非显而易见杯

专利无效挑战赛

目标专利:2117用于渲染用户的视听记录的方法,处理器系统和计算机可读介质

专利公开号:CN111466124B

专利权人:皇家KPN公司

无效请求书提交日期:2026年


上一项目 下一项目

非显而易见性评估仅供参考,不构成法律建议。




对比文件列表

编号 名称
0 2013-08-15_JP2013532148A_发明专利_JP2013532148A Human antibody drug conjugate to the tissue factor.docx
0 2017-12-13_EP3255904A_发明公开_EP3255904A1 DISTRIBUTED AUDIO MIXING_+++A_B_D_H_I_J_O_n+++.docx
0 2017-03-08_JP6090779B_发明专利_JP6090779B2 圧縮梱包装置とその制御方法.docx
0 2016-12-27_JP6055404B_发明专利_JP6055404B2 組織因子に対するヒト抗体薬物結合体.docx
0 2016-11-28_ES2592217T_发明专利_ES2592217T3 Un aparato y método para convertir una primera señal de audio paramétrico espacial en una segunda señal de audio paramétrico espacial_+++B_C_F+++.docx
0 2016-11-02_JP6017854B_发明专利_JP6017854B2 情報処理装置、情報処理システム、情報処理方法及び情報処理プログラム_+++A_B_C_D_E_H_i+++.docx
0 2016-08-11_US2016234475A_发明申请_US20160234475A1 METHOD, SYSTEM AND APPARATUS FOR CAPTURE-BASED IMMERSIVE TELEPRESENCE IN VIRTUAL ENVIRONMENT_+++A_B_C_D_H_I_J_e+++.docx
0 2015-03-26_WO2015039239A_发明申请_WO2015039239A1 METHOD, SYSTEM AND APPARATUS FOR CAPTURE-BASED IMMERSIVE TELEPRESENCE IN VIRTUAL ENVIRONMENT_+++A_B_C_D_E_H_I_J+++.docx
0 2015-03-26_CA2924156A_发明专利_CA2924156A1 METHOD, SYSTEM AND APPARATUS FOR CAPTURE-BASED IMMERSIVE TELEPRESENCE IN VIRTUAL ENVIRONMENT_+++A_B_C_D_E_H_I_J_f_g_l_n_o+++.docx
0 2014-07-31_JP2014138944A_发明专利_JP2014138944A Compression packing device and controlling method thereof.docx
0 2014-02-27_KR1020140023505A_发明公开_KR1020140023505A 홈네트워크 가전기기를 제어하기 위한 홈 가전기기 제어 방법 및 시스템.docx
0 2014-02-26_JP5426035B_发明专利_JP5426035B2 Apparatus and method for converting a first parametric spatial audio signal to the second parametric spatial audio signal.docx
0 2006-12-28_US2006290699A_发明申请_US20060290699A1 System and method for audio-visual content synthesis.docx
0 2013-04-25_JP2013514696A_发明专利_JP2013514696A Apparatus and method for converting a first parametric spatial audio signal to the second parametric spatial audio signal_+++B_C_F_n+++.docx
0 2013-01-17_US2013016842A_发明申请_US20130016842A1 APPARATUS AND A METHOD FOR CONVERTING A FIRST PARAMETRIC SPATIAL AUDIO SIGNAL INTO A SECOND PARAMETRIC SPATIAL AUDIO SIGNAL_+++O+++.docx
0 2013-01-10_JP2013008031A_发明专利_JP2013008031A Information processor, information processing system, information processing method and information processing program_+++A_B_C_D_E_h_i_j_l_o+++.docx
0 2013-01-02_CN102859584A_发明公开_CN102859584A 用以将第一参数式空间音频信号转换成第二参数式空间音频信号的装置与方法_+++B_C_F_O_n+++.docx
0 2012-09-26_EP2502228A_发明公开_EP2502228A1 AN APPARATUS AND A METHOD FOR CONVERTING A FIRST PARAMETRIC SPATIAL AUDIO SIGNAL INTO A SECOND PARAMETRIC SPATIAL AUDIO SIGNAL_+++B_C_F_N_O_i+++.docx
0 2012-08-09_KR1020120089369A_发明公开_KR1020120089369A 제 1 파라메트릭 공간 오디오 신호를 제 2 파라메트릭 공간 오디오 신호로 변환하기 위한 장치 및 방법_+++B_C_F+++.docx
0 2012-07-26_AU2010332934A_发明专利_AU2010332934A1 An apparatus and a method for converting a first parametric spatial audio signal into a second parametric spatial audio signal_+++B_C_F_N_O_a_d+++.docx
0 2011-07-20_EP2346028A_发明公开_EP2346028A1 An apparatus and a method for converting a first parametric spatial audio signal into a second parametric spatial audio signal_+++B_C_F_n+++.docx
0 2011-06-23_WO2011073210A_发明申请_WO2011073210A1 AN APPARATUS AND A METHOD FOR CONVERTING A FIRST PARAMETRIC SPATIAL AUDIO SIGNAL INTO A SECOND PARAMETRIC SPATIAL AUDIO SIGNAL_+++B_C_F_n+++.docx
0 2011-06-23_CA2784862A_发明专利_CA2784862A1 AN APPARATUS AND A METHOD FOR CONVERTING A FIRST PARAMETRIC SPATIAL AUDIO SIGNAL INTO A SECOND PARAMETRIC SPATIAL AUDIO SIGNAL_+++C_F_b_n+++.docx

权利要求1

一种渲染用户的视听记录的方法,接收表示该用户的视觉记录的视觉数据;接收表示该用户的音频记录的音频数据;获得指定朝向的朝向数据;其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示;所述朝向表示在所述视听记录中所述用户的面部朝向;基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源;该空间方向与该视觉表示中该用户的面部朝向一致。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名经验丰富的专利代理师,我针对目标专利权利要求1与对比文件D1(CA2924156A1)进行严谨的技术特征比对与无效宣告/创造性分析。

---

## 一、 目标专利权利要求1的技术特征拆解与说明书解释

根据专利法及审查指南,权利要求中的术语应当结合说明书的上下文进行客观、合理的解释:

* **技术特征A(接收视觉数据)与特征B(接收音频数据):** 属于视听数据采集与接收的基础特征。

* **技术特征C(获得朝向数据)、特征E(朝向表示用户的面部朝向):**

* *说明书解释:* 该“朝向数据”明确限定为**视听记录中用户的面部朝向**(Facial Orientation/Facing Direction),即通过图像识别、形态特征提取或追踪定位技术获取的、能体现用户面部/双眼朝向的角度或向量数据。

* **技术特征D(渲染视觉表示):** 渲染视觉数据并在显示器上建立用户的视觉图像或虚拟形象(如Avatar/3D Mesh/点云等)。

* **技术特征F(基于朝向数据渲染空间音频源)、特征G(空间方向与面部朝向一致):**

* *说明书解释:* 本专利的核心发明点在于**“音视频空间朝向的动态协同联动”**。系统不是简单地将音频根据“空间坐标位置(X,Y,Z)”进行声场定位,而是**将“声源的声场发射/指向角度”与“用户面部的朝向角度”进行绑定**。当视觉表示中用户的面部转动时,其发出的空间音频(Spatial Audio)的声场方向同步转动,确保听觉上的空间方位感与视觉上的面部朝向完全匹配一致。

---

## 二、 对比文件技术特征比对与分析

### 1. 对比文件指代及公开号

* **D1:** CA2924156A1(公开日:2015-03-26),题目为 *METHOD, SYSTEM AND APPARATUS FOR CAPTURE-BASED IMMERSIVE TELEPRESENCE IN VIRTUAL ENVIRONMENT*。

---

### 2. 特征比对表格(技术特征比对表)

权利要求1技术特征D1(CA2924156A1)对比文件原文及出处是否公开 / 公开性质
特征A: 接收表示该用户的视觉记录的视觉数据[0006] "at least one three-dimensional (3D) capture device to continuously capture image data of a first user..."<br>[0022] "continuously receiving image data of a first user..."已公开<br>(实质公开)
特征B: 接收表示该用户的音频记录的音频数据[0010] "an audio capture device continuously captures audio data emitted at least by the first user..."<br>[0023] "continuously receiving audio data emitted at least by the first user..."已公开<br>(实质公开)
特征C: 获得指定朝向的朝向数据[0014] "the first 3D representation has at least punctually a user specific position and orientation in the virtual environment..."<br>[0079] "...monitors and stores the position and orientation of the participant representations relative to the virtual environment."已公开<br>(实质公开)
特征D: 其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示[0006] "...rendering engine for outputting at least the representation of the second user... at least one display device for displaying the output."<br>[0022] "...outputting for display at least the 3D representation of the second user..."已公开<br>(实质公开)
特征E: 所述朝向表示在所述视听记录中所述用户的面部朝向[0048] "The expression 'photorealistic' may be defined as incorporating realistic morphological cues of a participant's anatomy... including eye contact, facial expressions, body language..."<br>[0085] "...perform some form of morphological recognition of the participant's anatomy... recognize the participant's eyes and then relate the orientation of the participant..."已公开<br>(实质公开)
特征F: 基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源[0062] "...multi-channel audio system... to provide some form of stereo effect or spatialized sound related to the location of the various participants in the virtual environment. Indeed, the relative relation between participants... can be rendered in terms of sound. For instance, the amplitude... adjusted as a function of the position of the sound source..."<br>[0075] "...produce a depth effect for the sound... as a function of the spatial location of the sound source..."未完全公开<br>(仅公开了基于*位置Location/Position*的音频空间化,未明确公开基于*面部朝向Orientation*进行音频渲染)
特征G: 该空间方向与该视觉表示中该用户的面部朝向一致D1全篇仅提到音频根据“位置(Position/Location)”进行空间化调整(幅度/深度),没有明确提及或教导音频的“空间指向/方向”要与“面部的朝向角度”实时绑定与一致。未公开

---

## 三、 最接近对比文件分析与创造性评估

### 1. 最接近对比文件的选择

* **最接近对比文件:D1(CA2924156A1)**

* **理由:**

1. **技术领域相同:** D1与目标专利均属于虚拟现实(VR)、远程存在(Telepresence)以及多媒体视听渲染技术领域。

2. **解决的技术问题重合度高:** 均致力于在虚拟环境中实现高沉浸感、高逼真度的多用户交互与视听体验。

3. **技术特征覆盖度高:** D1公开了3D图像采集、音频采集、用户位置与朝向(Orientation)的管理、3D模型渲染以及多通道空间音频(Spatialized Audio)输出(特征A、B、C、D、E、F的部分)。因此,D1非常适合作为本专利创造性分析中的最接近对比文件(最接近现有技术)。

---

### 2. 区别技术特征与实际解决的技术问题

通过上述比对,权利要求1相对于D1的区别技术特征为:

> **区别特征:** **将音频数据渲染为空间方向与视觉表示中用户“面部朝向”保持一致的空间音频源(特征G及特征F的相关限定)。**

* **D1的技术方案:** D1中的音频空间化(Spatialized Sound)主要是基于**声源的位置坐标(Position / Spatial Location / X,Y,Z)**调整音量振幅或多声道深度效果(例如:人在左边声音从左边传出)。

* **目标专利的技术方案:** 增加了对**面部指向/朝向(Facing Direction)**的动态联动,实现了不仅声音位置对齐,而且声音的发散方向/声场指向与人物面部的偏转方向严格一致。

* **实际解决的技术问题:**

如何提高虚拟环境中用户面部偏转或说话方向变化时声场方向的逼真度与匹配度,消除视觉面部朝向与听觉指向不一致带来的不自然感。

---

### 3. 无效宣告中的薄弱特征分析(专利权人/无效请求人视角)

在对本专利发起无效宣告请求时,**权利要求1最薄弱(最容易被攻破)的技术特征是:特征F与特征G的组合。**

* **薄弱原因分析:**

1. **公知常识/常规技术手段叠加:** 在3D/VR声学渲染领域,3D声源通常包含两个基本要素:**位置(Position)** 和 **方向/指向性(Direction/Directivity)**。在真实世界中,人类发声具有明显的方向指向性(向正面辐射)。

2. 如果现有技术中存在对“虚拟人物朝向/面部朝向”的追踪(D1已公开),将该已知的“面部朝向数据”作为参量输入到已有的“空间音频渲染引擎(如DirectSound3D, OpenAL, HRTF引擎)”中,以控制声源的指向性向量(Cone/Directivity Vector),属于声学工程技术人员**无需付出创造性劳动即可联想到的常规技术手段**。

---

## 四、 针对性的对比文件检索策略(无效检索指南)

为了成功无效权利要求1,必须补充检索能够公开**“声音指向性与头/面部朝向绑定(Directional Audio / Head Orientation-based Spatial Audio)”**的对比文件(D2/D3)。以下是具体的检索策略:

### 1. 关键词组合策略(Languages: EN / CN)

* **主题1(视觉/朝向追踪):** `facial orientation` OR `head pose` OR `head orientation` OR `facing direction` OR `gaze direction`

* **主题2(空间音频/声学指向):** `spatial audio` OR `3D audio` OR `directional audio` OR `audio directivity` OR `sound radiation` OR `HRTF`

* **主题3(一致性/联动):** `aligned` OR `consistent` OR `match` OR `bind` OR `synchronize`

---

### 2. IPC / CPC 专利分类号结合策略

建议重点在以下分类号区间进行交叉检索:

* **G06T 19/00** (虚拟现实的3D渲染/交互)

* **H04S 7/00** (立体声/空间声场系统的控制,特别是包含头追踪/位置追踪的声场控制)

* **H04N 7/15** (电视会议/远程会议系统)

* **G06F 3/01** (基于身体/面部/姿态追踪的人机交互输入)

---

### 3. 具体检索公式示例(以Google Patents / Espacenet为例)

```text

(CPC=H04S7/00 OR CPC=H04S7/02 OR CPC=G06T19/00)

AND ((facial OR head OR body) NEAR/3 (orientation OR pose OR direction))

AND ((spatial OR 3D OR directional) NEAR/3 audio)

AND (render OR align OR match OR derive)

```

---

### 4. 非专利文献(NPL)检索建议

空间音频与面部/头部追踪结合的技术在学术界应用较早,建议同步检索 IEEE Xplore、ACM Digital Library 及 AES (Audio Engineering Society) 电子图书馆:

* **重点检索领域:** *Virtual Reality Audio Rendering*, *Acoustic Radiation Pattern of Human Speech in Telepresence*, *Head-tracked Spatial Audio for Teleconferencing*.


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名经验丰富的专利代理师,我针对目标专利权利要求1,结合其说明书含义以及所提供的三份对比文件(D1: CA2784862A1、D2: WO2011073210A1、D3: EP2346028A1)进行深度技术特征比对与法律创造性分析。

---

## 一、 对比文件同族情况与说明

在深入分析特征前,需明确三份对比文件的基本情况:

* **D1(CA2784862A1)**:加拿大专利/申请;

* **D2(WO2011073210A1)**:PCT国际申请;

* **D3(EP2346028A1)**:欧洲专利申请。

**重要结论**:经核对三份对比文件的原文内容、图表以及段落结构,**D1、D2与D3系同一发明创造的同族专利(同族申请文件)**。其核心技术方案完全相同,均揭示了一种在参数化空间音频编码(如DirAC/SAM)体系中,根据镜头旋转/缩放(zoom/rotation control signals)对声音的到达方向(DOA)、扩散度(diffuseness)以及下混合信号(downmix)进行重映射与过滤的技术方案。

---

## 二、 权利要求1的技术特征拆解与比对分析

### 1. 技术特征对比表格

针对权利要求1分解出的技术特征A~G,与对比文件(D1: CA2784862A1 / D2: WO2011073210A1 / D3: EP2346028A1)进行原文对比如下:

权利要求1技术特征对比文件原文对应内容及详细出处公开属性判定
特征A:接收表示该用户的视觉记录的视觉数据D1/D2/D3:均在摘要及正文中揭示了结合视频/图像处理(Video capturing, video source)。例如 D1/D2/D3摘要与[0011]/[p0011] :“modification of the visual image is commonly applied... modify the received or original spatial audio data according to the zoom control or rotation control signals provided by the video camera to synchronize...”实质公开
特征B:接收表示该用户的音频记录的音频数据D1/D2/D3 [0003]-[0006] / [p0003]-[p0006]:揭示了接收多声道或参数化音频信号(downmix audio signal 112, parametric spatial side information 114)。毫无异议公开
特征C:获得指定朝向的朝向数据D1/D2/D3 [0011]/[0014]/[0045]:揭示了获得摄像机/观察者的偏转角度/方向控制信号(rotation control signals, zoom control signals, looking direction)。实质公开
特征D:其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示D1/D2/D3:仅提及根据视频变换(Zoom/Rotation)同步渲染音频(audio-visual playback / teleconferencing)。但未明确公开“在显示器上渲染视觉数据以‘建立该用户的视觉表示’(如虚拟形象/Avatar或视频中特定用户的面部图像)”。未公开
特征E:所述朝向表示在所述视听记录中所述用户的面部朝向D1/D2/D3 中公开的“orientation”均指摄像机/麦克风阵列的拍摄/监听方向或说话人的方位角(DOA),未公开“朝向数据专门表示视听记录中‘用户的面部朝向’(User's facial orientation)”。未公开
特征F:基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源D1/D2/D3 [0009]-[0011]:揭示了基于控制信号(包含方向/朝向变化)修改音频的DOA和下混合,渲染出对应空间方向的空间音频源(acoustical zoom/audio rotation)。实质公开
特征G:该空间方向与该视觉表示中该用户的面部朝向一致D1/D2/D3 [0011]/[0124]:揭示了音频的空间方向与视频图像变焦/旋转保持一致("synchronize the audio experience to the video experience")。但由于其缺乏“用户面部朝向”的限定,仅公开了“音频方向与摄像机视角/说话人方位一致”。未完全公开(缺乏“面部朝向”要素)

---

## 三、 整体解决的技术问题及技术效果分析与最接近对比文件选择

### 1. 最接近对比文件的选择

* **候选文件**:D1(CA2784862A1)、D2(WO2011073210A1)、D3(EP2346028A1)。

* **选择结论**:由于D1、D2、D3为同族专利,技术方案完全一致,**D1、D2、D3中的任意一份均适合作为最接近的对比文件**。在实际提交无效宣告请求时,通常优先选用文本格式规范、段落编号清晰的 **D3(EP2346028A1)** 或 **D2(WO2011073210A1)** 作为主对比文件(D1)。

### 2. 整体技术问题与技术效果对比分析

* **目标专利(权利要求1)**:

* **解决的技术问题**:如何在视听记录渲染过程中,使渲染出的空间音频方向能够与显示画面中“用户的面部朝向”动态绑定与对齐,提升虚拟互动/视听渲染的真实感与沉浸感。

* **技术效果**:使用户听到的声音空间方位与视觉呈现上该用户的面部朝向相吻合。

* **对比文件(D1/D2/D3)**:

* **解决的技术问题**:在参数音频编码中,如何根据摄像机视角的改变(如变焦Zoom、旋转Rotation)灵活调整已录制音频场景的Listening position和Orientation,解决视听不同步的问题。

* **技术效果**:实现“声随影动”(acoustical zoom与video zoom同步,audio rotation与camera rotation同步)。

---

## 四、 未被最接近对比文件公开的特征分析及最薄弱特征指出

### 1. 未被对比文件公开的技术特征

对比分析表明,D1/D2/D3(同族)**未公开**以下区别技术特征:

1. **特征D的部分与特征E**:获得指定朝向数据,且该朝向具体限定为**“在视听记录中所述用户的面部朝向(face orientation)”**,并在显示器上建立该用户的视觉表示。

2. **特征G的特定绑定**:空间音频源的渲染方向是**“与视觉表示中该用户的面部朝向一致”**(对比文件公开的是“与摄像机拍摄视角/声源DOA一致”)。

### 2. 最薄弱的技术特征判定

在无效宣告程序中,本专利权利要求1**最薄弱的技术特征**为:

> **“获得表示用户面部朝向的朝向数据,并使渲染的空间音频方向与该用户的面部朝向一致”(特征C+E+G的结合)**

**薄弱原因分析**:

1. **概念显而易见性(本领域普通技术人员的公知常识/惯用手段)**:

在视听互动(如虚拟现实VR、3D游戏、远程视频会议Teleconferencing)领域,根据人的面部/头部朝向(Head/Face Orientation,通常由人脸识别、头部追踪Head Tracking或面部捕捉技术获取)来实时调整其发声的空间方位角(Spatial Audio Orientation),属于本领域非常常规的技术选型。

2. **对比文件已有教导**:

D1/D2/D3在应用场景描述中(如 **D3 [0124]** 视讯会议Teleconferencing)已经提出了“将摄像机指向活跃说话者(active speaker),并进行声学放大/对齐”。将“说话者的位置/朝向”细化为“面部朝向(face orientation)”,仅属于视觉特征提取指标的常规选择,并未产生预料不到的技术效果。

---

## 五、 进一步的对比文件检索策略(针对无效请求)

为了彻底击退权利要求1及可能存在的从属权利要求,建议采取以下二次检索策略:

### 1. 检索要素表达(Search Elements & Keywords)

* **视觉/面部朝向表达**:

`Facial orientation`, `Face pose`, `Head pose tracking`, `Face direction`, `Gaze direction`, `Visual representation / Avatar`.

* **音频渲染与空间对齐表达**:

`Spatial audio`, `3D audio rendering`, `Binaural rendering`, `Direction of Arrival (DOA)`, `Audio-visual alignment`, `Sound source orientation`.

* **结合场景表达**:

`Teleconference`, `Virtual Reality (VR)`, `Augmented Reality (AR)`, `Virtual avatar`, `Gaming`.

### 2. 分类号检索组合(IPC/CPC Classification Code)

* **G06T 19/00 / G06T 13/40**:虚拟现实与人脸/人体动画渲染;

* **G06V 40/16**:人脸识别与面部姿态估计(Face pose estimation);

* **H04S 7/00**:立体声/空间音频渲染调整与头部/面部追踪(Spatial audio positioning & tracking);

* **H04N 7/15 / H04N 21/478**:视频会议与交互式视听系统。

### 3. 补充检索方向建议

1. **方向一(追踪面部朝向+空间音频结合)**:

重点检索2010~2020年间Apple、Meta/Oculus、Sony、Microsoft、Qualcomm等公司在VR/AR/视频会议领域关于 **“Head/Face pose tracking to adjust 3D spatial sound”** 的专利文献(例如结合前置摄像头捕捉Face Orientation并调整Binaural 3D Audio的专利)。

2. **方向二(公知常识/教科书证据)**:

检索虚拟现实(VR)或人机交互(HCI)领域的标准教材、学术论文(如ACM SIGGRAPH、IEEE VR),用以证明“基于面部/头部朝向渲染方向性空间音频”属于本领域的公知常识(Common Knowledge)。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为经验丰富的专利代理师,我对目标专利权利要求1以及调取的3份对比文件(同族专利文献)进行了深度对比与法律/技术分析。现汇报分析意见如下:

---

## 一、 目标专利权利要求1的技术特征拆解与说明书解释

权利要求1限定了一种**“渲染用户的视听记录的方法”**,其核心逻辑在于**实现视觉呈现(面部朝向)与空间音频渲染(音频源方向)的动态一致与同步**。

特征编号权利要求1的技术特征内容说明书文本解释(结合视听记录与渲染逻辑)
特征 A接收表示该用户的视觉记录的视觉数据接收视频/图像流数据,其中包含拍摄到的用户的画面。
特征 B接收表示该用户的音频记录的音频数据接收与上述视觉记录同步采集或关联的音频信号数据。
特征 C获得指定朝向的朝向数据提取或计算目标对象的空间姿态参数,特别是偏航角(Yaw)、俯仰角(Pitch)等朝向矢量。
特征 D其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示在终端屏幕或显示设备上解码并播放视频,呈现用户的图像(如人像/虚拟形象)。
特征 E所述朝向表示在所述视听记录中所述用户的面部朝向关键限定:朝向数据并非指代摄像机本身的旋转/变焦角度,而是特指记录画面中“用户面部”的朝向(Head/Face Orientation)。
特征 F基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源根据获取的朝向参数,对音频数据进行空间声场调制(如声轴偏移、3D音频渲染)。
特征 G该空间方向与该视觉表示中该用户的面部朝向一致声源的空间方位角/辐射方向跟随面部朝向的改变而动态调整,保持视听空间的一致性。

---

## 二、 检索对比文件基础信息

* **对比文件 D1**:`AU2010332934A1`(公开日:2012-07-26)

* **对比文件 D2**:`KR1020120089369A`(公开日:2012-08-09)

* **对比文件 D3**:`EP2502228A1`(公开日:2012-09-26)

> **同族说明**:D1、D2、D3 属于同一国际专利申请(`WO2011/073210`)进入不同国家/地区的同族专利,其技术方案、说明书文本及图纸完全一致,主要探讨的是**基于摄像机视角(变焦 Zoom 或旋转 Rotation)对参数化空间音频(如 DirAC/SAM)进行调整的技术方案**。

---

## 三、 对比文件技术特征比对表格及详细出处

针对权利要求1的特征A~G,在对比文件(以D1/D2/D3同族文本为准)中的公开情况比对如下:

权利要求1特征对比文件 D1 (AU2010332934A1)对比文件 D2 (KR1020120089369A)对比文件 D3 (EP2502228A1)比对结论
特征 A实质公开<br>出处:Page 2, lines 18-24; Page 3, lines 20-22<br>(提到摄录视频图像及视频源)实质公开<br>出处:[0008]-[0009], [0013]<br>(公开接收与处理摄像视频图像数据)实质公开<br>出处:Description, "Summary", Page 2, Paragraph 4; Page 3, Paragraph 2已公开
特征 B毫无异议公开<br>出处:Page 3, lines 33-35; Page 7, lines 3-10<br>(接收并处理麦克风录制的音频数据)毫无异议公开<br>出处:[0017], [0031]<br>(公开接收N个麦克风采集的音频输入信号)毫无异议公开<br>出处:Description, Page 3, Paragraph 3; Page 6, Paragraph 2已公开
特征 C实质公开(存在差异)<br>出处:Page 7, lines 21-25; Page 9, lines 4-9<br>(获得摄像机的旋转/视角控制信号 $d$ 或旋转角度)实质公开(存在差异)<br>出处:[0031], [0035]<br>(公开获取控制信号 $d$ 或摄像机旋转控制信号)实质公开(存在差异)<br>出处:Description, Page 6, Paragraph 3; Page 7, Paragraph 3实质公开(但控制对象不同)
特征 D实质公开<br>出处:Page 2, lines 28-32; Page 31, lines 5-10<br>(视频再现与视听播放)实质公开<br>出处:[0009], [0148]-[0149]<br>(公开在显示终端进行画面播放与视听再现)实质公开<br>出处:Description, Page 2, Paragraph 5; Page 24, "Applications"已公开
特征 E未公开<br>D1公开的朝向仅为摄像机本身的旋转视角/镜头方向(Camera Rotation/Orientation),并非画面中“用户的面部朝向”。未公开<br>D2公开的朝向仅为摄像机自身的旋转/倾斜角度,未涉及对画面中人物面部姿态/朝向的处理。未公开<br>D3同样仅涉及摄像机(Camera)或虚拟听者的总体观看位置(Listening Orientation)。未公开(核心区别特征)
特征 F实质公开<br>出处:Page 7, lines 11-19; Page 9, lines 20-25; Fig. 3A<br>(根据控制信号重映射DOA并渲染空间音频)实质公开<br>出处:[0031], [0038], [0040]-[0047]<br>(公开根据控制信号重映射到达方向DOA并渲染空间音频)实质公开<br>出处:Description, Page 6, Paragraph 3; Page 7, Paragraph 6已公开
特征 G部分公开(存在概念差异)<br>出处:Page 2, lines 28-32; Page 12, lines 13-17<br>(声学图像与修改后的相机视频视角保持一致)部分公开(存在概念差异)<br>出处:[0009], [0055]<br>(公开声音的空间方向与相机视角的旋转方向保持一致)部分公开(存在概念差异)<br>出处:Description, Page 2, Paragraph 5; Page 9, Paragraph 5部分公开(对象不同)

---

## 四、 最接近对比文件分析与创造性评估

### 1. 最接近对比文件的选择

**最接近对比文件**:**D1 (`AU2010332934A1`)** / **D3 (`EP2502228A1`)** (D1、D2、D3为同族,技术内容完全一致,推荐优先采用结构最清晰的 **D1** 或 **D3** 作为最接近对比文件)。

* **整体解决的技术问题对比**:

* **目标专利**:解决在渲染视听记录时,如何使渲染出的空间音频与画面中**特定人物/用户的真实面部朝向**保持动态匹配,提高视听沉浸感与真实感。

* **对比文件 D1/D2/D3**:解决在拍摄/播放视频时,由于摄像机视角旋转(Camera Rotation)或变焦(Zoom),导致**声音画面与相机拍摄视角不匹配**的问题。

* **技术效果对比**:

* 两者均实现了“视听信号空间方向的动态对齐与渲染同步”。

### 2. 区别技术特征与实际解决的技术问题

将目标专利权利要求1与最接近对比文件(D1/D2/D3)相比,**区别技术特征**在于:

> **特征 E 及特征 G 的特定限定**:目标专利获取并使用的朝向数据是**表示视听记录中“用户的面部朝向(Face Orientation)”**,并使渲染出的空间声源方向与“用户的面部朝向”相一致;而对比文件 D1/D2/D3 中调制的依据是**“摄像机的视角/旋转角度(Camera Orientation/Rotation)”**。

基于上述区别特征,目标专利**实际解决的技术问题**是:

> *在视频画面包含人物时,如何根据人物自身的面部姿态/朝向变化(而非仅依赖镜头本身的移动),精确且动态地调整该人物所对应声源的空间指向性。*

---

## 五、 无效请求中最薄弱的技术特征与法律风险评估

若针对该专利发起无效宣告请求,**最薄弱的技术特征(即专利权人最难被击穿的防御壁垒)** 是:

### ⚠️ 最薄弱特征:特征 E(“所述朝向表示在所述视听记录中所述用户的面部朝向”)及 特征 G 的联动

* **法律分析**:

1. 现有对比文件 D1、D2、D3 均属于“全局相机视角驱动(Camera-driven/Rigid Orientation)”的技术路线。其技术核心在于“镜头转到哪里/变焦到哪里,声场就整体跟着旋转或放大”。

2. 目标专利属于“基于画面主体特征驱动(Subject-driven / Face Orientation)”的技术路线。即使镜头不动,如果记录画面中的**主体人物转头或改变面部朝向**,目标专利也会捕捉这一“面部朝向(Face Orientation)”并调整声源的方向性。

3. 仅凭目前的 D1/D2/D3,**无法直接证明**将“摄像机旋转角度”替换为“画面中用户的面部朝向”属于本领域的公知常识或显而易见的技术方案,缺乏明确的技术启示(Technical Teaching)。

---

## 六、 进一步的对比文件检索策略建议

为了成功击穿目标专利权利要求1的创造性,建议在后续无效检索中采取以下针对性补充检索策略:

```

┌────────────────────────────────────────┐

│ 针对特征 E 的突破检索策略 │

└───────────────────┬────────────────────┘

┌───────────────────────────────┴───────────────────────────────┐

▼ ▼

【策略一:人脸识别/姿态估计+声场结合】 【策略二:虚拟现实(VR)/虚拟人/游戏渲染】

重点检索结合了“Head Tracking”与“Spatial Audio” 重点检索虚拟形象/Avatar/游戏NPC的声场渲染,

的技术文献(如多麦克风阵列+摄像头追踪人脸)。 画面中人物头部转动时,音频辐射角/定向声源跟随转动。

```

### 详细检索要素与组合公式(IPC分类号 + 关键词):

1. **IPC/CPC 分类号锁定**:

* `G06V40/16`(人脸识别、面部特征分析)

* `G06T7/70`(图像处理中目标位置/朝向的确定)

* `H04S7/00`(空间声场控制、声定位、视听同步技术)

* `H04N21/439` 或 `G11B27/031`(视听信号同步/编辑)

2. **核心关键词组合**:

* **表达1(面部/头部朝向捕捉)**:`(face orientation OR head orientation OR head pose OR facial direction OR head tracking)`

* **表达2(空间音频/声源指向)**:`(spatial audio OR directional sound OR 3D audio OR audio rendering OR sound source orientation)`

* **表达3(一致性/同步)**:`(consistent OR align OR match OR synchronize)`

3. **结合方向**:

* 寻找一份公开了**“通过摄像头检测视频画面中人头/面部朝向(Head Pose Estimation),并据此实时调整该人物语音的3D空间渲染方向”**的对比文件(作为对比文件 D4)。

* 采用 **D1/D3(最接近对比文件:提供了视听同步及音频重映射的基本框架) + D4(补充对比文件:教导了提取面部朝向并用于控制空间音频方向)** 的组合,依据《专利审查指南》第四部分第六章关于“显而易见性”的规定,主张权利要求1不具备创造性(100%击穿特征 E 与 G)。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名经验丰富的专利代理师,我针对目标专利权利要求1(下称“权利要求1”)结合说明书逻辑、法律规范及对比文件原文进行深入分析,并制定无效宣告策略。

---

### 一、 权利要求1的技术特征拆解与说明书解释

根据目标专利说明书的整体发明构思,权利要求1的核心在于**针对用户的视听记录,通过捕获/确定该用户的面部朝向,并将音频渲染为与显示画面中该面部朝向相一致的空间音频,从而实现音视频空间方向的精准同步与沉浸式重放**。

技术特征拆解如下:

* **前言部分**:一种渲染用户的视听记录的方法

* **技术特征A**:接收表示该用户的视觉记录的视觉数据

* **技术特征B**:接收表示该用户的音频记录的音频数据

* **技术特征C**:获得指定朝向的朝向数据

* **技术特征D**:其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示

* **技术特征E**:所述朝向表示在所述视听记录中所述用户的面部朝向

* **技术特征F**:基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源

* **技术特征G**:该空间方向与该视觉表示中该用户的面部朝向一致

---

### 二、 各对比文件公开特征比对与原文出处

各对比文件公开号及指代约定:

* **D1**:CN102859584A

* **D2**:JP2013008031A

* **D3**:JP2013514696A

#### 权利要求1与对比文件特征比对表

权利要求1技术特征D1 (CN102859584A) 是否公开及原文出处D2 (JP2013008031A) 是否公开及原文出处D3 (JP2013514696A) 是否公开及原文出处
前言:一种渲染用户的视听记录的方法公开:[0009]“提供也允许依据视觉移动来虚拟地改变收听位置及/或方位的一装置及方法……已记录的声像可与对应的已修改视频影像一致。”公开:[0006]“情報処理装置、情報処理システム、情報処理方法…”;[2]“発話内容とともに音環境を記録…”公开:[0010]“視覚の動きに従って、聴取位置および/または方向を変えることも可能にする装置および方法…”
特征A:接收表示该用户的视觉记录的视觉数据公开:[0013]“耦接至一视频摄影机或其他视频源……”公开:[2]“撮影部13は、撮影した画像を表す画像信号をフレーム毎に生成し…”公开:[0014]“ビデオカメラまたは他のビデオソースと結合されて…”
特征B:接收表示该用户的音频记录的音频数据公开:[0026]“N个麦克风102被配置以获得N个麦克风输入信号……”公开:[2]“収音部11、12は、それぞれm、nチャネルの音響信号を情報表示装置14に出力する。”公开:[2]“複数のマイクロホンを用いて、音場を捉えることを目指している。”
特征C:获得指定朝向的朝向数据公开:[0027]“确定的空间旁侧信息包含对应于声音的到达方向(DOA)的一测量值……”公开:[2]“放射方向推定部142は、各音源の放射方向(orientation)と位置を推定する。”公开:[2]“空間キュー情報は、基本的に、音の到来方向(DOA)…”
特征D:渲染视觉数据以建立视觉表示未明确公开:仅提及根据摄影机旋转/变焦调整视频视角与音频。公开:[2]“画像合成部147は…画像表示部152に出力…人物43A、43Bが示されている”未明确公开:同D1。
特征E:朝向表示视听记录中用户的面部朝向未公开:D1公开的是声源到达方向(DOA)或摄像机视角变化。公开/实质公开:[2](变形例2-1)“放射方向推定部242は、撮影部13から入力された画像信号…顔面の方向を検出し、検出した方向を放射方向とし推定する。”未公开:同D1。
特征F:基于朝向数据将音频渲染为具有空间方向的空间音频源公开:[0031]-[0033]“基于降混信号及空间参数…使用向量基振幅移动(VBAP)或DirAC渲染空间音频”公开:[2]“音響合成部148は…頭部伝達関数(HRTF)を…畳み込み演算…視聴者は、受聴点を基準とした制整の音源方向に各音源に係る音を知覚する。”公开:[2]“再生のための所望のスピーカ信号は、ダウンミックス信号およびパラメトリック補助情報に基づいて決定される。”
特征G:空间方向与视觉表示中用户的面部朝向一致未公开:D1侧重于听者视角改变(Camera Control/Zoom)下的声音旋转。公开:[2]“前記音声が放射される放射方向に前記一方向を向けて…(变形例2-1)顔面の方向を…放射方向とし”未公开:同D1。

---

### 三、 最接近对比文件的选择与创造性分析

#### 1. 最接近对比文件的选择:D2 (JP2013008031A)

* **技术领域与问题**:

D2(JP2013008031A)涉及多发言人场景下的视听记录处理与重放。其要解决的整体技术问题是:在包含多人的视听记录中,如何使观看者能够直观、准确地识别各个发言者的位置、发言内容以及讲话朝向/对象。

* **技术效果**:

通过估计发言者面部/声源辐射方向(orientation),在图像中建立发言者视觉表示的同时,渲染出与该方向/朝向一致的空间音频及视觉指示,使观看者能够直观感知发言者的真实空间方位和面对方向。

* **最接近判定**:

权利要求1与D2(JP2013008031A)在技术领域、解决的技术问题及最终达成的视觉/听觉同步渲染效果上高度契合。因此,**D2(JP2013008031A)最适合作为本权利要求的最接近对比文件**。

*注:D1 (CN102859584A) / D3 (JP2013514696A) 属于同族/同类文献,主要解决的是“摄像机镜头变焦/旋转(即听觉/视觉视角平移)时如何同步修改参数化音频信号”的问题,其朝向数据针对的是镜头视角而非“记录中用户的面部朝向”,因此不适合作为首选的最接近对比文件。*

#### 2. 结合对比文件的创造性分析

如比对表所示,D2 (JP2013008031A) 已经在其实施例及变形例2-1中完整公开了特征A、B、C、D、E、F、G的全部技术要素:

1. **特征A、B、D**:D2公开了拍摄并接收图像信号(视觉数据)与多通道音频信号(音频数据),在显示界面上建立发言者(用户43A、43B)的图像视觉表示。

2. **特征C、E**:D2在变形例2-1中明确公开了“通过图像处理检测发言者脸部的方向(面部朝向),并将其作为辐射方向(朝向数据)”。

3. **特征F、G**:D2公开了基于估计的朝向/方向,通过HRTF(头头传达函数)将音频信号渲染为具有空间方向的空间音频,使其听觉空间方向与画面中发言者的位置及面部朝向保持一致。

结论:**权利要求1的技术方案已被对比文件D2 (JP2013008031A) 完整公开或属于该领域的公知常识/显而易见的结合,权利要求1不具备新颖性或创造性。**

---

### 四、 最薄弱的技术特征分析与进一步检索策略

#### 1. 专利权人可能抗辩的最薄弱特征

在无效宣告程序中,专利权人最可能争辩的薄弱点在于**特征E与特征G的限定粒度**:

* **争辩点**:专利权人可能主张D2的主实施例主要依赖麦克风阵列推导声源辐射方向,而变形例2-1虽然提到了脸部方向检测,但争辩“朝向数据是否直接精细绑定为面部朝向并用于驱动空间音频渲染的全流程”。

#### 2. 进一步对比文件检索策略(进一步巩固无效证据链)

为确保彻底击穿权利要求1及后续可能修改的从属权利要求,建议采取以下补充检索策略:

1. **关键词与分类号(IPC/CPC)组合拓展**:

* **IPC/CPC 分类号**:`H04S7/00`(立体声装置的调整)、`H04N21/439`(音视频同步与音频处理)、`G06V40/16`(人脸识别与面部姿态估计)、`H04S3/00`。

* **逻辑组合词组**:

* `(facial orientation OR face direction OR head pose OR gaze direction)` (面部朝向/头部姿态)

* **AND** `(spatial audio OR 3D audio OR directional sound OR HRTF)` (空间音频/3D音频)

* **AND** `(render OR position OR align OR coincide)` (渲染/对齐/一致)

2. **重点文献库与技术源头追溯**:

* **IEEE Xplore / AES (Audio Engineering Society) 数据库**:重点检索 2008–2015 年间关于“Head pose estimation for spatial audio spatialization”或“Video-driven spatial audio rendering”的会议/期刊论文。

* **追溯重点申请人/实验室**:如 Microsoft Corporation(Kinect相关面部追踪与空间音频专利)、Sony Corporation、Apple Inc.、Fraunhofer-Gesellschaft 及 Oculus/Meta 早期虚拟现实与视听同步专利。

3. **从属权利要求预防御检索**:

* 针对说明书中可能进一步补充的“面部追踪算法(如Haar-like、打点模型)”、“多视角相机校准”或“动态视差调整”等技术细节,提前检索补充对比文件(D4/D5),形成组合对比文件组合攻击(如 D2 + D4 结合)。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

资深专利代理师,我针对目标专利权利要求1(下称“本专利权1”)与提交的3份对比文件进行深度法律与技术比对分析。

---

## 一、 权利要求1的技术特征拆解与说明书解释

根据本专利权利要求1的文本,将其拆解为以下7个独立的技术特征(A–G):

* **特征 A**:接收表示该用户的视觉记录的视觉数据;

* **特征 B**:接收表示该用户的音频记录的音频数据;

* **特征 C**:获得指定朝向的朝向数据;

* **特征 D**:其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示;

* **特征 E**:所述朝向表示在所述视听记录中所述用户的面部朝向;

* **特征 F**:基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源;

* **特征 G**:该空间方向与该视觉表示中该用户的面部朝向一致。

### 结合目标专利说明书的准确原意解释:

1. **“视觉表示”与“面部朝向”(特征 D、E)**:指在虚拟环境/显示界面中建立的用户的2D/3D图像(如3D点云、网格模型或视频图像)。其“面部朝向”(Orientation)是指该视觉形象在虚拟空间中的朝向/面向方向(Face Orientation),用于体现用户的视线、面部朝向或身体姿态。

2. **“空间音频源”与“一致性”(特征 F、G)**:指将接收到的用户音频数据进行空间声场化处理(声场空间化),赋予音频声源一个空间方位角/朝向。**关键的技术联动在于**:该空间声源的发声方向/辐射方向,是基于获取的朝向数据进行动态渲染控制的,使得在虚拟空间中,声音发出的空间方向与画面中用户形象的面部朝向(面向方向)保持实时同向或几何一致,从而建立声像一致的沉浸式感知。

---

## 二、 对比文件原文比对分析与比对表格

实务中,**D1(WO2015039239A1)** 与 **D2(US20160234475A1)** 属于同一专利族,技术内容与段落编号完全对应。**D3(JP6017854B2)** 为日本授权发明专利。

### 1. 各对比文件对比分析

#### **D1:WO2015039239A1 / D2:US20160234475A1**

* **实质公开(完全公开)的技术特征**:

* **特征 A**:公开了通过3D捕捉设备连续采集第一用户的图像数据(D1/D2 [0010]/[0006])。

* **特征 B**:公开了音频捕捉设备连续捕捉第一用户发出的音频数据(D1/D2 [0014]/[0010])。

* **特征 C**:公开了接收/获得用户在虚拟环境中的特定朝向(User Specific Orientation)(D1/D2 [0017]/[0014]、[0028]/[0026])。

* **特征 D**:公开了渲染引擎输出并在显示器上显示虚拟环境中用户的3D视觉表示(3D Representation)(D1/D2 [0010]/[0006]、[0025]/[0022])。

* **特征 E**:公开了3D表示结合形态特征(Morphological Cues,包括面部表情、眼神接触等),且具有特定姿态与朝向,反映了用户面部/身体朝向(D1/D2 [0048]/[0048]、[0079]/[0079])。

* **特征 F**:公开了通过多通道音响/音频驱动器渲染出与虚拟环境中用户位置相关的空间化/3D声音(Spatialized sound / Virtual 3D sound environment)(D1/D2 [0062]/[0062]、[0075]/[0075])。

* **未实质公开/区别特征(特征 G)**:

D1/D2公开了根据用户在虚拟环境中的**空间位置(Position/Location)**调整声音振幅和空间方位,但**未明确说明**空间音频的“声音辐射/发声方向”与“用户面部的朝向(Orientation)”进行直接的动态绑定渲染一致。

#### **D3:JP6017854B2**

* **实质公开(完全公开)的技术特征**:

* **特征 A**:公开了通过摄像部(13)获取包含说话者(音源)的图像/视觉数据(段落[0020])。

* **特征 B**:公开了通过收音部(11、12)采集说话者发出的多通道声音信号(音频数据)(段落[0019])。

* **特征 C、E**:公开了通过放射方向推定部(142/242)推导音源(说话者面部)放射声波的最大指向性方向/面部朝向(段落[0023]、[0093])。

* **特征 D**:公开了图像合成部合成并在显示部(152)上建立说话者图像及视觉文本标示(段落[0029]、[0067])。

* **特征 F**:公开了音频合成部(148)利用头唇/头传递函数(HRTF)基于音源方向将音频渲染为立体声/空间音频(段落[0031]-[0032])。

* **未实质公开/区别特征(特征 G)**:

D3中的视觉方向标示(如箭头标示)是朝着声波放射方向(说话对象),且音频渲染主要基于说话者相对于受听者/视点的**物理方位角(Position Angle)**,而**并非将音频自身的空间辐射方向与视觉表示中说话者面部的朝向(Orientation)进行强制绑定一致**。

---

### 2. 技术特征比对表格

权利要求1技术特征D1 (WO2015039239A1) 详细出处及比对D2 (US20160234475A1) 详细出处及比对D3 (JP6017854B2) 详细出处及比对
A: 接收视觉数据已公开<br>段落[0010] “3D capture device to continuously capture image data”已公开<br>段落[0006] “3D capture device to continuously capture image data”已公开<br>段落[0020] “撮影部13は、撮影した画像を表す画像信号...を出力”
B: 接收音频数据已公开<br>段落[0014] “audio capture device continuously captures audio data”已公开<br>段落[0010] “audio capture device continuously captures audio data”已公开<br>段落[0019] “収音部11、12は...音響信号に変換する”
C: 获得朝向数据已公开<br>段落[0017] “user specific... orientation in the virtual environment”已公开<br>段落[0014] “user specific... orientation in the virtual environment”已公开<br>段落[0023] “放射方向(orientation)...を推定する”
D: 渲染显示建立视觉表示已公开<br>段落[0010] “outputting at least the 3D representation... for displaying”已公开<br>段落[0006] “outputting at least the 3D representation... for displaying”已公开<br>段落[0029] “画像合成部147...表示画像信号を合成して...画像表示部152に出力”
E: 朝向表示面部朝向已公开<br>段落[0048] “morphological cues... eye contact, facial expressions... orientation”已公开<br>段落[0048] “morphological cues... eye contact, facial expressions... orientation”已公开<br>段落[0093] “画像信号が表す画像に表された人物の顔面の方向...を放射方向とし推定”
F: 渲染为具有空间方向的空间音频源已公开<br>段落[0062] “spatialized sound related to the location of the various participants... simulate the virtual 3D sound environment”已公开<br>段落[0062] “spatialized sound related to the location of the various participants... simulate the virtual 3D sound environment”已公开<br>段落[0031]-[0032] “頭部伝達関数(HRTF)...左右各チャネルの音響信号を合成...音源方向に各音源に係る音を知覚”
G: 空间方向与视觉表示中面部朝向一致未明确公开(区别特征)<br>仅提到了根据位置(Location/Position)调整空间声音,未明确将音频声源的发声辐射方向与面部朝向(Face Orientation)联动渲染一致。未明确公开(区别特征)<br>仅提到了根据位置(Location/Position)调整空间声音,未明确将音频声源的发声辐射方向与面部朝向(Face Orientation)联动渲染一致。未明确公开(区别特征)<br>D3基于声源位置和HRTF进行声源定位,且箭头指向放射方向,但未显式限定将音频空间方向与视觉呈现的面部朝向锁定一致渲染。

---

## 三、 最接近对比文件选择与技术问题/效果分析

### 1. 最接近对比文件的选择:**D1 (WO2015039239A1) / D2 (US20160234475A1)**

(注:D1与D2为同族专利,技术方案等同,均可作为最接近对比文件)。

* **选择理由**:

1. **技术领域高度重合**:D1/D2与本专利均属于“虚拟现实/远程临场(Telepresence)中的视听感知渲染”领域。

2. **技术构架极其吻合**:D1/D2同样构筑了一个包含3D视觉捕捉(点云/网格)、用户特定位置与朝向(Position & Orientation)校准、多通道空间立体声(Spatialized Sound / 3D Sound)渲染的完整虚拟交互系统。

3. **覆盖特征最多**:D1/D2已经公开了本专利权1中特征A、B、C、D、E、F的绝大部分技术细节。

### 2. 实际解决的技术问题与技术效果分析

* **区别特征**:特征 G(将空间音频的空间方向渲染为与视觉表示中用户的面部朝向一致)。

* **实际解决的技术问题**:如何提高虚拟现实远程交互中“听觉方位感”与“视觉面部朝向”的匹配度,避免因声像方向脱节导致的沉浸感降低问题。

* **达到的技术效果**:使得受听者在虚拟环境中听到声音时,声音的来源与方向感自然匹配说话者面部所面对的方位(例如,当说话者扭头说话时,声场朝向同步发生偏转),增强视听融合的真实感与交互沉浸感。

---

## 四、 专利无效攻击的薄弱点与进一步检索策略

### 1. 权利要求1最薄弱的技术特征(攻击切入点)

权利要求1最薄弱的技术特征是 **“特征 G(空间方向与视觉表示中用户的面部朝向一致)”**。

* **薄弱原因**:

在三维虚拟现实(VR)、虚拟会议或游戏领域,**“声像一致性(Audio-Visual Consistency)”** 是本领域的公知常识与惯用技术手段。当D1/D2已经建立了用户的3D视觉表示(含面部朝向数据)并支持3D空间音频渲染时,本领域技术人员为了追求极致的沉浸感,极其容易产生将“空间声场的辐射方向”直接与“视觉模型的面部朝向向量”进行绑定的显而易见的技术动机(Design Choice)。

### 2. 进一步对比文件检索策略(用于彻底击垮特征G)

若要以“不具备创造性(如A22条3款)”甚至“缺乏新颖性”发起无效宣告,建议采取以下补充检索策略:

1. **关键词组合扩展**:

* **音频/声学类**:`Spatial Audio`(空间音频)、`3D Audio`(3D音频)、`Directional Sound`(方向性声音)、`Sound Radiation Field`(声辐射场)、`HRTF`(头相关传输函数)、`Acoustic Orientation`(声学朝向)。

* **视觉/姿态类**:`Head Orientation`(头部朝向)、`Facial Orientation`(面部朝向)、`Gaze Direction`(视线方向)、`Facing Angle`(面向角度)、`Pose Tracking`(姿态跟踪)。

* **关联/匹配类**:`Audio-Visual Alignment`(视听对齐)、`Synchronize`(同步)、`Consistency`(一致性)、`Coherence`(连贯性)。

2. **分类号(IPC / CPC)精准锁定**:

* `G06F 3/01`:专门用于输入或输出与人体相适应的装置(VR/AR交互)。

* `H04S 7/00`:空间声音控制系统(Positional/Spatial Audio Processing)。

* `G06T 19/00`:三维混合现实/虚拟现实呈现。

3. **重点检索方向与组合方案**:

* **方向 A(寻找直接公开特征G的公知常识/对比文件 D4)**:检索2013年9月之前(优先权日之前)关于“虚拟声学中根据说话人头姿/面部朝向动态调整定向声源辐射方向(Directional Source Directivity)”的音视频处理专利或学术论文(如AES、IEEE期刊)。

* **拼图组合逻辑**:以 **D1/D2** 作为第一对比文件(提供虚拟临场系统框架、视觉朝向与空间音频),结合补充检索出的 **D4**(公开了基于面部/头部朝向渲染定向空间声源的特征G),组合发起**D1+D4**或**D1+D3+D4**的创造性无效攻击。

---

> **总结代理意见**:本专利权1保护范围较宽,核心壁垒仅在于“声场方向与视觉面部朝向的强制绑定渲染”。在无效程序中,以D1/D2作为最接近对比文件,结合公知常识或补充检索声学方向性渲染的前案(D4),有极高把握攻破其创造性。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名资深专利代理师,我针对目标专利权利要求1,结合对比文件 **D1(ES2592217T3)** 与 **D2(EP3255904A1)** 的原文内容,为您提供系统、严密的侵权/无效法律分析与检索策略。

---

### 一、 权利要求1的技术特征拆解与技术内涵解释

**【权利要求1全文】**

> 一种渲染用户的视听记录的方法,接收表示该用户的视觉记录的视觉数据;接收表示该用户的音频记录的音频数据;获得指定朝向的朝向数据;其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示;所述朝向表示在所述视听记录中所述用户的面部朝向;基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源;该空间方向与该视觉表示中该用户的面部朝向一致。

#### 技术特征拆解与理解:

* **前言(主题名称)**:一种渲染用户的视听记录的方法

* **技术特征A**:接收表示该用户的视觉记录的视觉数据;

* **技术特征B**:接收表示该用户的音频记录的音频数据;

* **技术特征C**:获得指定朝向的朝向数据;

* **技术特征D**:其中渲染该视听记录包括渲染该视觉数据以在显示器上建立该用户的视觉表示;

* **技术特征E(核心限定1)**:所述朝向表示在所述视听记录中所述用户的面部朝向;

* **技术特征F**:基于该朝向数据将该音频数据渲染为具有空间方向的空间音频源;

* **技术特征G(核心限定2)**:该空间方向与该视觉表示中该用户的面部朝向一致。

**【专利法理解与技术内涵分析】**:

本权利要求解决的核心技术问题在于:**在视听记录渲染中,如何实现声源空间方向与视觉画面中“用户面部朝向”的动态对齐**。其技术内涵并非泛泛的“相机角度调整”或“听者头部追踪”,而是明确提取**视听记录中被记录用户的“面部朝向(Face Orientation)”**作为控制参数,使渲染出的空间音频方向与画面中用户面部的朝向相吻合,从而在转头、对视或特定姿态下提供符合视觉面部朝向的沉浸式空间声场。

---

### 二、 对比文件原文核查与对比分析

#### 1. 对比文件 D1:ES2592217T3

* **公开号**:ES2592217T3

* **原文核查与技术特征对应关系**:

* **特征A/B**:D1公开了接收视频与音频信号。例如描述部分提及:*“se acopla a una cámara de video u otras fuentes de video”*(耦合至视频相机或其他视频源)以及 *“reciben además señales de audio espacial paramétrico”*(接收空间参数音频信号)。

* **特征C/F**:D1公开了基于朝向/控制信号调整音频方向。例如:*“modifican los datos de audio espacial... de acuerdo con las señales de control de zoom o control de rotación”*(根据缩放或旋转控制信号修改空间音频数据)。

* **特征D**:D1公开了渲染视频图像。例如:*“modificación de la imagen visual... la imagen acústica grabada se puede alinear con la correspondiente imagen de video modificada”*(声学图像与修改后的视频图像对齐)。

* **特征E/G**:**未公开**。D1中公开的朝向是**相机视角的旋转角度(orientación de la cámara)**或**虚拟听音位置的朝向(orientación de escucha virtual)**,并非视听记录中“被记录用户的面部朝向(face orientation of the user)”,因此也无法实现声源方向与“面部朝向”的一致。

#### 2. 对比文件 D2:EP3255904A1

* **公开号**:EP3255904A1

* **原文核查与技术特征对应关系**:

* **特征A/B**:D2段落 `[0006]`, `[0029]`, `[0037]` 明文公开了接收多路音频信号及视频信号(*“receive a plurality of audio signals representing captured audio”*, *“receive spatial video signals”*)。

* **特征C/F**:D2段落 `[0009]`, `[0039]`, `[0088]`, `[0096]` 公开了获取位置/朝向数据(如通过 HAIP 蓝牙定位标签获取 DOA 角度,或通过 Head Tracker 123 获取听者的头部朝向),并据此渲染空间音频。

* **特征D**:D2段落 `[0004]` 公开了在 VR 头显等显示器上呈现捕捉到的视频与音频(*“through a VR headset, can view and listen to the captured video and audio”*)。

* **特征E/G**:**未公开**。D2跟踪的是音频源(如歌手、乐手)的**三维空间物理位置(spatial position)**(利用定位标签 HAIP tag,段落 `[0039]`)或者**听者的头部朝向(listener's orientation)**(段落 `[0088]`),完全没有涉及或公开提取/获得视听记录中**被记录用户的“面部朝向”**,更未公开将声源方向与画面中用户的“面部朝向”进行一致性渲染。

---

### 三、 特征比对表格 (Feature Comparison Table)

权利要求1技术特征对应D1(ES2592217T3)原文与公开情况对应D2(EP3255904A1)原文与公开情况比对结论
前言:一种渲染用户的视听记录的方法公开:*“modificar la imagen acústica... alinear con la correspondiente imagen de video”*公开:[0001], [0004] *“capture and rendering of spatial audio data... VR application”*D1、D2均公开
特征A:接收表示该用户的视觉记录的视觉数据公开:*“fuentes de video... captura de video”*公开:[0029] *“receive spatial video signals”*D1、D2均公开
特征B:接收表示该用户的音频记录的音频数据公开:*“reciben además señales de audio espacial”*公开:[0006] *“receiving a plurality of audio signals... from respective audio sources”*D1、D2均公开
特征C:获得指定朝向的朝向数据实质公开(相机/听音朝向):*“orientación de escucha... señales de control de rotación”*实质公开(听者朝向/声源位置角度):[0009] *“measurement of the DoA angle”*, [0088] *“orientation of the listener”*D1、D2公开了朝向/角度数据,但非“面部朝向”
特征D:渲染视觉数据以建立用户的视觉表示公开:*“modificación de la imagen visual... en las cámaras de video”*公开:[0004] *“through a VR headset, can view and listen to the captured video”*D1、D2均公开
特征E:所述朝向表示在所述视听记录中所述用户的面部朝向未公开(D1仅涉及相机镜头旋转/镜头视角朝向)未公开(D2仅涉及声源空间物理坐标位置及听者头部姿态)区别特征(D1、D2均未公开)
特征F:基于朝向数据将音频渲染为具有空间方向的空间音频源公开:*“producir los datos modificados... en forma de señal de mezcla descendente... con la dirección de llegada”*公开:[0096] *“audio renderer 121 is configured to control the azimuth, elevation... based on the tracked position data”*D1、D2均公开
特征G:该空间方向与该视觉表示中该用户的面部朝向一致未公开(D1实现的是声场与相机缩放/视角旋转的对齐)未公开(D2实现的是声学对象与物理坐标位置/听者视角的对齐)区别特征(D1、D2均未公开)

---

### 四、 创造性分析与最接近对比文件的确定

#### 1. 最接近对比文件的选择

在创造性分析中,**对比文件 D2(EP3255904A1)最适合作为第一最接近的对比文件**(亦可同时选择 D1 作为备选最接近对比文件):

* **原因**:D2 与本专利同属于 **VR 视听捕捉、分布式音频混合与渲染技术领域**。D2 旨在解决多声源/多用户场景下分布式空间音频与视频的对齐与沉浸式重建问题,其技术领域、所面对的技术问题及技术架构与目标专利最为接近。

#### 2. 区别技术特征与实际解决的技术问题

以 **D2(EP3255904A1)** 为最接近对比文件,权利要求1的区别技术特征为:

* **区别特征(特征E + 特征G)**:朝向数据表示视听记录中**用户的“面部朝向”**,且将音频渲染为空间声源时,其**空间方向与视觉表示中用户的“面部朝向”一致**。

* **实际解决的技术问题**:

如何在视听记录渲染过程中,精细化捕捉并利用被记录用户的面部姿态/朝向变化,使渲染出的空间音频与画面中用户面部的朝向相匹配,从而提高面部姿态动态变化(如转头说话/演唱)时的音画同步真实感与声场沉浸感。

#### 3. 显而易见性判断(非显而易见)

* D2 中仅给出了通过标签(HAIP tag)追踪声源的**空间三维位置坐标**,或通过头追踪器(Head Tracker)获取**听者(Listener)的头部朝向**。

* D1 中仅给出了根据**相机镜头自身的旋转/缩放角度**调整音频的方向与漫射度。

* 现有技术(D1、D2)均未给出“提取视听记录中**被记录用户的面部朝向**并使空间声源方向与该面部朝向一致”的技术启示。技术人员在 D2 或 D1 的基础上,无法显而易见地联想到将“被记录者的面部朝向”作为空间音频渲染的控制参量。

* **结论**:权利要求1相对于 D1(ES2592217T3)与 D2(EP3255904A1)的结合**具备突出的实质性特点和显著的进步,具备创造性**。

---

### 五、 无效请求中最薄弱的技术特征分析

若针对本专利发起无效宣告请求:

1. **最薄弱的技术特征(易被现有技术攻破的特征)**:

* **特征C与特征F**(获得朝向数据 & 基于朝向数据将音频渲染为具有空间方向的空间音频源)。

* **原因**:在音频处理领域(如 D1 中的相机/听音旋转角度控制,D2 中的 DoA/ Head Tracking 渲染),基于角度/朝向参数进行空间音频方位角(Azimuth/Elevation)渲染属于普遍采用的技术手段,已被现有技术充分公开。

2. **最具防御力/最稳固的技术特征(专利权的防线)**:

* **特征E与特征G的结合**(朝向限定为“**视听记录中用户的面部朝向**”,且声源方向“**与面部朝向一致**”)。

* **原因**:该特征将视觉人脸姿态估计(Face Pose/Orientation Tracking)与空间音频定向渲染进行了深度融合,D1 和 D2 均未涉及“面部朝向”这一维度的控制。

---

### 六、 进一步的对比文件检索策略

为了成功无效权利要求1,后续检索必须**突破“声源三维坐标定位(D2)”与“镜头视角旋转(D1)”的范畴,锁定“基于人脸/头部朝向(Face/Head Orientation)驱动空间音频渲染”的相关专利或文献**。

#### 1. 扩展检索关键词组合(Keywords)

* **面部/姿态维度**:

`Face orientation`, `Facial pose`, `Head pose`, `Gaze direction`, `Face tracking`, `Facial direction`, `人脸朝向`, `面部姿态`, `头部朝向`.

* **音频/声源维度**:

`Spatial audio`, `Directional audio`, `Spatial source`, `Audio rendering`, `Sound spatialization`, `空间音频`, `定向音频`, `声场渲染`.

* **关联/融合逻辑**:

`("Face orientation" OR "Head pose") AND ("Spatial audio" OR "Directional sound")`

`"Face pose dependent audio"` / `"Facial orientation aligned audio"`

#### 2. 重点 IPC / CPC 分类号交叉检索

* **H04S 7/00**(声场效果配置;空间音频处理、头追踪与声源定位)

* **G06V 40/16** / **G06T 19/00**(人脸识别、面部姿态估计、虚拟现实/增强现实图像渲染)

* **H04N 21/439** / **H04N 21/81**(视听信号同步、沉浸式多媒体内容传输与处理)

#### 3. 重点检索技术领域与文献类型

* **虚拟会议/远程协作(Teleconferencing / Telepresence)**:如 Microsoft、Apple、Meta、Sony 等在虚拟会议中根据发言人面部朝向调整虚拟声源方向的专利。

* **虚拟人/Avatar/VTuber 驱动**:根据人脸捕捉(Face MoCap)实时渲染 Avatar 面部及对应面部朝向声场的文献。

* **学术非专利文献(NPL)**:重点检索 **AES(Audio Engineering Society)** 会议论文、**IEEE ICASSP**、**ACM SIGGRAPH** 等关于 *Audio-Visual Fusion*(音画融合)与 *Face Pose Estimation for Spatial Audio* 的论文。


权利要求2

根据权利要求1所述的方法,其中渲染该视听记录包括在虚拟环境中渲染该视觉数据以在该虚拟环境内建立该用户的视觉表示;将该音频数据渲染为该虚拟环境中的具有空间位置的空间音频源;该空间位置与该虚拟环境中该用户的该视觉表示的空间位置一致。


权利要求3

根据权利要求1或2所述的方法,其中该朝向数据进一步指示该用户在该视觉表示的空间轮廓内的相对位置;渲染该空间音频源包括确定该空间音频源相对于该用户的视觉表示的空间位置;该空间位置与该用户的所述相对位置一致。


权利要求4

根据权利要求1或2所述的方法,其中将该音频渲染为空间音频源包括使用包括高保真立体声的环绕声场再现技术技术;或者将该音频渲染为空间音频源包括使用基于对象的音频渲染技术技术。


Powered by Django

网站备案号:渝ICP备2023012882号


重庆市非显而易见网络科技有限责任公司 A Anti NPE NPE