非显而易见杯

专利无效挑战赛

目标专利:2082用于确定音频系统的感知质量的方法和系统

专利公开号:CN102576535B

专利权人:皇家KPN公司

无效请求书提交日期:2026年


上一项目 下一项目

非显而易见性评估仅供参考,不构成法律建议。



权利要求列表点击可跳转

序号 权利要求内容

1

一种用于关于参考信号确定质量指标的方法,所述质量指标代表音频系统的输出信号的感知质量;其中处理和比较所述参考信号和所述输出信号;并且所述处理包括将所述参考信号和所述输出信号划分成相互对应的时间帧;其中所述处理还包括将所述参考信号的强度缩放成固定声强级;对缩放的参考信号内的时间帧执行测量用于确定参考信号时间帧特性;将所述参考信号的强度从所述固定声强级缩放成与所述输出信号有关的声强级;在感知响度域中将所述输出信号的响度缩放成固定响度级,输出信号响度缩放使用所述参考信号时间帧特性;在所述感知响度域中将所述参考信号的响度从与所述输出信号有关的声强级对应的响度级缩放成与缩放的输出信号的响度级有关的响度级,参考信号响度缩放使用所述参考信号时间帧特性;将所述参考信号和所述输出信号相减从而获得差值信号;并且从所述差值信号导出所述质量指标。

2

根据权利要求1所述的方法,其中所述音频系统是语音处理设备。

3

根据权利要求1所述的方法,其中将所述参考信号的强度从所述固定声强级缩放成与所述输出信号有关的声强级是基于所述参考信号与缩放因子相乘;所述缩放因子通过以下来定义为多个时间帧确定平均参考信号声强级;为与所述参考信号的用来确定所述平均参考信号声强级的时间帧对应的多个时间帧确定平均输出信号声强级;通过基于所述平均参考信号声强级 and 所述平均输出信号声强级确定分数来导出预备缩放因子;如果所述预备缩放因子小于阈值,则通过将所述缩放因子定义成等于所述预备缩放因子、否则等于用附加的依赖于预备缩放因子的值递增的所述预备缩放因子来确定缩放因子。

4

根据任一前述权利要求所述的方法,其中所述方法在输出电平到固定响度级的响度缩放之前还包括针对所述参考信号的具有比所述输出信号的响度级高的响度级的部分将所述参考信号的响度级局部缩放成所述输出信号的响度级;并且随后针对所述输出信号的具有比所述参考信号的响度级高的响度级的部分将所述输出信号的响度级局部缩放成所述参考信号的响度级。

5

根据权利要求1-3中任一项所述的方法,其中所述处理还包括将所述缩放的参考信号 and 所述输出信号从时域变换到时间-频率域;根据所述参考信号导出参考音调功率密度函数,并且根据所述输出信号导出输出音调功率密度函数,声强级差对应于所述音调功率密度函数的声强级之间的差;局部缩放所述参考音调功率密度函数以获得局部缩放的参考音调功率密度函数;关于频率部分地补偿局部缩放的参考音调功率密度函数;导出参考响度密度函数 and 输出响度密度函数,响度级差对应于所述响度密度函数的响度级之间的差;其中所述响度密度函数代表实现量化可变电平回放对感知质量的影响的密度函数。

6

根据权利要求5所述的方法,其中所述方法还包括对所述参考音调功率密度函数 and 所述输出音调功率密度函数中的至少一个执行激励操作。

7

根据权利要求4所述的方法,其中关于频率补偿所述局部缩放的参考音调功率密度函数 and 补偿所述局部缩放的参考响度密度函数中的至少一个包括基于所述参考信号时间帧特性来估计所述音频系统的线性频率响应。

8

根据权利要求1-3中任一项所述的方法,其中在缩放成与所述感知响度域中的所述输出信号的响度级有关的响度级之前对所述感知响度域中的所述参考信号执行用于将噪声抑制直至预定噪声电平的噪声抑制动作。

9

根据权利要求1-3中任一项所述的方法,其中在缩放成固定响度级之前对所述感知响度域中的所述输出信号执行用于将噪声抑制直至代表干扰的噪声电平的噪声抑制算法。

10

根据权利要求1-3中任一项所述的方法,其中在比较之前对所述感知响度域中的所述参考信号 and 所述输出信号执行全局噪声抑制。


对比文件列表

编号 名称
0 2007-12-25_US7313517B_发明授权_US07313517B2 Method and system for speech quality prediction of an audio transmission system_+++A_B_C_D_I_J_K_S_T_W_Z_e+++.docx
0 DE602004010634T2_Description_20260704_0102_+++A_B_C_D_E_I_J_K_S_T_W+++.docx
0 2009-05-13_JP4263620B_发明专利_JP4263620B2 Method and system for measuring the transmission quality of the system_+++A_B_C_D_E_I_J_K_S_T_U_W_z+++.docx
0 2009-04-28_US7526394B_发明授权_US07526394B2 Quality assessment tool_+++A_K+++.docx
0 2009-04-16_WO2009046949A_发明申请_WO2009046949A1 METHOD AND SYSTEM FOR SPEECH INTELLIGIBILITY MEASUREMENT OF AN AUDIO TRANSMISSION SYSTEM_+++A_B_C_D_E_I_J_K_S_T_W_Z_u_v+++.docx
0 2008-10-09_WO2008119510A_发明申请_WO2008119510A2 METHOD AND SYSTEM FOR SPEECH QUALITY PREDICTION OF THE IMPACT OF TIME LOCALIZED DISTORTIONS OF AN AUDIO TRASMISSION SYSTEM.docx
0 2008-08-12_US7412375B_发明授权_US07412375B2 Speech quality assessment with noise masking_+++A_B_C_D_E_F_I_J_K_S_T_W_l+++.docx
0 2008-05-16_ES2298725T_发明专利_ES2298725T3 PROCEDIMIENTO Y SISTEMA PARA PREDICCION DE CALIDAD DE VOZ DE UN SISTEMA DE TRANSMISION DE AUDIO_+++A_B_C_D_E_I_J_K_S_T_U_V_W_Z_x+++.docx
0 2008-01-01_US7315812B_发明授权_US07315812B2 Method for determining the quality of a speech signal_+++A_B_C_I_J_K_S_T_U_V_Z_d_e_w_y+++.docx
0 2003-09-18_WO2003076889A_发明申请_WO2003076889A1 METHOD AND SYSTEM FOR MEASURING A SYSTEM'S TRANSMISSION QUALITY_+++W_u+++.docx
0 2007-11-27_US7302234B_发明授权_US07302234B1 Portable interference-generating device for use in a CDMA mobile testing.docx
0 2007-09-20_DE60308336T_发明专利_DE60308336T2 Method and system for measuring the transmission quality of a system_+++A_B_C_D_E_I_J_K_S_T_V_W_Z_u_x+++.docx
0 2007-05-01_ES2272952T_发明专利_ES2272952T3 PROCEDIMIENTO Y SISTEMA PARA MEDIR LA CALIDAD DE LA TRANSMISION DE UN SISTEMA_+++A_B_C_D_E_I_J_K_S_T_U_W_z+++.docx
0 2006-08-03_US2006171543A_发明申请_US20060171543A1 Method and system for speech quality prediction of an audio transmission system_+++A_B_C_D_E_I_J_K_S_T_W+++.docx
0 2004-10-14_WO2004088638A_发明申请_WO2004088638A1 METHOD AND SYSTEM FOR SPEECH QUALITY PREDICTION OF AN AUDIO TRANSMISSION SYSTEM_+++A_B_C_D_E_I_J_K_S_T_U_V_W_l_m_n_o_p_z+++.docx
0 2004-10-06_EP1465156A_发明公开_EP1465156A1 Method and system for determining the quality of a speech signal_+++A_B_C_D_E_I_J_K_S_T_W+++.docx
0 2004-04-22_US2004078197A_发明申请_US20040078197A1 Method and device for determining the quality of a speech signal.docx

权利要求1

一种用于关于参考信号确定质量指标的方法,所述质量指标代表音频系统的输出信号的感知质量;其中处理和比较所述参考信号和所述输出信号;并且所述处理包括将所述参考信号和所述输出信号划分成相互对应的时间帧;其中所述处理还包括将所述参考信号的强度缩放成固定声强级;对缩放的参考信号内的时间帧执行测量用于确定参考信号时间帧特性;将所述参考信号的强度从所述固定声强级缩放成与所述输出信号有关的声强级;在感知响度域中将所述输出信号的响度缩放成固定响度级,输出信号响度缩放使用所述参考信号时间帧特性;在所述感知响度域中将所述参考信号的响度从与所述输出信号有关的声强级对应的响度级缩放成与缩放的输出信号的响度级有关的响度级,参考信号响度缩放使用所述参考信号时间帧特性;将所述参考信号和所述输出信号相减从而获得差值信号;并且从所述差值信号导出所述质量指标。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名专利代理师,我针对您提供的权利要求1及三份对比文件进行了系统的法律与技术比对分析。

---

### 一、 对比文件基本信息说明

* **D1**:EP1465156A1,公开日:2004-10-06

* **D2**:WO2004088638A1,公开日:2004-10-14

* **D3**:US20060171543A1,公开日:2006-08-03

> **同族/同源说明**:从文本内容看,D1、D2和D3属于同一技术方案的同族申请/同源文件(同出自Koninklijke KPN N.V.,基于PESQ P.862标准的改进)。其技术架构、背景和具体实施例描述完全一致。

---

### 二、 权利要求技术特征比对表格

以下为权利要求1(特征A~J)与对比文件原文的详细比对及比对出处:

权利要求1特征特征内容描述D1 (EP1465156A1) / D2 (WO2004088638A1) / D3 (US20060171543A1) 比对及出处比对结论
特征 A一种用于关于参考信号确定质量指标的方法,所述质量指标代表音频系统的输出信号的感知质量D1 段落[0001] / D2 [p0001] / D3 段落[0001]:“Method and system for measuring the transmission quality of a system under test...”及段落[0016]的“output signal Q... represents an estimate of the perceptual quality”。公开
特征 B处理和比较所述参考信号和所述输出信号D1 段落[0001] / D2 [p0001] / D3 段落[0001]:“...an input signal entered into the system under test and an output signal resulting from the system under test being processed and mutually compared.”公开
特征 C将所述参考信号和所述输出信号划分成相互对应的时间帧D1 段落[0026] / D2 [p0030] / D3 段落[0029]:“Short term FFT or time frequency decomposition... overlap between successive time windows (frames)...”公开
特征 D将所述参考信号的强度缩放成固定声强级D1 段落[0016],[0018] / D2 [p0022],[p0024] / D3 段落[0019],[0021]:“the pre-processing including power level scaling... level alignment to a calibrated listening level”。但该过程为标准PESQ的基本前处理,并非在感知响度域对缩放后的信号进行后续双重特定级缩放。实质公开/隐性公开
特征 E对缩放的参考信号内的时间帧执行测量用于确定参考信号时间帧特性D1 段落[0028],[0029] / D2 [p0032],[p0033] / D3 段落[0031],[0032]:在时间帧(frame $n$)内计算功率密度与局部缩放因子(local scaling factor)等特性。实质公开
特征 F将所述参考信号的强度从所述固定声强级缩放成与所述输出信号有关的声强级D1 段落[0028],[0045]-[0046] / D2 [p0033],[p0056]-[0057] / D3 段落[0031],[0052]-[0053]:提及部分线性频率补偿与增益补偿(PPXWIRSS(f)n 的缩放与校正)。未完全对应/存在差异
特征 G在感知响度域中将所述输出信号的响度缩放成固定响度级,输出信号响度缩放使用所述参考信号时间帧特性D1 段落[0029],[0031] / D2 [p0033],[p0034] / D3 段落[0032],[0034]:D1/D2/D3是在Pitch Power Density域(频域功率密度)执行局部增益补偿(PPY'WIRSS(f)n),随后才通过Zwicker公式转换至Sone Loudness Density(感知响度域 LX(f)n, LY(f)n)。其增益缩放并非直接在“感知响度域(Sone)”中利用参考信号时间帧特性将输出信号响度缩放至固定响度级。未公开
特征 H在所述感知响度域中将所述参考信号的响度从与所述输出信号有关的声强级对应的响度级缩放成与缩放的输出信号的响度级有关的响度级,参考信号响度缩放使用所述参考信号时间帧特性同特征G,D1/D2/D3的缩放迭代发生在功率密度层级(Pitch Power Density),转换到Sone感知响度域后直接进行相减计算Disturbance Density,未在感知响度域内执行此具体的双重响度级匹配与二次缩放步骤。未公开
特征 I将所述参考信号和所述输出信号相减从而获得差值信号D1 段落[0032] / D2 [p0039] / D3 段落[0035]:“The signed difference between the distorted and original loudness density is computed... raw disturbance density.”公开
特征 J从所述差值信号导出所述质量指标D1 段落[0036]-[0041] / D2 [p0044]-[p0052] / D3 段落[0043]-[0048]:将差值信号(Disturbance Density)逐帧积分并最终导出PESQ / MOS评分。公开

---

### 三、 最接近对比文件的确定与技术问题/效果分析

#### 1. 最接近的对比文件选择

在创造性分析中,**D1 (EP1465156A1)**、**D2 (WO2004088638A1)** 以及 **D3 (US20060171543A1)** 均可作为最接近的现有技术(最接近对比文件)。

* 从公开时间来看,**D1(2004年10月6日)** 与 **D2(2004年10月14日)** 的公开日更早,在专利无效诉讼中更适合优先作为主力最接近对比文件(优先权/公开日防线更稳固)。

#### 2. 整体解决的技术问题与技术效果分析

* **对比文件(D1/D2/D3)解决的问题与效果**:

对比文件旨在解决传统的PESQ(ITU-T P.862)在面对大频率响应偏差或局部功率差异较大时,由于直接计算频率补偿和局部功率缩放因子相互干扰导致预测感知质量与人工主观评价(MOS)相关性不佳的问题。其技术方案是在**功率谱密度/Pitch Power Density域**采用**迭代循环(Iterative Loop)**方式交替执行部分频率补偿与局部功率缩放。

* **目标专利解决的问题与区别效果**:

目标专利(权利要求1)同样致力于提高感知质量评估的准确性,但其将缩放与匹配过程引入到了**感知响度域(Perceptual Loudness Domain,即Sone域)**。通过在感知响度域中使用参考信号的时间帧特性直接对输出信号及参考信号的响度进行特定的级次缩放(特征G与H),使得相减获得的差值信号能够更真实地反映人耳对非线性失真及响度差异的感知特征。

---

### 四、 无效请求中最薄弱的技术特征及突破口

在对目标专利发起无效宣告请求时,**最薄弱的技术特征**(即目标专利区别于现有技术的核心保护壁垒)是:

1. **特征 G**:在**感知响度域**中将所述输出信号的响度缩放成固定响度级,输出信号响度缩放使用所述参考信号时间帧特性;

2. **特征 H**:在所述**感知响度域**中将所述参考信号的响度……缩放成与缩放的输出信号的响度级有关的响度级,参考信号响度缩放使用所述参考信号时间帧特性。

**薄弱点/突破口理由**:

* D1/D2/D3虽然已经完整公开了PESQ的前处理(时间帧划分、电平对齐)、相减获取扰动密度(Disturbance Density)以及最终导出质量评分的整体架构,但其增益与频率补偿均是在**Sone变换之前的Pitch Power Density域**完成的。

* 目标专利将“强度/功率缩放”改在“**感知响度域(Perceptual Loudness Domain)**”中结合“参考信号时间帧特性”进行,属于计算架构顺序及作用域的微调。如果仅依据D1/D2/D3,专利权人极易以“现有技术是在功率域处理,未教导在感知响度域直接进行二次响度级缩放”为由进行有效辩驳。

---

### 五、 进一步对比文件检索策略建议

为了成功无效目标专利权利要求1,必须重点针对**特征G和特征H**(即**在感知响度域/Sone域中利用参考帧特性执行响度缩放/增益校准**)补充检索组合对比文件(D4/D5)。

建议采取以下针对性的检索策略:

#### 1. 扩充检索的分类号(IPC / CPC)

* `G10L 19/00`(语音信号的分析、合成或编码)

* `G10L 19/06` 或 `G10L 25/69`(用于语音信号感知质量评估,如PESQ、POLQA、BS.1387/PEAQ)

* `H04M 3/22`(电信网中的测试与监控)

#### 2. 核心关键词逻辑组合

* **主题词A(语音/音频质量评估)**:`PESQ` OR `POLQA` OR `PEAQ` OR `"speech quality"` OR `"perceptual quality"` OR `"audio quality"`

* **主题词B(感知响度域)**:`"loudness domain"` OR `"sone domain"` OR `"perceptual loudness"` OR `"Zwicker"` OR `"loudness density"`

* **主题词C(响度/增益缩放与校准)**:`"loudness scaling"` OR `"gain compensation"` OR `"level alignment"` OR `"scaling factor"` OR `"frame characteristics"`

#### 3. 重点检索方向与文献源

1. **ITU-T 及 AES 标准提案演进文档(最可能包含此类微调算法)**:

* 重点检索 **POLQA (ITU-T P.863)** 的早期草案及相关开发背景论文(POLQA是PESQ P.862的下一代标准,包含了大量在感知响度域进行时域/频域响度缩放的改进算法)。

* 重点检索国际音频工程学会(AES)会议论文及 IEEE Transactions on Audio, Speech, and Language Processing 中关于 **Psychoacoustic Model / Loudness Compensation** 的研究。

2. **专利同源发明人/申请人追踪**:

* 追踪重点发明人(如 John Gerard Beerends 等)在2004年至专利申请日之间的后续专利申请,寻找其是否在后续文献中显式披露了“将功率域的迭代缩放移植到Sone响度域”的公知常识或技术教导。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名经验丰富的专利代理师,我对目标专利权利要求1与提供的三份对比文件进行了深度的技术特征比对与法律逻辑分析。以下是详细的分析报告:

---

### 一、 对比文件基本信息与代称映射

1. **D1**:西班牙发明专利 **ES2272952T3**

* *公开号*:ES2272952T3(公开日:2007-05-01)

* *主题*:一种用于测量系统传输质量的方法和系统(Procedimiento y sistema para medir la calidad de la transmisión de un sistema)。

2. **D2**:德国发明专利 **DE60308336T2**

* *公开号*:DE60308336T2(公开日:2007-09-20)

* *主题*:测量系统传输质量的方法和系统(Method and system for measuring the transmission quality of a system)。

* *注*:经文本比对,D1与D2属于同一族专利(如EP 1241633 / EP01200945等衍生),其技术方案与内容高度同源。

3. **D3**:美国发明授权专利 **US7313517B2**

* *公开号*:US7313517B2(授权公告日:2007-12-25)

* *主题*:用于音频传输系统语音质量预测的方法和系统(Method and system for speech quality prediction of an audio transmission system)。

---

### 二、 权利要求1的技术特征比对与出处分析

目标专利权利要求1拆解为10个技术特征(A~J)。以下是各对比文件原文的比对情况与详细出处。

#### 1. 特征比对总表

权利要求1技术特征D1 (ES2272952T3) 公开情况D2 (DE60308336T2) 公开情况D3 (US7313517B2) 公开情况
特征A:质量指标代表音频系统输出信号感知质量完全公开 (P. 2 Field, P. 4-5)完全公开 (P. 2 Field, P. 4-5)完全公开 (Col. 1 [0001], Col. 2 [0019])
特征B:处理和比较参考信号与输出信号完全公开 (P. 2 Field)完全公开 (P. 2 Field)完全公开 (Col. 1 [0001], Col. 2 [0019])
特征C:将参考和输出信号划分成相互对应的时间帧完全公开 (P. 5 Short term TRF, P. 6)完全公开 (P. 5 Short term FFT)完全公开 (Col. 3 [0029])
特征D:将参考信号强度缩放成固定声强级完全公开 (P. 5 Power/Loudness scale factor)完全公开 (P. 5 Power/Volume scale factor)完全公开 (Col. 3 [0026])
特征E:对缩放参考信号内时间帧测量确定时间帧特性完全公开 (P. 6 Partial compensation)完全公开 (P. 6 Partial compensation)完全公开 (Col. 3 [0030], Col. 4 [0032])
特征F:将参考信号强度从固定声强级缩放成与输出信号有关的声强级完全公开 (P. 6 Partial compensation)完全公开 (P. 6 Partial compensation)完全公开 (Col. 3 [0030], Col. 4 [0032])
特征G:感知响度域中将输出信号响度缩放成固定响度级(使用参考信号时间帧特性)未公开/差异特征(D1/D2采用局部增益补偿PY',但未在感知响度域以该特定顺序缩放)未公开/差异特征(同D1)未公开/差异特征(D3采用迭代频响与局部功率缩放)
特征H:感知响度域中将参考信号响度缩放(使用参考信号时间帧特性)部分公开/差异特征(D1/D2包含低电平软缩放Subalgorithm 2,但具体响度缩放顺序不同)部分公开/差异特征(同D1)未公开/差异特征
特征I:将参考信号与输出信号相减获得差值信号完全公开 (P. 3, P. 7 Disturbance Density)完全公开 (P. 3, P. 7 Disturbance Density)完全公开 (Col. 4 [0036]-[0041])
特征J:从差值信号导出质量指标完全公开 (P. 8 PESQ score)完全公开 (P. 8 PESQ value)完全公开 (Col. 5 [0049])

---

#### 2. 对比文件原文详细出处说明

* **D1 (ES2272952T3)**:

* **特征A、B**:*Field of the Invention*(第2页)“A method and a system to measure the transmission quality of a system in test, being an input signal introduced... and an output signal... processed and compared to each other.”

* **特征C**:*Short term TRF*(第5页)“Short term TRF with a window size 32 ms. Overlap between successive time windows (frames) is 50 percent.”

* **特征D**:*The power scale change factor / The loudness scale change factor*(第5页)公开了通过1000 Hz 40 dB SPL基准信号将功率和响度标定到固定级(1 Sone / 40 dB SPL)。

* **特征E、F**:*Partial compensation of tonal height power density original / distorted*(第6页)“The power ratio in the original files and in the gradients are calculated... multiplied by this ratio...”

* **特征I、J**:*Disturbance Density Calculation / PESQ score calculation*(第7-8页)“The signed difference between the distorted and original loudness density... The final PESQ score is a linear combination...”

* **D2 (DE60308336T2)**:

* **特征A、B**:*Technical field of the invention*(第2页)对应段落。

* **特征C、D、E、F、I、J**:技术内容同D1,均基于ITU-T P.862 PESQ模型架构及其改进版(软缩放/Soft-scaling机制)。

* **D3 (US7313517B2)**:

* **特征A、B、C**:*Detailed Description*(Col. 1 [0001], Col. 3 [0029])“short term FFT with overlap between successive time windows (frames)...”

* **特征D、E、F**:Col. 3 [0026], [0030]以及Col. 4 [0032]“Compensation of the Original Pitch Power Density... Compensation of the Distorted Pitch Power Density...”公开了对原始信号及失真信号进行频响与时变增益补偿。

* **特征I、J**:Col. 4 [0036]-[0041], Col. 5 [0049]“Calculation of the Disturbance Density... signed difference between the distorted and original loudness density...”。

---

### 三、 最接近对比文件的选择与技术问题/效果分析

#### 1. 最接近对比文件的确定

**D1 (ES2272952T3) 和 D2 (DE60308336T2) 均适合作为最接近的对比文件(两者为同族专利)。**

* **整体解决的技术问题**:

目标专利与D1/D2均致力于解决“传统的ITU-T P.862 PESQ方法在处理信号中存在弱信号/低噪声背景或局部增益变化时,无法准确进行帧间/时域和响度补偿,导致客观质量评估得分与主观感知质量相关性较低”的技术问题。

* **技术效果**:

D1/D2与目标专利均旨在提升音频客观评估指标(如PESQ/MOS分)与人类主观感知质量之间的高相关性。

* **对比分析**:

D3主要关注于通过“迭代循环(Iterative Loop)”来解决线性频率响应补偿与局部功率缩放之间的相互干扰问题(Col. 2 [0008]-[0010])。而D1/D2提出了“软缩放(Soft-scaling)”以及在感知响度域/功率域对参考信号与输出信号的缩放调整,其技术领域、技术方案的架构组成与目标专利最为接近。

#### 2. 未被最接近对比文件(D1/D2)完全公开的特征分析

被D1/D2区别开的特征主要是 **特征G** 和 **特征H** 中的具体缩放顺序与响度域变换逻辑:

* **特征G**:要求在**感知响度域**中将输出信号的响度缩放成固定响度级,且使用**参考信号时间帧特性**。

* **特征H**:要求在**感知响度域**中将参考信号的响度从与输出信号有关的声强级对应的响度级缩放成与缩放的输出信号响度级有关的响度级,且使用**参考信号时间帧特性**。

**其他对比文件(如D3)是否公开了特征G和H?**

* D3并没有公开在“感知响度域”中利用“参考信号时间帧特性”按此特定顺序对输出信号和参考信号分别进行双重响度缩放。D3采用的是在功率谱/音高功率密度(Pitch Power Density)层面的迭代频率响应与增益补偿,随后再统一通过Zwicker定律转换为响度密度(Col. 4 [0034])。

---

### 四、 无效请求中最薄弱的技术特征与法律突破口

若对目标专利权利要求1发起无效宣告请求,**最薄弱的技术特征(即专利权人的防御核心/区别特征)是:特征G与特征H(在感知响度域中利用参考信号时间帧特性进行特定的双向/交叉响度缩放步骤及顺序)。**

#### 破局与无效理由展开策略:

1. **公知常识/技术演进推导(创造性攻击)**:

* D1/D2(P. 3-4)已经明确揭示了核心发明构思:“人类听觉感知机制偏好软阈值(Soft thresholds)”,并指出了在感知响度域(Loudness domain/Sone scale)对信号进行幅度/功率校准和差值计算(Disturbance density)的必要性。

* 目标专利将“时域/功率域的增益补偿(使用参考信号帧特性)”置换或延伸至“感知响度域(Sone域)”中进行,本领域技术人员在D1/D2给出“在响度域导出差值信号”和“利用帧特性进行局部功率/幅度补偿”的教导下,将缩放操作的执行位置从频响/功率谱域移动到响度域,属于本领域的惯用技术手段或显而易见的选择。

2. **说明书支持/充分公开问题(专利法第26条第3/4款突破口)**:

* 需紧密结合目标专利说明书核查:说明书中对于“如何在感知响度域中利用参考信号时间帧特性对输出信号和参考信号进行特定响度缩放”是否有具体、明确的数学公式与算法支持?

* 如果说明书仅在字面上重复权利要求1的特征G和H,而未给出具体的计算公式(例如未给出像D1/D2中 $S = C^a + \dots$ 这样明确的算法),则可依据**说明书公开不充分**或**权利要求得不到说明书支持**发起攻击。

---

### 五、 进一步对比文件检索策略

为了彻底攻破特征G与特征H,建议采取以下补充检索策略:

1. **精准同源/后续标准检索(ITU-T 建议书及工作组文档)**:

* **目标**:PESQ(P.862)的升级标准 **POLQA (ITU-T P.863)** 及其前期草案。

* **关键词/分类号组合**:

* 分类号:`G10L19/00`, `H04M3/22`, `H04B17/00`

* 关键词:`Perceptual evaluation`, `Loudness domain`, `Scaling`, `Frame characterization`, `Reference signal`, `MOS`, `POLQA`, `P.863`, `Zwicker`.

* **重点关注机构/作者**:Opticom GmbH, Psytechnics Ltd., Swisscom, J.G. Beerends, A.W. Rix 等 PESQ/POLQA 标准的主要贡献团队。

2. **追溯申请人/发明人的学术论文与前瞻专利**:

* 检索相同发明人/申请人在 2000 年~2010 年期间发表的 IEEE / AES (Audio Engineering Society) 会议论文,特别是关于 *“Loudness domain scaling in objective speech quality assessment”* 或 *“POLQA psychoacoustic model”* 的文章。学术论文往往比专利更早、更详细地公开了感知响度域的帧缩放细节。

3. **专利结合攻击组合**:

* **主对比文件**:D1 (ES2272952T3) / D2 (DE60308336T2)(提供PESQ基础框架、帧划分、功率校准、软缩放概念及响度域相减)。

* **辅助对比文件**:针对“感知响度域缩放(Loudness scaling)”的文献/标准文档(提供将帧级特性应用于Sone响度域缩放的具体教导)。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名资深专利代理师,我已对目标专利权利要求1与三篇对比文件(D1: US7315812B2、D2: ES2298725T3、D3: US7412375B2)的原文内容进行了全面且深入的对比分析。

以下是紧密结合目标专利说明书及对比文件原文的详细无效宣告分析报告:

---

### 一、 权利要求1的技术特征拆解与对比文件特征比对表格

目标专利权利要求1涉及一种基于参考信号确定音频系统输出信号感知质量指标的方法(即PESQ/POLQA类客观语音质量评估算法的改进)。

各对比文件公开特征比对如下表所示:

权利要求1技术特征D1 (US7315812B2) 是否公开及原文出处D2 (ES2298725T3) 是否公开及原文出处D3 (US7412375B2) 是否公开及原文出处
特征A:一种用于关于参考信号确定质量指标的方法,所述质量指标代表音频系统的输出信号的感知质量公开<br>· [0002] "determining, according to an objective measurement technique, the speech quality of an output signal... with respect to a reference signal."公开<br>· Field of Invention: "procedure... to measure the transmission quality of a system under test, being processed and compared... a input signal... and a signal from output..."公开<br>· [0011] "method of assessing the perceptual quality of stereo speech signals... generate a speech quality prediction..."
特征B:其中处理和比较所述参考信号和所述输出信号公开<br>· [0019] "The device 11 carries out a main processing step... signal differentiating means 15 and modelling means 16."公开<br>· [0019]及Fig.1: "...processed and compared to each other... signal differentiating means 15..."公开<br>· [0041] "...reference signal 1 is compared with a degraded signal 2... compared with each other by a comparator 6..."
特征C:所述处理包括将所述参考信号和所述输出信号划分成相互对应的时间帧公开<br>· [0022] "...transformed from a signal in the time domain into a time and frequency dependent output signal Y(f,t)..."(隐含分帧/FFT窗口)公开<br>· 节选段落: "FFT or time-frequency decomposition at short term... overlapping between successive temporary windows (frames)..."公开<br>· [0047] "...filtered by respective filters 31, 31' using a Hanning window... 32 ms Hanning window is used."
特征D:其中所述处理还包括将所述参考信号的强度缩放成固定声强级公开(部分)<br>· [0019] "...the pre-processing including power level scaling and time alignment operations..."(仅提到功率级缩放,未明确固定声强级)公开(部分)<br>· [0019] "...preprocessing scale operations of the power level and time alignment..." / 节选段落: "level alignment at a calibrated listening level..."公开<br>· [0045] "Each signal is also processed by a leveller 21... predetermined level... 79 dB Sound Pressure Level (SPL)."
特征E:对缩放的参考信号内的时间帧执行测量用于确定参考信号时间帧特性实质公开<br>· [0024] "FR(f) = ∫Y(f,t)dt / ∫X(f,t)dt"(基于时间帧积分计算信号功率/频谱特性)公开<br>· 节选段落: "Compensation of the original tonal power density... calculates... average power spectrum of original... over active voice frames..."实质公开<br>· [0048] "...calculate a partial compensation factor based on the average power densities of the respective signals."
特征F:将所述参考信号的强度从所述固定声强级缩放成与所述输出信号有关的声强级未公开<br>(D1仅在频域乘以基于FR(f)计算的补偿因子CF,未涉及二次声强级缩放架构)未公开<br>(D2仅在迭代循环中计算局部功率缩放因子,未采用特定顺序的声强/响度级级联缩放)未公开<br>(D3在前端平抑至79dB,未在感知响度域前执行此特定的二次强度与响度交错缩放)
特征G:在感知响度域中将所述输出信号的响度缩放成固定响度级,输出信号响度缩放使用所述参考信号时间帧特性未公开<br>(D1与D2在Zwicker定律转换前/后仅有局部增益补偿,未利用参考信号帧特性在感知响度域将输出信号缩放至固定响度级)未公开未公开
特征H:在所述感知响度域中将所述参考信号的响度从与所述输出信号有关的声强级对应的响度级缩放成与缩放的输出信号的响度级有关的响度级,参考信号响度缩放使用所述参考信号时间帧特性未公开<br>(缺少在感知响度域内利用参考信号帧特性对参考信号进行的特定双重/级联响度缩放步骤)未公开未公开
特征I:将所述参考信号和所述输出信号相减从而获得差值信号公开<br>· [0019] "...a differential or disturbance signal D is determined by means of the differentiating means 15 from said representation signals."公开<br>· 节选段落: "Disturbance Density Calculation... perceptual subtraction of the loudness densities LX(f)n and LY(f)n resulting in the disturbance density D(f)n..."公开<br>· [0041] "...sensation surfaces 1'', 2'' are then compared... comparator 6, and a resulting disturbance profile 5..."
特征J:从所述差值信号导出所述质量指标公开<br>· [0019] "...differential signal D is then processed by modelling means 16... in order to obtain the quality signal Q."公开<br>· 节选段落: "Aggregation of disturbance densities... final PESQ score is a linear combination of average value of disturbance..."公开<br>· [0041] "...disturbance profile 5 is passed to a cognitive modeller 7 which generates a speech quality prediction 8."

---

### 二、 最接近对比文件的选择分析(整体技术问题与技术效果角度)

在评估哪个对比文件最适合作为最接近的对比文件(Closest Prior Art)时,需要综合评估其与目标专利在技术领域、解决的技术问题、技术方案和技术效果上的贴合程度:

#### 1. D2 (ES2298725T3 / EP1343145) —— **首选最接近对比文件**

* **解决的技术问题**:D2旨在解决在存在大频率响应偏差或局部功率差异时,ITU-T P.862 (PESQ) 标准算法无法准确评估感知语音质量的问题。

* **技术方案贴合度**:D2公开了完整的ITU-T P.862框架,包括时间/频率分解(FFT帧)、声强/功率级缩放、频率响应补偿、Zwicker定律响度转换以及感知相减(获得Disturbance Density)。更重要的是,D2重点改进了**局部功率缩放因子(Local Power Scale Factor)与频率补偿的协同迭代机制**,这与本专利改进增益/响度缩放特性的出发点高度吻合。

* **结论**:D2与本专利解决的技术问题最接近,技术特征重叠度最高,最适合作为首选的最接近对比文件。

#### 2. D1 (US7315812B2) —— **备选最接近对比文件**

* **解决的技术问题**:解决参考信号与退化信号之间存在严重音色差异(Timbre differences)时,客观语音质量预测不准确的问题。

* **技术方案贴合度**:D1同样基于ITU-T P.862标准,采用了预处理缩放、频域转换、基于频率依赖函数(Clipping Function)的补偿因子乘法、响度压缩以及差值信号导出指标。

* **结论**:D1在整体架构上(A, B, C, D部分, E, I, J)与目标专利高度一致,是极其稳定的背景技术文献,可作为备选最接近对比文件。

#### 3. D3 (US7412375B2) —— **特定特征(特征D)的最佳对比文件**

* **技术特点**:D3主要解决双耳/立体声噪声掩蔽下的语音质量评估。

* **贡献**:D3段落[0045]明确指出了**“将信号平均电平平抑/缩放至预定声强级(79 dB SPL)”**,这为特征D(将参考信号强度缩放成固定声强级)提供了极其明确的原文教导。

---

### 三、 区别技术特征分析与目标专利最薄弱技术特征

通过对比可见,对比文件D1-D3共同公开了前置预处理、分帧、初步功率缩放、感知相减及导出质量指标(特征A, B, C, D, E, I, J)。

目标专利相对于现有技术的核心区别特征集中在 **特征F、G、H** 的组合机制:

* **特征F**:将参考信号强度从固定声强级再次缩放成与输出信号有关的声强级;

* **特征G**:在**感知响度域**中利用参考信号时间帧特性,将**输出信号**响度缩放成**固定响度级**;

* **特征H**:在**感知响度域**中利用参考信号时间帧特性,将**参考信号**响度缩放成与缩放后输出信号响度级相关的响度级。

#### 核心薄弱点诊断(专利无效宣告突破口):

1. **本质属于“算法公式/计算步骤的重构”**:

目标专利在感知响度域(Sone域)引入的“固定响度级缩放”以及“参考信号与输出信号间的交叉归一化缩放”,其本质是为了消除系统传输增益波动对响度差值计算(Disturbance calculation)的干扰。

2. **最薄弱技术特征:特征G与特征H中的“利用参考信号时间帧特性进行感知响度域缩放”**。

* **无效突破思路**:在ITU-T P.863 (POLQA) 标准或相关研讨文献(如ITU-T SG12贡献文档)中,POLQA算法相比PESQ (P.862) 的核心改进正是将原本在线性/频域进行的增益/电平Scaling,转移到基于Psychoacoustic Loudness Domain(Sone域)进行局部响度缩放。如果能在POLQA的基础标准定义文件或其研讨背景文献中检索到在Sone域利用Original Frame Energy/Pitch Density进行Loudness Normalization,则特征F, G, H将面临被“公知常识/标准演进”全面击穿的风险。

---

### 四、 针对目标专利的后续对比文件检索策略

为了成功发起专利无效宣告,建议采取以下**三阶检索策略**:

#### 1. 紧扣“POLQA (ITU-T P.863)”标准及演进过程检索

* **背景分析**:目标专利涉及的“在感知响度域进行固定响度级缩放”是ITU-T P.863 (POLQA) 标准的核心特征(POLQA取代了P.862 PESQ)。

* **关键词组合**:

* `("POLQA" OR "P.863" OR "Perceptual Objective Listening Quality Assessment")`

* `AND ("loudness domain" OR "sone domain" OR "perceptual loudness")`

* `AND ("scale" OR "scaling" OR "normalize" OR "gain compensation")`

* `AND ("fixed loudness" OR "reference frame")`

* **重点关注机构与发明人**:

* **机构**:OPTICOM GmbH, SwissQual AG, Koninklijke KPN N.V., TNO.

* **关键发明人**:Beerends John George (D1/D2发明人), Keyhl Michael, Schmidmer Christian.

#### 2. 深入非专利文献(NPL)与ITU-T SG12标准化贡献文件(Contributions)

* **检索目标**:ITU-T SG12 Working Party 1 (Question 9/12, Objective modeling of speech and audio quality) 在2006年–2010年期间提交的内部草案与学术论文。

* **检索平台**:IEEE Xplore, AES (Audio Engineering Society) E-Library, ITU-T SG12 Meeting Reports.

* **典型论文主题**:*"Loudness domain normalization for objective speech quality evaluation"*, *"Perceptual gain adaptation in POLQA"*.

#### 3. 组合追踪专利族与同源申请

* **扩展检索**:追踪D2 (ES2298725T3 / EP1343145) 与 D1 (US7315812B2) 的同族专利(特别是EP/US后置授权件),以及引用了D1/D2的后续专利申请(Forward Citations),重点筛选2008年至本专利优先权日之间的中间过渡专利文献。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名经验丰富的专利代理师,基于目标专利说明书(以权利要求1为准)的技术方案,结合引用的对比文件原文(D1:WO2009046949A1,D2:US7526394B2),对权利要求1进行深入的法律与技术比对分析如下:

---

### 一、 权利要求1的技术特征拆解与说明书含义解析

目标专利权利要求1涉及一种用于确定音频系统输出信号感知质量指标的方法,其核心在于通过**对参考信号在声强级域的特定双重缩放**以及**在感知响度域中利用参考信号时间帧特性对输出信号与参考信号进行二次响度缩放**,从而消除增益和声压影响,计算差值信号以导出质量指标。

* **技术特征 A/B/C(基本框架):** 将参考信号(输入)与输出信号分割为相互对应的**时间帧**(Time Frames),并在感知域处理与比较。

* **技术特征 D(参考信号首次缩放):** 将参考信号的强度(Power/Level)缩放成**固定声强级**(Fixed Power Level)。

* **技术特征 E(参考信号特征提取):** 对首次缩放后的参考信号时间帧进行测量,确定**参考信号时间帧特性**(Reference signal time frame characteristics)。

* **技术特征 F(参考信号二次缩放):** 将参考信号强度从固定声强级,缩放到**与输出信号有关的声强级**(Power level related to the output signal)。

* **技术特征 G(输出信号响度缩放):** 在**感知响度域**(Perceptual Loudness Domain)中,利用**参考信号时间帧特性**,将输出信号响度缩放到**固定响度级**(Fixed Loudness Level)。

* **技术特征 H(参考信号感知响度二次缩放):** 在**感知响度域**中,利用**参考信号时间帧特性**,将参考信号响度从与输出信号有关的声强级对应响度,缩放到**与缩放后的输出信号响度级有关的响度级**。

* **技术特征 I/J(差值与指标导出):** 将感知响度域中的参考信号与输出信号相减获得差值信号(Disturbance Density),并导出质量指标。

---

### 二、 对比文件原文技术特征比对与公开性分析

为了确保比对的严谨性,以下引入各对比文件的公开号及原文出处段落。

#### 1. D1(公开号:WO2009046949A1)

D1公开了一种测量音频传输系统语音可懂度(Speech Intelligibility)的方法(基于标准PESQ P.862算法改进)。

* **特征A、B、C(公开):** [p0002]和[p0006]明确记载将输入参考信号 $X(t)$ 与输出信号 $Y(t)$ 划分成时间-频率单元/帧(`cells in the frequency (f) and time (n) domain`),并在感知域比较处理。

* **特征D(公开):** [p0032]记载 `Both the original X(t) ... and degraded (output) signal Y(t) are scaled to the same, constant power level, resulting in signals Xs(t) and Ys(t).`(将参考信号强度缩放到固定功率/声压级)。

* **特征E(公开):** [p0033]-[p0035]及[p0042]-[p0043]记载,对参考信号各帧的功率谱 `PPX'(f)n` 执行测量并计算自相关(`frameCorTimeOrg(n)`),用作校正的帧特性。

* **特征F(公开):** [p0032]及[p0035]记载了对参考信号与降级信号进行总体增益补偿和增益缩放。

* **特征G、H(未明确完全公开或存在技术差异):**

* *差异点:* D1在[p0035]-[p0037]中,增益和滤波补偿(Processing block 28, 29)主要是在**Pitch Power Density(音高功率密度域)**执行的,随后才通过Zwicker定律(Block 31, 32)转换为Sone响度密度(`LX(f)n`, `LY(f)n`)。而目标专利特征G、H明确限定了**“在感知响度域中”**利用参考信号时间帧特性分别对输出信号和参考信号进行**响度级别的二次缩放**。

* **特征I、J(公开):** [p0010]和[p0037]记载 `perceptual subtraction of the loudness densities ... to obtain a disturbance density function D(f)n`,[p0012]记载聚合该差值导出可懂度/质量指标 $I$。

#### 2. D2(公开号:US7526394B2)

D2公开了一种**无侵入式(Non-intrusive)**的VOIP语音质量评估工具。

* **对比结果:** D2通过提取网络数据包的抖动(Jitter)、丢包率、连续正抖动(Consecutive Positive Jitter)等传输层参数([0012], [0043]),利用模型预测MOS分。

* **完全未公开:** D2是**无参考(No-Reference / Non-intrusive)**评估方法,不具备参考信号与输出信号的逐帧对比机制(特征C),更未涉及在感知响度域对参考信号和输出信号进行双重强度/响度缩放(特征D、E、F、G、H)以及感知响度相减(特征I)。

---

### 三、 特征比对表格(Feature Comparison Table)

下表详细说明权利要求1的技术特征在对比文件中的公开情况及具体段落出处:

权利要求1技术特征D1 (WO2009046949A1) 公开情况及原文出处D2 (US7526394B2) 公开情况及原文出处
A:质量指标代表输出信号感知质量公开:[p0002] "measuring the speech intelligibility of an audio transmission system...";[p0028] "represents an estimate of the perceptual intelligibility"公开:[0002] "speech quality assessment system"
B:处理和比较参考信号与输出信号公开:[p0002] "in which both the input signal X(t) and the output signal Y(t) are processed."未公开:D2为无侵入式(Non-intrusive),仅对被测信号/数据包进行分析([0005]-[0006])。
C:划分成相互对应的时间帧公开:[p0007] "cells in the frequency (f) and time (n) domain";[p0033] "32 ms frames. The overlap between successive frames is 50%."未公开:D2基于数据包(Packets)统计,无参考信号帧匹配过程。
D:参考信号强度缩放成固定声强级公开:[p0032] "Both the original X(t)... are scaled to the same, constant power level, resulting in signals Xs(t)..."未公开
E:测量缩放参考信号确定时间帧特性公开:[p0033]-[p0035], [p0042] 计算参考信号各帧的 Pitch Power Density PPX'(f)n 及帧间相关性 frameCorTimeOrg(n)。未公开
F:参考信号强度缩放到与输出信号有关的声强级实质公开:[p0032], [p0035] 通过整体及局部增益补偿(Level Alignment),将参考信号与输出信号强度关联缩放。未公开
G:在感知响度域中将输出信号响度缩放成固定响度级(使用参考信号帧特性)未完全公开(存在差异):D1的增益/滤波补偿(Block 28, 29)在功率谱域(Pitch Power Density)完成,之后才转为响度密度([p0036]-[p0037]),并非在“感知响度域”直接进行响度缩放。未公开
H:在感知响度域中将参考信号响度缩放到与缩放后输出信号有关的响度级未完全公开(存在差异):原因同特征G,D1未明确记载在响度域(Sone Domain)进行该特定逻辑的二次响度缩放。未公开
I:参考信号与输出信号相减获得差值信号公开:[p0010] "perceptual subtraction of the loudness densities (LX(f)n, LY(f)n) to obtain a disturbance density function (D(f)n)";[p0037]未公开
J:从差值信号导出质量指标公开:[p0012] "aggregating the corrected disturbance density function... to obtain a measure (I)";[p0051]-[p0056]未公开

---

### 四、 最接近的对比文件(Closest Prior Art)选择与技术效果分析

#### 1. 最接近对比文件的选择

根据《专利审查指南》,选择最接近的对比文件应优先考虑**技术领域相同或相近**、**所要解决的技术问题最接近**、**公开技术特征最多**的文件。

* **最接近对比文件:D1(WO2009046949A1)**

* **理由:**

1. **技术领域与架构完全一致:** D1与目标专利均属于基于感知模型(PESQ/ITU-T P.862框架)的音频/语音质量或可懂度客观评估技术领域。

2. **技术特征高度重合:** D1公开了目标专利权利要求1中的特征A、B、C、D、E、F、I、J,并揭示了基于时间帧的信号缩放、功率密度计算以及感知响度域减法(Perceptual Subtraction)的核心流程。

3. **解决的技术问题高度相关:** 两者均致力于通过更精准的感知变换和增益/响度校正,消除系统线性增益/声级差异对客观评价结果的干扰,提高客观评分与人类主观感知(MOS/可懂度)的一致性。

* **D2(US7526394B2)不适合作为最接近的对比文件:**

D2属于无参考信号(Non-intrusive)的数据包网络质量监测,其技术路线是基于VoIP传输层数据包参数预测MOS,完全不涉及参考信号处理、感知响度域转换及差值计算,与本专利的技术架构差异巨大。

#### 2. 区别技术特征与实际解决的技术问题

对比D1,权利要求1的区别技术特征在于**特征G和特征H**:

> **区别特征:** 在**感知响度域(Perceptual Loudness Domain)**中,**使用参考信号时间帧特性**,分别将输出信号的响度缩放成固定响度级,并将参考信号的响度缩放成与缩放后的输出信号响度级有关的响度级。

* **传统技术(如D1)的缺陷:** D1等经典PESQ算法通常在功率/声压域(Power/Level Domain)完成增益调整与补偿,随后一次性映射到Sone响度域。如果在功率域缩放,无法精准反映人耳听觉系统对不同频率/声强级下的非线性响度感知(如等响曲线随着声压级变化而改变的特性)。

* **本专利解决的技术问题:** 如何在感知响度域更准确地消除输出信号与参考信号之间的增益差异和级次波动,从而提高质量指标对人耳真实响度感知偏差的预测精度。

* **技术效果:** 通过在感知响度域(Sone域)直接利用参考信号的帧特性对两路信号进行二次响度缩放,能够直接针对人耳非线性感知后的“响度”进行归一化,避免了在功率域线性缩放后再转响度域带来的失真,使得导出的差值信号(Disturbance Density)更符合人耳主观评测结果。

---

### 五、 无效请求分析:最薄弱的技术特征与进一步检索策略

如果你拟对目标专利提出无效宣告请求(Invalidation Request),相关分析与策略如下:

#### 1. 最薄弱的技术特征分析

目标专利权利要求1中最薄弱、也是**最容易被突破的技术特征**是:

> **特征G和特征H中“在感知响度域中...进行响度缩放”这一实施节点。**

* **薄弱原因分析:**

1. **属于本领域的常规技术手段演进:** 在音频感知评价模型(如POLQA / ITU-T P.863、BS.1387 PEAQ等)的发展史中,从功率域(Power/Pitch Domain)补偿过渡到响度域(Loudness/Sone Domain)缩放与归一化,是本领域技术人员(PNIPA/POSITA)为了解决“等响曲线非线性”自然会想到的技术改进。

2. **D1已给出了极强的技术启示:** D1([p0005], [p0036]-[p0037])明确指出了“语音/音频质量测量应当在感知域(Perceptual Domain)中开展”,且已经公开了在Pitch Power域利用帧特性进行增益补偿(Block 28, 29)并最终相减(Block 34)。将补偿步骤从“转换为响度前”移动到“转换为响度后”,对于本领域技术人员而言,仅需要结合公知的听觉感知模型(如Zwicker模型)即可实现。

#### 2. 进一步对比文件检索策略(Search Strategy)

为了完全击毁权利要求1的创造性(或新颖性),针对区别特征G和H,建议采取以下针对性的检索策略:

1. **聚焦标准文献与后续演进标准(Standard Documents):**

* **重点目标:** **ITU-T Recommendation P.863 (POLQA)** 及其草案/讨论文稿(White Contributions)。

* **理由:** P.862 (PESQ) 是在功率域做部分补偿,而其下一代标准 P.863 (POLQA) 正是在感知响度域(Sone Domain)全面引入了复杂的响度缩放、标定(Loudness Scaling / Normalization)与级次调整。

* **检索关键词:** `POLQA`, `P.863`, `loudness scaling`, `loudness domain`, `Sone`, `scale loudness`, `reference frame`, `gain variation`.

2. **聚焦核心发明人/申请人的专利族与学术论文:**

* **重点目标:** 检查技术源头 Holland/OPTICOM/KPN/TNO 或发明人(如 *Beerends John Gerard* 等,D1的发明人也是他)。

* **理由:** 音频感知测量领域的专利高度集中于少数顶级专家(如Beerends等)。Beerends在2001-2010年间发表了大量关于PESQ向POLQA演进的专利(如D1的参考文献[6]-[11]中提到的Patent Application)。

* **检索式组合:**

* `(IN="Beerends") AND (loudness OR Sone) AND (scale OR scaling OR compensate) AND (reference OR output)`

* `CPC classification: G10L19/008 OR G10L25/69 OR H04M3/2227`

3. **结合公知常识(Common Knowledge)组合逻辑:**

* **无效组合公式:** **D1 (WO2009046949A1) + D3 (公开了在Sone/感知响度域进行信号增益/响度归一化缩放的对比文件) + 公知常识**。

* **论证逻辑:** D1已经公开了除“缩放发生阶段在感知响度域”之外的所有特征。D3教导了在音频评价中,在感知响度域直接缩放响度相较于在功率域缩放具有消除等响效应偏差的技术效果。本领域技术人员在D1的基础上引入D3的响度域缩放手段来优化D1的PESQ流程,是显而易见的,因此权利要求1不具备创造性。


未提交复审委

无效理由:专利法第二十二条

蒋 晓勇
@jxy

作为一名经验丰富的专利代理师,在进行专利无效宣告或复审评估时,**“说明书是权利要求的字典”**是首要的法律适用原则。

本案的目标专利权利要求1涉及一种用于评估音频系统输出信号感知质量的客观测量方法(属于PESQ或POLQA算法体系的技术领域)。其核心技术特征在于**在不同的处理阶段(声强级域/功率域 vs. 感知响度域)对参考信号和输出信号进行“多阶段、交叉结合的缩放(Scaling)与比对”**。

下面将紧密结合目标专利权利要求、说明书内在逻辑以及对比文件原文(包括出处、翻译和公开事实),为您进行全面、严谨的客观与实质公开分析、最接近对比文件甄选、无效薄弱特征剖析及后续检索策略制定。

---

### 一、 目标专利权利要求1的技术特征拆解与说明书含义解释

在解释权利要求前,需 clarify 本专利中涉及的两个重要域概念:

1. **声强级域/功率域(Power/Intensity Level Domain)**:信号转换为心理声学响度前的物理域信号表示(如声压级、功率谱密度或FFT能量密度)。

2. **感知响度域(Perceptual Loudness Domain)**:经过心理声学模型(如Zwicker模型、Bark频带转换)处理后的心理物理表示(单位为Sone或响度密度)。

特征编号权利要求1的技术特征拆解紧密结合说明书的深层技术含义解释
A一种用于关于参考信号确定质量指标的方法,所述质量指标代表音频系统的输出信号的感知质量基于客观模型预测人耳对经过音频系统(如Codecs、通信网络)劣化后的输出信号的感知质量评分(如MOS分)。
B其中处理和比较所述参考信号和所述输出信号输入系统的参考信号 $X(t)$ 与经过系统后的输出信号 $Y(t)$ 的双端比对架构。
C所述处理包括将所述参考信号和所述输出信号划分成相互对应的时间帧将连续的时间信号通过加窗(如Hanning窗)划分为按时间对齐的短时帧(帧长如30ms/32ms)。
D其中所述处理还包括将所述参考信号的强度缩放成固定声强级第一阶段预缩放:在功率/强度域将参考信号归一化到一个固定的标准物理声级(例如40dB SPL,对应校准标准)。
E对缩放的参考信号内的时间帧执行测量用于确定参考信号时间帧特性在固定声强下分析参考信号各帧的物理特性(如计算参考信号帧能量 $P_X$、局域噪声级 $K$ 或帧激活状态等)。
F将所述参考信号的强度从所述固定声强级缩放成与所述输出信号有关的声强级第一阶段再缩放:在功率/强度域将参考信号变回/调整为与当前实际输出信号相匹配的强度级别(或反之,反映系统的实际传输增益)。
G在感知响度域中将所述输出信号的响度缩放成固定响度级,输出信号响度缩放使用所述参考信号时间帧特性第二阶段输出缩放:信号映射至响度域(Sone)后,利用前面测得的参考信号帧特性(例如根据参考信号的局域噪声/功率阈值 $K$),将输出信号响度归一化/缩放。
H在所述感知响度域中将所述参考信号的响度从与所述输出信号有关的声强级对应的响度级缩放成与缩放的输出信号的响度级有关的响度级,参考信号响度缩放使用所述参考信号时间帧特性第二阶段参考缩放(核心):在感知响度域中,利用参考信号的时间帧特性(如 $LX(t) < K$),将参考信号自身的响度以快于正常趋于0的速度进行加速衰减缩放(Soft-Scaling),使其与已缩放的输出信号响度对齐。
I将所述参考信号和所述输出信号相减从而获得差值信号将响度域中调整后的参考信号与输出信号进行减法运算,得到未处理的或经掩蔽后的外乱/干扰密度(Disturbance Density $D(f)_n$)。
J从所述差值信号导出所述质量指标将外乱密度按时间/频域标准(如 $L_p$ 范数)集成分数,计算得出最终的感知质量指标(MOS值)。

---

### 二、 对比文件原文出处、对比表及公开性分析

下表附对比文件的公开号及原文明确公开(或实质公开)的技术特征比对:

* **对比文件D1**:`JP4263620B2`(日本发明专利,公开日:2009-05-13)

* **对比文件D2**:`DE602004010634T2`(德国专利,公开日:2006-07-04,族聚对应EP1434145)

#### 1. 详细特征比对表

权利要求1技术特征对比文件 D1 (JP4263620B2)对比文件 D2 (DE602004010634T2)
特征A (感知质量指标)完全公开 <br>出处:段落[0002]、[0003]<br>*原文*:“被試験システムの伝送品質を測定する方法及びシステム…”完全公开 <br>出处:Gebiet der Erfindung, Stand der Technik<br>*原文*:“...Verfahren und ein System zur Messung der Übermittlungs-Qualität eines sich im Test befindlichen Systems...”
特征B (处理与比较参考与输出信号)完全公开 <br>出处:段落[0002]、图1<br>*原文*:“入力信号と…出力信号とを処理して、互いに比較する方法…”完全公开 <br>出处:Detaillierte Beschreibung, Fig. 1<br>*原文*:“Eingangs-Signal X(t)... und Ausgangs-Signal Y(t)... verarbeitet und gegenseitig verglichen wird.”
特征C (划分为互相对应的时间帧)完全公开 <br>出处:段落[0010]、[0023]<br>*原文*:“好ましい単純且つ効果的な実施の形態は…(例えば30msの)フレームごとのパワーを取得し…”完全公开 <br>出处:Detaillierte Beschreibung (Abschnitt Kurzzeit FFT)<br>*原文*:“...Kurzzeit FFT mit Überlappung zwischen nachfolgenden Zeitfenstern (Rahmen) implementiert.”
特征D (缩放参考信号强度至固定声强级)完全公开 <br>出处:段落[0020]、[0021]<br>*原文*:“1000Hz及び40dB SPLの校正音を用いて…パワー・スケーリング係数Spである定数を右から乗ずることにより実行される。”完全公开 <br>出处:Detaillierte Beschreibung (Abschnitt Die Leistungs- und Lautstärken-Skalierungs-Faktoren)<br>*原文*:“Fliegende Tonhöhen-Konstanten... in der Lautstärken-Berechnung nur für die Kalibration des Systems verwendet werden.”
特征E (确定参考信号时间帧特性)完全公开 <br>出处:段落[0011]、[0023]、[0033]<br>*原文*:“入力信号の局所ノイズ・レベルに依存するスケーリング係数…時間フレームごとの低レベルのノイズのパワー条件を表し…”完全公开 <br>出处:Darstellung der Erfindung, Detaillierte Beschreibung<br>*原文*:“...Schätzung bezüglich des lokalen temporären Skalierungs-Faktors... Tonhöhen-Leistungs-Dichte des Eingangs-Signals...”
特征F (参考信号强度缩放成与输出信号有关的声強级)完全公开 <br>出处:段落[0004]、[0025]<br>*原文*:“パワー・ドメインにおいて参照入力信号と適合するよう、劣化出力信号が局所的にスケーリングされる…”完全公开 <br>出处:Detaillierte Beschreibung (Abschnitt Kompensation der verzerrten Tonhöhen-Leistungsdichte)<br>*原文*:“Das Verhältnis der Leistung in der ursprünglichen und den herabgesetzten Dateien wird berechnet...”
特征G (感知响度域中缩放输出信号响度至固定响度级)部分/实质公开 (差异点项1) <br>出处:段落[0021]、[0032]<br>*说明*:D1在响度域映射时使用了固定校准(40dB对应1 Sone),但在响度域主要缩放的是参考信号 $H(t,f)$。部分/实质公开 <br>出处:Detaillierte Beschreibung<br>*说明*:D2在功率谱密度域(Pitch Power Density)进行多轮迭代交替缩放,未明确将输出信号在“感知响度域”利用参考帧特性缩放到固定响度级。
特征H (感知响度域中缩放参考信号响度)完全公开 <br>出处:段落[0011]、[0032]、[0033]<br>*原文*:“入力ラウドネス信号のスケーリングの後に、内部表現のラウドネス・ドメインにおける差の計算が実行される… $H(t,f) = LX(f)_n^b / K^{b-1}$ ($LX < K$时)”未完全公开 (差异点项2) <br>出处:Darstellung der Erfindung<br>*说明*:D2采用的是功率域的迭代滤波与增益补偿(Iterative loop),并非在“感知响度域”直接对参考信号响度实施基于低电平噪声阈值的加速衰减公式。
特征I (参考信号与输出信号相减得差值信号)完全公开 <br>出处:段落[0014]、[0032]<br>*原文*:“内部表現の差を利用することにより… $D(f)_n = \LY(f)_n - H(t,f)\
特征J (从差值信号导出质量指标)完全公开 <br>出处:段落[0029]、[0030]<br>*原文*:“最終的なPESQスコアは、平均外乱値と平均非対称外乱値との線形結合である。”完全公开 <br>出处:Detaillierte Beschreibung (Abschnitt Berechnung der PESQ-Wertzahl)<br>*原文*:“Die endgültige PESQ-Wertzahl ist eine lineare Kombination des durchschnittlichen Störungswertes...”

---

### 三、 创造性分析:最接近对比文件的甄选

从整体解决的技术问题和达到的技术效果来看:

#### 1. 目标专利要解决的核心技术问题与技术效果

* **技术问题**:传统PESQ算法(如ITU-T P.862)在处理参考信号中存在微弱局域背景噪声或局域增益剧烈波动时,由于“硬阈值”或简单的功率补偿,导致客观评测分数与人耳实际主观听感(MOS)相差较大、相关性低的问题。

* **技术效果**:通过在“感知响度域”引入基于参考信号帧特性的“软缩放(Soft-Scaling)”(即当参考信号低于设定噪声阈值 $K$ 时,使其响度以幂函数 $b > 1$ 加速趋近于0),模拟了人耳在没有原声对比下忽略微弱背景噪声的心理声学机制,从而极大提高了客观质量指标与主观听感评分的一致性。

#### 2. 对比文件评估与最接近对比文件(Primary Reference)确定

* **D1 (`JP4263620B2`) —— 最适合作为“第一最接近对比文件”**

* **技术领域**:完全一致(基于PESQ的音频质量测量方法)。

* **解决的问题**:完全一致(明确指出P.862在参考信号存在低电平噪声或功率波动时,客观得分与主观评分相差大的缺陷,见段落`[0003]`)。

* **技术手段与架构**:高度重合。D1明确提出了**“第二软缩放子算法(Second Soft-Scale Process)”**,其核心即为:在**内部表现的响度域(Loudness Domain)**,依据参考信号时间帧的低电平噪声特性 $K$,将参考信号的响度 $LX(f)_n$ 进行调整(定义新参考信号 $H(t,f) = LX(f)_n^b / K^{b-1}$),进而求取响度差值 $D(f)_n = |LY(f)_n - H(t,f)|$(见段落`[0011]`、`[0032]`、`[0033]`)。

* **结论**:D1构成了最贴切的起点,公开了目标专利权利要求1绝大部分的核心步骤(特征A-F、H-J)。

* **D2 (`DE602004010634T2`) —— 可作为“辅助/第二最接近对比文件”**

* **技术领域**:完全一致(PESQ改善模型)。

* **解决的问题**:解决系统频率响应偏差大及局域功率差异导致的评测不准问题。

* **技术手段**:D2侧重于在**功率谱域(Pitch Power Density Domain)**采用“频域补偿”与“局域功率缩放”的**迭代循环(Iterative Loop)**(见`Darstellung der Erfindung`),未将缩放的重点放在“感知响度域内针对参考信号响度的加速衰减缩放”上。

---

### 四、 无效宣告中最薄弱的技术特征与突破点剖析

若针对权利要求1发起无效宣告请求,综合比对可知:

#### 1. 目标专利相对于D1可能主张的“微小差异”(即最薄弱的技术特征):

在引入D1作为最接近对比文件后,专利权人唯一可能争辩的防线(即**最薄弱的技术特征**)在于**技术特征G与特征H的搭配细节**:

* **特征G的细节**:“在感知响度域中将**输出信号的响度缩放成固定响度级**,输出信号响度缩放使用所述参考信号时间帧特性”。

* **争辩点分析**:D1段落`[0032]`中直接把软缩放算式作用在参考信号响度 $LX$ 上(变为 $H(t,f)$),而对输出信号 $LY$ 保持原响度密度。目标专利在此处将“输出信号响度”与“参考信号响度”在感知响度域中进行了**双向/对偶的协同缩放(即输出信号缩放到固定响度级,参考信号再缩放到与缩放后的输出信号相关的响度级)**。

#### 2. 该薄弱特征的无效击穿路径(创造性攻破策略):

1. **公知常识/算法等效演变**:在心理声学测量中,对比两个信号($X$与$Y$)的相对响度差时,将“调整参考信号以匹配输出信号”与“先将输出信号归一化到固定标称响度,再按比例缩放参考信号”,在数学演算和信号处理效果上属于**等效的代数变换或常规测量归一化手段**。

2. **D1本身的启示**:D1段落`[0004]`和`[0010]`明确指出,软缩放(Soft-scaling)既可以作用于输出信号,也可以作用于输入信号(“...output signal and/or input signal is scaled...”)。这为本领域技术人员将响度域缩放同时或选择性地应用于输出信号和参考信号提供了明确的技术启示。

---

### 五、 进一步的对比文件检索策略(Search Strategy)

为了实现对权利要求1及后续从属权利要求的“绝对击穿”(形成完美102新颖性或基于103极强组合),建议采取以下针对性检索策略:

#### 1. 检索要素提取与表达(Keywords & CPC/IPC Classifications)

* **核心分类号(IPC/CPC)**:

* `G10L 19/008` / `G10L 19/012`(音频信号感知质量评估)

* `H04M 3/22` / `H04M 11/00`(通信网路传输质量测试)

* `G10L 25/69`(针对特殊目的的语音信号评估/质量测量)

* **关键词组合 (Key Concepts)**:

* **概念1(主题)**:`PESQ` OR `POLQA` OR `Perceptual Quality` OR `Audio Assessment` OR `MOS`

* **概念2(响度域)**:`Loudness Domain` OR `Sone` OR `Bark Scale` OR `Psychoacoustic`

* **概念3(缩放/增益调整)**:`Soft Scaling` OR `Loudness Scaling` OR `Noise Floor` OR `Reference Signal` OR `Gain Compensation`

#### 2. 精确检索方向(Targeted Search Directions)

1. **追溯同一发明团队/机构的专利族与学术论文**:

* D1与D2的作者(如 **John Beerends**, **Antony Rix**,申请人如 **Koninklijke KPN N.V.** 或 **BT Group**)是PESQ/POLQA标准的主导者。目标专利极有可能是该团队针对POLQA(ITU-T P.863)标准研制过程中的改进专利。

* **行动**:重点检索 John Beerends 在 2002年—2010年 期间发表于 *J. Audio Eng. Soc. (JAES)* 及 *AES Conventions* 的学术论文,以及 KPN 公司的后续欧洲专利(EP)、PCT申请。论文中常包含比专利更详尽的公式推导(如同时对 $LX$ 与 $LY$ 进行响度域归一化的步骤)。

2. **ITU-T 标准化草案文件(Standard Contributions)**:

* ITU-T Study Group 12 (SG12) 负责 P.862 (PESQ) 和 P.863 (POLQA) 标准的制定。

* **行动**:检索 2006 年至 2011 年间 ITU-T SG12 数据库中的 Working Papers / Contributions。标准提案文献中通常会毫无保留地公开包含“在感知响度域中双向缩放参考信号与输出信号”的具体算法流程图及C代码片段。


权利要求2

根据权利要求1所述的方法,其中所述音频系统是语音处理设备。


权利要求3

根据权利要求1所述的方法,其中将所述参考信号的强度从所述固定声强级缩放成与所述输出信号有关的声强级是基于所述参考信号与缩放因子相乘;所述缩放因子通过以下来定义为多个时间帧确定平均参考信号声强级;为与所述参考信号的用来确定所述平均参考信号声强级的时间帧对应的多个时间帧确定平均输出信号声强级;通过基于所述平均参考信号声强级 and 所述平均输出信号声强级确定分数来导出预备缩放因子;如果所述预备缩放因子小于阈值,则通过将所述缩放因子定义成等于所述预备缩放因子、否则等于用附加的依赖于预备缩放因子的值递增的所述预备缩放因子来确定缩放因子。


权利要求4

根据任一前述权利要求所述的方法,其中所述方法在输出电平到固定响度级的响度缩放之前还包括针对所述参考信号的具有比所述输出信号的响度级高的响度级的部分将所述参考信号的响度级局部缩放成所述输出信号的响度级;并且随后针对所述输出信号的具有比所述参考信号的响度级高的响度级的部分将所述输出信号的响度级局部缩放成所述参考信号的响度级。


权利要求5

根据权利要求1-3中任一项所述的方法,其中所述处理还包括将所述缩放的参考信号 and 所述输出信号从时域变换到时间-频率域;根据所述参考信号导出参考音调功率密度函数,并且根据所述输出信号导出输出音调功率密度函数,声强级差对应于所述音调功率密度函数的声强级之间的差;局部缩放所述参考音调功率密度函数以获得局部缩放的参考音调功率密度函数;关于频率部分地补偿局部缩放的参考音调功率密度函数;导出参考响度密度函数 and 输出响度密度函数,响度级差对应于所述响度密度函数的响度级之间的差;其中所述响度密度函数代表实现量化可变电平回放对感知质量的影响的密度函数。


权利要求6

根据权利要求5所述的方法,其中所述方法还包括对所述参考音调功率密度函数 and 所述输出音调功率密度函数中的至少一个执行激励操作。


权利要求7

根据权利要求4所述的方法,其中关于频率补偿所述局部缩放的参考音调功率密度函数 and 补偿所述局部缩放的参考响度密度函数中的至少一个包括基于所述参考信号时间帧特性来估计所述音频系统的线性频率响应。


权利要求8

根据权利要求1-3中任一项所述的方法,其中在缩放成与所述感知响度域中的所述输出信号的响度级有关的响度级之前对所述感知响度域中的所述参考信号执行用于将噪声抑制直至预定噪声电平的噪声抑制动作。


权利要求9

根据权利要求1-3中任一项所述的方法,其中在缩放成固定响度级之前对所述感知响度域中的所述输出信号执行用于将噪声抑制直至代表干扰的噪声电平的噪声抑制算法。


权利要求10

根据权利要求1-3中任一项所述的方法,其中在比较之前对所述感知响度域中的所述参考信号 and 所述输出信号执行全局噪声抑制。


Powered by Django

网站备案号:渝ICP备2023012882号


重庆市非显而易见网络科技有限责任公司 A Anti NPE NPE