英文题目:Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation
标签:#音乐源分离 | #生成模型 | #理论分析 | #基准测试
评分:8.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
👥 作者与机构
- Maxime Baelde:organization=Independent researcher, city=Lille, country=France
📌 核心摘要
论文刻画单通道时频实增益掩蔽的正交投影上限,并用一个高斯混合后验均值估计器研究先验、读出与相位对称性:长窗留出设置下估计器距实测类上界 11.44 dB,校准分析中的约 70% 是分贝缺口之比,不是全部缺口或误差能量都由后验方差解释,更不是所有生成分离器的性能上限。
🔗 开源与复现资源
代码相关资源:https://github.com/mbaelde/masking-ceiling — 暂时无法访问
代码相关资源:https://github.com/mbaelde/generative-audio-source-models — 暂时无法访问
第三方资源:https://github.com/mbaelde/masking-ceiling — 暂时无法访问
第三方资源:https://github.com/mbaelde/generative-audio-source-models — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入什么、改变什么、保留什么、输出什么?
输入是单通道混合波形,经短时傅里叶变换得到每帧每频点的混合复数值。想改变的是其中一个声源的估计,例如把人声从伴奏中分离出来。必须保留的是评价方式:估计与真源之间的平方误差,对应时域信号失真比。输出是每个时频点的复数值估计。 领域常用做法是只估计一个实数增益,再乘回混合并沿用混合相位。
若增益限制为非负,就是幅度加混合相位的参数化;只有再把增益约束在 [0,1] 才进入有界掩蔽子类。这覆盖了维纳滤波、理想比值掩蔽、理想二值掩蔽以及大量掩蔽网络。本文不比较网络结构,先把这种格式本身能达到的最好点算清楚,再问离开它需要付出什么、能否换来收益。
已有天花板为什么没有管住整个格式?
理想比值掩蔽和预言维纳滤波是常用的参照。它们都是格式内的普通成员,而不是格式的最优点。原文回顾了相位敏感掩蔽的工作,其约束最优解已经写出,但当时是作为训练目标研究,没有连接到声源先验的假设,也没有说明成员资格取决于什么。 另一条线是复掩蔽、广义线性滤波和多帧维纳滤波。它们把每点算子从标量放宽到相似变换、任意实矩阵或跨帧矩阵,常常从观测的 2 阶统计直接规定算子。
生成式路线则从先验出发,例如在每个声源上拟合高斯混合并取后验均值,但经典做法采用零均值、圆形、分频点独立的相位不变先验,恰好把相位建模留空。 本文的位置是把三者连起来:先给出整个实增益类的精确天花板,再给出 4 个嵌套算子类与先验 3 个假设的一一对应,最后用一个可证明离开最小类的闭式估计量实测离开是否值得。部署系统的归属也要按定义区分:幅度加混合相位输出说明的是非负实增益,不必小于等于 1,只有额外约束在 [0,1] 才是有界子类。
时域系统则本来就在类外,天花板对它们没有约束力。
一个频点上的几何约束是什么?
固定一个频点,把混合值与声源值看成平面上的两个向量。实增益只能输出混合所在直线上的点,与估计器有多大无关。最好的点是声源向该直线的正交投影,残差是与混合正交的分量,长度由两者夹角决定。 该最优增益与最小残差有闭式解。
\[m^{\star}=\frac{\Re\!\left(s\,\overline{x}\right)}{|x|^{2}},\qquad\min_{m\in\mathbb{R}}|s-mx|^{2}=|s|^{2}\sin^{2}\theta.\]把所有频点与帧加起来,天花板变成能量加权的平均,只与夹角有关。
\[\mathrm{SDR}^{\star}=-10\log_{10}\frac{\sum_{t,f}|s|^{2}\sin^{2}\theta}{\sum_{t,f}|s|^{2}},\]这意味着残差是数据自带的,不是训练量、参数量或算力可以移动的。它对判别式与生成式系统同样适用,只要最后一步是实数乘混合。
实增益掩蔽 × 复掩蔽: 实增益掩蔽负责把估计限制在混合向量张成的直线上,只估计一个实数增益;复掩蔽负责在同一频点上再允许一个公共相位旋转。两者搭配的原因是逐帧重算时只差这一个相位参数就能实现完美重构,组合后多解决的是正交残差能否被消除的问题,而固定算子下这一步几乎不带来增益。
有界与非负掩蔽各付出多少?多声源划分免费吗?
最优实增益既可能大于一,也可能为负。前者出现在两声源部分抵消的频点,后者出现在源与混合夹角超过直角的频点。把增益限制到区间上,约束最优就是把无约束最优裁剪到区间端点,额外误差是裁剪距离的平方乘混合能量。
\[\min_{m\in I}|s-mx|^{2}=|s|^{2}\sin^{2}\theta+|x|^{2}\left(m^{\star}-m^{\star}_{I}\right)^{2}.\]在本文材料上,有界掩蔽相对无约束实掩蔽损失人声 1.25 dB 与伴奏 1.26 dB,短窗下损失更大。理想比值掩蔽应与它所属的有界类天花板比较,而不是直接与最宽类的天花板比较。 多声源同时用实掩蔽估计时,无约束最优自动满足增益之和为一,因为混合恒等于各源之和。
\[\sum_{i=1}^{J}m^{\star}_{i}=1,\qquad\min_{m_{i}\in\mathbb{R}}|s_{i}-m_{i}x|^{2}=|s_{i}|^{2}\sin^{2}\theta_{i},\]但把每个增益再限制到区间后,划分性质一般不再自动成立。两源有界情形仍能互相补偿,非负情形在两源时已破坏划分,有界情形在三源时也会破坏。这解释了多源网络在输出层同时要划分与限幅时会面临的取舍。
四个算子类如何从输出反查到先验假设?
把堆叠实虚部的谱向量看成实向量,实线性映射就是实矩阵,按频点分块。最小类是每块为标量乘单位阵的实掩蔽;放宽为直接相似块得到复掩蔽;放宽为任意 2 乘 2 块得到分频点广义线性;再放开非对角块得到跨频耦合的全矩阵。
包含关系严格递增,每频点实参数数分别为一、二、四与 4 倍频点数。 判别位置不需要看估计值,只看拟合算子把单位圆变成什么:同心圆且方向不动是实掩蔽,同心圆加公共旋转是复掩蔽,椭圆是广义线性,椭圆轴随其他频点内容变化是耦合类。平移出原点则对应仿射变体。 关键对应是:非零均值对应仿射偏移,非圆性对应块偏离标量、全协方差对应非对角耦合。恢复零均值、圆形、分频独立 3 个假设,估计量就退回实掩蔽并与高斯分离文献中的维纳滤波一致。
因此链条走到哪里由先验能放弃什么决定,而不是由输出设计决定。
先验长什么样?后验均值如何一步步算出?
每个声源在堆叠实虚谱上携带高斯混合先验,分量均值不为零,协方差不强制圆形结构,也不强制分频独立。拟合用期望最大化在孤立声源材料上分声源独立完成。对角协方差保留实虚增益不同,已进入广义线性类;全协方差才进入耦合类,但参数量随维度平方增长,对数据量提出直接要求。 两独立源相加后,混合分布仍是高斯混合,权重相乘、均值与协方差相加。
对观测取条件,后验仍是混合形式,每对分量贡献一个维纳修正均值与一个与观测无关的成对条件后验协方差,权重是该分量对的责任。估计量是这些成对维纳估计按责任加权平均,因此对观测有双重依赖:估计本身与权重都随观测变化。 具体执行时,每对分量的增益矩阵只与分量有关,与帧无关,可 1 次性做乔列斯基分解再应用于整块帧。复杂度是分量对数乘维度立方的 1 次性开销加每帧 2 次开销。原文明确说明该估计量在运行速度上不占优,所有结论只谈精度。
非圆性 × 广义线性估计: 非圆性负责描述复分布实部与虚部统计不对称,协方差不再是标量块;广义线性估计负责把每频点算子从标量放宽到任意实 2 乘 2 矩阵。搭配的原因是前者是后者的先验来源,组合后多解决的是方向相关的旋转与拉伸,而不再只是整体缩放。
为什么算子在宽类、输出仍可能落回直线上?
估计量是观测加权的仿射宽线性算子凸组合,形式上在最大类中。但平方误差准则会把它往直线上拉。先看允许增益随观测变化但始终不出直线的自适应实掩蔽集合,它是平方可积空间的闭子空间,其投影增益是预言增益对观测的条件均值,残差等于天花板残差加预言增益的后验方差。
若给定混合后,源幅度与相位差的联合条件分布关于相位差镜像对称,奇部 1 阶矩相消,条件均值恰好落回混合直线上,增益等于预言增益的后验均值,超额误差等于该增益的后验方差。该结论不需要参数化相位模型,对任意耦合先验成立。零均值、圆形、分频独立的先验必然给出这种对称,但反之不然:非圆先验仍可能给出对称相位后验,此时算子在宽类而输出仍在直线上。
这就区分了两个问题:算子结构由先验决定,输出位置由准则与对称性决定,天花板只对后者敏感。最大后验点或 1 次后验采样没有理由落在线上,应当明显离线但平方误差更大。
后验均值 × 对称相位后验: 后验均值负责在平方误差下给出条件期望读出;对称相位后验负责描述给定混合后源相位关于混合方向镜像对称。搭配的原因是对称会杀死正交方向的 1 阶矩,组合后多解决的是算子虽在宽类、输出却落回直线的原因,并把多余误差识别为预言增益的后验方差。
没有神经网络训练时,什么被拟合、什么被冻结?
本工作没有可微网络的梯度训练阶段。需要拟合的是每个声源高斯混合的权重、均值与协方差,用期望最大化迭代 30 次完成,协方差设下限,随机种子固定。拟合完成后所有分量参数冻结,测试时不再更新。 测试阶段的计算是确定性闭式推理:对每 1 帧计算各分量对的高斯似然得到责任,再计算各对的维纳均值并加权平均,第二声源用混合减第一估计得到。跟着 1 帧走一遍就是似然、责任、成对估计、加权 4 步,没有跨帧状态,也没有测试时重置问题。
固定算子 × 逐帧自适应: 固定算子负责用同一矩阵处理一整段的所有帧,只能利用跨帧统计量;逐帧自适应负责允许增益随当前观测改变,保留实例级相位信息。搭配比较的原因是两者给出两种天花板读法,组合后多解决的是相位到底值多少钱:在逐帧口径下它解释全部残差,在固定口径下它对不相关声源几乎一文不值。
远离拟合支撑时的行为可分解为回归项与责任项。前者每对分量在其自身协方差诱导的度量下不扩张,风险有限;后者是 2 次型柔性最大值的划分,跨过 2 次曲面边界会切换主导分量对。由此得到可证伪预测:沿连续谱变形,误差在责任稳定时缓慢移动,在主导分量切换处跳变。若实测是光滑曲线无跳变,则该分析被反驳。
数据、划分、指标与天花板如何搬运到时域?
实验用完整 MUSDB18,一百首训练、五十首测试,任务是人声对伴奏分离。立体声取平均成单声道,保持原生采样率。先验在训练曲解码后的帧池中随机抽取拟合,设两万与十五万两档帧数上限。评测使用抽取的 30 s 片段,而不是全部 50 首测试曲的完整曲目。长窗支撑内用 10 首训练曲拟合并在同 10 首评测。
长窗留出在 100 首训练曲上拟合、抽 10 首测试曲,剔除一条静音声源片段后保留 9 条。短窗配置用 5 条片段,协方差结构交叉在同一评测机制内配对。长窗每片段 2582 帧。 指标是去头尾 1 帧后的时域信号失真比,不用尺度不变版本,因为天花板本来就是关于增益尺度的陈述。能量比超过 60 分贝的一条无声干声摘录被整体剔除,留出表因此是 9 条而非 10 条。
合并统计用分贝平均,使人声与伴奏等权,而不是让能量大的伴奏主导。 谱域天花板搬到时域需要处理非一致谱问题。分析与综合构成无痛框架,投影丢弃非一致分量而不影响综合结果。综合算子不是压缩映射,排序靠数值验证:在 100 帧以上摘录中未出现反转,短摘录的反转是边缘效应并已裁掉。窗函数固定为周期汉恩,换窗会移动估计量约 1.8 分贝而几乎不移动预言量,因此不得跨窗比较。
类天花板在该语料上是多少?固定算子能走多远?
先回答比较问题:同一批摘录、同一重建流程下,最宽实掩蔽类、其非负与有界子类各留多少上限?下表把预言链放在同一时域口径下,回答限幅输出层在学习开始前已让出多少。
| 口径 | 实掩蔽上界(dB) | 非负上界(dB) | 有界上界(dB) | 人声限幅损失 | 伴奏限幅损失 |
|---|---|---|---|---|---|
| 长窗 9 段,实测时域 | 16.62 dB | 15.98 | 15.37 dB | 1.25 dB | 1.26 dB |
| 长窗 9 段,解析谱域 | 15.49 dB | 15.02 | 14.59 dB | 未单列 | 未单列 |
| 5 段子集的短窗对照 | 下降 2.43 dB | 未单列 | 限幅损失 1.65 dB | 1.65 dB | 1.65 dB |
表后解释分 3 层。最公平的净信息是长窗下限幅分别拿走人声 1.25 dB 与伴奏 1.26 dB,部署系统的差距不在这里。
失败项是理想比值掩蔽:它在同材料上约 13.68 分贝,低于其所属有界类天花板约 1.69 分贝,说明常用参照本身离类最优还有距离。不能推出的是跨窗比较:原文在同一 5 段子集比较时报告 2.43 dB 下降;不能把这个受控比较与长窗 9 段 16.62 dB、短窗另一组 5 段 14.83 dB 直接混减,不同评测集合的值须分开陈述。 再问固定算子放宽线性类能换多少?下表把 4 个投影残差与逐帧天花板并列,条件是每摘录单独拟合固定算子并在同时域口径下评测。
| 配置 | 固定实掩蔽 | 固定复掩蔽 | 固定广义线性 | 固定耦合校正后 | 逐帧天花板 |
|---|---|---|---|---|---|
| 长窗 9 条 | 7.22 | 7.22 | 7.24 | 9.92 | 16.62 |
| 长窗 5 条 | 7.95 | 7.95 | 7.97 | 10.35 | 17.27 |
| 短窗 5 条 | 7.08 | 7.08 | 7.10 | 8.24 | 14.83 |
净收益是只有耦合一步值得一提,短窗约 1.14 分贝,长窗校正后约 2.68 分贝,而复掩蔽与非圆性两步合计只有很小的分贝增益。反例恰是理论预测:不相关声源下正交相关量为零,固定复掩蔽相对实掩蔽几乎不动。不能推出的是放宽线性类可替代自适应:最宽固定类仍比逐帧最小类低约 6.7 分贝,自适应比加宽更重要,这也是后验先验路线而非更宽滤波器的理由。
拟合估计量离逐帧天花板多远?加分量与加数据能补吗?
比较问题是同一摘录配对下,后验均值比逐帧天花板低多少,以及分量数与数据量各能收窄多少。条件是对角协方差、两档帧数、三档分量数,缺口定义为同摘录天花板减估计量自身分贝数。
| 配置 | 小数据 K8 缺口(dB) | 小数据 K32 缺口(dB) | 大数据 K8 缺口(dB) | 大数据 K32 缺口(dB) | 变化判断 |
|---|---|---|---|---|---|
| 支撑内 10 条 | 10.89 | 9.99 | 10.84 | 9.84 | 分量更多时略降 |
| 留出 9 条 | 12.01 | 11.46 | 11.84 | 11.44 | 仍远低于同片段上界 |
| 短窗留出 5 条 | 9.82 | 9.81 | 9.63 | 9.83 | 并非单调改善 |
净收益很小:支撑内分量翻两番约降 1 分贝,留出仅约 0.4 分贝,按此斜率补 11 分贝需要五十多次翻倍。
数据乘 7.5 倍只移动 0.02 至 0.19 分贝,最大分量留出档几乎不动。失败项是短窗无序:分量增加不再单调,说明在该口径下计数分量不是答案。不能推出的是该缺口代表类已穷尽:估计量比理想比值掩蔽还低约 8.5 分贝,其中 8.50 dB 相对于 11.44 dB 这一部分原则上可由更好的实增益预测器追回,而不必离开混合直线,当前瓶颈是先验而非几何。 见证量支持方差解释:容量增加使相位旋转略增而超单位增益占比下降,数据增加则使离线见证量成倍缩小而缺口几乎不动。
更好的拟合是更紧的后验,均值更贴近直线,剩余误差正是方差本身。
全协方差带来耦合后,离线是否换来收益?
比较问题是只换协方差结构、其余拟合条件相同时,耦合类相对对角类能赚多少,以及泛化差距归于结构还是归于评测机制。条件是短窗、150000 帧上限、同批拟合曲、同摘录同预言配对。
| 分量数 | 支撑内全协方差 | 支撑内对角 | 留出全协方差 | 留出对角 | 泛化差距全/对角 |
|---|---|---|---|---|---|
| 8 | 8.53 | 9.22 | 9.54 | 9.63 | 1.01/0.41 |
| 16 | 8.01 | 8.59 | 9.38 | 9.85 | 1.37/1.26 |
| 32 | 7.64 | 8.15 | 9.55 | 9.83 | 1.91/1.68 |
净收益是全协方差恒优但不足 1 分贝,支撑内约半分贝,留出更小且随分量无趋势。失败项是记忆化:泛化差距随分量增长,两结构皆然,全协方差附加费约零点几分贝,原因是每个分量协方差参数远超可用帧数。
不能推出的是耦合无用:全协方差下,中位相位旋转的片段平均为 3.6–4.4 度,对角协方差为 0.33–0.52 度;模增益大于 1 的活跃频点占比为 3.4–4.4%,对角协方差为 0.2–0.8%,自由度确实被使用了,只是准则没有把它变成收益。
帧间耦合 × 频率间耦合: 帧间耦合负责让 1 帧估计借助相邻帧,沿时间轴利用相关性;频率间耦合负责让一频点估计借助其他频点,沿频率轴利用谐波共起落。搭配区分的原因是本文先验只放松后者,组合后多解决的是宽类中到底哪一步在固定算子下仍有约 1 至 2 分贝可挖,而前者留给多帧滤波路线。
另需记录 1 次支撑内插值式穿越:小规模试探中全协方差在参数多于帧数时可高出天花板约 1.5 分贝。这不威胁精确天花板,恰说明拟合复现了评测摘录的相位。本文主交叉的十二格与 60 个逐摘录数字均无穿越,参数计数解释了为何此处不复现。
换读出与校准门如何验证方差解释?
比较问题是固定已拟合后验、只换读出时,离线程度与平方误差是否同向变化。条件是支撑内 10 条、同天花板、不重训练,对比后验均值、硬指派与 1 次后验采样。硬指派取责任最大的分量对的均值,并非整个混合后验的全局 MAP 点,二者不可混称。
| 读出 | K8 缺口(dB) | K32 缺口(dB) | 中位相位旋转(度) | 超单位增益占比(%) | 负增益占比(%) |
|---|---|---|---|---|---|
| 后验均值 | 10.84 | 9.84 | 0.3–0.6 | 0.8–1.0 | 0.8–1.0 |
| 硬指派 | 10.87 | 9.90 | 0.4–0.7 | 2.2–3.3 | 2.2–3.3 |
| 1 次采样 | 12.38 | 11.50 | 24–26 | 27–28 | 20–21 |
净信息是采样明显离线但稳定变差约 1.6 分贝,且差值几乎不随分量变化,符合组内方差主导的预期。
失败项是硬指派几乎无用:它与均值差约 0.06 分贝,说明逐帧责任已近退化,缺口不在分量归属不确定性,而在分量内部方差。不能推出的是采样无价值:它暴露了均值平均掉的方差,只是平方误差准则下不应为此付费。 校准门比较同 10 条支撑内片段的大数据配置,不重新训练:K=8、16、32 的实测谱缺口为 9.87、9.42、8.93 dB,预测方差对应 6.87、6.71、6.37 dB。作者称约 70%,指预测与实测的分贝缺口之比,不是误差能量比例;K=8 按误差能量换算的报告值为 44.3%。
实测/预测误差能量比的逐片段中位数为 2.12、1.95、1.84,组内项分别占预测方差 97.7%、96.8%、96.1%。K=32 的 2.56 dB 差距只约束对当前拟合进行校准可回收的部分,不约束其他先验。 时域缺口高于谱域 0.91–0.97 dB;作者归因于重建合成,但没有单独实验分解两项贡献。
先验诊断与域外定位说了什么、没说什么?
先验诊断在孤立源谱上直接检验 3 个假设。非圆系数在模型划分内仅比噪声基线高约 2 至 3 倍,是最弱的一环,恰好决定后验均值能否离线,中位旋转不足一度是它在输出侧的镜像。尾部是最大违背:峰度远高于复高斯的二,希尔指数低于高斯基线,说明分量被模值尾部占用,几何分量被挤占。相邻频点经秩高斯化后的平方相关减相关平方仍为正,说明剩余依赖逃出任何高斯连接函数,指向共享尺度机制。 域外定位沿谱倾斜连续变形检验责任项预测。
36 条路径共 209 次主导分量切换,切换处中位绝对步长约 1.00 分贝,非切换处约 0.03 分贝,比值约 30 倍,最大切换步达 8.5 分贝。非切换步以上升居多但多为很小的分贝漂移,不是单调爬升;209 次切换中 46 次影响小于非切换步的 95 分位数,其最大责任中位约 0.85,说明柔和边界下切换代价小,与责任差加权的界一致。 限度有三。其一,谱到时域搬运是数值验证的不等式,短缺的真实性只到其松弛为止。
其二,两窗长天花板用不同摘录集,是各自陈述而非比较。其三,部分里程碑数字是合并均值之差而非逐摘录配对差,只表水平不表显著性。
复现应先核对哪一步、最易误读哪里?
先复现预言链:用真源算逐点最优实增益、裁剪到非负与有界的残差,再经同一重建流程得到时域天花板。确认理想比值掩蔽与预言维纳滤波落在有界子类内且低于类最优,再确认固定算子级联中复掩蔽一步几乎为零。只有这条基线站稳,后续缺口数字才有意义。 再拟合小规模对角模型:长窗、少量分量、两档数据量,核对缺口随分量缓慢下降、随数据几乎不动,以及见证量随拟合改善向直线收缩。
若你的实现中见证量随拟合变好反而远离直线,应先查协方差条件数与责任数值稳定性,而不是宣布发现了更强的离线机制。 常见误读有三。把支撑内试探的高分当成超越天花板,实为参数多于帧数的插值。把合并均值之差当成配对显著性,原文只有部分表格是逐摘录配对。把重采样或生成采样的听感改善当成推翻方差解释,原文冲突只针对平方误差最优是条件均值的情形,换准则即换问题。
什么条件下值得试、什么应先补?
值得试的情形是仍用掩蔽格式但想知道投入产出比:若目标是逼近类天花板,应先改进实增益预测,而不是急于引入复数或宽线性自由度;若已接近理想比值掩蔽,才轮到相位不对称性与准则的冲突成为瓶颈。精确后验可直接用作采样器的解析参照:均值、每对分量上与观测无关的条件后验协方差与逐点对数密度都能无蒙特卡洛误差评分,这是独立于分离分数的可用资产。
完整混合后验的总体协方差因责任随观测变化,通常仍随观测变化,不能把成对条件协方差的常量性质推广到整体。 应补的验证按回报排序,但都属待检验推断而非已证结论。重尾分量能否只收紧过度自信区间、带状协方差能否保留邻频耦合又把参数量压到可支撑范围、跨帧先验能否直接减小组内方差,原文都没有实测或一般性证明,不能据此承诺新先验的结果。
其中跨帧方向是校准门留出杠杆最大的候选,因为当前预测方差几乎全在组内,而组内方差本身的大小取决于先验是否更锐。 最终判断是机制性的而非排名性的:在平方误差下,离开直线需要相位后验不对称,而本文材料在所测分辨率下不对称性很弱;作者推断更锐先验可能降低缺口水平,但斜率是否不变、重尾是否只改变校准而未实测,尚待检验;换准则或换任务才可能改变冲突本身。
📎 论文与评分元数据
排名:前25% | 文档类型:理论研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses