英文题目:Reviving Etter method for autoregressive inpainting: Generalization, evaluation, implementation
标签:#音频修复 | #自回归模型 | #音乐 | #开源工具 | #严格因果
评分:6.9/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Ondřej Mokrý:机构信息未在 arXiv HTML 中可靠披露
- Matěj Hrdlička:机构信息未在 arXiv HTML 中可靠披露
- Pavel Rajmic:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频修复任务输入为含单段连续缺失的波形,输出为填补后的波形,难点在于音乐信号非平稳且长缺失下前后文难以兼顾。本文先用Burg算法或线性预测编码从缺失两侧各估计一组自回归模型系数,再由前向与后向滤波矩阵与已知数据矩阵构造联合最小残差线性系统并求解缺失样本,最后提供纯左侧因果外推与加权交叉淡化两种简化路径。与仅做单向外推或迭代Janssen方法相比,该机制差异在于同时约束双向残差能量并通过边界项耦合求解,因而能利用右侧未来信息并支持缺失短于模型阶数的截断推广。在MUSHRA听测评测设置下,通过后筛选的评估者分数达标人数为14人,低于初始参测的评估者分数达标人数19人。在音乐片段缺失达80ms的评测中,Etter方法总体与多数自回归与稀疏基线相当但弱于逐缺失Janssen,且主观听测排序与PEMO-Q客观差异等级基本一致。结论仅适用于单缺失音乐短间隙插值,未验证多缺失、语音、强非平稳与实时丢包下的外推表现。该结论适用边界受限于单缺失音乐短间隙,强非平稳与多缺失场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
代码相关资源:https://github.com/ondrejmokry/InpaintingAutoregressive — 链接可访问(HTTP 200)
数据相关资源:https://github.com/ondrejmokry/TestSignals — 链接可访问(HTTP 200)
第三方资源:https://www.mathworks.com/help/signal/ref/lpc.html — 链接不可用(HTTP 403)
第三方资源:https://www.mathworks.com/help/signal/ref/arburg.html — 链接不可用(HTTP 403)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
要修的到底是什么声音问题?
这篇论文研究的是音频修复中的缺口插值问题,也就是波形中间丢了一段样本,要把丢掉的部分填回去。论文开场交代的输入是一段离散音频波形,其中有一个连续的缺失段,长度记为 M,起始位置记为 l,缺失样本是未知量,两侧各有一段已知上下文。目标是根据两侧已知样本估计出缺口内的波形,使重建后听不到中断或咔哒声。必须保留的信息包括缺口长度、缺口两侧上下文长度、自回归模型阶数、系数估计方法,以及评价用的信噪比和听感等级。输出就是长度为 M 的估计向量。
对于刚进入这个领域的研究生,首先要建立的直觉是,短缺口不是简单补零或直线连接就能解决的。即使只有几十毫秒的中断,人耳对波形不连续、相位跳变和能量突变非常敏感。论文把场景分为两类,一类是离线修复,例如野外录音掉线,可以同时看到缺口左右两边,另一类是在线丢包隐藏,例如网络传输丢包,要求低延迟因果处理,只能主要依赖左边。后文所有方法分支都是围绕这两类信息条件展开的。
学习这篇论文时,建议先沿着一个样本走完全流程。假设一段音乐中间丢了 50 毫秒,先取缺口左右各一段已知样本估计模型,再用模型约束缺口内样本,最后输出填补后的完整波形。评价时把估计波形与原始干净波形比较,既看样本误差,也看听感预测和真人打分。理解了这条主线,再去看矩阵构造和基线比较就不会迷路。
除自回归之外还有哪些修复路线?
论文把已有音频修复方法归纳为几条路线。第一条是基于短时傅里叶谱稀疏性的方法,假设音频在时频域是稀疏的,通过稀疏优化恢复缺口,还包括社会稀疏变体和字典学习扩展。第二条是利用低秩或矩阵分解结构的方法。第三条是自回归建模方法,其中代表是 Janssen 迭代法。论文明确指出,自回归方法概念简单,在低延迟和计算量受限时仍有吸引力,特别是在丢包隐藏中,包括一些混合方法也在使用它。
Etter 方法在这种版图中的位置是经典但少有人完整实现的方法。论文写道,尽管 Etter 被广泛引用,但很少以完整非简化形式被应用,据作者所知此前没有公开实现,也没有直接用于原始音频。这就是本文要做的工作,不是提出全新的信号假设,而是把一个老方法补齐实现、补齐短缺口推广和因果变体,并放在与 Janssen 和稀疏方法相同的评价协议下检验。
对初学者而言,相关工作的对照维度应该是同输入、同目标、同运行阶段。自回归路线和稀疏路线输入都是带缺口波形加两侧上下文,目标都是恢复时域样本,但监督来源和计算方式不同。自回归依赖局部平稳假设和线性预测,稀疏依赖时频稀疏假设和迭代优化。不能因为类别不同就直接比较优劣,论文后文用相同数据集、相同缺口设置和多种指标来尽量保证比较条件一致,这一点在读结果时需要反复核对。
输入、缺口和评价量是如何定义的?
论文用统一符号描述问题。输入信号样本记为列向量,缺口是其中一段连续缺失样本,长度为 M。待插值的向量记为缺口估计,左侧自回归系数向量记为 a,右侧系数向量记为 b,其中按 Etter 约定包含 a0 等于负 1 的项。自回归模型阶数为 K,缺口两侧各取一段已知上下文用于估计系数。实验中缺口长度最长到 80 毫秒,系数估计上下文是缺口每侧 4096 个样本。
评价量分为两类。信噪比按重建信号与干净参考的能量比取对数计算,数值越大表示波形越接近。客观差异等级用 PEMO-Q 或 PEAQ 得到,预测感知劣化,范围从负 4 表示非常烦人到 0 表示不可感知,数值越接近 0 越好。论文还做了类似 MUSHRA 的听音测试,让受试者打分,分数越高越好。这 3 类评价分别回答波形误差、模型预测听感和真人听感,需要分开理解。
一个常见的误解是把高信噪比等同于听感好。论文同时报告两者正是因为样本级误差和听感并不完全一致。例如高阶模型可能把波形细节拟合得更好,但引入的振铃或不连续仍可能被听出来。后文比较 Etter、外插、Janssen 和稀疏方法时,需要同时看信噪比和客观差异等级的排序是否一致,不一致的地方往往提示了方法的听感短板。
Etter 方法全景:两边建模中间联立求解
Etter 方法的全景可以分成 3 步。第一步是分别估计左侧和右侧自回归系数,左侧系数管前向预测,右侧系数管后向预测。第二步是把缺口上的残差分解为已知样本贡献和未知样本贡献,构造前向滤波矩阵、后向滤波矩阵以及左右已知数据矩阵。第 3 步是要求一个统一的缺口向量同时让前后向残差能量之和最小,由此得到一个线性方程组并求解。
白话来说,前向预测是顺着时间从左往右猜,后向预测是逆着时间从右往左猜。如果只用一边猜,越往缺口深处走误差越大。Etter 的做法不是简单把两边猜的结果拼接,而是让同一个缺口向量同时满足两边的线性预测方程,残差都尽量小。这相当于用两边的边界条件把缺口夹住求解,因此在缺口附近非平稳时,右侧信息可能起到关键作用。
还需要区分完整 Etter 插值、加权外插和因果丢包隐藏三者的关系。完整插值要解线性方程组,加权外插是分别做前后向预测再交叉淡化,不解方程组,属于次优但廉价的替代。因果变体只用左侧上下文和左侧系数做逐样本前向外推,形式上等价于加权外插的前向部分。论文后文比较三者的性能和耗时,正是为了回答何时值得付出解方程组的代价。
前后向残差是如何拼成一个优化目标的?
先解释自回归模型本身。白话说,自回归假设当前样本可以由前面 K 个样本线性组合预测,组合权重就是自回归系数,英文为 autoregressive coefficients,预测对不上的部分就是激励或残差,英文为 excitation 或 residual。模型阶数 K 越大,能刻画的频谱细节越多,但也需要更多上下文来可靠估计。
前向预测 × 后向预测: 前向预测负责用缺口左侧已知样本和左侧自回归系数从左向右递推缺口,后向预测负责用缺口右侧已知样本和右侧自回归系数从右向左约束缺口,二者搭配的理由是单侧外推在非平稳处会漂移,组合意义是通过最小化两侧残差能量之和求一个同时满足两边边界条件的统一缺口向量。
论文把前向和后向的残差向量分别定义在缺口上,然后把每个残差拆成已知部分加未知部分。前向滤波矩阵 A 是由前向系数构成的下三角 Toeplitz 矩阵,后向滤波矩阵 B 是由后向系数构成的上三角矩阵,左右已知数据矩阵 L 和 R 分别装着缺口两侧的已知样本。这种构造的目的是把缺口未知量与已知边界分开,使残差可以写成矩阵与向量的乘积形式。
\[x_{i}=\sum_{j=1}^{K}a_{j}x_{i-j}+u_{i}\]上式是自回归模型的定义,符号 xi 表示第 i 个样本,aj 表示阶数为 K 的系数,ui 表示激励残差。输入是过去 K 个样本和系数,计算目标是当前样本的预测值加残差。原文明确的实现是把系数估计和缺口估计分开,先用两侧上下文估计系数,再固定系数求缺口。
\[\varepsilon=(\hat{\boldsymbol{u}}^{\textup{L}})^{\top}\hat{\boldsymbol{u}}^{\textup{L}}+(\hat{\boldsymbol{u}}^{\textup{R}})^{\top}\hat{\boldsymbol{u}}^{\textup{R}}.\]上式是 Etter 的优化目标,符号表示前向残差能量加后向残差能量。输入是统一的缺口向量和已知的系数矩阵,计算目标是让两侧残差平方和最小。对该目标求导并令导数为零,就得到后文的线性方程组。
\[\boldsymbol{D}\hat{\boldsymbol{x}}=\boldsymbol{y}\]上式是待求解的线性系统,矩阵 D 由前后向滤波矩阵构成,向量 y 综合了左右已知样本的边界条件。输入是系数和边界样本,输出是缺口估计。原文的实现就是组装 D 和 y 后直接求解,这也是计算开销的主要来源。
\[\boldsymbol{D}=\boldsymbol{A}^{\top}\boldsymbol{A}+\boldsymbol{B}^{\top}\boldsymbol{B}\]上式给出 D 的构成,即前向矩阵转置乘自身加后向矩阵转置乘自身,因此 D 是对称矩阵。理解这一点有助于明白为什么论文在未来工作中提到可以利用矩阵结构做数值加速。
短缺口遇到高阶模型时矩阵如何截断?
原始 Etter 推导假设缺口长度 M 大于模型阶数 K,这样滤波矩阵和数据矩阵的形状比较规整。但近年实践偏好高阶模型,例如上 1000 阶,而缺口可能只有几十毫秒对应的几百个样本,就会出现 K 大于 M 的情况。论文的第一个推广就是处理 M 小于等于 K 的情形。
白话解释是,当模型阶数超过缺口长度时,原来矩阵中超出缺口的部分不能直接套用,需要按缺口长度截断 Toeplitz 结构。论文重新定义了前向矩阵 A 和后向矩阵 B 的元素形式,使其只用到缺口长度范围内的系数,同时把左右上下文矩阵 L 和 R 扩展为 M 行 K 加 1 列,把更远的已知样本也纳入边界条件。未知样本参与预测的结构矩阵也做了相应截断,但最终仍是求解同一个线性方程组。
自回归系数 × 激励残差: 自回归系数负责刻画信号当前样本可由过去样本线性组合预测的规律,激励残差负责记录该线性预测解释不了的部分,二者搭配的理由是 Etter 把插值目标写成让缺口上的前后向残差能量都最小,组合意义是系数固定后求缺口就变成解线性方程组而不是重新估计模型。
对初学者而言,关键操作是先确认 M 和 K 的大小关系,再选择矩阵构造分支。如果 M 大于 K,用原始公式,如果 M 小于等于 K,用截断公式。论文强调这一推广很关键,因为不做推广就无法在短缺口上测试高阶模型,而实验显示较优阶数往往比较高。复现时要特别注意下标从 1 开始,只有系数向量隐含 a0 等于负 1,不要把矩阵第一列的零和系数位置弄错。
没有神经网络训练时到底计算了什么?
本研究没有训练神经网络,因此 training 一节要讲清真实的计算过程是模型估计加线性求解,而不是梯度训练。论文明确指出 Etter 原文没有规定如何估计左右自回归系数,作者采用两种标准策略,一种是最小化残差能量的线性预测系数法,英文为 linear prediction coefficients,简称 LPC,可用 Levinson-Durbin 算法求解,另一种是 Burg 算法,英文为 Burg algorithm,它额外要求同一组参数能同时建模信号及其时间反转,从而保证全极点滤波器稳定。
线性预测系数法 × Burg 算法: 线性预测系数法负责最小化残差能量直接求解自回归系数,可用 Levinson-Durbin 算法高效实现,Burg 算法负责同时要求同一组参数能建模信号及其时间反转以保证全极点滤波器稳定,二者搭配比较的理由是原文没有规定 Etter 系数必须怎么估计,组合意义是论文用同一插值流程分别接入两种估计器来验证系数估计对重建质量的影响。
具体操作是,对每个缺口取左右各 4096 个样本作为上下文,分别调用 LPC 或 Burg 估计得到左侧系数 a 和右侧系数 b。论文实验用的是 Matlab 的 lpc 函数和 arburg 函数。系数一旦估计完成就被固定,不再更新,缺口求解阶段没有梯度路径,也没有监督标签参与反向传播。监督来源就是两侧已知波形本身,目标是残差能量最小。
需要指出的缺项是,论文没有报告 LPC 和 Burg 估计时的正则化、数值稳定处理或失败重置细节,也没有给出估计窗口加窗方式。不能从方法名称推定具体实现细节,复现时应先按默认函数行为实现并记录版本,再核对重建质量趋势是否与论文一致,即 Burg 在统计检验下优于 LPC。
在什么数据和条件下比较方法?
实验遵循已有文献的协议,使用 EBU SQAM 音乐信号子集,测试信号来自公开仓库。每个缺口两侧各取 4096 个样本估计自回归系数。缺口长度覆盖短到长的多个档位,最长到 80 毫秒。模型阶数测试了从 256 到 3072 的多个取值。评价指标包括信噪比和用 PEMO-Q 或 PEAQ 得到的客观差异等级,另有听音测试验证。
比较对象包括 Etter 完整插值、加权外插、因果丢包隐藏变体,以及外部基线中的加窗 Janssen、逐缺口 Janssen、稀疏方法 A-SPAIN 和 A-SPAIN-MOD。论文报告计算耗时随缺口长度和模型阶数的变化,并区分 Burg 和 LPC 估计器的耗时差异。听音测试采用 webMUSHRA 环境,事先筛选为有知识的受试者,部分控制条件下用自备设备、安静环境和耳机完成,事后按隐藏参考打分筛选有效受试者。
下表把论文明确给出的实验信息条件整理成可核对的形式,重点是缺口范围、上下文长度和评价量纲,便于复述时不混淆条件。
表前比较问题是不同方法是否在相同缺口和相同上下文下比较,公平条件是同一信号子集和同一评价定义,指标方向是信噪比越大越好,客观差异等级越接近 0 越好。
| 条件 | 指标 | 取值 1 | 取值 2 | 取值 3 |
|---|---|---|---|---|
| 缺口长度 | 最大缺口 | 音乐片段 | 信噪比 | 客观差异等级 |
| 上下文 | 每侧样本数 | 音乐子集 | 信噪比 | 客观差异等级 |
| 感知评价 | 等级范围 | 烦人端 | 不可感知端 | 评价工具 |
表后解释是,该表只整理论文直接报告的协议要素,不代表性能排序。缺口最长到 80 毫秒的设定决定了结论只适用于短到中等缺口,不能推广到秒级缺失。每侧 4096 样本的上下文决定了高阶模型有足够数据支撑,但也意味着延迟和计算量。客观差异等级从负 4 到 0 的量纲提醒读者,负值越大表示感知越差,读图时要注意纵轴是否被裁剪。未胜出项和边界在后文结果中展开,这里先明确条件一致性是比较的前提。
Etter 与基线相比表现如何?
论文首先比较系数估计器,结果显示 Burg 算法在重建质量上持续优于 LPC,并用 Wilcoxon 符号秩检验在 5% 显著性水平下拒绝中位数相等的原假设,支持 Burg 更优。模型阶数的影响与其它自回归方法类似,较优阶数相对较高但不是测试的最大值。这说明系数估计质量和阶数选择是影响结果的重要前提,读主比较时要先确认用的是哪种估计器和哪个阶数。
信噪比 × 客观差异等级: 信噪比负责度量重建波形与干净参考在样本能量上的接近程度,客观差异等级负责用 PEMO-Q 或 PEAQ 预测人耳感知的劣化等级,二者搭配的理由是样本误差小不等于听感好,组合意义是论文同时报告两者并辅以听音测试,避免只看波形误差得出片面结论。
在主比较中,完整 Etter 插值优于只用左侧的因果丢包隐藏变体,这符合预期,因为右侧上下文在缺口附近非平稳时能提供额外信息。Etter 与加权外插的比较则比较微妙,按 PEMO-Q 看 Etter 多数情况下更好,但在高阶处外插可能反超,其余客观指标在高阶偏向外插、低阶则不确定。论文明确写道 Etter 曾把外插视为次优,但实验并未一边倒支持完整求解。
与外部基线相比,Etter 属于较强的一组,按 PEAQ 甚至是最优,但在综合排序中逐缺口 Janssen 仍是最优。听音测试的排序大体与 PEMO-Q 一致,逐缺口 Janssen 最好,外插和 Etter 无显著差异,而 A-SPAIN-MOD 在主观评价中比客观评价更受青睐,与外插和 Etter 并列。计算耗时方面,Burg 比 LPC 慢,但在长缺口下差异变得不重要,因为 Etter 的主要开销是解线性方程组,其规模与估计器无关。
下表整理听音测试的组织条件,用于核对主观结论的适用边界,避免把自动指标直接当成人评。
表前比较问题是主观排序是否支持客观排序,公平条件是相同信号子集和相同缺口档位,指标方向是 MUSHRA 分数越高越好。
| 条件 | 指标 | 取值 1 | 取值 2 | 取值 3 |
|---|---|---|---|---|
| 受试者 | 参与人数 | 筛选后有效 | 隐藏参考 | 通过门限 |
| 测试信号 | 乐器种类 | 缺口档位 | 测试环境 | 播放要求 |
| 对照设置 | 隐藏参考 | 锚点 | 省略方法 | 评价界面 |
表后解释是,该表的代价在于样本量有限,只用了单簧管、小提琴、钢琴 3 种信号和 20、50、80 毫秒三档缺口,19 人参与、14 人通过筛选,因此主观结论的支持范围较窄。未胜出项是加窗 Janssen 和部分稀疏方法在主观上并未超过 Etter,但逐缺口 Janssen 的主观优势依然存在。反例是 A-SPAIN-MOD 在客观上不突出却在主观上与 Etter 并列,说明只看客观等级会低估该方法。未评测边界包括更长缺口、语音信号和实时因果条件下的听感,这些都不能从本次听音推断。
去掉右侧信息或去掉方程组求解会怎样?
论文做了两组贴近消融的比较。第一组是完整 Etter 对因果丢包隐藏变体,相当于拿掉右侧模型和右侧上下文,只保留左侧。第二组是完整 Etter 对加权外插,相当于保留两侧独立预测但拿掉联立方程组求解。两组比较分别回答信息条件和计算形式的贡献。
Etter 插值 × 加权外插: Etter 插值负责联立前后向滤波矩阵解线性方程组得到缺口,加权外插负责分别做独立前后向预测再交叉淡化拼接而不解方程组,二者搭配的理由是后者把缺口上激励向量置零从而省掉矩阵求逆,组合意义是论文借此检验完整联立求解相对廉价拼接到底带来多少可测增益和多少计算代价。
结果支持右侧信息有价值,完整 Etter 优于因果变体,尤其在非平稳区域。但联立求解的增益并不稳定,外插在高阶时可能更好,且耗时明显更低。论文还报告耗时随缺口长度和阶数增长,Etter 解方程组的代价是主要瓶颈。这意味着如果目标是离线高质量修复,值得尝试完整 Etter 或逐缺口 Janssen,如果目标是低延迟或低算力,外插或纯前向外推更合适。
一个需要避免的推断是拿掉后必然怎样。论文没有做逐组件的因果剔除实验来证明某矩阵项不可或缺,也没有报告不同截断方式的失败条件。因此只能说在给定协议下观察到上述排序,不能推广为右侧信息在所有音乐和所有缺口下都同样重要,也不能把某阶数下的反超推广为全程成立。
哪些结论不能推广?
首先是数据边界。实验只用了音乐片段子集,最长缺口 80 毫秒,没有覆盖语音、环境声或秒级长缺口。缺口都是单个紧凑段,没有测试多缺口、突发丢包或连续丢包序列。因此结论中的相当或最优只在该音乐短缺口协议内成立。
其次是指标与统计边界。客观评价依赖信噪比和 PEMO-Q 或 PEAQ,纵轴在部分图中被裁剪,读数时要注意完整量程从负 4 到 0。系数估计比较用了 Wilcoxon 检验,但主方法排序多为均值曲线比较,论文没有给出每组缺口和每阶数下的显著性细节。总体趋势不等于每组都成立,特别是在 Etter 与外插高低阶交叉处更应谨慎。
再次是实现与成本边界。论文提供了外部代码仓库和测试信号仓库,当前可用性按资源状态核对,第三方 Matlab 函数链接本次未能确认可达。耗时结论与具体硬件和 Matlab 实现有关,训练资源、推理开销和实际延迟需要分开讨论。由于没有神经网络训练,不能谈论权重下载,只能谈论代码可运行性和函数依赖。未来工作提到的利用矩阵结构加速尚未实现,因此不能承诺 Etter 已达到外插的效率。
要复现应该先做什么?
复现的第一步是准备数据和代码。获取测试信号仓库中的 EBU SQAM 子集,获取作者发布的自回归修复代码仓库,按论文设置对每个缺口取左右各 4096 样本。记录 Matlab 版本以及 lpc 和 arburg 的调用参数,因为论文未报告这些细节,默认行为可能影响 Burg 优于 LPC 的复现程度。
第二步是实现矩阵分支。先实现 M 大于 K 的原始矩阵,再实现 M 小于等于 K 的截断矩阵,注意系数向量隐含 a0 等于负 1,下标从 1 开始。固定系数后组装 D 和 y 并求解线性方程组得到缺口,同时实现加权外插和纯前向外推作为对照。建议先用单缺口单阶数跑通,再扩展到多缺口和多阶数,避免 1 次引入太多变量。
第 3 步是评价对齐。按论文定义计算信噪比,用相同版本的 PEMO-Q 或 PEAQ 计算客观差异等级,注意量程从负 4 到 0。听音测试如需重复,应使用相同乐器和缺口档位,并保留隐藏参考和筛选标准。还需补做的验证包括更长缺口、语音数据、不同上下文长度,以及在因果条件下加短交叉淡化以抑制咔哒声的效果,这些在原文中只是建议而未充分验证。
何时值得尝试 Etter 方法?
综合来看,当任务允许同时使用缺口两侧上下文,且缺口在几十毫秒量级,Etter 是一个值得尝试的自回归基线。它的优点是原理直接,把双向预测写成一个最小二乘问题,代码公开后可核对矩阵构造,短缺口高阶模型的截断推广使高阶测试成为可能。在论文协议下,它与多数自回归和稀疏基线相当,按 PEAQ 甚至靠前。
但有两点代价需要权衡。第一是质量上限,逐缺口 Janssen 在客观和主观上仍更优,如果追求最高重建质量,应优先考虑迭代的逐缺口方法。第二是计算代价,解线性方程组比外插慢,如果延迟或算力受限,外插或纯前向外推更合适,尤其在高阶时外插的客观指标并不吃亏。
对研究生而言,建议把 Etter 当作理解双向约束的教学起点,而不是万能修复器。先复述出前向残差加后向残差最小如何导出线性方程组,再动手比较 Burg 与 LPC、完整求解与外插、离线双向与因果单向 3 组对照。补足长缺口、语音和实时延迟的验证后,才能判断它在自己任务中是否真正可用。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses