英文题目:Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs

会议身份:conference:interspeech:2026:conference-paper-id:jia26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#指令微调 #模型评估 #可解释性 #音频质量评估

评分:6.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yuhang Jia:机构信息未能从会议 PDF 纯文本可靠映射
  • Xu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yang Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Enzhi Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音频编辑评估需同时输入原始音频、编辑后音频、原始描述与编辑指令,输出总体质量、编辑有效性与未改动保持度,而现有客观指标缺乏参考真值且多模态大模型缺少跨音频联合推理能力。本文先在30000条伪平行对上微调Qwen2-Audio-7B-Instruct使其生成差异描述与共性描述,再验证其准确率与主客观指标的相关性并据此合成Edit score与Faith score,最后用七步思维链提示与40条人工精修样本的轻量指令微调生成结构化自然语言评估。与传统1-5分预测不同,该链条把感知、复述期望、对比判断与综合建议显式分离,使评估过程可审计。在AuditScore测试集上Edit score与人类编辑有效性评分的线性相关系数达到0.7652,超过专用监督基线AuditEval-ssl的0.6196。该结论目前仅在混合重排合成的加删改数据与23个系统的英文评测上验证,对真实录音、韵律音量等声学一致性与长音频的外推尚未证明。原文未披露训练时长、推理成本与解码参数。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么听感评价贵且难复现,自动评价要补什么?

这篇论文的输入是四样东西:编辑前的音频、它的原始文字描述、目标描述或编辑指令,以及编辑模型生成的编辑后音频。目标不是只输出一个 1 到 5 的分数,而是输出一段自然语言评价,至少覆盖 3 个方面:编辑后整体质量、编辑指令是否被准确执行、原音频中不应改动的内容与整体特征是否被保留。必须保留的信息条件是成对音频加文字指令,输出必须同时谈改动与保留,不能只谈一端。

初学者容易把自动评价理解成算一个声学距离。白话说,自动平均意见分预测是指让模型学习人类打分的规律,输出可重复的质量估计,英文是 automatic mean opinion score prediction,常缩写为 MOS 预测;主观听感评价是指组织人实际听并打分,是更可信但昂贵且难复现的基准。论文把前者当作可扩展的替代,把后者当作校准依据。学习依赖是先理解任务为什么需要同时看两段音频和一段指令,再理解模型如何先学会讲差异与共性,最后才理解如何用结构化推理把观察变成评价。

自动平均意见分预测 × 主观听感评价: 自动平均意见分预测负责用可重复的模型输出代替反复组织试听,用统一流程给出可比较的分数或文本;主观听感评价负责提供人类对质量、相关性和保真度的直接感受,是校准自动方法的基准。二者搭配的原因是前者解决成本与一致性,后者解决有效性,组合意义在于用人工评分验证自动评价是否真的贴近人的判断,而不是只在客观距离上自洽。

从动作上看,研究生的复述路径应该是:给定一段风雨加人声的原音频和加入雷声的指令,先听出新增事件是什么,再听出风雨人声是否还在,最后把两部分对照指令写成结论。论文的方法全景正是把这个动作固定下来,先用微调让模型能同时讲清差异与共性,再用提示与轻量指令调优让模型按固定步骤比较与综合。

同输入同目标的已有路线与本文的分工有何不同?

与本文同输入的工作是音频编辑模型本身,例如按指令做增加、删除、替换、修复或超分辨率的方法。它们的目标是生成更好的编辑后音频,运行阶段是生成。与本文同目标但不同输入的工作是文本生成音频评价,例如对整体质量打分或做美学判断,它们通常只看单段音频加文字,不需要对齐两段音频的差异与保留。同监督的工作是已有的人工编辑评价数据集 AuditScore,它提供成对音频、文字描述与专家 1 到 5 分,是本文用来验证相关性的基准,而不是本文要替代的生成模型。

本文的运行阶段是评价而非生成,监督来源一是伪平行编辑对的差异与共性题注,二是 AuditScore 的人工评分与客观指标。区别在于传统客观指标依赖参考真值,而编辑任务往往没有真值;专用监督打分模型能输出分数但缺少过程解释。本文选择多模态大模型作为判官,目的是同时给出可检查的文本证据和可对照的量化信号。教学例子是:同样是雷声加入失败,距离指标可能只说整体变差,而本文框架要能说清是新增事件听感像爆炸声,但背景保留完好。

资源状态需要如实说明。本次收到的证据中资源状态为 NONE,未发现来源绑定且完成验证的资源,因此不能声称代码、模型或数据已公开。原文虽有将发布代码与工具的表述,但按本次证据只能理解为作者计划,不能写成当前可用。

评价器要回答哪三个问题,形式化输入输出是什么?

论文把评价写成函数映射。输入是原音频、原描述、目标描述或指令、编辑后音频,输出是文本评价集合,包含总体质量、编辑有效性和未改内容保持 3 个部分。白话说,总体质量回答听起来是否自然完整,编辑有效性回答指令要求的差别是否准确出现,保持能力回答不该动的地方是否原样保留。

沿一个样本走完流程有助于建立依赖。输入是风雨加人声的原音频与加入雷声的指令,模型先表示两段音频的声音事件,再用差异分支回答新增了什么,用共性分支回答保留了什么,然后把预测的差异与期望的加入雷声对照,把预测的共性与期望的风雨人声对照,最后综合成总体判断。例子中模型预测新增像爆炸声,共性是风、人声与雨声仍在,因此总体是中等质量、部分满足目标。这个例子表明评价必须保留期望文本作为比较基准,否则无法判断偏差来自编辑失败还是描述不清。

该任务的难点在原文有明确交代:一是需要联合感知成对音频加文字指令,二是缺少监督编辑基准导致传统依赖真值的指标难以直接套用,三是评价必须同时覆盖输出相对原音频的质量、是否满足指令、未编辑区域是否保留。因此后续所有设计都围绕同时看两段音频展开,而不是单音频打分。

框架如何把一次评价拆成可检查的七个动作?

在看具体图之前,需要先建立全景。框架基于 Qwen2-Audio,先通过两个题注微调任务补齐多音频联合理解,再用 7 步思维链提示加轻量指令调优做评价。7 步的顺序是固定的:第一步描述实际差异,第二步描述实际共性,第 3 步复述期望差异,第四步复述期望共性,第五步比较实际差异与期望差异并评价编辑效果,第六步比较实际共性与期望共性并评价保持效果,第 7 步综合前两步给出总体评价与改进建议。

下面这张总览图把提示、推理与最终评价放在同一版面,适合对照步骤理解信息流向。它左侧是提示词的 7 步文字,右侧是模型与适配器如何接收两段音频并输出预测差异与共性,底部是综合后的自然语言结论。看图时不要只看结论句,要回查结论中的每个判断在前面哪一步有对应观察。

看图路径: 1. 先从左侧提示框找到七个步骤的分组:生成观察、复述期望、分别比较、综合总体;2. 再看右侧推理框中两路音频波形如何进入带适配器的多模态大模型;3. 对照底部总体评价,确认模型如何把雷声误判为爆炸声与背景保留完好分开表述;4. 注意期望差异与预测差异在文字上的对应关系

原论文 Figure 1:Overview of our audio editing evaluation framework.

论文图 1。原论文 Figure 1:“Overview of our audio editing evaluation framework.”。

从像素可见,左侧提示框明确写出从分析差异共性到复述期望再到分别比较的 7 条指令,右侧推理框显示上下两路音频波形进入标注为多模态大模型与低秩适配器的模块,上方标注期望差异是加入雷声、期望共性是风雨加人声,下方预测差异是加入爆炸声、预测共性是风、人声与雨声。底部评价框的结论是总体中等,新增雷声未被忠实实现而听感像爆炸声,但风雨与语音背景保留自然。

这个对应关系说明框架的动作不是直接打分,而是先固定观察与期望,再做 2 次独立比较,最后综合。复述期望的设计意图在原文有解释,是为了防止模型生成完自己的预测后覆盖或忘记基准,从而保证跨音频比较稳定。

差异分支与共性分支各自看什么,为什么要分开训练?

白话说,差异描述是指用一句话说清两段音频的不同之处,英文是 difference captioning;共性描述是指用一句话说清两段音频的相同之处,英文是 commonality captioning。后文分别简称差异分支与共性分支。原文指出 Qwen2-Audio 虽在单音频题注上理解较强,但多音频推理能力有限,因此需要专门构造配对数据同时训练这 2 个任务。

差异描述 × 共性描述: 差异描述负责说清编辑前后两段音频哪里不一样,对应指令要求增加、删除或替换的内容;共性描述负责说清两段音频哪里应该一样,对应需要保留的背景与原有事件。二者搭配的原因是音频编辑评价天然包含改动是否做对和未改是否保留两个子问题,组合意义在于把一个笼统的好坏判断拆成两个可分别验证、可分别与编辑类和保持类指标对照的文本证据。

构造规则按编辑操作区分。数据共 30,000 个编辑后样本对,每个对包含原音频与编辑后音频,以编辑指令作为目标差异,以重叠内容作为目标共性。对于增加操作,共性题注取原始题注;对于删除操作,共性题注取编辑后题注;对于替换操作,共性题注取两者题注的交集。

这个规则的动作含义是:增加时原内容应全部保留,删除后剩余内容即应保留,替换时只有未被替换的交集应保留。模型被联合微调以同时预测差异与保留部分,从而为后续评价提供基础。

编辑有效性 × 保持能力: 编辑有效性负责衡量目标修改是否准确出现,例如是否真的加入了雷声而不是别的声音;保持能力负责衡量原有场景是否完整保留,例如风声、雨声和人声是否自然延续。二者搭配的原因是只看一端会误判,把改得多当成改得好或把没变化当成高质量,组合意义在于最终的总体评价必须同时综合两端,才能区分过度编辑、编辑不足和保留破坏。

分开的理由在相关性验证中得到支持。差异准确度与编辑类指标正相关而与保持类指标多为负相关,共性准确度则相反。这种互补不是事先假设的修辞,而是后续用 23 个编辑系统数据算出的趋势。因此评价时必须保留两个分支,不能用一个笼统的相似度代替。

七步推理中比较与综合步骤做了哪些稳定设计?

7 步提示的前两步依赖微调后的多音频能力,中间两步是显式复述期望差异与期望共性,后两步是分别比较,最后一步是综合。白话说,思维链提示是指要求模型按固定中间步骤逐步作答,英文是 Chain-of-Thought prompting;指令调优是指用少量高质量问答让模型更服从该格式。组合时思维链提供结构,指令调优提供服从性。

原文报告了两个容易被初学者忽略的机制。一是在指令微调时把同批内的标准题注随机打乱配对,以减少输入与输出之间的注意力泄漏,避免模型把预测任务做成简单抄写。二是在比较阶段之前加入复述期望的中间步骤,以加强参考信息,防止模型在生成完自己的观察后忘记基准。动作顺序是先解耦再强化记忆,而不是同时把答案与问题一起喂给模型。

用于指令调优的数据量很小。原文说明通过大模型辅助生成再加人工精修构造了 40 个样本,经 Qwen2-Audio 改写后用于轻量指令调优,以增强任务特定的指令跟随能力。这意味着主要的感知能力来自 30,000 对的题注微调,而格式与推理稳定性来自这 40 个精修样本。复现时不能把两者混为一谈,也不能认为仅靠提示就能替代差异与共性微调。

模型动了哪些参数,用了多少数据与什么硬件?

骨干是 Qwen2-Audio-7B,微调采用低秩适配,秩为 8,缩放系数为 32,丢弃率为 0.05,有效批量为 16,最大输入长度为 2048 个词元,学习率设为 1 乘 10 的负 4 次方直到收敛。硬件条件是 4 张英伟达 GeForce RTX 4090。需要明确的是原文只报告了更新适配器与相关微调设置,没有给出冻结层数、梯度是否截断或优化器内部状态的完整说明,缺项应如实指出,不能从模型名称推定实现。

注意力泄漏缓解 × 参考复述: 注意力泄漏缓解负责在指令微调时把同批内的标准答案打乱配对,避免模型直接抄写输入中给出的期望差异与共性;参考复述负责在推理比较之前让模型先把期望差异与期望共性再说一遍,防止生成完自己的观察后忘记比较基准。二者搭配的原因是一个管训练时不走捷径,一个管推理时不丢失基准,组合意义在于保证后续的比较步骤是真实的观察与期望对照,而不是复述或遗忘造成的虚假一致。

数据方面,题注微调数据是按已有方法通过混合与重排构造的伪平行编辑样本,共 30,000 个,按 8 比 1 比 1 切分为训练、验证与测试。指令调优数据是 40 个精修样本。相关性验证与打分比较使用 AuditScore 数据集,它覆盖 23 个音频编辑系统,共 6300 个标注实例,每个实例包含成对音频、文字描述与编辑指令,并由专家从整体质量、编辑有效性和保真度 3 个维度给出 1 到 5 分,同时补充计算了常用客观指标。

下表把数据规模与切分放在同一版面,目的是核对复现时的数据量级与划分口径,避免把伪平行构造数据与人工标注验证数据混用。表前的问题是:微调学感知用多少数据,格式学习用多少数据,验证用人评用多少数据,条件是否一致。

环节数据量划分或处理模型或用途比较对象
题注微调构造300008 比 1 比 1 切分Qwen2-Audio 适配器微调伪平行编辑对
指令调优精修40大模型生成加人工精修任务格式跟随高质量问答
人工验证集630023 个系统AuditScore 专家评分1 到 5 分 3 维度

表后需要解释代价与边界。30,000 对只对应约 80 小时量级的精修配对数据,相比骨干预训练的上 10000 小时通用音频数据是很小的增量,但原文报告它足以把差异与共性题注能力从几乎不可用提升到可用。代价是伪平行数据的混合重排与真实编辑模型的输出分布仍有差距,因此必须再用真实编辑系统的 6300 个人工标注做相关性验证。未胜出项是原文明确承认保持维度的声学一致性更难,专用监督打分在保持上仍占优,这与伪平行数据偏重语义事件而轻韵律音量噪声有关。

用什么数据、什么基线、什么指标来判断评价是否可信?

实验按问题组织。第一个问题是模型能否讲清差异与共性,测法是在 30,000 对的测试切分上用标准题注指标衡量,包括 BLEU1 到 4、FENSE、SPICE、SPIDER、CIDEr-d、METEOR 与 ROUGE-L,方向都是越高越好。第二个问题是讲清差异与共性是否对应真实编辑质量,测法是在 AuditScore 上算预测准确度与主观客观指标的线性相关系数,编辑侧期望差异分支高、共性分支低,保持侧相反。第 3 个问题是文本评价是否比直接打分或基线更完整准确丰富,测法是用 Qwen2.5-Omni 作判官在 318 个测试样本上做成对投票,标准是完整性、准确性与丰富度,并交替选项顺序以消除位置偏置。

比较条件需要逐 1 核对。题注能力比较的是微调前后同一骨干;打分比较的是本文的编辑分数与忠实分数对照专用监督 1 到 5 分模型 AuditEval-ssl,用线性相关、斯皮尔曼秩相关与肯德尔秩相关衡量与人工的一致;文本评价比较的是本文方法对照无优化提示的原始 Qwen2-Audio,以及用优化提示的 Qwen2.5-Omni。客观指标包括 CLAP 分数、FAD、FD、KL 与 IS,原文说明这些与主观评分一起按编辑能力、保持能力与总体质量分组。

实现细节上,题注微调的批量、长度与学习率已在训练节交代,相关性实验的指标工具链指向已有题注与音频生成评价仓库。统计方法主要是线性相关系数与秩相关,聚合对象是跨 23 个编辑系统的实例级准确度与系统级评分。未报告的是推理延迟、输出帧率与误判率,原文没有测量这些量,因此不能承诺该框架在速度或成本上优于专用打分模型。

差异与共性准确度与人工判断的相关性呈现什么互补模式?

在进入热力图之前,先明确要回答的比较问题:在相同 AuditScore 实例上,差异描述写得越准则编辑类指标是否越高,共性描述写得越准则保持类指标是否越高,方向是否互补。公平条件是同一组预测文本用同一套题注指标分别算差异与共性准确度,再分别与同一组主观客观编辑指标算相关。指标方向是编辑侧相关越高越支持差异分支有效,保持侧相关越高越支持共性分支有效。

看图路径: 1. 先确认左右两块热力图分别对应差异描述与共性描述;2. 再按行看编辑质量行偏亮的位置与保持质量行偏亮的位置是否左右互补;3. 重点观察相关性行与保真度行在两图中的符号是否相反

原论文 Figure 2:Linear correlation coefficient (LCC) analysis between the model’s predicted Difference/Commonality…

论文图 2。原论文 Figure 2:“Linear correlation coefficient (LCC) analysis between the model’s predicted Difference/Commonality accuracy and subjec- tive/objective editing metrics across 23 audio editing…”。

从像素可见,左侧差异热力图在编辑质量行偏浅黄表示正相关较强,在保持质量的部分行偏橙红表示负相关;右侧共性热力图则相反,在保持质量的 FD 行偏浅黄表示正相关较强,在编辑质量行偏橙红表示负相关。右侧色条从深橙到浅黄对应负 1 到正 1,因此颜色越浅越正相关,越深越负相关。这种左右镜像的布局就是原文所说的完全互补的相关趋势。需要强调的是相关性不是因果,热力图显示的是预测文本准确度与质量指标同向变化,不证明写好题注必然导致编辑变好。

编辑分数 × 忠实分数: 编辑分数负责把多个差异描述准确度指标按相关强度加权组合成编辑侧的量化分;忠实分数负责把多个共性描述准确度指标按相关强度加权组合成保持侧的量化分。二者搭配的原因是单一题注指标各有偏好,组合可以利用互补信息,组合意义在于在保留可解释文本评价的同时,提供能与人工 1 到 5 分对照的量化信号,用于验证差异与共性文本是否真的反映了编辑质量。

下表整理原文直接报告的关键数字,目的是把热力图的定性互补落到可复述的定量点上,数值写法保留原文精度,不做四舍五入。表前的问题是:微调后题注绝对性能如何,差异与共性分别在哪个代表性相关点上最强。

条件指标基线本方法比较对象
差异题注FENSE0.26330.83微调前后
共性题注FENSE0.26640.69微调前后
编辑侧Relevance 与 FENSE负相关0.71差异分支
编辑侧CLAP 与 FENSE负相关0.58差异分支
保持侧FD 与 SPICE负相关0.67共性分支

表后解释主要收益与具体代价。收益是微调前骨干在联合多音频题注上几乎不可用,微调后差异与共性 FENSE 分别达到 0.83 与 0.69,差异分支在编辑有效性上与人工相关性最高达 0.71 量级,共性分支在保持上与 FD 相关达 0.67 量级。代价与反例是共性分支在编辑侧呈负相关,差异分支在保持侧呈负相关,说明单一分支不能兼顾两端。未胜出项是忠实分数在保持上虽优于其任一组成指标,但总体仍弱于专用监督模型,这与 AuditScore 对韵律音量噪声等声学一致性的强调有关,是多模态大模型题注偏重语义的局限。

量化打分比较的原文报告是:编辑分数在预测编辑有效性上超过专用监督 1 到 5 分模型,更贴近人类专家评分;忠实分数与人工保真度的相关为 0.59,优于任一组成指标单独使用。重提这些结果时新增的对照是前者说明无监督组合指标在编辑侧有潜力,后者说明保持侧仍需声学建模补强,适用条件是语义事件变化明显时更可信,细微声学差异为主时要谨慎。

拿掉微调、指令调优与防泄漏设计后投票结果如何变化?

消融要回答的是每个设计是否必要,测法是在 AuditScore 测试集 318 个样本上让判官模型在成对输出中投票,报告本方法获胜占比。比较对象包括去掉差异与共性微调、去掉指令调优、去掉注意力泄漏处理、去掉标准答案复述,以及对照原始 Qwen2-Audio 与作为判官的 Qwen2.5-Omni。条件一致的做法是同一提示结构、同一判官标准与交替顺序,标准覆盖完整性、准确性与丰富度。

下面条形图把每次消融的胜负占比画成绿蓝对比,绿色为本方法,蓝色为对照,中间虚线为 50.00% 平局线。看图时先看绿色是否过线,再比较不同行的绿色长度,最后注意几乎全绿的极端行。

看图路径: 1. 先找到中间 50.00% 参考线,判断每条绿色占比是否明显偏向本方法;2. 再比较上面四条消融与下面两条基线对照的绿色长度差异;3. 重点看去掉注意力泄漏处理后绿色占比是否接近全部

原论文 Figure 3:Ablation Results (top) and Comparison with the base- line raw model and A/B test judger model…

论文图 3。原论文 Figure 3:“Ablation Results (top) and Comparison with the base- line raw model and A/B test judger model (bottom).”。

从像素可见,第一行完整方法对照去掉差异与共性微调时绿色为 87.12% 蓝色为 12.88%,第二行对照去掉指令调优时绿色为 86.79% 蓝色为 13.21%,第三行对照去掉注意力泄漏处理时绿色为 99.69% 蓝色为 0.31%,第四行对照去掉标准答案复述时绿色为 65.41% 蓝色为 34.59%,第五六行对照原始基线与判官模型时绿色分别为 87.12% 与 65.40%。这组结果支持的判断是 4 个设计都有正向作用,其中注意力泄漏处理缺失时代价最大,模型会把题注任务混同为简单复述而出现灾难性遗忘。限制是投票者本身是 Qwen2.5-Omni,与第六行对照模型同源,可能存在判官偏好,原文虽交替顺序但未报告人与判官的一致率,因此不能把投票胜率直接等同于人工胜率。

下表把权重与样本量等复现关键常数集中呈现,目的是让读者在复现组合分数时不猜权重。表前的问题是:组合分数的权重如何按相关强度确定,平滑与衰减常数取何值。

条件指标基线本方法比较对象
编辑分数权重wf 与 ws未加权0.48 与 0.52差异 FENSE 与 SPIDER
编辑分数权重vsp 与 vme未加权0.46 与 0.54共性 SPICE 与 METEOR
忠实分数权重usp 与 url未加权0.48 与 0.52共性 SPICE 与 ROUGE-L
忠实分数权重zsp 与 zme未加权0.53 与 0.47差异 METEOR 与 ROUGE-L
平滑衰减epsilon 与 lambda未设置1e-6 与 0.5指数衰减项

表后说明适用与未评测边界。按相关强度定权重的动作含义是相关越强的组成指标占比越高,平滑项避免对数零值,衰减项控制另 1 分支的指数修正。未评测的是权重在新编辑系统上的迁移稳定性,以及判官投票在不同主题音频上的分布差异,这些在原文没有报告,复现时应先固定权重再在新数据上重算相关,不宜直接把投票胜率推广为全程最优。

哪些结论有直接证据,哪些还只是待验证的推测?

直接报告的是:微调显著提升差异与共性题注绝对性能;差异与共性准确度与编辑和保持指标呈现互补相关;编辑分数在编辑侧超过专用监督打分;4 个消融对照中完整方法均获胜且去掉防泄漏时代价最大。这些都有具体数字或投票占比支撑,可用报告或显示来表述。

有限解释的是:互补相关支持用差异与共性文本做评价,但相关性不是因果,不能说写好题注就能让编辑模型变好;投票结果支持文本评价更完整准确丰富,但判官是模型且未报告与人工的一致率,因此只能说在该判官标准下成立。待验证的是:权重在新系统上的稳定性、声学一致性建模不足能否通过加入韵律音量噪声特征弥补、推理开销与输出延迟是否可接受。原文未测量延迟、成本与误判率,总体趋势不等于每组音频每一步都成立。

另一个特有误解是把无训练等同于确定性求解。本文是有训练的,题注微调更新了适配器参数,指令调优也更新了跟随能力,不能因为最终评价是文本生成就认为是确定性规则。相反,生成式评价的输出具有采样不确定性,复现时应固定解码设置并多次采样核对结论稳定性,原文未报告解码温度与多次运行方差,这是具体缺项。

要复现这套评价,先准备什么,再按什么顺序跑?

先准备数据与模型。数据需要伪平行编辑对 30,000 个并按 8 比 1 比 1 切分,用于题注微调;需要 40 个精修问答,用于指令调优;需要 AuditScore 的 6300 个人工标注与 318 个测试样本,用于相关性与投票验证。模型需要 Qwen2-Audio-7B 作为骨干,低秩适配秩 8、缩放 32、丢弃 0.05、批量 16、长度 2048、学习率 1 乘 10 的负 4 次方,硬件按 4 张 4090 规划。判官需要 Qwen2.5-Omni 并固定完整性、准确性与丰富度三标准,同时交替选项顺序。

再按顺序跑 3 步。第一步跑差异与共性联合微调,核对测试切分上 FENSE 是否从 0.26 量级提升到差异 0.83 与共性 0.69 量级,若未提升先检查配对构造中增加删除替换的共性规则是否写对。第二步在微调时加入批内打乱以缓解注意力泄漏,在推理提示中保留复述期望的两步,再用 40 个样本做轻量指令调优,核对消融中去掉任一步是否导致胜率明显下降。第 3 步在 AuditScore 上算差异与共性准确度与主观客观指标的相关,核对是否出现差异偏编辑、共性偏保持的互补,再按原文权重组合编辑分数与忠实分数并与专用打分对照。

关于可用性,只能按本次证据表述:未发现完成验证的公开资源,不得声称代码模型数据已公开。若后续要补验证,优先补判官与人工的一致率、不同编辑类型下的分项相关、以及多次采样的稳定性,而不是先扩大修辞。

何时值得尝试这套方法,还需补哪项验证?

当评价任务同时满足 3 个条件时值得尝试:输入是成对音频加文字指令,输出需要同时回答改对了没有与没改的保住了没有,并且希望评价过程可检查而不是只有一个分数。此时先沿单样本走完输入到表示再到差异共性再到比较综合的完整链路,确认每个结论都能回指到某一步的观察或期望。若只需要单音频质量分数或已有可靠参考真值,传统客观指标或专用打分可能更直接,不必套用 7 步文本评价。

复现的最小闭环是:用 30,000 对学会讲差异与共性,用 40 个样本学会按 7 步作答,用 AuditScore 验证互补相关与投票优势。关键超参数与信息条件是适配器秩与学习率、8 比 1 比 1 切分、组合分数中按相关定出的权重与平滑衰减常数、以及判官的三标准与顺序交替。还需补的验证是声学一致性维度的专项测试、判官与人工的一致率、以及新编辑系统上的权重迁移,这些缺项不是否定已有证据,而是在把方法用于模型选择或强化学习奖励之前必须补齐的边界。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总