英文题目:SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.349

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #强化学习 #多语言 #语音质量评估 #语音伪造检测

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.5/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinghua Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Yifan Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shujie Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Junyang Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Yanzhe Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shiwan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinyu Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiaming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Yan Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理合成语音感知质量评估,输入为单段或成对多语言语音,输出为结构化解释性评价、改进建议与真伪判定,难点在于标量分缺乏归因且跨任务跨语言泛化弱。方法第一步构建SpeechEval数据集,经八维结构化问卷与人机协同流程产生多源真伪语音与细粒度标注,为监督提供多样化描述与维度标签。第二步以语音大模型统一四任务指令格式并做维度级思维链指令微调,使中间维度评分显式引导最终文本生成。第三步以冻结大模型为多维奖励器经组相对策略优化对齐有用性与准确性,其优化后输出直接作为最终可解释评价。与平均意见分回归和直接评测语音大模型相比,关键差异在于显式维度推理加自动多维奖励优化,因而兼顾可解释性与多任务通用性。在SpeechEval深伪检测评测任务下,SQ-LLM的EER错误率为6.249,低于微调基线FT Qwen2-Audio-7B的8.593。其结论适用边界受限于中英日法四语与设定四任务,低资源与代码切换等外延尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?要解决的评测困难是什么?

本文的输入是待评价的语音片段,可能是文本转语音系统合成的单条语音,也可能是需要横向比较的两条语音,还可能是需要判断真假的语音。目标不是再训练一个合成器,而是训练一个能当裁判的语音大模型,要求它能说出整体质量如何、在哪些维度好坏、两条谁更好、该怎么改、是否为伪造。必须保留的关键信息是数据规模与任务覆盖、模型 2 阶段做法、与人类标注的一致性度量以及伪造检测的误判代价,输出则是 1 篇能复述流程的技术解读。

现有做法的困难有两层。第一层是不可解释,平均意见分这类主观评测把听感压成一个分数,客观指标如梅尔倒谱失真只算信号距离,都不说明是可懂度差还是失真重,也不定位失真发生在第几秒。第二层是泛化窄,很多模型只在英语、单一来源和单一任务上训练,换语言、换合成器或换成比较与建议任务就不可靠。白话说,裁判只会亮分不会写评语,换了赛场就不认识动作。英文名是 Mean Opinion Score,缩写为 MOS,后文统一称 MOS;可解释评价指按维度给出理由的自然语言评价。

平均意见分 × 可解释评价: 平均意见分负责把多人听感压缩成一个标量分数,分工是排序和验收;可解释评价负责说明分数来自哪些维度,分工是定位失真类型、时间段和主观感受,二者搭配的原因是只给分无法指导改进,加上维度归因后才能把评价变成可执行的修改意见,组合意义在于让大模型同时输出结论与依据。

为核对可用性,本文涉及的第三方语音服务与伪造检测代码链接在本次核查中状态为可用。具体而言,阿里云语音合成页面、火山引擎控制台与微软语音服务页面均返回可用,伪造检测挑战仓库链接也返回可用。这只说明链接当前可达,不代表论文数据与模型权重可直接运行,复现仍需看论文仓库的实际文件。

同输入同目标的已有路线差在哪里?

按同输入、同目标、同监督来对照,已有路线可分 3 类。第一类是传统主客观评测,输入也是语音,目标是给出质量高低,监督来自人工打分或信号启发式,运行时是打分或算距离。它的优点是简单可复现,缺点是只有标量或二分类,没有维度归因,难以指导改进。第二类是任务专用质量预测器,如 MOSNet、UTMOS 与 Audiobox Aesthetics,输入是语音,目标是回归 MOS 或分类标签,监督是窄域标注。它们在单任务上相关性较好,但通常只做一种任务且语言受限,不直接生成理由。第 3 类是语音大模型直接做评测,输入是语音加指令,目标是生成评价,但原文报告其零样本效果弱,需要任务调优,且多为英语与窄任务。

成对比较 × 伪造语音检测: 成对比较负责判断样本甲与乙在各维度谁更好,分工是服务选型测试;伪造语音检测负责判断单条语音是真人还是合成,分工是服务真实性风控,二者搭配的原因是都依赖对失真与自然度的细粒度感知,组合后同一模型既能讲相对优劣又能讲绝对真假,扩大了评测的适用场景。

本文的选择是保留大模型的语言组织能力,但补上大规模多任务监督与结构化推理。教学例子是:同样听两条语音,专用模型可能只输出甲分更高,而本文模型要说甲在可懂度更清晰、乙在 3.8 秒到 4 秒有抖动、两者动态范围相近、甲语速更合适,再综合判甲优。这个例子只说明输出形态差异,不附加论文之外的数值效果。

四个任务各自要求模型做什么?

论文把评测拆成 4 个任务,覆盖真实工作流。语音质量评估要求对单条语音生成自然语言描述,要谈整体印象、技术维度与主观感受。语音质量比较要求对样本甲与乙判断谁更好并给出理由,对应实际的偏好测试。语音质量改进建议要求对次优语音给出可操作的修改方向,例如调语速、修音色或加强情感。伪造语音检测要求判断是真人还是合成或篡改,论文把它视为与真实感和质量退化相关的子任务。

标注协议把质量拆成三方面 8 个子维度。总体是一项整体质量,客观制作质量包括可懂度、失真、语速与动态范围,主观内容欣赏包括情感感染力、艺术表现与主观体验。比较时按维度给出甲优、乙优或相近,评估时多为 5 分制,语速是分类。之外还收集失真类型、情感类型与说话人性别 3 类标签,以及失真时长、严重程度、感知描述、说话人年龄与音色 5 个开放字段。这种设计让同一批标注既能做结构化监督,又能做自然语言监督。

从一条语音到一份评语的全景是什么?

沿一条语音走完全流程有助于建立依赖关系。输入是一段波形与一条任务指令,例如请评价这段语音的整体质量。语音编码器先把波形变成连续表示,保留与失真、语速和音色有关的声学信息。随后这些表示与文本指令一起送入语音感知的语言解码器,解码器先在 8 个维度上形成中间判断,再综合成最终答案。输出形态随任务切换,评估是描述段落,比较是带结论的对比段落,建议是改进条目,检测是真或假的类别词。

客观制作质量 × 主观内容欣赏: 客观制作质量负责可听技术项,分工是可懂度、失真、语速与动态范围;主观内容欣赏负责听者感受项,分工是情感感染力、艺术表现与整体体验,二者搭配的原因是技术干净不等于好听,必须分开标注才能区分修信号还是修表达,组合意义是让改进建议能分别指向降噪、调速或加强表现力。

下图展示了 4 种交互的期望形态,重点不是背诵某句话,而是看输出结构是否完整。评估要同时谈客观与主观,比较要先分维度再给总判,建议要可执行,检测要简洁。

看图路径: 1. 先看四个子面板的问题写法:单条评价、双条比较、单条改进、真假判断;2. 再看每个回答是否同时包含客观技术句与主观感受句;3. 核对比较面板是否给出失真时间段与说话人特征再下结论;4. 确认伪造检测面板只输出类别词而改进面板输出条目化动作

原论文 Figure 1:Example interactions showcasing the core capabilities of SpeechLLM-as-Judges.

论文图 1。原论文 Figure 1:“Example interactions showcasing the core capabilities of SpeechLLM-as-Judges.”。

这张图说明裁判不是只给分。评估面板提到中等的整体质量、可懂度偶发不清、在 2.4 秒到 2.9 秒有掉音、语速合适、动态平衡,主观上男中音顺滑但平淡。比较面板先讲甲可懂度更清晰、乙有抖动,再讲动态相近与语速差异,最后综合判甲优。建议面板把调语速、修音色与加强情感写成动作,检测面板只给类别。这种结构正是后文思维链与奖励要强化的形态。

编码器与解码器各自算什么?如何组合?

模型基于 Qwen2.5-Omni 构建,包含语音编码器与语音感知语言解码器。编码器把输入语音信号变换为连续表示,解码器结合任务指令生成维度分数、自由文本理由或分类结果。论文把 4 个任务统一为指令框架,用自然语言提示区分任务,用结构化输出保证可比。这种统一的好处是同一套参数能跨任务与跨语言复用,代价是需要足够的多任务标注来对齐听觉与语言。

语音编码器 × 语言解码器: 语音编码器负责把波形变成保留声学细节的连续表示,分工是听清失真、语速和音量;语言解码器负责把任务指令与语音表示变成结构化文本,分工是按维度推理并组织语言,二者搭配的原因是单一编码器不能直接讲理,单一语言模型听不到细粒度声学,组合后才能跨任务复用同一听觉前端而切换输出格式。

下图是训练总览,下半是第一阶段的指令调优,上半是第二阶段的奖励优化,中间用预测结果连接。

看图路径: 1. 先看下半阶段一的语音编码器加任务指令到解码器再到维度推理的箭头;2. 再看上半阶段二的冻结评价器给出四个奖励并回传优化策略;3. 确认中间预测结果是连接两阶段的唯一可学习输出

原论文 Figure 4:Overview of SQ-LLM training. Stage I uses instruction tuning with dimension-wise CoT reasoning.

论文图 4。原论文 Figure 4:“Overview of SQ-LLM training. Stage I uses instruction tuning with dimension-wise CoT reasoning. Stage II applies multi-aspect feedback for refinement.”。

从像素看,下半的输入是样本甲与乙的波形示意加比较指令,解码器上方先出现失真、情感与表达等维度推理框,再出现结果框,箭头指向上半的预测结果。上半的冻结评价器以 Qwen3 实现,输入是评价标准、真实标注与预测结果,输出是有用性、相关性、准确性与详细程度 4 路奖励。组合机制是阶段一立结构,阶段二磨偏好,前者保证维度不遗漏,后者让表达更贴近人类裁判的写法。

两阶段训练的监督从哪里来?参数如何更新?

第一阶段是对评估、比较与建议 3 类生成任务做带思维链的指令微调。给定指令与一条或两条语音,模型先在 8 个预定义维度上给出粗预测,再以这些中间信号引导最终答案。因为人工标注时已经收集了维度判断,所以这些维度天然成为结构化监督。联合损失包含维度损失与最终答案的交叉熵损失,系数控制中间推理的权重。原文给出该系数为 0.3,训练 8 轮,批量大小为 4,学习率为 1e-4,语音编码器冻结,只更新低秩适配器。

思维链推理 × 奖励优化: 思维链推理负责先给出 8 个维度的中间判断再写总结,分工是保证一致性与可追溯;奖励优化负责用有用性、相关性、准确性和详细程度 4 维打分来调整策略,分工是贴近人类偏好,二者搭配的原因是只做指令微调易写得通顺但不准确,只做奖励又缺中间监督,组合意义是先立结构再磨表达。

第二阶段是用奖励优化微调,论文写为广义策略梯度优化并指向对应方法。做法不是用偏好对,而是为每个任务设计自动奖励器,从有用性、相关性、准确性与详细程度打分,评价器是冻结的 Qwen3。每个维度先给 0 到 10 的整数再归一化加权,总奖励作为策略更新信号。权重分别设为有用性 1、相关性 1、准确性 2、详细程度 0.5,批量大小为 1,每条提示采样 4 个候选,适配器学习率为 1e-6。检测任务的奖励退化为预测与真值是否一致的示性。原文未给出优化器内部梯度路径与奖励方差处理细节,这部分属于缺项,不从模型名推定。

下图是数据构建流程,解释了监督来源的可复现性。左侧收集开源数据集、开源系统与商业合成接口的语音汇成原始池,中间按任务填问卷与附加细节,右侧是模型生成结构化描述后人工修订再扩写多候选再筛选,伪造标签则按来源元数据确定。

看图路径: 1. 先沿左侧数据收集到中间原始音频池再到右侧标注流程看主路径;2. 再看中间协议区分了打分问卷、比较问卷与改进维度勾选;3. 确认右侧闭环是模型生成初稿后人工修订再扩写再筛选

原论文 Figure 3:Overview of the SpeechEval data construction process, including data collection (left),…

论文图 3。原论文 Figure 3:“Overview of the SpeechEval data construction process, including data collection (left), task-specific annotation protocols (middle), and a human-in-the-loop annotation workflow…”。

该流程的要点是人机循环而非纯模型标注。问卷先固定维度与选项,模型把结构化答案转成初稿,人修订保证准确,再让模型扩写多样表达,人筛选合适变体。这样既保质量又保语言多样,且能跨任务与语言复用。商业接口链接本次核查可用,但论文未公开具体调用参数与合成文本清单,复现商业部分时需自行补齐并注意许可。

数据划分、基线与指标如何保证可比?

数据划分按任务分别处理。前 3 个任务的音频大致按 70% 训练、15% 验证、15% 测试划分,且验证与测试包含未见过的说话人、系统与文本,以测泛化。检测任务沿用伪造检测挑战的惯例,训练、验证与测试占比约为 20.5%、17.8% 与 61.7%,真语音比例逐段下降,部分伪造来源只出现在测试以测零样本,部分来源按不同比例切分以平衡语言与规模。论文还声明排除了跨任务数据泄漏。具体切分脚本见附录,本文只转述原则,不编造文件划分口径。

基线分 3 类。第一类是未经任务调优的多模态大模型,用于看零样本听评能力。第二类是自组管线,把 Whisper、WavLM 与 Audiobox 美学编码器等前端接语言模型,或对音频大模型微调,用于看有监督后的提升。第 3 类是专用专家模型,评估与比较用 MOSNet、UTMOS 与 Audiobox Aesthetics,检测用 RawNet2、AASIST 与 AASIST2。比较条件在附录统一了输入特征与训练设置,检测专家用加权交叉熵训练,但不同前端与参数量仍带来公平性差异,解读时需留余地。

指标分生成与检测两套。生成任务用自动文本相似度、基于大模型的总体打分与维度抽取,以及人工 1 到 5 分评价。评估任务还报告 7 个维度的皮尔逊相关与语速率分类准确率,比较任务报告维度偏好准确率。检测任务报告等错误率、最小检测代价与准确率,其中大模型的等错误率与代价只在语义有效输出上计算,准确率则对所有输出计算。方向是相关性与准确率越高越好,等错误率与代价越低越好,百分点差与相对百分比含义不同,不混用。

主结果:在人类一致性与伪造检测上谁更好?

先看评估与比较的人类一致性问题。比较条件是同一测试集与同一维度抽取流程,指标方向是总体维度相关越高越好、比较准确率越高越好。下表是原文总体质量维度的相关与比较准确率对照,包含零样本大模型、专家模型、自组管线、微调基线与本文模型。

MODELAssessmentComparison
Qwen2-Audio-7B0.0730.310
Qwen2.5-Omni-7B0.0700.203
MiDashengLM-7B0.1580.265
SQ-LLM (OURS)0.5200.751

表后解释需要同时讲收益与代价。表中本文模型在评估总体质量上达到 0.520,在比较总体质量上达到 0.751,均高于所列基线。专家模型明显强于零样本大模型,说明直接让通用音频模型当裁判并不可靠。代价是该表只看总体维度,不能代表失真与主观体验等难维度,且相关性高不等于因果改进,未胜出项如微调后的音频大模型在评估上只有 0.244,说明同一底座换了训练方式差距仍大。原文还用热力图指出失真与主观体验对多数基线最难,而语速与动态相对易,本文模型在难维度上更均衡,但具体每格数值需以原图为准。

再看伪造检测问题。比较条件是同一划分与同一有效输出计分规则,指标方向是等错误率与代价越低越好、准确率越高越好。下表整理了原文检测结果,包含专家系统、自组管线与微调模型。

模型条件任务阶段等错误率最小检测代价准确率
RawNet2 专家基线检测测试集15.8360.32572.036
AASIST 专家基线检测测试集18.1580.45071.599
AASIST2 专家基线检测测试集18.6330.41472.001
Whisper 接大模型自组管线检测测试集16.5020.41178.977
微调音频大模型基线检测测试集8.5930.19489.312
SQ-LLM 本文模型检测测试集6.2490.14289.358

表后解释要指出前端敏感性与未胜出边界。本文模型三项均为最优,但自组管线中 Whisper 前端尚可而其他前端明显退化,说明管线成绩高度依赖前端。未胜出项是零样本大模型准确率仅 20 到 60 多,且不能给出校准分数,表明开箱即用不可靠。按语言与来源拆分后,日语整体较稳,中文开源伪造与法语商业伪造下降更多,真语音准确率近乎完美,说明主要短板是对特定合成管线的泛化,而非把真人误判为假。训练与推理成本另计,不因准确率高就承诺延迟更低。

拿掉思维链与奖励优化会发生什么?

消融问题是结构化推理与偏好优化各自贡献多少。比较条件是同一底座与同一测试,指标方向是生成任务的大模型打分越高越好、检测等错误率越低越好。下表把普通微调、加思维链、再加奖励优化三档放在同一框架下,覆盖评估、比较、建议与检测。

训练条件适用任务评估打分比较打分建议打分检测等错误率
加思维链加奖励本文策略生成与检测测试6.8336.4347.4206.249

表后解释要区分增量大小。加思维链在 3 类生成任务与检测上均有清晰提升,建议任务从 6.733 到 7.018,检测从 8.574 到 6.264,支持结构化中间监督有助于显式区分低层退化与高层韵律情感。加奖励后进一步提升,建议任务到 7.420 增幅最大,支持偏好优化对开放式建议更有效。但评估与比较的 2 次增量较小,且人工评价的柱状图显示三档差距在误差线内仍有序,说明趋势成立但每组都显著的结论需谨慎。未评测边界是奖励权重与采样数的敏感性,原文只给一组权重,不做外推。

下图是人工评价的消融结果,纵轴为 1 到 5 分,横轴为三档训练,误差线为条目级自助区间。

看图路径: 1. 先看横轴三组:普通微调、加思维链、加奖励优化的顺序;2. 再比较同组内蓝色评估、绿色比较与黄色建议三根柱子的高低;3. 核对误差线是否为自助法区间并观察建议任务的提升幅度最大

原论文 Figure 7:Human-evaluated ablation results on the As- sessment, Comparison, and Suggestion tasks with 95%…

论文图 7。原论文 Figure 7:“Human-evaluated ablation results on the As- sessment, Comparison, and Suggestion tasks with 95% item-level bootstrap confidence intervals.”。

从像素看,普通微调三根柱子约为 3.55、3.64 与 3.87,加思维链后约为 3.90、3.98 与 4.08,本文策略约为 4.05、4.04 与 4.33。黄色建议柱始终最高且最终增幅最明显,蓝色与绿色在最后一步提升较小。这与自动打分表的趋势一致,支持奖励对建议任务帮助更大的判断,但人工只抽 60 条且每条至少 3 人评分,样本有限,不能推广为全量必胜。

哪些结论还不能下?边界在哪里?

论文明确的局限是只覆盖 4 种语言与固定任务集,低资源或语码混合语言、情感表达与说话人一致性等场景未包含。这是缺失证据而非技术错误,相关性也不是因果,不能把多语言平均分高理解为每种语言每种失真都好。伪造检测按来源拆分已显示中文开源伪造与法语商业伪造是短板,总体趋势不等于每组都成立。

另一边界是成本与部署。训练约 43 个 A100 小时,其中指令微调约 12 小时、奖励优化约 31 小时,推理开销、输出长度与实际延迟未系统报告。总体打分高不承诺误判率、延迟或成本同时改善,选用时需另测流式与长音频表现。标注者有语言背景与质检流程,但情感标签高度偏向中性,性别与失真类型分布也不均衡,模型可能对少数类欠拟合,使用时应先看混淆而非只看平均。

要复现先准备什么?先跑哪一步?

复现先做三件事。第一是拿数据划分表核对文件清单,前 3 个任务按约 70%、15%、15% 切分并保证说话人与系统不泄漏,检测任务按来源类型切分并保留零样本来源,任何自行重切分都会改变可比性。第二是固定评价管线,生成任务先跑自动相似度再跑大模型抽取维度,最后再做小规模人工抽检,检测任务先定有效输出的判定规则再算等错误率与代价,避免把自动指标当成人评。第三是固定训练超参,阶段一学习率 1e-4、批量 4、8 轮、维度权重 0.3 且冻结编码器,阶段二学习率 1e-6、每提示采样 4 个候选、4 维权重为 1、1、2、0.5,硬件预算按 43 小时规划。

论文声明代码、模型与数据公开,但本次只核验了第三方服务与挑战仓库链接可达,未验证论文仓库的权重与脚本是否可运行。区分代码开源、权重下载与系统可运行三件事,先跑推理复现评价格式,再跑小规模微调验证损失下降,最后才跑全量与奖励优化。商业合成部分因参数与文本未完全公开,建议先用开源系统复现主趋势,再补商业接口对照。还需补的验证是奖励评价器的稳定性、不同前端的敏感性以及少数情感与失真类型的分层指标,这些在原文只有部分展开。

何时值得尝试这种裁判范式?

当你的合成系统已经能出声,但不知差在哪、改哪一句、选哪个版本时,这种按维度讲理的裁判值得尝试。它的价值不在替代 MOS,而在把 1 次试听变成可定位的修改单,例如失真在第几秒、语速是否合适、情感是否平淡。复现时优先保证划分无泄漏与评价管线一致,再验证思维链是否减少维度遗漏,最后才用奖励优化打磨表达。

不适合的场景是只求一个排序分数、延迟敏感或语言与伪造来源超出覆盖范围时。此时专用打分器或检测器可能更轻更稳,大模型裁判可作为第二意见而非唯一门禁。记住论文直接报告的是在给定划分与指标下的相关性与准确率提升,有限解释是结构化推理与多维奖励有助于对齐人类偏好,未验证的是跨新合成器与新语言的长期稳定性,这部分需要你用自己的数据补测后再下结论。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总