英文题目:AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
会议身份:
conference:eacl:2026:conference-paper-id:2026.eacl-long.168
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#模型集成 #音频大模型 #模型评估 #语音 #语音质量评估
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Potsawee Manakul:机构信息未能从会议 PDF 纯文本可靠映射
- Woody Haosheng Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Michael J Ryan:机构信息未能从会议 PDF 纯文本可靠映射
- Ali Sartaz Khan:机构信息未能从会议 PDF 纯文本可靠映射
- Warit Sirichotedumrong:机构信息未能从会议 PDF 纯文本可靠映射
- Kunat Pipatanakul:机构信息未能从会议 PDF 纯文本可靠映射
- William Barr Held:机构信息未能从会议 PDF 纯文本可靠映射
- Diyi Yang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究大音频模型成对语音评测,输入为两段待比音频加文字指令与转录参考,输出为优劣或是否匹配的结构化判定,难点在于副语言与韵律线索细微主观且专用质量模型分散难跨域复用。AudioJudge先以成对比较提示让大音频模型直接输出推理与标签,使判定可解析进入后续拼接优化。接着将上下文示例与待测指令及两段音频分别拼接为连续音频流,以减少音频文本交替造成的模态切换负担,其输出作为统一听觉上下文送入模型。最后针对综合指令按词汇内容与副语言表现与语音质量拆分三个专用法官并多数投票集成,得到兼顾内容与表达的最终排序。相对以往单任务微调质量网络,连续拼接保留跨段可比上下文而无需大量标注,多方面集成避免单一提示混淆内容与表达维度。在ThaiMOS语音质量评估任务下,AudioJudge的准确率为64.0,高于UTMOS的53.5。该结论适用边界受限于英语自然度与中文质量与泰语发音等已测语料,语速与说话人辨别及强噪声与位置冗长偏差下仍存在失败条件。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/tatsu-lab/alpaca_eval — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决什么困难
本文的输入是语音指令与两个待评语音回应,目标是让大音频模型直接输出谁更好或是否相同,从而替代为每个语音特性单独训练专用系统的做法。初学者可以把大音频模型理解为能听语音并用文字回答的模型,英文名为大型音频模型,缩写为 LAM,裁判式用法英文为 AudioJudge。作者指出当前语音评测有两个困难,第一是每种特性都需要设计专用系统,第二是自动方法与人类偏好相关性差。
研究把评测分为两类场景,一类是样本级的音频特性检测,包括发音是否一致、哪段语速更快、是否为同一说话人,以及合成语音的自然度与质量,另一类是系统级的偏好排序,即多个语音生成系统按人类喜好排出的顺序能否被模型复现。前者服务于快速分析生成语音的具体属性,后者服务于自动基准与系统比较。输出保留了关键信息,包括所用模型版本、提示拼接方式、样本量与人类上限,以便他人复述方法与核对条件。
已有路线在相同输入与目标下是如何做的
在相同输入与相近目标下,已有路线可分为 3 类。第一类是文本裁判的扩展,先把语音转写为文本再用文本大模型评价,这种做法只能看到词汇内容,看不到语调、音质与表达方式。第二类是专用语音质量系统,例如用于平均意见分预测的 UTMOS、MOSANET 加与 SALMONN 微调版本,以及用于可懂度的客观指标,它们在训练域内准确但需要大量标注与定制结构,换语言或换任务时性能下降明显。
第 3 类是语音基准,覆盖语音助手、对话理解与音频推理等客观任务,但多用固定指标而非人类主观偏好。论文的对照思路是同一音频对既可用专用模型打分,也可用 AudioJudge 直接比较,从而检验统一提示框架能否在多维度上保持稳定。本文不把类别差异当作同条件胜负,而是按输入模态、监督来源与运行阶段区分适用边界。
要回答的具体问题与可检验的形式
本文要回答的问题是何时与如何有效使用 AudioJudge。例子是为了教学而设的例子,不是论文新增数据,假设有一条要求用英式与美式两种发音说番茄并讲解区别的语音指令,模型甲与模型乙各生成一段语音回应,裁判需要听完两段回应后给出甲更好、乙更好或持平。可检验的形式有两种,一种是样本级二选一准确率,随机猜测为 50%,另一种是系统级排序相关,用斯皮尔曼相关衡量自动胜率排序与人类胜率排序的一致性,越高表示越接近人类。
论文还要求检验提示工程的作用与鲁棒性,包括拼接是否减少模态切换负担,转写文本是否有帮助,多方面拆分是否有增益,以及噪声、冗长与位置是否改变结论。
AudioJudge 全景:一个样本如何走完输入到输出
先沿一个样本走完流程,输入是裁判系统提示、用户消息与两段待评音频,系统提示规定只看发音、语速、说话人或音质等目标维度并要求输出推理与标签,用户消息重复任务要求,模型先听音频再写出文字推理,最后输出结构化标签。成对比较是本文主流程,1 次比较两段音频,多轮比较可汇总为系统胜率。逐点打分是作为对照的另 1 流程,1 次只评一段音频并给出绝对分数,再转化为成对偏好。论文报告成对比较更可靠,因此后续主实验采用成对比较。
下图展示了从语音指令到待评模型回应再到裁判预测的主路径,右侧同时列出 3 类评价方面与各自基线,有助于理解统一框架要覆盖的范围。
看图路径: 1. 从左侧语音指令与待评模型输出出发,沿箭头看到裁判的输入与输出;2. 对照右侧三个评价方面,确认词汇内容、语音质量与副语言各自的考察点;3. 注意裁判提示与音频回应如何汇入同一个判断框

论文图 1。原论文 Figure 1:“AudioJudge takes an instruction and audio responses and then performs evaluation (e.g., pairwise in this illustration) based on a judge evaluation prompt.”。
该图显示指令先分发给两个待评模型,各自生成语音回应后连同裁判提示一起送入 AudioJudge,最终输出成对胜负。右侧把评价分为词汇内容、语音质量与副语言三方面,分别对应转写加文本裁判、平均意见分系统与暂无基线的细粒度表达判断。这说明同一裁判流程需要通过更换提示来切换考察维度,而不是更换模型结构。
拼接策略与转写增强各自负责什么
音频拼接的白话含义是把多段音频首尾相接合成一条连续音频,英文为音频拼接,上下文学习的白话含义是给模型看几个带答案的示例再让它判断新样本,英文为在上下文学习。论文测试 5 种做法,不拼接、只拼接示例对内、把全部示例拼成一条长音频、只拼接测试对、示例与测试都拼接即全文拼接。全文拼接时示例部分附带每个示例的标签,测试部分把指令与两段回应拼在一起。转写增强的白话含义是额外提供自动语音识别或人工转写文本,期望让模型免于识别词内容而专注比较。
大音频模型 × AudioJudge: 大音频模型负责接收语音波形并生成自然语言推理与判断,大音频模型分工是听懂并比较声音,AudioJudge 负责把这种能力约束为评测动作,分工是给定指令、音频对与输出格式并判定胜负,搭配理由是前者已有语音理解但缺评测标准,后者提供成对比较流程,组合意义是无需为每个语音特性训练专用模型即可复用同一模型做多种判断。
音频拼接 × 上下文学习: 音频拼接分工是把多个分散音频文件合并为一条连续音频流并保留停顿等声学边界,上下文学习分工是提供带标签的示例让模型模仿判断尺度,搭配理由是分散的音频文本交替会迫使模型频繁切换模态,而连续流更利于直接对比,组合意义是在示例与测试端同时拼接后形成全文拼接,使模型在 1 次连续听辨中完成示例学习与测试比较。
从实现角度看,不拼接需要多次上传独立音频文件并在音频与文本之间交替,拼接则减少这种交替。论文的直觉是连续音频流更利于模型直接对比,而分散上传会增加模态切换负担。转写增强在发音任务上有一定帮助,但在多数副语言任务上帮助很小甚至下降,因此后文不再深入该路线。
多方面拆分与投票如何组合
多方面集成的白话含义是把综合评价拆给 3 个专用裁判分别打分,英文为多方面集成,多数投票的白话含义是少数服从多数确定最终标签。3 个裁判分别是词汇裁判只看准确性、完整性与组织而忽略音质与表达,副语言裁判只看语调、韵律、表现力与口音是否符合要求而忽略内容好坏,语音质量裁判只看清晰度、自然度、流畅度与发音正确性而忽略内容与表达。每个裁判独立输出第一段更好、第二段更好或持平,再投票得到集成预测。该设计针对同时要求理解指令并生成合适内容与合适表达的任务,例如要求耳语讲故事或模仿非语言声音的指令。
成对比较 × 逐点打分: 成对比较分工是同时听两段音频并直接判定第一段更好、第二段更好或持平,逐点打分分工是独立给每段音频打出 1 到 5 分的绝对分数,搭配理由是前者只需要相对排序而后者需要校准绝对刻度,组合意义是论文以成对比较为主并用逐点打分做对照,显示直接比较更可靠而绝对打分误差更大。
多方面集成 × 多数投票: 多方面集成分工是把综合评价拆成词汇内容、语音质量与副语言 3 个专用裁判,各自只看被分配的维度,多数投票分工是把 3 个裁判的胜负标签汇总为最终标签,搭配理由是综合指令同时要求内容、音质与表达,单一提示容易混淆维度,组合意义是通过分工隔离干扰再投票合并,提升在多方面数据集上与人类排序的一致性。
这种拆分不是简单重复 3 次评价,而是通过提示隔离干扰,使每个裁判的推理集中在被分配的信号上。论文在系统级实验中比较单裁判与集成,并进一步比较集成加拼接的效果,发现最优组合与模型有关,说明拆分与拼接是正交的改进方向。
本研究训练了什么,没有训练什么
本研究没有训练新的大音频模型,也没有微调裁判模型的参数,不存在梯度更新、参数冻结切换或优化器配置。真实计算过程是调用已有模型进行推理,包括 GPT 杠 4o 音频版本与不同版本的 Gemini 闪光系列,以及少量开源模型的对照。
构造方面的工作包括采样与合成评测数据,例如从已有语音质量库中按平均意见分差大于 1 筛选样本对,从对话数据中过滤适合口语的样本并用多种声音合成语音,以及为语音进语音出任务编写 82 条覆盖发音、风格情感、韵律表达与非语言音效的指令。标注方面包括发音是否一致的人工二值标注与系统偏好的人类成对投票。推理方面是按提示模板组织系统提示、音频与用户消息,解析模型返回的推理与标签,再按准确率或排序相关汇总。
由于没有训练阶段,复现重点是调用版本、提示文本、音频拼接方式与随机种子,而非训练超参数。
数据、划分、指标与运行条件如何设定
样本级特性检测使用 6 组数据,发音数据为 200 对词典参考录音与模型朗读的匹配判断,语速数据为 187 对同一说话人的快慢判断,说话人数据为 200 对是否同一人的判断,另有英语自然度、中文带噪质量与泰语发音质量各 200 对。人类上限由 2 名未参与原始标注的人员按相同指令独立标注得到,准确率在 69.5%-83.0% 之间,说明任务本身有主观性。
系统级偏好使用 2 个数据集,口语化对话数据从 33K 轮对话中保留 2 轮并过滤出口语化子集,合成约 7.8K 条并抽 1K 条评测,语音进语音出基准包含 82 条指令与 13 个系统的人类投票 508 次。指标方面,样本级用成对准确率,方向为越高越好,系统级用斯皮尔曼相关,方向为越高表示自动排序越接近人类排序。模型标识在附录中明确,GPT 为 2024 年 12 月 17 日预览版,Gemini 为对应闪光版本。鲁棒性实验采用零样本无拼接以隔离固有偏置,噪声实验只在词汇内容数据上加白高斯噪声以免改变非词汇标签。
样本级检测与系统级排序的主结果是什么
样本级检测首先要回答基础提示是否足够。论文报告基础提示在发音与语速上接近随机猜测,说明强模型在无引导时难以捕捉副语言线索,而语音质量任务的基线相对更好。接着比较提示策略,传统不拼接的上下文学习提升很小,只有语速在 4 样本时有显著改善,测试端拼接带来明显增益,全文拼接 4 样本平均最好,在发音、语速与说话人上显著超过基线并接近部分人类水平,但在语速上仍与人类差距较大。
超过 4 样本后增益递减,6 样本与 8 样本有时下降,因此后文采用全文拼接 4 样本。 下表整理了样本级检测的关键对照,比较问题是不同提示是否在公平的同模型同数据下提升准确率,指标方向为准确率越高越好。
| 条件 | 指标 | 基线 | 测试拼接零样本 | 全文拼接 4 样本 |
|---|---|---|---|---|
| 发音准确率 | 成对准确率 | 46.0% | 66.0% | 66.5% |
| 语速准确率 | 成对准确率 | 46.9% | 54.2% | 55.3% |
| 说话人准确率 | 成对准确率 | 61.5% | 64.0% | 70.0% |
| 人类上限参考 | 成对准确率 | 69.5% 到 83.0% | 69.5% 到 83.0% | 69.5% 到 83.0% |
该表的主要收益是拼接显著改善副语言细粒度判断,代价是仍未完全达到人类水平且需要更长的拼接音频与更多示例,未胜出项是转写增强与不拼接的上下文学习,它们在多数任务上提升有限。
与专用模型相比,专用网络在域内数据上更强,但在跨域泰语数据上下降,而 AudioJudge 用很少标注即保持相对稳定,显示其在多语言或低资源评测中的替代价值。 系统级排序要回答自动排名能否替代人类排名。论文报告零样本已具较强相关,GPT 在口语对话上达到 0.902 而在多方面基准上为 0.731,Gemini 则分别为 0.805 与 0.846,全文拼接 4 样本进一步提升,多方面集成在多方面基准上更高,Gemini 零样本集成达到 0.912。
下表整理了系统级排序的对照,比较问题是拼接与集成是否提升排序相关,指标方向为相关越高越好。
| 条件 | 指标 | 基线零样本 | 拼接 4 样本 | 多方面集成 |
|---|---|---|---|---|
| 口语对话 GPT | 排序相关 | 0.902 | 0.931 | 不适用 |
| 口语对话 Gemini | 排序相关 | 0.805 | 0.877 | 不适用 |
| 多方面 GPT | 排序相关 | 0.731 | 0.775 | 0.802 |
| 多方面 Gemini | 排序相关 | 0.846 | 0.857 | 0.912 |
| 随机猜测 | 排序相关 | 0.000 | 0.000 | 0.000 |
该表显示拼接在 2 模型 2 数据集上一致提升,集成在多方面任务上增益更大,但集成加拼接的效果与模型有关,对一个模型继续提升而对另一模型略有下降,说明最优提示与模型相关。
\[Spearman = 0.912 p-value = 1.398e-05\]上式是多方面集成在语音进语音出基准上取得高相关的量化标记,论文同时给出很小的显著性值,支持自动胜率与人类胜率强相关的判断,但仍需注意该相关是在特定 82 条指令与 13 个系统上测得。 噪声鲁棒性的导读是观察加噪后裁判是否改变原判,横轴为信噪比,纵轴为预测不变比例,3 条曲线分别对应原判为选中、未选中与持平。
看图路径: 1. 先确认横轴为信噪比条件与纵轴为预测不变比例;2. 比较最初判为选中、未选中与持平的三条曲线随噪声的变化;3. 观察在 1 分贝低信噪比下曲线是否仍明显高于随机水平

论文图 2。原论文 Figure 2:“Noise robustness analysis. Percentage of unchanged GPT-4o-Audio predictions across varying Signal-to-Noise Ratios on ChatbotArena-Spoken.”。
该图显示即使在 1 分贝低信噪比下,原判为未选中的不变比例仍在 90% 以上,原判为选中的在 80% 以上,原判为持平的在 70% 以上,均明显高于完全损坏时的三分之一,支持模型对声学噪声保持稳定的判断,但这只针对词汇内容任务,不能推广到噪声会改变标签的非词汇任务。
哪些做法没有赢,偏置与打分方式暴露什么边界
消融首先比较逐点打分与成对比较。论文在有平均意见分的数据上让模型独立打 1 到 5 分再转化为成对偏好,结果显示逐点转化的准确率为 55% 到 59%,而直接成对比较为 65% 到 70%,均方误差也较高,拼接虽能降低误差但仍难做到精确校准。这支持主流程选择成对比较的决定,也说明绝对分数更难。 下表复述逐点与成对的对照,比较问题是在相同语音质量数据上哪种输出形式更可靠,指标方向为准确率越高越好、误差越低越好。
| Setup | SOMOS | TMQ | ThaiMOS |
|---|---|---|---|
| PointW-0shot | 52.8 | 46.5 | 51.5 |
| PointW-4shot | 50.3 | 51.8 | 55.3 |
| PointW-4shot-Concat | 55.3 | 59.3 | 53.5 |
| PairW-0shot | 70.5 | 70.5 | 65.5 |
该表的主要信息是即使给 4 样本并拼接,逐点转化的准确率仍明显低于直接成对比较,未胜出项是逐点零样本与逐点不拼接 4 样本,它们的误差更大。这意味着需要绝对分数的场景不能直接复用成对结论,还需额外校准。 冗长偏置的导读是观察在人类判为持平但长度差 5 词以上的样本上,模型是否系统性偏好更长语音。
看图路径: 1. 对比四个模型中偏好更长与偏好更短的两组柱高;2. 记录每个模型顶端标注的具体百分比数值;3. 确认在持平样本上是否系统性偏向更长回应

论文图 5。原论文 Figure 5:“Verbosity bias on ChatbotArena-Spoken.”。
该图显示 4 个模型偏好更长的比例均高于偏好更短的比例,例如一版模型偏好更长为 55.7% 而偏好更短为 39.1%,另一模型为 54.0% 对 34.2%,论文经自助检验认为偏向显著。这支持存在冗长偏置的判断,但由于持平样本仅占约 20% 且偏置不偏向特定系统,整体排序相关仍可保持在高位。 位置偏置的导读是把同一音频对按正反两种顺序各测 1 次,统计模型始终偏好第 1 个或第 2 个位置的比例。
看图路径: 1. 对比位置 1 偏置与位置 2 偏置在四个模型上的差异;2. 重点观察最左侧模型的位置 1 柱是否明显高于其他模型;3. 判断哪个模型在交换顺序后最不稳定

论文图 7。原论文 Figure 7:“Positional bias on ChatbotArena-Spoken. Po- sition 1 Bias and Position 2 Bias indicate the percentage of cases where the model consistently prefers the first or second response.”。
该图显示多数模型偏好第 1 个位置,其中一版模型的位置 1 偏置达 18.3% 而位置 2 仅 5.1%,GPT 的位置 1 为 8.9% 而位置 2 为 4.3%,只有一版模型两侧接近而无明显方向。结合非词汇任务的补充分析,语速任务出现较大的近因偏置,任务越难即平均意见分差越小,位置偏置越大。这说明交换顺序与多轮聚合在实际部署中不可省略。
在什么条件下结论不再成立
论文明确报告的局限包括副语言任务仍明显低于人类,尤其语速与说话人差距较大,说明当前模型的听觉分辨能力存在根本短板。全文拼接与多方面集成虽有效但增加音频长度与调用成本,限制大规模实用。语音进语音出基准规模较小,仅 82 条指令与 13 个系统共 1 千多条数据,难以覆盖真实场景的多语言、方言与表达多样性。鲁棒性结论也有边界,噪声实验仅在词汇内容上验证,未测量误判率、延迟与成本,因此不能承诺这些量得到改善。
相关性高不等于因果成立,也不等于每组比较都正确,困难样本上偏置更大。转写增强、开源模型音频输入与音频输出等对照显示,直接音频评价的优势主要体现在专有模型上,开源模型在音频输入下退化明显,因此结论不能无条件推广到所有模型。
复现先做什么,需要保留哪些条件
复现应先固定模型版本与调用日期,再按附录提示词逐字组织系统提示与用户消息,注意发音、说话人、语速、语音质量、口语对话与多方面基准各有不同模板。音频处理需复现拼接方式,包括示例内部拼接、全部示例拼接与测试对拼接的边界停顿,并在全文拼接 4 样本上优先验证。数据方面需按原文采样量与筛选阈值重建,例如语音质量对要求平均意见分差大于 1,对话数据需过滤出口语化子集并记录合成声音。
评估时样本级统计成对准确率并用自助法检验显著性,系统级先计算对参考系统的胜率再算排序相关。人类上限与偏置检查应同步复现,包括 교환音频顺序的位置检验与持平样本的长度检验。资源状态方面,第三方代码链接当前可用,但这只是 AlpacaEval 方法参考,不是本文全部代码已公开的证据,权重下载与系统可运行需按原文联系方式与附录另行确认。
何时值得尝试,还需补哪项验证
当任务是快速比较两段语音的相对好坏或对多个语音系统排序,且能承担拼接音频与多次调用成本时,值得尝试全文拼接加成对比较,多方面任务可进一步拆为词汇、音质与副语言三裁判再投票。当需要绝对分数、精确到小数点的质量刻度或低延迟在线评测时,不宜直接套用本文结论。还需补充的验证包括更大规模与更多语言的语音进语音出基准、困难样本上的误判率分析、长度归一化与顺序随机化后的偏置缓解效果,以及推理开销与实际延迟的测量。
常见误解是把系统级高相关当作样本级已解决,实际上样本级细粒度判断仍接近人类下限,另一误解是把抗噪稳定当作所有任务都抗噪,实际上该结论仅在不改变标签的词汇任务上得到验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses