英文题目:ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

会议身份:conference:interspeech:2026:conference-paper-id:jeon26d_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #音频大模型 #模型评估 #语音属性识别

评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Jisu Jeon:机构信息未能从会议 PDF 纯文本可靠映射
  • Seungyeon Jwa:机构信息未能从会议 PDF 纯文本可靠映射
  • Joosung Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinhyeon Kim:机构信息未能从会议 PDF 纯文本可靠映射
  • Woojin Chung:机构信息未能从会议 PDF 纯文本可靠映射
  • Hwiyeol Jo:机构信息未能从会议 PDF 纯文本可靠映射
  • Jeonghoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
  • Jonghyun Choi:机构信息未能从会议 PDF 纯文本可靠映射
  • Soyoon Kim:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大型音频语言模型(Large Audio-Language Model, LALM)作为语音评测者时,输入为音频对与准则指令,输出为[[A]]、[[B]]或[[TIE]]三选一,难点在于细粒度副语言学差异易被整体自然度掩盖且模型不愿弃权。基准构建先从Expresso、Sonos Voice Control Bias Assessment、LibriTTS、EARS的官方测试划分中按标签抽取目标与非目标样本,再按准则构造非Tie对比与双好或双坏Tie对,最后施加同转录与跨转录控制及AB换位以分离声学与词汇依赖。评测流程将同一准则模板施加于Gemini 2.5 Flash、GPT-4o Audio、Kimi-Audio-7B-Instruct、Qwen2.5-Omni-7B与SpeechJudge-7B共5个代表性LALM并与6人人类多数投票对比,输出整体准确率与Tie校准、位置偏差等多维诊断。与仅报告整体偏好的已有语音评测基准相比,该机制差异在于显式要求模糊时弃权与转录解耦,从而暴露校准失效与模态依赖。在ParaPairAudioBench基准下,Gemini 2.5 Flash的准确率为61.5%,低于人类的准确率79.2%。结论仅适用于受控自然语音的成对辨别,不覆盖生成语音分布外泛化与Rate的Tie场景,且未验证去偏方法的有效性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

本文解读的对象是 1 篇语音评价基准论文,输入是公开自然语音库中截取并配对的音频,目标是检验大音频语言模型作为裁判能否按指令判断副语言属性。所谓副语言,在这里先用白话说就是文字之外怎么说,包括说话风格如耳语或困惑、全局快慢、某个词是否重读、听起来像儿童还是老人、像男性还是女性,对应英文为 paralinguistic。所谓裁判模型,即 LALM-as-a-Judge,指让能同时处理音频和文字的大音频语言模型 Large Audio-Language Model 直接听两段音频并裁决哪段更符合要求。

输出不是整体自然度打分,而是三选一:选音频 A 记为[[A]],选音频 B 记为[[B]],相当则选[[TIE]]。本解读必须保留的关键信息是数据规模与划分、5 个维度的定义、平局与非平局的构造、文本控制与换序评估、人类基线与 5 个被测模型的对照条件。你读完应能复述每个样本如何从两段音频加一条维度指令走完全流程,并在自己机器上按同样三选一模板重跑。后续先讲任务与相关路线,再讲方法全景与组件分工,然后讲构造与推理的真实计算,最后讲实验条件、结果反证与复现收束。

资源状态方面,代码与数据集链接本次均返回可用,当前可用已公开,读者可按文末官方地址获取,但本解读的事实仍以论文原文证据为准。

已有路线解决了什么,还缺哪块拼图?

在文本领域,用大语言模型当裁判 LLM-as-a-Judge 已经显示出与人类偏好较强的对齐,做法多是成对比较谁的回答更好,因为相对判断比绝对打分更稳定。但这类方法主要操作文字表示,无法直接评价语音的声学与副语言特性。搬到语音后,早期工作沿两条线走。一条是整体质量线,例如微调一个音频语言模型输出自然度偏好,或直接提示模型评价整体语音质量,关注的是听起来自然不自然。

另一条是解释与扩展线,分析裁判的决策过程、给出可解释说明,或把语音到语音的评价拆成内容保真与副语言等多个感知维度,也有人做韵律基准或会话语音能力基准。论文把这些工作定位为已覆盖整体偏好和音频语言理解,但缺少在受控成对条件下的可靠性分析。也就是说,同样输入、同样目标、同样运行阶段下,模型能否稳定区分细粒度副语言差异,能否在模糊时弃权,是否依赖文字抄近道,换个顺序是否改判,这些都没有被系统测量。

本文的拼图就是把副语言裁决分解为维度级辨别、平局校准、文本敏感性和顺序稳健性,用同一套三选一协议同时测四件事。教学例子:好比考试只给总分看不出偏科,这里把一张综合卷拆成听力、口语、语法分项,并加入空题可交白卷和题序打乱两种防作弊设计。

要诊断的具体问题是什么?难在哪里?

具体问题是:给定两段语音和一条明确写出目标属性的指令,裁判能否稳定指出哪段更符合该属性,无法区分时能否输出平局。难点有 3 层。第一层是属性层级不同。性别年龄是相对稳定的生理特征,与基频和共振峰相关;语速是遍布整句的全局时间 pacing。

重音是落在某个词上的局部能量音高时长突起;风格是横跨声学质地与情感意图的高层表达,例如耳语、高兴或悲伤。把它们压成一个自然度分数,就会看不见模型擅长全局线索却栽在局部突起上。第二层是模糊不可判。两段都好或都不好时正确答案是平局,若协议不允许弃权,模型被迫二选一也能蒙对一半,校准问题就被掩盖。

第 3 层是文字捷径。许多音频语言模型内含语音识别预训练的编码器,判定时可能先在心里转写文字,再用文字差异猜答案,而不是真听韵律。因此必须控制文本相同与不同两种条件,才能看出声学依赖与词汇依赖各占多少。论文把这 3 层转为可操作的设计:5 维分轴、显式平局、文本控制加换序重测,缺任何一块都会把失败误读为成功。

方法全景:一个样本如何走完输入到输出?

沿一个样本走完全程最清楚。输入是音频 A、音频 B 和一条维度指令,例如哪段更好地传达了目标风格耳语。两段音频在同一次推理中作为分开的片段呈现,并用文字标识 Audio A 和 Audio B 加以区分,避免拼成一条长波形带来的切分歧义。指令明确写出要比的是风格、语速、重音、年龄还是性别中的哪一项,以及目标取值是什么,例如以期望速度说话、在指定词上重读、听起来像某年龄组或某性别。模型要输出三者之一:[[A]] 表示 A 更好,[[B]] 表示 B 更好,[[TIE]] 表示无有意义区别。

表示层面,模型内部既要处理声学信号,也可能隐式转写词汇,论文正是要利用后文的文本控制来诊断它到底用了哪条通路。组件层面,上半是裁判,下半是诊断,诊断包含五轴划分、文本控制、位置偏置、平局与非平局 4 个模块。目标层面,每个维度定义了一个谁更符合生成指令的任务,例如风格是按指定方式说,语速是按期望节奏说,重音是在目标词上加压,年龄性别是听起来像指定人群。

输出层面,所有模型用同一套按维度定制的提示模板,不为某个模型改写,以保证公平。

下面这张总览图把上述主路径与诊断模块画在了一起,先看上半如何从两段输入走向三选一,再看下半 4 个诊断如何承接输出做 2 次剖面。

看图路径: 1. 先看上半 Judge 框左侧两条波形与目标风格指令如何汇入中间裁判;2. 再看右侧三个输出按钮与 A 大于 B 等标注的对应关系;3. 最后看下半 Diagnose 框四个诊断模块与上半输出的箭头衔接

原论文 Figure 1:Overview of PARAPAIRAUDIOBENCH. Given a pair of speech samples and an instruction specifying the…

论文图 1。原论文 Figure 1:“Overview of PARAPAIRAUDIOBENCH. Given a pair of speech samples and an instruction specifying the evaluation criterion, LALM-as-a-Judge assesses them and outputs one of [[A]],…”。

图中上半 Judge 框左侧画出两条不同包络的波形,分别标注 Audio A 与 Audio B,下方写明比较目标是 Style,中间是一个戴耳机持小木槌的机器人形象,右侧并列 3 个按钮分别对应[[A]] 为 A 优于 B、[[B]] 为 A 劣于 B、[[TIE]] 为都好或都坏,箭头清晰表明双音频加指令汇入同一裁判再分叉为三选一。下半 Diagnose 框用 4 个小框承接上半箭头,依次是五轴集合、文本相同与跨文本对照、A 与 B 双向箭头的位置偏置、天平式平局与非平局对照。这张图的可执行价值在于它 1 次性固定了全文术语:后文所有准确率、校准、偏置数字都是在这个三选一和四诊断框架下计算的,复现时只要照此搭输入输出解析器,就不会把平局误算成错误二选一。

五个维度与三类对照各自负责什么?

5 个维度的选择覆盖了从静态说话人特质到动态韵律控制的层级。性别年龄对应声道共振与基频等稳定线索;语速对应整句的全局时间 pacing;重音对应词级能量音高时长的局部突起;风格对应从耳语这类声学质地到高兴悲伤这类情感意图的高层表达。

每个维度都配有明确的生成指令语义,评判时只看是否满足该维度目标,不用整体好听与否干扰。两类核心对照承担诊断职责。第一类是平局对照。风格年龄性别的平局在都好与都坏之间平衡,两种情况下正确答案都是平局;重音的平局只用都坏,因为要造出两段在同一词上重音轮廓感知相同的都好对,需要帧级标注验证,做不到可靠。

语速完全不设平局,因为即使标签相同,自然录制的节奏仍有波动,无法保证真相当,留待未来工作。第二类是文本对照。整体在同文本占百分之 47 点 0 与跨文本占百分之 53 点 0 之间平衡,语速只用相同文本以免句长干扰,重音的跨文本对仍要求两句都包含目标词,以免因缺词而无法比。第 3 类是顺序对照。每对都测 2 次,交换 AB 顺序,分别计算正确答案在 A 位与 B 位时的准确率,两者之差即位置偏置。

大音频语言模型 × 裁判模型: 大音频语言模型负责同时接收两段波形和文字指令并输出比较结果,裁判模型规定它必须在该比较中承担判分职责,二者搭配的理由是只有能听声学细节的模型才可能替代人评副语言,组合后新增的作用是把生成语音评价从整体自然度推进到按维度可诊断的成对裁决。

成对比较 × 平局: 成对比较负责把绝对打分转化为选 A、选 B 还是相当,减轻打分刻度校准负担,平局负责在两段都符合或都不符合目标时要求弃权,二者搭配的理由是模糊条件下强行二选一会掩盖不可判情形,组合后新增的作用是同时测出辨别力和遇到歧义时是否敢于不判。

同文本 × 跨文本: 同文本负责固定词汇内容让两段只差声学实现,跨文本负责改变句子内容引入词汇和整体韵律差异,二者搭配的理由是裁判模型内部可能隐含语音转文字通路,组合后新增的作用是分离模型到底在听能量基频时长,还是在借文字内容猜风格重音。

非平局准确率 × 平局准确率: 非平局准确率负责度量有明确优劣时选对的比例,平局准确率负责度量本应判相当时成功弃权的比例,二者搭配的理由是只看总准确率会把强行猜对和不敢弃权混在一起,组合后新增的作用是直接暴露校准失败即辨别尚可但弃权崩塌。

位置偏置 × 交换一致性: 位置偏置负责度量正确答案放在 A 位与 B 位时准确率之差,交换一致性负责度量交换顺序后是否给出同一判决且判对,二者搭配的理由是单次呈现无法区分模型真听懂还是偏爱先听或后听,组合后新增的作用是检验裁判在部署中调换顺序是否依然可靠。

把这些放在一起看,风格与重音的对比最见功力。风格在文本相同时只比声学质地,文本不同时词汇变化会干扰判断;重音在文本相同时必须捕捉同一句话内细微的词级突起,文本不同时反而多了整句节奏语调的脚手架。这种不对称只有在五轴加文本控制下才显形,单轴自然度评价会把两者平均掉。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练新的裁判模型,也没有报告梯度路径、参数冻结与更新、优化器或训练轮数,因此不能从模型名字推定其内部实现细节。真实计算是构造加调用加聚合。构造侧只用官方测试集切分以减轻预训练污染,按维度标签约束、文本控制要求和平衡条件做 2 次采样,论文明说在标签、文本与平衡三重约束下优先保证受控诊断单元,而非穷举语料中所有可能配对。调用侧评估 5 类模型:商用两个为 Gemini 2.5 Flash 与 GPT-4o Audio,开源两个为 Kimi-Audio-7B-Instruct 与 Qwen2.5-Omni-7B,外加一个为整体自然度微调的裁判 SpeechJudge-7B。

要求被测模型必须支持单次推理内处理两段音频。除 SpeechJudge 按原文协议以温度 1 点 0 跑 10 次多数投票外,其余模型均用贪心解码。聚合侧总准确率是两种顺序条件的平均,并分别报告非平局与平局准确率;另算 Acc@A 与 Acc@B 即正确答案全放在 A 位或 B 位时的准确率,其差即位置偏置;一致性指 2 次顺序下决策字符完全相同的比例,一致且正确指一致又判对的比例。

人类评价在 250 条子集上进行,每维度 50 条,尽量在平局与非平局、文本、答案位置上平衡,由 6 名评分者独立打分,为避免记忆污染不放 AB 交换的重复项,评分者间一致性为 Fleiss kappa 等于 0 点 67。由于无训练,本节缺项明确为无学习率、批量大小与硬件预算可报告,复现重点是提示模板、解析规则与换序聚合,而不是复训模型。

数据从哪来,规模多大,基线与指标如何对齐?

数据全部来自已验证的公开语料官方测试集:Expresso 提供重音与风格,Sonos 语音控制偏置评估集提供年龄与性别,LibriTTS 补充性别,EARS 提供语速。这种按来源分工的安排理由是各库自带对应维度的标签,便于构造目标与非目标对比。规模上全文统一为 5175 个音频对,覆盖风格语速重音年龄性别 5 维。文本控制上同文本与跨文本大体各半,语速只用相同文本,重音跨文本仍保留目标词。基线包含人类与 5 个模型,人类每维度 50 条共 250 条,模型跑全量。

指标方向都是越高越好,但机会水平不同:三选 1 维度随机基线为百分之 33 点 3,语速只有二选一故为百分之 50。比较公平条件有三:同一维度模板不加修改地用于所有模型;每对必做换序 2 次,总准确率为 2 次平均;SpeechJudge 的多数投票是其原文协议自带,其余贪心解码,差异在解读时需记住。统计上用 z 检验在百分之 95 置信度下标注高于或低于机会水平。

先提出比较问题:在总量与文本控制上,基准是否真做到受控诊断而非简单堆量,公平条件是只看官方测试集与平衡约束,指标方向是规模越大且越平衡越利于诊断。

条件指标基线本方法比较对象
全量规模音频对总数250 条人类子集5175 对全量人类抽样子集
文本控制同文本占比随机混排47.0% 同文本跨文本对照
文本控制跨文本占比随机混排53.0% 跨文本同文本对照
维度覆盖副语言维度数单一自然度5 个维度整体质量评价

表后解释如下。本表的收益是让初学者一眼看清诊断设计的可运行性:5175 对保证每个维度都有足够的平局与非平局单元,百分之 47 点 0 与百分之 53 点 0 的文本配比保证声学与词汇依赖可分离,5 维拆分保证全局与局部线索不被平均。代价与边界是语速无平局、重音无都好型平局,因此跨维度比较总准确率时必须注意机会水平与平局占比不同,不能直接把语速的二选一准确率与风格的三选一准确率等同为同一难度。未胜出项在这里体现为人类子集虽小但仍是校准上限的参照,任何模型总准确率超过人类都需回到分维度与分条件核对,而不能宣布全面超越。

主结果:谁强谁弱,差距与校准崩塌有多大?

主结果围绕 3 个模式展开。第一,最强模型仍明显落后人类。Gemini 2.5 Flash 平均落后人类 17 点 7 个百分点,说明副语言裁决远未解决。第二,去掉只有二选一的语速后,模型平均在性别与重音上相对最好,而人类在重音与风格上最好,表明人与模型依赖的线索不同。第三,年龄对人类也难,人类准确率偏低且评分者一致性最低,Gemini 在该维甚至略超人类 3 点 8 个百分点,但其平局准确率仍略低于人类,说明能检出大年龄差不等于能在模糊时弃权。

更关键的是校准崩塌。Gemini 在重音非平局达百分之 82 点 3,到平局只剩百分之 19 点 3;GPT-4o Audio 在风格非平局达百分之 69 点 0,到平局只剩百分之 3 点 8;SpeechJudge 在风格与性别平局上分别低至百分之 1 点 7 与百分之 1 点 6,几乎从不选平局。人类在重音性别风格平局上均超百分之 75,证明声学线索本身足以支撑弃权,是模型侧不敢弃权。

位置偏置方面,SpeechJudge 平均 Acc@A 与 Acc@B 之差达 29 点 4 个百分点且偏向 B 位,Qwen2.5-Omni 在 5 维都偏向 A 位,说明调换顺序会大幅改判。

下图把位置偏置与一致性画成左右两组柱状,先看左右落差再看模型排序,才能把单次准确率的水分挤掉。

看图路径: 1. 先对比左图每个模型蓝色 Acc@A 与橙色 Acc@B 柱高差;2. 再对比右图绿色一致性柱与黄色斜线一致且正确柱的落差;3. 最后横向比较五个模型谁的落差最大谁相对最稳

原论文 Figure 2:Position bias and consistency under presentation or- der swaps.

论文图 2。原论文 Figure 2:“Position bias and consistency under presentation or- der swaps.”。

左图纵轴为准确率百分比,横轴为 5 个模型,每组两根柱分别为正确答案在首位与次位时的准确率,柱顶标出具体数值,差距即位置偏置,其中 SpeechJudge 首位次位差最大,Qwen 则反向偏好首位。右图纵轴同样为准确率百分比,每组两根柱分别为 2 次顺序决策相同的比例与一致且正确的比例,绿色一致性普遍高于黄色一致正确,落差最大者说明虽稳定但判错或虽判对 1 次但换序就变。

观察动作上,先记下 Gemini 两图均为最高,再记下 SpeechJudge 一致性仅百分之 34 点 6 且一致正确仅百分之 14 点 1,最后确认模型排序在总准确率、一致性、一致正确上完全相同,这支持论文判断即为整体自然度微调的裁判不易迁移到可控副语言比较。

回到数字表,先提出比较问题:在相同三选一协议与换序平均下,哪个模型最接近人类,校准代价有多大,指标方向为准确率越高越好但需分非平局与平局看。

条件指标基线本方法比较对象
平均表现落后人类幅度人类平均17.7%p 落后Gemini 2.5 Flash
重音非平局判对比例33.3% 机会水平82.3% 判对Gemini 2.5 Flash
重音平局弃权成功比例33.3% 机会水平19.3% 弃权成功Gemini 2.5 Flash
风格非平局判对比例33.3% 机会水平69.0% 判对GPT-4o Audio
风格平局弃权成功比例33.3% 机会水平3.8% 弃权成功GPT-4o Audio

表后解释如下。收益是 Gemini 在非平局重音与性别等维度上确实学到可用的全局线索,性别非平局达百分之 84 点 9 即 1 例。但代价是强辨别不保证校准,同一模型到平局就崩塌,GPT-4o Audio 的风格落差与 SpeechJudge 近乎零的平局准确率都是反例。未胜出项是开源模型与微调裁判在多数维度低于机会水平或仅略高于机会水平,说明它们连基本辨别都未过关,其年龄上平局高于非平局的反转更可能是不会做年龄辨别而非真会校准。边界是年龄维度人类自身一致性低,因此该维的小幅超人类不宜解读为超越人类感知。

文本控制剖面:风格与重音为何走向相反?

文本控制是本文最具教学价值的消融,因为它只改词汇是否相同,不改音频通路,却让风格与重音呈现镜像。风格上所有模型在同文本下远好于跨文本。Gemini 在同文本达 83.8%,跨文本仅 36.6%,差距为 47.2%p,而人类在两者上分别为 86.0% 与 85.3%,几乎不变。机制解释是同文本固定词汇后模型可专注韵律节奏音色,跨文本引入词汇变化反而干扰风格判断,说明模型对风格过度依赖文字内容。重音上模式反转。

Gemini 在同文本仅 43.5%,跨文本升至 56.4%;GPT-4o Audio 同样为 34.9% 对 53.4%。机制解释是同文本要求在完全相同的句子内检测目标词上能量音高时长的细微突起,模型局部敏感性弱;跨文本虽只改变 surrounding 句子但两句仍含同一目标词,整句节奏语调差异提供了全局脚手架,放大了感知到的重音对比,人类则在两种条件下都稳定,证明这是模型侧局限。论文强调这种风格重音对比只有在多轴加文本控制下才可见,单轴评价会把两者压成一个平均分。

先提出比较问题:在同文本与跨文本两种运行条件下,模型是否真在听声学,公平条件是两句是否含同一目标词与音频通路不变,指标方向为同条件内越高越好,跨条件比较看落差方向。

条件指标判对比例 (%)基线本方法比较对象
风格同文本判对比例 (%)86.0 人类83.8 Gemini 2.5 FlashGemini 2.5 Flash
风格跨文本判对比例 (%)85.3 人类36.6 Gemini 2.5 FlashGemini 2.5 Flash
风格落差跨条件下降人类稳定47.2%p 下降 Gemini 2.5 FlashGemini 2.5 Flash
重音同文本判对比例 (%)人类稳定43.5 Gemini 2.5 FlashGemini 2.5 Flash
重音跨文本判对比例 (%)人类稳定56.4 Gemini 2.5 FlashGemini 2.5 Flash

表后解释如下。收益是跨文本为重音提供了可用的全局韵律 scaffolding,使模型在跨文本下反而更好,跨文本重音 56.4% 高于同文本 43.5%,说明全局线索尚可利用。代价是风格在跨文本下崩塌近半,从 83.8% 跌至 36.6%,证明词汇变化会淹没声学风格线索,部署中若生成文本开放多变,风格裁判会大量误判。反例是人类在 2 维两种文本下都稳定,风格 86.0% 对 85.3%,排除了任务本身不可比的解释。未评测边界是语速只用同文本、重音跨文本仍强制含目标词,因此结论不能推广到句长差异很大或目标词缺失的情形,复现时必须保留同样的文本约束才能复现镜像模式。

还有哪些测不到、不能推广、容易误读?

论文自身明确了多处边界,初学者最易误读的有四点。第一,覆盖不穷举。由于要同时满足标签、文本与平衡约束,作者优先保证受控诊断单元而非穷举所有配对,未来工作才扩展更广更均衡的覆盖,因此不能把 5175 对理解为自然语音的全面抽样。第二,平局构造不对称。重音无都好型平局,语速无平局,原因是缺乏帧级标注无法验证相同重音轮廓,以及自然录制节奏天然波动。

这意味着跨维度比较平局准确率时基数不同,重音与语速的数字不能直接与风格年龄性别的平局数字等同。第三,人类基线小而精。每维度 50 条共 250 条,虽在平局、文本、位置上尽量平衡且 6 人独立评分,但量子集仍有限,年龄维人类自身一致性最低,任何在年龄上的小幅超人类都应表述为报告显示而非证明超越。第四,协议细节影响解读。SpeechJudge 的 10 次多数投票与他人贪心解码不同。

单次呈现双音频加文字标识与拼成一条长音频的做法经作者测试无实质差异,但这只是报告的经验结果,不等于所有模型都无差异。相关性不等于因果,例如文本条件与准确率相关不能直接断言模型内部一定先转写再判断,只能说支持词汇依赖的解释,待验证的是编码器层面的因果定位。未测量的还有延迟、成本与误判率,论文未承诺这些量得到改善,部署前需另测。

要复现,先准备什么,按什么顺序跑?

复现先做三件事。第一,取官方代码与数据集链接,本文写作时两者均可用,但仍以论文脚注地址为准,按官方测试集切分取数,不要混入训练集以免污染。第二,按维度重建配对逻辑。风格年龄性别需各配都好与都坏型平局,重音只配都坏型平局,语速不配平局;同文本与跨文本大体各半,语速只用同文本,重音跨文本必须两句都含目标词。

第三,固定提示与解析。每个维度用各自模板,所有模型同一模板不修改;输入为两段独立音频加文字标识 Audio A 与 Audio B,输出解析只认[[A]]、[[B]]、[[TIE]] 3 种标记,其余视为无效并按原文聚合口径处理。运行顺序是先跑单顺序得初步准确率,再对每对交换顺序跑第 2 次,计算 Acc@A、Acc@B、总准确率为两者平均、一致性与一致正确。人类复核可选 250 条子集,每维度 50 条,6 人独立评分,不放交换重复项以免记忆污染。

关键超参数与信息条件是 SpeechJudge 用温度 1 点 0 跑 10 次多数投票,其余贪心解码;机会水平三选一为百分之 33 点 3,语速二选一为百分之 50;统计用 z 检验百分之 95 置信度标注高于或低于机会水平。区分 3 类可运行性:代码开源不等于权重可下载,更不等于系统可一键运行,复现前先确认 5 个被测模型的音频双输入能力与本地解码环境。若要验证文本依赖,务必保留同文本百分之 47 点 0 与跨文本百分之 53 点 0 的切分,否则风格与重音的镜像落差无法重现。

何时值得尝试这套方法,还需补哪项验证?

当你的任务是从生成语音中按指令验收副语言,而非只问好不好听时,这套方法值得尝试。具体说,需要验收耳语困惑等风格、快慢是否达标、重音是否落在指定词、年龄性别是否符合角色设定,且允许系统在模糊时说相当而不是硬选其一,就应采用 5 维分轴加显式平局加文本控制加换序的组合。若只是做整体自然度排序,则用不上这么重的诊断。复现后的第一判断看校准而非总分:若非平局高而平局低,说明裁判在强行偏好,需加入弃权阈值或 2 次确认。

若同文本与跨文本落差大且方向与本文风格重音镜像一致,说明模型在借文字或全局韵律抄近道,需加强局部韵律建模或在训练中加入文本扰动。还需补的验证有三项。一是补速率平局与重音都好型平局的可靠构造,需要帧级韵律标注或受控合成来保证真相当。二是补更均衡的跨库与跨语言覆盖,以检验结论是否只在当前 4 个来源语料上成立。

三是补去偏方法,例如位置平衡解码、校准温度或弃权头,并报告其在一致性与一致正确上的真实收益,而非只报告单顺序准确率。回到中心矛盾:自然度进步不等于按指令说对,只有把评价拆到可控维度并允许弃权,才能看见裁判到底是真听懂还是在猜。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总