英文题目:S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.1615
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准测试 #基准设计 #语音 #语音对话系统
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Feng Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyu Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Yiyang Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Liumeng Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Bu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhao Du:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangying Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Benyou Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haizhou Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音到语音交互要求同时听懂输入语音中的副语言线索并在输出语音中恰当表达,而现有基准多将输出转写为文本再用文本裁判打分,因而丢失韵律、情感与说话风格等表达保真度信号。为此本文构建S2S-Arena基准,覆盖教育、娱乐、社交与医疗四类场景与上百种任务类别,并设计四级交互协议以区分从语义理解到副语言感知与表达的递增难度。方法链分为三步:先人工编写脚本并结合语音合成、真人录制与情感语料采集种子语音查询,再经母语者人工质控形成高质量种子集,接着以语音原生自指令按模式批量扩充为大规模增强集,最后以语音原生配对比较与Elo排序完成评估。种子集输出作为示例约束进入扩充步骤以生成新样本,扩充样本再进入配对评估步骤由人类与自动裁判直接听音频判定胜负,从而全程保留音频形态。相对已有方法的关键机制差异在于不经转写而直接在语音模态下按指令对齐、副语言表达力与音频质量三准则裁判,因而能揭示转写评估无法发现的表达差距并为编码器与解码器选型提供指导。在S2S-Arena Seed基准的人机一致性评测下,Gemini 2.5-Pro的一致性指标Cohen’s Kappa为0.6553,高于Qwen2.5-Omni的0.4667。该结论适用边界为短轮次单查询场景,尚未验证长程人设一致性与真实噪声分布下的外推能力,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://www.volcengine.com/docs/6561/1594356 → https://docs.volcengine.com/docs/6561/1594356?lang=zh — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
本文解读的对象是 S2S-Arena,一项语音到语音模型的评测基准研究。输入是直接用语音说出的指令与测试查询,输出也是语音,评价必须同时看字面语义是否正确与说话方式是否符合要求。目标读者是刚进入语音、音乐与音频领域的研究生,目标是讲清可核对、可复述的方法链条,而不是复述营销式结论。
必须保留的信息包括任务定义、4 级难度协议、2 阶段数据构造、语音内竞技场比较流程、10 个模型的比较条件与主要数字。为此先讲任务与已有路线的缺口,再走完一个样本从输入语音到表示、组件、目标与输出的全程,然后讲构造与推理的实际操作,最后按问题组织实验条件、结果与反证,并说明复现先做什么。
全文默认从原文独立写作,事实只依据本次收到的论文原文证据与官方原图像素。凡是教学举例都会明确标为例子,不把例子当作论文报告的数值或效果。
已有评测走了多远,为什么还缺表达侧?
已有工作可以按输入、目标与运行阶段分成 3 类。第一类是基础能力评测,例如动态超大规模语音理解类基准与多模态音频理解基准,它们设计情绪识别、说话人识别与背景推断等任务,迫使模型关注输入语音中的副语言信号,但重点仍是理解。第二类是对话式评测,例如面向口语对话理解的数据集与语音助手基准,它们用日常对话考推理,但输出仍主要转成文本再用文本大模型打分。第 3 类是开始兼顾生成的评测,例如加入韵律感知指令的基准,但仍主要通过转写文本评价输出。
白话说,副语言信息就是除字词之外的怎么说,包括音高、语速、停顿、情绪、口音、年龄感与背景声。英文是 paralinguistic information。已有路线大多把它当作输入侧的辅助特征,用来帮助听懂,而生成侧是否忠实表达这些特征长期未被直接考核。论文用对照表指出,只有 S2S-Arena 在理解与生成的语义和副语言四格中全覆盖,并且评价模态是语音、评价者是人与语音模型。
这意味着同输入、同目标下的公平对照应该是语音对语音的比较,而不是文本转写后的比较。类别差异不能当作同条件胜负,例如文本裁判的高分不能直接等同于语音表达的高分,这正是后文坚持语音内评价的理由。
要解决的任务是什么,难在哪里?
论文研究的任务是副语言指令跟随。白话说,就是模型听到一段语音指令后,输出的语音既要把事情做对,又要用对的方式说出来。方式包括按要求的语速、重音、节奏、情绪与角色说话,也包括先听懂输入中的情绪、反讽、身份与背景,再做出恰当回应。只把输出转成文字再打分,会丢掉恰恰要考的东西。
为让初学者建立直觉,举一个例子而非论文数值:若输入用很快的语速说请先按我的语速复述再慢速复述,理想输出应包含 2 次语速不同的复述,且第 1 次与输入一样快。转写文本只能看到 2 次文字相同,无法判断语速是否跟随。这就是文本评价的盲区。
下面这张节奏控制示例图把这种盲区分成等级,值得在进入方法前先看懂输入输出如何同时带副语言要求。
看图路径: 1. 先看顶部输入要求:先按输入语速说一遍,再非常慢地说一遍;2. 再看四行输出的文字说明如何从完全跟随退化到完全不跟随;3. 对照右侧表情符号的降级顺序,确认只看转写文本会漏掉语速差异;4. 回到标题中的节奏控制,明确输入输出都要考核副语言
论文图 1。原论文 Figure 1:“An example of evaluating rhythm-aware in- struction following in both speech input and output.”。
这张图的上半部分给出任务与输入,下半部分给出 4 个模型的输出说明与满意度表情。像素可见输入要求先按输入语速说一遍目标句再非常慢地说一遍,且该句处于较快速度。4 个输出从上到下依次退化:说了两遍不同语速但第一遍不够快;说了两遍但第一遍是正常语速;只说了一遍。
完全不跟随指令。右侧表情从微笑降到不满意,直观说明语义正确不等于副语言正确。这也解释了为什么后文的裁判标准要并列检查指令对齐、表达力与音频质量。
方法全景:四级协议如何串起领域与构造?
S2S-Arena 的方法全景由三块串联而成。第一块是 4 级交互协议,按难度递增定义理解侧与生成侧何时需要副语言。第二块是 4 个代表性应用领域与 19 类种子任务,负责覆盖教育、娱乐、社交陪伴与医疗咨询。第三块是 2 阶段数据构造与语音内竞技场评价,负责把协议落成可运行的 1243 条语音查询与 1000 次以上的成对比较。
4 级定义需要逐字记住。第一级只看语义指令,副语言不评价。第二级要求感知输入中的副语言并据此调整回复,但对输出的副语言无要求。第三级输入本身是中性的,但要求输出按显式要求嵌入指定的副语言特征。第 4 级要求同时理解输入副语言并在输出中再现恰当的副语言,最接近真实语音交互。
下图是构造管线的总览,先看协议表再看领域任务最后看 2 阶段构造,就能把样本的一生走通。
看图路径: 1. 先沿左侧四级协议表看理解列与生成列何时加入副语言要求;2. 再看中间四个领域图标与右侧代表任务的对应关系;3. 最后沿右侧从人工种子经自指令到配音的箭头走完两阶段构造
论文图 2。原论文 Figure 2:“Overview of the S2S-Arena construction pipeline.”。
从像素看,左侧表格明确写出从第一级到第 4 级理解列与生成列何时出现副语言要求。中间纵列给出教育、社交互动、娱乐与医疗 4 个图标,并向右列出纠音、节奏控制、言外之意理解、反讽检测、歌唱能力、角色扮演与健康咨询等代表任务。右侧上方是人工标注的种子分支,区分语音合成与真人演员两条路径;下方是扩增分支,从蓝色种子文档经自指令变成绿色新文档再经配音变成音频。箭头方向说明先有人定标准再有机器扩规模,这正是下一节要展开的组件分工。
三个组件各自做什么,为什么这样搭配?
现代语音大模型通常围绕 3 个核心组件组织。白话说,语音编码器是耳朵,负责把波形变成表示;语言模型主干是大脑,负责指令跟随与推理;语音解码器是嘴,负责把意图变回自然、有表现力的波形。英文分别是 speech encoder、语言模型主干与 speech decoder,后文分别简称为编码器、主干与解码器。
语义内容 × 副语言信息: 语义内容负责说什么,即字词、事实与指令的字面要求;副语言信息负责怎么说,包括语速、重音、情绪、音色、年龄感与背景声。两者搭配的理由是真实语音交互中同一句话用不同方式说出含义完全不同,组合意义在于把理解侧的感知与生成侧的表达分开考核,才能发现只转写文本就会丢失的失败。
编码器路线分为两类。离散路线把语音向量量化成 token,常结合大词汇语音识别编码器,便于与文本词表统一建模,代表是语音生成式预训练模型与若干国产多模态语音模型。连续路线保留声学 embedding 并加轻量适配器接入识别编码器,代表是轻量与全模态系列。主干多用已有的大规模预训练语言模型,其选择影响指令跟随与副语言可控性。解码器越来越多采用流匹配生成模型加神经声码器,或非自回归、自回归与编解码器混合方案,直接影响自然度与韵律控制。
语音编码器 × 语音解码器: 语音编码器负责把输入波形变成模型可用的表示,承担副语言感知与语义提取;语音解码器负责把语言模型的意图变回波形,承担韵律控制与音质生成。两者搭配的原因是论文把三件套中的这两端视为表达能力的上下界,组合意义在于解释为什么换大编码器提升理解、换流匹配解码器提升表达。
离散语音 token × 连续语音 embedding: 离散语音 token 负责用量化码本把语音切成可与文本词表拼接的符号,便于语言模型直接建模;连续语音 embedding 负责保留未量化的声学细节并用轻量适配器接入语言模型。搭配理由是前者统一建模更方便,后者保真度更高,组合意义在于论文据此划分 SpeechGPT 类与 LLaMA-Omni 类的技术路线并比较其副语言损失。
论文没有训练新模型,而是把这些已有多样架构的模型当作被测对象。组合机制的教学要点是:编码器决定能听出多少副语言,主干决定能否按指令推理,解码器决定能否把副语言说出来。三者缺一不可,这也为后文按难度拆分差距埋下伏笔,即基础指令跟随主要看主干,感知层看编码器,表达层看解码器。
没有训练新模型时,两阶段构造实际做了什么?
本研究没有训练新的语音模型,该节的真实计算过程是数据集构造与语音合成流程,而非梯度更新。因此不存在参数冻结、梯度路径与监督损失的报告,缺项即明确指出未报告,不从模型名称推定实现。实际调用的是外部语音合成与大语言模型,用于写脚本与配音。
第一阶段是人工种子收集。每个任务在 4 级难度约束下至少设计 10 个脚本,中性样本用豆包语音合成生成,强副语言样本用人声录制或从高质量情绪语音库选取,并加入机场、街道、咖啡馆等 8 类背景噪声。全部音频经 4 名母语为中文、口语成绩达标的标注者做人工质控,剔除可感知的伪影、副语言不清或语义不匹配样本,最终保留跨 19 个任务的 293 条高质量种子。
种子集人工构造 × 自指令自动扩增: 种子集人工构造负责定标准,用配音与真人录音保证每级难度与每类副语言属性正确;自指令自动扩增负责扩规模,用大模型按五样本示例批量写新脚本再用可控语音合成转成音频。搭配原因是只靠人工做不到覆盖,只靠自动保证不了难度定义,组合意义在于用 293 条高质量种子换来 950 条结构一致的扩增样本。
第二阶段是自动自指令扩增。用结构化脚本表示,每个脚本是包含编号、文本、任务、类别、任务描述、语言与难度等级的 JSON 对象。每次随机抽 5 个种子作上下文示例,用大模型生成一个语义合理、结构一致但显著不同的新脚本,重复直到每子集达到每任务 50 条,共 950 条自动样本。合成选用对韵律、情绪与声学变化建模较强的可控语音合成系统,并保留适度噪声与风格变化以维持自然多样性。随机抽 100 条的人工核查显示难度等级一致性与副语言一致性分别达到较高水平,说明多数合成样本与设计意图对齐。
下图是扩增集的任务分布饼图,先看大扇区再看长尾,才能理解扩增偏向表达性交互。
看图路径: 1. 先找到占比 27.7% 的最大扇区并对照图例中的讲故事类别;2. 再看第二大 13.5% 与 7.7% 扇区对应的情绪识别与诗歌朗诵;3. 最后扫一遍右侧长图例,确认情绪、语速、重音类任务占多数
论文图 5。原论文 Figure 5:“The task distribution in S2S-Arena augment dataset.”。
像素可见饼图最大扇区标注 27.7%,图例对应讲故事;其次是 13.5% 左右的情绪识别与 7.7% 左右的诗歌朗诵,其余是情绪适应、跨语言带情绪翻译、 sarcasm 检测、自然声模拟等二十多个小扇区。右侧图例很长,说明自动扩增确实产生了 100 个以上任务描述,经归一化与聚类后仍保留 28 个簇。教学含义是扩增集明显偏向情绪与表达类现象,这与种子集偏重教育纠音等结构化任务形成互补,但也意味着评价分布本身带有合成偏好,后文局限节会回应。
为便于核对规模,先提出比较问题:在相同 2 阶段管线下,种子与扩增各自贡献了多少任务与样本,总体规模是多少,公平条件是同一难度划分与同一语音查询定义,指标方向是样本数越多覆盖越广但质量需另行核查。
| 数据子集 | 任务数 | 样本数 | 每任务新增数 | 构造方式 |
|---|---|---|---|---|
| 种子集 | 19 | 293 | 人工每任务至少 10 脚本 | 人工录音与语音合成加人工质控 |
| 扩增集 | 100 以上 | 950 | 每任务 50 | 自指令生成加可控语音合成 |
| 全部 | 100 以上 | 1243 | 2 阶段合计 | 专家策划加语音内自指令 |
上表的主要收益是规模与质量兼顾:293 条种子定标准,950 条扩增换覆盖,合计 1243 条。具体代价是扩增依赖合成语音,可能偏向适应合成分布的模型;未胜出项是种子本身仅 293 条,相对真实口语交互的多样性仍显不足,且日语与印地语占比极低,多语言泛化边界未被充分评测。
评价条件:如何在语音内做成对比较?
评价要回答的问题是:在不转写文本的前提下,如何公平比较 2 个模型的语音输出。比较对象是 10 个 2023 至 2025 年发布的代表性语音到语音系统,包括工业界的实时语音模型、豆包、语音理解生成基座、跨模态语音模型与音频模型,以及学术界的语音对话模型与轻量系列。条件一致性通过重采样到各模型要求的采样率、用官方代码或官方接口运行、本地模型统一用同型显卡推理来保证,不原生支持音频文件输入的模型则适配官方代码接入同一管线。
Elo 评分 × 成对胜率: 成对胜率负责记录 2 个模型直接相遇时谁更符合语音指令,是原始观测;Elo 评分负责把多次有偏采样的胜负折算成可跨模型比较的能力分,是聚合估计。搭配理由是直接平均胜率受对手强弱影响,组合意义在于用期望胜率与 K 值为 32 的更新规则实现可增量扩展的竞技场排名。
模型配对策略不是均匀采样,而是偏向中等评分差距的组合,用指数权重让差距接近最大差距三分之一的组合更易被抽中,避免恒等比较与强弱悬殊的无效比较。语音内裁判把 spoken 任务指令与两个候选回复拼成单个音频提示,按指令对齐、副语言表现力与输出音频质量 3 条标准直接在语音上判断,不设平局。所有模型初始分 1000,期望胜率用经典等级分公式计算,更新步长固定为 32。
裁判可靠性先在种子集上用 19 名中文研究者的人工判断做预实验,并比较两个自动裁判。人工内部双标一致性较高,自动裁判中大模型裁判与人工高度一致,另一语音模型裁判为中等一致,因此大规模扩增集采用前者作默认自动裁判。需要区分的是自动指标与人评不可混用,此处的一致性数字只支持在该种子分布下用该自动裁判替代人工的大致可行性,不承诺换领域后依然成立。
为核对裁判条件,先提出比较问题:在相同种子成对比较下,哪个自动裁判更接近人工,公平条件是同一批音频三元组与同一三标准提示,指标方向是 Kappa 与一致率越高越好。
| 评估条件 | 指标 | 自动裁判一 | 自动裁判二 | 人工参照 |
|---|---|---|---|---|
| 种子集语音内成对判断 | 一致性 | 高一致 | 中等一致 | 双人一致较高 |
| 同上 | 统计量 | Kappa 与一致率较高 | Kappa 与一致率较低 | 百分比一致 |
| 大规模采用 | 可部署策略 | 被选为默认裁判 | 未被采用 | 保留抽查 |
| 比较轮数 | 规模 | 覆盖扩增集的 1000 次比较 | 同左备选 | 数百次预实验 |
| 模型数 | 范围 | 10 个被测模型 | 同左 | 含级联对照的 6 个模型 |
上表的主要收益是确立了可扩展的语音内裁判:高一致裁判支撑了后文 1001 次比较的可行性。具体代价是自动裁判本身也是大模型,可能带有自身偏好;未胜出项是另一语音模型裁判一致性明显更低,说明并非任意语音模型都能当裁判,未评测边界是长时对话与多轮一致性尚未覆盖。
主结果:谁在总体排名中领先,差距有多大?
主结果要回答:在扩增集的 1001 次语音内比较中,10 个模型的总排名与胜负结构如何。基线是全体被测模型互相比拼,没有外部最优值,可部署策略就是各模型按官方配置直接生成语音回复。指标方向是 Elo 越高、胜率越高越好,但胜场数还受参评场次影响,需结合看。
总体上工业系统明显领先学术系统。跨模态全模态模型 Elo 最高,实时语音模型胜场最多,豆包胜率最高,三者形成第一集团。中段 3 个模型分数接近且架构相似,学术模型中只有一大模型接近工业尾部,其余落后 300 分以上。进一步的自助重采样显示排名稳定,相关性较高,支持排名不是单次抽样的偶然。
下图是 10 模型的成对胜率矩阵,行是获胜方、列是被击败方,数值 0 到 1 为行胜列的概率,颜色越红胜率越高。
看图路径: 1. 先确认横轴是被击败模型、纵轴是获胜模型;2. 再比较左上工业模型之间 0.3 到 0.7 之间的互有胜负区域;3. 最后看右下学术模型对工业模型接近 0 的蓝色区域与内部小胜负
论文图 3。原论文 Figure 3:“Pairwise win rate matrix among 10 S2S mod- els. Each cell shows the win rate (ranging from 0 to 1) of the row model over the column model.”。
从像素看,第一行豆包对实时模型约 0.71、对全模态模型约 0.58,说明它在顶层互赛中占优;第二行实时模型对后两者分别约 0.66 与 0.62,同样互有胜负。中间三行对学术四行的格子多为 0.8 到 1.0 的深红,证实工业对学术的压制。右下学术内部则出现 0.5 左右的灰色格,例如两个轻量模型之间与语音生成模型之间互有胜负,说明弱模型之间靠专门化特长区分,而非全面领先。非传递性在中段尤为明显,即甲胜乙、乙胜丙不代表甲必胜丙。
为核对关键数字,先提出比较问题:在相同 1001 次比较与同一裁判下,总体 Elo、胜场与胜率的三项第一各归谁,公平条件是同一扩增集与同一三标准裁判,指标方向均为越高越好。
| 比较对象 | 总体 Elo | 胜场数 | 胜率 | 可运行策略 |
|---|---|---|---|---|
| 全模态大模型 | 1246.1 | 参评 200 余场中的百余胜 | 约 59.0% | 官方 7B 开源版本直接推理 |
上表的主要收益是三项第一分属三家,说明顶层是多维领先而非单点碾压。具体代价是胜率与 Elo 并不完全同序,因为配对有偏且场次不同;反例是豆包虽胜率最高但 Elo 不是第一,说明它可能在更多势均力敌的对局中取胜。未胜出项是学术模型整体落后,尤其在表达层差距拉大,边界是本表只反映短轮单查询,不反映长时人设与情绪连续性。
拆解:领域与难度如何改变排名与归因?
除总体排名,论文按特有维度展开两类细节。第一类是四领域拆分:教育、娱乐、医疗与社交。第二类是四难度拆分:从只考语义到同时考感知与表达。两者共同检验总体趋势是否每组都成立。
领域发现可归纳为 3 条。知识驱动领域强调语义 grounding 与可靠回答,实时模型在教育与医疗领先。表达性领域奖励副语言灵活性与自然度,全模态模型在社交最高,语音基座与音频模型在娱乐有竞争力。没有模型在四领域通吃,例如某基座在娱乐远高于医疗,说明单总分无法代表真实部署,语义可靠与表达适应需要权衡。
难度发现同样有 3 条。工业系统在 4 级全面领先,平均差距近 200 分。差距随难度增大而拉大:在第一级学术模型已与部分工业模型相当,说明基础跟随不是瓶颈;到第三、4 级顶层领先学术 300 分以上,说明瓶颈在表达生成与完整副语言交互。架构归因指出更强主干提升第一级跟随,更大编码器提升第二级感知,向量量化无明确收益,流匹配对第 4 级表达至关重要,而声码器选型影响有限。相关性不等于因果,这些归因是有限解释而非严格消融,待验证。
案例分析提供机制线索。顶层对比中实时模型偏理性解法、豆包偏口语化表达,后者因副语言丰富偶尔取胜。强弱逆转案例中某音频模型音质尚可但声音偏弱,清晰度不如较弱的语音模型,说明人声化不等于清晰稳健。这些都支持语音内评价的必要性,但未测量延迟与成本,不承诺这些量得到改善。
哪些结论站不住,边界在哪里?
论文明确报告的局限有两层。第一层是数据分布:总体规模相对真实口语交互仍小,且高质量合成语音可能偏向更适应合成分布的模型。第二层是交互长度:当前主要针对单句与短程交互,未覆盖长时人设一致性、长期情绪动态与篇章连贯。
从复现角度还需补三项验证。一是裁判偏好验证:自动裁判与人工在种子集高度一致,但在扩增集的大规模采用中缺乏持续的人工抽查,换领域后是否保持未知。二是语言覆盖验证:扩增集以英文为主、中文次之,其余语言极少,跨语言情绪翻译等任务的结论不宜推广。三是成本验证:未报告训练资源、推理开销、输出帧率与实际延迟,总体趋势不等于每步都成立,部署选型不能只看 Elo。
区分表述很重要。论文直接报告的是排名数字与领域难度分数;有限解释的是架构归因;未验证推测是训练数据规模导致差距。缺失证据不是技术错误,引用时应分别用报告、支持与可能待验证来表达。
复现先做什么,需要哪些信息条件?
复现应先做最小闭环,而非 1 次复刻全部。第一步是拿到种子脚本结构与难度定义,按 JSON 模式自查字段顺序与取值,确认第一级到第 4 级的理解与生成要求。第二步是按论文的采样率重采样输入,用官方代码或官方接口跑通 2 到 3 个模型的语音生成,重点验证不支持音频输入的模型已正确适配。第三步是在小规模种子上复现语音内裁判的三标准提示与无平局判决,再与人工小样本对照,确认自动裁判可用。
关键超参数与信息条件包括初始分 1000、更新步长 32、配对权重的均值取最大差距三分之一、每任务扩增 50 条、人工核查抽样与一致性水平。代码与数据方面,论文声明释放源数据与推理代码,第三方语音合成文档当前可用,但本次解读不把链接可达当作长期保证,复现时以论文附录的版本号与官方仓库为准。
常见误解是把无训练等同于确定性求解。实际上本研究未训练任何被测模型,但合成、采样与裁判都有随机性与模型偏好,不能从参数冻结推定输出确定。另一个误解是把转写文本的高分当作语音表达的高分,复现时必须保留语音内比较,否则会重复论文所指出的信息丢失。
何时值得尝试这套方法,如何收束?
当你的任务同时关心说什么与怎么说,且输出必须直接是语音时,这套方法值得尝试。例如教育纠音需要听出错误并用正确重音示范,娱乐讲故事需要情绪起伏,社交陪伴需要识别情绪并回应,医疗咨询需要稳健可靠的表达。这些场景用文本裁判会漏判,语音内竞技场更贴合。
收束全链条:输入是带副语言的语音指令,经过编码器感知、主干推理与解码器表达,输出是带副语言的语音;4 级协议把难度说清,四领域把场景说全,2 阶段构造把规模做大,语音内比较把评价做真。结果显示工业领先且差距随表达难度拉大,架构上主干管跟随、编码器管感知、流匹配解码器管表达。
最终判断是:S2S-Arena 把评价从转写正确性推向交互级的人类对齐,为研究语音智能体的表达能力提供了可复用的起点,但使用时必须记住合成分布、短轮交互与裁判偏好 3 条边界,并在自己的领域补做人工核查与成本测量。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



