英文题目:MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

会议身份:conference:interspeech:2026:conference-paper-id:chen26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #混合专家模型 #跨语言 #语音翻译

评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Szu-Chi Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • I-Ning Tsai:机构信息未能从会议 PDF 纯文本可靠映射
  • Yi-Cheng Lin:机构信息未能从会议 PDF 纯文本可靠映射
  • Sung-Feng Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

表达性语音到语音翻译(Speech-to-Speech Translation, S2ST)需将源语言语音中的笑声与哭泣等非言语发声(Non-verbal Vocalizations, NVs)一并转写翻译并重建为目标语言语音,难点在于真实 NV 数据稀缺且多情感混合易在共享参数中相互干扰。本文先以情感自适应合成构建英中平行表达语料,再冻结音频大模型(Audio Large Language Model, AudioLLM)基座并在其上并行训练 5 个发声专家,最后以无标签语言建模损失训练令牌级软加权路由器(Router)实现混合情感动态融合。合成管线先以笑声检测器与人工核验筛选提示音频,再用解耦声纹与情感韵律的合成引擎生成千小时级平行语料并经双语转写过滤对齐,为专家训练提供可控输入。与共享单适配器易致情感平滑的已有方案不同,五专家各居独立低秩子空间专攻一类情感流形,路由器按上下文逐令牌分配连续权重,从而在保留基座语义能力的同时实现细粒度混合表达。在NonverbalTTS客观评测任务下,MoVE的NV Match准确率为76.00,高于SeamlessExpressive的NV Match准确率14.00。该结论仅在英中双语、5 类情感加合成数据分布内得到验证,对真实噪声 NV 与未见语种的外推尚未证实。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 数据相关资源:https://47zzz.github.io/MoVE/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么:为什么笑声翻丢了就不算翻对?

这篇解读的输入是论文正文证据与 3 张官方原图像素,目标是让刚进入语音音乐音频方向的研究生能核对并复述方法。必须保留的信息包括任务定义、数据构造动作、模型冻结与更新安排、评价条件与关键数字,输出是 1 篇按学习依赖展开的中文技术解读。

语音到语音翻译的任务是把一种语言的语音直接变成另一种语言的语音,中间要同时解决语音识别、机器翻译和语音合成三件事。论文要解决的矛盾是现有系统语义分很高,但会把笑声、哭声等非言语发声抹掉。例子是带笑的玩笑被翻成严肃语气就丢了幽默,带特定语气的夸奖丢了语气就可能被听成讽刺。也就是说可懂不等于语用正确。

语音到语音翻译 × 非言语发声: 语音到语音翻译负责把源语言语音的内容翻成目标语言语音,承担语义对齐和可懂度;非言语发声指笑声、哭声这类不承载词但承载语用意图的声音,承担情感和态度信号。二者搭配的原因是只翻词会把玩笑翻成严肃、把夸奖翻成讽刺,组合意义是翻译系统必须同时保词义和保发声才能不扭曲原意。

初学者容易误以为加一个情感分类标签就能解决。论文的判断是瓶颈有两层,一是训练数据层缺少干净、带真实非言语且双语对齐的语料,二是架构层要在跨语言语义对齐之外再保留多样声学表情,放在一个共享参数里容易互相干扰。后文先讲相关路线如何走到音频大语言模型,再讲数据管线、混合专家、2 阶段训练、实验条件与反证,最后给出复现起点。

相关路线对照:直接建模、级联与音频大模型有何不同?

按同输入同目标对照,直接语音到语音翻译路线试图端到端完成识别加翻译加合成,优点是延迟结构简单,缺点是论文指出其在一般声学表情上就吃力,更不用说具体的笑和哭。级联路线是识别后翻译文本再用带提示的合成重建声音,本文用识别加翻译加合成的级联作为参考上限,它可以用源音频做 1 次性声学提示,因此在客观情感相似度上可能占优,但范式不同不能直接当同条件胜负。

另一条线是数据与评测。论文提到已有语音翻译语料和非言语语料在结构、质量、数量上不适合直接训练表情翻译,因此需要自己做合成管线。音频大语言模型路线被看作潜在解法,因为其预训练已覆盖识别与合成等任务,提供了语义和声学基础。但论文提出两个待回答问题,一是到底需要多少数据才能唤起其翻译能力,二是如何设计能处理多种相似或冲突情感而不互相干扰的架构。这正是后文数据效率实验与混合专家要回答的。

问题如何界定:保词义之外还要保什么?

论文把问题界定为表情语音到语音翻译,具体是英中双向。输入是一个带表情与非言语的源语言 utterance,输出是目标语言语音,要求词义正确,同时目标语音要复现源的情感与非言语类别。教学例子是输入为带笑的英文 Hello,期望输出为带笑的中文你好,而不是字对但语气中性的你好。

评价因此分成 3 维,一是语义保留,用语音识别后算分衡量,二是客观情感保真,用唤醒值效价连续相似度衡量,三是主观人评,包括自然度平均意见分、情感相似度平均意见分与非言语是否完全一致的匹配准确率。论文明确说缺少可靠的客观非言语指标,所以客观连续度量加人评是互补关系,不能把自动分当成人评。范围限定是聚焦高兴、悲伤、生气 3 个基本情感加笑、哭两种极端非言语,未覆盖全部情感与非言语类别。

方法全景:跟着一个带笑样本走完输入到输出

先沿一个样本走全程。输入是带笑的英文语音,先经过语音编码器与音频分词器得到语音 token,再进入冻结的大语言模型层,层内有 5 个并行低秩专家与一个路由器按 token 给出混合权重,混合后的表示生成目标语言语音 token,最后经微调过的解码器还原成带笑的中文波形。目标是词义对且笑声仍在,输出是目标语音。

全景包含三块。第一块是可扩展表情数据合成管线,负责造出大规模英中表情对齐对。第二块是混合发声专家架构,负责把表情建模拆到专科子空间再软混合。第三块是 2 阶段训练与解码器微调,负责先对齐编码器、再专科化专家、再学路由,最后让解码器能可靠重建极端非言语。论文强调解码器被所有基线共享,因此各行差距反映语言模型与路由而不是解码器。

数据侧用英文中文平行文本做内容源,用高质量声学提示提供情感与说话人信息,用合成引擎生成双语语音,再经 3 级过滤得到对齐对。模型侧冻结基座,把表情适配限制在轻量低秩模块,避免破坏原有的识别合成与跨语言能力。

组件与计算:五个专家和路由器各自算什么?

基座是 Kimi-Audio。为了保留其识别、合成与跨语言语义能力,论文冻结基座参数,把表情适配限制在轻量低秩模块。不是用单个模块,而是注入 5 个并行低秩适配器,分别专攻高兴、悲伤、生气、笑、哭的声学流形。每个适配器作用在注意力与前馈门控矩阵上,在独立低秩子空间工作,保留基座生成连贯语音的能力。这样做的安排理由是防止冲突的副语言线索在共享参数空间互相干扰。

音频大语言模型 × 低秩适配: 音频大语言模型指在大量语音任务上预训练过的语音语言模型,负责提供已有的语义和声学表示;低秩适配指冻结基座只训练注入的小秩矩阵,负责用很少参数激活基座能力。二者搭配的原因是直接重训整个翻译加表情系统难度大,组合意义是用小量精选数据唤醒预训练表示而不是从零重建。

路由器是轻量线性加 Softmax,对每个语音 token 的隐状态输出连续混合权重。输出是基座权重输出加各专家低秩增量的加权和。论文特意不用硬 top-k 路由,因为人类情感本质是混合的,例如紧张的笑需要细粒度混合。路由器训练时不给离散情感标签,只用最终语言建模损失端到端优化,让它从上下文线索自主学出最优混合,这是理解后文混淆矩阵的关键。

表情解码器是把语音 token 映射回波形的模块。论文报告预训练解码器不能忠实还原极端笑哭,因此用带非言语诱发提示合成的表情语音对其微调,使其能可靠重建富非言语波形。该解码器被指令模型与所有低秩混合行共享,目的是隔离变量。

发声专家 × 软加权路由: 发声专家指各自专攻高兴、悲伤、生气、笑、哭一种声学流形的并行低秩适配器,负责避免冲突情感在同一参数空间互相干扰;软加权路由指对每个语音 token 输出连续混合权重的轻量线性加 Softmax 模块,负责把多个专家按比例混合。二者搭配的原因是真实情感常是混合态如紧张的笑,组合意义是既保留专科能力又能细粒度拼出混合表情。

训练与构造如何执行:数据三步与两阶段冻结安排是什么?

数据构造分 3 步。第一步是表情提示精选。为防合成退化为狭窄情感刻板印象,对高兴悲伤生气从多个情感数据集聚合多样样本以保持连续情感流形,对稀有极端非言语则更严格过滤,笑声提示用笑声检测器高置信度筛选再人工核验,哭声提示从日语情感语料中精选经人验证的言语夹杂哭声,以保证声学可用。

第二步是属性解耦的情感自适应合成,用 IndexTTS2 做合成引擎,常规情感用单个声学参考同时提供说话人与情感韵律,稀有非言语则解耦身份与表情,用精选非言语提示诱发副语言、用独立中性提示定义说话人身份,从而把稀有特征投射到多样说话人上,覆盖 5 种流形。第 3 步是自动质检与配对,经静音裁剪丢弃过短输出、经小型语音识别做词错率校验并用宽松阈值容忍非言语带来的识别困难、再做对级过滤只保留英文中文都通过的对,生成对齐翻译对。

论文称生成 1000 小时语料并公开。

声纹与表情解耦合成 × 自动质量过滤: 声纹与表情解耦合成指用非言语提示控制哭笑等副语言、用独立中性提示控制说话人身份,负责把稀有笑哭特征投射到多样说话人上;自动质量过滤指静音裁剪加语音识别词错率校验加双语成对保留,负责去掉合成失败和不对齐样本。二者搭配的原因是极端非言语提示少且易混入伪影,组合意义是在保真前提下扩大覆盖并保证英中对齐可用。

模型训练先微调语音编码器以建立共享声学基础,再分 2 阶段训练混合专家。第一阶段是独立专家专科化,在基座与对齐后编码器冻结下,每个低秩专家在其表情子集上独立训练,避免跨情感干扰。第二阶段是动态路由优化,把专科专家装入统一架构,在全集上只优化路由器而固定其他参数。实现细节是专家秩与缩放因子均为 256,用 AdamW 优化,学习率很小,第一阶段训练 2 轮,第二阶段 1 轮内收敛。以下示意图展示了 2 阶段冻结与数据量的切换,是复述时最值得对照的图。

看图路径: 1. 先看底部输入:左侧 20 小时专科子集与右侧 100 小时全集的文件夹标注;2. 再看中部冻结与可训练标记:比较两阶段哪部分橙色可训练、哪部分雪花冻结;3. 沿底部 Hello 笑声波形到顶部你好笑声波形的箭头走一遍主路径;4. 对比左图单专家直连与右图经绿色 Router 扇出到五个专家的区别

原论文 Figure 1:Illustration of MoVE Two-Stage training

论文图 1。原论文 Figure 1:“Illustration of MoVE Two-Stage training”。

从像素看,左面板底部标注 20 小时专科子集,右面板底部标注 100 小时全集,图例明确橙色为低秩适配器、雪花为冻结、火焰为可训练。左图只有笑专家处显示火焰且与编码器直连,其余专家置灰,语言模型层整体冻结,含义是第一阶段 1 次只练一个专科。第二阶段绿色路由器变为可训练并扇出到 5 个专家,含义是只学如何混合而不改专家本身。输入输出箭头都是从底部带笑 Hello 波形经编码与分词进入模型,再到顶部带笑你好波形,说明任务闭环是跨语言但保留非言语。

实验条件:和谁比,在什么数据上,用什么指标?

模型与训练一节已讲清冻结安排,本节聚焦可比性。基线包括免训练的强系统与商用模型、单低秩架构消融、不同数据源训练的单低秩对照,以及范式不同的级联参考。架构消融用同一训练集比较单低秩与混合专家,数据质量对照用同一单低秩架构比较自建数据子集、随机采样的合成数据子集与外部表情对齐语料,从而把数据效应与架构效应分开。

测试集与指标分 3 维。语义用从语音翻译语料采样的 1000 对英中对做识别后算分。客观情感保真用从非言语语料严格过滤掉无语言内容后每类至多采样 1000 条的域外真实录音,指标是唤醒值效价相似度,方向是越高越保真。主观用人评采样 30 条覆盖 6 类,熟练双语者做多刺激测试,给自然度与情感相似度 1 到 5 分,非言语匹配只有感知非言语与源完全一致才算命中,架构消融另做成对偏好测试含平局选项。

唤醒值效价值相似度 × 非言语匹配准确率: 唤醒值效价值相似度指在唤醒度和效价连续空间度量情感接近程度的客观指标,负责评价整体表情保真而不是只检出笑哭;非言语匹配准确率指只有当感知到的非言语与源完全一致才算命中,负责人评层面的笑哭是否翻过去。二者搭配的原因是缺少可靠的客观非言语检测器,组合意义是用连续客观度量加严格人评互补判断表情迁移。

需要核对的细节是聚合与不确定度。论文表格括号内分别报告自助估计标准差、样本量 306 下的标准误与 5 位被试下的被试间标准误,不能把三者混为同一误差。级联用了源音频 1 次性提示而非纯零样本推理,因此论文明确其不对称,只作参考上限。基线完整配置与提示在项目页,资源状态显示数据集页当前可用。

主结果:词义与笑哭保留是否同时成立?

比较问题是自建数据加混合专家是否在保词义同时显著提升表情与非言语保真,且条件是否公平。公平条件是架构消融用同 100 小时自建数据,数据对照用同单低秩架构,解码器在各行共享,指标方向是识别后算分、情感相似度、人评分与非言语匹配越高越好。

系统英中识别后算分中英识别后算分非言语匹配率人评与基线对照
混合发声专家32.521.476%最高自然度与情感保真
现有语音翻译系统未胜出23.6至多 14%未胜出
单低秩同数据基线未胜出未胜出低且丢极端副语言偏好测试落败
级联参考未胜出未胜出参考客观接近但人评被超

上表提出主收益与代价。混合专家在英中取得最好识别后算分 32.5,中英 21.4 与基线 23.6 相当,说明把容量重分配给表情流形未损害语义。表情侧复现目标非言语达 76% 情形,而现有系统至多保留 14%,人评自然度与情感相似度均为参比系统中最高。代价与反例是中英语义仍未超过最强基线,客观情感相似度与级联仅差很小但级联范式不同不能直接宣称全面胜出,单低秩同数据基线在极端笑哭上失败而混合专家成功,证明收益来自架构而非解码器。未胜出项必须保留,即现有商用与开源强基线在非言语上集体低迷。

以下混淆矩阵用于解释路由器为何能支撑上述混合表情,它不是分类器评测而是事后对齐检查。导读是把行看作真实类别、列看作路由主选专家,重点看对角命中与非对角分散。

看图路径: 1. 先确认横轴为路由预测标签、纵轴为真实标签的混淆矩阵布局;2. 沿对角线读出笑、生气、哭、悲伤等格子的命中数;3. 观察高兴行分散到笑和悲伤等格子的非对角分布

原论文 Figure 3:Confusion matrix of router behavior.

论文图 3。原论文 Figure 3:“Confusion matrix of router behavior.”。

从像素看,对角格数字明显更大,例如笑 226、生气 229、悲伤 181、哭 166,说明经专科化后路由器在无标签训练下仍能高度对齐。非对角如高兴行有 100 被路由到笑、悲伤与哭之间、快乐与笑之间存在重叠,论文解释这不是任意错误而是自然人类表情的混合本性,支持软加权而非硬分类的动机。报告的总体对齐准确率为 63.68%,是在无离散情感监督下取得的,因此不能把它当作有监督分类精度来比较。

消融与数据效率:多少数据才够,预训练起了什么作用?

本节回答两个问题,一是混合相对单低秩是否必要,二是数据量效应来自低秩容量还是预训练先验。条件是单低秩与混合用同数据,随机初始化对照用同子集重训。指标仍是识别后算分与情感相似度,方向越高越好。

架构消融显示同 100 小时数据下混合在所有指标上超过单低秩,主观偏好测试混合胜率明显高于单低秩与平局,人评自然度与情感相似度最高,非言语匹配上混合能合成单低秩保不住的极端副语言。数据对照显示即使 50 小时自建子集也在客观两项上大幅超过外部 67 小时与 100 小时子集,且 100 小时自建在同架构下超过 100 小时外部合成子集,支持质量优势来自管线而非数据量或模型容量。

训练与数据条件数据量情感保真结论语义结论关键超参与训练轮数
精选数据低秩微调30 分钟达全量 95%不损害翻译精度秩 256 ,学习率 1 × 10−5
专家专科化20 小时子集专科避免干扰冻结保能力训练 2 轮
路由优化100 小时全集对齐 63.68%只学混合训练 1 轮
随机初始化对照多规模坍缩为不可懂贴零同子集失败

上表后需解释代价与边界。数据效率的核心证据是 30 分钟精选数据达到全量情感保真的 95% 而不损语义,规模曲线从 0.5 小时到 1000 小时呈稳健平台而 0.1 小时处骤降。随机初始化在各规模均坍缩为不可懂 babble,证明效率来自音频大模型已存的声学语义知识而低秩只是激活而非创造。限制是平台不等于每组每步都单调,曲线在大量级有波动,且该结论依赖精选高质量合成,换成噪声大的真实数据未必复现。以下曲线图展示了这种陡升加平台加虚线贴零的形态。

从数据效率曲线进入前,先确认双纵轴与图例再判断升降好坏,避免把右侧情感轴波动误读为语义变差。

看图路径: 1. 先确认横轴为训练小时数、左侧蓝色纵轴为语音识别后算分、右侧红色纵轴为情感相似度;2. 观察 0 到 0.5 小时区间实线如何陡升后进入平台期;3. 对比下方虚线随机初始化在各规模下始终贴近零线的表现

原论文 Figure 2:Data efficacy and scaling behaviors across varying training sizes.

论文图 2。原论文 Figure 2:“Data efficacy and scaling behaviors across varying training sizes.”。

从像素看,蓝色实线为基座加低秩的识别后算分,红色实线为情感相似度,横轴为训练小时数,两条实线在 0 到 0.5 小时区间陡升后缓慢爬升并保持平台,误差棒为标准误。蓝色与红色虚线为随机初始化,蓝色虚线始终贴零,红色虚线仅低位爬升,强烈反衬预训练的作用。不能从末步结果推广全程,也不能把平台解读为数据无用,因为 0.1 小时以下仍会骤降且精选质量是前提。

限制与未验证:哪些结论不能推广?

论文直接报告的是英中双向、5 类表情与非言语、合成主导数据上的结果,显示混合专家在非言语匹配与人评上领先。有限解释是软路由的非对角重叠反映混合情感本性,这一解释有混淆矩阵支持但仍是事后解读。未验证推测是扩展到其他语言对与更多真实场景,论文明确说英中范围跟随合成引擎与基座的英中中心训练,混合本身无语言特定组件但换语言需要合适模型,属未来工作,应用可能与待验证表达。

缺失证据不是技术错误,但必须指出具体缺项。原文未报告推理延迟、实时率、训练算力预算与部署成本,因此不能承诺这些量得到改善。未测量误判率与噪声鲁棒性,真实环境录音常带噪,合成管线虽经人工核验与过滤,仍不能等同真实分布。人评样本仅 30 条且被试仅 5 位,标准误较大,推广时需更大规模复评。客观情感相似度与级联差距很小且范式不对称,不能据此宣称客观全面碾压。

复现先做什么:数据、冻结与评测的最小闭环是什么?

何时值得尝试是当任务必须保留笑哭等语用信号且能接受合成数据偏差时,混合专家加软路由是合适起点;若只要词义可懂则不必引入五专家复杂度。复现先做三件事,一是按 3 步重建小规模管线,先聚合常规情感提示,再对笑哭做高置信检测加人工核验与身份解耦合成,最后跑静音裁剪加宽松词错率加双语成对过滤。二是冻结基座与对齐后编码器,先在专科子集上独立训练 5 个低秩专家,再冻结专家只在全集上训练路由器,且全程用最终语言建模损失监督路由。三是共享微调后的解码器以隔离变量,再跑语义、情感相似度与人评 3 维评测。

关键超参数与信息条件是秩与缩放因子 256、优化器 AdamW、学习率量级、第一阶段 2 轮第二阶段 1 轮、词错率阈值与最短时长过滤。区分代码开源、权重下载与系统可运行,论文给出数据集与演示页当前可用,但不等于一键可运行全系统,复现需补基座权重与合成引擎版本。还需补的验证是域外真实非言语上的盲测、更大被试人评、以及与其他语言对的迁移测试。

收束:用一句话记住方法与证据链

记住一条链,稀有笑哭经严格筛选与身份解耦被投射到多样说话人上形成大规模对齐对,5 个专科低秩专家先分开学再由无标签软路由按 token 混合,冻结基座保证语义不丢,微调解码器保证极端声音能发出来。证据链是同数据下混合超单低秩、同架构下自建数据超外部数据、30 分钟达全量情感保真 95%、非言语匹配 76% 对至多 14%、路由无监督对齐 63.68%。重提结果时新增的适用条件是该链在英中合成主导条件下成立,换真实噪声分布或新语言需重做筛选与验证,不能直接外推效果。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总