英文题目:Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation

会议身份:conference:interspeech:2026:conference-paper-id:song26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #评测协议 #韵律 #跨语言 #语音翻译

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yuchen Song:机构信息未能从会议 PDF 纯文本可靠映射
  • Xi Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Mingze Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Satoshi Nakamura:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

英语到汉语语音到语音翻译(Speech-to-Speech Translation,S2ST)需在保留语义的同时把源端词汇重音落实到声调语言对应字符,难点是汉语重音与声调耦合且缺乏标注数据与自动评测手段。方法链分4步推进:先录制双说话人汉语重音语料并做感知与对齐质检,再用XLS-R多层融合加音节池化与双向上下文建模训练汉语重音检测器,接着以源端EmphaClass加目标端检测加SimAlign对齐构成跨语言重音转移分数(Cross-lingual Emphasis Transfer Score,CETS),最后用重音标签微调CosyVoice 3实现可控合成。与直接复用英语帧级检测和通用TTS的方案相比,音节级多层融合更匹配汉语以字为单位的感知单元,显式标签桥接避免韵律在翻译中丢失。在5次随机划分约170条测试样本的评测下,本文系统的CETS-S为58.30%,高于Gemini + Base基线的CETS-S 16.60%,同时ASR-BLEU保持47.35的竞争水平。该结论限于朗读式短句和固定合成音色,未验证自发对话、多说话人及强口音下的稳定性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,先保留哪些信息?

本文输入是带词汇重音的英语语音,目标是生成中文语音翻译,要求语义正确、语音自然,同时把源端强调落在语义对应的中文字符上。读者需要先保留 3 个信息:第一,任务是英译中语音到语音翻译,不是纯文本翻译;第二,重音指说话人对某个词或音节的凸显,用来传达意图和语用含义;第三,中文是声调语言,重音实现必须保留声调类别,不能靠夸张变调来模拟强调。

输出是 1 篇可复述方法的解读,不评价模型优劣,只讲原文实际给出的数据构造、检出器、评测管线和合成系统的动作与条件。 词汇重音在这里是白话的强调动作,英文名是 lexical stress,后文简称重音。声调语言指普通话这类靠音高模式区分字义的语言,与英语这类重音语言的感知和声学机制不同。正是这种差异,导致直接搬运英语强调检出模型到中文不可行,也导致通用语音合成模型难以稳定输出中文重音。

词汇重音 × 词法声调: 词汇重音指英语中通过时长、能量和音高凸显某个音节以表达强调和意图的机制,词法声调指普通话中每个音节自带的声调类别区别词义的机制,二者搭配的难点在于中文不能靠大幅改动音高来造重音否则会改变声调,因此本文把重音实现为在保持声调类别前提下的可感知凸显,组合意义是检出和合成都要在声调约束下找重音。

已有路线解决了什么,还缺哪一块?

已有路线可以分为三支。第一支是语音到语音翻译主干,例如无缝多语言模型和离散单元的 2 阶段翻译,语义准确率和音频质量已有明显提升,也有面向翻译质量的无文本评测指标。第二支是强调保持评测,例如 EmphAssess 提出了强调迁移基准,发现现有模型难以可靠保持强调。第三支是强调可控合成,例如面向英语的强调语音生成和面向中文的表达性音频大语言模型,但在中文上稳定渲染指定位置重音仍然不稳定。

与同输入同目标的工作相比,本文的差异不在翻译主干本身,而在补齐中文重音数据和中文重音检出器。英语中心的方法在帧级分类加多数投票上对英语有效,但中文需要音节级表示和上下文建模。面向印地语等语言的重音迁移也不能直接搬运,因为普通话韵律特性不同。教学例子:比如英语强调动词与中文强调对应动词字,词序和切分不同,必须先做跨语言词对齐才能判定是否压中,这正是本文引入对齐加严格匹配的原因。

为什么英译中重音保持特别难?

困难来自三处。第一,感知冲突:英语靠重音凸显,中文靠声调辨义,若合成时大幅改变音高,可能破坏声调类别,听感上变成另一个字或不自然的夸张。第二,评测缺失:没有可靠的中文重音自动检出器,就无法判断翻译语音的重音是否落在正确位置,只能靠人听,主观成本高且不可重复。第三,数据缺失:没有高质量带重音标注的中文语音,微调合成模型时就没有目标信号,通用合成模型只能随机或微弱地体现强调。

本文把问题拆成可操作的链条:先录制并筛选中文重音语料,再训练中文检出器,再用中英检出器加词对齐定义客观指标,最后用带标签文本把翻译与合成串起来。每个环节都有明确输入输出,便于研究生复述和检查。

全景:一个样本如何走完翻译链路?

沿一个样本走一遍。输入是一段英语语音,其中某个英文词被重读。第一步,强调感知的语音到文本模块识别语义并预测重音位置,输出带重音标签的中文文本,例如在对应中文字符前后加标记。第二步,重音可控的语音合成模块读入带标签文本,合成中文语音,要求在标签位置产生可感知的凸显,同时保持声调和分段内容正确。

第三步,评测管线独立工作:英语端用检出器找源重音词,中文端转写加对齐加检出找目标重音字,再通过跨语言对齐判断是否落在语义对应处。 下图是原文提出的重音感知语音到语音系统总体结构,左侧是带标签文本进入语音合成,中间是基座合成模型加可训练适配,右侧是翻译语音输出,阅读时先看主路径再看可训练部分在哪里叠加。

看图路径: 1. 从左侧带标签文本进入中间浅蓝色语音合成大框;2. 观察框内低秩适配模块以残差形式叠加在基座模型上;3. 确认右侧输出为带重音的中文翻译语音波形示意

原论文 Figure 2:The overall architecture of our proposed stress-aware S2ST system.

论文图 2。原论文 Figure 2:“The overall architecture of our proposed stress-aware S2ST system.”。

该图显示的合成侧是一个大框包住基座语音合成模型,左侧箭头为带标签文本输入,框内有一个虚线包围的可训练低秩结构,右侧箭头指向翻译语音波形示意。它的教学价值在于明确分工:基座保证通用音质和中文发音,新增适配只学习如何解释重音标签并实现强调,避免全参数微调在小数据上遗忘或过拟合。结合前面的概念桥,翻译模块决定放哪里,合成模块决定如何响,二者靠显式标签解耦。

StressTransfer × CosyVoice3: StressTransfer 负责语音到文本的翻译与重音位置预测,它输出带重音标签的中文文本,CosyVoice3 负责根据带标签文本合成中文语音,StressTransfer 解决重音应该放在哪里,CosyVoice3 解决重音如何声学实现,二者用显式标签衔接,组合意义是把源端声学强调转为目标端语言符号再转回声学,避免端到端模型随意生成重音。

检出器做了什么计算?

中文重音检出器名为 Syl-BiLSTM,严格工作在音节层面。输入是中文语音波形,先用预训练语音表示模型提取全部层的帧级表示,原文使用全部 25 层,因为不同层编码声学、韵律和语义等互补线索。接着用强制对齐得到每字时间边界,把帧表示按字切成每字可变帧数的张量,再对时间维做平均池化,得到每字固定尺寸表示。

之后把每字的多层表示堆成整句序列,用可学习的归一化权重融合多层,再送入双向长短期记忆网络建模上下文,最后线性头对每字输出二分类标签,1 为重读,0 为非重读。 下图是该检出器的结构,底部是输入波形和特征提取,上半是层权重融合、双向网络和预测头,阅读时自下而上跟踪表示形状变化。

看图路径: 1. 从底部输入波形向上追踪到特征提取器与字符时长切分;2. 观察时间平均池化如何把可变帧数压成每字一个向量;3. 对比下半绿色冻结部分与上半黄色可学习层权重与双向网络;4. 确认顶端预测头输出的是每字二分类重音标签

原论文 Figure 1:Architecture of the proposed Syl-BiLSTM for Man- darin stress detection.

论文图 1。原论文 Figure 1:“Architecture of the proposed Syl-BiLSTM for Man- darin stress detection.”。

该图下半绿色部分标注为字符级特征提取,包含特征提取器、字符时长切分和时间平均池化,表示从可变帧数变为每字一个向量,上半黄色部分为可学习层权重融合、每字融合表示、双向网络和预测头,顶端为重音标签,图中用不同图标区分冻结与可训练。这种设计的 3 个关键点是音节级池化、多层特征融合和双向上下文编码,原文报告它们对匹配中文重音的语言和声学特性至关重要。 跨语言评测管线名为跨语言强调迁移分数,英文简称 CETS。

英语端用 EmphaClass 检出强调,若一个英文词超过一半帧被判为强调则该词为重读。中文端先用大语音识别模型转写合成音频,再用中文强制对齐工具得到字级时间戳,再用训练好的检出器给出每字二分类。然后用跨语言词对齐框架建立英文词与中文字符的对应,只有当英文重读词直接对齐的中文字符也被判为重读,才算迁移成功。这种严格匹配保证强调不是在输出中随意出现,而是落在语义对应位置。

EmphaClass × Syl-BiLSTM: EmphaClass 负责英语源端重音检出,它用 XLS-R 帧级分类加多数投票判断英文词是否重读,Syl-BiLSTM 负责中文目标端重音检出,它先做音节级池化和多层融合再用双向长短期记忆建模上下文,二者搭配理由是跨语言评测需要两端各有一个可靠检出器,组合后才能通过词对齐判定重音是否落在语义对应位置。

SimAlign × CETS: SimAlign 负责利用多语言预训练模型给出英语词与中文字符之间的自动词对齐,CETS 负责基于两端检出结果计算跨语言强调迁移分数,SimAlign 解决位置对应问题,CETS 解决成功判定问题,组合意义是只有英文被检出重读的词所对齐的中文字符也被检出重读,才算 1 次严格意义上的重音迁移成功。

数据如何录制,模型如何更新?

数据构造遵循已有强调语料方法。来源是两部分:中文强调基准的全部 218 条中文样本,以及指令语料中挑选的 200 条样本。录制招募 2 名普通话标准的母语者,在安静房间用麦克风以 16000 赫兹采样率录音。每句给定目标强调位置,要求在标记音节或字符上产生自然可感知的凸显,同时保持声调类别,避免夸张音高变化或音段改动。每句同一强调位置录制 3 到 5 遍,只在弱、中、强提示下改变 intended 重音强度。

质检人工检查,只保留满足 5 条的音频:目标音节可感知、无邻近非目标重音压过目标、声调和内容正确、无削波噪声截断、字符级强制对齐成功,不满足任一条即丢弃。最终得到 1883 个样本,覆盖 418 个不同句子,共 2.74 小时。 下表把数据规模问题具体化:来源取样是多少,最终保留是多少,时长和说话人是多少,阅读时注意来源条数与最终样本数的区别,前者是文本条数,后者是多遍录音加筛选后的音频条数。

该表显示来源两部分合计约四百余条文本,最终扩展为近 2000 条音频,时长不到 3 小时,说话人仅 2 名。收益是标注位置明确、质检严格,适合微调合成模型学习标签到声学的映射。代价是说话人多样性很低,文本平均长度也有限,原文报告源文本平均约 9.10 词、目标平均约 13.49 字,因此泛化到更广说话人和更长语篇属于未验证范围。 模型更新分两路。

翻译侧采用已有重音感知翻译主干,用大语音编码器加 300000000 参数大语言模型,语言模型同时做翻译和强调预测,输出带显式重音标签的中文文本。为保持通用翻译能力并适应重音预测,对语音编码器和语言模型主干使用低秩适配,只全量微调适配器模块。

合成侧以第三代可控语音合成模型为基座,冻结文本和语音分词器,对注意力与投影层做低秩适配,训练时在文本输入中用显式标签表示重音,用交叉熵损失最大化在给定提示、文本和标签条件下预测目标语音单元的概率。原文未报告学习率、秩、轮数等关键超参数,这是复现时需要补齐的缺项,不能从模型名称推定实现。

实验条件如何保证可比?

评测用自采中文重音标注数据。每次从基准子集中随机抽 35 个不同句子构成测试集,得到约 170 条强调语音,约占全集 10%。为保证统计稳健,随机抽取重复 5 次,所有客观结果报告 5 次随机划分的均值加标准差。关键的防泄漏安排是:两说话人语料不用于训练翻译模块,推理时合成模块用固定默认音色而非语料说话人提示,且每次划分中测试句的所有录音都不参与合成微调和检出器训练。

客观翻译质量遵循已有表达性翻译协议,用大语音识别模型转写生成音频后计算识别后文本的双语评测分数。语音自然度和音频质量用自动 MOS 预测指标。重音保持报告本文提出的跨语言强调迁移分数,分词级和句级两种粒度。词级计算成功迁移的重读词数占比,衡量逐词准确性。句级要求一句中所有源重读词都准确迁移才算整句成功,衡量全局韵律一致性,非常严格。

CETS-W × CETS-S: CETS-W 是词级严格迁移率,计算成功迁移的重读词数占源端重读词总数的比例,CETS-S 是句级完全迁移率,要求一句中所有源端重读词都准确迁移才算整句成功,前者衡量逐词准确性,后者衡量整句韵律一致性,组合使用可以区分偶发压中一个重音与稳定保持全句强调的能力。

主观评测从 1 次测试划分中随机选 20 个样本,招募 6 名熟练双语者。评测者先读源英文文本并看重音高亮,再听源音频,最后听中文翻译音频,只做二值判断:强调是否成功迁移到正确语义位置,明确忽略整体翻译和音质。这种指令把重音判断与翻译质量、音质解耦,避免把自动指标当成人评,也避免不同指标差值混放。

主结果:重音提升了多少,翻译付出什么?

比较对象包括 5 种可运行策略:开源多模态大模型、闭源音频大模型、高能力级联系统、未微调合成的翻译基线,以及本文完整管线。前两者被提示识别源重音、翻译并合成强调中文语音,第三者用高能力大模型做带标签翻译再用基座合成,第四者沿用已有架构但不用本文合成微调。所有系统在相同随机划分协议下比较,指标方向均为越高越好。 下表聚焦最严格的句级迁移率与自动人评一致性,提出比较问题是:在语义对应位置上稳定保持整句强调的能力是否提升,以及自动指标是否可作为人评代理。

来源证据量化值一量化值二量化值三量化值四
来源句一16%22%——
来源句二0.52106—

该表后需要同时读收益与代价。报告显示本文模型在句级严格标准下达到 58.30%,而基线系统停留在 16% 到 22% 左右,说明基线偶发压中单个重音但难以整句保持。自动管线与人评多数投票的皮尔逊相关为 0.52 且显著,绝对一致率达 79%,支持该指标可作为有用的自动代理,但相关不等于因果,也不能承诺误判率或延迟改善。

代价在原文表格中可见:大模型基线双语评测分数略高,本文翻译质量只是可比且自然度保持较好,未胜出项是纯语义翻译能力并未因重音建模而超越最大参数量级联系统。 主观侧 20 样本人评同样显示本文系统大幅领先,但样本量小、仅 1 次划分,且评测者忽略翻译质量,因此不能把主观成功率直接等同于整体系统可用性。

来源证据量化值一量化值二量化值三量化值四
来源句一218———
来源句二1,883 samples418——

该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。

检出器设计哪一步不可少?

检出器对比设置两个源自英语强调检出范式的基线。第一是帧线性加多数投票:用最后一层表示做帧分类,再按字符边界投票。第二是帧双向网络:在最后一层后加双向网络做上下文建模,但仍是帧级分类加投票。本文方法改为音节级池化、多层融合加双向上下文编码。 原文报告帧级基线在中文上明显退化,加上下文的帧双向网络优于帧线性,但仍显著落后于本文方法,本文方法 F1 达到 0.91。

这支持 3 个设计对匹配中文特性是关键的判断,但属于有限解释:原文未给出逐项去掉池化、融合或双向网络的完整消融,也未报告不同层权重分布,因此不能说拿掉某一步必然下降多少。未评测边界包括噪声、口音和自发语速下的检出稳定性,这些在安静房间朗读数据上无法验证。

哪些结论不能推广?

第一,说话人覆盖不足。语料仅 2 名说话人,合成推理用固定默认音色,未来工作也明确要扩展到更广说话人和声调语言场景,因此跨说话人、跨性别年龄和跨口音的重音实现属于待验证。第二,数据规模与场景单一。2.74 小时朗读式录音无法代表对话、会议或嘈杂环境,弱中强 3 种提示强度也不能等同于真实语用中的对比焦点和情感强调。

第三,评测链条依赖多步自动模块,转写、强制对齐、词对齐任一步出错都会影响成功判定,原文未测量各步误判率,也未报告训练资源、推理开销和实际延迟,不能承诺这些量得到改善。第四,资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成验证的资源,不得声称代码模型或数据已公开,复现只能按论文文字重做录制和训练流程。 相关性需要谨慎解读。

0.52 的相关加 79% 一致率支持自动指标有用,但主观仅 20 源样本乘 5 系统共 100 条输出,且 6 人多数投票,样本量和多样性有限,不能推广为全场景人评替代。

复现先做什么,需要补哪些验证?

复现先做数据与划分。按原文从两部分来源取文本,招募标准普通话说话人安静录音,每句同一位置录 3 到 5 遍并覆盖弱中强提示,再按 5 条质检筛选并确认字符级对齐成功。划分时每次随机抽 35 个不同句子做测试,重复 5 次取均值加标准差,且测试句全部录音不进入合成微调和检出器训练,翻译模块不用该两说话人语料训练,合成用固定默认音色。 再做检出与评测。

英语端用已有强调分类模型按过半帧规则判词重读,中文端用大识别模型转写加中文对齐得字边界,再训练音节级融合加双向网络检出器,最后用多语言词对齐建立对应并按严格匹配计算词级和句级分数。合成侧冻结分词器并对注意力投影做低秩适配,用显式标签训练。 下表把人评规模问题具体化:源样本、系统数、总输出、人评人数如何对应,阅读时注意总输出等于源样本乘系统数,多数投票人数与招募人数一致。

来源证据量化值一量化值二量化值三量化值四
来源句一610020—
来源句二610020—

该表显示人评基于 20 源样本跨 5 系统得到 100 条输出,由 6 人投票并与自动管线算相关。复现时应保留相同信息条件:评测者必须同时看到源文本高亮和听到源音频,再听中文输出,且只判位置是否正确而忽略翻译和音质。还需补的验证包括:报告低秩适配的秩、学习率和训练步数,测量转写与对齐错误对指标的影响,补充更多说话人和自然对话测试,并分别记录训练算力与推理延迟。

何时值得尝试这条路线?

当你的英译中语音翻译在语义和音质上已达标,但用户反馈强调经常丢失或落错位置,且你能承担小规模人工录音与质检成本时,这条先检出再可控合成的路线值得尝试。它的适用条件是朗读式短句、可明确标注强调位置、且能接受固定音色合成。若场景是开放域对话、多说话人或强噪声,应先补数据多样性和鲁棒性验证,而不是直接认定重音能力可迁移。 记住论文特有的易错点:中文重音不是把音调拉得很高,而是在保留声调类别下的可感知凸显。

词级压中 1 次不等于整句保持,句级指标严得多;自动指标与人评相关不等于可替代人评;翻译分数高不等于重音好,基线大模型语义强但重音保持弱。按原文链条复述方法时,始终区分直接报告的数字、有限解释的机制归因和未验证的推广推测。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总