英文题目:PLaST: Towards Paralinguistic-aware Speech Translation
会议身份:
conference:aaai:2026:conference-paper-id:40449
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#注意力机制 #大语言模型 #语音 #语音翻译
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Yi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Ruiquan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jinsong Su:机构信息未能从会议 PDF 纯文本可靠映射
- Daimeng Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Min Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yidong Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音翻译需将源语言语音直接生成目标语言文本,难点在于语音除字面内容还携带重音、情绪与韵律等副语言线索,同词异韵会导致译文分化,而级联与强对齐端到端系统往往将其抹除。PLaST构建双分支流程:语言分支由Whisper编码器加适配器抽取语音表征,副语言分支由冻结的emotion2vec风格编码器抽取帧级风格特征。语言分支先经分层最优传输在LLM解码器多层输出上最小化Wasserstein距离,向文本语义空间提纯得到语言学忠实的表征。提纯后的语言表征作为查询,经基于注意力的检索模块从副语言特征中检索并精炼相关情绪与韵律线索,二者连同指令提示一并送入Llama2解码器生成译文。与仅做语音文本对齐的已有方法不同,该设计显式分离两类信息并在注意力层面按需融合而非将其视为噪声对齐掉,具有提升语义与语用充分性的实际意义。在CoVoST-2基准下,PLaST-2B的BLEU分数为41.6,高于LLaST-2B的41.2。当前结论适用边界受限于英语出发的ContraProST三个方向与CoVoST-2合并训练的6个到英语方向,尚未验证开放域口语、强噪声与未见语言的外推效果。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/YancyDan/PLaST — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留什么?
本文解读的对象是副语言敏感的语音翻译。输入是一段源语言语音,目标是生成目标语言文字。必须保留的关键信息是同一字面转写在不同说法下可能对应不同译文。
输出是 1 篇按学习依赖展开的技术说明,不做营销判断。先说一个教学例子,例子不是论文实验数据。假设英文我很高兴你来了,用真诚高兴的语气说,译文倾向于直接表达欣喜。
若用讽刺不耐烦的语气说同样的词,译文可能要体现迟到带来的不满。例子说明声音里有两层东西,一层是词本身,另一层是怎么说。传统级联做法先做语音识别再做机器翻译,翻译阶段只看到识别出的文字。
这自然丢掉了怎么说。端到端方法直接把语音送进模型,看似能接触到副语言。但现有做法把语音表示往文本内容上对齐,等于鼓励模型只学文字部分。
副语言仍是间接利用。论文因此提出双分支框架,一路提纯语言学内容,一路单独保留副语言,再在解码前融合。后续各节按任务与路线、方法全景、组件计算、训练推理、实验条件、结果反证、复现收束展开。
代码当前可用,地址为官方仓库链接,本次资源状态显示可用。
已有路线在同输入同目标下做了什么?
同输入同目标的端到端语音翻译,核心困难是语音与文本的模态差距。已有工作用多任务学习把语音和文本投到共享语义空间。用跨模态混合、对比学习、对抗训练显式拉近两者表示。
引入大模型后,常见做法是用轻量适配器把语音嵌入映射到大模型输入空间,再做指令微调。这类对齐越贴近文字内容,越容易把语音当成文字的另一种写法,副语言被压缩。
另一条线是副语言研究,在语音合成里学韵律表示并迁移,在语音到语音翻译里讨论表现力。在多模态大模型里做风格感知的问答与对话。
在语音翻译内部,有工作在韩语疑问词上用对比似然比较级联与直接模型,发现直接模型更能利用韵律。有工作贡献双重对比数据集促进更广的副语言研究。也有工作用粗粒度情绪标签增强翻译。
与这些工作相比,本文的不同在于不用离散情绪标签,而是用预训练风格编码器抽取帧级连续表示,并用检索机制按需取用。类别差异不能当成同条件胜负。标签法依赖标注可得性,帧级法依赖风格编码器质量,二者适用条件不同。
为什么字面相同的句子会要求不同译文?
问题可以沿一个样本走完。输入是一段英文语音,语言学表示是单词序列,转写完全相同。副语言表示是重音落在哪个词、情绪是真诚还是讽刺、韵律如何起伏。
目标是在给定说法下选出语用恰当的西班牙语译文,输出是文字译文。当重音落在我还是她身上,指涉与辩解重点变化,译文的主语强调结构也要变化。当情绪从高兴变为讽刺,字面是欢迎,实际是抱怨迟到。
这说明翻译目标不仅是词对词,还包括说话意图。评估因此需要对比似然,即在同一转写配两种说法与两种译文时,模型给正确配对更高似然的程度。方向性分数看单个子例是否选对。
全局分数要求 1 对双重对比同时选对,后者明显更难。理解这一点后,才能看懂双分支的必要性,一路保证词义不丢,一路保证说法可被感知。
下面这张图用两个教学案例把上述欠定具体化,读图时先区分重音与情绪两种条件,再看同一句话如何分叉。
看图路径: 1. 先看上下两个大色块区分重音案例与情绪案例的输入条件;2. 再对比同一英文下 A 与 B 两行的解释与西班牙语译文差异;3. 注意红色下划线与表情符号标记的正是文字转写看不到的线索
论文图 1。原论文 Figure 1:“The same sentence can be interpreted differently when spoken with diverse paralinguistic cues, resulting in distinct translations from English to Spanish.”。
上图显示第一例用同一英文句的重音位置区分两种解释与两种西班牙语译文,第二例用真诚高兴与讽刺恼怒区分字面欢迎与实际抱怨。像素可见红色下划线标出重音词,表情符号区分情绪标签。
解释行说明意图,翻译行给出对应西语。教学价值在于它把副语言从抽象名词变成可操作的翻译分叉。复述时应强调转写相同但译文不同,且差异来源在声音而不在文字。
双分支全景中数据如何流动?
方法全景先走一个样本。输入西班牙语或英语语音波形,进入两条并行支路。黄色语言学支路经语音编码器与适配器得到语言学表示。
绿色副语言支路经风格编码器与注意力检索得到副语言表示,两类表示与任务提示拼接后送入大模型解码器生成目标文字。右侧是训练初期的跨模态对齐视图,语音路与文本路分别经共享大模型得到多层分布,再用搬运损失拉近。
为避免副语言干扰语言学空间,检索处的语言学查询做了截断,不让梯度回流。整体设计是先分离再融合,分离保证提纯,融合保证按需取用。
下图是全文结构锚点,读图时先沿输入到输出的主路径看,再比较两条支路在何处汇合以及冻结与可训练标记的分布。
看图路径: 1. 先沿底部语音波形向上追踪黄色语言学支路到适配器的箭头;2. 再看绿色风格编码器到检索模块的键值箭头与黄色查询虚线汇合处;3. 对比左图整体架构与右图分层对齐中冻结与可训练图标的分布
论文图 2。原论文 Figure 2:“Overall of the proposed PLaST: (a) model architecture of PLaST, and (b) the cross-modal alignment with hierarchical Optimal Transport.”。
上图左半显示语音同时进入语音编码器与风格编码器,语言学表示经适配器直达提示区。副语言表示经查询键值检索后到达提示区另一侧,中间提示块连接两者并送入带低秩适配的大模型。
右半显示语音经编码器与适配器进入共享大模型的多层分布,文本经分词与嵌入进入同一大模型的多层分布,层间用搬运损失对齐。顶部图例区分副语言、语言学、大模型,以及截断、冻结、可训练 3 种状态。
复述时应按输入到表示到组件到目标到输出的顺序讲,不跳过汇合点。
语言学支路如何提纯文字内容?
语言学支路的任务是从语音中抽出与转写一致的内容。论文选用 Whisper-large-v2 作语音编码器,理由是多语言泛化强、对噪声与口音鲁棒。编码器结构易于接入端到端框架。
编码器输出经 3 层多层感知机适配器映射到大模型 2048 维嵌入空间。由于预训练数据质量与语音信息冗余,初抽表示可能混入不利于翻译的成分,因此再做分层最优传输提纯。
具体做法是把语音表示与转写嵌入成对送入冻结的大模型,取多层解码器隐状态作为两组分布。用平方欧氏代价矩阵度量搬运代价,用熵正则上界与 Sinkhorn 算法高效求解 Wasserstein 损失,并在选中层上加权求和。
冻结大模型保证只优化语音侧,实现从语音到文本的单向对齐。
语言学信息 × 副语言信息: 语言学信息指字面转写能承载的形态句法语义,由语音编码器加适配器抽取并经最优传输向文本对齐,负责提供可译的核心命题;副语言信息指重音、情绪、韵律等文字之外的表达方式,由风格编码器抽取帧级特征,负责消解同一句话的多种解释;二者搭配的原因是只保留前者会在重音或反讽处欠定,只保留后者则无命题可译,组合意义是先分离提纯再用注意力检索融合,让解码器同时看到说什么和怎么说。
风格特征的抽取公式是理解分离起点的一步,符号含义是输入语音经风格编码器得到副语言序列。计算目标是保留帧级韵律情绪细节,原文明确该编码器在后续端到端阶段保持冻结。
\[Zp = ENCstyle(s).\]搬运损失的优化目标是最小化传输代价减去熵正则项,符号中传输矩阵指定质量如何在两分布间搬运。正则系数控制平滑强度,原文明确用近似求解而非精确线性规划。
\[LWASS = min\]提纯后的语言学表示作为后续检索的查询,既是语义主体,也是筛选副语言的依据。
副语言支路如何按需取用而不污染主路?
副语言支路的任务是提供细粒度、可筛选的说法线索。论文采用 emotion2vec+base 作风格编码器,看重其免训练可用与帧级抽取能力。对称地从同一语音得到风格序列。
由于该表示缺乏与翻译目标的语义对齐,直接拼接效果次优,因此设计注意力检索模块。模块以截断后的语言学表示为查询,以风格特征为键和值。
做解耦的编码器解码器式注意力,再经线性层与 3 层多层感知机输出。与大模型内部自注意力不同,这里查询与键值来源分离,促进结构化融合。截断操作阻止梯度流回语言学支路,保持语义对齐空间的完整性。
直观讲,模型先问当前语义需要什么语境,再从风格候选中检索最相关的重音与情绪证据。
分层最优传输 × 跨模态对齐: 跨模态对齐是要让语音表示与对应文本表示在大模型语义空间中可比,分层最优传输是实现它的计算手段,即在多个解码器隐层上用熵正则 Wasserstein 距离度量两组变长序列分布的最小搬运代价并用 Sinkhorn 近似求解;搭配理由是单层对齐只约束出口,深层仍可漂移,分层约束迫使各层输出都不依赖输入模态,组合后得到更纯净的语言学表示,为后续副语言融合保留干净查询。
检索计算的公式含义是输出副语言表示由注意力函数对查询与键值加权得到,输入是截断语言学序列与风格序列。目标是任务相关的精炼表示,原文明确截断是防止干扰的关键。
\[Hp = Attention\]注意力检索 × 交叉注意力: 交叉注意力指查询与键值来自不同来源的注意力计算,注意力检索是论文用它实现的副语言筛选器,以对齐后的语言学表示为查询,以风格特征为键和值;分工是语言学分支决定此刻需要什么语境,副语言分支提供候选韵律情绪细节,搭配理由是直接拼接会把任务无关风格噪声灌入解码器,而以查询为导向的检索只取与当前语义相关的线索,组合意义是在注意力层面完成结构化融合。
Whisper 语音编码器 × emotion2vec 风格编码器: Whisper 语音编码器负责多语言鲁棒的语言学内容抽取,选用 large-v2 并加 3 层多层感知机适配到大模型维度;emotion2vec 风格编码器负责细粒度帧级副语言特征抽取,论文采用 emotion2vec+base 并保持冻结;搭配原因是单一编码器经文本对齐后会偏向文字内容而压制副语言,双编码器物理分离避免相互覆盖,组合后一路提纯一路保留,再由检索模块汇合。
消融显示去掉截断会让似然与 BLEU 明显下降,支持分离设计的价值。但这只是该配置下的观察,不能推广为任何融合都必须截断。
两阶段训练与提示拼接如何执行?
训练分两段执行。第一段做分层最优传输对齐,优化语音编码器与适配器。层集合取大模型第 5、7、9、11、13、15、17、19、21、22 层。
对应权重为 0.4、0.4、0.4、0.4、0.5、0.6、0.7、0.8、0.9、1,大模型全程冻结。第二段做端到端翻译,可训参数包括适配器、检索模块以及语音编码器与大模型上的低秩适配。
语音侧秩 128,大模型侧秩 512,风格编码器保持冻结。两段各训一轮,用 AdamW 优化,贝塔为 0.9 与 0.99。学习率先线性暖机至 2 乘 10 的负 4 次方再余弦退火,暖机占前 3% 步数。
解码输入是语言学表示加任务提示加副语言表示的 3 段拼接,训练目标是给定拼接与历史译文预测下一词。提示模板区分语音识别与语音翻译,粗体指令词随任务与方向变化。
下图是提示拼接的可执行依据,读图时先看任务词替换,再看两类占位的位置。
看图路径: 1. 先看上下两个方框区分语音识别提示与语音翻译提示的任务词;2. 再找到每行首尾的语言学占位与副语言占位在提示中的位置;3. 注意加粗的转写与翻译动词及源语言与目标语言名称的替换规律
论文图 3。原论文 Figure 3:“An example of the prompt template. In bold are in- structive words that differ across tasks and translation direc- tions.”。
上图显示识别提示要求把上方英文转写为英文,翻译提示要求把上方西班牙语译为英文。两行首尾分别有语言学占位与副语言占位,中间是给定辅助信息的说明。
像素可见蓝色与红色标题区分任务,加粗动词与语言名随方向变化,绿色占位符标记两类表示插入点。复述时应说明占位不是文字,而是连续向量拼入解码器输入。
冻结大模型 × LoRA 适配: 冻结大模型指在分层最优传输阶段不更新大模型参数,只优化语音编码器与适配器,以建立从语音到文本的单向对齐;LoRA 适配指在端到端翻译阶段以低秩旁路微调语音编码器与大模型解码器,适配器与检索模块全量可训;搭配理由是先冻结可防止文本空间漂移,再用轻量适配恢复翻译生成能力,组合意义是用 2 阶段分工兼顾对齐纯净性与生成质量。
未报告的缺项是具体硬件时长与显存占用,论文未给出可复算的预算,复现时需自行记录。
在什么数据与指标下比较才算公平?
实验用两类基准回答两类问题。副语言感知用 ContraProST,它由双重对比样例组成。每个潜在歧义英文转写配两组说法与译文,覆盖英译德、西、日 3 个方向。
通用翻译用 CoVoST-2,源自 Common Voice,论文用 9 个方向合并训练,涉及法德西意中日译英与英译德日中。并在 6 个译英方向上独立报告。
指标方向需分清,对比评估看对比似然与对比质量,越高表示越能利用副语言。方向性是单子例正确率,随机基线为 50%,全局是成对同时正确。
全局更难且分数普遍偏低;通用翻译看区分大小写的 sacreBLEU,越高越好。基线包括强基线 LLaST 的 2B 与 8B 复现,以及 XLS-R、SeamlessM4T、ZeroSwot-Large、SALMONN 等代表性方法。
模型配置上语言学用 Whisper-large-v2,副语言用冻结 emotion2vec+base。解码器为 TinyLlama-1.1B-Chat 与 Llama-2-7b-chat,对应总参约 2B 与 8B。
公平条件是同一训练数据合并策略与同一指标实现,复述数字时必须同时核对数据集、方向、阶段与聚合对象,数值相同不等于同一指标。
主结果在多大程度上支持副语言有用?
比较问题是双分支是否在副语言敏感与通用场景同时带来可运行收益,公平条件是同一基线 LLaST 与同规模解码器。指标方向是对比似然越高越好、BLEU 越高越好。
下表选择原矩阵中表头与关键基线及本方法行列,保留原文写法与精度,用于回答通用场景的收益。原表在证据清单中的题注写为 ContraProST,但矩阵内容实为 CoVoST-2 的 6 个译英方向 BLEU。
与题注冲突,此处按矩阵实际内容解读为通用翻译结果,并在后文用逐字原句表补足副语言敏感结果,不自行改写原表数字。
| Whisper-large-v2 (2023) 1.6B | 36.4 | 26.1 | 36.3 | 18.0 |
|---|---|---|---|---|
| LLaST-8B (2024b) 8B | 44.1 | 24.4 | 40.8 | 23.3 |
| PLaST-2B (ours) 2B | 41.6 | 24.8 | 37.4 | 19.7 |
| PLaST-8B (ours) 8B | 44.3 | 27.8 | 40.9 | 24.8 |
上表截取通用翻译矩阵的法、日、德、中四列与 LLaST-2B、PLaST-2B、PLaST-8B 等行,显示 PLaST-2B 在各列上略高于同规模 LLaST-2B。PLaST-8B 进一步提升,尤其在日译英上增幅较大。
代价是引入风格编码器与检索模块的参数与计算,未胜出项是部分高资源方向增益较小。不能把平均提升理解为每组都同等提升。
下表用全文连续原句覆盖的数字整理副语言敏感与通用平均收益,解决原表宽度不足且题注冲突的问题。所有数字与单位来自原句逐字证据。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 副语言敏感平均 | 方向性似然 | 强基线 | 65.0 | 平均 65.0 方向性 |
| 副语言敏感平均 | 全局似然 | 强基线 | 14.1 | 平均 14.1 全局 |
| 副语言敏感增益范围 | 方向性提升点 | LLaST | 2.3 至 5.9 点 | 方向性增益区间 |
| 副语言敏感增益范围 | 全局提升点 | LLaST | 2.8 至 5.2 点 | 全局增益区间 |
| 通用 2B 平均 | BLEU 提升 | LLaST | 0.43 | 2B 平均提升 |
上表显示论文报告副语言敏感平均达方向性 65.0 与全局 14.1,较 LLaST 方向性提升 2.3 至 5.9 点、全局提升 2.8 至 5.2 点。通用 2B 平均提升 0.43 BLEU。
主要收益是方向性与全局同时提升且超越 SeamlessM4T 等方法,具体代价是全局绝对值仍偏低。说明成对同时选对依然困难,未评测边界是除英译德西日外的更多副语言现象。
拿掉哪一块会让增益消失?
反证按去掉组件组织。在 CoVoST-2 西译英与 ContraProST 英译西的联合消融中,去掉整个副语言分支带来最大下降。似然下降 8.6、BLEU 下降 0.42,支持副语言对翻译过程有效。
去掉最优传输与去掉检索分别让似然提升减少 1.1 与 6.7,BLEU 提升减少 0.37 与 0.31。说明检索的筛选作用大于纯对齐增益。去掉截断操作让似然下降 5.9、BLEU 下降 0.28。
这支持副语言梯度会干扰语言学空间的判断。检索变体中,把交叉注意力换成对副语言的自注意力,似然与 BLEU 分别下降 2.2 与 0.12。换成对语言学的自注意力相当于把语言学送 2 次。
此时 BLEU 略高于无增强但似然基本不变,支持语音编码器主要捕获文字内容。堆叠两层或 3 层检索与单层差异很小,支持增益来自检索过程而非容量增加,故采用单层。
跨模态检索实验在 2000 对语音转写上用最小 Wasserstein 距离找最近邻,PLaST 在第 22、21、20 层 Top-1 准确率分别为 97.5、97.3、96.9。基线为 91.3、66.7、21.2,越往低层差距越大。
这支持分层对齐产生语言学忠实表示。相关性不等于因果,消融未测量延迟与误判率,不能承诺这些量同步改善。
哪些结论还不能下,边界在哪里?
论文直接报告的是在给定数据集、基线与指标下的提升,有限解释是双分支与截断有助于分离与融合。未验证推测是该思路可推广到所有副语言现象。
缺失证据不是技术错误,但复述时要用报告显示、结果支持、可能待验证区分语气。边界包括副语言敏感评估仅覆盖 3 个译出方向,通用评估仅报告 6 个译英方向。
全局似然绝对值仍低,说明细粒度决策远未解决;训练与推理开销、输出帧率与实际延迟未系统报告。不能从 BLEU 提升推定更快更便宜。
风格编码器冻结意味着其自身偏置会被继承,低资源语言的大增益可能与数据分布有关。原表题注与矩阵内容冲突已在结果节标注,不自行编造划分来圆成一致。
总体趋势不等于每步都成立,引用平均值时应同时给出区间与反例。
要复现应先做什么,需要什么条件?
复现先做信息条件核对。代码当前可用,官方仓库链接在摘要代码行给出,本次资源状态为可用。权重下载与系统可运行需按仓库实际说明核对。
本文不从模型名称推定实现。数据准备 ContraProST 用于副语言对比评估,CoVoST-2 按论文 9 方向合并训练。并在 6 个译英方向独立评估,指标用对比似然与区分大小写 sacreBLEU。
模型搭建按语言学 Whisper-large-v2 加 3 层适配器、副语言冻结 emotion2vec+base 加单层检索执行。解码器 TinyLlama 或 Llama-2 的 2B 与 8B 两档执行。
训练按先分层对齐一轮再端到端一轮执行,保留层集合与权重、低秩秩数、优化器与学习率计划等关键超参数。先跑跨模态检索验证对齐是否达到高位准确率,再跑主结果与消融。
避免直接调参掩盖对齐失效。还需补的验证是延迟显存记录、更多语言方向与人工语用评价,缺项应在报告中明确写出。
何时值得尝试这种分离再融合?
当任务输入是语音、目标文字对说法敏感、且同一转写存在多解释时,值得尝试先分离再融合。做法是保留一路经文本对齐提纯的语言学查询。
另开一路冻结风格编码器保留帧级副语言,再用单层交叉注意力按需检索并截断梯度。最后与提示拼接送入解码器。适用条件是已有可靠风格编码器与可对比评估数据,否则增益难以度量。
尝试前应确认基线是实际可运行策略,搜索最优或事后最优只作参考,不代替可部署收益。常见误解是端到端接触语音就等于用好副语言。
本文显示过度向文字对齐反而压缩副语言;另一误解是拼接越多风格越好,消融显示无检索的全量拼接会引入噪声。收束时回到可核对事实。
双分支在已测条件下带来方向性与全局的同时提升与通用场景的小幅稳定提升,代价是额外编码与 2 阶段训练,边界与成本仍需补测。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


