论文解读

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

这篇论文旨在解决语音到语音翻译(S2ST)系统普遍丢失源语音中非语言声音(如笑声、哭声)和情感信息的问题,这严重影响了跨语言交流的自然度和准确性。为此,作者提出了三项核心贡献:首先,设计了一个可扩展的自动化数据合成管道,用于生成大规模、高质量的英中富有表现力S2ST平行语料,克服了训练数据稀缺的瓶颈

 · 更新于 2026-09-24 · 约 11 分钟 · 5030 字 阅读 →
论文解读

Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps

本文旨在解决语音大模型(SpeechLLMs)在推理时产生的“幻觉”问题,即生成与输入音频不符的流畅文本。现有方法依赖昂贵的黄金标准输出,而文本LLM的方法无法捕捉音频特有信号。为此,作者提出了四个基于注意力图的轻量级指标(AudioRatio, AudioConsistency, AudioEnt

 · 更新于 2026-09-24 · 约 9 分钟 · 4059 字 阅读 →
论文解读

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

这篇论文旨在解决语音到语音翻译(S2ST)系统普遍缺失非语言声音(如笑声、哭泣)和情感韵律的问题,这严重限制了跨语言交流的自然度和语用准确性。作者提出了三大贡献:1) 一个**可扩展的表达性数据合成管道**,能自动生成高质量、带情感标注的S2ST训练对,克服了数据稀缺瓶颈;2) **MoVE(混合声

 · 更新于 2026-09-24 · 约 10 分钟 · 4623 字 阅读 →
论文解读

NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages

这篇论文旨在解决非洲低资源语言在语音翻译(S2ST和S2TT)研究中面临的高质量、多口音平行语音数据严重匮乏的核心瓶颈。为此,作者构建了**NaijaS2ST**数据集,涵盖豪萨语、伊博语、约鲁巴语和尼日利亚皮钦语与英语的平行语音,每种语言约50小时,捕获了真实的说话者与口音多样性。基于此数据集,论

 · 更新于 2026-09-24 · 约 9 分钟 · 4148 字 阅读 →