Last Translation Benchmark

📄 不再打总分:给每道翻译难题配一把专用量尺 英文题目:Last Translation Benchmark 一句话:面对饱和的机器翻译基准与失灵的整体打分,这项工作用众包难例加逐题验证规则把评价变成可复现的通过率,最强模型仅约四成通过而人工接近满分,代价是样本偏向刻意难题与英文中心。 标签:#语音翻译 | #大语言模型 | #多语言 | #基准测试 | #多模态模型 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Vilém Zouhar:机构信息未在 arXiv HTML 中可靠披露 Niyati Bafna:机构信息未在 arXiv HTML 中可靠披露 Mukund Choudhary:机构信息未在 arXiv HTML 中可靠披露 Maike Züfle:机构信息未在 arXiv HTML 中可靠披露 Sara Rajaee:机构信息未在 arXiv HTML 中可靠披露 Pinzhen Chen:机构信息未在 arXiv HTML 中可靠披露 Jannis Vamvas:机构信息未在 arXiv HTML 中可靠披露 Sara Papi:机构信息未在 arXiv HTML 中可靠披露 Ona de Gibert:机构信息未在 arXiv HTML 中可靠披露 Bhavitvya Malik:机构信息未在 arXiv HTML 中可靠披露 Eliya Habba:机构信息未在 arXiv HTML 中可靠披露 Orfeas Menis Mastromichalakis:机构信息未在 arXiv HTML 中可靠披露 Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露 Michelle Wastl:机构信息未在 arXiv HTML 中可靠披露 Sheriff Issaka:机构信息未在 arXiv HTML 中可靠披露 Leshem Choshen:机构信息未在 arXiv HTML 中可靠披露 Stella Biderman:机构信息未在 arXiv HTML 中可靠披露 Antonis Anastasopoulos:机构信息未在 arXiv HTML 中可靠披露 Jan Niehues:机构信息未在 arXiv HTML 中可靠披露 Rico Sennrich:机构信息未在 arXiv HTML 中可靠披露 Mrinmaya Sachan:机构信息未在 arXiv HTML 中可靠披露 Ondřej Bojar:机构信息未在 arXiv HTML 中可靠披露 Kenton Murray:机构信息未在 arXiv HTML 中可靠披露 Jörg Tiedemann:机构信息未在 arXiv HTML 中可靠披露 Alham Fikri Aji:机构信息未在 arXiv HTML 中可靠披露 Philipp Koehn:机构信息未在 arXiv HTML 中可靠披露 Christof Monz:机构信息未在 arXiv HTML 中可靠披露 Alexandra Birch:机构信息未在 arXiv HTML 中可靠披露 Sowmya Vajjala:机构信息未在 arXiv HTML 中可靠披露 Chalamalasetti Kranti:机构信息未在 arXiv HTML 中可靠披露 Cristina España-Bonet:机构信息未在 arXiv HTML 中可靠披露 Nobin Sarwar:机构信息未在 arXiv HTML 中可靠披露 David Kaczér:机构信息未在 arXiv HTML 中可靠披露 Shunta Asano:机构信息未在 arXiv HTML 中可靠披露 Malik Marmonier:机构信息未在 arXiv HTML 中可靠披露 Daban Q. Jaff:机构信息未在 arXiv HTML 中可靠披露 Vaisakhi Mishra:机构信息未在 arXiv HTML 中可靠披露 Hend Al- Khalifa:机构信息未在 arXiv HTML 中可靠披露 Gabriele Sarti:机构信息未在 arXiv HTML 中可靠披露 Sourajit Saha:机构信息未在 arXiv HTML 中可靠披露 Nils Rehlinger:机构信息未在 arXiv HTML 中可靠披露 Juan Daniel Cuervo Villa:机构信息未在 arXiv HTML 中可靠披露 Jonathan Tonglet:机构信息未在 arXiv HTML 中可靠披露 Saugata Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Dominik Macháček:机构信息未在 arXiv HTML 中可靠披露 Jagannathan Ramanujam:机构信息未在 arXiv HTML 中可靠披露 Heejin Do:机构信息未在 arXiv HTML 中可靠披露 Zuzana Nadova:机构信息未在 arXiv HTML 中可靠披露 Fred Philippy:机构信息未在 arXiv HTML 中可靠披露 Fabian Retkowski:机构信息未在 arXiv HTML 中可靠披露 Maria Lymperaiou:机构信息未在 arXiv HTML 中可靠披露 Silvia Casola:机构信息未在 arXiv HTML 中可靠披露 Hanna Yukhymenko:机构信息未在 arXiv HTML 中可靠披露 Shubhashis Roy Dipta:机构信息未在 arXiv HTML 中可靠披露 Sangwon Ryu:机构信息未在 arXiv HTML 中可靠披露 Andrés Jerez:机构信息未在 arXiv HTML 中可靠披露 Ron Keinan:机构信息未在 arXiv HTML 中可靠披露 Shuaib Shuaib Yusuf:机构信息未在 arXiv HTML 中可靠披露 Avantica Vempati:机构信息未在 arXiv HTML 中可靠披露 Maria Carmen Staiano:机构信息未在 arXiv HTML 中可靠披露 Sukannya Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Adrian Cosma:机构信息未在 arXiv HTML 中可靠披露 Vitalii Babenko:机构信息未在 arXiv HTML 中可靠披露 Erivan Inan:机构信息未在 arXiv HTML 中可靠披露 Aviral Nigam:机构信息未在 arXiv HTML 中可靠披露 Wafa Aissa:机构信息未在 arXiv HTML 中可靠披露 Fatima Haouari:机构信息未在 arXiv HTML 中可靠披露 Venkata Prasanth Kumar Gummadi:机构信息未在 arXiv HTML 中可靠披露 Mehdi Jafarzadeh:机构信息未在 arXiv HTML 中可靠披露 Valentin Scourneau:机构信息未在 arXiv HTML 中可靠披露 Lukas Edman:机构信息未在 arXiv HTML 中可靠披露 Kaiser Sun:机构信息未在 arXiv HTML 中可靠披露 Shaomu Tan:机构信息未在 arXiv HTML 中可靠披露 Mohammad Sadegh Gholizadeh:机构信息未在 arXiv HTML 中可靠披露 Johannes-Rudolf David:机构信息未在 arXiv HTML 中可靠披露 Dipankar Srirag:机构信息未在 arXiv HTML 中可靠披露 Javier García Gilabert:机构信息未在 arXiv HTML 中可靠披露 Ruta Binkyte:机构信息未在 arXiv HTML 中可靠披露 Manar Ali:机构信息未在 arXiv HTML 中可靠披露 Ana-Maria Bucur:机构信息未在 arXiv HTML 中可靠披露 Sabry E. Farrag:机构信息未在 arXiv HTML 中可靠披露 Youssef Saber:机构信息未在 arXiv HTML 中可靠披露 Yihong Liu:机构信息未在 arXiv HTML 中可靠披露 Jean Maillard:机构信息未在 arXiv HTML 中可靠披露 Cojocaru Nicoleta:机构信息未在 arXiv HTML 中可靠披露 Xiaochuang Yuan:机构信息未在 arXiv HTML 中可靠披露 Sina Ahmadi:机构信息未在 arXiv HTML 中可靠披露 Philipp Mondorf:机构信息未在 arXiv HTML 中可靠披露 Kaustubh Dhole:机构信息未在 arXiv HTML 中可靠披露 Roman Wixinger:机构信息未在 arXiv HTML 中可靠披露 Shenbin Qian:机构信息未在 arXiv HTML 中可靠披露 Manuel Tuor:机构信息未在 arXiv HTML 中可靠披露 Sergey Troshin:机构信息未在 arXiv HTML 中可靠披露 Jonathan Yahav:机构信息未在 arXiv HTML 中可靠披露 Fida Mohammad Thoker:机构信息未在 arXiv HTML 中可靠披露 Amir Arsalan Rezapour:机构信息未在 arXiv HTML 中可靠披露 Lance Calvin Lim Gamboa:机构信息未在 arXiv HTML 中可靠披露 Manon Reusens:机构信息未在 arXiv HTML 中可靠披露 Kätriin Kukk:机构信息未在 arXiv HTML 中可靠披露 Koel Dutta Chowdhury:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把评价从整体印象分改为单样本可判定验证规则,用信息不对称缓解大语言模型(Large Language Model,LLM)既当选手又当裁判的自利偏差,思路干净且可诊断。短板是众包难例天然偏向猎奇、对抗与英文中心分布,对日常翻译质量代表性不足,规则质量与跨语言可比性仍高度依赖人工复核,迁移主张偏强。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1031 words

Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

📄 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages 一句话:针对转录稀缺导致解码器目标端先验不足的问题,SAMA-ASR 在冻结 Whisper 上插入语义-声学双锚点门控适配器,在 30 小时闽南语与客家语上以自动生成的普通话翻译锚点实现约 30% 与 19% 的相对 CER 下降,代价是依赖配对翻译与额外的 ST 推理开销。 标签:#语音识别 #Adapter #语音翻译 #低资源 #多语言 评分:8.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kuan-Tang Huang:National Taiwan Normal University, Taiwan;EZAI, Taiwan Cheng-Yeh Yang:National Taiwan Normal University, Taiwan Chien-Chun Wang:National Taiwan Normal University, Taiwan Hung-Shin Lee:National Taiwan Normal University, Taiwan Hsin-Min Wang:Academia Sinica, Taiwan Berlin Chen:National Taiwan Normal University, Taiwan 💬 毒舌点评 亮点在于把低资源自动语音识别(Automatic Speech Recognition,ASR)重新定义为目标端生成证据不足问题,并用冻结骨干加语义-声学双锚点门控适配器的极简设计同时解决语义引导与声学落地,消融与冷启动分析相当扎实。短板是验证仅限两套汉语方言且依赖配对普通话翻译,极低资源与弱翻译器下的失效边界已被作者自行暴露,跨语系泛化与真实无配对场景的可用性仍存疑。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1582 words

Is Prosody Lost in Translation? Fine-Grained Cross-Lingual Prosody Similarity Across Languages

📄 翻译丢掉的不只是词:当语调跨越语言还能剩下多少? 英文题目:Is Prosody Lost in Translation? Fine-Grained Cross-Lingual Prosody Similarity Across Languages 一句话:论文用影视专业配音的平行话语做词级语义重排后的基频与能量轮廓相关分析,证实跨语言韵律存在微弱但系统性的保留,且名词段贡献最大,代价是结论依赖不可公开的配音数据与三对欧洲语言。 标签:#语音翻译 #多语言 #基准测试 评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5 👥 作者与机构 Haopeng Xie:Center for Language and Speech Processing (CLSP), Johns Hopkins University;Baltimore, MD, USA Ismail Rasim Ulgen:Center for Language and Speech Processing (CLSP), Johns Hopkins University;Baltimore, MD, USA Sofia Son:Center for Language and Speech Processing (CLSP), Johns Hopkins University;Baltimore, MD, USA Berrak Sisman:Center for Language and Speech Processing (CLSP), Johns Hopkins University;Baltimore, MD, USA Philipp Koehn:Center for Language and Speech Processing (CLSP), Johns Hopkins University;Baltimore, MD, USA 💬 毒舌点评 亮点在于首次用专业配音数据在词级对齐粒度上量化跨语言韵律可迁移性,引入语义重排与词性消融使分析框架完整且统计处理细致。短板是所有结论建立在不可公开的影视配音语料上,基频相关仅 0.229 至 0.246、能量仅 0.174 至 0.183 的弱相关却被论证为系统性保留,且仅覆盖德英、英西、英法三对欧洲非声调语言,对韵律普适性的外推力极弱。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 783 words

The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

📄 The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT 标签:#语音识别 #参数高效微调 #语音翻译 #鲁棒性 #模型评估 6.5/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #LoRA | #参数高效微调 #语音翻译 | arxiv 👥 作者与机构 第一作者:Kirill Borodin(论文未列出机构) 通讯作者:Kirill Borodin(论文未列出机构) 作者列表:Kirill Borodin、Vasiliy Kudryavtsev、Ivan Viakhirev、Grach Mkrtchian(均未说明机构) 💡 毒舌点评 本文把 reserved null token 从“解码细节”升级成诊断透镜,并把“幻觉抑制”和“删除真实语音”放进同一个 \(C_\kappa\) 代价曲线,这是审稿人希望看到的清醒做法。短板也很明显:locked 评估只覆盖 Whisper-small 的五个 checkpoint 条件,外部 VAD/state gate 没有在同一 locked set 上竞争;trained row 在 locked set 上从未成为任何展示 \(\kappa\) 下的最低点,低 \(\kappa\) 时只是 bias b=5 的点估计更优,\(\kappa\ge 2\) 时 stock 更优。因此最核心的“row 编辑是否真的优于简单 bias 或外部拒绝器”仍没有结论。标题里的 “knows” 也有些过强:论文实际显示状态和 margin 中有可分离信号,但 native EOT argmax 仍经常不弃权。 ...

2026-08-18 · 更新于 2026-09-04 · 6 min · 1073 words

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

📄 VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation 标签:#语音翻译 #大语言模型 #低资源 #语音合成 6.9/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音翻译 | #大语言模型 | #低资源 #语音合成 | arxiv 👥 作者与机构 第一作者:Yejin Jeon(Mila - Quebec AI Institute、McGill University);Marie Maltais(Mila - Quebec AI Institute、McGill University,标注 equal contribution) 通讯作者:未说明 作者列表:Yejin Jeon(Mila - Quebec AI Institute、McGill University)、Marie Maltais(Mila - Quebec AI Institute、McGill University)、Virginia Ceccatelli(Mila - Quebec AI Institute、McGill University)、Min Ma(Google DeepMind)、David Ifeoluwa Adelani(Mila - Quebec AI Institute、McGill University、Canada CIFAR AI Chair) 💡 毒舌点评 亮点是给出了第一个大规模多语言长语音“联合摘要+翻译”基准 VoxSumm,703小时/24语言/10045对的规模填补了任务定义和数据空白,并做了较系统的模型与提示设置比较。短板是全部音频由 TTS 合成而非真实语音,且数据对齐依赖 CrossSum 自动语义相似度匹配,论文只承诺 release 却未给出任何可获取链接,可复现性大打折扣。 ...

2026-08-12 · 更新于 2026-09-04 · 3 min · 586 words

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

📄 Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders 标签:#语音翻译 #语音大模型 #端到端 #课程学习 #多语言 8.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音翻译 | #语音大模型 | #端到端 #课程学习 | arxiv 👥 作者与机构 第一作者:Yexing Du(机构未说明;论文标注为 1,2) 通讯作者:论文未注明通讯作者 作者列表: Yexing Du(机构未说明;标注 1,2) Kaiyuan Liu(机构未说明;标注 1,2) Youcheng Pan(机构未说明;标注 2) Bo Yang(机构未说明;标注 2) Chengpeng Fu(机构未说明;标注 1,2) Yu Wang(机构未说明;标注 2) Ming Liu(机构未说明;标注 1,2) 说明:论文只给出作者单位编号 1 和 2,没有提供单位名称,因此无法确认具体机构。 💡 毒舌点评 用“冻结高资源专家 + 可训练中低资源专家”的方式把资源分层直接做进语音编码器,思路不算复杂,但确实直击共享编码器的容量竞争问题,45 语言全方向评测的工程量也值得肯定。不过“打破多语言诅咒”这个结论仍偏强:MoSE 本质上只是按人工资源等级把模型容量切成两半,缺少参数匹配对照、显著性检验和更精细的资源分组依据,效果有多少来自路由、多少来自直接翻倍编码器参数,论文并没有彻底说清。全方向 1,980 个翻译方向的主结果表也只给出聚合分布与代表方向,逐方向失败模式仍未充分暴露。 ...

2026-08-06 · 更新于 2026-09-04 · 8 min · 1514 words

The Role of Disfluencies in Speech Translation

📄 The Role of Disfluencies in Speech Translation 标签:#语音翻译 #基准测试 #音频理解 #Transformer #模型评估 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.4/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音翻译 | #Transformer | #基准测试 #音频理解 | arxiv 👥 作者与机构 第一作者:Maike Züfle(卡尔斯鲁厄理工学院) 通讯作者:未说明 作者列表:Maike Züfle(卡尔斯鲁厄理工学院)、Maria Teleki(德克萨斯农工大学)、Fabian Retkowski(卡尔斯鲁厄理工学院)、Vilém Zouhar(苏黎世联邦理工学院)、Oliver Grabner(德克萨斯农工大学)、Alexander Waibel(卡尔斯鲁厄理工学院、卡内基梅隆大学)、James Caverlee(德克萨斯农工大学)、Jan Niehues(卡尔斯鲁厄理工学院) 💡 毒舌点评 这篇论文为语音翻译中的不流畅现象做了一次扎实的"验尸报告":通过人类情感标注和基准构建,首次量化了去除不流畅对情绪感知的扭曲,问题定义清晰且有现实意义。然而,该工作本质上是对现有模型盲点的系统诊断,其贡献边界应更清晰地界定。方法层面的创新有限,推理时策略的改进幅度微小且未解决根本问题——如果加两个上下文示例就能提升5个chrF点,那只能说明当前模型离解决此问题只差一点点提示工程,所谓的"盲点"可能更多是训练数据分布偏差,而非真正的认知缺陷。 ...

2026-08-04 · 更新于 2026-09-04 · 3 min · 557 words

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

📄 SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision 标签:#语音翻译 #流式处理 #多任务学习 #参数高效微调 #音频理解 7.3/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.3/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音翻译 | #多任务学习 | #流式处理 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Rongshen He(The Chinese University of Hong Kong, Shenzhen) 通讯作者:Zhizheng Wu(The Chinese University of Hong Kong, Shenzhen) 作者列表:Rongshen He(The Chinese University of Hong Kong, Shenzhen)、Xinyu Liang(The Chinese University of Hong Kong, Shenzhen)、Dekun Chen(The Chinese University of Hong Kong, Shenzhen)、Jiaqi Li(The Chinese University of Hong Kong, Shenzhen)、Mingjie Chen(The Chinese University of Hong Kong, Shenzhen)、Zhizheng Wu(The Chinese University of Hong Kong, Shenzhen) 💡 毒舌点评 论文在数据稀缺条件下,通过精巧的轨迹监督和架构分解实现了有竞争力的流式S2ST,工程优化思路清晰,实验设计扎实。然而,核心依赖对齐质量且完全不开源,使其贡献的可验证性和可复用性大打折扣,更像是一个精心打造的内部技术报告而非开放研究。 ...

2026-07-23 · 更新于 2026-09-04 · 3 min · 576 words

When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation

📄 When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation 标签:#语音翻译 #提示学习 #流式处理 #音频理解 #Transformer 6.7/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音翻译 | #提示学习 | #流式处理 #音频理解 | arxiv 👥 作者与机构 第一作者:Zeyu Yang(香港中文大学(深圳)) 通讯作者:Zeyu Yang(香港中文大学(深圳)) 作者列表:Zeyu Yang(香港中文大学(深圳))、Satoshi Nakamura(香港中文大学(深圳)) 💡 毒舌点评 论文的亮点在于洞察精准——将上下文收益归结于术语恢复而非通用语义增强,并且将其实现为轻量的推理时框架。shuffled-memory控制实验设计严谨,有效地验证了性能提升源于与正确证据的对齐,而非通用偏向。短板也很明显:核心组件“术语提取器”是一个闭源的大语言模型API(Qwen3-30B-Instruct),其准确性、偏差和可复现性是硬伤。验证数据集规模有限且场景高度特化(ACL技术会议),在更通用或低资源场景下的价值存疑。方法高度依赖文档级上下文质量,这限制了其适用范围。 ...

2026-07-21 · 更新于 2026-09-04 · 2 min · 321 words

X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System

📄 X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System 标签:#语音翻译 #语音合成 #语音克隆 #实时处理 #多语言 7.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.4/1.5 ✅ 7.8/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音翻译 | #语音合成 | #语音克隆 #实时处理 | arxiv 👥 作者与机构 第一作者:Yuxiang Zhao(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院) 通讯作者:Xie Chen(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院) 作者列表:Yuxiang Zhao(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院)、Yichi Zhang(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab)、Yanjie An(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab)、Yanqiao Zhu(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院)、Zhanxun Liu(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院)、Yushen Chen(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院)、Qixi Zheng(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院)、Haina Zhu(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院)、Yunchong Xiao(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab)、Keqi Deng(Microsoft)、Shuai Fan(AISpeech Co., Ltd.)、Kai Yu(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab)、Xie Chen(上海交通大学计算机科学与工程系,MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, X-LANCE Lab; 上海创新研究院) 💡 毒舌点评 这篇论文最突出的亮点是构建了一个完全开源、模块化、面向部署研究的实时语音翻译系统,并提供了从系统设计、运行时策略到多维度评估的完整方案,这在黑盒API盛行的当下尤为珍贵。然而,其创新主要体现在工程整合与运行时控制层面,而非提出新的核心模型或算法,因此在技术深度上难以与顶级模型论文媲美,更像是一份详尽的“系统集成与评估技术报告”。 ...

2026-07-21 · 更新于 2026-09-04 · 5 min · 870 words