论文解读

评价要排序、训练却在拟合绝对分:用成对排序微调把 CometKiwi 对准文档内 Kendall τ

针对无参考语音翻译质量估计在文档内排序的评价方式,论文把 580M 参数的 CometKiwi-22 改为文档内成对排序加权 MSE 微调,在开发集上达到平均 35.2% 的 per-source Kendall τ,相对 34.6% 基线小幅提升,代价是只用英德和英中数据且未利用音频信号。

 · 更新于 2026-09-24 · 约 17 分钟 · 8475 字 阅读 →
论文解读

不用人工标注的语音翻译数据从哪里来:伪标签真实语音与合成语音的对照

该工作以中库尔德语到英语自发语音翻译为目标,对比用真实语音经语音识别加机器翻译做伪标签与用语音合成加机器翻译造数据两条路线,最强证据是伪标签训练的端到端模型在开发集 25.73、测试集 21.09 的 BLEU,代价是依赖已微调好的识别与翻译模型以及严格过滤,而纯合成数据在自发语音上明显偏弱。

 · 更新于 2026-09-24 · 约 19 分钟 · 9066 字 阅读 →
论文解读

借英语占位撬动马普敦贡语翻译:冻结大模型只练一个小适配器

针对马普敦贡语到西班牙语的极低资源语音翻译,论文冻结 Canary-1B-v2 并只训练约 589k 参数的线性适配器、用英语源语言占位实现翻译方向劫持,开发集上时长过滤版本取得 1.56 的词错率和 3.7 的 BLEU,测试集上过滤版本取得 0.82 的 BLEU 和 14.31 的 chrF2++,代价是仍存在重复解码和极低的绝对分数。

 · 更新于 2026-09-24 · 约 25 分钟 · 12472 字 阅读 →
论文解读

用黑盒发射策略把离线大模型压成同传:Parakeet 加 Qwen 的级联取舍

该工作用 Parakeet 做流式识别、Qwen 3.5 做流式翻译并以黑盒前缀策略控制提交时机,在 MCIF 长语音上以高延迟配置换质量、低延迟用掩码重翻译补足,并用词表增强与检索示例做上下文轨道,代价是更宽松策略会带来可测的质量回落与闪烁。

 · 更新于 2026-09-24 · 约 19 分钟 · 9109 字 阅读 →
论文解读

长语音指令跟随:把短语料拼成长训练、再用重排补转写的得失

该工作把短语音语料拼接成最长 15 分钟的长指令数据并覆盖六任务四语言,用温度采样和端到端加级联两种结构参赛,最强证据是似然加最小贝叶斯风险重排在英语上把词错率从 37.65 降到 21.39 而语义任务仅小幅波动,代价是似然重排会误选切分候选并损害问答与摘要。

 · 更新于 2026-09-24 · 约 17 分钟 · 8206 字 阅读 →
论文解读

小语言模型下保住多任务语音跟随:换大容量投影器并补科学演讲合成数据

针对英语语音输入并按多语指令完成识别翻译问答的问题,该工作用只用识别数据训练的语音映射器对接冻结语言模型并加入合成科学演讲数据,在更小语言模型下追平上届最优并用跨域基准揭示识别与问答的权衡。

 · 更新于 2026-09-24 · 约 17 分钟 · 8037 字 阅读 →
论文解读

用双模识别稳住部分音频,再让大模型翻译:NeMo 级联同传如何兼顾延迟与质量

该工作用双模统一识别器做流式转写加多语言大模型做翻译的级联路线,在英德英意英中和捷英四个方向上以统一模型覆盖高低延迟档,最强证据是低延迟下统一模型转写与翻译质量优于缓冲与缓存感知基线,代价是中文等语序重排方向需缩小块并提前结束以控延迟。

 · 更新于 2026-09-24 · 约 16 分钟 · 7887 字 阅读 →
论文解读

科学口音难克隆:用三教师蒸馏加单语 LoRA 补学术域数据

针对 IWSLT 2026 跨语言克隆学术演讲到阿拉伯语、法语和汉语的任务,该工作用 OmniVoice、VoxCPM 和 Chatterbox 三教师做 Best-of-N 合成蒸馏再对 OmniVoice 按语言做 LoRA 微调,在完整盲测上阿拉伯语 WER 由 0.244 降到 0.228、法语和汉语说话人相似度分别升到 0.760 和 0.732, …

 · 更新于 2026-09-24 · 约 17 分钟 · 8174 字 阅读 →
论文解读

长音频不等说完再译:Pinch-AST 用级联重翻译与噪声前缀训练换单卡实时

Pinch-AST 针对最长约 2.5 小时无切分音频同时翻译,用 Qwen3-ASR 加 Qwen3.5-4B 每语言对 LoRA 级联与字符级最长公共前缀只增发,在单张 H100 上报告 En→De、En→It、En→Zh 相对基线 XCOMET-XL 提升 4.1、5.7、2.6 分,代价是靠固定块重解码与前缀截断训练控制延迟。

 · 更新于 2026-09-24 · 约 15 分钟 · 7135 字 阅读 →
论文解读

从等词输出到译员式取舍:用四种显式动作重做同声传译

论文把同传从读写时机控制改成包含切句、删除、压缩与代词化的动作选择,用统计感知的逐步提示在英中、英德、英日上同时改善语义与单调性延迟,但文本实验与启发式充分性检查仍留下语音端到端的待验证缺口。

 · 更新于 2026-09-24 · 约 17 分钟 · 8164 字 阅读 →
论文解读

压哪里比压多少更关键:只压 MLP 投影的编解码压缩

该研究固定 Qwen2-Audio-7B-Instruct 做受限英译中语音翻译,只对 gate_proj、up_proj 和 down_proj 做有损量化加无损 Zstandard 压缩,本地 416 条对比中 q3 加 Zstd 以 0.7767 的 COMET 最接近 0.7792 的基线而体积降到 10.312 GB,q2 加 Zstd 以 …

 · 更新于 2026-09-24 · 约 17 分钟 · 8375 字 阅读 →
论文解读

从离线到同传再到打分:IWSLT 2026 如何把语音翻译的任务、系统与评价钉在一起

IWSLT 2026 围绕离线、低资源、压缩、字幕、同传、语音生成与质量估计组织十个赛道,用统一数据条件、自动指标加听音频人工打分检验级联与端到端路线,最强证据是压缩后 4 比特模型与全精度接近、额外上下文平均提升 2.75 个 COMET 点,而语音质量估计在片段级仍远低于人工一致性。

 · 更新于 2026-09-24 · 约 21 分钟 · 10109 字 阅读 →
论文解读

低资源下直接翻译为何胜过级联:QUESPA 以 SpeechT5 加增强与新语料推进克丘亚语语音翻译

针对克丘亚语到西班牙语低资源语音翻译,QUESPA 比较了级联与端到端路线,最强证据是端到端微调 SpeechT5 结合 SIDON 增强、数据增广与 Collao 语料在官方集上取得 27.2 的 BLEU,代价是 CHRF 未同步提升且大模型提示翻译仍远低于微调基线。

 · 更新于 2026-09-24 · 约 17 分钟 · 8151 字 阅读 →
论文解读

离线大模型不重训怎么做同传:停顿切分加等待策略的测试时适配

论文把同时语音翻译拆成停顿切分与离线多模态大模型增量翻译,用等待块数与每轮生成上限控制延迟,在开发集上以五折交叉验证显示优于级联基线,但大模型推理开销与误差累积仍是代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 8000 字 阅读 →
论文解读

多语言一起训反而互相拖累:用梯度冲突定位瓶颈再做局部专化

针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。

 · 更新于 2026-09-24 · 约 18 分钟 · 8755 字 阅读 →
论文解读

字幕块太碎翻不好:先固定时间,再用整句重写文本

该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。

 · 更新于 2026-09-24 · 约 17 分钟 · 8262 字 阅读 →
论文解读

把连续打分变钝一点:用分桶平局校准提升语音翻译质量估计的段级排序

针对无参考语音翻译质量估计中连续分数制造大量文档内微排序噪声的问题,该工作冻结 COMETKiwi-22 只做文本打分再用训练集上搜出的分桶宽度把近似分数压成精确平局,在开发集上把平均段级 Kendall τb 做到 39.4% 而系统级 SPA 维持 88.0% 左右。

 · 更新于 2026-09-24 · 约 17 分钟 · 8271 字 阅读 →
论文解读

让编码器自己学要看多远:动态前视掩码在同时语音翻译中的验证

该工作在 SeamlessM4T 编码器每层加入预测未来帧数的调度器并用滑动窗口重翻译与改造版 StreamAtt 进行验证,最强证据是改造版 StreamAtt 在英德 4 秒块取得 1976 毫秒延迟比基线快 817 毫秒,主要代价是两种策略下翻译质量均系统性低于未修改基线。

 · 更新于 2026-09-24 · 约 15 分钟 · 7200 字 阅读 →
论文解读

零样本语音意图分类为何混合架构更稳:级联、端到端与混合的十三语言实证

该研究在 13 种语言上比较 6 个系统的零样本意图分类,报告混合架构与强级联相当并更能缓解转写错误,而纯端到端明显落后,且多语言效果同时受大语言模型能力与语音编码器识别质量制约。

 · 更新于 2026-09-24 · 约 15 分钟 · 7275 字 阅读 →