评价要排序、训练却在拟合绝对分:用成对排序微调把 CometKiwi 对准文档内 Kendall τ
针对无参考语音翻译质量估计在文档内排序的评价方式,论文把 580M 参数的 CometKiwi-22 改为文档内成对排序加权 MSE 微调,在开发集上达到平均 35.2% 的 per-source Kendall τ,相对 34.6% 基线小幅提升,代价是只用英德和英中数据且未利用音频信号。
针对无参考语音翻译质量估计在文档内排序的评价方式,论文把 580M 参数的 CometKiwi-22 改为文档内成对排序加权 MSE 微调,在开发集上达到平均 35.2% 的 per-source Kendall τ,相对 34.6% 基线小幅提升,代价是只用英德和英中数据且未利用音频信号。
该工作以中库尔德语到英语自发语音翻译为目标,对比用真实语音经语音识别加机器翻译做伪标签与用语音合成加机器翻译造数据两条路线,最强证据是伪标签训练的端到端模型在开发集 25.73、测试集 21.09 的 BLEU,代价是依赖已微调好的识别与翻译模型以及严格过滤,而纯合成数据在自发语音上明显偏弱。
针对马普敦贡语到西班牙语的极低资源语音翻译,论文冻结 Canary-1B-v2 并只训练约 589k 参数的线性适配器、用英语源语言占位实现翻译方向劫持,开发集上时长过滤版本取得 1.56 的词错率和 3.7 的 BLEU,测试集上过滤版本取得 0.82 的 BLEU 和 14.31 的 chrF2++,代价是仍存在重复解码和极低的绝对分数。
该工作用 Parakeet 做流式识别、Qwen 3.5 做流式翻译并以黑盒前缀策略控制提交时机,在 MCIF 长语音上以高延迟配置换质量、低延迟用掩码重翻译补足,并用词表增强与检索示例做上下文轨道,代价是更宽松策略会带来可测的质量回落与闪烁。
该工作把短语音语料拼接成最长 15 分钟的长指令数据并覆盖六任务四语言,用温度采样和端到端加级联两种结构参赛,最强证据是似然加最小贝叶斯风险重排在英语上把词错率从 37.65 降到 21.39 而语义任务仅小幅波动,代价是似然重排会误选切分候选并损害问答与摘要。
针对英语语音输入并按多语指令完成识别翻译问答的问题,该工作用只用识别数据训练的语音映射器对接冻结语言模型并加入合成科学演讲数据,在更小语言模型下追平上届最优并用跨域基准揭示识别与问答的权衡。
该工作用双模统一识别器做流式转写加多语言大模型做翻译的级联路线,在英德英意英中和捷英四个方向上以统一模型覆盖高低延迟档,最强证据是低延迟下统一模型转写与翻译质量优于缓冲与缓存感知基线,代价是中文等语序重排方向需缩小块并提前结束以控延迟。
针对 IWSLT 2026 跨语言克隆学术演讲到阿拉伯语、法语和汉语的任务,该工作用 OmniVoice、VoxCPM 和 Chatterbox 三教师做 Best-of-N 合成蒸馏再对 OmniVoice 按语言做 LoRA 微调,在完整盲测上阿拉伯语 WER 由 0.244 降到 0.228、法语和汉语说话人相似度分别升到 0.760 和 0.732, …
Pinch-AST 针对最长约 2.5 小时无切分音频同时翻译,用 Qwen3-ASR 加 Qwen3.5-4B 每语言对 LoRA 级联与字符级最长公共前缀只增发,在单张 H100 上报告 En→De、En→It、En→Zh 相对基线 XCOMET-XL 提升 4.1、5.7、2.6 分,代价是靠固定块重解码与前缀截断训练控制延迟。
论文把同传从读写时机控制改成包含切句、删除、压缩与代词化的动作选择,用统计感知的逐步提示在英中、英德、英日上同时改善语义与单调性延迟,但文本实验与启发式充分性检查仍留下语音端到端的待验证缺口。
该研究固定 Qwen2-Audio-7B-Instruct 做受限英译中语音翻译,只对 gate_proj、up_proj 和 down_proj 做有损量化加无损 Zstandard 压缩,本地 416 条对比中 q3 加 Zstd 以 0.7767 的 COMET 最接近 0.7792 的基线而体积降到 10.312 GB,q2 加 Zstd 以 …
IWSLT 2026 围绕离线、低资源、压缩、字幕、同传、语音生成与质量估计组织十个赛道,用统一数据条件、自动指标加听音频人工打分检验级联与端到端路线,最强证据是压缩后 4 比特模型与全精度接近、额外上下文平均提升 2.75 个 COMET 点,而语音质量估计在片段级仍远低于人工一致性。
针对克丘亚语到西班牙语低资源语音翻译,QUESPA 比较了级联与端到端路线,最强证据是端到端微调 SpeechT5 结合 SIDON 增强、数据增广与 Collao 语料在官方集上取得 27.2 的 BLEU,代价是 CHRF 未同步提升且大模型提示翻译仍远低于微调基线。
论文把同时语音翻译拆成停顿切分与离线多模态大模型增量翻译,用等待块数与每轮生成上限控制延迟,在开发集上以五折交叉验证显示优于级联基线,但大模型推理开销与误差累积仍是代价。
针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。
该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。
针对无参考语音翻译质量估计中连续分数制造大量文档内微排序噪声的问题,该工作冻结 COMETKiwi-22 只做文本打分再用训练集上搜出的分桶宽度把近似分数压成精确平局,在开发集上把平均段级 Kendall τb 做到 39.4% 而系统级 SPA 维持 88.0% 左右。
该工作在 SeamlessM4T 编码器每层加入预测未来帧数的调度器并用滑动窗口重翻译与改造版 StreamAtt 进行验证,最强证据是改造版 StreamAtt 在英德 4 秒块取得 1976 毫秒延迟比基线快 817 毫秒,主要代价是两种策略下翻译质量均系统性低于未修改基线。
该研究在 13 种语言上比较 6 个系统的零样本意图分类,报告混合架构与强级联相当并更能缓解转写错误,而纯端到端明显落后,且多语言效果同时受大语言模型能力与语音编码器识别质量制约。