论文解读

把对齐改成填空:一次填完长语音时间戳的槽位方案

针对多语长语音中逐帧搜索易累积系统性偏移的问题,该文把强制对齐改成在文本中插入时间槽并分类预测离散时间索引,报告在伪标签与人工标注上平均累积偏移大幅下降,代价是模型更大且实时因子略升、人工验证仅覆盖中文。

 · 更新于 2026-09-25 · 约 19 分钟 · 9165 字 阅读 →
论文解读

用发音特征做跨语言偏置:在新语言上只用 10 小时做语音单元发现

针对无文字低资源语言难以从原始音频发现音素单元的问题,该工作在 HuBERT 基础上用 55 语言的发音特征与音素监督做多语言续训,再以 ABX 可辨别性检验上下文不变性,最强有监督自适应在开发集与测试集取得 3.07% 与 3.39% 的平均误差,但自监督与有监督之间仍有差距且评估集中于 ABX。

 · 更新于 2026-09-25 · 约 16 分钟 · 7721 字 阅读 →
论文解读

先标出不流利词,再让大模型学会不说:三语语音纠错的对比调优

针对印地语、孟加拉语、马拉地语语音转写中填充词与重复修复残留问题,论文用 MuRIL 词级标记引导指令微调并以对比损失惩罚复现不流利词,在人工校对与真实口语两类测试上取得一致提升,但真实集规模小且仅验证 3B 量级模型。

 · 更新于 2026-09-25 · 约 19 分钟 · 9477 字 阅读 →
论文解读

文化知识碎在模态和语言之间:MMAC 如何对齐三模态输入再测一致性与根据

针对多语言多模态模型的文化感知碎片化问题,MMAC 用 8 国 10 语言 27,000 题的三模态语义对齐题库和五维评测揭示跨语言跨模态不一致与解释不忠实,并以口音线索增益与整合失败等代价界定其适用边界。

 · 更新于 2026-09-25 · 约 21 分钟 · 10388 字 阅读 →
论文解读

长语音指令跟随:把短语料拼成长训练、再用重排补转写的得失

该工作把短语音语料拼接成最长 15 分钟的长指令数据并覆盖六任务四语言,用温度采样和端到端加级联两种结构参赛,最强证据是似然加最小贝叶斯风险重排在英语上把词错率从 37.65 降到 21.39 而语义任务仅小幅波动,代价是似然重排会误选切分候选并损害问答与摘要。

 · 更新于 2026-09-25 · 约 17 分钟 · 8206 字 阅读 →
论文解读

小语言模型下保住多任务语音跟随:换大容量投影器并补科学演讲合成数据

针对英语语音输入并按多语指令完成识别翻译问答的问题,该工作用只用识别数据训练的语音映射器对接冻结语言模型并加入合成科学演讲数据,在更小语言模型下追平上届最优并用跨域基准揭示识别与问答的权衡。

 · 更新于 2026-09-25 · 约 17 分钟 · 8037 字 阅读 →
论文解读

用双模识别稳住部分音频,再让大模型翻译:NeMo 级联同传如何兼顾延迟与质量

该工作用双模统一识别器做流式转写加多语言大模型做翻译的级联路线,在英德英意英中和捷英四个方向上以统一模型覆盖高低延迟档,最强证据是低延迟下统一模型转写与翻译质量优于缓冲与缓存感知基线,代价是中文等语序重排方向需缩小块并提前结束以控延迟。

 · 更新于 2026-09-25 · 约 16 分钟 · 7887 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 108 分钟 · 53865 字 阅读 →
论文解读

长音频不等说完再译:Pinch-AST 用级联重翻译与噪声前缀训练换单卡实时

Pinch-AST 针对最长约 2.5 小时无切分音频同时翻译,用 Qwen3-ASR 加 Qwen3.5-4B 每语言对 LoRA 级联与字符级最长公共前缀只增发,在单张 H100 上报告 En→De、En→It、En→Zh 相对基线 XCOMET-XL 提升 4.1、5.7、2.6 分,代价是靠固定块重解码与前缀截断训练控制延迟。

 · 更新于 2026-09-25 · 约 15 分钟 · 7135 字 阅读 →
论文解读

一个模型说四种话:POWSM 把语音、文字和音标放在同一解码器里

POWSM 用同一注意力编码器解码器结构统一完成音素识别、语音识别、带音频的字转音与音转字四项任务,在未见语言上取得可比最优的音素错误率,但多任务对域内识别的增益并不稳定且仍偏向高资源语言。

 · 更新于 2026-09-25 · 约 18 分钟 · 9018 字 阅读 →
论文解读

不用人工偏好标注:用大音频语言模型反馈做连续自回归非言语发声的偏好优化

针对连续自回归语音模型没有显式序列似然而难以直接做直接偏好优化的问题,该工作用大音频语言模型自动构造同提示 chosen-rejected 对,并以拒绝采样微调冷启动加带监督锚的流匹配偏好优化做两阶段对齐,在 1600 句官方测试上把最终分从 73.96 提高到 75.80,而整体质量基本保持稳定。

 · 更新于 2026-09-25 · 约 21 分钟 · 10217 字 阅读 →
论文解读

只看转写错误会漏掉什么:PRiSM 同时考听写与下游使用

PRiSM 把音素实现识别拆成转写准确与转写探针加表示探针两类下游使用来考,证据显示多语言覆盖与编码器加 CTC 更稳定而专用模型仍领先大音频语言模型,但以声学保真与任务依赖为代价。

 · 更新于 2026-09-25 · 约 20 分钟 · 9552 字 阅读 →
论文解读

用非言语笑声哭声做监督:韵律如何跨到多语言言语情绪识别

论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。

 · 更新于 2026-09-25 · 约 19 分钟 · 9179 字 阅读 →
论文解读

不用每语一个适配器:PUMA 以共享投影加语言令牌做多语 ASR

针对十种非洲低资源语言的转写任务,PUMA 用冻结的 wav2vec 2.0 特征加可训练的通用语言投影与语言令牌和 CTC 训练,在同时训练平均词错误率 0.314 上报告优于 MMS 的 0.419 和 Whisper-large 的 0.339,代价是零样本下仍落后于 7B 量级系统且阿拉伯语等难语言更依赖语言令牌。

 · 更新于 2026-09-25 · 约 18 分钟 · 8773 字 阅读 →
论文解读

从等词输出到译员式取舍:用四种显式动作重做同声传译

论文把同传从读写时机控制改成包含切句、删除、压缩与代词化的动作选择,用统计感知的逐步提示在英中、英德、英日上同时改善语义与单调性延迟,但文本实验与启发式充分性检查仍留下语音端到端的待验证缺口。

 · 更新于 2026-09-25 · 约 17 分钟 · 8164 字 阅读 →
论文解读

把质检口语变成可执行依赖图:语音数据质量的多智能体 overnight 流水线

论文把自然语言质检需求编译为依赖感知的有向无环工作流并调用 24 个音频与文本核查工具,在专家一致率 80-90% 的条件下把人工成本时间压到 20% 以下,代价是规划器选型与幻觉和运行时的权衡。

 · 更新于 2026-09-25 · 约 18 分钟 · 8711 字 阅读 →
论文解读

先对齐再翻译:S2ST-Omni 用分层语言感知桥接语音与大模型

S2ST-Omni 把多语语音到语音翻译拆成高精度语音到文本前端加可插拔语音合成后端,用先局部后全局的混合适配器和声学加语言两级源语言感知提升翻译,在 CVSS-C 法德西到英上取得平均 BLEU 35.67 的报告最好结果,代价是依赖大骨干与可靠语言标识且只验证了三对高资源方向。

 · 更新于 2026-09-25 · 约 20 分钟 · 9617 字 阅读 →
论文解读

先听片段再分流:用文本可答性把死记训练和听觉强化分开

针对多轮多语言对话选择题中文本先验掩盖听觉依赖的问题,该工作用事件级切分加语义与声学双分支合成 359825 题,再把文本可答的弱题用于监督微调、必须听音频的强题用于 GSPO 强化学习,以 90.92% 的终测准确率为证据,代价是依赖大模型判断与多阶段验证流水线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8830 字 阅读 →
论文解读

用说话人描述做监督:SLAP 如何把人口学、嗓音与健康属性装进同一语音表示

SLAP 针对语音中人口学、嗓音质量与健康属性难以零样本推断的问题,选择用大语言模型把异构元数据转写为自然语言描述再与语音做对比学习,最强证据是 38 个二分类任务上零样本平均 F1 达到 62.9%,代价是预训练数据仍不均衡且小测试集任务波动大。

 · 更新于 2026-09-25 · 约 19 分钟 · 9215 字 阅读 →
论文解读

低资源多口音下毒性语音为何失效:冻结音频大模型加三段软提示的解法

针对级联转写在低资源语言和口音下丢失声学线索且误差传播的问题,论文用冻结 MiMo-Audio-7B 加任务加共享加语言残差三段软提示做端到端二分类,在 PolySpeechTox 上报告微平均 ROC-AUC 为 98.07%,代价是只验证了单一骨干且依赖语言口音标签做训练路由。

 · 更新于 2026-09-25 · 约 18 分钟 · 8674 字 阅读 →