论文解读

多人同场说话时,助手先要判断该不该开口、再判断替谁做事

MSI-Bench 用 1152 个多人多轮语音场景考查说话人限定的记忆、指令跟随与推理,最强配置英文全通过率仅 66.8%、中文 54.5%,开源模型主要卡在多人语音感知,前沿模型则卡在干净文本上的说话人限定决策与开口克制。

 · 更新于 2026-09-25 · 约 18 分钟 · 8849 字 阅读 →
论文解读

长音频不是更长,而是条件更多:MuLA-Bench 如何分离语言、证据与操作

MuLA-Bench 用 5038 个开放问题检验 16 语言长音频理解,发现语言难度随领域和任务变化、声学证据差距随操作变化、找对事件不等于对准时钟,而代价是声学单元稀疏不均且长尾结论受限。

 · 更新于 2026-09-25 · 约 24 分钟 · 11910 字 阅读 →
论文解读

长对话问答不缺音频而缺取舍:按问题动态分配文本与声学证据

针对多语言双人长对话口语问答中不同问题依赖不同证据的问题,该工作用带说话人时间戳的转写做主干、按问题动态挂接局部或全局音频,开发集任务二达到 94.84% 准确率,但消融无法完全分离标签质量与证据分配的因果。

 · 更新于 2026-09-25 · 约 20 分钟 · 9904 字 阅读 →
论文解读

乐观的录音与悲观的转写:Vimarsha 如何同时校正印度语 ASR 评测的两端偏差

针对印度 22 种官方语言语音识别评测中干净音频导致分数虚高与单参考转写导致有效变体被误罚的问题,Vimarsha 用 43.3 小时受控田野录音加 56.1 小时难例野外音频与每词平均 1.5 个可接受变体的格状参考进行评测,发现 10 个主流模型在野外条件下排名大幅变动且最佳系统词错误率从约 10–15% 升至 27–34%,代价是多格评估与人工校验成本 …

 · 更新于 2026-09-25 · 约 20 分钟 · 9829 字 阅读 →
论文解读

先想好怎么说,再开口说:COT-TTS 把对话历史变成可检查的说话计划

COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。

 · 更新于 2026-09-25 · 约 21 分钟 · 10461 字 阅读 →
论文解读

听懂东南亚语音:SEABED 用六类可听推理把答对和讲对分开查

SEABED 针对印尼语、泰语和马来语真实语音构造必须听音频才能推理的问答,用准确率加推理接地审计测六个音频大模型,最好的 Gemini 3.5 Flash 也只答对约一半,且区域模型的正确回答中多达四分之一缺少音频依据。

 · 更新于 2026-09-25 · 约 22 分钟 · 10910 字 阅读 →
论文解读

先分清谁在说话、再转写说什么:Transsion 级联式多语说话人归属转写系统解读

针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。

 · 更新于 2026-09-25 · 约 18 分钟 · 8539 字 阅读 →
论文解读

在低秩优化器里加旧任务曲率:CGaLore 如何让 ASR 基座模型记得住又学得进

针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。

 · 更新于 2026-09-25 · 约 19 分钟 · 9335 字 阅读 →
论文解读

按病因分开训练为何胜过混合训练:多语种构音障碍严重度的对照实验

该研究在相同骨干与训练流程下比较按病因拆分与混合病因的严重度分类,报告脑瘫、帕金森、肌萎缩侧索硬化三个方向上按病因模型全面领先混合基线,代价是需要病因路由、单次训练与以英语为主的评测局限。

 · 更新于 2026-09-25 · 约 20 分钟 · 9859 字 阅读 →
论文解读

数字写成字还是阿拉伯数字:语音识别词错误率里被忽略的归一化代价

论文以波兰语为重心研究数字归一化对词错误率的影响,方法是统一把逐字数字转成阿拉伯数字再评测,最强证据是议会数据上逐字与数字文本间差异大于 2% 并可归零,主要代价是归一器覆盖不全且会改变分母权重。

 · 更新于 2026-09-25 · 约 18 分钟 · 8836 字 阅读 →
论文解读

幻灯片能帮耳朵认词吗:用合成讲稿重测多语言语音识别

该研究把朗读维基百科的语音按小节配上大模型规划加规则渲染的合成幻灯片,在英德荷三语上只用音频测出最佳平均微观词错率 10.23% 与字错率 6.48%,而全量幻灯片文本或图片的零样本提示因大段复制与插入错误而失效。

 · 更新于 2026-09-25 · 约 15 分钟 · 7363 字 阅读 →
论文解读

用圆环记时间:CircleMatch 以千级参数做关键词识别

CircleMatch 针对极小参数关键词识别,用分频带压缩编码加每类 5 个原型匹配,再以无参数圆环统计与有序路径分数汇总时序,在 GSC 与 MSWC 多词表上以约 1k-10k 参数取得可比精度,代价是大词表与大模型绝对精度仍占优且部分对比协议并不一致。

 · 更新于 2026-09-25 · 约 23 分钟 · 11158 字 阅读 →
论文解读

不动 ASR 模型,如何把田间嘈杂的多人农问转写做准

针对田间噪声、多说话人和农业词汇三类失败,论文用可开关的增强、说话人分离与词表修复包裹未改动的 ASR 模型,在印地语等三语评估上实现云端相对 16% 至 23% 的词错误率下降,多说话人下达 32% 至 42%,代价是增强与修复只在证据支持时生效且 M4 未被测量。

 · 更新于 2026-09-25 · 约 19 分钟 · 9045 字 阅读 →
论文解读

同一段语音,不同理解:用固定音频区分语义推断与直接给词

HearInContext 用共享合成语音配对隐式与显式上下文研究同音歧义消解,报告 Qwen3-ASR-1.7B 隐式目标词召回中英分别提升 11.0 和 11.5 个百分点而通用识别误差变化低于 0.1 个百分点,代价是训练配比不当会损害无关上下文鲁棒性。

 · 更新于 2026-09-25 · 约 17 分钟 · 8083 字 阅读 →
论文解读

说话人压过语言:卢森堡语与法语魅力韵律的方差从哪里来

论文用 10 名双语政客各 20 句卢森堡语加 20 句法语共 400 句和 41 个魅力相关声学韵律特征,以混合效应模型分离说话人与语言方差,发现说话人中位解释一半以上方差而语言中位仅占约 0.5%,语言差异集中在法语更高的 shimmer 与句末基频和卢森堡语更强的中频谱能量,但合成魅力指数无语言主效应。

 · 更新于 2026-09-25 · 约 20 分钟 · 9695 字 阅读 →
论文解读

元音管语言、辅音留个人:双语政治演讲的时间组织不对称

该研究以 10 名卢森堡政治人物各 20 句卢森堡语加 20 句法语共 400 句自发政治话语为对象,用 C/V 分段与成对变异等时长节律指标加配对 t 检验与方差分解,报告显示元音时长与语速主要随语言重组而辅音时序保留说话人特征,且未发现语言与性别交互。

 · 更新于 2026-09-25 · 约 15 分钟 · 7237 字 阅读 →
论文解读

语音大模型越靠近语言端病理线索为何越弱:编码器解码器与生成的分层核对

该工作在西班牙语德语捷克语帕金森语音上对比语音大模型的编码器表示解码器表示与零样本生成,报告编码器优于解码器而生成接近随机,并用样本自适应层聚合代替单层搜索,但跨语言绝对性能仍明显低于多语言混合训练。

 · 更新于 2026-09-25 · 约 19 分钟 · 9051 字 阅读 →
论文解读

把笑声叹息放进指定位置:连续隐变量、长尾补数据与多指标选样的可控语音

为在指定文本位置可靠生成 16 类非言语发声,该工作用连续隐变量 DiTAR 加专用标签与停顿判别建模,以双语预训练加针对性合成与频率重采样补长尾,再用解码参数搜索与五选一多指标选样提升鲁棒性,最终以双语加权 62.786 获 Track 2 总分第一,代价是额外推理计算与英文控制仍待加强。

 · 更新于 2026-09-25 · 约 20 分钟 · 9653 字 阅读 →
论文解读

声调看不见的合成器:DunDun 给约鲁巴语 TTS 补一条声调轴

针对约鲁巴语 TTS 中字符错误率看不见声调错误的问题,论文提出只读输入变音符号作金标、只读基频作预测的 DunDun 指标,用压平基频与翻转答案键验证其声调敏感性,并显示微调主要降低字符错误率而声调早已接近母语锚点,代价是可用区间只到 0.596 且依赖可靠标调文本。

 · 更新于 2026-09-25 · 约 19 分钟 · 9392 字 阅读 →
论文解读

一个小模型装不下两种语言:希腊-英语生产识别的步数前沿与绕行办法

论文要解决希腊语混英语电话与会议转写同时过九道生产门的问题,选择不再找单一训练配比而是用路由加解码干预加组合绕行,最强证据是三模型词投票把门覆盖从单模型 4 到 7 项拉到 9 项并把重叠语音词错误率从 53.35% 降到 37.87%,代价是单模型在该规模下希腊噪声门与英语语种识别门所需步数相差近 6 倍而无交集。

 · 更新于 2026-09-25 · 约 21 分钟 · 10106 字 阅读 →