多人同场说话时,助手先要判断该不该开口、再判断替谁做事
MSI-Bench 用 1152 个多人多轮语音场景考查说话人限定的记忆、指令跟随与推理,最强配置英文全通过率仅 66.8%、中文 54.5%,开源模型主要卡在多人语音感知,前沿模型则卡在干净文本上的说话人限定决策与开口克制。
MSI-Bench 用 1152 个多人多轮语音场景考查说话人限定的记忆、指令跟随与推理,最强配置英文全通过率仅 66.8%、中文 54.5%,开源模型主要卡在多人语音感知,前沿模型则卡在干净文本上的说话人限定决策与开口克制。
MuLA-Bench 用 5038 个开放问题检验 16 语言长音频理解,发现语言难度随领域和任务变化、声学证据差距随操作变化、找对事件不等于对准时钟,而代价是声学单元稀疏不均且长尾结论受限。
针对多语言双人长对话口语问答中不同问题依赖不同证据的问题,该工作用带说话人时间戳的转写做主干、按问题动态挂接局部或全局音频,开发集任务二达到 94.84% 准确率,但消融无法完全分离标签质量与证据分配的因果。
针对印度 22 种官方语言语音识别评测中干净音频导致分数虚高与单参考转写导致有效变体被误罚的问题,Vimarsha 用 43.3 小时受控田野录音加 56.1 小时难例野外音频与每词平均 1.5 个可接受变体的格状参考进行评测,发现 10 个主流模型在野外条件下排名大幅变动且最佳系统词错误率从约 10–15% 升至 27–34%,代价是多格评估与人工校验成本 …
COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。
SEABED 针对印尼语、泰语和马来语真实语音构造必须听音频才能推理的问答,用准确率加推理接地审计测六个音频大模型,最好的 Gemini 3.5 Flash 也只答对约一半,且区域模型的正确回答中多达四分之一缺少音频依据。
针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。
针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。
该研究在相同骨干与训练流程下比较按病因拆分与混合病因的严重度分类,报告脑瘫、帕金森、肌萎缩侧索硬化三个方向上按病因模型全面领先混合基线,代价是需要病因路由、单次训练与以英语为主的评测局限。
论文以波兰语为重心研究数字归一化对词错误率的影响,方法是统一把逐字数字转成阿拉伯数字再评测,最强证据是议会数据上逐字与数字文本间差异大于 2% 并可归零,主要代价是归一器覆盖不全且会改变分母权重。
该研究把朗读维基百科的语音按小节配上大模型规划加规则渲染的合成幻灯片,在英德荷三语上只用音频测出最佳平均微观词错率 10.23% 与字错率 6.48%,而全量幻灯片文本或图片的零样本提示因大段复制与插入错误而失效。
CircleMatch 针对极小参数关键词识别,用分频带压缩编码加每类 5 个原型匹配,再以无参数圆环统计与有序路径分数汇总时序,在 GSC 与 MSWC 多词表上以约 1k-10k 参数取得可比精度,代价是大词表与大模型绝对精度仍占优且部分对比协议并不一致。
针对田间噪声、多说话人和农业词汇三类失败,论文用可开关的增强、说话人分离与词表修复包裹未改动的 ASR 模型,在印地语等三语评估上实现云端相对 16% 至 23% 的词错误率下降,多说话人下达 32% 至 42%,代价是增强与修复只在证据支持时生效且 M4 未被测量。
HearInContext 用共享合成语音配对隐式与显式上下文研究同音歧义消解,报告 Qwen3-ASR-1.7B 隐式目标词召回中英分别提升 11.0 和 11.5 个百分点而通用识别误差变化低于 0.1 个百分点,代价是训练配比不当会损害无关上下文鲁棒性。
论文用 10 名双语政客各 20 句卢森堡语加 20 句法语共 400 句和 41 个魅力相关声学韵律特征,以混合效应模型分离说话人与语言方差,发现说话人中位解释一半以上方差而语言中位仅占约 0.5%,语言差异集中在法语更高的 shimmer 与句末基频和卢森堡语更强的中频谱能量,但合成魅力指数无语言主效应。
该研究以 10 名卢森堡政治人物各 20 句卢森堡语加 20 句法语共 400 句自发政治话语为对象,用 C/V 分段与成对变异等时长节律指标加配对 t 检验与方差分解,报告显示元音时长与语速主要随语言重组而辅音时序保留说话人特征,且未发现语言与性别交互。
该工作在西班牙语德语捷克语帕金森语音上对比语音大模型的编码器表示解码器表示与零样本生成,报告编码器优于解码器而生成接近随机,并用样本自适应层聚合代替单层搜索,但跨语言绝对性能仍明显低于多语言混合训练。
为在指定文本位置可靠生成 16 类非言语发声,该工作用连续隐变量 DiTAR 加专用标签与停顿判别建模,以双语预训练加针对性合成与频率重采样补长尾,再用解码参数搜索与五选一多指标选样提升鲁棒性,最终以双语加权 62.786 获 Track 2 总分第一,代价是额外推理计算与英文控制仍待加强。
针对约鲁巴语 TTS 中字符错误率看不见声调错误的问题,论文提出只读输入变音符号作金标、只读基频作预测的 DunDun 指标,用压平基频与翻转答案键验证其声调敏感性,并显示微调主要降低字符错误率而声调早已接近母语锚点,代价是可用区间只到 0.596 且依赖可靠标调文本。
论文要解决希腊语混英语电话与会议转写同时过九道生产门的问题,选择不再找单一训练配比而是用路由加解码干预加组合绕行,最强证据是三模型词投票把门覆盖从单模型 4 到 7 项拉到 9 项并把重叠语音词错误率从 53.35% 降到 37.87%,代价是单模型在该规模下希腊噪声门与英语语种识别门所需步数相差近 6 倍而无交集。