论文解读

两人对话先分清谁在说,再听懂整场在说什么:第二届 MLC-SLM 的多任务设定

该挑战用约 2100 小时 14 语言双人对话同时考 diarization 加识别与整场理解,基线显示长时说话人对齐与语义推理是主要瓶颈,而参赛系统靠域内 diarization 适配与音频依赖监督把误差与准确率推到新水平。

 · 约 20 分钟 · 9734 字 阅读 →
论文解读

先听清再推理:用声音证据校准无标签测试时更新

论文先量化大音频语言模型对声音的依赖再提出感知 grounded 的测试时强化学习,用多数票伪标签乘以声学支撑权重更新策略,在 MMAR 上最高提升 4.6 个点、在 MMAU 上最高提升 4.9 个点,代价是每步需额外做遮蔽前向与分组投票计算。

 · 更新于 2026-09-24 · 约 20 分钟 · 9639 字 阅读 →
论文解读

长音频不是更长,而是条件更多:MuLA-Bench 如何分离语言、证据与操作

MuLA-Bench 用 5038 个开放问题检验 16 语言长音频理解,发现语言难度随领域和任务变化、声学证据差距随操作变化、找对事件不等于对准时钟,而代价是声学单元稀疏不均且长尾结论受限。

 · 更新于 2026-09-24 · 约 24 分钟 · 11910 字 阅读 →
论文解读

长对话问答不缺音频而缺取舍:按问题动态分配文本与声学证据

针对多语言双人长对话口语问答中不同问题依赖不同证据的问题,该工作用带说话人时间戳的转写做主干、按问题动态挂接局部或全局音频,开发集任务二达到 94.84% 准确率,但消融无法完全分离标签质量与证据分配的因果。

 · 更新于 2026-09-24 · 约 20 分钟 · 9904 字 阅读 →
论文解读

能解码不等于在用:语音拒绝的因果落点在文本主干的中后段

论文用分组留出的方向消融检验语音有害请求的拒绝边际,发现 Qwen2.5-Omni 在 L16 处消融使边际下降约 7.10 而投影器处仅约 0.013,代价是良恶提示的措辞差异使该方向只能读作拒绝相关而非纯粹有害性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9116 字 阅读 →
论文解读

先锁定结论语义再推理:SPARE 如何把长思维链拉回音频

针对显式思维链导致注意力偏离音频的推理落差,SPARE 在推理起点插入寄存器令牌并用结论语义做余弦对齐,在 SALMONN 13B 上把 MMAU 提升到 58.03%、MMAR 提升到 40.32%,代价是微调阶段增加一个训练期对齐分支而推理零新增开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8867 字 阅读 →
论文解读

不只听懂说了什么:用 22 个副语言特征和两阶段课程统一说话方式与声学环境理解

针对音频大模型能转写却听不懂说话方式与声学环境的问题,论文用 22 维特征定义、120 万音频问答对与先单属性后多属性的两阶段课程训练 ParA-LLM,在 ParA-Bench 总体上报告 43.53% 准确率并在外部语音基准上同步提升,代价是声学单项仍弱于 GPT-4o-Audio 且绝对准确率仍远低于人类。

 · 更新于 2026-09-24 · 约 17 分钟 · 8324 字 阅读 →
论文解读

听懂东南亚语音:SEABED 用六类可听推理把答对和讲对分开查

SEABED 针对印尼语、泰语和马来语真实语音构造必须听音频才能推理的问答,用准确率加推理接地审计测六个音频大模型,最好的 Gemini 3.5 Flash 也只答对约一半,且区域模型的正确回答中多达四分之一缺少音频依据。

 · 更新于 2026-09-24 · 约 22 分钟 · 10910 字 阅读 →
论文解读

证据越远越难用:Vox-Infinity 按所需历史时长检验语音长上下文

Vox-Infinity 沿轮数与每轮时长拉长语音历史并以最早证据到提问的跨度分组,在七个语音语言模型上报告随证据变远准确率下降的近因效应,以及文本历史保语义而音频历史保韵律的互补代价。

 · 更新于 2026-09-24 · 约 15 分钟 · 7278 字 阅读 →
论文解读

复用语音识别编码器状态做查询条件话题定位:文本之外补边界信息

论文研究给定话题标题查询在语音转写中预测连续句子区间的问题,用冻结语音识别编码器状态做句子级声学表示并与文本嵌入融合,在两个主数据集上以轻量定位器验证严格边界指标的提升,同时报告自发会议上增益有限的代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8527 字 阅读 →
论文解读

小参数做音频问答:Samsone 用裁词表与减层数换端侧可运行

Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8844 字 阅读 →
论文解读

泰卢固语先出声再作答:VākQA 如何把语音、转写与评测分开检验

针对泰卢固语语音事实问答缺少基准与评测不可靠问题,VākQA 用 2001 对真人 quiz 语音与双语转写先校准自动评测再测问答,发现 Gemini 作答与做裁判均领先但仍受语言、模态与级联误差影响且文化域最敏感。

 · 更新于 2026-09-24 · 约 20 分钟 · 9667 字 阅读 →
论文解读

不让大模型直接说时间戳:用冻结语义加帧级定位做声音事件接地

针对大音频语言模型时间定位不准的问题,论文冻结大模型只取查询语义表示并外挂帧级定位模型,在多个接地基准上提高严格阈下召回与平均交并比,并在推理阶段把定位结果作为外部时间证据回填给大模型。

 · 更新于 2026-09-24 · 约 18 分钟 · 8776 字 阅读 →
论文解读

语音问答记住了不该记的事实:切断声学理解与隐私记忆的四种遗忘路径

论文在语音问答大音频语言模型上对比梯度上升、任务算术与两种拒答对齐遗忘方法,报告在中度记忆检查点上可把隐私泄露率降低约 80% 且非隐私问答基本保持,但压到接近零泄露时非隐私准确率必然明显下滑。

 · 更新于 2026-09-24 · 约 20 分钟 · 9634 字 阅读 →
论文解读

打开语音输出反而答错:用更强的纯文本策略把交错生成拉回来

论文发现相同语音输入下交错语音文本生成的内部文本准确率大幅低于纯文本回答,提出联合输出在策略蒸馏用冻结的语音到文本策略监督学生自己的联合轨迹,在 Step-Audio-2-mini 上把输出模式差距从 42.87 降到 16.26 个百分点而语音到文本基本不变,代价是仍残留十余点差距且口语答案增益小于内部文本增益。

 · 更新于 2026-09-24 · 约 19 分钟 · 9447 字 阅读 →
论文解读

长音频先检索再作答:混合检索与双模态证据如何分工

论文研究长音频中分散证据的定位与整合问题,采用离线结构化元数据加按需音频片段的混合检索智能体路线,最强证据是混合检索加多模态证据比单模态平均答案准确率提高约 10 个百分点、理由准确率提高约 6 个百分点,代价是声学任务仍需灵活选择证据模态且答案正确会高估真实 grounding 能力。

 · 更新于 2026-09-24 · 约 19 分钟 · 9406 字 阅读 →
论文解读

继承来的跟踪头:音频模型借用文本主干的位置机制选说话人

论文报告六说话人描述任务基线低于随机猜测,用 100 个头的注意力对数偏置把输出转向目标到 90% 以上,而纯文本任务选出的头可原样迁移,但饱和强度下增益多来自提示与汇点且随机对照本身波动极大。

 · 更新于 2026-09-24 · 约 22 分钟 · 10813 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

喉塞音不是音位,却能标记焦点:法语产出与感知的双重证据

该研究以法语问答诱发的半自发语料检验喉化与信息焦点的关联,再用交叉拼接只插入喉塞音的感知实验验证听者是否据此作窄焦点解读,最强证据是插入喉塞音使窄焦点判定的胜算比变为约 4.97 倍,代价是仅覆盖句末焦点与人工插入的自然度限制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10383 字 阅读 →
论文解读

多人对话里该说还是该静:MP-Bench 把轮次感知拆成可核对的行为题

MP-Bench 用合成四人语音与显式、隐式、消极三类轮次条件测语音智能体,12 个系统的最强证据是带完美说话人标签的文本上限接近满分而实时语音系统在游戏轮次上徘徊于随机水平,代价是完全受控合成、无重叠与单决策点评估。

 · 更新于 2026-09-24 · 约 23 分钟 · 11162 字 阅读 →