论文解读

看得懂却算不对:多模态大模型乘法在算术负载下的计算崩塌

论文用配对文本图像音频乘法题证明感知近乎完美但计算随算术负载 C 急剧失效,并用强制续写损失探针与 LoRA 正交性揭示模型偏好分配式分解而强加单一启发式反而破坏原有路由。

 · 更新于 2026-09-24 · 约 17 分钟 · 8277 字 阅读 →
论文解读

小语言模型下保住多任务语音跟随:换大容量投影器并补科学演讲合成数据

针对英语语音输入并按多语指令完成识别翻译问答的问题,该工作用只用识别数据训练的语音映射器对接冻结语言模型并加入合成科学演讲数据,在更小语言模型下追平上届最优并用跨域基准揭示识别与问答的权衡。

 · 更新于 2026-09-24 · 约 17 分钟 · 8037 字 阅读 →
论文解读

资源受限下做通用阿拉伯语语音大模型:Nuha-Speech 的数据、微调与评测链路

针对阿拉伯语语音指令数据稀缺与评测缺失问题,Nuha-Speech 用约 150 万条统一问答式语料对 Qwen-Omni 系列做两阶段 LoRA 微调,并在七任务评测中报告语义与副语言能力的全面提升,但合成数据占比与评测合成偏置仍是主要代价与限制。

 · 更新于 2026-09-24 · 约 16 分钟 · 7954 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

答对不等于可靠:用可回答与不可回答配对检验大音频语言模型的对话修复

论文把可回答性做成输入属性,用语义-声学掩蔽构造配对问答并以不可补偿的 EAR 分数同时考核答题与修复,报告显示多模型答题强但修复弱,而掩蔽加宽能提升修复检出。

 · 更新于 2026-09-24 · 约 16 分钟 · 7813 字 阅读 →
论文解读

长音频查不完:先规划模态与时间,再用结构化查询取小证据

针对 10 分钟到 540 分钟音频中说话内容、说话人、情感与声音事件交织推理难的问题,PlanRAG-Audio 先把音频离线转成时间对齐的结构化库,再按问题规划检索并只取相关片段生成答案,以检索把推理代价与原始长度解耦,代价是受上游感知精度约束并需承担离线预处理开销。

 · 更新于 2026-09-24 · 约 22 分钟 · 10857 字 阅读 →
论文解读

编号保住谁是谁:PolyAudio 用交错上下文做五段内跨音频对证

论文针对需综合多个独立音频才能作答的多音频推理问题,选择在 Audio Flamingo 3 上做交错多音频指令微调,最强证据是 PolyAudio-Bench 上从 32.9% 提升到 73.5%,代价是依赖合成管线构造数据并把组合范围限制在最多 5 段。

 · 更新于 2026-09-24 · 约 16 分钟 · 7612 字 阅读 →
论文解读

只听主人、不听路人:用选择性听觉堵住音频大模型的旁观者泄露

论文针对音频大模型会无意收录并回答旁观者语音的问题,提出只听主说话人的选择性听觉任务与 SH-Bench 评测和 SE 统一指标,并用旁观者隐私微调 BPFT 在保持主说话人理解的同时学会拒答,最强证据是微调后选择模式下旁观者准确率与 SE 大幅超过 Gemini 2.5 Pro,代价是主说话人准确率轻微波动且仅覆盖单主说话人场景。

 · 更新于 2026-09-24 · 约 19 分钟 · 9239 字 阅读 →
论文解读

边听边想错了怎么办:RetroThinker 让语音大模型向前改错

针对流式语音大模型边听边推理容易出错且不能回滚重说的问题,RetroThinker 用三阶段事后反思微调让 Moshi 在文本内心独白中自验自改,在 TTS 版 GSM8K 上以相近延迟取得 11 个百分点的绝对准确率提升,代价是反思会先拉长推理链,需再用 Early Reasoning 和 LengthDPO 压回延迟。

 · 更新于 2026-09-24 · 约 20 分钟 · 9841 字 阅读 →
论文解读

先听片段再分流:用文本可答性把死记训练和听觉强化分开

针对多轮多语言对话选择题中文本先验掩盖听觉依赖的问题,该工作用事件级切分加语义与声学双分支合成 359825 题,再把文本可答的弱题用于监督微调、必须听音频的强题用于 GSPO 强化学习,以 90.92% 的终测准确率为证据,代价是依赖大模型判断与多阶段验证流水线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8830 字 阅读 →
论文解读

噪声不在波形里,而在嵌入的方向上:SEE 量化与 SEEN 中和

论文针对大音频语言模型在噪声下语义推理不稳定的问题,提出在模型内部嵌入空间度量噪声投影能量的 SEE 并用减去噪声子空间分量的 SEEN 做免训练缓解,最强证据是 SEE 与生成成功率呈约 0.98 负相关,而代价是需要对齐的干净与纯噪声标定数据且只能去除可分离干扰不能补回已丢失语义。

 · 更新于 2026-09-24 · 约 19 分钟 · 9190 字 阅读 →
论文解读

不急着融合:用显式动作先决定信谁再转写

针对同时有内部听觉与外部转写建议时朴素融合反而变差的问题,论文用可学习的内部、外部、重写三种动作先裁决再生成,在七个语音识别集与多域音频问答上报告了可运行策略的改进,但重写类样本稀少仍是主要代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8586 字 阅读 →
论文解读

重音一变意思就变:语音模型为何听不出言外之意

论文针对句子重音改变语义这一被忽视的能力,提出 StressTest 基准与 Stress-17k 合成训练管线,微调得到的 StresSLM 在真实录音上显著超过现有语音模型,同时基本保留原有识别能力。

 · 更新于 2026-09-24 · 约 18 分钟 · 8705 字 阅读 →
论文解读

平滑偏置之下:用模糊视图逼出瞬态证据的解码修正

针对统一大音频语言模型偏向平滑上下文而漏掉短暂声学线索的问题,论文提出只在推理时对比原始与时域模糊音频的对数几率并做门控稀疏修正,在 MMAU 上 Qwen2.5-Omni 平均达 73.2%,代价是每样本多一次慢路径预填充前向与双路解码缓存。

 · 更新于 2026-09-24 · 约 16 分钟 · 7528 字 阅读 →
论文解读

盲评多说话人长对话问答:微调记忆、上下文纠偏与语音锚定检索的三条路线

针对无预切分、无说话人标签的 21 语言多说话人长对话选择题任务,论文对比了 Voxtral-Mini-3B 的 LoRA 微调、冻结 Voxtral-24B 的多模态上下文学习纠偏、以及免训练语音锚定检索三条路线,最强证据是上下文学习在第二阶段评测取得 0.81 准确率,代价是微调在小数据上过拟合回落与检索前端依赖转写和切分质量。

 · 更新于 2026-09-24 · 约 20 分钟 · 9961 字 阅读 →
论文解读

简单题别啰嗦、难题多想想:让音频大模型的推理长度跟着难度走

论文针对音频问答中统一长度推理导致的简单题冗余和难题推理不足,提出随模型感知难度调节长度奖励的 GRDR 与 GA2DR,在保持准确率的同时报告平均推理长度下降至少 50%,代价是 GRDR 在强噪声与高难度集上更易出现奖励投机与不稳定。

 · 更新于 2026-09-24 · 约 21 分钟 · 10062 字 阅读 →
论文解读

不靠语义猜声音:用海洋哺乳动物叫声逼模型真正去听

该研究用分布外海洋哺乳动物叫声构造感知与认知两类选择题,测低层听觉,最强证据是人类 Remember 达 97.1% 而模型仅 57.1% 左右,代价是题型限于单选题且只覆盖单一生态域。

 · 更新于 2026-09-24 · 约 18 分钟 · 8578 字 阅读 →
论文解读

单个都会、合在一起就不会:ART 要求模型同时听懂语音与声音再推理

论文针对多模态大模型只被单项音频能力考核的问题,构造 9 类 9000 条音频内嵌提问的推理基准,用是否问答与描述问答两种协议测得人类约 92.9% 而开源模型多在 50% 附近,代价是全合成语音与模板化问题限制了声学多样性。

 · 更新于 2026-09-24 · 约 16 分钟 · 7824 字 阅读 →
论文解读

转写不等于回答:ACID 用语音输入揭开大音频模型的文化安全假象

该研究把文化敏感提问译成 10 种语言再合成 1315 小时语音来考 12 个大音频语言模型,报告 MERaLiON 相关性最高也未过 0.5,而 LTU 等模型的零有害只是因为答非所问。

 · 更新于 2026-09-24 · 约 18 分钟 · 8956 字 阅读 →
论文解读

何时想、如何想:用四路奖励教音频大模型做难度自适应的推理

针对音频问答中显式推理不稳定、提示词无法自适应开关思考的问题,Audio-Thinker 用自适应思考准确率奖励加一致性和思考质量奖励在 GRPO 下训练,只用约 4 万条后训练样本就在 MMAU、MMAR 和 AIR 上超过同基座的显式推理基线,代价是依赖外部 Qwen3-8B 做推理裁判并增加强化学习采样开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9171 字 阅读 →