论文解读

把幻觉拆成可验的原子断言:OmniHallu 统一六向跨模态检测

针对图像视频音频的理解与生成六类任务,OmniHallu 用原子断言拆分加模态专家验证再推理聚合做声明级检测,在 10000 样本基准上以宏平均 F1 领先基线并用可训练验证器把专家调用减少约三分之二。

 · 更新于 2026-09-24 · 约 20 分钟 · 9564 字 阅读 →
论文解读

编号保住谁是谁:PolyAudio 用交错上下文做五段内跨音频对证

论文针对需综合多个独立音频才能作答的多音频推理问题,选择在 Audio Flamingo 3 上做交错多音频指令微调,最强证据是 PolyAudio-Bench 上从 32.9% 提升到 73.5%,代价是依赖合成管线构造数据并把组合范围限制在最多 5 段。

 · 更新于 2026-09-24 · 约 16 分钟 · 7612 字 阅读 →
论文解读

只看转写错误会漏掉什么:PRiSM 同时考听写与下游使用

PRiSM 把音素实现识别拆成转写准确与转写探针加表示探针两类下游使用来考,证据显示多语言覆盖与编码器加 CTC 更稳定而专用模型仍领先大音频语言模型,但以声学保真与任务依赖为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9552 字 阅读 →
论文解读

听不见的推理:从基础听觉短板看多模态模型的音画推理上限

论文用极简听觉测试 DeafTest 和 4555 题的音画推理基准 AV-Odyssey 证明低级听觉感知与高级音画推理高度相关,最强证据是两者准确率的 Pearson 相关达 0.945,而代价是当前模型在计数、响度与音高上仍接近随机猜测。

 · 更新于 2026-09-24 · 约 17 分钟 · 8293 字 阅读 →
论文解读

把质检口语变成可执行依赖图:语音数据质量的多智能体 overnight 流水线

论文把自然语言质检需求编译为依赖感知的有向无环工作流并调用 24 个音频与文本核查工具,在专家一致率 80-90% 的条件下把人工成本时间压到 20% 以下,代价是规划器选型与幻觉和运行时的权衡。

 · 更新于 2026-09-24 · 约 18 分钟 · 8711 字 阅读 →
论文解读

真实现场压垮推理:RSA-Bench 用声学生态测出音频大模型的感知-认知断层

论文用四种真实声景按 1 到 4 个干扰源叠加构造十万级评测,报告高阶推理在户外强干扰下功能性崩溃而性别感知相对稳定,且常用去噪反而加重词错误率等代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9023 字 阅读 →
论文解读

不只听懂,还要说得对:S2S-Arena 考语音模型的副语言指令跟随

针对语音到语音模型只测语义、不测说话方式的问题,S2S-Arena 用四级交互协议与 1243 条语音查询做 1001 次语音内成对比较,最强证据是工业模型全面领先而学术模型在高难度表达层落后 300 分以上,代价是合成语音分布与短轮交互的局限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9501 字 阅读 →
论文解读

听出自然:用多轮语音偏好同时学韵律与口语风格

针对文本评测看不见韵律情感与书面腔问题,该工作用真实对合成与书面對口语两类多轮偏好对训练端到端奖励模型,在分层基准上以 96.61% 模态微平均等证据显示可运行优势,代价是绝对分值仍随域偏移需谨慎用于优化。

 · 更新于 2026-09-24 · 约 17 分钟 · 8332 字 阅读 →
论文解读

把打断听成自言自语:语音助手为何分不清谁在说话

论文研究主用户与第三方同处一室时的打断处理,用可定制的应答策略加声学优先训练解决语义走捷径问题,最强证据是合成与真实录音上策略跟随与有用性同步提升,而代价是需要大量合成双说话人数据与难负样本约束。

 · 更新于 2026-09-24 · 约 18 分钟 · 8603 字 阅读 →
论文解读

重音一变意思就变:语音模型为何听不出言外之意

论文针对句子重音改变语义这一被忽视的能力,提出 StressTest 基准与 Stress-17k 合成训练管线,微调得到的 StresSLM 在真实录音上显著超过现有语音模型,同时基本保留原有识别能力。

 · 更新于 2026-09-24 · 约 18 分钟 · 8705 字 阅读 →
论文解读

听声辨位:用可定位性把众包录音筛成组合推理考题

论文把音频地理定位做成音频语言模型基准,用四步声学过滤加正负类别加权的定位性分数筛出 1444 段录音,最强闭源模型仍只在部分样本上精确定位且高度依赖语言线索。

 · 更新于 2026-09-24 · 约 21 分钟 · 10407 字 阅读 →
论文解读

从单分到多维推理:UniSRM 如何让语音评价说出依据

针对语音生成评价依赖主观平均意见分且单指标奖励不透明的问题,UniSRM 用四任务统一数据加两阶段推理评价与推理一致奖励,在 UniSRM-Bench 上提升多任务准确率,但多轮对话与跨域泛化仍受数据覆盖和计算开销限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9597 字 阅读 →
论文解读

只看画面能懂笑点吗:v-HUB 逼模型从视觉和环境声里找幽默

v-HUB 把视频幽默拆成字幕匹配、幽默解释和开放问答三类可核对任务,用文本、纯视频、视频加音频三组输入对照测出模型重度依赖文字线索,而环境声和画面内文字只带来小而稳定的增益且历史默片更难。

 · 更新于 2026-09-24 · 约 20 分钟 · 9544 字 阅读 →
论文解读

先看再听:用两段式推理链约束幻灯片辅助转写

针对全模态模型易复述可见幻灯片文字而忽略语音的问题,论文提出先在思考块中识别幻灯片文字再在回答块中引用锚定转写,并用四项奖励做组相对策略优化,在实体密集基准上改善实体识别,同时带来思考块的额外推理开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8645 字 阅读 →
论文解读

真人中文语音做考题:VCB Bench 为何要同时考听话、懂知识和抗干扰

针对英文为主和合成语音评测失真的问题,VCB Bench 用全真人中文语音构建指令跟随、知识理解与鲁棒性三维评测,在 9 个语音对话模型上显示常识问答最难而物理干扰比口误更致命。

 · 更新于 2026-09-24 · 约 16 分钟 · 7773 字 阅读 →
论文解读

吴语没有数据就没有模型:用八千小时多维标注把理解与生成一起补齐

针对吴语语音数据极少、无公开基准和可用模型的问题,论文用约 8000 小时多维自动标注语料加人工基准与分阶段模型验证,在识别与理解任务上大幅降低误差并提升翻译与属性判断,但数据分布不均与自动标注噪声仍限制泛化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9033 字 阅读 →
论文解读

词级定位而非句级知道:WESR 把笑声哭声放回词的位置

针对非言语事件只知有无、不知在词何处的问题,论文以 21 类离散与连续事件的词级转写为目标,用位置感知的评测解耦词错与事件错,并以 1700+ 小时弱标注训练得到强基线,在保持词错误率基本稳定的代价下把宏平均 F1 做到 38.0%。

 · 更新于 2026-09-24 · 约 21 分钟 · 10205 字 阅读 →
论文解读

不靠语义猜声音:用海洋哺乳动物叫声逼模型真正去听

该研究用分布外海洋哺乳动物叫声构造感知与认知两类选择题,测低层听觉,最强证据是人类 Remember 达 97.1% 而模型仅 57.1% 左右,代价是题型限于单选题且只覆盖单一生态域。

 · 更新于 2026-09-24 · 约 18 分钟 · 8578 字 阅读 →
论文解读

单个都会、合在一起就不会:ART 要求模型同时听懂语音与声音再推理

论文针对多模态大模型只被单项音频能力考核的问题,构造 9 类 9000 条音频内嵌提问的推理基准,用是否问答与描述问答两种协议测得人类约 92.9% 而开源模型多在 50% 附近,代价是全合成语音与模板化问题限制了声学多样性。

 · 更新于 2026-09-24 · 约 16 分钟 · 7824 字 阅读 →
论文解读

已有配音怎么改:AV-Edit 用音画联合表示做加、删、换

针对已有视频音轨需随画面增删替换音效的问题,AV-Edit 先用细粒度对比掩码预训练学到音画对齐表示,再用相关门控加多模态扩散重生成,在 VGG-Edit 三类编辑与 VGGSound 生成上报告最优距离与质量,代价是原文承认不能无失真保留原音。

 · 更新于 2026-09-24 · 约 20 分钟 · 9758 字 阅读 →