论文解读

不重编音频也能验声:复用编码器状态删掉无据事件提及

针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。

 · 约 16 分钟 · 7925 字 阅读 →
论文解读

用声明式许可与两阶段自动标注把互联网档案馆做成可复现的音乐描述资源

该研究针对可公开复现的大规模音乐与文本配对缺失问题,选择以互联网档案馆中声明为知识共享许可的音频为源、轻量音频语言模型初标加分类标签与档案元数据聚合精修为方法,最强证据是 1500 段抽样下与 JamendoMaxCaps 相当的参考无关分数与正确性完整性约 4.2 分以上的人评,主要代价是长时体裁欠采样与语言流畅性仍落后于人工标注。

 · 更新于 2026-09-24 · 约 21 分钟 · 10188 字 阅读 →
论文解读

每个词听到了哪里:把音频大模型的描述逐词钉回时频证据

针对音频多模态大模型自由描述中每个词缺乏时频依据的问题,STAG 用词条件内部激活做时间定位、用频带遮挡做频谱定位再做可分融合,在四个时序标注基准上取得最佳事件定位,并在反事实删除中以目标置信下降和事件消失支持其忠实性,代价是可分假设与缺少频率真值。

 · 更新于 2026-09-24 · 约 20 分钟 · 9987 字 阅读 →
论文解读

链式推理何时帮倒忙:语音理解与描述中的显式思维链、课程学习与槽填充对照

论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。

 · 更新于 2026-09-24 · 约 18 分钟 · 8810 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

声音太像说不出差别:用两阶段跨音频解码逼出可比的描述

针对无监督异常声音检测中正常与异常机器声高度相似、单条通用描述难以支撑差异总结的问题,论文提出推理时两阶段多样且判别性束搜索解码,用多条组内多样加跨音频互斥的描述供给大语言模型汇总,主观评估显示更具体可辨但未承诺延迟与误判改善。

 · 更新于 2026-09-24 · 约 19 分钟 · 9329 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把幻觉拆成可验的原子断言:OmniHallu 统一六向跨模态检测

针对图像视频音频的理解与生成六类任务,OmniHallu 用原子断言拆分加模态专家验证再推理聚合做声明级检测,在 10000 样本基准上以宏平均 F1 领先基线并用可训练验证器把专家调用减少约三分之二。

 · 更新于 2026-09-24 · 约 20 分钟 · 9564 字 阅读 →
论文解读

听觉不只听声:用多模态线索合成细粒度音频描述

针对自动音频描述缺少细节与上下文的问题,该工作用专家模型抽取语音、音乐、通用声音和视频线索再由大语言模型融合成纯音频描述,并用 120 万条描述与 600 万问答对证明检索与理解收益,代价是融合带来细节提升的同时幻觉风险上升且需离线专家与过滤成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8776 字 阅读 →
论文解读

从贴标签到写病程:用情绪—认知描述统一多模态心理健康评估

针对分类法缺解释、纯文本大模型漏掉表情语调的问题,该研究提出情绪—认知协同多模态描述任务并用双路 BridgeNet 加 LLaMA 生成描述,在 MMDA 上描述指标领先且生成的画像把抑郁焦虑辅助判断的准确率平均提升超 12 个百分点,代价是两阶段训练与自动标注依赖人工清洗。

 · 更新于 2026-09-24 · 约 18 分钟 · 8982 字 阅读 →
论文解读

声音去哪了:末层仍可线性读出却在选项字母上失准的读出瓶颈

论文把 ASR 监督前端是否丢弃声学信息当作可证伪假设,在同一 Qwen3.5-4B 流水线中对比 Whisper 与三类重建式编解码器,并用分层探针、几何比值与仅调 LM 头选项行的因果小手术证明声学结构在最终隐状态仍可恢复而 MCQA 失效主要来自读出对齐,但换前端本身不能解决情绪与环境声字幕的欠利用。

 · 更新于 2026-09-24 · 约 24 分钟 · 11701 字 阅读 →
论文解读

一条声音,二十四种说法:SonicCaps 把听觉歧义变成检索的养分

音频检索 | 7.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10292 字 阅读 →
论文解读

长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起

音频字幕生成 | 6.8/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10434 字 阅读 →
论文解读

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

音频字幕生成 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8571 字 阅读 →
论文解读

AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

音频字幕生成 | 7.9/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2475 字 阅读 →
论文解读

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

音频字幕生成 | 8.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11629 字 阅读 →
论文解读

REFRAMED: Towards Realistic Audio Description Generation for Movies

音频字幕生成 | 8.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 9013 字 阅读 →
论文解读

MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

音频字幕生成 | 6.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6369 字 阅读 →
论文解读

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

音视频理解 | 9.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10324 字 阅读 →