不重编音频也能验声:复用编码器状态删掉无据事件提及
针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。
针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。
该研究针对可公开复现的大规模音乐与文本配对缺失问题,选择以互联网档案馆中声明为知识共享许可的音频为源、轻量音频语言模型初标加分类标签与档案元数据聚合精修为方法,最强证据是 1500 段抽样下与 JamendoMaxCaps 相当的参考无关分数与正确性完整性约 4.2 分以上的人评,主要代价是长时体裁欠采样与语言流畅性仍落后于人工标注。
针对音频多模态大模型自由描述中每个词缺乏时频依据的问题,STAG 用词条件内部激活做时间定位、用频带遮挡做频谱定位再做可分融合,在四个时序标注基准上取得最佳事件定位,并在反事实删除中以目标置信下降和事件消失支持其忠实性,代价是可分假设与缺少频率真值。
论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对无监督异常声音检测中正常与异常机器声高度相似、单条通用描述难以支撑差异总结的问题,论文提出推理时两阶段多样且判别性束搜索解码,用多条组内多样加跨音频互斥的描述供给大语言模型汇总,主观评估显示更具体可辨但未承诺延迟与误判改善。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对图像视频音频的理解与生成六类任务,OmniHallu 用原子断言拆分加模态专家验证再推理聚合做声明级检测,在 10000 样本基准上以宏平均 F1 领先基线并用可训练验证器把专家调用减少约三分之二。
针对自动音频描述缺少细节与上下文的问题,该工作用专家模型抽取语音、音乐、通用声音和视频线索再由大语言模型融合成纯音频描述,并用 120 万条描述与 600 万问答对证明检索与理解收益,代价是融合带来细节提升的同时幻觉风险上升且需离线专家与过滤成本。
针对分类法缺解释、纯文本大模型漏掉表情语调的问题,该研究提出情绪—认知协同多模态描述任务并用双路 BridgeNet 加 LLaMA 生成描述,在 MMDA 上描述指标领先且生成的画像把抑郁焦虑辅助判断的准确率平均提升超 12 个百分点,代价是两阶段训练与自动标注依赖人工清洗。
论文把 ASR 监督前端是否丢弃声学信息当作可证伪假设,在同一 Qwen3.5-4B 流水线中对比 Whisper 与三类重建式编解码器,并用分层探针、几何比值与仅调 LM 头选项行的因果小手术证明声学结构在最终隐状态仍可恢复而 MCQA 失效主要来自读出对齐,但换前端本身不能解决情绪与环境声字幕的欠利用。
音频检索 | 7.2/10
音频字幕生成 | 6.8/10
音频字幕生成 | 7.5/10
音频字幕生成 | 7.9/10
音频字幕生成 | 8.4/10
音频字幕生成 | 8.0/10
音频字幕生成 | 6.3/10
音视频理解 | 9.2/10