Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

📄 Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention #音频事件检测 #多模态模型 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 🔥 8.2/10 | 前25% | #音频事件检测 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Daniel Shalam(Amazon) 通讯作者:未说明 作者列表:Daniel Shalam(Amazon)、Emanuel Ben Baruch(Amazon)、Avi Ben Cohen(Amazon)、Tal Remez(Amazon) 💡 毒舌点评 这是一篇"简单但有效"的典型工作:两个清晰insight(注意力应聚焦于预测区域、信号应跨token聚合)组合出一个即插即用的Training-free分数,在三个模态四个benchmark上一路吊打SVAR等基线,甚至在COCO上将零样本AP翻倍,实用性拉满。但"注意力质量即置信度"这条路线已有多篇工作在走,MTLA本质上是对SVAR做了"localize + multi-token"的工程优化,创新高度稍欠;且跨模态迁移性依旧依赖MLLM的天花板,并没有从根本上解决MLLM幻觉生成的底层缺陷。 📌 核心摘要 要解决的问题:多模态大语言模型(MLLM)在生成定位输出(检测框、时序窗口)时存在严重幻觉(58%-68%的预测区域不匹配真实目标),且模型自身的token概率无法有效区分幻觉与真实定位,导致MLLM在标准检测/定位评测中可靠性差。 ...

2026-07-08 · 更新于 2026-08-14 · 4 min · 677 words

Adaptive Diversity-Uncertainty Active Learning with Redundancy Control for Bioacoustic Event Classification

📄 Adaptive Diversity-Uncertainty Active Learning with Redundancy Control for Bioacoustic Event Classification #音频事件检测 #低资源 6.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 ✅ 6.2/10 | 前50% | #音频事件检测 | #低资源 | arxiv 👥 作者与机构 第一作者:Gabriel Dubus(未说明) 通讯作者:未说明 作者列表:Gabriel Dubus(未说明)、Hugo Magaldi(未说明)、Anatole Gros-Martial(未说明) 💡 毒舌点评 论文为多标签生物声学事件分类定制了一套自适应不确定性-多样性主动学习策略,并加上MMR去冗余,在鸟类数据集上确实跑赢了CoreSet和Margin,工程思路清晰。但海洋场景近乎翻车、基线缺少信息论方法、连BALD的影子都没见着,而TypiClust又被漏掉了。代码和数据全无,让这份“挑战赛报告”的复现与推广价值打了不小的折扣。 📌 核心摘要 要解决的问题:在生物声学事件多标签分类中,标注代价高昂且声学环境异质性强,需设计能动态平衡探索与利用、并控制批次冗余的主动学习采样策略。 方法核心:提出ADU-MMR,通过全局模型置信度驱动的自适应权重将预测不确定性与嵌入空间多样性结合,并用贪婪最大边际相关性(MMR)控制批次内样本冗余。 与已有方法的区别:自适应权重根据未标注池的全局归一化熵非线性动态调整,早期偏重多样性探索,后期转向不确定性利用;同时显式引入MMR减少批次冗余,区别于固定权重或纯不确定/多样性方法。 主要实验结果:在BirdSet(HSN、POW、UHH)和ATBFL上,平均AULC 0.505、mAP 0.590,优于CoreSet、Margin、TypiClust和Random。HSN上AULC领先CoreSet 7.6个百分点,ATBFL上所有方法差距微小且Random略优。 实际意义:为生态监测中的多标签声学事件标注提供了更高效的主动学习策略,尤其适用于结构化声景,可直接嵌入BaseAL等主动学习框架。 主要局限性:严重依赖PerchV2嵌入质量,在低频海洋场景优势消失;未开源且缺少BALD等更强基线;自适应阈值τ凭经验设定,缺乏灵敏度分析。 🔗 开源详情 代码:未提供代码链接 模型权重:未提供模型权重下载链接(使用预训练PerchV2嵌入,但未给出具体权重链接) 数据集:使用BirdSet(引用[6])和ATBFL(引用[4]),论文未提供可直接访问的数据集下载链接 Demo:未提及 复现材料:未提供训练配置、检查点或其他复现材料 论文引用的开源项目: PerchV2(预训练音频嵌入模型,引用[5,2])— 常见获取方式为Google Research的Perch项目仓库(https://github.com/google-research/perch ) BirdSet(大规模鸟类声学数据集,引用[6])— 常见链接:https://huggingface.co/datasets/multispecies/BirdSet ATBFL(Acoustic Trends Blue Fin Library,引用[4])— 论文未提供链接,可能通过 https://data.csiro.au/ 获取 CoreSet选择方法(引用[8])— 开源实现常见于 https://github.com/dsgissin/DiscriminativeActiveLearning TypiClust(引用未在片段中给出完整信息)— 作为多样性感知基线 BaseAL框架(BioDCASE 2026 Task 4提供)— 论文未提供链接,可能由挑战组织方提供 🏗️ 方法概述和架构 该方法基于固定预训练嵌入空间,整体流程为:在每一轮主动学习迭代中,从无标注池中选择一个批次(大小 \(B=25\))提交标注,更新多标签分类器,重复直到总预算500耗尽。核心是ADU-MMR采样策略,由三个模块级联:不确定性估计、多样性距离计算、自适应加权与MMR批次选择。 ...

2026-07-07 · 更新于 2026-08-14 · 2 min · 361 words

Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection

📄 Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection #音频事件检测 #测试时自适应 #领域适应 #无监督学习 7.3/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.3/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ✅ 7.3/10 | 前50% | #音频事件检测 | #测试时自适应 | #领域适应 #无监督学习 | arxiv 👥 作者与机构 第一作者:Grach Mkrtchian(独立研究者,未说明所属机构) 通讯作者:Grach Mkrtchian(独立研究者,邮箱:g.mkrtchyan.m@gmail.com) 作者列表:Grach Mkrtchian(独立研究者) 💡 毒舌点评 这篇独立研究者的论文用极低成本的纯后处理方案,揭示并部分解决了DCASE ASD赛道中“开发集AUC漂亮,评估集AUC塌方”的结构性骗局——即这本质上是个操作点校准问题,而非模型能力问题。然而,其核心贡献——那个无标签的域平衡选择准则——在三个挑战赛年份中,仅一年展现出稳健的预测力,另外两年一个简单的全均衡固定默认配置就能打平甚至击败它。这让准则的通用性承诺大打折扣,使其更像是一次针对特定年份的聪明过拟合,而非一个可泛化的方法论突破。 📌 核心摘要 问题定位:论文针对DCASE Challenge Task 2中首次异常声检测(ASD)的两个开放问题:源域与目标域AUC在不同系统间呈负相关,以及开发集性能无法预测评估集性能。 核心方法:提出DACo(Domain-Aware Calibration),一个训练无关的后处理层,包含两部分:(i) 基于可收缩的每域分位数校准,通过先验强度 \(m\) 调节源域/目标域的平衡前沿;(ii) 一个基于交叉验证的、完全标签无关的域平衡准则,利用训练正常样本的KS距离自动从候选配置中进行选择。 方法论主张:提出一种新范式,即用粗粒度的、基于有标签开发集的“可行性否决”来排除退化配置,再用细粒度的、标签无关的部署时准则来对剩余配置进行排序和选择。 核心实验结论(DCASE 2025):在45个配置的网格上,所提准则以 Spearman \(\rho = +0.91\) 预测评估集分数 \(\Omega\),而开发集 \(\Omega\) 的预测力仅为 \(+0.06\)。准则选择将评估集 \(\Omega\) 从55.83提升至59.34(可排第7),在扩展网格上达到61.05(可排第4)。 跨年度复现结论:在DCASE 2023和2024的复现中,准则的预测力在经家族聚类不确定性分析后,仅在2025年显著。2023年证据不足,2024年准则完全失效(\(\rho = -0.10\))。固定全均衡默认配置(\(m=0\) 软分配)在多数情况下匹配或击败准则选择。 实际价值与局限性:提供了一种部署时无需目标域标签即可自动校准操作点的方法,计算成本极低。主要局限在于:准则的跨年度泛化证据薄弱;需依赖有标签的开发集否决来规避退化配置;基于10个样本的目标域校准几乎整个pAUC区间都是外推的,且绝对错误率高于名义水平。 🔗 开源详情 代码:https://github.com/polestvr/daco-experiments 模型权重: BEATs iter3+ AS2M(MIT许可,论文未给出直接下载链接) EAT-base(检查点 worstchan/EAT-base_epoch30_pretrain,MIT许可) PANNs CNN14-16k(权重来自 Zenodo 记录 3987831,CC-BY许可,https://zenodo.org/record/3987831) 数据集: DCASE 2025 Task 2:Zenodo 记录 15097779, 15392814, 15519362 DCASE 2023 Task 2:Zenodo 记录 7882613, 7830345, 7860847 DCASE 2024 Task 2:Zenodo 记录 10902294, 11259435, 11363076 DCASE 2026 开发集:Zenodo 记录 19336329 复现材料:代码仓库提供了全套实验代码、结果CSV、配置清单、复现脚本、环境锁文件及预注册说明(PREREGISTRATION.md)。 论文引用的开源项目: DCASE 2025/2024/2023官方评估器 PANNs预训练权重 BEATs/EAT预训练模型(仅提及名称与许可) 🏗️ 方法概述和架构 DACo是一个三阶段的后处理流水线,完全操作在已冻结的音频嵌入提取器和基础异常打分器之上,无需任何训练。 ...

2026-07-07 · 更新于 2026-08-14 · 3 min · 563 words

BAT: Better Audio Transformer Guided by Convex Gated Probing

📄 BAT: Better Audio Transformer Guided by Convex Gated Probing #音频分类 #音频事件检测 #语音识别 #自监督学习 #Transformer 8.6/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.6/10 | 前25% | #音频分类 | #自监督学习 | #音频事件检测 #语音识别 | arxiv 👥 作者与机构 第一作者:Houtan Ghaffari(Ghent University)、Lukas Rauch(University of Kassel,现就职于 Earth Species Project)(并列一作) 通讯作者:Houtan Ghaffari(Ghent University)、Lukas Rauch(University of Kassel) 作者列表:Houtan Ghaffari(Ghent University)、Lukas Rauch(University of Kassel,现就职于 Earth Species Project)、Christoph Scholz(University of Kassel,Fraunhofer IEE)、Paul Devos(Ghent University) 发表于 ICML 2026,首尔,韩国 💡 毒舌点评 论文以鲜明的"探测优先于微调"的评估哲学切入,提出的 CGP 和 BAT 形成了一套从评估到模型设计的闭环,实验维度相当完整且可复现性意识强。不过,其 AS-2M 的最终微调性能未能超越已报告 SOTA(Reported SSLAM 50.2 vs BAT 48.85),且性能提升的来源存在一定"调参红利"嫌疑,部分结论的泛化性仍待更严格的跨框架验证。 ...

2026-07-04 · 更新于 2026-08-14 · 8 min · 1519 words

Listening Through the Noise: Cauchy-Driven Diffusion Bridges for Robust Gastrointestinal Auscultation and Clinical Benchmarking

📄 Listening Through the Noise: Cauchy-Driven Diffusion Bridges for Robust Gastrointestinal Auscultation and Clinical Benchmarking #音频修复 #语音增强 #扩散模型 #音频事件检测 7.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ✅ 7.4/10 | 前50% | #音频修复 | #扩散模型 | #语音增强 #音频事件检测 | arxiv 👥 作者与机构 第一作者:Dian Ding(上海交通大学计算机科学与工程系) 通讯作者:Yu Lu(上海交通大学计算机科学与工程系,yulu01@sjtu.edu.cn) 作者列表:Dian Ding(上海交通大学)、Liren Dong(陕西师范大学人工智能与计算机科学学院)、Yu Lu(上海交通大学)、Juntao Zhou(上海交通大学)、Ran Wang(上海交通大学)、Peng Li(陕西师范大学)、Zhenyi Jia(上海交通大学医学院附属第六人民医院普外科)、Guangtao Xue(上海交通大学) 💡 毒舌点评 本文在扩散桥框架内引入 Cauchy 噪声假设,对临床肠鸣音去噪具有扎实的理论动机——但“语音干扰呈重尾分布”这一核心动机仅通过 Fig.2 的目视对比来论证,并未给出正式的统计拟合优度检验,有“看图说话”之嫌。CLINBS 数据集填补了病理肠鸣音空白值得肯定,然而论文未提供任何代码、模型权重或数据集获取方式,严重削弱了可复现性与实际影响力。此外,所有评估均在人工加性混合的语音干扰下进行,即使在附录 C.4 补充了真实病房噪声实验,该实验仍采用加性混合模型(将无肠鸣音的背景录音与纯净肠鸣音线性混合),未涉及真实含噪临床录音的直接去噪,临床适用性仍有待证明。 ...

2026-07-04 · 更新于 2026-08-14 · 5 min · 1053 words

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

📄 NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating #音频事件检测 #长音频处理 #高效推理 5.5/10 | 创新 1/2 | 严谨 0.7/1.5 | 实验 0.8/1.5 | 清晰 0.4/1 | 影响 0.5/1.5 | 开源 0.8/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 📝 5.5/10 | 前50% | #音频事件检测 | #音频大模型 | #长音频处理 #高效推理 | arxiv 👥 作者与机构 第一作者:Zhongju Yuan(WAVES Research Group, Ghent University, Gent, Belgium) 通讯作者:Zhongju Yuan(zhongju.yuan@ugent.be) 作者列表:Zhongju Yuan(Ghent University)、Geraint A. Wiggins(Vrije Universiteit Brussel; Queen Mary University of London)、Dick B.M. Botteldooren(Ghent University) 💡 毒舌点评 这篇论文将“选择性注意”包装成一个神经启发的波动力学问题,想法有趣,但数学与工程落地之间存在不小的鸿沟。OWM的Bragg共振最优性证明看似漂亮,但从离散格点方程跳跃到连续介质近似的过程略显随意,部分定理(如Theorem 2.3)在连续假设下漂亮但实际系统离散、有界,理论对实际设计的指导意义有限。此外,实验仅在两个数据集上进行,主要性能提升(17.1% AP)令人印象深刻,但对比基线AudioQwen全量推理表现过弱(53.50% AP),且论文未与任何基于深度特征的时序模型基线(如简单的GRU/LSTM漂移检测器)对比,让人难以判断OWM复杂的波动力学机制是否真有必要。自适应阈值依赖多个手动设定的参数(W=20, α=0.2),其跨场景泛化能力存疑。论文自我定位为“训练自由”方法,但严重依赖两个大规模预训练模型(PANN和AudioQwen),这种“自由”是建立在他人训练成果之上的。 ...

2026-07-04 · 更新于 2026-08-14 · 2 min · 377 words

Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis

📄 Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis #音频分类 #音频事件检测 #低资源 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | #音频分类 | #知识蒸馏 | #音频事件检测 #低资源 | arxiv 👥 作者与机构 第一作者:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 通讯作者:Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 作者列表:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University)、Guoheng Huang(School of Computer Science and Technology, Guangdong University of Technology)、Chan-Tong Lam(Faculty of Applied Sciences, Macao Polytechnic University)、Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University) 💡 毒舌点评 这篇论文精准地抓住了医疗音频模型过度自信的几何病根——范数偏差,用球形约束和动态Procrustes对齐的组合拳切断了特征幅度与置信度的虚假耦合,理念清晰且动机扎实。实验校准效果惊人,将BEATs的ECE从28.51%拉低到4.44%,且做到了零额外推理成本,这一点很漂亮。然而,方法论层面更多是已知几何工具(L2归一化、ETF、SVD)在特定问题上的精巧组装,而非基础性突破。此外,验证局限于两个公开的呼吸音/心音数据集,在标签噪声、跨中心/跨设备泛化上的鲁棒性论证几乎为零,结论的临床闭环说服力仍需大量补充。 ...

2026-07-04 · 更新于 2026-08-14 · 5 min · 901 words

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

📄 AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization #音视频理解 #自监督学习 #对比学习 #音频事件检测 8.5/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.5/10 | 前25% | #音视频理解 | #自监督学习 | #对比学习 #音频事件检测 | arxiv 👥 作者与机构 第一作者:Tianhong Zhou(阿里巴巴集团;清华大学) 通讯作者:Jun Song(阿里巴巴集团) 作者列表:Tianhong Zhou(阿里巴巴集团;清华大学)、Mingyang Han(未说明)、Boyu Li(未说明)、Yuxuan Jiang(未说明)、Jiaxin Ye(未说明)、Dongxiao Wang(未说明)、Haoxiang Shi(未说明)、Kunpeng Wang(未说明)、Jun Song(阿里巴巴集团)、Cheng Yu(未说明)、Bo Zheng(未说明) 💡 毒舌点评 亮点是将音视频评估中被长期混淆的时序对齐与语义一致性进行系统性解耦,并基于野生视频构建了五类变量隔离的挑战任务,直击当前多模态模型训练中的维度偏置。短板是语义编辑完全依赖外部生成模型(DDSP、OpenVoice),但未对编辑产物的“声学纯度”进行定量控制或消融,使“纯语义”假设在物理声学层面站得不够稳;同时,数据集仅3,269个视频,基准规模偏小,且0.64秒切片的选择缺乏理论或实验依据,长期使用的鲁棒性存疑。 ...

2026-07-02 · 更新于 2026-08-14 · 4 min · 645 words

Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition

📄 Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition #音频事件检测 6.2/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 ✅ 6.2/10 | 前50% | #音频事件检测 | #音频事件检测 | arxiv 👥 作者与机构 Peng Zhang, Qingyu Luo, Philip J.B. Jackson, Wenwu Wang Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K. 💡 毒舌点评 想法不错,把语言学里的句法分析搬来处理音频活动,立意是好的。但“语法引导”在音频领域听起来很炫,实际贡献有点薄。核心就是从一个已有的事件检测器输出后,加个规则后处理来“理顺”序列顺序,对于事件边界和时序定位的精度问题基本无能为力,Edit分数的提升掩盖了F1和准确率的停滞甚至下降。创新在于形式化,但工程价值有限,更像一个针对特定数据集(MultiAct)特性的后处理技巧。实验比较单薄,尤其缺乏在更复杂、噪声更强的数据集上的验证,结论的普适性存疑。没有开源代码,复现门槛高,显得不够坦诚。 ...

2026-06-29 · 更新于 2026-08-14 · 2 min · 403 words

Sonus Health: Calibrated Heart-Murmur Detection from Smartphone-Based Veterinary Auscultation

📄 Sonus Health: Calibrated Heart-Murmur Detection from Smartphone-Based Veterinary Auscultation #音频事件检测 5.7/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.3/1.5 📝 5.7/10 | 前50% | #音频事件检测 | #音频事件检测 | arxiv 👥 作者与机构 Aswin Jose, Roeland P-J E. Decorte, Laurent Locquet (Sonus Health) 💡 毒舌点评 这论文就像一个精心设计的“临床安全网”。作者很聪明,知道一个模型直接给诊断太冒险,所以搞了两个“互相监督”的模型,意见一致时才放行,不一致就“扔”给兽医。这想法挺实用,特别是在宠物主人自己录音这种“不靠谱”场景下。但别被那个95.9%的高置信度准确率唬住了,那是从30%里挑出来的“尖子生”成绩。整体来看,74.84%的准确率和0.841的AUROC,在兽医AI里算中规中矩,比不上用专业设备做的研究。最大的槽点是“黑箱”——方法细节全藏起来了,说是什么“专有信息”,这让想复现或深入批判的人无从下手。数据集也小,322个录音,在机器学习领域属于“玩具”级别,泛化能力存疑。总之,工程价值大于科研贡献,是一个不错的临床产品原型,但作为一篇追求方法创新的顶会论文,火候还差不少。 📌 核心摘要 本研究介绍了Sonus Health,一个基于智能手机的兽医心脏杂音检测与分层平台。核心设计是“双模型共识+置信度分层”:一个对细微杂音敏感的双线性网络与一个对噪声鲁棒的LightGBM模型并行处理音频,其输出经校准后通过规则结合,将案例分为高、中、低三个置信度等级。平台在322个真实录音上的评估表明,其高置信度层(占30%案例)能达到95.9%的准确率,而模型不一致的案例(约30%)则被系统性地推迟给兽医审核。这种机制牺牲了整体自动化率,但换取了在关键案例上的高可靠性和临床安全性,定位为筛查、分层与监测工具,而非独立诊断。 🔗 开源详情 代码:论文中未提供代码仓库链接 模型权重:论文中未提及 数据集:论文中未提及 Demo:论文中未提及 复现材料:论文中声称评估管道可从固定种子重新生成,且工件小于4MB,但未提供获取这些工件的方法或链接。 论文中引用的开源项目:未提及 🏗️ 方法概述和架构 Sonus Health平台的评估管道是一个多阶段、双流的融合系统,其核心设计哲学是“保守决策”,即通过模型间的共识来提升可靠性,并用分层机制明确标注不确定性。 ...

2026-06-24 · 更新于 2026-08-14 · 2 min · 226 words