Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

📄 Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models 标签:#音视频问答 #多模态模型 #空间音频 #强化学习 6.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #空间音频 #强化学习 | arxiv 👥 作者与机构 第一作者:Zhi Zeng(标注为共同一作,机构编号 1;机构名称未在正文中说明) 共同一作:Cheng Zhang、Zesheng Yang(机构编号 1)、Rendong Pi(机构编号 2) 作者列表:Zhi Zeng¹、Cheng Zhang¹、Zesheng Yang¹、Rendong Pi²、Jiaying Wu³、Di Zhang¹、Zihan Ma¹、Guodong Li⁴、Zhou Yang¹、Yu Xiang²、Yifei Zheng⁵、Minnan Luo¹(前四位标注 equal contribution;通讯作者未说明;1–5 为机构编号,机构名称未在论文中给出) 💡 毒舌点评 亮点:把"移动声源的时空跟踪与视觉绑定"正式定义为四级 QA 任务,并用模态必要性约束从构造上堵死单模态捷径,定位精准;ST-Omni-R1 平均 77.83% 领先最强闭源基线 Gemini-2.5-Pro(37.28%)达 40.55 个百分点,差距显著。 短板:核心产物(ST-OmniQA 数据、STA-encoder 代码、模型权重)完全未开源,一个基准论文拿不出基准本身,是最大的硬伤;全部数据来自 Matterport3D+SoundSpaces 2.0 单一仿真管线,真实场景只有音频模态的部分迁移证据;高度相关的近作 ST-AudioLM 在正文中被点名却未入表对比;且所有通用基线均为零样本,与经过同分布 SFT 的本文方法并不对等,“碾压式"领先需要打折解读。 📌 核心摘要 要解决的问题:现有音频语言模型(LALM)多以全局事件语义表示整段音频,视觉语言模型缺乏空间音频线索,SELD 则受限于固定词表与结构化输出,三者均无法对移动声源执行"定位—跟踪—跨模态绑定"的联合开放推理。 方法核心:构建 ST-OmniQA 基准(40K 全景视频 + 400K QA,四级能力 A/B/C/D,式 (2) 模态必要性约束),提出 ST-Omni-R1 模型,由 STA-encoder(1 个语义 token + 40 个时序轨迹 token)、Qwen2.5-VL-7B-Instruct 视频分支、两层 MLP 音频连接器组成,经 Stage A→D 渐进课程学习与推理树强化学习(RT-GRPO)训练。 新在哪里:基准层面要求答案仅在联合视听证据下唯一可解(\(|\mathcal{C}_A|>1, |\mathcal{C}_V|>1, |\mathcal{C}_{AV}|=1\));表示层面将 FOA 的时变声强向量转为有序轨迹 tokens,并与全景视觉实例绑定。 主要实验结果:ST-OmniQA 上 ST-Omni-R1(SFT+RT-RL)平均语义准确率 77.83%,最强闭源基线 Gemini-2.5-Pro 为 37.28%;TAU-NIGENS/L3DAS22/STARSS23 三个公开空间音频基准上总体均优于 BAT(注意 TAU-NIGENS 的 Elevation 子项上 BAT 50.00 略高于本文 49.50)。 实际意义:为"空间音频+全景视频"的动态声源推理提供了基准与基线系统,可能推动音视频问答、具身智能中声源跟踪与视觉绑定方向的研究。 主要局限:训练与评测均来自 Matterport3D+SoundSpaces 2.0 同一仿真引擎,真实场景仅有音频/音视频迁移的部分证据;模型、数据、代码均未开源;RT-GRPO 奖励权重与树节点打分细则未披露;Level C 仅 55.70% 且无失败模式分析。 下图展示了ST-OmniQA基准中的一个单源音频-视觉接地任务示例。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 493 words

Machine-Learning-Based Diagnostic Framework for Passive Ultrasonic Detection of Railway Wheel Defects

📄 Machine-Learning-Based Diagnostic Framework for Passive Ultrasonic Detection of Railway Wheel Defects 标签:#音频分类 #集成学习 #工业应用 #可解释性 5.6/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1/1.5 📝 5.6/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #音频分类 | #集成学习 | #工业应用 #可解释性 | arxiv 👥 作者与机构 第一作者:Aashish Shaju(Virginia Tech,Department of Mechanical Engineering) 通讯作者:未说明 作者列表:Aashish Shaju(Virginia Tech,Department of Mechanical Engineering)、Steve Southward(Virginia Tech,Department of Mechanical Engineering)、Mehdi Ahmadian(Virginia Tech,Department of Mechanical Engineering) 💡 毒舌点评 亮点是把被动空气耦合超声从“有没有裂纹”推进到“是哪类缺陷”,统计筛选+互信息排序+随机森林的流水线对低成本现场检测有实际想象空间。短板是实验证据仅来自11个轮对台架数据,没有基线对比,也没有公开数据或代码;0.66的balanced accuracy很难支撑“可部署”结论。更严重的是,论文声称的“nine classes”与正文列出的10种状态相互矛盾,且未按轮对分组划分交叉验证,同轮样本相关性可能使结果偏高。若不做轮对级分组,测试性能可能被乐观估计。 ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 291 words

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

📄 MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection 标签:#音视频理解 #多模态模型 #基准测试 #语音合成 #音频生成 6.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.5/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频理解 | #多模态模型 | #基准测试 #语音合成 | arxiv 👥 作者与机构 作者列表:Yanqiu Li、Yang Xiao、Jisheng Bai、Bin Chen、Hong Jia、Ting Dang。 机构编号为 1、2、3;具体机构名称在提供的论文原文片段中未披露。 通信作者信息未披露。 💡 毒舌点评 论文把“环境音频”从被长期忽视的背景音升级成了独立伪造组件,但复现所需的代码、数据和模型权重却被藏成了未披露的第三个组件。行文与表格中存在大量排版损坏字符,读起来像从 PDF 里抢救出来的半成品;实验设计值得肯定,工程开源程度却让“rigorous foundation”显得有点嘴硬。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 561 words

Mitigating Over-Suppression in Speech Enhancement via Inference-Time Rethink-and-Refine Correction Module

📄 Mitigating Over-Suppression in Speech Enhancement via Inference-Time Rethink-and-Refine Correction Module 标签:#语音增强 #测试时自适应 #鲁棒性 #语音质量评估 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #测试时自适应 | #鲁棒性 #语音质量评估 | arxiv 👥 作者与机构 第一作者:Mike Qu(机构未说明) 通讯作者:未说明 作者列表:Mike Qu、Yu-Wen Chen、Julia Hirschberg(机构信息均在原文中未说明) 💡 毒舌点评 把 over-suppression 校正拆成 ASR 对齐的“反思-修复”在直觉上很务实,免训练、即插即用、多数据集多模型验证也是加分项;但核心主张“ASR 局部权重优于已有全局插值/SNR 检测式校正”没有用 observation-adding 或 NRSER 做任何数值对照,双视图重调和、fallback、分段粒度也全部没有消融。工程上像是一个有用的输出级修补件,但学习率、迭代次数、ASR 切分参数等复现关键信息缺失,且没有代码或 demo,离“系统性新方法”还差至少一轮严格的消融与开源支撑。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 695 words

Multilingual Emotion Neurons in Large Audio-Language Models

📄 Multilingual Emotion Neurons in Large Audio-Language Models 标签:#语音情感识别 #多模态模型 #可解释性 #低资源 6.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #多模态模型 | #可解释性 #低资源 | arxiv 👥 作者与机构 第一作者:Xiutian Zhao(Center for Language and Speech Processing, Johns Hopkins University, USA) 通讯作者:未说明 作者机构归属: Johns Hopkins University: Xiutian Zhao、Philipp Koehn、Berrak Sisman Imperial College London: Björn Schuller 论文标题页脚注明确给出了作者编号与机构对应关系:编号 1 对应 CLSP, Johns Hopkins University;编号 2 对应 GLAM, Imperial College London。因此可将姓名与机构直接对应,不需要写“未说明”。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 765 words

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

📄 MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation 标签:#音乐生成 #自回归模型 #模型评估 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #自回归模型 | #模型评估 | arxiv 👥 作者与机构 第一作者:Shuyu Li(浙江大学人工智能学院) 通讯作者:Kejun Zhang(浙江大学人工智能学院;长三角一体化创新中心) 作者列表:Shuyu Li(浙江大学人工智能学院)、Kejun Zhang(浙江大学人工智能学院)、Jiahe Lei(香港中文大学)、Shulei Ji(浙江大学计算机科学与技术学院)、Zihao Wang(浙江大学计算机科学与技术学院/山东大学)、Jiaxing Yu(浙江大学人工智能学院)、Wanying Wu(浙江大学竺可桢学院)、Lei Wang(蚂蚁集团) 💡 毒舌点评 用显式布局规划替代隐式全局prompt,方向正确且及时。方法整体是一个“在ACE-Step的LM token流中插入一段结构化文本”的增量式改造,胜在工程闭环完整,但结论的适用范围需要仔细甄别:相对匹配数据no-layout控制确实全面更优,这是最有力的证据;然而在外部基线对比中,生成布局只在FreeMIDI上FAD/KL最优,MuChin真实音频域FAD高达3.456(显著差于XL-Turbo的1.994和Stable Audio的2.007),CLAPScore也始终低于Stable Audio,说明显式规划并不能统一提升全局文本对齐。布局操作实验仅有4个手工挑选的成功案例和谱图可视化,无量化指标和失败案例;主观评价样本量小、无显著性检验。全文无代码/权重/demo链接,可复现性仅停留在“附录写得很详细”的层面。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 574 words

Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions

📄 Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions 标签:#声源定位 #CNN #模型评估 6.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #CNN | #模型评估 | arxiv 👥 作者与机构 第一作者:Mikko Heikkinen(未说明) 通讯作者:未说明 作者列表:Mikko Heikkinen(未说明)、Archontis Politis(未说明)、Konstantinos Drossos(未说明)、Tuomas Virtanen(未说明) 💡 毒舌点评 用复值ATF替代几何坐标作为阵列条件,是解决非自由场、带壳体散射设备泛化的正确方向,手机型阵列上的泛化结果也确有价值。但全篇只有仿真实验,缺少与Neural-SRP、GI-DOAEnet、PhaseCoder等同赛道方法的对比,也没有证明"ATF优于坐标"的消融;CoordConv、跨通道共享注意力等关键设计同样没有组件级证据;不公开代码和数据让"array-generic"更像一个精致演示,而不是可验证的结论。 📌 核心摘要 论文提出利用复值方向性阵列传递函数(ATF)作为阵列元数据,配合多通道信号谱图进行神经网络声源到达方向估计,以解决大多数深度学习DoA方法只能用于训练阵列、难以泛化到未见设备的问题。核心网络由信号卷积编码器、ATF直接性卷积编码器、跨注意力融合和DoA解码器组成,输出多源笛卡尔向量;所有二维卷积均替换为CoordConv。区别于用麦克风坐标作为元数据的方法,ATF能描述非自由场、非全向、含壳体散射的实际设备。2D单源任务中,方法F1@5°=0.75、LE=4.0°,低于MUSIC(0.97/1.5°),但LE明显优于FCGA(9.8°);3D多源任务中随着源数增加性能衰减比MUSIC更平缓,且mobile-like阵列泛化与单一阵列训练差距不大。意义在于提供了一条将物理阵列模型嵌入神经DoA估计、增强设备泛化性的路径。局限主要包括仅仿真验证、未与近年前沿阵列泛化DNN对比,且未提供代码或数据。 下文表格只列论文正文明确给出的代表性设置与结果;未报告的基线数字不作推断。 🔗 开源详情 代码:论文中未提及代码链接。论文仅给出 arXiv ID 2608.09425v1,未提供 GitHub、HuggingFace、ModelScope、项目主页或 Demo 地址。 ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 376 words

omni-macos: On-Device Omni-Modal Search on Apple Silicon

📄 omni-macos: On-Device Omni-Modal Search on Apple Silicon 标签:#音频检索 #多模态模型 #高效推理 #开源工具 #模型压缩 7.2/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频检索 | #多模态模型 | #高效推理 #开源工具 | arxiv 👥 作者与机构 第一作者:Han Xiao(Jina AI by Elastic,来自论文署名行) 通讯作者:未说明(论文未明确标注通讯作者) 作者列表:Han Xiao(Jina AI by Elastic) 💡 毒舌点评 工程完成度确实高,把“隐私、持续索引、交互延迟、统一内存预算”做成一个可运行的原生 macOS 系统,并且每个机制都给了跨五台机器的测量。但论文始终没有与任何既有检索系统做端到端质量对比,检索质量只靠“与自身 bf16 扫描的一致性”来间接说明,更像一份优秀的系统报告而非完整的检索研究。作为审稿人,我愿意接收为系统展示/工程论文,但不会把它当作检索质量或 SOTA 的证据。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 948 words

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

📄 PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue 标签:#语音交互 #大语言模型 #语音识别 #语音合成 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音交互 | #大语言模型 | #语音识别 #语音合成 | arxiv 👥 作者与机构 第一作者:Shibo Wang(Alibaba Group)、Zicheng Zhang(Alibaba Group),论文标注为Co-first authors(共同第一作者) 通讯作者:Libo Wang(Alibaba Group),论文标注为Corresponding author 作者列表:Shibo Wang(Alibaba Group)、Zicheng Zhang(Alibaba Group)、Libo Wang(Alibaba Group)、Junfeng Ma(Alibaba Group) 💡 毒舌点评 PACE 用"播放边界"这个系统可观测信号把 LLM 全双工语音对话中最隐蔽的上下文错位问题变成了可工程化修复的问题,GCM 的提法本身很有价值,且 25.0%→96.3% 的 RAA 提升令人印象深刻;但整个验证只基于 DashScope 单一家后端、TTS 合成的用户轨迹和 ChatGPT 5.5 单一裁判,“provider-independent” 的系统级卖点目前还停留在架构声明层面,且 PACE 核心代码未开源,独立复现门槛较高。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 771 words

Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty

📄 Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty 标签:#声源定位 #Transformer #鲁棒性 #多通道 6.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #Transformer | #鲁棒性 #多通道 | arxiv 👥 作者与机构 第一作者:Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) 通讯作者:未说明 作者列表: Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) Changwoo J. Lee(Duke University, Department of Statistical Science) Xin Shen(Duke University, Department of Statistical Science) Ari Lehtiö(University of Jyväskylä, Digital Services) Sandro von Brandenburg(University of Jyväskylä, Digital Services) Ossi Nokelainen(University of Jyväskylä, Department of Biological and Environmental Science;University of Jyväskylä, Open Science Centre) David B. Dunson(Duke University, Department of Statistical Science) Otso Ovaskainen(University of Jyväskylä, Department of Biological and Environmental Science) 💡 毒舌点评 用“保留物理求解器 + 学习校正 + 两层物理门控 + GDOP 缩放不确定性”的思路来抑制双曲定位的灾难性长尾,诊断清楚、设计务实,这是论文最大的亮点。但真实实验只有一个冰冻湖站点、六个已知扬声器位置,森林场景全部是仿真,且没有给出完整混合门控在森林仿真中的直接结果;基线只有经典双曲求解器,未与任何现代深度学习、score-based 或 conformal 声源定位方法对比。整体说服力仍未达到顶会主接收准。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 619 words