IVQ: Structured and Lightweight Vector Quantization via Binary Hierarchical Composition Inspired by

📄 IVQ: Structured and Lightweight Vector Quantization via Binary Hierarchical Composition Inspired by \(\textit{IChing}\) #音频编码 #音乐生成 #多模态模型 #模型压缩 8.2/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 🔥 8.2/10 | 前25% | #音频编码 | #模型压缩 | #音乐生成 #多模态模型 | arxiv 👥 作者与机构 第一作者:Heda Zuo(浙江大学计算机科学与技术学院) 通讯作者:Weitao You(浙江大学计算机科学与技术学院) 作者列表:Heda Zuo(浙江大学计算机科学与技术学院)、Junxian Wu(浙江大学计算机科学与技术学院)、Fengjie Lu(浙江大学计算机科学与技术学院)、Pei Chen(浙江大学计算机科学与技术学院)、Lingyun Sun(浙江大学计算机科学与技术学院)、Weitao You(浙江大学计算机科学与技术学院) 💡 毒舌点评 这篇论文的野心在于用东方哲学包装一个本质上属于残差积量化(Residual-Product VQ)的技术方案,并试图将《易经》的符号系统强制映射为一种结构先验。但难能可贵的是,这种包装并非纯粹的概念点缀,而是真正催生了极简码本(4×2个基向量)与几何对称约束的有效结合,从根本上解决了码本坍缩,并实现了100%的利用率。在“大力出奇迹”的Scaling Law时代,这种追求结构优雅和极致轻量化的反向探索具有启发性。但哲学隐喻增加了不必要的阅读障碍,且实验规模与当前主流大模型相差甚远,使其实用性仍存疑。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 823 words

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

📄 JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments #声源定位 #多模态模型 #空间音频 #参数高效微调 #数据集 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.1/10 | 前25% | #声源定位 | #多模态模型 | #空间音频 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Zhan Liu(清华大学、腾讯AI Lab) 通讯作者:Chao Zhang(清华大学) 作者列表:Zhan Liu(清华大学、腾讯AI Lab)、Changli Tang(清华大学)、Yuxin Wang(香港科技大学)、Zhiyuan Zhu(浙江大学)、Youjun Chen(香港中文大学)、Yiwen Shao(腾讯AI Lab)、Tianzi Wang(腾讯AI Lab)、Lei Ke(腾讯AI Lab)、Zengrui Jin(清华大学)、Chao Zhang(清华大学) 💡 毒舌点评 本文提出了在3D模拟物理环境中进行联合音视频定位与推理的框架 JAEGER,其核心贡献 Neural IV 和 SpatialSceneQA 数据集为空间音频理解研究提供了有价值的工具和基准。亮点在于系统性整合了 RGB-D 视觉与多通道 FOA,并在附录中通过 SimpleFuse 基线实验初步证明了其架构设计的有效性,而非仅依赖于多模态输入的堆砌。然而,实验设计存在明显的“避重就轻”:正文主表(Table 2)回避了 SimpleFuse 基线,将其置于附录,这使得核心主张——即架构的优越性——在主叙述中缺乏最直接的量化支撑。此外,3D 视觉接地任务中,专门针对 3D 的模型 N3D-VLM 竟获得 0.0 IoU,这一零样本、无适配的对比方式极不公正,更像是对基线的“处决”而非“比较”。更严重的是,多说话人推理任务在正文中汇报了接近 100% 的准确率,营造出任务已被解决的假象,而论文在附录中承认,当干扰项增至 4-6 个时性能迅速下降,这种对任务天花板效应(ceiling effect)的深度分析本应是正文的核心内容,却被掩盖于近乎完美的数字之下。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 742 words

Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits

📄 Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits #语音识别 #语音增强 #鲁棒性 #扩散模型 #多模态模型 9.3/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 🔥 9.3/10 | 前10% | #语音识别 | #扩散模型 | #语音增强 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Gilad Nurko(Technion – Israel Institute of Technology) 通讯作者:Gilad Nurko(Technion – Israel Institute of Technology) 作者列表:Gilad Nurko(Technion – Israel Institute of Technology)、Roi Benita(Technion – Israel Institute of Technology)、Yehoshua Dissen(Technion – Israel Institute of Technology)、Tomohiro Nakatani(NTT, Inc., Japan)、Marc Delcroix(NTT, Inc., Japan)、Shoko Araki(NTT, Inc., Japan)、Joseph Keshet(Technion – Israel Institute of Technology) 💡 毒舌点评 信号与logits扩散的耦合想法聪明又实用,让增强和识别双向奔赴,确实比傻乎乎的“先增强后分类”高出几个段位。但计算开销是硬伤,Nested和Alternating策略的NFE(神经功能评估)倍数(10×和7×)让部署侧直呼受不了,且ASR实验一直抱着受限词表不放,似乎有点逃避大词汇量连续识别的hard mode。整体瑕不掩瑜,ICML的spotlight水平,但别想让审稿人给full oral。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 444 words

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

📄 LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues #语音交互 #语音大模型 #基准测试 #内容审核 #多模态模型 8.1/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #语音交互 | #语音大模型 | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 通讯作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 作者列表:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering)、Shinji Watanabe(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 这篇论文为语音安全评估贡献了一个设计精良的受控基准,最可贵之处在于清晰揭示了“增加音频不一定更安全”这一反直觉结论,并系统解构了模态、转录源和提示策略间的复杂交互。然而,所有对话均基于合成语音,真实的嘈杂环境、口音、自然副语言信息和多轮累积危害的缺失,使得当前结论能否直接迁移到实际部署中仍存较大疑问,而作者在这方面过于乐观的决策流程图可能会误导急于落地的从业者。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 753 words

Language Model Augmented Semi-Supervised Statistical Inference

📄 Language Model Augmented Semi-Supervised Statistical Inference #语音属性识别 #大语言模型 #少样本 #医疗音频 #理论分析 5.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 📝 5.4/10 | 后50% | #语音属性识别 | #大语言模型 | #少样本 #医疗音频 | arxiv 👥 作者与机构 第一作者:Xinrui Ruan(University of California, Berkeley, Division of Biostatistics) 通讯作者:Jingshen Wang(University of California, Berkeley, Division of Biostatistics) 作者列表:Xinrui Ruan(University of California, Berkeley)、Yingfei Wang(University of Washington, Foster School of Business)、Waverly Wei(University of Southern California, Department of Data Sciences and Operations)、Jingshen Wang(University of California, Berkeley) 💡 毒舌点评 论文在统计理论上花费了大量篇幅证明LLM伪标签的校准权重能提升半监督推断效率,思想严谨但不够惊艳——本质上是对半参数推断中投影技巧的LLM特化。实验局限于语音转录文本这一个应用,且与语音社区熟知的预训练模型(Wav2Vec2、HuBERT)毫无关联,代码、数据提取全闭源,对于语音/音频领域的读者而言,这更像一篇披着语音应用外衣的统计论文,而非真正解决语音问题的研究。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 328 words

Learning Tight Rejection Boundaries without Negatives for Strict One-Class Audio Deepfake Detection

📄 Learning Tight Rejection Boundaries without Negatives for Strict One-Class Audio Deepfake Detection #语音伪造检测 9.3/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 9.3/10 | 前10% | #语音伪造检测 | #无监督学习 | arxiv 👥 作者与机构 第一作者:Yuze Zhao(哈尔滨工业大学深圳) 通讯作者:Wei Jiang(哈尔滨工业大学网络空间安全学院) 作者列表:Yuze Zhao(哈尔滨工业大学深圳)、Kuiyuan Zhang(哈尔滨工业大学网络空间安全学院)、Zhongyun Hua(哈尔滨工业大学深圳)、Yushu Zhang(江西财经大学计算机与人工智能学院)、Qing Liao(哈尔滨工业大学深圳)、Wei Jiang(哈尔滨工业大学网络空间安全学院) 💡 毒舌点评 这篇文章的野心让人眼前一亮:它试图在完全不看任何伪造样本的前提下,仅靠真实语音就训练出一个既能圈定真实分布又能明确划出“哪是假”边界的检测器,这在音频深伪检测领域确实是个硬骨头。方法核心“用结构破坏的探针代替假样本当负类”的想法很巧妙,跨域和未知攻击的鲁棒性提升也相当扎实。不过,亮点背后也藏着隐忧:探针家族纯靠人工设计,万一未来的攻击技术高明到连音频的时序、频谱、相位结构都不带破绽,这套边界恐怕就会被钻空子。另外,在线标准化虽然有效缓解了余弦坍塌,但对比的归一化方法有限,缺乏更深入的理论解释。总体而言,是一篇想法新颖、实验扎实的顶会候选,但在理论深度和终极鲁棒性上仍有待打磨。 📌 核心摘要 本工作瞄准严格单类音频深度伪造检测中的核心难题:如何在仅用真实语音训练、完全不接触任何伪造样本的前提下,学习一个既能压缩真实分布、又能在嵌入空间中明确划出拒绝边界的检测器。 提出 CA-SOADD (Centroid-Anchored Strict One-Class Audio Deepfake Detection),采用“质心锚定的三目标学习”框架:质心紧凑性 (\(\mathcal{L}_{\text{cpt}}\)) 锚定真实核心、良性视图不变性 (\(\mathcal{L}_{\text{binv}}\)) 稳定质心邻域、质心参考的边界塑造 (\(\mathcal{L}_{\text{cabs}}\)) 通过结构破坏探针施加余弦间隔约束,在不引入显式负类的情况下收紧接受域。 与放松的单类方法(训练时引入伪造或辅助负样本)和纯紧凑性驱动的 Deep-SVDD 等彻底划清界限:CA-SOADD 严格对齐推理时的余弦-质心打分规则,首次将离线形边界探针与质心参照间隔引入语音伪造检测,完全避免了对伪造样本的判别学习或代理判别。 在多个基准上验证了有效性:ASVSpoof-2021 LA/DF 上 AUC/EER 达到 96.9%/7.3% 和 96.9%/8.4%,ASVSpoof-5 上 92.7%/13.4%,CtrSVDD 歌唱基准 EER 16.83%,MLAAD 跨语言基准全语言 EER 17.70%,均大幅优于同严格协议下的其他单类基线,并在跨基准迁移(ASVSpoof-2021→ASVSpoof-5)中超越有监督检测器。 贡献了系统的消融分析:证实边界塑造损失、良性不变性、在线标准化均起关键作用,尤其是代理判别损失(BCE、InfoNCE)无法复现增益,证明增益来自评分对齐的边界塑形而非代理判别。此外,探针池按机制族移除的分析验证了整体方法对特定探针的鲁棒性。 实际意义:提供了一种完全脱离伪造样本的开集检测方案,天然适应快速演变的生成攻击,部署时无需收集、标注或假设攻击类型,可降低对抗性语音检测系统的持续维护成本。 主要局限:结构破坏探针池依赖人工设计,对保留自然语音结构但含细微伪造痕迹的攻击覆盖不足;在线标准化缺乏与更多归一化方法的深度对比;跨域场景下阈值需域内真实样本校准;多语言场景禁用 \(\mathcal{L}_{\text{binv}}\),暴露了良性不变性与多中心分离间的潜在冲突;未在工业级真实管道中验证。 🔗 开源详情 代码:https://github.com/120L020310/CA-SOADD (论文声明的开源仓库) 模型权重:未发布 数据集: ASVSpoof-2021 LA/DF:需向 https://www.asvspoof.org/ 申请 ASVSpoof-5:需向 https://www.asvspoof.org/ 申请 CtrSVDD:https://github.com/nii-yamagishilab/CtrSVDD MLAAD:https://github.com/nii-yamagishilab/mlaad 复现材料:附录 B(在线标准化伪代码)、C.3(探针池算子参数与实现细节)、C.4(探针生成器范式诊断)、E(真实阈值校准流程)、F.1/F.2(损失权值与间隔敏感度分析)提供了充分信息;所有实验在单卡 NVIDIA RTX 5090 上完成。 论文引用的开源/公开项目(部分列举): XLSR / wav2vec 2.0: https://github.com/facebookresearch/fairseq/tree/main/examples/wav2vec WavLM: https://github.com/microsoft/unilm/tree/master/wavlm HuBERT: https://github.com/facebookresearch/fairseq/tree/main/examples/hubert Deep-SVDD: https://github.com/lukasruff/Deep-SVDD AASIST: https://github.com/clovaai/aasist RawNet2: https://github.com/jungjee/RawNet CSI: https://github.com/alinlab/CSI 其他引用的方法(OC-SVM, CutPaste, NAD, OC-Softmax, LCNN, RawGAT, ABC-CapsNet, MPE, ASDG, IG-SVD, NaturalSpeech 3, MaskGCT 等)的官方仓库或论文出处已在原文参考文献中标注。 🏗️ 方法概述和架构 CA-SOADD 严格遵循单类学习协议,训练全程只使用真实语音,推理采用余弦相似度到质心的打分规则。整体流程如图2所示:原始真实语音波形 \(x\) 经过几何稳定表征提取器 \(f_\theta\) 得到句级嵌入 \(z\),嵌入经过在线标准化后参与三目标联合训练,同时维护一个仅从真实样本更新的运行质心 \(c\)。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 594 words

LightAVSeg: Lightweight Audio-Visual Segmentation

📄 LightAVSeg: Lightweight Audio-Visual Segmentation #模型压缩 #高效推理 #多模态模型 #知识蒸馏 6.3/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.3/10 | 前50% | #模型压缩 | #模型压缩 | #高效推理 #多模态模型 | arxiv 👥 作者与机构 第一作者:Qing Zhong (华中农业大学信息学院) 通讯作者:Guodong Ding (新加坡国立大学计算学院) 作者列表:Qing Zhong (华中农业大学信息学院), Guodong Ding (新加坡国立大学计算学院), Lingqiao Liu (阿德莱德大学计算机科学学院), Zaiwen Feng (华中农业大学信息学院), Lin Yuanbo Wu (华威大学工学院 / 浙江越秀外国语学院), Angela Yao (新加坡国立大学计算学院) 💡 毒舌点评 这篇论文抓住了一个真实痛点:AVS模型在移动端的部署瓶颈。解耦”语义过滤“和”空间定位“的思路清晰,但本质上是将多模态融合中”音频提供全局语义“这一已知洞察工程化为通道调制,范式贡献有限。移动端8倍加速的数据亮眼,但164ms的延迟对于”实时交互“仍显尴尬,且与Mamba等同期线性复杂度工作的对比缺失,让优越性存疑。代码和模型不开源,在这个领域几乎是原罪,让所有工程化承诺都悬于空中。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 624 words

Listening Through the Noise: Cauchy-Driven Diffusion Bridges for Robust Gastrointestinal Auscultation and Clinical Benchmarking

📄 Listening Through the Noise: Cauchy-Driven Diffusion Bridges for Robust Gastrointestinal Auscultation and Clinical Benchmarking #音频修复 #语音增强 #扩散模型 #音频事件检测 7.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ✅ 7.4/10 | 前50% | #音频修复 | #扩散模型 | #语音增强 #音频事件检测 | arxiv 👥 作者与机构 第一作者:Dian Ding(上海交通大学计算机科学与工程系) 通讯作者:Yu Lu(上海交通大学计算机科学与工程系,yulu01@sjtu.edu.cn) 作者列表:Dian Ding(上海交通大学)、Liren Dong(陕西师范大学人工智能与计算机科学学院)、Yu Lu(上海交通大学)、Juntao Zhou(上海交通大学)、Ran Wang(上海交通大学)、Peng Li(陕西师范大学)、Zhenyi Jia(上海交通大学医学院附属第六人民医院普外科)、Guangtao Xue(上海交通大学) 💡 毒舌点评 本文在扩散桥框架内引入 Cauchy 噪声假设,对临床肠鸣音去噪具有扎实的理论动机——但“语音干扰呈重尾分布”这一核心动机仅通过 Fig.2 的目视对比来论证,并未给出正式的统计拟合优度检验,有“看图说话”之嫌。CLINBS 数据集填补了病理肠鸣音空白值得肯定,然而论文未提供任何代码、模型权重或数据集获取方式,严重削弱了可复现性与实际影响力。此外,所有评估均在人工加性混合的语音干扰下进行,即使在附录 C.4 补充了真实病房噪声实验,该实验仍采用加性混合模型(将无肠鸣音的背景录音与纯净肠鸣音线性混合),未涉及真实含噪临床录音的直接去噪,临床适用性仍有待证明。 ...

2026-07-04 · 更新于 2026-07-28 · 5 min · 1053 words

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

📄 MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks #音频理解 9.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 9.1/10 | 前10% | #音频理解 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Yadong Niu(Xiaomi Inc, Beijing, China) 通讯作者:Yadong Niu(niuyadong@xiaomi.com)、Heinrich Dinkel(dinkelheinrich@xiaomi.com)、Tianzi Wang(twang@se.cuhk.edu.hk) 作者列表:Yadong Niu(Xiaomi Inc)、Tianzi Wang(Xiaomi Inc、The Chinese University of Hong Kong)、Heinrich Dinkel(Xiaomi Inc)、Xingwei Sun(Xiaomi Inc)、Jiahao Zhou(Xiaomi Inc)、Gang Li(Xiaomi Inc)、Jizhong Liu(Xiaomi Inc)、Xunying Liu(The Chinese University of Hong Kong)、Jian Luan(Xiaomi Inc) 💡 毒舌点评 本文在音频理解基准的“标注粒度”和“评估区分度”两个痛点上做出了有针对性的努力。多专家+CoT的标注流水线和DATE指标确实比现有方案更精细,对暴露当前LALMs的“语音中心偏见”和“声学属性忽视”问题有实际贡献。但作为一篇以基准为核心卖点的论文,其数据源取自ACAV100M,标注流水线核心强依赖DeepSeek-R1这一闭源商业LLM,这直接动摇了基准作为“黄金标准”应具备的独立性和可复现性。10秒音频片段的设定也使其在长时序推理评测上无法与现有长音频基准形成互补,格局略显不足。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 346 words

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

📄 MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio #音频理解 #医疗音频 #基准测试 #数据集 #多模态模型 6.4/10 | 创新 0.8/2 | 严谨 0.8/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | #音频理解 | #多模态模型 | #医疗音频 #基准测试 | arxiv 👥 作者与机构 第一作者:Harshit Rajgarhia(Centific Global Solutions Inc.) 通讯作者:Harshit Rajgarhia(Centific Global Solutions Inc.) 作者列表:Harshit Rajgarhia(Centific Global Solutions Inc.)、Shuubham Ojha(Centific Global Solutions Inc., University of Maryland, College Park)、Asif Shaik(Centific Global Solutions Inc.)、Akhil Pothanapalli(Centific Global Solutions Inc.)、Rachuri Lokesh(Centific Global Solutions Inc.)、Abhishek Mukherji(Centific Global Solutions Inc.)、Prasanna Desikan(Centific Global Solutions Inc.) 💡 毒舌点评 这篇论文构建了一个规模可观(46k QA对)且设计精巧的医学音频推理基准,通过对13个前沿模型的系统评测,清晰暴露了当前多模态大模型在医学音频上的显著短板,尤其是言语理解与生理声理解的严重偏科。然而,数据完全依赖合成生成和API调用,使整个基准的价值高度绑定于特定商业模型(Gemini和ElevenLabs)的生成能力,缺乏对“真实”临床音频分布差距的严格验证;且没有开源代码、模型或完整的生成流水线,连自身宣称的“scalable”理念都无法让社区复制,工程诚意严重不足。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 306 words