Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits

📄 Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits #语音识别 #语音增强 #鲁棒性 #扩散模型 #多模态模型 9.3/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 🔥 9.3/10 | 前10% | #语音识别 | #扩散模型 | #语音增强 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Gilad Nurko(Technion – Israel Institute of Technology) 通讯作者:Gilad Nurko(Technion – Israel Institute of Technology) 作者列表:Gilad Nurko(Technion – Israel Institute of Technology)、Roi Benita(Technion – Israel Institute of Technology)、Yehoshua Dissen(Technion – Israel Institute of Technology)、Tomohiro Nakatani(NTT, Inc., Japan)、Marc Delcroix(NTT, Inc., Japan)、Shoko Araki(NTT, Inc., Japan)、Joseph Keshet(Technion – Israel Institute of Technology) 💡 毒舌点评 信号与logits扩散的耦合想法聪明又实用,让增强和识别双向奔赴,确实比傻乎乎的“先增强后分类”高出几个段位。但计算开销是硬伤,Nested和Alternating策略的NFE(神经功能评估)倍数(10×和7×)让部署侧直呼受不了,且ASR实验一直抱着受限词表不放,似乎有点逃避大词汇量连续识别的hard mode。整体瑕不掩瑜,ICML的spotlight水平,但别想让审稿人给full oral。 ...

2026-07-04 · 更新于 2026-07-27 · 3 min · 444 words

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

📄 LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues #语音交互 #语音大模型 #基准测试 #内容审核 #多模态模型 8.1/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #语音交互 | #语音大模型 | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 通讯作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 作者列表:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering)、Shinji Watanabe(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 这篇论文为语音安全评估贡献了一个设计精良的受控基准,最可贵之处在于清晰揭示了“增加音频不一定更安全”这一反直觉结论,并系统解构了模态、转录源和提示策略间的复杂交互。然而,所有对话均基于合成语音,真实的嘈杂环境、口音、自然副语言信息和多轮累积危害的缺失,使得当前结论能否直接迁移到实际部署中仍存较大疑问,而作者在这方面过于乐观的决策流程图可能会误导急于落地的从业者。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 753 words

LightAVSeg: Lightweight Audio-Visual Segmentation

📄 LightAVSeg: Lightweight Audio-Visual Segmentation #模型压缩 #高效推理 #多模态模型 #知识蒸馏 6.3/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.3/10 | 前50% | #模型压缩 | #模型压缩 | #高效推理 #多模态模型 | arxiv 👥 作者与机构 第一作者:Qing Zhong (华中农业大学信息学院) 通讯作者:Guodong Ding (新加坡国立大学计算学院) 作者列表:Qing Zhong (华中农业大学信息学院), Guodong Ding (新加坡国立大学计算学院), Lingqiao Liu (阿德莱德大学计算机科学学院), Zaiwen Feng (华中农业大学信息学院), Lin Yuanbo Wu (华威大学工学院 / 浙江越秀外国语学院), Angela Yao (新加坡国立大学计算学院) 💡 毒舌点评 这篇论文抓住了一个真实痛点:AVS模型在移动端的部署瓶颈。解耦”语义过滤“和”空间定位“的思路清晰,但本质上是将多模态融合中”音频提供全局语义“这一已知洞察工程化为通道调制,范式贡献有限。移动端8倍加速的数据亮眼,但164ms的延迟对于”实时交互“仍显尴尬,且与Mamba等同期线性复杂度工作的对比缺失,让优越性存疑。代码和模型不开源,在这个领域几乎是原罪,让所有工程化承诺都悬于空中。 ...

2026-07-04 · 更新于 2026-07-27 · 3 min · 624 words

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

📄 MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio #音频理解 #医疗音频 #基准测试 #数据集 #多模态模型 6.4/10 | 创新 0.8/2 | 严谨 0.8/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | #音频理解 | #多模态模型 | #医疗音频 #基准测试 | arxiv 👥 作者与机构 第一作者:Harshit Rajgarhia(Centific Global Solutions Inc.) 通讯作者:Harshit Rajgarhia(Centific Global Solutions Inc.) 作者列表:Harshit Rajgarhia(Centific Global Solutions Inc.)、Shuubham Ojha(Centific Global Solutions Inc., University of Maryland, College Park)、Asif Shaik(Centific Global Solutions Inc.)、Akhil Pothanapalli(Centific Global Solutions Inc.)、Rachuri Lokesh(Centific Global Solutions Inc.)、Abhishek Mukherji(Centific Global Solutions Inc.)、Prasanna Desikan(Centific Global Solutions Inc.) 💡 毒舌点评 这篇论文构建了一个规模可观(46k QA对)且设计精巧的医学音频推理基准,通过对13个前沿模型的系统评测,清晰暴露了当前多模态大模型在医学音频上的显著短板,尤其是言语理解与生理声理解的严重偏科。然而,数据完全依赖合成生成和API调用,使整个基准的价值高度绑定于特定商业模型(Gemini和ElevenLabs)的生成能力,缺乏对“真实”临床音频分布差距的严格验证;且没有开源代码、模型或完整的生成流水线,连自身宣称的“scalable”理念都无法让社区复制,工程诚意严重不足。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 306 words

Multimodal Latent Language Modeling with Next-Token Diffusion

📄 Multimodal Latent Language Modeling with Next-Token Diffusion #语音合成 #多模态模型 6.1/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.1/10 | 前50% | #语音合成 | #自回归模型 | #多模态模型 | arxiv 👥 作者与机构 第一作者: Yutao Sun (Tsinghua University) 通讯作者: Furu Wei (Microsoft Research), Jianyong Wang (Tsinghua University) 作者列表: Yutao Sun (Tsinghua University), Hangbo Bao (Microsoft Research), Wenhui Wang (Microsoft Research), Zhiliang Peng (Microsoft Research), Li Dong (Microsoft Research), Shaohan Huang (Microsoft Research), Yaoyao Chang (未说明), Jianyong Wang (Tsinghua University), Furu Wei (Microsoft Research) 💡 毒舌点评 本文在“一切皆为token”的统一多模态框架上迈出了扎实的一步,用next-token diffusion巧妙绕开了VQ-VAE的信息瓶颈,σ-VAE的方差约束设计也切中自回归生成的exposure bias要害。但ImageNet上的图像生成实验,LatentLM-L(479M, FID 2.24)实际上并未超越同体量的MAR(479M, FID 1.78),论文将其归入非因果类进行对比虽分类合理,但未能提供等计算量对比来证明因果框架自身能弥补这一差距;此外,仅在200B tokens上训练的1.3B多模态LLM远未达到收敛,声称的scaling优势仍需更大规模验证;TTS人类评估仅24人,略显单薄。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 384 words

Multimodal Meta-Verifier with Explicit Structured Recalibration

📄 Multimodal Meta-Verifier with Explicit Structured Recalibration #多模态模型 #强化学习 5.2/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.3/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.2/10 | 后50% | #多模态模型 | #强化学习 | arxiv 👥 作者与机构 第一作者:Xinchen Zhang(清华大学)、Bowei Liu(清华大学) 通讯作者:Yujiu Yang(清华大学)、Ling Yang(普林斯顿大学) 作者列表:Xinchen Zhang(清华大学)、Bowei Liu(清华大学)、Jiale Liu(宾夕法尼亚州立大学)、Chufan Shi(南加州大学)、Yizhen Zhang(清华大学)、Junhong Liu(未说明)、Youliang Zhang(清华大学)、Zhiheng Li(清华大学)、Yujiu Yang(清华大学)、Ling Yang(普林斯顿大学) 💡 毒舌点评 这篇论文的核心洞察——将元验证信号从文本迁移到符号化表征(边界框),并采用数据层面的解耦训练——在工程上是清晰且有效的,在ViVerBench和代理生成任务上的提升也佐证了其价值。然而,论文的理论贡献是对“梯度被乘法门控”这一现象的符号重述,深度有限;更致命的是,它全程回避了与同领域直接竞争对手(如RewardDance、UnifiedReward)在视觉验证基准上的定量比较,使其声称的“避免奖励黑客”和“高效”论点缺乏最关键的硬性证据。对于语音/音频领域读者而言,此工作因完全扎根于图像模态而不具备直接影响力。 📌 核心摘要 该论文旨在解决多模态视觉验证器中反馈信号粗糙(仅依赖二元正确/错误判断)的问题,提出了一种多模态元验证范式,利用验证器自身生成的结构化依据(而非决策信号)来提供更细粒度的训练信号。 方法核心包含两个发现:第一,使用符号化输出(如边界框或点)代替文本解释作为元验证依据,使得能够使用基于规则的奖励(IoU)而非脆弱的模型奖励,从而在源头规避奖励黑客问题,并提升训练效率;第二,将二元判断和元验证任务在数据层面进行解耦,分别服从独立的奖励模型进行强化学习训练,相比联合优化能提供持续、稳定的梯度信号,从而显著提升性能。 与已有工作相比,该方法从DeepSeekMath-V2等纯文本的元验证框架中获得灵感,首次将其系统性地迁移至多模态空间验证,并针对视觉表征结构化的特性,提出了基于规则的结构化奖励与解耦训练策略。 主要实验结果显示:在ViVerBench基准上,经解耦训练的OmniVerifier-M1(基于Qwen3-VL-8B)取得了0.680分,优于联合训练的0.671分和基线的0.654分;基于该验证器构建的代理视觉生成系统M1-TTS,在GPT-Image-1.5基础上,将WISE和T2I-CoreBench上的综合得分分别从0.83提升至0.88和从0.782提升至0.800。 表 1: ViVerBench & 效率分析(来自论文Table 1) ...

2026-07-04 · 更新于 2026-07-27 · 3 min · 441 words

Multiple Choice Learning of Low-Rank Adapters for Language Modeling

📄 Multiple Choice Learning of Low-Rank Adapters for Language Modeling #多模态模型 #大语言模型 8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.7/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8/10 | 前25% | #多模态模型 | #参数高效微调 | #大语言模型 | arxiv 👥 作者与机构 第一作者:Victor Letzelter(LTCI, Télécom Paris, Institut Polytechnique de Paris;Valeo.ai)、Hugo Malard(LTCI, Télécom Paris, Institut Polytechnique de Paris)(同等贡献) 通讯作者:Victor Letzelter(letzelter.victor@hotmail.fr) 作者列表:Victor Letzelter(LTCI, Télécom Paris, Institut Polytechnique de Paris;Valeo.ai)、Hugo Malard(LTCI, Télécom Paris, Institut Polytechnique de Paris)、Mathieu Fontaine(LTCI, Télécom Paris, Institut Polytechnique de Paris)、Gaël Richard(LTCI, Télécom Paris, Institut Polytechnique de Paris)、Slim Essid(LTCI, Télécom Paris, Institut Polytechnique de Paris)、Andrei Bursuc(Valeo.ai)、Patrick Pérez(Kyutai) 💡 毒舌点评 本文巧妙地将 Multiple Choice Learning 与 LoRA 结合,为自回归语言模型的多模态输出提供了参数高效的解决方案。但理论分析建立在苛刻的“组件不重叠”假设上,对真实语言数据中普遍存在的模式重叠问题避而不谈,且缺乏对各个适配器所学语义的深入剖析,使方法的“多样性”仅停留在指标层面,其内部分工机制仍是一个黑箱。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 682 words

Native Active Perception as Reasoning for Omni-Modal Understanding

📄 Native Active Perception as Reasoning for Omni-Modal Understanding #多模态模型 6.8/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | #音视频理解 | #强化学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Zhenghao Xing(香港中文大学)、Ruiyang Xu(上海交通大学)、Yuxuan Wang(阿里巴巴通义千问团队) 通讯作者:Jin Xu(jxu3425@gmail.com)、Pheng-Ann Heng(pheng@cse.cuhk.edu.hk) 完整作者列表:Zhenghao Xing1, Ruiyang Xu2, Yuxuan Wang3, Jinzheng He3, Ziyang Ma2,4, Qize Yang3, Yunfei Chu3, Jin Xu3, Junyang Lin3, Chi-Wing Fu1, Pheng-Ann Heng1 ( 共同一作;1 香港中文大学计算机科学与工程系;2 上海交通大学;3 阿里巴巴通义千问团队,Qwen Team;4 南洋理工大学) 💡 毒舌点评 这篇工作在“让MLLM学会像人一样主动看视频”的agentic范式上做出了优雅且扎实的尝试——将长视频理解重塑为POMDP中的迭代感知过程,并用TAURA解决了GRPO在多轮推理中的信用分配难题,让7B模型在LVBench上正面击败了10倍大的静态模型,这个结果本身具备足够的冲击力。然而,对于语音/音频领域的审稿人而言,这份工作的吸引力会打折扣:论文的核心卖点是交互范式和视频理解效率,音频在这里更像是个“锦上添花”的模态输入,而非被深入研究的感知对象。尽管“全模态”的旗号已经打出,但论文并未在诸如长播客理解、复杂声学场景对话、ASR等纯音频任务上验证方法的迁移性,其“Omni”的宣称尚缺乏来自音频社区的严苛审视。如果投到纯音频会议,这艘船可能因为“货物不对板”而吃水过深。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 367 words

Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation

📄 Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation #音视频语音分离 #语音增强 #多模态模型 6.2/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | #音视频语音分离 | #多模态模型 | #语音增强 | arxiv 👥 作者与机构 第一作者:Xinmeng Xu(岭南大学人工智能系,Department of Artificial Intelligence, Lingnan University) 通讯作者:Haoran Xie(岭南大学人工智能系,Department of Artificial Intelligence, Lingnan University) 作者列表:Xinmeng Xu(岭南大学人工智能系)、Haoran Xie(岭南大学人工智能系)、Xiaohui Tao(南昆士兰大学数学物理与计算学院,School of Mathematics, Physics and Computing, University of Southern Queensland)、Lin Li(武汉理工大学计算机科学与人工智能学院,School of Computer Science and Artificial Intelligence, Wuhan University of Technology)、S. Joe Qin(岭南大学人工智能系) 💡 毒舌点评 这篇论文从认知神经科学中搬来“听觉选择”和“跨模态补偿”的双阶段机制,并在AVSS架构中将其显式化为ASM和CCM模块,想法干净且有洞察力。在LRS2/3和VoxCeleb2上以6.3M的参数稳定超越包括AV-CrossNet在内的现有SOTA,且多说话人重叠和视觉降质下的表现更加突出。然而,致命伤是完全闭源:无代码、无模型、无Demo链接,这在2024年后的ML顶会中极度罕见且难以接受。此外,Section 3.1的信息论不等式与模块设计之间存在一条明晃晃的鸿沟:Eq. 2中的β项从未在损失函数中出现过,其“理论指导设计”的说法本质上是一种后验包装。总体而言,这是一篇工程扎实但理论过度声称、且因闭源而严重削弱影响力的工作。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 662 words

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

📄 OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models #音视频理解 #模型压缩 #多模态模型 #高效推理 6.3/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.3/10 | 前50% | #音视频理解 | #模型压缩 | #多模态模型 #高效推理 | arxiv 👥 作者与机构 第一作者:Zining Wang(北京航空航天大学计算机科学与工程学院,复杂与关键软件环境国家重点实验室) 通讯作者:Xianglong Liu(北京航空航天大学计算机科学与工程学院,复杂与关键软件环境国家重点实验室) 其他作者:Zhihang Yuan(北京大学)、Yingjie Zhai(华为技术有限公司)、Wenshuo Li(华为技术有限公司)、Han Shu(华为技术有限公司)、Ruihao Gong(复杂与关键软件环境国家重点实验室)、Jinyang Guo(北京航空航天大学计算机科学与工程学院/人工智能学院,复杂与关键软件环境国家重点实验室) 💡 毒舌点评 这篇论文的动机分析(层间异质性和跨模态锚点驱动)是一次漂亮的现象学观察,作者花了大力气证明“为什么”需要层自适应和跨模态对齐。但坦白说,方法论上更像一个“证件照”:SVD、DPC-KNN、余弦相似度这套组合拳看起来体面,深究下去却没有真正的新算法原理。核心卖点“training-free”既是铠甲也是软肋——轻量化部署确实友好,但也意味着它永远只能做“事后诸葛亮”,无法改变模型自身对冗余信息的处理逻辑。实验覆盖面广是优点,但依然缺少对深层why的拷问:为什么基于静态编码器输出的余弦相似度,能成为深层复杂语义交互的良好代理?这篇工作给了一个“够用”的解释,但离“令人信服”还有距离。 ...

2026-07-04 · 更新于 2026-07-27 · 3 min · 466 words