ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

Is Semantics Enough for Speech Mean Opinion Score Prediction?

📄 语义听得懂内容,声学才听得出破绽:MOS 预测的双耳之争 英文题目:Is Semantics Enough for Speech Mean Opinion Score Prediction? 一句话:论文把语义自监督、纯声学编解码与语义声学统一编解码放在同一冻结与微调探针下比较,证明匹配语言下协同表征上界更高而跨语言时连续语义更稳,代价是公平性与机理证据仍不完整。 标签:#语音质量评估 | #自监督学习 | #语音合成 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Tianyu Lan:机构信息未在 arXiv HTML 中可靠披露 Yufei Shi:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Honghao Sun:机构信息未在 arXiv HTML 中可靠披露 Huipeng Du:机构信息未在 arXiv HTML 中可靠披露 Zhenhua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语义主导的自监督学习与声学重建的神经音频编解码器放在同一冻结探针下硬碰硬,问题切得准。短板在于所谓统一表征几乎全是借用现成 XCodec 与 SpeechTokenizer 的封装对比,缺少对语义声学解耦的因果验证,跨语言反转也解释得过于仓促。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 870 words

SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training

📄 抹掉谁在说话,才能听清他什么心情 英文题目:SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training 一句话:针对跨说话人情感泛化难的问题,SISER 用 wav2vec 2.0 做表示、用 ECAPA-TDNN 做强判别器并以熵最大化逼均匀后验,在 IEMOCAP 上取得测试 UA 60.63%,代价是仅单语料验证且部分折出现退化。 标签:#语音情感识别 | #对抗训练 | #说话人验证 | #自监督学习 评分:6.5/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Eunseo Choi:机构信息未在 arXiv HTML 中可靠披露 Hyunku Kang:机构信息未在 arXiv HTML 中可靠披露 Chanwoo Kim:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把说话人验证领域的强判别器拿来做对抗压力源的想法直观有效,消融也确实指向判别器容量是关键变量。硬伤是全文证据锁死在 IEMOCAP 单语料上,且验证集与测试集口径、前后文数字多处打架,让所谓说话人不变更像特定划分下的拟合红利而非可外推结论。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 917 words

The 2026 PNPL Competition: Word Classification and Efficient Cross-Subject Generalisation in LibriBrain100

📄 八十小时练一人,十分钟认新人:词分类竞赛把跨被试泛化变成硬指标 英文题目:The 2026 PNPL Competition: Word Classification and Efficient Cross-Subject Generalisation in LibriBrain100 一句话:论文以 LibriBrain100 的约 80 小时单被试深度与 32 人广度为底,用固定 50 词加 Moses 50 加 OVMI 三重评估组织深广双赛道,深度基线 BAcc@10 达 73.23% 而广度仅 42.96% 且 OVMI 低至 0.014,证明分钟级跨被试仍是最大鸿沟。 标签:#语音识别 | #自监督学习 | #低资源 | #基准测试 评分:7.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Francesco Mantegna:PNPL, Department of Engineering Science, University of Oxford, UK Gereon Elvers:PNPL, Department of Engineering Science, University of Oxford, UK Dulhan Jayalath:PNPL, Department of Engineering Science, University of Oxford, UK Gilad Landau:PNPL, Department of Engineering Science, University of Oxford, UK Tasha Kim:PNPL, Department of Engineering Science, University of Oxford, UK Miran Özdogan:PNPL, Department of Engineering Science, University of Oxford, UK Luisa Kurth:PNPL, Department of Engineering Science, University of Oxford, UK Teyun Kwon:PNPL, Department of Engineering Science, University of Oxford, UK SungJun Cho:PNPL, Department of Engineering Science, University of Oxford, UK;OHBA, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK Benjamin Ballyk:PNPL, Department of Engineering Science, University of Oxford, UK Alex Fung:PNPL, Department of Engineering Science, University of Oxford, UK;FMRIB, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK Anna Greer:PNPL, Department of Engineering Science, University of Oxford, UK Pratik Somaiya:PNPL, Department of Engineering Science, University of Oxford, UK Christian Herff:Maastricht University, The Netherlands Yorguin Mantilla Ramos:UNIQUE, Université de Montréal, Canada Hamza Abdelhedi:UNIQUE, Université de Montréal, Canada Karim Jerbi:UNIQUE, Université de Montréal, Canada;Mila–Quebec AI Institute, Canada Greg Farquhar:Google DeepMind, UKJoint first authors Brendan Shillingford:Google DeepMind, UKJoint first authors Mark Woolrich:OHBA, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK Oiwi Parker Jones:PNPL, Department of Engineering Science, University of Oxford, UK 💬 毒舌点评 把非侵入语音解码从单被试刷分拉向临床最痛的跨被试少样本与零样本,课程设计与双轨评估颇有野心。短板是全篇零新模型,两个参考模型均为旧工作复用,宽松的 Top-10 指标叠加功能词为主的词表让绝对分数虚胖,OVMI 揭开后通信价值几乎归零。 ...

2026-09-04 · 更新于 2026-09-04 · 7 min · 1491 words

Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models

📄 复述一句就能听出你来过:微调语音如何记住嗓音与录音 英文题目:Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models 一句话:论文把双条件查询与变长波形比较形式化为可评分范围与记忆诱发两条准则,用朗读查询加声纹与多层 WavLM 加动态规整的解耦表征实现说话人与记录两级审计,在三模型两数据集上达到 0.80 以上 AUC 而代价是记录级需影子模型与十次重复查询。 标签:#语音合成 | #生成模型 | #说话人验证 | #自监督学习 评分:7.5/10 | 创新 1.7/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kunlin Cai:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Kaiyuan Zhang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Zihang Xiang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Jinghuai Zhang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Abeer Alwan:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Fnu Suya:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Yuan Tian:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. 💬 毒舌点评 把文本加参考语音双条件查询空间形式化并用可评分范围与记忆诱发解释朗读查询最强,表征上说话人级走全局声纹、记录级走多层帧特征加动态时间规整的解耦切中语音变长连续痛点。短板是记录级依赖同架构影子模型训练的轻量长短期记忆网络判别器,跨架构迁移未验证,防御评估停留在早停、输入扰动和差分隐私随机梯度下降的粗粒度尝试。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 1026 words

Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer's Disease Detection

📄 越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索 英文题目:Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer’s Disease Detection 一句话:论文以 Pitt 语料家族为对照场,证明去噪与策展虽能抬高同域分数,却因分布偏移削弱跨域鲁棒性,即使训练与测试同增强或引入大音频语言模型也难以挽回。 标签:#音频分类 | #自监督学习 | #基准测试 | #鲁棒性 评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Luqi Sun:Center for Language and Speech Processing (CLSP), Johns Hopkins University Shreeram Suresh Chandra:机构信息未在 arXiv HTML 中可靠披露 Lin Zhang:机构信息未在 arXiv HTML 中可靠披露 You-Jin Li:Research Center for Information Technology Innovation, Academia Sinica Brian MacWhinney:University of Michigan, Ann Arbor Yu Tsao:Research Center for Information Technology Innovation, Academia Sinica Emily Mower Provost:Carnegie Mellon University Berrak Sisman:Center for Language and Speech Processing (CLSP), Johns Hopkins University 💬 毒舌点评 贡献在于把 Pitt 家族“越干净越好”的集体无意识拽到台前,用同域/跨域与匹配/失配增强的四重对照证明去噪带来的分布偏移代价,对长期把 ADReSS 当即插即用基准的社区是一记必要的警钟。缺陷也同样直白:全部跨域结论压在仅 56 例的 English Lu Corpus 这一根独苗上,原始 Pitt/Pitt/ADReSS/ADReSSo 的增强管线均未公开却用 5 种现代增强器做代理归因,对“干净为何更差”仅靠 DNSMOS 的 BAK 抬升与单例 Mel 谱图定性描述,未能量化停顿、迟疑、词汇贫乏等病理标志究竟被何种伪影抹平。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1407 words

Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution

📄 听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验 英文题目:Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution 一句话:为检验被动指纹是否真的持久可复现且与内容无关,论文用 PIPDP 三探针把指纹按人耳可感知性拆开,证明在保持听感透明时位深抖动仍能让溯源准确率下降 48.2%,而改情感只带来约 1.00% 的波动,代价是结论仍受限于 10 类闭集与代理透明度阈值。 标签:#语音伪造检测 | #自监督学习 | #鲁棒性 | #可解释性 评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yupei Li:机构信息未在 arXiv HTML 中可靠披露 Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露 Emmanouil Benetos:机构信息未在 arXiv HTML 中可靠披露 Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露 Björn Schuller:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于首次把被动指纹(passive fingerprint)按人耳可感知性拆分为可感知与不可感知两类,并用可控扰动与情感提示做了可验证的诊断,视角比单纯测鲁棒性更贴近取证可靠性。短板是核心结论高度依赖闭集 10 分类与 DNSMOS / STOI 代理的可感知阈值,且扰动与情感实验的统计与跨检测器一致性论证不足,难以支撑“不可感知指纹更可信”的强泛化宣称。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1582 words

Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment

📄 没有配对报告时,如何让呼吸声自己找到临床语义? 英文题目:Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment 一句话:REACH 用 GPT-4 把离散元数据蒸馏为结构化报告来锚定冻结的 MedSigLIP 文本空间,并以 Sigmoid 对比损失加掩码重建与第 10 远负采样对齐呼吸音编码器,在 9 任务上实现 61.3% 零样本 AUC 的同时把线性探测推至 71.6%,代价是细粒度分级仍近随机且依赖合成文本的措辞稳定性。 标签:#音频分类 | #对比学习 | #自监督学习 | #多模态模型 评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mustafa Talha İlerisoy:机构信息未在 arXiv HTML 中可靠披露 Hung Manh Pham:机构信息未在 arXiv HTML 中可靠披露 Mathias Funk:机构信息未在 arXiv HTML 中可靠披露 Mykola Pechenizkiy:机构信息未在 arXiv HTML 中可靠披露 Aaqib Saeed:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用冻结的 MedSigLIP 文本空间作锚点、以 GPT-4 把离散元数据蒸馏为 2-3 行标准化报告来填补呼吸音音频-报告配对真空,并用 SigLIP 损失加掩码重建正则与 FAISS 第 10 远负采样来防止对齐崩塌,思路干净且在 9 任务上把零样本从通用模型的 51% 拉到 61% 可用区间。短板是所谓零样本高度依赖合成报告的措辞与 prompt 模板,相似度采样与温度等关键超参不透明,且 T3 Covid 咳嗽 51.3% 与 T9 五级 COPD 分级 52.1% 仍近随机,平均数掩盖了细粒度任务的失效,宣称的通用临床零样本能力被高估。 ...

2026-09-02 · 更新于 2026-09-04 · 6 min · 1252 words

Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection

📄 类型未知时如何判真假:用两套耳朵听同一段音频 英文题目:Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection 一句话:面对语音、环境声、歌声、音乐四类混合且类型未知的真假判别,论文用 EAT-large 与 XLS-R-300M 的双域互补融合构建统一决策边界,并在评测集上以 95.58% Macro-F1 取得第二,代价是依赖封闭挑战集且未开源复现细节。 标签:#音频伪造检测 #自监督学习 #模型融合 评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Cunhang Fan:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Junqin Cao:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Tian Gao:Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta, Hefei, Anhui, China Zhipeng Xie:Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta, Hefei, Anhui, China Jun Xue:Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, Wuhan, Hubei, China Zhao Lv:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Xin Fang:University of Science and Technology of China, Hefei, Anhui, China 💬 毒舌点评 用 EAT-large 管宽带声学事件、XLS-R-300M 管波形与语音细节的双域分工思路清晰,token 维拼接规避帧对齐、让注意力在统一池中自适应选线索的做法务实,保守的双重门控语音精炼也确实避免了硬路由的类型误判雪崩。但本质仍是 24 层加权求和加拼接再池化的常规融合,对伪造机理没有新假设与新约束,挑战集第二名的成绩建立在闭源、固定阈值 0.5、无显著性检验和仅在 AT-ADD 内验证的封闭环境下,可迁移性与开放域稳健性论证单薄。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1461 words

CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations

📄 用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型 英文题目:CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations 一句话:针对对比学习全局强局部弱、JEPA 局部强却依赖 EMA 且易坍缩的矛盾,CoJEPA 用同一 ViT-1D 主干在类别令牌上做对比、在序列令牌上做掩码潜预测,以对比梯度替代 EMA 实现稳定,并在 7 个音乐任务上尤其以调性与和声取得显著增益,代价是深层谐波信息衰退与私有数据限制复现。 标签:#音乐理解 #自监督学习 #对比学习 #Transformer #音乐检索 评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Gabriel Meseguer-Brocal:机构信息未在 arXiv HTML 中可靠披露 Yuexuan Kong:机构信息未在 arXiv HTML 中可靠披露 Romain Hennequin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用对比学习梯度直接替代联合嵌入预测架构的指数移动平均教师,单主干在类别令牌与序列令牌上分工施加全局对比与局部潜空间预测,7.1M 参数在调性与和声任务上逼近 330M 的 MusicFM,思路干净且有效。短板是预训练依赖未公开的 22M 私有曲库且无代码权重,掩码比例在方法章与训练章表述矛盾,层间性能波动大却缺乏对预测器深度与损失权重的消融,稳定性声明缺少损失曲线与坍缩度量支撑。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1263 words