ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback

📄 同样是二倍速,为何有人觉得高效、有人只想跳过 英文题目:CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback 一句话:倍速下的感知质量由速度与内容时间密度共同决定,论文用时间信息量、每分钟词数、每分钟节拍数分别刻画视频、语音、音乐的可跟随压力并以指数族加线性融合预测平均意见分,在受控小样本上取得高相关,但语义与个性化仍在模型之外。 标签:#音频质量评估 | #多模态模型 | #语音质量评估 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jiarun Song:机构信息未在 arXiv HTML 中可靠披露 Yuxin Song:机构信息未在 arXiv HTML 中可靠披露 Fuzheng Yang:机构信息未在 arXiv HTML 中可靠披露 Weisi Lin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把倍速下“想高效看还是想跳过”的模糊意图转成可计算的跨模态感知质量,有产品嗅觉;但全篇仍是小样本主观分拟合的指数曲线加线性融合,泛化证据和统计完备性撑不起个性化推荐的大叙事。 📌 核心摘要 本文研究在线音视频倍速播放下的感知质量退化,核心观察是同一速度对不同内容可对应高效观看与选择性跳过两种相反意图。作者提出内容自适应模型 Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback (CAPQ-FAST),以播放速度 \(S\) 结合模态内时间密度预测平均意见分 Mean Opinion Score (MOS)意义下的质量:视频用时间信息量 Temporal Information (TI),语音用每分钟词数 Words Per Minute (WPM),音乐用每分钟节拍数 Beats Per Minute (BPM),再经音视频融合得到整体质量 \(Q\)。验证显示融合模型在语音视频和音乐视频上 Pearson Correlation Coefficient (PCC)达 0.976 和 0.968,优于不区分内容的同族基线。应用上用于播放速度推荐、自适应播放控制和意图粗粒度解释。局限是 72 名 22岁至28岁大学生被试、内容与语义覆盖有限,TI、WPM、BPM 只刻画时间密度而非语义重要性,外推到真实平台行为需谨慎。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 775 words

Last Translation Benchmark

📄 不再打总分:给每道翻译难题配一把专用量尺 英文题目:Last Translation Benchmark 一句话:面对饱和的机器翻译基准与失灵的整体打分,这项工作用众包难例加逐题验证规则把评价变成可复现的通过率,最强模型仅约四成通过而人工接近满分,代价是样本偏向刻意难题与英文中心。 标签:#语音翻译 | #大语言模型 | #多语言 | #基准测试 | #多模态模型 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Vilém Zouhar:机构信息未在 arXiv HTML 中可靠披露 Niyati Bafna:机构信息未在 arXiv HTML 中可靠披露 Mukund Choudhary:机构信息未在 arXiv HTML 中可靠披露 Maike Züfle:机构信息未在 arXiv HTML 中可靠披露 Sara Rajaee:机构信息未在 arXiv HTML 中可靠披露 Pinzhen Chen:机构信息未在 arXiv HTML 中可靠披露 Jannis Vamvas:机构信息未在 arXiv HTML 中可靠披露 Sara Papi:机构信息未在 arXiv HTML 中可靠披露 Ona de Gibert:机构信息未在 arXiv HTML 中可靠披露 Bhavitvya Malik:机构信息未在 arXiv HTML 中可靠披露 Eliya Habba:机构信息未在 arXiv HTML 中可靠披露 Orfeas Menis Mastromichalakis:机构信息未在 arXiv HTML 中可靠披露 Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露 Michelle Wastl:机构信息未在 arXiv HTML 中可靠披露 Sheriff Issaka:机构信息未在 arXiv HTML 中可靠披露 Leshem Choshen:机构信息未在 arXiv HTML 中可靠披露 Stella Biderman:机构信息未在 arXiv HTML 中可靠披露 Antonis Anastasopoulos:机构信息未在 arXiv HTML 中可靠披露 Jan Niehues:机构信息未在 arXiv HTML 中可靠披露 Rico Sennrich:机构信息未在 arXiv HTML 中可靠披露 Mrinmaya Sachan:机构信息未在 arXiv HTML 中可靠披露 Ondřej Bojar:机构信息未在 arXiv HTML 中可靠披露 Kenton Murray:机构信息未在 arXiv HTML 中可靠披露 Jörg Tiedemann:机构信息未在 arXiv HTML 中可靠披露 Alham Fikri Aji:机构信息未在 arXiv HTML 中可靠披露 Philipp Koehn:机构信息未在 arXiv HTML 中可靠披露 Christof Monz:机构信息未在 arXiv HTML 中可靠披露 Alexandra Birch:机构信息未在 arXiv HTML 中可靠披露 Sowmya Vajjala:机构信息未在 arXiv HTML 中可靠披露 Chalamalasetti Kranti:机构信息未在 arXiv HTML 中可靠披露 Cristina España-Bonet:机构信息未在 arXiv HTML 中可靠披露 Nobin Sarwar:机构信息未在 arXiv HTML 中可靠披露 David Kaczér:机构信息未在 arXiv HTML 中可靠披露 Shunta Asano:机构信息未在 arXiv HTML 中可靠披露 Malik Marmonier:机构信息未在 arXiv HTML 中可靠披露 Daban Q. Jaff:机构信息未在 arXiv HTML 中可靠披露 Vaisakhi Mishra:机构信息未在 arXiv HTML 中可靠披露 Hend Al- Khalifa:机构信息未在 arXiv HTML 中可靠披露 Gabriele Sarti:机构信息未在 arXiv HTML 中可靠披露 Sourajit Saha:机构信息未在 arXiv HTML 中可靠披露 Nils Rehlinger:机构信息未在 arXiv HTML 中可靠披露 Juan Daniel Cuervo Villa:机构信息未在 arXiv HTML 中可靠披露 Jonathan Tonglet:机构信息未在 arXiv HTML 中可靠披露 Saugata Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Dominik Macháček:机构信息未在 arXiv HTML 中可靠披露 Jagannathan Ramanujam:机构信息未在 arXiv HTML 中可靠披露 Heejin Do:机构信息未在 arXiv HTML 中可靠披露 Zuzana Nadova:机构信息未在 arXiv HTML 中可靠披露 Fred Philippy:机构信息未在 arXiv HTML 中可靠披露 Fabian Retkowski:机构信息未在 arXiv HTML 中可靠披露 Maria Lymperaiou:机构信息未在 arXiv HTML 中可靠披露 Silvia Casola:机构信息未在 arXiv HTML 中可靠披露 Hanna Yukhymenko:机构信息未在 arXiv HTML 中可靠披露 Shubhashis Roy Dipta:机构信息未在 arXiv HTML 中可靠披露 Sangwon Ryu:机构信息未在 arXiv HTML 中可靠披露 Andrés Jerez:机构信息未在 arXiv HTML 中可靠披露 Ron Keinan:机构信息未在 arXiv HTML 中可靠披露 Shuaib Shuaib Yusuf:机构信息未在 arXiv HTML 中可靠披露 Avantica Vempati:机构信息未在 arXiv HTML 中可靠披露 Maria Carmen Staiano:机构信息未在 arXiv HTML 中可靠披露 Sukannya Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Adrian Cosma:机构信息未在 arXiv HTML 中可靠披露 Vitalii Babenko:机构信息未在 arXiv HTML 中可靠披露 Erivan Inan:机构信息未在 arXiv HTML 中可靠披露 Aviral Nigam:机构信息未在 arXiv HTML 中可靠披露 Wafa Aissa:机构信息未在 arXiv HTML 中可靠披露 Fatima Haouari:机构信息未在 arXiv HTML 中可靠披露 Venkata Prasanth Kumar Gummadi:机构信息未在 arXiv HTML 中可靠披露 Mehdi Jafarzadeh:机构信息未在 arXiv HTML 中可靠披露 Valentin Scourneau:机构信息未在 arXiv HTML 中可靠披露 Lukas Edman:机构信息未在 arXiv HTML 中可靠披露 Kaiser Sun:机构信息未在 arXiv HTML 中可靠披露 Shaomu Tan:机构信息未在 arXiv HTML 中可靠披露 Mohammad Sadegh Gholizadeh:机构信息未在 arXiv HTML 中可靠披露 Johannes-Rudolf David:机构信息未在 arXiv HTML 中可靠披露 Dipankar Srirag:机构信息未在 arXiv HTML 中可靠披露 Javier García Gilabert:机构信息未在 arXiv HTML 中可靠披露 Ruta Binkyte:机构信息未在 arXiv HTML 中可靠披露 Manar Ali:机构信息未在 arXiv HTML 中可靠披露 Ana-Maria Bucur:机构信息未在 arXiv HTML 中可靠披露 Sabry E. Farrag:机构信息未在 arXiv HTML 中可靠披露 Youssef Saber:机构信息未在 arXiv HTML 中可靠披露 Yihong Liu:机构信息未在 arXiv HTML 中可靠披露 Jean Maillard:机构信息未在 arXiv HTML 中可靠披露 Cojocaru Nicoleta:机构信息未在 arXiv HTML 中可靠披露 Xiaochuang Yuan:机构信息未在 arXiv HTML 中可靠披露 Sina Ahmadi:机构信息未在 arXiv HTML 中可靠披露 Philipp Mondorf:机构信息未在 arXiv HTML 中可靠披露 Kaustubh Dhole:机构信息未在 arXiv HTML 中可靠披露 Roman Wixinger:机构信息未在 arXiv HTML 中可靠披露 Shenbin Qian:机构信息未在 arXiv HTML 中可靠披露 Manuel Tuor:机构信息未在 arXiv HTML 中可靠披露 Sergey Troshin:机构信息未在 arXiv HTML 中可靠披露 Jonathan Yahav:机构信息未在 arXiv HTML 中可靠披露 Fida Mohammad Thoker:机构信息未在 arXiv HTML 中可靠披露 Amir Arsalan Rezapour:机构信息未在 arXiv HTML 中可靠披露 Lance Calvin Lim Gamboa:机构信息未在 arXiv HTML 中可靠披露 Manon Reusens:机构信息未在 arXiv HTML 中可靠披露 Kätriin Kukk:机构信息未在 arXiv HTML 中可靠披露 Koel Dutta Chowdhury:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把评价从整体印象分改为单样本可判定验证规则,用信息不对称缓解大语言模型(Large Language Model,LLM)既当选手又当裁判的自利偏差,思路干净且可诊断。短板是众包难例天然偏向猎奇、对抗与英文中心分布,对日常翻译质量代表性不足,规则质量与跨语言可比性仍高度依赖人工复核,迁移主张偏强。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1031 words

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

📄 暖启动之后,基座模型还记得什么:用隐状态几何找回被遗忘的人名 英文题目:Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions 一句话:针对暖启动语音大模型对命名实体等多词元词的系统性误识,论文用语音模型与自身基座模型的层间角度与幅度几何做门控,只在约 10% 高语义依赖位置做束搜索与概率插值,以约 1.4 倍贪心代价恢复束搜索 96.4% 命名实体增益并在两遍纠错中把平均命名实体错误率从 18.29% 降到 17.69% 且总体词错误率不恶化。 标签:#语音识别 | #多模态模型 | #参数高效微调 | #鲁棒性 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chan-Jan Hsu:机构信息未在 arXiv HTML 中可靠披露 Jaeyeon Kim:机构信息未在 arXiv HTML 中可靠披露 Chao-Han Huck Yang:NVIDIA Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露 Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露 Carlos Busso:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把适配后残留的基座大语言模型变成免费校正器,用跨模型隐状态几何做门控,避免全局融合的幻觉灾难,想法干净。短板是所谓自校正高度依赖在 YODAS 上拟合的高斯门限与延续词元规则,换模型换领域就要重标定,完整端到端只验了一个 Phi-4-Multimodal,离通用解码器还差一口气。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 937 words

ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection

📄 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection 一句话:针对一段音频里真伪线索并存的混合伪造问题,ToolDF 让音频大模型做分诊编排而非直接判真假,在复合测试上拿到 81.89 的复合平均分,代价是性能仍受分离器和专家检测器上限牵制。 标签:#音频伪造检测 | #多模态模型 | #参数高效微调 | #基准测试 评分:8.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Taewoo Kim:Multi-Modal Research Center, KETI, South Korea;Department of Artificial Intelligence, Korea University, South Korea Young Han Lee:Multi-Modal Research Center, KETI, South Korea Nam In Park:机构信息未在 arXiv HTML 中可靠披露 Chanwoo Kim:Department of Artificial Intelligence, Korea University, South Korea 💬 毒舌点评 把混合真伪检测从整段二分类改写为可解析的编排推理,用监督轨迹把分离与分诊决策学了出来,思路干净。短板是整套裁决仍被外挂分离器和四个专家上限锁死,工具错则编排再漂亮也只是把错误解释得很清楚。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 815 words

语音/音乐/音频论文速递 2026-09-04

语音/音乐/音频论文速递 2026-09-04 共分析 30 篇论文 ⚡ 今日概览 ✅ 筛选入选 30 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音增强 5 篇 █████ #语音合成 3 篇 ███ #语音交互 2 篇 ██ #语音质量评估 2 篇 ██ #声源定位 1 篇 █ #语音情感识别 1 篇 █ #语音编码 1 篇 █ 📊 论文评分排行榜(30 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ToolDF: Tool-Integrated Reasoning for Mixed… 8.4 前25% 方法研究 #音频伪造检测 🥈 Geometric Ceilings on Time-Frequency Masking for… 7.9 前25% 理论研究 #音乐源分离 🥉 CRAW: Codec Robust Audio Watermarking 7.7 前25% 方法研究 #音频水印 4. The 2026 PNPL Competition: Word Classification and… 7.5 前25% 数据集与基准 #语音识别 5. Test-time adaptation for speech enhancement with an… 7.5 前25% 方法研究 #语音增强 6. Alignment-Free Text-Audiobox for Voice Dubbing and… 7.5 前25% 系统技术报告 #语音合成 7. Listen to the Latents: Self-Correcting Speech… 7.2 前50% 方法研究 #语音识别 8. StreamWSR: Streamable and Lightweight Waveform-Domain… 7.2 前50% 方法研究 #语音增强 9. DuplexSpeechBench-IFEval: Evaluating Implicit… 7.2 前50% 数据集与基准 #语音交互 10. Building and Evaluating Fixed-Voice Thai TTS from… 7.2 前50% 系统技术报告 #语音合成 11. PACodec: A Low-bitrate Neural Speech Codec with… 7.1 前50% 方法研究 #语音编码 12. Decoupling Turn-Taking from Semantics: A Decoupled… 7.0 前50% 方法研究 #语音交互 13. Summary of the ChinaVoices Challenge 2026: Data, Tasks… 6.9 前50% 数据集与基准 #语音识别 14. The Attention Triangle in Audio-Video Models 6.9 前50% 方法研究 #音视频生成 15. Compressing Streaming Neural Audio Encoders via Latent… 6.9 前50% 方法研究 #语音识别 16. Dual-Form ASR: Semantics-Aware Inverse Text… 6.8 前50% 方法研究 #语音识别 17. Deep Neural Compression for RIR-Characterized Acoustic… 6.6 前50% 方法研究 #音频编码 18. SISER: Speaker-Invariant Speech Emotion Recognition… 6.5 前50% 方法研究 #语音情感识别 19. Masked Autoregressive Speech Enhancement with… 6.4 前50% 方法研究 #语音增强 20. Last Translation Benchmark 6.4 前50% 数据集与基准 #语音翻译 21. Neural Music Enhancement with Dual Time-Frequency… 6.2 前50% 方法研究 #语音增强 22. CAPQ-FAST: Content-Adaptive Perceived Quality… 6.2 前50% 应用研究 #音频质量评估 23. Beyond .WAV: Design and Software Verification of… 6.1 前50% 系统技术报告 #语音质量评估 24. Broadband Acoustic Intensity Direction Estimation with… 6.1 前50% 方法研究 #声源定位 25. Local Chord Corruption Is Not Recognizer Replay: Chord… 6.1 前50% 方法研究 #音乐生成 26. VoxReason: Listener-Free Evaluation of Source-Grounded… 5.9 前50% 数据集与基准 #语音合成 27. Is Semantics Enough for Speech Mean Opinion Score… 5.9 前50% 方法研究 #语音质量评估 28. Fairness Evaluation of Edge-AI Implementation for… 5.6 前50% 应用研究 #语音识别 29. StrixAE: An Intelligent Agent for Audio Enhancement… 5.5 前50% 系统技术报告 #语音增强 30. Opening mind by opening architecture: analysis… 4.5 后 50% 系统技术报告 #音频生成 📋 论文列表 🥇 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection ...

2026-09-04 · 更新于 2026-09-04 · 26 min · 5367 words

Auditory Illusion Benchmark for Large Audio Language Models

📄 听错了才是听懂了?当大音频模型遇上人类幻听 英文题目:Auditory Illusion Benchmark for Large Audio Language Models 一句话:论文把十种听觉错觉做成可对照人类听感的选择题来考大音频模型,发现最像人的模型也只有人类一半的易感度,而像人与忠于物理信号之间至今没有模型能兼得,代价是提示词稍改结果就大变。 标签:#音频理解 | #多模态模型 | #基准测试 | #模型评估 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Hayoon Kim:机构信息未在 arXiv HTML 中可靠披露 Eunice Hong:机构信息未在 arXiv HTML 中可靠披露 Kyogu Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把听觉错觉从演示视频变成可跑分、可对照人类分布的基准,这个选题确实抓住了音频评测的盲区。问题是人类基线只靠20名绝对音感听者撑场面,控制准确率又普遍在随机线附近晃悠,所谓最像人的模型更像蒙对了选项而非真听错了。 📌 核心摘要 人类听觉会系统性偏离物理信号,而现有大型音频语言模型评测多围绕转录、分类、检索等客观真值任务,缺乏对主观错觉的系统检验。本文提出首个听觉错觉基准 Auditory Illusion Benchmark,覆盖音乐、声音、语音三大内容域的10种代表性错觉,并按主导机制划分为物理型与物理加知识型,同时配套错觉刺激与匹配控制刺激和人类听觉实验。方法核心是将每种错觉转化为二选一或三选一感知判断题,以人类多数投票定义错觉标签,并用人类相似准确率、现实符合率与错觉易感指数刻画模型位置。与已有视觉错觉基准相比,新意在于面向音频的参数化生成管线与人类同题对照协议,以及对自下而上声学与自上而下先验的分离讨论。关键结果是最佳模型平均错觉易感指数仅约0.455,远低于人类参照的1.0,且高易感常伴随低于随机水平的控制准确率,提示偏差多于感知;知识驱动错觉上多个模型由信号忠实反转为类人易感,提示对齐可能来自语言先验而非共享低层听觉处理。实际意义是为认知对齐提供独立于识别精度的诊断维度,可用于区分字面检测器与类人感知者,并明确高易感在交互场景与安全精密场景下的不同可取性。主要局限是人类样本特殊、合成刺激与自然经验有差距、指令措辞可带来超过模型间差异的波动,外推到一般听众与真实场景时需谨慎。 🔗 开源与复现资源 代码:https://github.com/gillosae/aib 模型权重:论文中未提及 数据集:AIB基准数据集,包含10种听觉错觉,共10385个错觉刺激和4444个对照刺激,总计14829个样本,另有包含1032个错觉刺激和534个对照刺激的mini子集,总计1566个样本,获取链接为 https://github.com/gillosae/aib Demo:论文中未提及 复现材料:论文提及提供用于系统生成基准错觉的开源实现以及通过受控听觉实验构建的人类基线数据,获取方式为访问 https://github.com/gillosae/aib,论文证据中未提及训练配置与检查点细节 论文中引用的开源项目:评估中提及 Pengi、Voxtral-Mini、MuLLaMa、Kimi-Audio-Instruct、Audio Flamingo 3、Fun-Audio-Chat、Qwen-Audio-Chat、Qwen2-Audio-Instruct、GLM-4-Voice、Gemini 3.1 Pro,论文证据中未给出上述项目的HTTPS链接 资源可达性验证:code=temporarily_unreachable;dataset=temporarily_unreachable;reproduction=temporarily_unreachable 🧭 深度解读 耳朵为什么总在骗大脑? 想象你在琴房里听老师弹了一个低音,你发誓听到了那个浑厚的根音,可频谱仪却告诉你那个频率根本没有发出。这不是你走神,而是听觉系统在主动补全。人类听声音从来不是麦克风式的忠实录音,大脑会用谐波关系、掩蔽记忆、节奏预期和语言知识去猜测世界,这种猜测大多数时候高效,偶尔就会系统性跑偏,形成听觉错觉。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 550 words

AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking

📄 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking 一句话:口语对话状态跟踪中实体误识会跨轮污染累积状态,AVERT 冻结基座与文本编辑器、只训练一个音频验证器对候选值打分再做投票补全替换,在 SpokenWOZ 上从 38.34 提升到 40.13 联合准确率,代价是双解码器与字面佐证覆盖有限。 标签:#语音识别 | #多模态模型 | #参数高效微调 评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5 👥 作者与机构 Chunggi Lee:Harvard University;Cambridge, Massachusetts, USA Hanspeter Pfister:Harvard University;Cambridge, Massachusetts, USA 💬 毒舌点评 把音频从生成器降级为验尸官是聪明的偷懒,用两倍解码器参数换取长对话稳定性也算诚实交易;可惜字面首词匹配的门控把近八成错误直接判了死刑,验证器那点增益更像给跨轮投票打了一针弱效强心剂。 📌 核心摘要 口语对话状态跟踪需要从含噪语音中恢复累积槽值状态,实体名与数字的识别错误会在多轮中持续污染后续预测。AVERT保持基座语音模型与文本编辑器冻结,新增音频条件验证器对已形成候选值逐个打分,再与跨轮加权一致性及词面佐证门控结合。投票、补全与替换三个算子分别处理不一致、遗漏和音频不支持三类可恢复错误,且每个算子仅在开发集选定的槽子集上启用。在SpokenWOZ因果评测下,管线从基座的33.04联合目标准确率提升到编辑器的38.34,再到AVERT的40.13,超过读取完整语音历史的1B对照系统的39.32。该设计使音频上下文不随轮数增长,相对增益随对话变长而放大。局限在于字面佐证覆盖率低、仅验证1B主干且槽选择依赖目标域开发集。 🔗 开源与复现资源 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:SpokenWOZ测试集用于评估,Loquacious与Fisher用于ASR预训练,论文说明SpokenWOZ与Loquacious为开放获取而Fisher需要LDC许可,论文中未提及数据集下载链接 Demo:论文中未提及 复现材料:基座模型RR采用WavLM-large编码器接入冻结的OLMo-2-1B并搭配rank-16 LoRA微调。第1阶段训练占用4张NVIDIA A100 GPU。第2阶段微调与验证器训练各占用1张GPU。验证器每槽每轮采样8个候选值并以focal二元交叉熵优化。增加阈值为0.3。论文中未提及检查点下载链接 论文中引用的开源项目:提及WavLM-large,OLMo-2-1B,SpokenWOZ,Loquacious与Fisher等但论文中未提及下载链接 资源可达性验证:未发现可验证的官方 HTTPS 资源 URL。 🧭 深度解读 语音助手最怕的不是听不清,而是记错还不改 想象你对语音助手说从剑桥到莱斯特,登记在詹姆斯名下。它把莱斯特听成近音词,把詹姆斯听成杰伊。这个错误不会只停在这一轮,下一轮它会带着错误的地名继续订票,再下一轮还会用错名字取票。对刚入门的同学,关键是理解口语对话的累积性:每一轮的状态都是历史槽值的并集,1 次实体误识会被后续所有轮次继承。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 590 words

PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment

📄 先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放 英文题目:PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment 一句话:针对视频面试评分不透明、通用大模型系统性跑偏的问题,PhoenixNest-Video 用语义视频图加检索校验与双奖励强化学习把每个分数锚定到可回放证据,在自采面试集上以 8B 模型达到 91.50% 等级准确率,代价是核心数据不公开且证据判断仍依赖大模型自身。 标签:#音视频理解 | #强化学习 | #多模态模型 | #可解释性 评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fan Yuxuan:The Hong Kong University of Science and Technology (Guangzhou) Huang Miaojun:The Hong Kong University of Science and Technology (Guangzhou) Zhang Haimei:The Hong Kong University of Science and Technology (Guangzhou) Wu Jingshen:The Hong Kong University of Science and Technology (Guangzhou) Liu Hao:The Hong Kong University of Science and Technology (Guangzhou) 💬 毒舌点评 亮点在于把评分锚定到可回放的证据链而非直接输出分数,并用双奖励把机构分级校准显式写入优化目标,思路贴合高风险评审的审计需求。短板在于核心数据集不公开且关键证据多依赖大模型自判自证,证据可追溯性与评分客观性都仍系于未经验证的模型判断。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 964 words

Predictors of Loneliness in Older Adults Using Multimodal Analysis of Speech and Language

📄 孤独听得出来吗:当说什么比怎么说更诚实 英文题目:Predictors of Loneliness in Older Adults Using Multimodal Analysis of Speech and Language 一句话:这项研究用 310 位老人的 1465 次电话随访检验了语言内容与声音特征对孤独感的关联,发现文本更稳、声音在特定人群更灵,而两者合在一起也只能解释很小一部分差异。 标签:#语音情感识别 | #多模态模型 | #模型集成 | #医疗音频 评分:4.9/10 | 创新 0.7/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5 👥 作者与机构 Vinmay Khandode:机构信息未在 arXiv HTML 中可靠披露 Sai Karthik Kosuri:机构信息未在 arXiv HTML 中可靠披露 Neil K. R. Sehgal:机构信息未在 arXiv HTML 中可靠披露 Adam Greene:机构信息未在 arXiv HTML 中可靠披露 Elif Alpoge:机构信息未在 arXiv HTML 中可靠披露 Elana Duffy:机构信息未在 arXiv HTML 中可靠披露 Matthew Lee Smith:机构信息未在 arXiv HTML 中可靠披露 Thomas K.M. Cudjoe:机构信息未在 arXiv HTML 中可靠披露 Sharath Chandra Guntuku:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把自然电话随访中的说什么和怎么说放在同一回归与参与者层面验证下硬碰硬,并做了性别与种族分层,问题意识诚实克制。硬伤是关联与预测效应整体微弱,重复测量的非独立性与声学侧多重比较处理粗糙,所谓多模态增益只是特征堆叠的边际红利,离可部署筛查还很远。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 718 words