ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

Opening mind by opening architecture: analysis strategies

📄 打开黑盒之前,先学会搭一间混响小屋 英文题目:Opening mind by opening architecture: analysis strategies 一句话:这篇教学报告以 1962 年 Schroeder 混响为标本,用 Faust 先搭原型再移植到 Csound 并配脉冲响应检验链,唯一的实证只是一张反馈延迟线衰减图,代价是缺参数、缺对比与缺听感验证。 标签:#音频生成 | #端到端 | #开源工具 | #可解释性 评分:4.5/10 | 创新 0.5/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.6/1 | 影响力 0.3/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Francesco Vitucci:Conservatorio “N. Piccinni” - Bari Giuseppe Silvi:Conservatorio “N. Piccinni” - Bari Daniele Giuseppe Annese:Conservatorio “N. Piccinni” - Bari Francesco Scagliola:Conservatorio “N. Piccinni” - Bari Anthony Di Furia:Conservatorio “N. Piccinni” - Bari 💬 毒舌点评 把 1962 年 Schroeder 混响用 Faust 再抄一遍到 Csound 还能包装成开放架构宣言,教学诚意可嘉,研究增量约等于课程作业。全文无一个可核对的声学数字、无基线、无听感评估,却大谈黑盒批判与创意未来,投顶会只会被以证据不足秒拒。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 760 words

The Attention Triangle in Audio-Video Models

📄 谁在替鹦鹉说话:当音频偷偷改写了画面 英文题目:The Attention Triangle in Audio-Video Models 一句话:针对文本到音视频联合生成中声音被绑到错误实体的问题,该工作把文本、音频、视频的三边交叉注意力看作可干预的路由三角,用无训练的两遍偏置转向同时约束直接绑定与经音频中转的间接耦合,在 100 个挑战提示上把声源归属从 0.1216 提升到 0.1349,代价是约数倍推理开销与对外部份割的依赖。 标签:#音视频生成 | #扩散模型 | #声源定位 | #可解释性 评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Sagi Polaczek:Tel Aviv University, Tel Aviv, Israel Noa Kraicer:Tel Aviv University, Tel Aviv, Israel Gal Metzer:Tel Aviv University, Tel Aviv, Israel Zhuo Ning:Simon Fraser University, Burnaby, Canada Ali Mahdavi-Amiri:Simon Fraser University, Burnaby, Canada Daniel Cohen-Or:Tel Aviv University, Tel Aviv, Israel Raja Giryes:Tel Aviv University, Tel Aviv, Israel 💬 毒舌点评 把文本音频视频三边泄漏统一为注意力三角并用双向路由可视化把玄学先验变成可干预通路,视角干净且干预无需训练。短板是全套转向依赖基线解码加 SAM3 外部分割与人工标注短语,成本约 2.5 倍且分割或音频显著性失效便无从纠偏,评估又建在人工筛选变异的失败富集提示集上,外推性存疑。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 809 words

VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis

📄 先查账再唱歌:VoxReason 把语音的“怎么说”变成可引用的计划 英文题目:VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis 一句话:针对表达性语音在合成前就已决定交付方式却无法问责的问题,VoxReason 把交付决策显式化为带源引用的说话计划并用确定性校验器加单线索反事实检验源依赖,在 1440 例受控源标签集上证明去源记录使引用约束分降 0.488 而局部性修复同时恢复准确率与局部性,代价是仅覆盖两种语句与单一场景且不评价波形质量。 标签:#语音合成 | #SFT | #基准测试 | #模型评估 | #可解释性 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mengzhe Geng:National Research Council Canada 💬 毒舌点评 把合成前说话计划做成带引用校验的查账任务,切断了用好听波形掩盖无据决策的退路,证伪链条设计得相当清醒。但受控到只有两种语句和单一场景的验证,更像一份自我设限的诊断说明书,离通用语音规划基准还有明显距离。 📌 核心摘要 表达性语音在波形生成前已决定情感与韵律等交付方式,但现有音频评分无法判断该决策是否得到源记录许可。VoxReason提出源引用说话计划(source-cited speaking plan)作为合成前预测对象,以确定性校验器检查引用合法性、槽位一致与单线索反事实局部性。论文在1440例源标签受控集上证明去除源记录会大幅降低引用约束得分,而局部性修复后的学习规划器同时恢复槽位准确率与反事实一致性。在波形质量完全排除于当前主张之外后,该方法为对话与叙述类语音提供了先验账本。当前结论仍被窄语句、固定场景与确定性标签映射所限定。 🔗 开源与复现资源 代码:https://github.com/MENGZHEGENG/voxreason,提供衍生切分与评估代码 模型权重:论文中未提及 数据集:RAVDESS衍生source-label切分含1440条记录,通过GitHub仓库获取,不再分发原始音频 Demo:论文中未提及 复现材料:论文提供手稿源码,planner schema,verifier评估代码和重跑表格命令 论文中引用的开源项目:未提及 资源可达性验证:code=temporarily_unreachable 🧭 深度解读 同一句话,为何换个心情就该换个说法 想象你在做一个对话助手,用户只说了一句孩子在门口玩,文字本身没有情绪。可如果病例记录写着说话人刚经历丧失,你若用欢快的语调催促,就会显得冷漠,若用低沉缓慢的安慰,反而恰当。这种差别不在文字里,而在文字背后的许可记录里。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 754 words

语音/音乐/音频论文速递 2026-09-04

语音/音乐/音频论文速递 2026-09-04 共分析 30 篇论文 ⚡ 今日概览 ✅ 筛选入选 30 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音增强 5 篇 █████ #语音合成 3 篇 ███ #语音交互 2 篇 ██ #语音质量评估 2 篇 ██ #声源定位 1 篇 █ #语音情感识别 1 篇 █ #语音编码 1 篇 █ 📊 论文评分排行榜(30 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ToolDF: Tool-Integrated Reasoning for Mixed… 8.4 前25% 方法研究 #音频伪造检测 🥈 Geometric Ceilings on Time-Frequency Masking for… 7.9 前25% 理论研究 #音乐源分离 🥉 CRAW: Codec Robust Audio Watermarking 7.7 前25% 方法研究 #音频水印 4. The 2026 PNPL Competition: Word Classification and… 7.5 前25% 数据集与基准 #语音识别 5. Test-time adaptation for speech enhancement with an… 7.5 前25% 方法研究 #语音增强 6. Alignment-Free Text-Audiobox for Voice Dubbing and… 7.5 前25% 系统技术报告 #语音合成 7. Listen to the Latents: Self-Correcting Speech… 7.2 前50% 方法研究 #语音识别 8. StreamWSR: Streamable and Lightweight Waveform-Domain… 7.2 前50% 方法研究 #语音增强 9. DuplexSpeechBench-IFEval: Evaluating Implicit… 7.2 前50% 数据集与基准 #语音交互 10. Building and Evaluating Fixed-Voice Thai TTS from… 7.2 前50% 系统技术报告 #语音合成 11. PACodec: A Low-bitrate Neural Speech Codec with… 7.1 前50% 方法研究 #语音编码 12. Decoupling Turn-Taking from Semantics: A Decoupled… 7.0 前50% 方法研究 #语音交互 13. Summary of the ChinaVoices Challenge 2026: Data, Tasks… 6.9 前50% 数据集与基准 #语音识别 14. The Attention Triangle in Audio-Video Models 6.9 前50% 方法研究 #音视频生成 15. Compressing Streaming Neural Audio Encoders via Latent… 6.9 前50% 方法研究 #语音识别 16. Dual-Form ASR: Semantics-Aware Inverse Text… 6.8 前50% 方法研究 #语音识别 17. Deep Neural Compression for RIR-Characterized Acoustic… 6.6 前50% 方法研究 #音频编码 18. SISER: Speaker-Invariant Speech Emotion Recognition… 6.5 前50% 方法研究 #语音情感识别 19. Masked Autoregressive Speech Enhancement with… 6.4 前50% 方法研究 #语音增强 20. Last Translation Benchmark 6.4 前50% 数据集与基准 #语音翻译 21. Neural Music Enhancement with Dual Time-Frequency… 6.2 前50% 方法研究 #语音增强 22. CAPQ-FAST: Content-Adaptive Perceived Quality… 6.2 前50% 应用研究 #音频质量评估 23. Beyond .WAV: Design and Software Verification of… 6.1 前50% 系统技术报告 #语音质量评估 24. Broadband Acoustic Intensity Direction Estimation with… 6.1 前50% 方法研究 #声源定位 25. Local Chord Corruption Is Not Recognizer Replay: Chord… 6.1 前50% 方法研究 #音乐生成 26. VoxReason: Listener-Free Evaluation of Source-Grounded… 5.9 前50% 数据集与基准 #语音合成 27. Is Semantics Enough for Speech Mean Opinion Score… 5.9 前50% 方法研究 #语音质量评估 28. Fairness Evaluation of Edge-AI Implementation for… 5.6 前50% 应用研究 #语音识别 29. StrixAE: An Intelligent Agent for Audio Enhancement… 5.5 前50% 系统技术报告 #语音增强 30. Opening mind by opening architecture: analysis… 4.5 后 50% 系统技术报告 #音频生成 📋 论文列表 🥇 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection ...

2026-09-04 · 更新于 2026-09-04 · 26 min · 5367 words

PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment

📄 先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放 英文题目:PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment 一句话:针对视频面试评分不透明、通用大模型系统性跑偏的问题,PhoenixNest-Video 用语义视频图加检索校验与双奖励强化学习把每个分数锚定到可回放证据,在自采面试集上以 8B 模型达到 91.50% 等级准确率,代价是核心数据不公开且证据判断仍依赖大模型自身。 标签:#音视频理解 | #强化学习 | #多模态模型 | #可解释性 评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fan Yuxuan:The Hong Kong University of Science and Technology (Guangzhou) Huang Miaojun:The Hong Kong University of Science and Technology (Guangzhou) Zhang Haimei:The Hong Kong University of Science and Technology (Guangzhou) Wu Jingshen:The Hong Kong University of Science and Technology (Guangzhou) Liu Hao:The Hong Kong University of Science and Technology (Guangzhou) 💬 毒舌点评 亮点在于把评分锚定到可回放的证据链而非直接输出分数,并用双奖励把机构分级校准显式写入优化目标,思路贴合高风险评审的审计需求。短板在于核心数据集不公开且关键证据多依赖大模型自判自证,证据可追溯性与评分客观性都仍系于未经验证的模型判断。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 964 words

语音/音乐/音频论文速递 2026-09-03

语音/音乐/音频论文速递 2026-09-03 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音合成 2 篇 ██ #音频分类 2 篇 ██ #声源定位 1 篇 █ #语音增强 1 篇 █ #语音情感识别 1 篇 █ #音乐生成 1 篇 █ #音视频理解 1 篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVERT: Audio-Verified Adjudication for Spoken Dialogue… 7.6 前25% 方法研究 #语音识别 🥈 Hearing the Whispers: Black-Box Membership Inference… 7.5 前25% 方法研究 #语音合成 🥉 The Missing Temporal Link: Temporal Context Routing… 7.5 前25% 方法研究 #音视频生成 4. VibeVoice-ASR-Streaming Technical Report 7.5 前25% 系统技术报告 #语音识别 5. A Common Measure of Communication for Speech Brain… 7.4 前50% 方法研究 #语音识别 6. SonicCaps: Large-Scale Diverse and Fine-Grained… 7.2 前50% 数据集与基准 #音频检索 7. Understanding Automatic Mixing: A Subtask-Oriented… 7.0 前50% 应用研究 #音乐生成 8. Scalable Direction-Following TTS via Voice Impression… 6.8 前50% 方法研究 #语音合成 9. Efficient Passive Acoustic Monitoring of Killer Whales… 6.7 前50% 应用研究 #音频分类 10. Auditory Illusion Benchmark for Large Audio Language… 6.4 前50% 数据集与基准 #音频理解 11. ARFT: A Synchronized Multimodal RF-Acoustic Dataset… 6.4 前50% 数据集与基准 #声源定位 12. Sensing Bone-Conducted Speech with Earbuds 6.3 前50% 应用研究 #语音增强 13. PhoenixNest-Video: Evidence-Grounded Multimodal Agent… 6.3 前50% 方法研究 #音视频理解 14. SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper… 6.1 前50% 应用研究 #语音识别 15. Removing Speech, Keeping Activities: A Privacy… 5.9 前50% 应用研究 #音频分类 16. Choosing a PEFT Variant for Per-Patient Dysarthric ASR… 5.9 前50% 应用研究 #语音识别 17. VAANI Noise Event Dataset: A curated spontaneous… 5.8 前50% 数据集与基准 #语音识别 18. Predictors of Loneliness in Older Adults Using… 4.9 后 50% 应用研究 #语音情感识别 📋 论文列表 🥇 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking ...

2026-09-03 · 更新于 2026-09-04 · 15 min · 3026 words

Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

📄 听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气 英文题目:Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models 一句话:论文用四段式贯穿分析追踪副语言信息从编码器到输出的演化,发现所有模型在编码器顶层都能以 82% 至 85% 线性探测到说话风格,却在输出端跌至 19.7% 至 53.7%,并用泄露度量与梯度反转实验说明这是训练目标导致的系统性利用失败而非编码失败。 标签:#语音情感识别 | #多模态模型 | #可解释性 | #模型评估 评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5 👥 作者与机构 Bhuvan Koduru:Language Technologies Institute;Carnegie Mellon University Dareen Safar B Alharthi:Language Technologies Institute;Carnegie Mellon University Rita Singh:Language Technologies Institute;Carnegie Mellon University Bhiksha Raj:Language Technologies Institute;Carnegie Mellon University 💬 毒舌点评 亮点在于用中心化核对齐(Centered Kernel Alignment, CKA)与线性探测(Linear Probing)的解离现象干净地揭示了“编码强、利用弱”的结构性鸿沟,并以训练目标作为解释变量给出可信的对照线索。短板是全篇建立在 Expresso 的 4 个说话人、7 类风格的封闭受控集上,外推性存疑,且梯度反转层(Gradient Reversal Layer, GRL)干预仅在单线性投影器上做最小化验证,离真正可用的解耦训练还很远,输出评估依赖关键词映射的启发式分桶也引入了额外噪声。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1613 words

MADS: A Multiview Acoustic Descriptor Set Beyond Standard Spectral Summaries

📄 别只看频谱长什么样:用 19 维力学视角重写环境声音的描述方式 英文题目:MADS: A Multiview Acoustic Descriptor Set Beyond Standard Spectral Summaries 一句话:MADS 把波形当作阻尼振荡与能量传递过程,用 19 维多视角描述子在经典分类器上以一半维度超越 38 维谱摘要基线,并在 ESC 与 MSoS 上取得 81.00%、52.78% 与 67.48% 的峰值准确率,代价是物理代理仍为启发式且未与深度前端对比。 标签:#音频分类 | #集成学习 | #音频事件检测 | #可解释性 评分:5.7/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5 👥 作者与机构 Utsab Ghosh:ABV-Indian Institute of Information Technology and Management, Gwalior, India Roshni Chakraborty:ABV-Indian Institute of Information Technology and Management, Gwalior, India 💬 毒舌点评 亮点在于把19维物理启发的多视角声学描述子集(Multi-view Acoustic Descriptor Set, MADS)做得紧凑可解释,在经典机器学习流水线上以一半维度压过38维传统基线;短板是所有物理量(有效质量、动能、PDE残差)均为启发式代理且缺乏消融与深度前端对比,所谓物理性更多是命名包装而非可验证的动力学建模。 ...

2026-09-02 · 更新于 2026-09-04 · 5 min · 989 words

Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution

📄 听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验 英文题目:Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution 一句话:为检验被动指纹是否真的持久可复现且与内容无关,论文用 PIPDP 三探针把指纹按人耳可感知性拆开,证明在保持听感透明时位深抖动仍能让溯源准确率下降 48.2%,而改情感只带来约 1.00% 的波动,代价是结论仍受限于 10 类闭集与代理透明度阈值。 标签:#语音伪造检测 | #自监督学习 | #鲁棒性 | #可解释性 评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yupei Li:机构信息未在 arXiv HTML 中可靠披露 Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露 Emmanouil Benetos:机构信息未在 arXiv HTML 中可靠披露 Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露 Björn Schuller:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于首次把被动指纹(passive fingerprint)按人耳可感知性拆分为可感知与不可感知两类,并用可控扰动与情感提示做了可验证的诊断,视角比单纯测鲁棒性更贴近取证可靠性。短板是核心结论高度依赖闭集 10 分类与 DNSMOS / STOI 代理的可感知阈值,且扰动与情感实验的统计与跨检测器一致性论证不足,难以支撑“不可感知指纹更可信”的强泛化宣称。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1582 words