ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

The Attention Triangle in Audio-Video Models

📄 谁在替鹦鹉说话:当音频偷偷改写了画面 英文题目:The Attention Triangle in Audio-Video Models 一句话:针对文本到音视频联合生成中声音被绑到错误实体的问题,该工作把文本、音频、视频的三边交叉注意力看作可干预的路由三角,用无训练的两遍偏置转向同时约束直接绑定与经音频中转的间接耦合,在 100 个挑战提示上把声源归属从 0.1216 提升到 0.1349,代价是约数倍推理开销与对外部份割的依赖。 标签:#音视频生成 | #扩散模型 | #声源定位 | #可解释性 评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Sagi Polaczek:Tel Aviv University, Tel Aviv, Israel Noa Kraicer:Tel Aviv University, Tel Aviv, Israel Gal Metzer:Tel Aviv University, Tel Aviv, Israel Zhuo Ning:Simon Fraser University, Burnaby, Canada Ali Mahdavi-Amiri:Simon Fraser University, Burnaby, Canada Daniel Cohen-Or:Tel Aviv University, Tel Aviv, Israel Raja Giryes:Tel Aviv University, Tel Aviv, Israel 💬 毒舌点评 把文本音频视频三边泄漏统一为注意力三角并用双向路由可视化把玄学先验变成可干预通路,视角干净且干预无需训练。短板是全套转向依赖基线解码加 SAM3 外部分割与人工标注短语,成本约 2.5 倍且分割或音频显著性失效便无从纠偏,评估又建在人工筛选变异的失败富集提示集上,外推性存疑。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 809 words

Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech

📄 一句里换一种口音:用帧级掩码把全局引导切开 英文题目:Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech 一句话:针对句内码本切换中嵌入短语被载体口音同化的泄露问题,论文在离散扩散 TTS 的推理时用自注意力探测得到短语掩码并以独立尺度 λ 做语言对比引导,在 1200 条 12 方向合成语料上将嵌入短语语言准确率从 0.233 提至 0.518,代价是 UTMOS 轻度下降与需回退到 eager 注意力的 2.26 倍推理开销。 标签:#语音合成 | #扩散模型 | #语音克隆 | #多语言 | #零样本 评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Che Hyun Lee:Department of Electrical and Computer Engineering, Seoul National University Sangkwon Park:Department of Electrical and Computer Engineering, Seoul National University Donghun Kang:Department of Electrical and Computer Engineering, Seoul National University Dongwook Lee:Interdisciplinary Program in Artificial Intelligence, Seoul National University Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把全局分类器无关引导 Classifier-Free Guidance (CFG) 拆成帧级可控的语言对比引导,并用模型自注意力自举定位短语边界,实现了无训练的句内口音解耦,思路干净且与离散扩散的迭代去噪天然互补。短板是核心证据完全绑定在 OmniVoice 单一骨干和合成文本上,对自回归架构、真实自发码本切换及长时韵律连贯性的外推缺乏严格验证,推理侧需退回 eager 注意力导致的 2.26 倍开销也削弱了即插即用的说服力。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1693 words

TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models

📄 掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处 英文题目:TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models 一句话:针对联合音视频扩散模型只管说什么不管何时说的问题,TimeSteer 在推理时用时序敏感注意力头定位源区间并用分区读图在预测干净隐空间搬运内容,在 SpeechShift 上将 HR0.2 提升 2 倍以上而 WER 与画质几乎不掉,代价仅为每步一次无梯度前向。 标签:#音视频生成 | #扩散模型 | #语音合成 | #多模态模型 评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Chao Zhou:机构信息未在 arXiv HTML 中可靠披露 Yiling Chen:机构信息未在 arXiv HTML 中可靠披露 Qi Chu:机构信息未在 arXiv HTML 中可靠披露 Tao Gong:机构信息未在 arXiv HTML 中可靠披露 Nenghai Yu:机构信息未在 arXiv HTML 中可靠披露 Tianyi We:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把联合音视频扩散模型中隐含的时序结构显式化为可编辑的目标到源读图映射,无需训练即可把语音精确塞进任意区间,思路干净且在 LTX-2 与 daVinci-MagiHuman 两个异构骨干上均有效。短板是所有证据仍困在 5 秒短片段与 8 步蒸馏采样器内,对长时多轮对话、真实语速自然度以及口型同步的人工主观评估几乎空白,承诺开源的 SpeechShift 与代码尚未兑现也削弱了可验证性。 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1803 words

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

📄 7B 做原生音画同步:用门控与路由把对齐做轻,而不是把参数做大 英文题目:DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution 一句话:DreamX-Creator 以首帧与文本为条件让音视频双流联合去噪,用门控跨模态注意力与模态感知强化学习在 Verse-Bench 上以 VQ 与 DeSync 对抗大模型,并用自回归 1 步蒸馏把 2K 精修压到每块一次去噪,代价是音频美学与跨模态语义仍落后于 22B 与 33B 系统。 标签:#扩散模型 #流匹配 #强化学习 #知识蒸馏 评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jiashu Zhu:机构信息未在 arXiv HTML 中可靠披露 Yanhao Zheng:机构信息未在 arXiv HTML 中可靠披露 Ruitian Tian:机构信息未在 arXiv HTML 中可靠披露 Rujing Dang:机构信息未在 arXiv HTML 中可靠披露 Shen Zhang:机构信息未在 arXiv HTML 中可靠披露 Bingze Song:机构信息未在 arXiv HTML 中可靠披露 Jiachen Lei:机构信息未在 arXiv HTML 中可靠披露 Ruimin Lin:机构信息未在 arXiv HTML 中可靠披露 Jiahong Wu:机构信息未在 arXiv HTML 中可靠披露 Xiangxiang Chu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 以 7B 紧凑双流加门控跨模态注意力实现首帧条件原生音视频联合去噪,并配齐数据系统、RL 后训练与自回归 1 步 2K 精修的工程链路,开放权重定位清晰。硬伤是自家表格直接证伪全面领先叙事:音频美学与跨模态语义被 22B LTX-2.3 与 33B MiniMax-H3 全面压制,Verse-Bench 无显著性检验、无门控/奖励路由/蒸馏消融,所谓 democratizing 仍停留在承诺开源而非可验证交付。 ...

2026-09-01 · 更新于 2026-09-04 · 10 min · 1929 words

PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation

📄 把声学公式写进损失:PhysWave 如何让扩散模型不再猜方向 英文题目:PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation 一句话:针对文本到 FOA 生成中方向与距离失真且自然语言与数值控制割裂的问题,PhysWave 用统一航点-标题条件与两项可微物理损失约束潜扩散,在合成动态数据上将静态与运动方向误差降至 1.73 °与 4.65 °并保持可比音质,代价是仅限单声源自由场且未验证真实房间泛化。 标签:#音频生成 #扩散模型 #空间音频 #变分自编码器 #数据集 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Lingfeng Yao:University of Houston Chenpei Huang:University of Houston Xingke Yang:University of Houston Ziye Geng:University of Houston Changqing Luo:University of Houston Hao Wang:Stevens Institute of Technology Jiang Liu:Waseda University Miao Pan:University of Houston 💬 毒舌点评 亮点在于把一阶 Ambisonics(First-Order Ambisonics,FOA)已知的球谐编码与反平方衰减显式做成可微损失并同时用于训练与推理时引导,统一了自然语言与航点轨迹控制,思路干净且有效;短板是物理先验仅限自由场直达声,300K 规模数据集完全依赖合成渲染且缺乏真实房间混响与多源评估,基线复现而非官方权重对比也削弱了 SOTA 说服力。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1764 words

Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models

📄 同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹 英文题目:Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models 一句话:针对吉他同一音高对应多弦品位置的歧义,Noise2Fret 把离散指板谱嵌入连续空间做条件扩散去噪,并以五项可微音乐物理损失联合约束,在 GuitarSet 与 GOAT 上同时提升音高与指板 F 值并保持 0.67 实时因子,代价是仍局限于标准调弦短窗干净录音。 标签:#音乐转录 #扩散模型 #多任务学习 #高效推理 评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Riccardo Simionato:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France Louis Bigo:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France 💬 毒舌点评 把离散指板选择搬进连续扩散空间并用五项可微音乐物理损失做软约束,思路比统计共现抑制更可解释,且在 GOAT 上的召回与可演奏性平衡确有说服力。短板是 100 ms 窗口与事件级聚合的时序建模过短、评测仍局限于标准调弦的干净录音,且对圆圈五度等较弱先验缺乏统计显著性与真实演奏容错分析。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1430 words

VIBE: Video Instruction-aligned Background music gEneration

📄 当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令 英文题目:VIBE: Video Instruction-aligned Background music gEneration 一句话:针对视频到音乐生成中静态条件瓶颈与指令违背无惩罚的难题,VIBE 用逐层动态条件连接与硬软奖励分解的五阶段偏好优化,在 ReelBench 上以 FD 10.13 与 IS 2.36 等指标超越 Video-Robin,并在速度与调性指令跟随上实现可验证提升,代价是依赖冻结 VAE 与外部裁判模型带来的偏差与开销。 标签:#音乐生成 #扩散模型 #音视频生成 #强化学习 #多模态模型 评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Aryan Vijay Bhosale:机构信息未在 arXiv HTML 中可靠披露 Vaibhavi Lokegaonkar:机构信息未在 arXiv HTML 中可靠披露 Vishnu Raj:Dolby Laboratories, USA Gouthaman KV:Dolby Laboratories, USA Sreyan Ghosh:University of Maryland, College Park, USA Ramani Duraiswami:University of Maryland, College Park, USA Lie Lu:Dolby Laboratories, USA Dinesh Manocha:University of Maryland, College Park, USA 💬 毒舌点评 亮点在于把视频到音乐的条件瓶颈和指令违背问题拆成架构与训练两条线一起治,Conditioning Connection 的层级路由和硬可验证奖励 + 软跨模态奖励的分解确实让指令跟随可被优化而非仅靠重构。短板是评测过度依赖自家训练的 CMI-RM 与 Qwen2.5-Omni 作为奖励与裁判,且人类评估仅 18 人、20 个视频、Fleiss κ 0.249 的一致性偏低,却仍宣称全方位优于基线。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1819 words

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

📄 Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling 标签:#空间音频 #扩散模型 #零样本 #多通道 7.5/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #扩散模型 | #零样本 #多通道 | arxiv 👥 作者与机构 第一作者:Amit Milstein(ECE School, Ben-Gurion University of the Negev) 通讯作者:正文未明确标注;电子邮件列出 Amit Milstein、Nir Shlezinger、Boaz Rafaely 作者列表:Amit Milstein、Nir Shlezinger、Boaz Rafaely(机构:ECE School, Ben-Gurion University of the Negev, Be’er-Sheva, Israel) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 825 words

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

📄 Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care 标签:#语音合成 #扩散模型 #数据集 #语音克隆 #低资源 7.6/10 | 创新 1.1/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.6/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #语音合成 | #扩散模型 | #数据集 #语音克隆 | arxiv 👥 作者与机构 第一作者:Kawshik Kumar Paul(Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) 通讯作者:正文未明确标注 作者列表:Kawshik Kumar Paul、Md. Nafiul Alam Fuji(机构:Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 426 words