ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-08-14 · 108 min · 22980 words

HybridSB-MoE: Dual-Domain Schrödinger Bridges with Scene-Adaptive Expert Routing for Speech Enhancement

📄 HybridSB-MoE: Dual-Domain Schrödinger Bridges with Scene-Adaptive Expert Routing for Speech Enhancement 标签:#语音增强 #扩散模型 #模型评估 5.9/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #扩散模型 | #模型评估 | arxiv 👥 作者与机构 第一作者:Zhengyi Lu(Oakland University, Department of Computer Science and Engineering) 通讯作者:未说明 作者列表:Zhengyi Lu、Aswini Sivakumar、Jie Hu、Yao Qiang,均来自 Oakland University, Department of Computer Science and Engineering, Rochester, MI 48309 邮箱:{zhengyilu, aswinisivakumar, jiehu, qiang}@oakland.edu 💡 毒舌点评 这篇论文有一个较有洞察力的设计:把谱域 MoE 的认知不确定性 u_epi 与波形 Schrödinger Bridge 的偶然不确定性 u_ale 设为非对称路由信号,让融合机制在“哪种误差更可信”之间切换,而不是对两个预测做对称平均。与此配套的效率主张也有一定价值:路径一致性与轨迹正则被写入 K 步离散误差的 2-Wasserstein 界,为小步数推理提供了训练目标层面的解释。 ...

2026-08-14 · 更新于 2026-08-14 · 4 min · 697 words

Luna-TTS Family Technical Report

📄 Luna-TTS Family Technical Report 标签:#语音合成 #扩散模型 #预训练 #流式处理 #强化学习 6.9/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.3/1.5 ✅ 6.9/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #扩散模型 | #预训练 #流式处理 | arxiv 👥 作者与机构 第一作者:论文标注 Feng Yin、Shuai Shi、Junjie Zheng、Kechenying Zhou 为共同第一作者 通讯作者:Yanmin Qian 作者列表:Feng Yin(VUI Labs Research)、Shuai Shi(VUI Labs Research)、Junjie Zheng(VUI Labs Research)、Kechenying Zhou(VUI Labs Research)、Yiqiu Wang(VUI Labs Research)、Chenyang He(VUI Labs Research)、Qiuhua Jiang(VUI Labs Research)、Mengxiao Bi(VUI Labs Research)、Yanmin Qian(VUI Labs Research);其余贡献者 Mingxin Chen、Xun Gong、Tianteng Gu、Bing Han、Peng Jiang、Chenda Li、Haiyang Sun、Han Wang、Wei Wang、Yi Wang、Leying Zhang、Wangyou Zhang、Chushu Zhou(均标注 VUI Labs Research,论文按姓氏字母顺序列出,未给出更细部门信息) 💡 毒舌点评 这个报告最亮眼的地方是把 masked discrete diffusion 从学术方案推到了 1M 小时、四语言的 TTS 生产系统,并给出 41.6ms 首块延迟和极低 RTF 的清晰部署画像。但它更像一份产品技术报告:没有开源权重/代码,也没有 RL、annealing、duration predictor、block adaptation 等关键阶段的可控消融,读者很难判断 SOTA 数字究竟来自架构,还是来自数据与后训练的堆叠。 ...

2026-08-13 · 更新于 2026-08-14 · 6 min · 1220 words

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

📄 Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec 标签:#语音增强 #语音大模型 #扩散模型 #流匹配 #自监督学习 7.1/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #语音大模型 | #扩散模型 #流匹配 | arxiv 👥 作者与机构 论文文本未提供作者与机构信息;需从 arXiv 页面另行确认。 💡 毒舌点评 这篇论文最有价值的地方是把六种 LM-based 语音增强范式放进同一个框架里做了一次难得的公平比较,并用侵入式指标补足了该方向常被忽略的评估盲区。但它更像一份高质量的系统化 benchmark,而非方法创新;缺少与外部 URgent 挑战系统的直接对比,也让“CNAR 最优”的结论略显内部化。 ...

2026-08-13 · 更新于 2026-08-14 · 5 min · 858 words

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

📄 UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos 标签:#音视频生成 #扩散模型 #知识蒸馏 #参数高效微调 7.8/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #扩散模型 | #知识蒸馏 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Yuxuan Zhang(The Chinese University of Hong Kong;Qwen Applications Business Group of Alibaba) 通讯作者:Liwei Wang(The Chinese University of Hong Kong) 作者列表:Yuxuan Zhang(The Chinese University of Hong Kong;Qwen Applications Business Group of Alibaba)、Haozhong Xiong(Qwen Applications Business Group of Alibaba)、Jiayi Song(Qwen Applications Business Group of Alibaba)、Jinpeng Yu(Qwen Applications Business Group of Alibaba)、Yang Shi(Qwen Applications Business Group of Alibaba)、Jiaming Liu(Qwen Applications Business Group of Alibaba)、Ruihua Huang(Qwen Applications Business Group of Alibaba)、Liwei Wang(The Chinese University of Hong Kong) 💡 毒舌点评 这项工作把换脸、语音转换、流式扩散蒸馏和 RoPE 缓存管理拼成了一个工程上相当完整的统一框架,长视频一致性消融也做得比多数 demo 论文扎实。但核心贡献更接近系统集成而非方法突破,且 Stage 3 蒸馏后在音画同步、视频美学和图像质量上反而低于 Stage 1/Stage 2;作者更多强调身份与语音质量改善,对蒸馏带来的同步和视觉质量回退解释不足。代码仓库仅通过项目主页提供,权重、训练数据和数据合成管线未公开,让“首个联合替换框架”的复现与检验仍受限。 ...

2026-08-13 · 更新于 2026-08-14 · 4 min · 831 words

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

📄 Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence 标签:#音视频生成 #多模态模型 #语音合成 #扩散模型 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频生成 | #多模态模型 | #语音合成 #扩散模型 | arxiv 👥 作者与机构 第一作者:Haoyu Zhang(The Chinese University of Hong Kong, Shenzhen;脚注说明工作完成于 LIGHTSPEED 实习期间) 通讯作者:Tianshu Yu(The Chinese University of Hong Kong, Shenzhen)、Yiwen Guo(Independent Researcher) 作者列表:Haoyu Zhang(The Chinese University of Hong Kong, Shenzhen)、Zhipeng Li(LIGHTSPEED)、Xiaoying Tang(The Chinese University of Hong Kong, Shenzhen)、Tianshu Yu(The Chinese University of Hong Kong, Shenzhen)、Yiwen Guo(Independent Researcher) 💡 毒舌点评 VTP+多码本语音单元+Prefix Streaming 的组合在系统层面确实打通了“对话→语音→视频”的完整链路,工程完整度明显高于同类工作,这是值得肯定的。但审稿人最想追问的是:所有关键视频条件都是自动标注或教师模型生成的,VTP first-frame grounding 只有 43%,你如何保证这个“视觉规划”不是模型自圆其说的幻觉?E2E RTF 1.293、首个视频块 3.14 秒后才出,恐怕只能叫“增量生成”而非“实时交互”,这个表达上的克制是聪明的,但离真正的交互体验还很远。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 865 words

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

📄 TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation 标签:#扩散模型 #端到端 #模型评估 6.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.6/1 | 影响 0.4/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #扩散模型 | #端到端 | #模型评估 | arxiv 👥 作者与机构 第一作者:Pengyu Zhang(University of Amsterdam, Amsterdam, The Netherlands) 通讯作者:未说明 作者列表:Pengyu Zhang(University of Amsterdam)、Yangqin Jiang(University of Hong Kong)、Klim Zaporojets(Aarhus University)、Congfeng Cao(University of Amsterdam)、Paul Groth(University of Amsterdam) 💡 毒舌点评 这篇工作的核心卖点是“模态时间尺度不匹配”——不同模态的相关性随时间以不同速率漂移,同一用户在不同时间上下文需要不同的模态融合比例。这个观察有真实场景支撑,且把时间信号同时注入模态级路由和扩散图重构,形成双层互补机制,比简单给DiffMM加时间特征更有想法。实验证据链在推荐论文中算比较完整:10种子配对t检验、时间输入vs噪声输入对照、用户分层路由分析、组件消融和噪声鲁棒性都做了。但短板也明显:时间切分实验只对比DiffMM一个基线,无法支撑“对时间分布漂移特别稳健”的强结论;关键超参数、权重取值和更多配置被放到匿名仓库和附录,正文复现信息不独立;此外本文核心是电商/短视频多模态推荐,与语音、音乐、音频方向读者的直接相关性有限。 ...

2026-08-12 · 更新于 2026-08-14 · 2 min · 290 words

A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies

📄 A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies 标签:#音频生成 #生成模型 #自回归模型 #扩散模型 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.1/0.5 | 工程 0.6/1.5 ✅ 6.5/10 | 前50% | 文档类型:理论研究 | 评分置信度:中 | #音频生成 | #生成模型 | #自回归模型 #扩散模型 | arxiv 👥 作者与机构 第一作者:Dongchao Yang(The Chinese University of Hong Kong,dcyang@se.cuhk.edu.hk) 通讯作者:论文未明确标注通讯作者;由于论文仅有一名作者,该唯一作者承担通讯角色。 作者列表:Dongchao Yang(The Chinese University of Hong Kong) 💡 毒舌点评 这篇立场论文最聪明的地方是拆掉“离散 vs 连续”这堵假墙:它指出真正决定架构选择的是依赖时域与条件歧义,而不是输出接口的类别;RVQ“残差有序但语义无序”的澄清,也比常见综述里“低层语义、高层声学”的说法准确得多。然而,这个“统一视角”的骨架几乎全是信息论恒等式——恒等式没有错,但它们本身不产生预测。全文没有给出任何一个可证伪的量化声明:依赖时域怎么测、条件歧义怎么算、式 (2) 的经验可建模性剖面具体长什么样,统统没有。概念框架像一张精美的地图,但没有标出任何一条实际走过的路。作为观点文章,清晰度够格;作为可检验的“框架”,验证基本缺位。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 459 words

CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

📄 CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis 标签:#语音合成 #扩散模型 #语音克隆 #自回归模型 #零样本 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #扩散模型 | #语音克隆 #自回归模型 | arxiv 👥 作者与机构 第一作者:Zhisheng Zheng(德克萨斯大学奥斯汀分校,由邮箱 zszheng@utexas.edu 确认) 通讯作者:未说明(论文正文未标注通讯作者;David Harwath 提供邮箱 harwath@utexas.edu,但未被明确指定为通讯作者) 作者列表:Zhisheng Zheng、Xiaohang Sun、Zhu Liu、Caren Chen、Rohith Kumar、Manoj Aggarwal、Gerard Medioni、David Harwath 机构信息:论文页脚标注两个单位——1. The University of Texas at Austin,2. Amazon;各作者与机构的对应关系未逐人标出。除上述两位由邮箱确认外,其余作者的机构归属无法确认。 💡 毒舌点评 把 DiTAR 的连续潜空间、CAM++ 声纹和逐音素韵律控制信号整合成一套可用的可控 TTS,工程上确实完整,0.6B 在零样本克隆上也略优于复现的 DiTAR。但“可控性”全程只拿对 GT 的 RMSE/MAE 说话,既没有验证对任意给定非 GT 目标韵律的跟随能力,也没有对 pitch/loudness 逐项消融,更没有控制效果的主观听感测试;0.1B 模型在零样本合成中 WER 明显退化也完全未解释。以顶会标准看,这只能证明“显式控制信号能降低与 GT 的声学误差”,还不足以支撑“用户可控表达性语音合成”的强声明。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 976 words

RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

📄 RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction 标签:#音频生成 #扩散模型 #音乐生成 #多模态模型 #对比学习 6.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #扩散模型 | #音乐生成 #多模态模型 | arxiv 👥 作者与机构 第一作者:Ambuj Mehrish(CVML Lab, Ca’ Foscari University of Venice) 通讯作者:未说明 作者列表:Ambuj Mehrish(CVML Lab, Ca’ Foscari University of Venice)、Sebastiano Vascon(CVML Lab, Ca’ Foscari University of Venice) 💡 毒舌点评 把 SDEdit / rectified-flow 中间初始化搬到脑到音频生成,用检索 exemplar 锚定采样轨迹而不是把它当条件或直接输出,确实是处理 prior domination 的务实思路;用 MusicGen 做负对照把“轨迹初始化”从“检索本身”中分离出来,也比一般脑解码文章的实验设计更用心。但全篇只在 Brain2Music 一个数据集、5 个受试者、300 个 pooled 样本上验证,代码链接还是 TBA;FAD 从 13.49 降到 1.25 主要是靠贴近检索真音频,而不是生成器本身的音频质量变强,所以作者没有 claim 超过 retrieval-only 是对的——RAG 相对纯检索的增量其实只有 novelty 从 0.06 提到 0.18,FAD 反而从 0.89 涨到 1.25,这个 trade-off 值不值取决于具体应用。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 1065 words