ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue

📄 何时闭嘴何时开口分开学:用真实重叠教会状态机的全双工配方 英文题目:Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue 一句话:针对合成带学不会真实打断与重叠时序的问题,该工作用人人语音学轮次、用可配人机文本保语义并以事件规则与来源感知损失缝合,在受控词量下轮次 F1 提升约 0.31、放量后语义距基座仅差 0.09,代价是单带仍压缩连续时间与副语言。 标签:#语音交互 | #大语言模型 | #流式处理 | #基准测试 评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yihang Li:Kyoto University Chenhui Chu:Kyoto University 💬 毒舌点评 把轮次控制与语义解耦、用真实人人对话学打断的思路切中了神经有限状态机合成数据的要害,事件引导的规则序列化做得扎实可扩展。但合成基线复现自由度偏大且语义评估口径不对等,暂停处理的激进策略也暴露了单带序列化压缩连续时间的固有代价。 📌 核心摘要 全双工对话需要同时处理打断、反向通道和地板争夺,而神经有限状态机将状态转换与回复生成序列化到单条因果带上,却依赖大语言模型合成难以还原真实声学时序的训练带。本文提出解耦数据方法,用真实人人口语对话学习轮次控制,用可配置的人机文本对话塑造语义,并以全规则的事件引导变换加来源感知校准损失实现联合训练。在控制训练token量的对比中,该方法在轮次F1与VoiceBench上均大幅超越合成基线,扩大到按比例上采样混合后语义基本恢复至基座模型零样本水平。实际意义在于为基于有限状态机的全双工系统提供了可扩展到任意人人语料且无需大语言模型标注的配方。主要边界是单带离散化必然损失连续时间与副语言信息,且当前仅覆盖双人问答场景。 🔗 开源与复现资源 代码: 仓库链接为 https://github.com/Liyht/def-fsm 模型权重: 论文中说明模型与代码均在 https://github.com/Liyht/def-fsm 获取,未提及独立HuggingFace或ModelScope权重链接 数据集: 采用Switchboard语料和Fisher语料作为人人口语对话,未提及获取链接,采用ShareGPT52K数据集作为人机对话,链接为 https://huggingface.co/datasets/RyokoAI/ShareGPT52K,另用GPT-4-Turbo生成1500个合成对话作为基线,未提及公开链接 Demo: 论文中未提及 复现材料: 基础模型为Qwen3-4B,人人与人机按1比1 token量混合,Fisher与Switchboard按4比1混合,来源感知校准损失设置tau为1且alpha为0.6,上下文长度为1024 token,峰值学习率为1.0e-5且warmup比例为0.03,token匹配设置训练至多300步,放量混合设置训练至多700步,细节见Appendix B.1和Appendix D 论文中引用的开源项目: Faster-Whisper,链接为 https://github.com/SYSTRAN/faster-whisper,Kokoro TTS,链接为 https://github.com/hexgrad/kokoro,另提及Whisper-Turbo和SimulStreaming和Silero VAD和Qwen3-32B,未提及对应链接 资源可达性验证:code=temporarily_unreachable;model=temporarily_unreachable;dataset=temporarily_unreachable;third_party=temporarily_unreachable;third_party=temporarily_unreachable 🧭 深度解读 人为什么能边听边想边插话? 想象你和朋友争论金星和火星哪个更大,你刚说到一半,对方轻轻嗯了一声,你自然继续讲下去。可当对方突然提高声音纠正你,你会立刻停下让对方说完。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 879 words

StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution

📄 不看未来,也要补出高频:StreamWSR 的零前视波形赌局 英文题目:StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution 一句话:针对低延迟语音超分辨率需要零前视流式推理的难题,StreamWSR 选择全因果波形域直接映射加训练期多分辨率 MDCT 谱监督,在 VCTK 2 kHz 到 16 kHz 上以 9.03 M 参数和 2.12 G 计算量取得 ViSQOL 3.81 的感知质量,代价是验证仍局限于干净英文朗读且缺乏实测延迟与主观听感。 标签:#语音增强 | #生成对抗网络 | #流式处理 | #高效推理 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuan Tian:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把波形域直接建模与零前视因果约束真正做成了可流式部署的轻量系统,避免了声码器和显式相位预测的复杂管线。短板在于仅在单一英文干净数据集上验证且缺少延迟实测与主观听感评估,零前视优势更多停留在结构因果层面而非系统级验证。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1015 words

VibeVoice-ASR-Streaming Technical Report

📄 边听边分清谁在说:把长历史留下来做说话人归属 英文题目:VibeVoice-ASR-Streaming Technical Report 一句话:针对流式会议转录要同时低延迟输出文字与说话人标签的难题,论文把固定块加前视与历史交错放入单一自回归上下文,用 7B 模型在五集合均值与 12 个归属设置上取得最优,代价是 8 分钟上限与首包更慢。 标签:#语音识别 | #语音大模型 | #说话人日志 | #流式处理 | #会议转录 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yujie Tu:University of Chinese Academy of Sciences Zhiliang Peng:Microsoft Research Jianwei Yu:Microsoft Research Li Dong:Microsoft Research Songchen Xu:Shanghai Jiao Tong University Yaoyao Chang:Microsoft Research Wenhui Wang:Microsoft Research Zilong Wang:Microsoft Research Zehua Wang:Microsoft Research Yan Xia:Microsoft Research Jiajun Zhang:University of Chinese Academy of Sciences Xie Chen:Shanghai Jiao Tong University Furu Wei:Microsoft Research 💬 毒舌点评 把长历史保留在自回归上下文里来固定说话人身份是漂亮而务实的选择,云端对比的延迟与代价测量也难得诚实。但序列化单流输出对长时重叠的妥协、八分钟上限与首包延迟问题让实时声称打了折,技术报告仍更像强工程而非范式突破。 ...

2026-09-03 · 更新于 2026-09-04 · 2 min · 294 words

Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework

📄 会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来 英文题目:Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework 一句话:为解决全双工对话中抢话时机与回答质量难以兼得的问题,论文用轻量控制器 LPS-TC 显式解耦时序与内容、并以风格指令控制打断与附和,在 WildTurn 真实对话上显著提升主动交互的时机与质量,但中间风格与跨语种泛化仍有明显代价。 标签:#语音交互 #语音大模型 #流式处理 #数据集 #基准测试 评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Tianrui Pan:机构信息未在 arXiv HTML 中可靠披露 Qinglin Zhang:机构信息未在 arXiv HTML 中可靠披露 Chong Deng:机构信息未在 arXiv HTML 中可靠披露 Luyao Cheng:机构信息未在 arXiv HTML 中可靠披露 Qian Chen:机构信息未在 arXiv HTML 中可靠披露 Wen Wang:机构信息未在 arXiv HTML 中可靠披露 Jie Tang:机构信息未在 arXiv HTML 中可靠披露 Gangshan Wu:机构信息未在 arXiv HTML 中可靠披露 Jie Liu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用轻量解耦控制器 LPS-TC 把 timing 与 content 生成分离,并配套 2981 小时真实对话的 WildTurn 与 chunk/turn 双层评测,解决了全双工里“抢话时机 vs 回答质量”长期 trade-off 的工程痛点;短板是核心贡献高度依赖 GPT-5.2 生成的风格指令与词表匹配的 BC 标注,跨语种和合成数据泛化证据薄,且通篇未给出代码、权重与数据集获取方式,可信度与复现性被开源缺失拖累。 ...

2026-09-01 · 更新于 2026-09-04 · 2 min · 261 words

Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement

📄 相位越不准,幅度越要背锅:用频带加权把流式增强从过衰减里拉回来 英文题目:Towards Balanced Spectral Reconstruction: Spectrally Adaptive Loss for Streaming Speech Enhancement 一句话:针对压缩相位感知损失在中高频的幅度-相位补偿导致过衰减,论文用固定 Sigmoid 与信号依赖的谱自适应两种频带加权来压低不可靠相位监督,在 HyST-Net 流式基线上使 4-8 kHz 的 LSD 降低约 1.18 dB 而全带质量持平,代价是超参数固定且仅在 DNS 合成集验证。 标签:#语音增强 #Transformer #流式处理 评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Haixin Zhao:机构信息未在 arXiv HTML 中可靠披露 Nilesh Madhu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于直指压缩相位感知损失的幅度相位补偿效应,用频带加权缓解中高频过衰减,动机清晰且与流式轻量场景强绑定。短板是两类加权本质仍是手工设计的频域衰减曲线,超参数固定且缺乏跨数据集与主观听感验证,HyST-Net 的混合建模也更像为验证损失而搭的基线而非独立贡献。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1093 words

Emotion Understanding in Streaming Video with Trajectory-Aware Reliability

📄 别只看那一刻有多自信,要看一路有多摇晃:TRACE 用轨迹来判断情感是否可信 英文题目:Emotion Understanding in Streaming Video with Trajectory-Aware Reliability 一句话:面对流式视频中证据不断到来的情感判断,TRACE 选择让低延迟的音频前缀先形成信念轨迹,再用轨迹的稳定性来决定是否值得花代价调用多模态重解释,在 StreamMER 上以 55.58% 的重解释调用保留了接近全量多模态 70.18% 中的 69.47% 准确率,但代价是重解释仍有延迟且可靠性估计依赖训练域的轨迹分布。 标签:#音视频理解 #多模态模型 #流式处理 #语音情感识别 评分:7.7/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Qingsong Wang:Zhejiang University;Ant Group Qigong Lei:Zhejiang University Zitong Wang:Ant Group Bohan Yu:Ant Group Zhiang Dong:Zhejiang University Jian liu:Ant Group Weiqiang Wang:Ant Group Chang Yao:Zhejiang University Jingyuan Chen:Zhejiang University 💬 毒舌点评 亮点在于把流式情感识别从单点置信度判断拉回到轨迹稳定性判断,并用音频前缀驱动低延迟路径、视觉文本上下文做选择性重解释,准确率-代价权衡做得干净。短板是轨迹可靠性仍靠手工特征加小MLP拟合、StreamMER完全基于Friends剧本情景且标注依赖Gemini-3.1-Pro初标,泛化与标注偏差风险未被充分证伪,所谓流式更多是截断式前缀模拟而非真实在线部署验证。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 776 words

From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents

📄 咳嗽不是噪声:让对话智能体在轮次间听见呼吸 英文题目:From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents 一句话:为解决远程对话中咳嗽被当作噪声丢弃的问题,HealthCUES 用 Qwen3-Omni 把轮次对齐的滚动缓冲与三路并行结构化预测叠加对话感知门控,在 847 段私有对话上做到 93.0% 咳嗽检测 F1 与 340 ms 平均延迟,代价是依赖大模型推理且罕见亚型仍不可靠。 标签:#音频事件检测 #多模态模型 #流式处理 #医疗音频 #音频理解 评分:6.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Tanmay Laud:机构信息未在 arXiv HTML 中可靠披露 Herprit Mahal:机构信息未在 arXiv HTML 中可靠披露 Subhabrata Mukherjee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把被对话系统当噪声丢弃的咳嗽信号做成带亚型与时长的实时管线,并用对话感知门控解决高频误触发这一真实部署痛点,工程闭环完整。短板是核心证据建立在 847 段私有数据与 3 位护士的定性访谈上,对比的 BEATs / PANNs / CoughVID 均非算力与骨干对齐的受控基线,Qwen3-Omni 的提示与约束细节未公开,复现与外推说服力不足。 ...

2026-08-29 · 更新于 2026-09-04 · 3 min · 633 words

StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

📄 边播边改:当音视频生成从片段走向持续世界 英文题目:StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation 一句话:StreamAV-Bench 用 180 秒双轨与 32 维指标把流式音视频生成拉到边播边改的真实时间轴上,用 13 个系统的横评揭示视觉质量与交互达成难以兼得,且所有系统都在长程漂移与状态复用上集体失效。 标签:#音频生成 #多模态模型 #基准测试 #流式处理 评分:8.2/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kaiqi Liu:BAAI;PKU Haoxuan Zeng:PKU Jingqi Liu:BAAI;PKU Jiacong Fang:BAAI;PKU Ziqi Cai:PKU Yunyao Mao:Kling Henglin Liu:THU Yu Sheng:USTC Shuchen Weng:BAAI;PKU Boxin Shi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 首次把流式音视频生成从“生成完再评”拉到“边播边改”的真实交互场景,320 个专家校验场景与 32 维指标把时间漂移、响应延迟、状态复用等隐蔽失效模式彻底曝光,13 系统横评揭示级联与原生联合的互补格局。短板是评估过度依赖 Gemini 3.1 Pro 等多模态大语言模型(Multimodal Large Language Model,MLLM)主观打分且未开源完整复现代码,商业系统缺失边界连续性等关键指标,32 维指标权重与冗余未做消融,结论的可信度仍受评测器偏差束缚。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 959 words

Towards Interpretable Depression Detection: Linking Acoustic Features to DSM-5 Indicators

📄 不只给一个抑郁概率:把声音拆成四条可审计的 DSM-5 线索 英文题目:Towards Interpretable Depression Detection: Linking Acoustic Features to DSM-5 Indicators 一句话:为解决抑郁语音检测黑盒化与云端隐私风险,该工作用显式规则的 Linkage Framework 把声学特征映射到 4 项可语音观测的 DSM-5 指标,并在 DAIC-WOZ 上验证出方向一致但校正后不显著的关联,代价是放弃端到端性能对比且证据仍限于小样本访谈数据。 标签:#语音情感识别 #端到端 #可解释性 #流式处理 评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Jonas Länzlinger:机构信息未在 arXiv HTML 中可靠披露 Katharina O.E. Müller:机构信息未在 arXiv HTML 中可靠披露 Burkhard Stiller:机构信息未在 arXiv HTML 中可靠披露 Bruno Rodrigues:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把黑盒抑郁概率拆成可审计的声学特征到 DSM-5 指标的显式链路,并真把全链路压到端侧跑通,是本工作的唯一卖点;代价是所谓验证仅在 64 人的 DAIC-WOZ 子集上做方向性检查且经 FDR 校正后全部不显著,合成 TESS 拼接音频的流式演示也无法替代真实家庭纵向评估,离可信临床证据至少还差一次大规模纵向研究。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 776 words