ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

📄 不数拍子也能合唱:对齐无关的配音与双人对话合成 英文题目:Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis 一句话:用 mT5 交叉注意力隐式对齐替代强制对齐与时长预测,结合 48 kHz DAC-VAE 隐变量流匹配统一单双通道生成,在内部配音基准可分享性提升约 0.40、短对话人类相似度 4.53 接近真人 4.62,代价是依赖闭源数据与多候选重排序。 标签:#语音合成 | #流匹配 | #语音克隆 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Sanyuan Chen:FAIR at Meta Min-Jae Hwang:FAIR at Meta Sho Inoue:FAIR at Meta Anna Sun:FAIR at Meta Bokai Yu:FAIR at Meta David Kant:FAIR at Meta Dongmin Hyun:FAIR at Meta Dorian Desblancs:FAIR at Meta Gregory Antonovsky:FAIR at Meta Oleg Repin:FAIR at Meta Peng-Jen Chen:FAIR at Meta Xutai Ma:FAIR at Meta Zehai Tu:FAIR at Meta Juan Pino:FAIR at Meta Wei-Ning Hsu:FAIR at Meta 💬 毒舌点评 把对齐无关文本接口、48 kHz低码率隐变量扩散与单双通道统一建模做成可落地的配音加全双工对话大系统,工程链条完整。短板是全程依赖内部数据与内部基线且无外部可验证产物,情绪与长对话评估多靠自动指标与自建主观量表,说服力打了折扣。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 839 words

Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech

📄 十五秒换一个声音:当教师的错误变成学生的课本 英文题目:Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech 一句话:为解决无单人语料时难以部署泰语固定音色合成的问题,论文用零样本克隆教师做可编程数据源经严格过滤与拒绝采样蒸馏出 82M 学生,以挑战集 68.2% 关键词准确率和 91.4% 停顿精确率为证,代价是难词上限仍被教师覆盖锁死。 标签:#语音合成 | #知识蒸馏 | #低资源 | #多语言 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kunat Pipatanakul:机构信息未在 arXiv HTML 中可靠披露 Potsawee Manakul:机构信息未在 arXiv HTML 中可靠披露 Warit Sirichotedumrong:机构信息未在 arXiv HTML 中可靠披露 Sittipong Sripaisarnmongkol:机构信息未在 arXiv HTML 中可靠披露 Pakorn Nathong:机构信息未在 arXiv HTML 中可靠披露 Phatrasek Jirabovonvisut:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把泰语停顿可接受集合形式化并配套可复现的评测管线,让合成流水线的取舍变得可度量。短板在于学生上限被教师分布锁死,挑战集关键词准确率始终落后教师与专有系统,蒸馏更多是在做有损压缩而非能力扩展。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1004 words

Is Semantics Enough for Speech Mean Opinion Score Prediction?

📄 语义听得懂内容,声学才听得出破绽:MOS 预测的双耳之争 英文题目:Is Semantics Enough for Speech Mean Opinion Score Prediction? 一句话:论文把语义自监督、纯声学编解码与语义声学统一编解码放在同一冻结与微调探针下比较,证明匹配语言下协同表征上界更高而跨语言时连续语义更稳,代价是公平性与机理证据仍不完整。 标签:#语音质量评估 | #自监督学习 | #语音合成 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Tianyu Lan:机构信息未在 arXiv HTML 中可靠披露 Yufei Shi:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Honghao Sun:机构信息未在 arXiv HTML 中可靠披露 Huipeng Du:机构信息未在 arXiv HTML 中可靠披露 Zhenhua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语义主导的自监督学习与声学重建的神经音频编解码器放在同一冻结探针下硬碰硬,问题切得准。短板在于所谓统一表征几乎全是借用现成 XCodec 与 SpeechTokenizer 的封装对比,缺少对语义声学解耦的因果验证,跨语言反转也解释得过于仓促。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 870 words

VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis

📄 先查账再唱歌:VoxReason 把语音的“怎么说”变成可引用的计划 英文题目:VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis 一句话:针对表达性语音在合成前就已决定交付方式却无法问责的问题,VoxReason 把交付决策显式化为带源引用的说话计划并用确定性校验器加单线索反事实检验源依赖,在 1440 例受控源标签集上证明去源记录使引用约束分降 0.488 而局部性修复同时恢复准确率与局部性,代价是仅覆盖两种语句与单一场景且不评价波形质量。 标签:#语音合成 | #SFT | #基准测试 | #模型评估 | #可解释性 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mengzhe Geng:National Research Council Canada 💬 毒舌点评 把合成前说话计划做成带引用校验的查账任务,切断了用好听波形掩盖无据决策的退路,证伪链条设计得相当清醒。但受控到只有两种语句和单一场景的验证,更像一份自我设限的诊断说明书,离通用语音规划基准还有明显距离。 📌 核心摘要 表达性语音在波形生成前已决定情感与韵律等交付方式,但现有音频评分无法判断该决策是否得到源记录许可。VoxReason提出源引用说话计划(source-cited speaking plan)作为合成前预测对象,以确定性校验器检查引用合法性、槽位一致与单线索反事实局部性。论文在1440例源标签受控集上证明去除源记录会大幅降低引用约束得分,而局部性修复后的学习规划器同时恢复槽位准确率与反事实一致性。在波形质量完全排除于当前主张之外后,该方法为对话与叙述类语音提供了先验账本。当前结论仍被窄语句、固定场景与确定性标签映射所限定。 🔗 开源与复现资源 代码:https://github.com/MENGZHEGENG/voxreason,提供衍生切分与评估代码 模型权重:论文中未提及 数据集:RAVDESS衍生source-label切分含1440条记录,通过GitHub仓库获取,不再分发原始音频 Demo:论文中未提及 复现材料:论文提供手稿源码,planner schema,verifier评估代码和重跑表格命令 论文中引用的开源项目:未提及 资源可达性验证:code=temporarily_unreachable 🧭 深度解读 同一句话,为何换个心情就该换个说法 想象你在做一个对话助手,用户只说了一句孩子在门口玩,文字本身没有情绪。可如果病例记录写着说话人刚经历丧失,你若用欢快的语调催促,就会显得冷漠,若用低沉缓慢的安慰,反而恰当。这种差别不在文字里,而在文字背后的许可记录里。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 754 words

Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models

📄 复述一句就能听出你来过:微调语音如何记住嗓音与录音 英文题目:Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models 一句话:论文把双条件查询与变长波形比较形式化为可评分范围与记忆诱发两条准则,用朗读查询加声纹与多层 WavLM 加动态规整的解耦表征实现说话人与记录两级审计,在三模型两数据集上达到 0.80 以上 AUC 而代价是记录级需影子模型与十次重复查询。 标签:#语音合成 | #生成模型 | #说话人验证 | #自监督学习 评分:7.5/10 | 创新 1.7/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kunlin Cai:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Kaiyuan Zhang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Zihang Xiang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Jinghuai Zhang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Abeer Alwan:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Fnu Suya:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Yuan Tian:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. 💬 毒舌点评 把文本加参考语音双条件查询空间形式化并用可评分范围与记忆诱发解释朗读查询最强,表征上说话人级走全局声纹、记录级走多层帧特征加动态时间规整的解耦切中语音变长连续痛点。短板是记录级依赖同架构影子模型训练的轻量长短期记忆网络判别器,跨架构迁移未验证,防御评估停留在早停、输入扰动和差分隐私随机梯度下降的粗粒度尝试。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 1026 words

Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

📄 导演喊“再来一条”时,机器如何既不变声又听懂弦外之音 英文题目:Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction 一句话:为解决同一脚本下相对化重读三元组稀缺问题,该文用印象可控合成造风格对再由大语言模型反推导演语言,并在冻结骨干嵌入空间以流匹配学习增量,主证据是伪数据与真人数据组合在保住音色的同时提升方向跟随,代价是伪数据韵律偏保守且评估部分同源。 标签:#语音合成 | #流匹配 | #大语言模型 评分:6.8/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kenichi Fujita:机构信息未在 arXiv HTML 中可靠披露 Yusuke Ijima:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点是用印象可控合成加相对差分生成方向文本,把难以采集的导演式重读三元组做成了可扩展流水线。短板是伪数据韵律变化幅度明显弱于真人表演,导致伪数据模型偏保守,而对齐度评估又与构造用估计器同源,可信度打了折扣。 📌 核心摘要 本文研究方向跟随语音合成(direction-following TTS),即在保持说话人身份和文本内容不变的前提下,根据自然语言表演方向(direction)对参考 utterance 做相对化风格修改。核心机制是先用印象可控零样本合成模型生成风格差异对,再用印象估计器计算相对印象差并交由大语言模型(large language model,LLM)撰写导演式方向文本,从而构造伪三元组(pre-mod utterance,伪方向,post-mod utterance)。风格修改本身通过固定骨干合成模型之上的方向条件风格精修器(direction-conditioned style refiner)实现,该精修器在语音嵌入空间中学习从修改前嵌入到修改后嵌入的增量映射。与绝对风格标注和直接文本提示语音合成(text-prompted TTS)的区别在于建模相对变换而非绝对风格。主实验显示组合伪数据与真实录制数据的 Full 配置在已见说话人上主观说话人相似度(SMOS)达到 3.35,同时主观对齐度(AlignMOS)达到 3.22,兼顾了稳定性和表现力。实际意义是为导演式重读和可控表演合成提供了可扩展的数据范式。主要边界是伪数据表现力保守且评估部分依赖同源估计器,跨语言和开放方向泛化仍待验证。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 814 words

BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling

📄 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling 一句话:在 1.1 kbps 低码率下语义与声学互相挤压的矛盾中,BiMTokenizer 用双向 Mamba 时序建模与固定 Leech 格点量化重做单塔瓶颈,在 LibriSpeech 上以 PESQ-NB 3.56 与 WER 2.44% 超越同码率双塔基线,代价是离线双向依赖与 196560 大词表带来的自回归预测负担。 标签:#语音编码 | #端到端 | #语音合成 | #语音质量评估 | #知识蒸馏 评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1876 words

Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations

📄 想练好一句难开口的话,机器得先学会怎么“演人”:Conversation Coach 的延迟与演技取舍 英文题目:Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations 一句话:为让管理者在真实开口前完成高保真语音演练,Conversation Coach 在同一批合成场景下对比端到端与级联两种语音架构,用 3 倍时延与 8 倍成本优势换来对人格一致性的显著让步,并在 4 万名管理者的半年部署中验证了面向困难对话的选择性使用。 标签:#语音交互 | #端到端 | #语音合成 | #大语言模型 评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Fanyou Wu:机构信息未在 arXiv HTML 中可靠披露 Suraj Maharjan:机构信息未在 arXiv HTML 中可靠披露 Ainur Yessenalina:机构信息未在 arXiv HTML 中可靠披露 Dennis Xu Chen:机构信息未在 arXiv HTML 中可靠披露 Rahul Srivastava:机构信息未在 arXiv HTML 中可靠披露 Srinivasan H. Sengamedu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把端到端语音到语音与级联流水线的取舍放在真实的4万人规模部署中验证,并给出可复用的时延、成本与角色一致性量化对比。短板是核心评估依赖148个合成场景与大语言模型作为评委,且未开源任何代码、模型或数据,导致外部几乎无法复现或检验其声称的人格一致性优势。 ...

2026-09-02 · 更新于 2026-09-04 · 6 min · 1120 words

Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech

📄 一句里换一种口音:用帧级掩码把全局引导切开 英文题目:Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech 一句话:针对句内码本切换中嵌入短语被载体口音同化的泄露问题,论文在离散扩散 TTS 的推理时用自注意力探测得到短语掩码并以独立尺度 λ 做语言对比引导,在 1200 条 12 方向合成语料上将嵌入短语语言准确率从 0.233 提至 0.518,代价是 UTMOS 轻度下降与需回退到 eager 注意力的 2.26 倍推理开销。 标签:#语音合成 | #扩散模型 | #语音克隆 | #多语言 | #零样本 评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Che Hyun Lee:Department of Electrical and Computer Engineering, Seoul National University Sangkwon Park:Department of Electrical and Computer Engineering, Seoul National University Donghun Kang:Department of Electrical and Computer Engineering, Seoul National University Dongwook Lee:Interdisciplinary Program in Artificial Intelligence, Seoul National University Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把全局分类器无关引导 Classifier-Free Guidance (CFG) 拆成帧级可控的语言对比引导,并用模型自注意力自举定位短语边界,实现了无训练的句内口音解耦,思路干净且与离散扩散的迭代去噪天然互补。短板是核心证据完全绑定在 OmniVoice 单一骨干和合成文本上,对自回归架构、真实自发码本切换及长时韵律连贯性的外推缺乏严格验证,推理侧需退回 eager 注意力导致的 2.26 倍开销也削弱了即插即用的说服力。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1693 words