论文解读

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5202 字 阅读 →
论文解读

UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6372 字 阅读 →
论文解读

A Comparison of Generative and Discriminative Methods for Speech Enhancement: Robustness, Complexity, and Hallucination

语音增强 | 8.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 7008 字 阅读 →
论文解读

Cosmos 3: Omnimodal World Models for Physical AI

音频生成 | 10/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8607 字 阅读 →
论文解读

Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening

语音合成 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5364 字 阅读 →
论文解读

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

音频生成 | 7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6522 字 阅读 →
论文解读

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5546 字 阅读 →
论文解读

DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech

语音合成 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing

音乐生成 | 8.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6772 字 阅读 →
论文解读

不可听水印为何在扩散重生面前失效:DiffErase 的黑盒去除与保真权衡

针对语音/音乐/环境声的神经音频水印,DiffErase 在不查询检测器且不知水印方案的黑盒条件下,通过梅尔频谱的中间噪声扰动与预训练扩散去噪重生实现去除,并在五种水印系统上将检测 TPR 降至近 0 的同时以 t* 控制保真度代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9247 字 阅读 →
论文解读

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2923 字 阅读 →
论文解读

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

语音合成 | 9.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6263 字 阅读 →
论文解读

SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue

语音合成 | 8.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8091 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

自回归模型 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8023 字 阅读 →
论文解读

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5475 字 阅读 →
论文解读

Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4803 字 阅读 →
论文解读

Native Audio-Visual Alignment for Generation

音频生成 | 7.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6977 字 阅读 →
论文解读

Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

音频生成 | 8.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7601 字 阅读 →
论文解读

DEMON: Diffusion Engine for Musical Orchestrated Noise

音乐生成 | 6.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7857 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6556 字 阅读 →