论文解读

Gogo: Group-wise granularity-ordered codec for stable and efficient speech generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5137 字 阅读 →
论文解读

Hierarchical Semantic-Acoustic Modeling via Semi-Discrete Residual Representations for Expressive End-to-End Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9658 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音识别 语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5615 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6225 字 阅读 →
论文解读

Steering Autoregressive Music Generation with Recursive Feature Machines

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4895 字 阅读 →
论文解读

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4500 字 阅读 →
论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5015 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5314 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6983 字 阅读 →
论文解读

Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5357 字 阅读 →
论文解读

Continuous Audio Language Models

音频生成 音乐生成 | 9.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5470 字 阅读 →
论文解读

DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5139 字 阅读 →
论文解读

Gogo: Group-wise granularity-ordered codec for stable and efficient speech generation

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4704 字 阅读 →
论文解读

Hierarchical Semantic-Acoustic Modeling via Semi-Discrete Residual Representations for Expressive End-to-End Speech Synthesis

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6858 字 阅读 →
论文解读

JaiTTS: A Thai Voice Cloning Model

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6263 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音大模型 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5696 字 阅读 →
论文解读

Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5369 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Steering Autoregressive Music Generation with Recursive Feature Machines

音乐生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4217 字 阅读 →
论文解读

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3665 字 阅读 →