论文解读

Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis

语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 4 分钟 · 1666 字 阅读 →
论文解读

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

语音合成 | 7.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5272 字 阅读 →
论文解读

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5547 字 阅读 →
论文解读

MUNI: Multimodal Unified Latent Diffusion for Coherent Any-to-Any Generation

语音生成 | 6.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5373 字 阅读 →
论文解读

Probing Low Frame Rate Degradation in Neural Audio Codecs

语音生成 | 8.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5018 字 阅读 →
论文解读

SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4632 字 阅读 →
论文解读

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

语音生成 | 9.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6024 字 阅读 →
论文解读

OpenBibleTTS: Large-Scale Speech Resources and TTS Models for Low-Resource Languages

语音合成 | 8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6802 字 阅读 →
论文解读

HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec

语音合成 | 5.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6148 字 阅读 →
论文解读

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

语音合成 | 9.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5546 字 阅读 →
论文解读

UniVocal: Unified Speech-Singing Code-Switching Synthesis

语音合成 | 8.9/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2097 字 阅读 →
论文解读

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

语音生成 | 9.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6224 字 阅读 →
论文解读

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

语音合成 | 9.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7303 字 阅读 →
论文解读

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

语音生成 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8743 字 阅读 →
会议任务专题

ICLR 2026 - 语音生成

共 1 篇 ICLR 2026 语音生成 方向论文

 · 更新于 2026-09-24 · 约 4 分钟 · 1781 字 阅读 →
论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音生成 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5015 字 阅读 →
会议任务专题

ICASSP 2026 - 语音生成

共 1 篇 ICASSP 2026 语音生成 方向论文

 · 更新于 2026-09-24 · 约 5 分钟 · 2072 字 阅读 →
论文解读

ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer

音频生成 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4275 字 阅读 →
论文解读

Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective

语音生成 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4296 字 阅读 →