论文解读

Gelina: Unified Speech and Gesture Synthesis Via Interleaved Token Prediction

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5600 字 阅读 →
论文解读

HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-Based TTS

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4633 字 阅读 →
论文解读

High-Fidelity Speech Enhancement Via Discrete Audio Tokens

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4455 字 阅读 →
论文解读

Joint Autoregressive Modeling of Multi-Talker Overlapped Speech Recognition and Translation

语音识别 语音翻译 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4119 字 阅读 →
论文解读

Lattice-Guided Consistency Regularization of Dual-Mode Transducers for Automatic Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3973 字 阅读 →
论文解读

MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows

语音转换 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5574 字 阅读 →
论文解读

MELA-TTS: Joint Transformer-Diffusion Model with Representation Alignment for Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5124 字 阅读 →
论文解读

Melos: Sentence-To-Section Training with Multi-Task Learning for LLM-Driven Song Generation

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →
论文解读

Modeling Strategies For Speech Enhancement in The Latent Space of a Neural Audio Codec

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4963 字 阅读 →
论文解读

Pianoroll-Event: A Novel Score Representation for Symbolic Music

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4100 字 阅读 →
论文解读

Principled Coarse-Grained Acceptance For Speculative Decoding In Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3911 字 阅读 →
论文解读

Retrieval-Based Speculative Decoding For Autoregressive Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3544 字 阅读 →
论文解读

S2Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

歌唱语音转换 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5290 字 阅读 →
论文解读

SLM-SS: Speech Language Model for Generative Speech Separation

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5237 字 阅读 →
论文解读

Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization Via Neural Audio Codec and Language Models

语音匿名化 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5467 字 阅读 →
论文解读

SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5548 字 阅读 →
论文解读

Syncspeech: Efficient and Low-Latency Text-to-Speech Based on Temporal Masked Transformer

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4853 字 阅读 →
论文解读

T-Mimi: A Transformer-Based Mimi Decoder for Real-Time On-Phone TTS

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3841 字 阅读 →
论文解读

Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3668 字 阅读 →
论文解读

Time-Shifted Token Scheduling for Symbolic Music Generation

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3965 字 阅读 →