论文解读

AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

多模态模型 | 7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7267 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

自回归模型 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8023 字 阅读 →
论文解读

Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4803 字 阅读 →
论文解读

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4782 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7769 字 阅读 →
论文解读

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6978 字 阅读 →
论文解读

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7303 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6277 字 阅读 →
论文解读

Toward Native Multimodal Modeling: A Roadmap

多模态模型 | 10/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4994 字 阅读 →
论文解读

Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model

音乐生成 | 5.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8324 字 阅读 →
论文解读

SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7239 字 阅读 →
论文解读

Streaming Speech-to-Text Translation with a SpeechLLM

语音翻译 | 6.8/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10616 字 阅读 →
论文解读

Text2Score: Generating Sheet Music From Textual Prompts

乐谱生成 | 7.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9318 字 阅读 →
论文解读

Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9094 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7885 字 阅读 →
论文解读

Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5630 字 阅读 →
论文解读

Can Speech LLMs Think while Listening?

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4703 字 阅读 →
论文解读

Continuous Audio Language Models

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5685 字 阅读 →
论文解读

DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations

语音对话系统 | 9.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4530 字 阅读 →
论文解读

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6971 字 阅读 →