论文解读

TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6310 字 阅读 →
论文解读

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5055 字 阅读 →
论文解读

Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

音频生成 | 9.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5926 字 阅读 →
论文解读

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12718 字 阅读 →
论文解读

dots.tts Technical Report

语音合成 | 9/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3032 字 阅读 →
论文解读

HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec

语音合成 | 5.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6148 字 阅读 →
论文解读

KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5494 字 阅读 →
论文解读

Multilingual Multi-Speaker Unit Vocoders: A Systematic Analysis of Discrete Speech Representations

语音合成 | 8.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5643 字 阅读 →
论文解读

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5202 字 阅读 →
论文解读

VoxCPM2 Technical Report

语音合成 | 9.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7125 字 阅读 →
论文解读

An Ultra-Low-Bitrate Neural Speech Codec with Plain-to-Pseudo Synergistic Vector Quantization

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5324 字 阅读 →
论文解读

CoSTA: Cognitive-State-Conditioned TTS Data Augmentation Using ASR Transcripts for Alzheimer's Disease Detection

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1509 字 阅读 →
论文解读

F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6113 字 阅读 →
论文解读

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8421 字 阅读 →
论文解读

GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6599 字 阅读 →
论文解读

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6696 字 阅读 →
论文解读

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6366 字 阅读 →
论文解读

Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6000 字 阅读 →
论文解读

UniVoice: A Unified Model for Speech and Singing Voice Generation

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5545 字 阅读 →
论文解读

CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

语音编码 | 8.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7045 字 阅读 →