论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音生成 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5015 字 阅读 →
论文解读

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

模型评估 | 9.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5353 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

基准测试 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4547 字 阅读 →
论文解读

Data-Centric Lessons To Improve Speech-Language Pretraining

语音问答 | 8.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3893 字 阅读 →
论文解读

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

基准测试 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5102 字 阅读 →
论文解读

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

语音情感识别 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5631 字 阅读 →
论文解读

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5535 字 阅读 →
论文解读

Gogo: Group-wise granularity-ordered codec for stable and efficient speech generation

语音合成 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4704 字 阅读 →
论文解读

JaiTTS: A Thai Voice Cloning Model

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6263 字 阅读 →
论文解读

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

音频安全 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5487 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音大模型 | 8.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5696 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音克隆 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4919 字 阅读 →
论文解读

Scaling Speech Tokenizers with Diffusion Autoencoders

语音分词 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4954 字 阅读 →
论文解读

Speech World Model: Causal State–Action Planning with Explicit Reasoning for Speech

语音情感识别 语音对话系统 | 9.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5094 字 阅读 →
论文解读

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3665 字 阅读 →
论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音对话系统 | 8.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3884 字 阅读 →
论文解读

VibeVoice: Expressive Podcast Generation with Next-Token Diffusion

语音合成 | 8.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5927 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5209 字 阅读 →
论文解读

One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech

语音克隆 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4425 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4318 字 阅读 →