论文解读

A Semi-Supervised Framework for Speech Confidence Detection using Whisper

语音自信度检测 | 6.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9646 字 阅读 →
论文解读

Evaluating the Expressive Appropriateness of Speech in Rich Contexts

语音质量评估 | 7.2/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9625 字 阅读 →
论文解读

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

语音对话系统 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8653 字 阅读 →
论文解读

Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM

语音大模型 | 8.0/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14118 字 阅读 →
论文解读

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

音频安全 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5665 字 阅读 →
论文解读

Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4081 字 阅读 →
论文解读

When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2617 字 阅读 →
论文解读

Can Speech LLMs Think while Listening?

语音对话系统 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4703 字 阅读 →
论文解读

Closing the Gap Between Text and Speech Understanding in LLMs

语音大模型 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4518 字 阅读 →
论文解读

Data-Centric Lessons To Improve Speech-Language Pretraining

语音问答 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4090 字 阅读 →
论文解读

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

语音情感识别 | 8.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3695 字 阅读 →
论文解读

Gogo: Group-wise granularity-ordered codec for stable and efficient speech generation

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5137 字 阅读 →
会议任务专题

ICLR 2026 - 语音大模型

共 1 篇 ICLR 2026 语音大模型 方向论文

 · 更新于 2026-09-24 · 约 3 分钟 · 1418 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音识别 语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5615 字 阅读 →
论文解读

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

多模态模型 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5484 字 阅读 →
论文解读

ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

语音对话系统 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4678 字 阅读 →
论文解读

Scaling Speech Tokenizers with Diffusion Autoencoders

语音识别 | 8.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3677 字 阅读 →
论文解读

Speech World Model: Causal State–Action Planning with Explicit Reasoning for Speech

语音情感识别 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5550 字 阅读 →
论文解读

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

语音识别 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4175 字 阅读 →
论文解读

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

语音对话系统 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4500 字 阅读 →