论文解读

Closing the Gap Between Text and Speech Understanding in LLMs

语音大模型 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4518 字 阅读 →
论文解读

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

多模态推理 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4438 字 阅读 →
论文解读

Confident and Adaptive Generative Speech Recognition via Risk Control

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4401 字 阅读 →
论文解读

Continuous Audio Language Models

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5685 字 阅读 →
论文解读

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

语音识别 | 9.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4230 字 阅读 →
论文解读

Data-Centric Lessons To Improve Speech-Language Pretraining

语音问答 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4090 字 阅读 →
论文解读

Deep Learning with Learnable Product-Structured Activations

神经网络架构 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4694 字 阅读 →
论文解读

DiffSDA: Unsupervised Diffusion Sequential Disentanglement Across Modalities

序列解耦 | 8.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6401 字 阅读 →
论文解读

Discovering and Steering Interpretable Concepts in Large Generative Music Models

音乐生成 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4454 字 阅读 →
论文解读

DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick

生成模型 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5814 字 阅读 →
论文解读

DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations

语音对话系统 | 9.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4530 字 阅读 →
论文解读

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

音频问答 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4607 字 阅读 →
论文解读

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4360 字 阅读 →
论文解读

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

语音分离 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5777 字 阅读 →
论文解读

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

语音情感识别 | 8.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3695 字 阅读 →
论文解读

End-to-end Listen, Look, Speak and Act

语音对话系统 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5323 字 阅读 →
论文解读

Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression

音视频事件检测 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5068 字 阅读 →
论文解读

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

语音合成 | 9.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5627 字 阅读 →
论文解读

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5075 字 阅读 →
论文解读

Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6318 字 阅读 →