论文解读

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

语音交互 | 7.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8276 字 阅读 →
论文解读

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10244 字 阅读 →
论文解读

Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7986 字 阅读 →
论文解读

Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9351 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 39 分钟 · 19087 字 阅读 →
论文解读

OPOD: On-Policy Omni Distillation

多模态模型 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6936 字 阅读 →
论文解读

X^3-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

音频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8383 字 阅读 →
论文解读

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

音视频理解 | 6.9/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10082 字 阅读 →
论文解读

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

音乐生成 | 6.8/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10649 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-23

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 70 分钟 · 34984 字 阅读 →
论文解读

Robust Summarization of Doctor-Patient Conversations: TalTech Systems for the Beyond Transcription Challenge

语音交互 | 6.3/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8701 字 阅读 →
论文解读

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

多模态模型 | 5.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6202 字 阅读 →
论文解读

WanSong v1.0 Technical Report

音乐生成 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6596 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-17

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 52 分钟 · 25719 字 阅读 →
论文解读

A Hybrid Mamba for Audio-Visual Navigation

声源定位 | 6.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7805 字 阅读 →
论文解读

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

音视频理解 | 9.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10324 字 阅读 →
论文解读

Task-Oriented Sensing and Covert Transmissions for Collaborative Multi-AUV Systems

声源定位 | 4.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5721 字 阅读 →
论文解读

LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

多模态模型 | 6.1/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10138 字 阅读 →
论文解读

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

音视频理解 | 6.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8333 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 51 分钟 · 25294 字 阅读 →