论文解读

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5682 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3963 字 阅读 →
论文解读

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5987 字 阅读 →
论文解读

Music Flamingo: Scaling Music Understanding in Audio Language Models

音乐理解 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6053 字 阅读 →
论文解读

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4700 字 阅读 →
论文解读

ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6023 字 阅读 →
论文解读

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5436 字 阅读 →
论文解读

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4393 字 阅读 →
论文解读

SpeechJudge: Towards Human-Level Judgment for Speech Naturalness

模型评估 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5451 字 阅读 →
论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5344 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-02

共分析 4 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 15 分钟 · 7026 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4835 字 阅读 →
论文解读

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6664 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4318 字 阅读 →
论文解读

Advancing Speech Summarization in Multi-Modal LLMs with Reinforcement Learning

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4272 字 阅读 →
论文解读

Advancing Speech Understanding in Speech-Aware Language Models with GRPO

语音问答 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3396 字 阅读 →
论文解读

Aligning Generative Speech Enhancement with Perceptual Feedback

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5533 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4356 字 阅读 →
论文解读

AVATAR: Audio-Visual Adaptive Fusion via Trained Agent Reinforcement for Multimodal Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4343 字 阅读 →
论文解读

B-GRPO: Unsupervised Speech Emotion Recognition Based on Batched-Group Relative Policy Optimization

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4316 字 阅读 →