论文解读

LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

多模态模型 | 6.1/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10138 字 阅读 →
论文解读

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

音视频理解 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8333 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 51 分钟 · 25294 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7440 字 阅读 →
论文解读

MuScriptor: An Open Model for Multi-Instrument Music Transcription

音乐转录 | 8.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6987 字 阅读 →
论文解读

MuScriptor: An Open Model for Multi-Instrument Music Transcription

音乐转录 | 9.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6309 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8468 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8582 字 阅读 →
论文解读

Reinforcement Learning for Data-Efficient Code-Switched ASR

语音识别 | 5.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5883 字 阅读 →
论文解读

Unified Audio Intelligence Without Regressing on Text Intelligence

音频交互 | 6.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3294 字 阅读 →
论文解读

ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools — From Consensus Learning to Ambiguity-Driven Emotion Reasoning

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9724 字 阅读 →
论文解读

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

音频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5673 字 阅读 →
论文解读

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

音视频问答 | 6.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8438 字 阅读 →
论文解读

Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability

语音合成 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6527 字 阅读 →
论文解读

Multimodal Meta-Verifier with Explicit Structured Recalibration

多模态模型 | 5.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6947 字 阅读 →
论文解读

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

音视频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7777 字 阅读 →
论文解读

Simultaneous Speech-to-Speech Translation Without Aligned Data

语音翻译 | 8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5628 字 阅读 →
论文解读

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

音视频理解 | 9.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7829 字 阅读 →
论文解读

Decomposer: Learning to Decompile Symbolic Music to Programs

音乐理解 | 8.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5948 字 阅读 →
论文解读

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

音视频理解 | 7.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7157 字 阅读 →