论文解读

UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

语音质量评估 | 10/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5850 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-25

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 52 分钟 · 25789 字 阅读 →
论文解读

A conceptual framework for learning to listen by reward: Curiosity-driven search for novel sources

声源定位 | 4.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8794 字 阅读 →
论文解读

A Survey of Audio Reasoning in Multimodal Foundation Models

音频推理 | 7.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8530 字 阅读 →
论文解读

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

语音识别 | 9.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7818 字 阅读 →
论文解读

Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning

音频编码 | 6.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8657 字 阅读 →
论文解读

Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation

语音对话系统 | 6.9/10

 · 更新于 2026-09-25 · 约 16 分钟 · 8002 字 阅读 →
论文解读

A conceptual framework for learning to listen by reward: Curiosity-driven search for novel sources

声源定位 | 5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7501 字 阅读 →
论文解读

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10575 字 阅读 →
论文解读

Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning

音频编码 | 7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9569 字 阅读 →
论文解读

EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales

多智能体协同 | 8.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9029 字 阅读 →
论文解读

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8863 字 阅读 →
论文解读

Evaluating the Expressive Appropriateness of Speech in Rich Contexts

语音质量评估 | 7.2/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9625 字 阅读 →
论文解读

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8876 字 阅读 →
论文解读

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

音视频问答 | 6.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9627 字 阅读 →
论文解读

Stage Light is Sequence^2: Multi-Light Control via Imitation Learning

舞台技术 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6801 字 阅读 →
论文解读

To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6769 字 阅读 →
论文解读

Stage Light is Sequence$^2$: Multi-Light Control via Imitation Learning

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7610 字 阅读 →
论文解读

NH-CROP: Robust Pricing for Governed Language Data Assets under Cost Uncertainty

强化学习 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5919 字 阅读 →
论文解读

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

视频描述生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4718 字 阅读 →