论文解读

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

多模态模型 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 7003 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-10

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 45 分钟 · 22351 字 阅读 →
论文解读

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

音视频问答 | 5.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7600 字 阅读 →
论文解读

KVAE: Family of Tokenizers for Multimodal Generative Models

音频编码 | 8.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7110 字 阅读 →
论文解读

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

音视频生成 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5522 字 阅读 →
论文解读

A Dual Evaluation for Music Transcription

音乐转录 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8387 字 阅读 →
论文解读

AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation

音频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5452 字 阅读 →
论文解读

C^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

音视频理解 | 4.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8343 字 阅读 →
论文解读

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

音视频交互 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7757 字 阅读 →
论文解读

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

语音情感识别 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7528 字 阅读 →
论文解读

Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE

音视频语音分离 | 6.8/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10746 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-06

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 73 分钟 · 36201 字 阅读 →
论文解读

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4713 字 阅读 →
论文解读

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

音视频问答 | 4.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5952 字 阅读 →
论文解读

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

音视频问答 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5761 字 阅读 →
论文解读

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

音频理解 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6060 字 阅读 →
论文解读

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

音视频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7260 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-05

共分析 32 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 93 分钟 · 46258 字 阅读 →
论文解读

AcoustiTrace: When Plausible Sound Violates Physics

音视频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6749 字 阅读 →
论文解读

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

音频分类 | 6.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6641 字 阅读 →