论文解读

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

多模态模型 | 7.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5751 字 阅读 →
论文解读

SceneBind: Binding What and Where Across Vision, Audio and Language

音视频理解 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6403 字 阅读 →
论文解读

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

多模态模型 | 5.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6202 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-17

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 52 分钟 · 25719 字 阅读 →
论文解读

A Hybrid Mamba for Audio-Visual Navigation

声源定位 | 6.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7805 字 阅读 →
论文解读

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

音视频理解 | 9.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10324 字 阅读 →
论文解读

Music-to-Dance Generation via Atomic Movements

音乐生成 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6911 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-16

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 63 分钟 · 31364 字 阅读 →
论文解读

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

语音情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6817 字 阅读 →
论文解读

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

音视频 | 7.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8619 字 阅读 →
论文解读

Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis

音频事件检测 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7501 字 阅读 →
论文解读

A Production-Oriented Framework for Evaluation of SFX Generation

音频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7493 字 阅读 →
论文解读

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

音频生成 | 7.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7705 字 阅读 →
论文解读

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

提示学习 | 8.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10446 字 阅读 →
论文解读

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6661 字 阅读 →
论文解读

Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

多模态模型 | 6.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12190 字 阅读 →
论文解读

Local Multimodal Music Alignment from Global Supervision

对比学习 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7732 字 阅读 →
论文解读

LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

多模态模型 | 6.1/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10138 字 阅读 →
论文解读

MRUF: Multi-granularity Routing with Uncertainty-Aware Fusion for Robust Multimodal Sentiment Analysis

多模态模型 | 5.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8734 字 阅读 →
论文解读

Qwen-Music Technical Report

音乐生成 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7232 字 阅读 →