论文解读

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

音视频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4901 字 阅读 →
论文解读

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

音视频理解 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4759 字 阅读 →
论文解读

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

音视频理解 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4537 字 阅读 →
论文解读

Does Listening Matter? Backchanneling and Nodding in AI Clone

语音交互 | 5.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5992 字 阅读 →
论文解读

Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction

语音情感识别 | 5.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6000 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-21

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 60 分钟 · 29950 字 阅读 →
论文解读

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5610 字 阅读 →
论文解读

FM Synthesizer Audio-Parameter Shared Embeddings

音频生成 | 7.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4702 字 阅读 →
论文解读

Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges

多模态模型 | 6.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4562 字 阅读 →
论文解读

Multimodal Rapport Estimation in Real-World HRI

多模态模型 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4533 字 阅读 →
论文解读

Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities

音频理解 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4569 字 阅读 →
论文解读

Pedagogical AI in Mental Health: A Tri-Stream Fine-Tuned LLM Framework for Automated Clinical Supervision and Risk Triage

多模态模型 | 6.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Sounds Uncertain: Exploring the Affective Aspects of Sonification for Uncertainty Visualization

音频生成 | 6.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4366 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-20

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 47 分钟 · 23525 字 阅读 →
论文解读

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3605 字 阅读 →
论文解读

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5996 字 阅读 →
论文解读

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3159 字 阅读 →
论文解读

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

语音情感识别 | 8.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3361 字 阅读 →
论文解读

Uncertainty-Aware Decision Making in Multimodal Large Language Models

音频理解 | 6.8/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3533 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-19

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19678 字 阅读 →