论文解读

Graph-based Modality Alignment for Robustness in Conversational Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5275 字 阅读 →
论文解读

HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection with Multichannel Audio and Multiscale Visual Cues

音频事件检测 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4420 字 阅读 →
论文解读

Hierarchical Tokenization of Multimodal Music Data for Generative Music Retrieval

音乐检索 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4794 字 阅读 →
会议任务专题

ICASSP 2026 - 多模态模型

共 6 篇 ICASSP 2026 多模态模型 方向论文

 · 更新于 2026-09-25 · 约 18 分钟 · 8700 字 阅读 →
论文解读

Improving Multimodal Brain Encoding Model with Dynamic Subject-Awareness Routing

脑信号编码 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5527 字 阅读 →
论文解读

InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 5000 字 阅读 →
论文解读

Inter-Dialog Contrastive Learning for Multimodal Emotion Recognition in Conversations

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4414 字 阅读 →
论文解读

Interval-Aware Retrieval Framework For Speech-Based Automatic Alzheimer’s Detection

语音生物标志物 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4971 字 阅读 →
论文解读

Investigating Modality Contribution in Audio LLMs for Music

模型评估 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3688 字 阅读 →
论文解读

Learning What to Hear: Boosting Sound-Source Association for Robust Audiovisual Instance Segmentation

音视频实例分割 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4721 字 阅读 →
论文解读

LETPAV: Lexicon-Enhanced Text with Progressive Audio-Visual Fusion for Multimodal Sentiment Analysis

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

Leveraging Large Multimodal Models for Audio-Video Deepfake Detection: A Pilot Study

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4328 字 阅读 →
论文解读

Leveraging prediction entropy for Automatic prompt weighting in Zero-Shot Audio-Language Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4393 字 阅读 →
论文解读

MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation Without Vector Quantization

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4829 字 阅读 →
论文解读

MCF: Text LLMS for Multimodal Emotional Causality

情感分析 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4895 字 阅读 →
论文解读

MECap-R1: Emotion-Aware Policy with Reinforcement Learning for Multimodal Emotion Captioning

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5068 字 阅读 →
论文解读

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4303 字 阅读 →
论文解读

Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4158 字 阅读 →
论文解读

Mitigating Language Prior-Induced Hallucinations via Bi-Level Contrastive Decoding

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3934 字 阅读 →