论文解读

Dual-Perspective Multimodal Sentiment Analysis with MoE Fusion: Representation Learning via Semantic Resonance and Divergence

多模态情感分析 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4367 字 阅读 →
论文解读

Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems

语音对话系统 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4864 字 阅读 →
论文解读

EEG and Eye-Tracking Driven Dynamic Target Speaker Extraction with Spontaneous Attention Switching

语音分离 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4652 字 阅读 →
论文解读

Efficient Audio-Visual Inference Via Token Clustering And Modality Fusion

音频问答 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4866 字 阅读 →
论文解读

EmoTri-RL: Emotion- and Cause-Aware Reinforcement Learning for Multi-Modal Empathetic Dialogue

语音情感识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4826 字 阅读 →
论文解读

Empowering Multimodal Respiratory Sound Classification with Counterfactual Adversarial Debiasing for Out-of-Distribution Robustness

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4255 字 阅读 →
论文解读

Enhancing Audio Question-Answering Performance Through Log-Likelihood Guided Reward Functions

音频问答 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4398 字 阅读 →
论文解读

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

音频问答 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4320 字 阅读 →
论文解读

Fine-Tuning Large Audio-Language Models with Lora for Precise Temporal Localization of Prolonged Exposure Therapy Elements

音频事件检测 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5707 字 阅读 →
论文解读

FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4107 字 阅读 →
论文解读

FoleyBench: A Benchmark for Video-to-Audio Models

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4402 字 阅读 →
论文解读

Gelina: Unified Speech and Gesture Synthesis Via Interleaved Token Prediction

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5600 字 阅读 →
论文解读

Graph-based Modality Alignment for Robustness in Conversational Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5275 字 阅读 →
论文解读

HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection with Multichannel Audio and Multiscale Visual Cues

音频事件检测 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4420 字 阅读 →
论文解读

Hierarchical Tokenization of Multimodal Music Data for Generative Music Retrieval

音乐检索 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4794 字 阅读 →
会议任务专题

ICASSP 2026 - 多模态模型

共 6 篇 ICASSP 2026 多模态模型 方向论文

 · 更新于 2026-09-06 · 约 18 分钟 · 8700 字 阅读 →
论文解读

Improving Multimodal Brain Encoding Model with Dynamic Subject-Awareness Routing

脑信号编码 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5527 字 阅读 →
论文解读

InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 5000 字 阅读 →
论文解读

Inter-Dialog Contrastive Learning for Multimodal Emotion Recognition in Conversations

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4414 字 阅读 →
论文解读

Interval-Aware Retrieval Framework For Speech-Based Automatic Alzheimer’s Detection

语音生物标志物 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4971 字 阅读 →