论文解读

Cross-Modal Bottleneck Fusion for Noise Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4237 字 阅读 →
论文解读

DAMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMS

视频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5719 字 阅读 →
论文解读

DBFT-SD: Weakly Supervised Multimodal Detection of Sensitive Audio-Visual Content

音频事件检测 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 4008 字 阅读 →
论文解读

DDSR-Net: Robust Multimodal Sentiment Analysis via Dynamic Modality Reliability Assessment

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8029 字 阅读 →
论文解读

DGSDNet: Dual-Graph Spectral Diffusion Network for Incomplete Multimodal Emotion Recognition in Conversations

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5031 字 阅读 →
论文解读

DPT-Net: Dual-Path Transformer Network with Hierarchical Fusion for EEG-based Envelope Reconstruction

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5126 字 阅读 →
论文解读

DSSR: Decoupling Salient and Subtle Representations Under Missing Modalities for Multimodal Emotion Recognition

情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5035 字 阅读 →
论文解读

Dual Contrastive Learning for Semi-Supervised Domain Adaptation in Bi-Modal Depression Recognition

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4365 字 阅读 →
论文解读

Dual-Perspective Multimodal Sentiment Analysis with MoE Fusion: Representation Learning via Semantic Resonance and Divergence

多模态情感分析 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4367 字 阅读 →
论文解读

Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems

语音对话系统 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4864 字 阅读 →
论文解读

EEG and Eye-Tracking Driven Dynamic Target Speaker Extraction with Spontaneous Attention Switching

语音分离 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4652 字 阅读 →
论文解读

Efficient Audio-Visual Inference Via Token Clustering And Modality Fusion

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4866 字 阅读 →
论文解读

EmoTri-RL: Emotion- and Cause-Aware Reinforcement Learning for Multi-Modal Empathetic Dialogue

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4826 字 阅读 →
论文解读

Empowering Multimodal Respiratory Sound Classification with Counterfactual Adversarial Debiasing for Out-of-Distribution Robustness

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4255 字 阅读 →
论文解读

Enhancing Audio Question-Answering Performance Through Log-Likelihood Guided Reward Functions

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4398 字 阅读 →
论文解读

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4320 字 阅读 →
论文解读

Fine-Tuning Large Audio-Language Models with Lora for Precise Temporal Localization of Prolonged Exposure Therapy Elements

音频事件检测 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5707 字 阅读 →
论文解读

FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4107 字 阅读 →
论文解读

FoleyBench: A Benchmark for Video-to-Audio Models

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4402 字 阅读 →
论文解读

Gelina: Unified Speech and Gesture Synthesis Via Interleaved Token Prediction

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5600 字 阅读 →