论文解读

ACIR-MACL: Effective Multimodal Sentiment Analysis via Attention-Based Causal Intervention Regularization and Multi-Aspect Contrastive Learning

情感分析 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5347 字 阅读 →
论文解读

An Unsupervised Alignment Feature Fusion System for Spoken Language-Based Dementia Detection

语音生物标志物 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4201 字 阅读 →
论文解读

Audience-Aware Co-speech Gesture Generation in Public Speaking via Anticipation Tokens

音频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Audio-Text Jailbreak Attack on Large Audio-Language Models: Towards Generality and Stealthiness

音频安全 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3636 字 阅读 →
论文解读

Auto-MatchCut: An Audio-Visual Retrieval Framework for Seamless Match Cutting

跨模态检索 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3899 字 阅读 →
论文解读

Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding

多模态模型 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5721 字 阅读 →
论文解读

Bimodal Fusion Framework for Dynamic Facial Expression Recognition In-The-Wild

语音情感识别 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3875 字 阅读 →
论文解读

CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5139 字 阅读 →
论文解读

Cross-Modal Bottleneck Fusion for Noise Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4237 字 阅读 →
论文解读

Cross-Modal Knowledge Distillation for Speech Large Language Models

语音大模型 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3931 字 阅读 →
论文解读

DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4453 字 阅读 →
论文解读

Diffemotalk: Audio-Driven Facial Animation with Fine-Grained Emotion Control via Diffusion Models

语音情感识别 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5341 字 阅读 →
论文解读

Disentangling Physiology from Fidelity: Latent-Guided Diffusion Models for Cross-Modal Cardiac Synthesis

音频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5351 字 阅读 →
论文解读

Do Speech LLMs Learn Crossmodal Embedding Spaces?

音频检索 | 6.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4063 字 阅读 →
论文解读

DPT-Net: Dual-Path Transformer Network with Hierarchical Fusion for EEG-based Envelope Reconstruction

语音生物标志物 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5126 字 阅读 →
论文解读

Estimating Hand-Related Features from Speech Using Machine Learning

语音生物标志物 | 5.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3195 字 阅读 →
论文解读

Face-Voice Association with Inductive Bias for Maximum Class Separation

说话人验证 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4756 字 阅读 →
论文解读

From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-Modal Understanding in Multimodal LLMS

音频场景理解 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4037 字 阅读 →
论文解读

HarmoNet: Music Grounding by Short Video via Harmonic Resample and Dynamic Sparse Alignment

音乐检索 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4256 字 阅读 →
会议任务专题

ICASSP 2026 - 跨模态

共 2 篇 ICASSP 2026 跨模态 方向论文

 · 更新于 2026-09-24 · 约 6 分钟 · 2803 字 阅读 →