论文解读

Audio-Text Jailbreak Attack on Large Audio-Language Models: Towards Generality and Stealthiness

音频安全 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3636 字 阅读 →
论文解读

AudioFuse: Unified Spectral-Temporal Learning Via A Hybrid VIT-1D CNN Architecture for Phonocardiogram Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4254 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5499 字 阅读 →
论文解读

AVATAR: Audio-Visual Adaptive Fusion via Trained Agent Reinforcement for Multimodal Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4343 字 阅读 →
论文解读

AVO-65: A Large-Scale Hierarchical Audio-Visual Object Dataset

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4186 字 阅读 →
论文解读

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

音频深度伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5721 字 阅读 →
论文解读

Bimodal Fusion Framework for Dynamic Facial Expression Recognition In-The-Wild

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3875 字 阅读 →
论文解读

Bone-Conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4225 字 阅读 →
论文解读

Brainprint-Modulated Target Speaker Extraction

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4574 字 阅读 →
论文解读

CaMoD: Causal-Aware Modality Denoising for Multimodal Dialogue Intent Recognition

多模态对话意图识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4555 字 阅读 →
论文解读

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

模型评估 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4504 字 阅读 →
论文解读

Caption and Audio-Guided Video Representation Learning with Gated Attention for Partially Relevant Video Retrieval

视频检索 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4469 字 阅读 →
论文解读

CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries

音频检索 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3821 字 阅读 →
论文解读

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3824 字 阅读 →
论文解读

Clue2Emo: A Brain-Inspired Framework for Open-Vocabulary Multimodal Emotion Recognition

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6003 字 阅读 →
论文解读

Context-Aware Dynamic Graph Learning for Multimodal Emotion Recognition with Missing Modalities

语音情感识别 | 8.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4275 字 阅读 →
论文解读

Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5822 字 阅读 →
论文解读

Coupling Acoustic Geometry and Visual Semantics for Robust Depth Estimation

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9555 字 阅读 →
论文解读

CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content

跨模态检索 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4170 字 阅读 →