论文解读

ALMA-Chor: Leveraging Audio-Lyric Alignment with Mamba for Chorus Detection

音乐信息检索 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4379 字 阅读 →
论文解读

AMBER2: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4014 字 阅读 →
论文解读

An Anomaly-Aware and Audio-Enhanced Dual-Pathway Framework for Alzheimer’s Disease Progression Classification

语音生物标志物 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5640 字 阅读 →
论文解读

An End-to-End Multimodal System for Subtitle Recognition and Chinese-Japanese Translation in Short Dramas

多模态模型 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5044 字 阅读 →
论文解读

An Unsupervised Alignment Feature Fusion System for Spoken Language-Based Dementia Detection

语音生物标志物 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4201 字 阅读 →
论文解读

AnimalCLAP: Taxonomy-Aware Language-Audio Pretraining for Species Recognition and Trait Inference

音频分类 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4960 字 阅读 →
论文解读

APKD: Aligned And Paced Knowledge Distillation Towards Lightweight Heterogeneous Multimodal Emotion Recognition

情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3585 字 阅读 →
论文解读

AQUA-Bench: Beyond finding answers to knowing when there are None in Audio Question Answering

音频问答 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3971 字 阅读 →
论文解读

Attention-Weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied To Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5893 字 阅读 →
论文解读

Attentive AV-Fusionnet: Audio-Visual Quality Prediction with Hybrid Attention

音视频 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4767 字 阅读 →
论文解读

Audience-Aware Co-speech Gesture Generation in Public Speaking via Anticipation Tokens

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Audio-Guided Multimodal Approach for Fine-Grained Alignment and Boundary Modeling in Active Speaker Detection

说话人检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4161 字 阅读 →
论文解读

Audio-Text Jailbreak Attack on Large Audio-Language Models: Towards Generality and Stealthiness

音频安全 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3636 字 阅读 →
论文解读

AudioFuse: Unified Spectral-Temporal Learning Via A Hybrid VIT-1D CNN Architecture for Phonocardiogram Classification

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4254 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5499 字 阅读 →
论文解读

AVATAR: Audio-Visual Adaptive Fusion via Trained Agent Reinforcement for Multimodal Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4343 字 阅读 →
论文解读

AVO-65: A Large-Scale Hierarchical Audio-Visual Object Dataset

音视频 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4186 字 阅读 →
论文解读

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

音频深度伪造检测 | 8.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding

多模态模型 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5721 字 阅读 →
论文解读

Bimodal Fusion Framework for Dynamic Facial Expression Recognition In-The-Wild

语音情感识别 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3875 字 阅读 →