论文解读

Look, Listen and Segment: Towards Weakly Supervised Audio-Visual Semantic Segmentation

音视频 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4187 字 阅读 →
论文解读

MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation Without Vector Quantization

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4829 字 阅读 →
论文解读

Malefa: Multi-Granularity Learning and Effective False Alarm Suppression for Zero-Shot Keyword Spotting

零样本关键词检测 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4936 字 阅读 →
论文解读

MC-MRX: Reference- and Midi-Guided Music Source Extraction with Contrastive Learning

音乐源提取 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5478 字 阅读 →
论文解读

Mitigating Language Prior-Induced Hallucinations via Bi-Level Contrastive Decoding

多模态模型 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3934 字 阅读 →
论文解读

Mitigating Shared-Private Branch Imbalance via Dual-Branch Rebalancing for Multimodal Sentiment Analysis

多模态模型 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5421 字 阅读 →
论文解读

Motionbeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding

舞蹈生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4092 字 阅读 →
论文解读

Multi-Scale Physiologically-Motivated Alignment for Auditory Attention Decoding

听觉注意力解码 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4347 字 阅读 →
论文解读

Noise-Robust Contrastive Learning with an MFCC-Conformer for Coronary Artery Disease Detection

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5224 字 阅读 →
论文解读

PADAM: Perceptual Audio Defect Assessment Model

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4814 字 阅读 →
论文解读

Prototype-Guided Cross-Modal Contrastive Learning for Continual Audio-Visual Sound Separation

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4252 字 阅读 →
论文解读

Rationale-Guided Learning for Multimodal Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4768 字 阅读 →
论文解读

RCAL: Reinforced Cross-Modal Alignment for Multimodal Sentiment Analysis with Sparse Visual Frames

多模态模型 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4562 字 阅读 →
论文解读

Representation-Based Data Quality Audits for Audio

数据集 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4054 字 阅读 →
论文解读

Representation-Diverse Self-Supervision for Cross-Domain Bioacoustic Learning in Low-Resource Settings

生物声学 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5415 字 阅读 →
论文解读

Rethinking Entity Disambiguation in Complex Modalities

实体消歧 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4884 字 阅读 →
论文解读

Salad-VAE: Semantic Audio Compression with Language-Audio Distillation

音频压缩 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4645 字 阅读 →
论文解读

Semantic-Guided Pseudo-Feature Attention Network for Audio-Visual Zero-Shot Learning

音频分类 零样本学习 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4921 字 阅读 →
论文解读

SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training

音频检索 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4546 字 阅读 →
论文解读

SmoothCLAP: Soft-Target Enhanced Contrastive Language-Audio Pretraining for Affective Computing

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3757 字 阅读 →