论文解读

Audio-Visual Feature Fusion for Calibrating Relevance Scores of Video Moment Retrieval

视频片段检索 | 7.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5439 字 阅读 →
论文解读

AUDIOCARDS: Structured Metadata Improves Audio Language Models for Sound Design

音频检索 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5242 字 阅读 →
论文解读

AudioFuse: Unified Spectral-Temporal Learning Via A Hybrid VIT-1D CNN Architecture for Phonocardiogram Classification

音频分类 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4254 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5499 字 阅读 →
论文解读

AUDIOGENIE-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning

音频问答 | 7.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5308 字 阅读 →
论文解读

Auditory Illusion Benchmark for Large Audio Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3529 字 阅读 →
论文解读

Auditory-Inspired Transformer for Binaural Speech Enhancement and Spatial Cue Preservation

语音增强 | 7.0/10

 · 更新于 2026-09-11 · 约 12 分钟 · 5802 字 阅读 →
论文解读

AURA: A Stegaformer-Based Scalable Deep Audio Watermark with Extreme Robustness

音频水印 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5484 字 阅读 →
论文解读

Auto-MatchCut: An Audio-Visual Retrieval Framework for Seamless Match Cutting

跨模态检索 | 7.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3899 字 阅读 →
论文解读

Automated Dysphagia Screening Using Noninvasive Neck Acoustic Sensing

音频分类 | 8.0/10

 · 更新于 2026-09-11 · 约 12 分钟 · 5574 字 阅读 →
论文解读

Automatic Estimation of Speaker Diarization Error Rate Based on Features of Audio Quality and Speaker Discriminability

说话人分离 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4339 字 阅读 →
论文解读

Automatic Music Mixing Using a Generative Model of Effect Embeddings

音乐生成 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5057 字 阅读 →
论文解读

Automatic Music Sample Identification with Multi-Track Contrastive Learning

音频检索 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4382 字 阅读 →
论文解读

AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook

音频生成 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4987 字 阅读 →
论文解读

Auxiliary Multi-Label Training For Improving the Robustness of Audio Deepfake Detection on AI-Processed Data

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3885 字 阅读 →
论文解读

AVATAR: Audio-Visual Adaptive Fusion via Trained Agent Reinforcement for Multimodal Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4343 字 阅读 →
论文解读

AVO-65: A Large-Scale Hierarchical Audio-Visual Object Dataset

音视频 | 7.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4186 字 阅读 →
论文解读

B-GRPO: Unsupervised Speech Emotion Recognition Based on Batched-Group Relative Policy Optimization

语音情感识别 | 6.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4316 字 阅读 →
论文解读

BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on POP and Classical Music

音乐信息检索 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4376 字 阅读 →
论文解读

Bayesian Low-Rank Factorization for Robust Model Adaptation

语音识别 | 8.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4176 字 阅读 →