论文解读

Auditory Illusion Benchmark for Large Audio Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-13 · 约 8 分钟 · 3529 字 阅读 →
论文解读

Auditory-Inspired Transformer for Binaural Speech Enhancement and Spatial Cue Preservation

语音增强 | 7.0/10

 · 更新于 2026-09-13 · 约 12 分钟 · 5802 字 阅读 →
论文解读

AURA: A Stegaformer-Based Scalable Deep Audio Watermark with Extreme Robustness

音频水印 | 7.5/10

 · 更新于 2026-09-13 · 约 11 分钟 · 5484 字 阅读 →
论文解读

Auto-MatchCut: An Audio-Visual Retrieval Framework for Seamless Match Cutting

跨模态检索 | 7.0/10

 · 更新于 2026-09-13 · 约 8 分钟 · 3899 字 阅读 →
论文解读

Automated Dysphagia Screening Using Noninvasive Neck Acoustic Sensing

音频分类 | 8.0/10

 · 更新于 2026-09-13 · 约 12 分钟 · 5574 字 阅读 →
论文解读

Automatic Estimation of Speaker Diarization Error Rate Based on Features of Audio Quality and Speaker Discriminability

说话人分离 | 7.5/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4339 字 阅读 →
论文解读

Automatic Music Mixing Using a Generative Model of Effect Embeddings

音乐生成 | 7.5/10

 · 更新于 2026-09-13 · 约 11 分钟 · 5057 字 阅读 →
论文解读

Automatic Music Sample Identification with Multi-Track Contrastive Learning

音频检索 | 7.5/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4382 字 阅读 →
论文解读

AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook

音频生成 | 8.0/10

 · 更新于 2026-09-13 · 约 10 分钟 · 4987 字 阅读 →
论文解读

Auxiliary Multi-Label Training For Improving the Robustness of Audio Deepfake Detection on AI-Processed Data

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-13 · 约 8 分钟 · 3885 字 阅读 →
论文解读

AVATAR: Audio-Visual Adaptive Fusion via Trained Agent Reinforcement for Multimodal Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4343 字 阅读 →
论文解读

AVO-65: A Large-Scale Hierarchical Audio-Visual Object Dataset

音视频 | 7.0/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4186 字 阅读 →
论文解读

B-GRPO: Unsupervised Speech Emotion Recognition Based on Batched-Group Relative Policy Optimization

语音情感识别 | 6.5/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4316 字 阅读 →
论文解读

BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on POP and Classical Music

音乐信息检索 | 7.5/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4376 字 阅读 →
论文解读

Bayesian Low-Rank Factorization for Robust Model Adaptation

语音识别 | 8.0/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4176 字 阅读 →
论文解读

Bayesian Signal Separation Via Plug-and-Play Diffusion-Within-Gibbs Sampling

语音分离 | 7.5/10

 · 更新于 2026-09-13 · 约 10 分钟 · 4956 字 阅读 →
论文解读

BBPE16: UTF-16-Based Byte-Level Byte-Pair Encoding for Improved Multilingual Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-13 · 约 7 分钟 · 3372 字 阅读 →
论文解读

Beamforming Using Virtual Microphones for Hearing Aid Applications

语音增强 | 7.5/10

 · 更新于 2026-09-13 · 约 8 分钟 · 3819 字 阅读 →
论文解读

Beat and Downbeat Detection: A Reformulated Approach

音乐理解 | 7.5/10

 · 更新于 2026-09-13 · 约 9 分钟 · 4272 字 阅读 →
论文解读

BeatMamba: Bidirectional Selective State-Space Modeling for Efficient Beat Tracking

音乐信息检索 | 7.5/10

 · 更新于 2026-09-13 · 约 10 分钟 · 4564 字 阅读 →