论文解读

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

音视频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7777 字 阅读 →
论文解读

PHALAR: Phasors for Learned Musical Audio Representations

音乐生成 | 8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7969 字 阅读 →
论文解读

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

音视频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7734 字 阅读 →
论文解读

SONAR: Spectral‑Contrastive Audio Residuals for Generalizable Deepfake Detection

语音伪造检测 | 7.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7289 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

音视频生成 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6714 字 阅读 →
论文解读

Cross Domain Few-Shot Class-Incremental Audio Classification Via Adversarial Contrastive Learning

音频分类 | 7.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5131 字 阅读 →
论文解读

SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings

语音合成 | 5.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5960 字 阅读 →
论文解读

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

音视频理解 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5320 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24050 字 阅读 →
论文解读

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

音频检索 | 7.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5356 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-01

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 50963 字 阅读 →
论文解读

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

音乐生成 | 9.4/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1658 字 阅读 →
论文解读

Semi-Supervised Sound Event Detection with Conditional Mixup and Embedding-Level Contrastive Loss

对比学习 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5962 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-30

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 51078 字 阅读 →
论文解读

DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning

语音质量评估 | 9.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
论文解读

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4420 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 55 分钟 · 27448 字 阅读 →
论文解读

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6034 字 阅读 →
论文解读

Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4879 字 阅读 →
论文解读

Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement

语音增强 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6019 字 阅读 →