论文解读

StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems

自回归模型 | 9.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8092 字 阅读 →
论文解读

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

音频检索 | 6.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7023 字 阅读 →
论文解读

Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants

语音合成 | 7.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6565 字 阅读 →
论文解读

ITGPT: A Transformer Based Architecture for the Generation of Dance Dance Revolution and In the Groove Charts

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7824 字 阅读 →
论文解读

Large Audio Language Models for Spoofing-Aware Speaker Verification

语音伪造检测 | 6.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7545 字 阅读 →
论文解读

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

音视频生成 | 6.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6689 字 阅读 →
论文解读

RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9074 字 阅读 →
论文解读

SceneBind: Binding What and Where Across Vision, Audio and Language

音视频理解 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6403 字 阅读 →
论文解读

SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings

语音分离 | 8.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8674 字 阅读 →
论文解读

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

多模态模型 | 5.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6202 字 阅读 →
论文解读

Video = World + Event Stream

音频理解 | 4.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6888 字 阅读 →
论文解读

WanSong v1.0 Technical Report

音乐生成 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6596 字 阅读 →
论文解读

What does the model actually see? Evaluation protocols and input availability in data-driven prediction of room acoustic parameters

音频质量评估 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7819 字 阅读 →
论文解读

A Hybrid Mamba for Audio-Visual Navigation

声源定位 | 6.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7805 字 阅读 →
论文解读

Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion

语音转换 | 6.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8922 字 阅读 →
论文解读

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

语音质量评估 | 8.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7473 字 阅读 →
论文解读

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

音视频理解 | 9.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10324 字 阅读 →
论文解读

Bring Music The Horizon: Music-Driven 360^\circ Video Generation

音视频生成 | 5.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4986 字 阅读 →
论文解读

Cover First, Disagree Softly: Rethinking Mismatch-First Active Learning for Frame-Level Audio Classification

音频事件检测 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5869 字 阅读 →
论文解读

Do LLMs Need Architectural Changes for Simultaneous Speech Translation? A Prefix-to-Prefix Data Driven Approach

语音翻译 | 5.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7514 字 阅读 →