每日研究速递

语音/音乐/音频论文速递 2026-06-19

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 110 分钟 · 54842 字 阅读 →
论文解读

Audio-to-Audio via Diffusion Warm Initialization

音频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6293 字 阅读 →
论文解读

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

语音合成 | 9.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5638 字 阅读 →
论文解读

AdaTT: Text-Guided Instrument Timbre Transfer with Target-Adaptive Structural Control

音频生成 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5380 字 阅读 →
论文解读

DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization

语音转换 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9064 字 阅读 →
论文解读

Fast When, Careful Who: Dual-Process Multiparty Turn-Taking with Diffusion Augmentation

语音活动检测 | 5.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6103 字 阅读 →
论文解读

Joycent: Diffusion-based Accent TTS without Accented Phone Prediction

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5195 字 阅读 →
论文解读

MUNI: Multimodal Unified Latent Diffusion for Coherent Any-to-Any Generation

语音生成 | 6.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5373 字 阅读 →
论文解读

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

音频生成 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5275 字 阅读 →
论文解读

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

语音合成 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6238 字 阅读 →
论文解读

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5771 字 阅读 →
论文解读

PianoKontext: Expressive Performance Rendering from Deadpan Context

音乐生成 | 9.1/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4271 字 阅读 →
论文解读

Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models

语音分离 | 7.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6713 字 阅读 →
论文解读

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

语音合成 | 7.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5034 字 阅读 →
论文解读

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6269 字 阅读 →
论文解读

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

语音合成 | 9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6999 字 阅读 →
论文解读

Your U-Net Dereverberation Model is Secretly an RIR Encoder

对比学习 | 8.3/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4101 字 阅读 →
论文解读

DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

扩散模型 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6540 字 阅读 →
论文解读

Entropy as a Structural Prior: How a Log-Barrier on DiT Belief Space Drives Musical Diversity and Development

音乐生成 | 4.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7818 字 阅读 →
论文解读

TargetSEC: Plug-and-Play In-the-Wild Speech Emotion Conversion via Arousal-Conditioned Latent Style Diffusion

语音转换 | 6.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5649 字 阅读 →