每日研究速递

语音/音乐/音频论文速递 2026-05-09

共分析 3 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 10 分钟 · 4857 字 阅读 →
论文解读

Predictive-Generative Drift Decomposition for Speech Enhancement and Separation

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8741 字 阅读 →
论文解读

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

视频编辑 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6198 字 阅读 →
论文解读

Stage-adaptive audio diffusion modeling

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5813 字 阅读 →
论文解读

AsymK-Talker: Real-Time and Long-Horizon Talking Head Generation via Asymmetric Kernel Distillation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6222 字 阅读 →
论文解读

MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech

音频安全 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5419 字 阅读 →
论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

图像生成 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4164 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10720 字 阅读 →
论文解读

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

生成模型 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4862 字 阅读 →
论文解读

Bridging Piano Transcription and Rendering via Disentangled Score Content and Style

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6223 字 阅读 →
论文解读

DiffSDA: Unsupervised Diffusion Sequential Disentanglement Across Modalities

序列解耦 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6401 字 阅读 →
论文解读

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6971 字 阅读 →
论文解读

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5679 字 阅读 →
论文解读

Instilling an Active Mind in Avatars via Cognitive Simulation

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4426 字 阅读 →
论文解读

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

视频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4928 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5220 字 阅读 →
论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4810 字 阅读 →
论文解读

Latent Fourier Transform

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4922 字 阅读 →
论文解读

LayerSync: Self-aligning Intermediate Layers

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4057 字 阅读 →
论文解读

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

音频生成 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4846 字 阅读 →