论文解读

同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹

音乐转录 | 8.2/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11909 字 阅读 →
论文解读

当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令

音乐生成 | 7.1/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13132 字 阅读 →
论文解读

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

空间音频 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4765 字 阅读 →
论文解读

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

语音增强 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Generalized Audio-Driven Synthesis of Precise Drummer Motion

音视频生成 | 7.8/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4876 字 阅读 →
论文解读

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

音视频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3309 字 阅读 →
论文解读

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

语音克隆 | 6.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7652 字 阅读 →
论文解读

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

音视频语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7543 字 阅读 →
论文解读

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

音视频语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6606 字 阅读 →
论文解读

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

空间音频 | 6.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8580 字 阅读 →
论文解读

Iterative Self-Learning for Expressive Text-to-Speech Synthesis

语音合成 | 6.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7178 字 阅读 →
论文解读

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8158 字 阅读 →
论文解读

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8252 字 阅读 →
论文解读

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

音频生成 | 6.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6421 字 阅读 →
论文解读

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

音视频生成 | 7.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6701 字 阅读 →
论文解读

HybridSB-MoE: Dual-Domain Schrödinger Bridges with Scene-Adaptive Expert Routing for Speech Enhancement

语音增强 | 5.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7143 字 阅读 →
论文解读

Luna-TTS Family Technical Report

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7839 字 阅读 →
论文解读

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5494 字 阅读 →
论文解读

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

音视频生成 | 7.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7019 字 阅读 →