论文解读

一步到位改三维声场:SwanWeave 为何把事件、空间、运动与房间一起学

SwanWeave 针对 FOA 四通道声场的指令编辑任务,用可控房间仿真构造 125K/类单操作与 250K 复合操作的源-目标配对监督,以潜空间流匹配为生成器,配合双层路由的 SE-MoE 与面向错编负样本的 SPO 偏好对齐及分阶段课程,实现一阶段复合编辑,并在客观与人评上一致优于现有通用与立体声编辑基线,代价是依赖仿真数据与约 10 秒短场景。

 · 更新于 2026-09-24 · 约 26 分钟 · 12707 字 阅读 →
论文解读

不对齐文本、直接生成双声道:Text-Audiobox 如何做配音与对话

针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9093 字 阅读 →
论文解读

导演喊“再来一条”时,机器如何既不变声又听懂弦外之音

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10186 字 阅读 →
论文解读

剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本

音视频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9837 字 阅读 →
论文解读

在一条潜流里同时生成两条音轨:解耦语义与声学后的少步分离

音乐源分离 | 5.3/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11167 字 阅读 →
论文解读

7B 做原生音画同步:用门控与路由把对齐做轻,而不是把参数做大

扩散模型 | 5.9/10

 · 更新于 2026-09-24 · 约 30 分钟 · 14580 字 阅读 →
论文解读

合成语音越多越好吗?在音素层面重新称量文本的价值

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8699 字 阅读 →
论文解读

梵颂为何难唱:当吟诵的旋律不在文本里

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8810 字 阅读 →
论文解读

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

语音合成 | 9.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5401 字 阅读 →
论文解读

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6164 字 阅读 →
论文解读

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

音频分离 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4945 字 阅读 →
论文解读

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8158 字 阅读 →
论文解读

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

音视频生成 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7021 字 阅读 →
论文解读

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9642 字 阅读 →
论文解读

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

音频生成 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6649 字 阅读 →
论文解读

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

语音合成 | 6.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6735 字 阅读 →
论文解读

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6892 字 阅读 →
论文解读

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5494 字 阅读 →
论文解读

Beyond Reconstruction: Full-Context Generative DiT for Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7890 字 阅读 →
论文解读

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10289 字 阅读 →