Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

📄 Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment 标签:#音乐生成 #自监督学习 #多模态模型 #对比学习 #扩散模型 7.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #自监督学习 | #多模态模型 #对比学习 | arxiv 👥 作者与机构 第一作者:Ryota Keio(Keio University, Sony Computer Science Laboratories) 通讯作者:未说明 作者列表:Ryota Keio(Keio University, Sony Computer Science Laboratories)、Sangheon Park(Georgia Institute of Technology)、Natalia Polouliakh(Sony Computer Science Laboratories)、Taketo Akama(Sony Computer Science Laboratories) 💡 毒舌点评 论文将单模态预训练、跨模态对比对齐和ControlNet生成三个模块“缝合”起来,系统设计思路清晰,实验也证明了模块组合的有效性。然而,其核心的对比学习目标与最终的生成质量之间缺乏深入的理论联系,且实验主要在一个较小的数据集上验证,音乐生成的主观质量也未显著超越移除核心模块的变体,让人不禁怀疑这更多是一次成功的工程集成,而非根本性的技术突破。 ...

2026-07-14 · 更新于 2026-08-14 · 3 min · 456 words

MusicMark: A Robust Generative Watermarking Framework for Music Generation

📄 MusicMark: A Robust Generative Watermarking Framework for Music Generation 标签:#音频水印 #扩散模型 #音乐生成 #鲁棒性 #音频理解 7.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频水印 | #扩散模型 | #音乐生成 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Seohwan Yun(高丽大学人工智能系) 通讯作者:Sungwoong Kim(高丽大学人工智能系) 作者列表:Seohwan Yun(高丽大学人工智能系)、Jeeyoung Yun(高丽大学人工智能系)、Yongjin Kim(高丽大学人工智能系)、Juyeon Lee(仁荷大学计算机工程系)、Sungwoong Kim(高丽大学人工智能系) 💡 毒舌点评 论文瞄准了AI生成音乐版权保护的真实痛点,并提出了一套在生成阶段就深度耦合水印的完整框架,其在神经网络编解码器重合成攻击下的鲁棒性提升是显著且令人信服的。然而,论文在方法创新上更多是“组合式创新”——将成熟的生成式水印思路(如在文本生成领域)迁移到复杂的音乐生成扩散模型上,并辅以巧妙的工程设计;同时,论文声称的“第一个生成式音乐水印框架”可能忽略了某些未被充分引用的相关工作,且未开源代码与模型的做法严重削弱了其影响力与可验证性。此外,评估中对“翻唱”攻击的定义与主流理解存在偏差,且评估数据均来自AI生成平台,其结论对真实世界音乐的泛化能力存疑。 ...

2026-07-14 · 更新于 2026-08-14 · 8 min · 1524 words

Qwen-Music Technical Report

📄 Qwen-Music Technical Report 标签:#音乐生成 #多模态模型 #歌唱生成 #扩散模型 #大语言模型 7.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.4/1.5 ✅ 7.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #多模态模型 | #歌唱生成 #扩散模型 | arxiv 👥 作者与机构 作者列表:来自 Qwen Team。论文附录列出了 Core Contributors 和 Contributors 的名单,其中 Jin Xu 标注为通讯作者。机构未在论文中明确说明。 💡 毒舌点评 亮点在于其将大语言模型的生成范式与专业音乐渲染管线深度融合,构建了一个完整、可控且在评测中表现突出的工业级系统,展现了团队强大的工程整合能力。短板在于整个系统完全闭源,且训练数据筛选、奖励模型构建等关键工程细节的“黑箱”属性,使其学术贡献的可验证性和可复现性大打折扣。 📌 核心摘要 本文介绍了Qwen-Music,一个用于生成带有人声完整歌曲的大规模音乐生成系统。该系统旨在解决从文本描述、歌词和音乐属性生成高质量、结构连贯歌曲,以及基于参考音频进行翻唱的技术挑战。核心方法是将生成过程解耦为语义作曲与声学渲染两个阶段,构建了Qwen-Music-Tokenizer、Qwen-Music-LLM和Qwen-Music-Render三大组件,并引入了旋律链式思维(Melody-CoT)机制进行显式旋律规划。相较于现有方法,其创新在于将大语言模型用于语义token序列建模,并设计了质量分级预训练课程和多阶段偏好对齐策略。在600个中英文提示词的客观评测中,Qwen-Music在16项音乐性和音频质量指标中的13项上取得最优结果;在盲测主观评估中,其生成质量优于MiniMax Music 2.6、Mureka V8、Suno V5等多个商业系统,并相对于最强的Suno V5.5略有优势(50.3% vs 49.7%)。该系统的实际意义在于推动了可控、高保真、结构连贯的端到端歌曲生成技术。主要局限性在于整个系统完全闭源,且训练数据筛选、奖励模型构建等关键工程细节不够透明,限制了其可复现性与学术影响力。 ...

2026-07-14 · 更新于 2026-08-14 · 4 min · 657 words

FreyaTTS Technical Report

📄 FreyaTTS Technical Report 标签:#语音合成 #扩散模型 #流匹配 #音频理解 #Transformer 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.7/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #扩散模型 | #流匹配 #音频理解 | arxiv 👥 作者与机构 第一作者:未说明(贡献者列表为 Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz,论文未明确标注第一作者或通讯作者) 通讯作者:未说明 作者列表:Ahmet Erdem Pamuk(未说明)、Ömer Yentür(未说明)、Ahmet Tunga Bayrak(未说明)、Yavuz Alp Sencer Öztürk(未说明)、Mustafa Yavuz(未说明) 💡 毒舌点评 这篇技术报告在土耳其语TTS的垂直领域里,将已有的非自回归流匹配架构与冻结的VAE潜空间结合,做出了一套完整、高效且经过“生产硬化”的系统,工程实现和部署考量比大多数学术论文都扎实。然而,其核心创新(非自回归DiT在冻结潜空间中生成)并非全新范式,且实验评估仅限于一个自建的495句基准,在通用性和与其他真正为土耳其语优化过的系统(而非通用英语系统的土耳其语分支)的严格对比上仍有说服力缺口。论文作者也坦诚地指出了其模型在干净对话文本上的错误率仍高于两个基于音素的紧凑VITS基线,这是一个重要的性能界限。 ...

2026-07-13 · 更新于 2026-08-14 · 3 min · 529 words

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

📄 ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models 标签:#语音合成 #扩散模型 #流匹配 #语音编码 #高效推理 7.5/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #扩散模型 | #流匹配 #语音编码 | arxiv 👥 作者与机构 第一作者:Sang-Hoon Lee 通讯作者:未说明 作者列表:Sang-Hoon Lee(未说明)、Ha-Yeong Choi(未说明) 💡 毒舌点评 本文提出的“从表示对齐到表示生成”的范式转变是深刻且有效的,层次化解耦设计显著提升了低比特率场景下的生成质量,实验结果令人信服。然而,其核心创新(ReGen框架与GFM)本质上是将现有表示学习、流匹配和对抗训练等成熟技术进行巧妙的工程整合与优化,并非根本性的理论突破,创新高度有限。 📌 核心摘要 本文针对极低比特率波形生成中,表示对齐(REPA)可能隐式纠缠潜在表示、限制模型生成能力的问题,提出了ReGen框架。其核心是将REPA的正则化范式转变为显式的层次化多提示表示生成,在单一扩散模型内联合估计语义、声学和波形多个层级的向量场。此外,论文引入广义流匹配(GFM)以改善条件流匹配的泛化性,防止多模态轨迹坍缩。实验表明,ReGen在神经音频编解码器(25 Hz, 400 bps)和VAE(12.5 Hz)上显著提升了波形生成质量。基于此,论文进一步构建了高效的LDM文本到语音系统ReGenVoice,以6.25 Hz的极低帧率运行,在4块GPU上仅需1天训练,在可懂度和说话人相似性上表现出色,并实现了0.08的RTF。主要局限是模型仍需对抗后训练来优化和加速采样,且当前开源承诺尚未完全兑现。 ...

2026-07-13 · 更新于 2026-08-14 · 7 min · 1333 words

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

📄 Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation 标签:#音乐生成 #扩散模型 #音频理解 #Transformer #模型评估 5.6/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音乐生成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:黄明阳(通义实验室,阿里巴巴集团) 通讯作者:未说明 作者列表:黄明阳(通义实验室,阿里巴巴集团)、张鹏(通义实验室,阿里巴巴集团)、胡力(通义实验室,阿里巴巴集团)、王广源(通义实验室,阿里巴巴集团)、张磅(通义实验室,阿里巴巴集团) 💡 毒舌点评 亮点:提出了一种“全局规划+局部精修”的分层架构,并配合动态帧率和光流损失,为生成分钟级、720p/30fps的连贯音乐驱动舞蹈视频提供了一套工程上可行的方案。论文写作结构清晰,实验图表直观。 槽点:1)评估严重依赖作者自行设计的主观打分,完全缺失独立的人类评估,使得所有宣称的“SOTA”得分可靠性存疑。2)基线选择存在严重问题,仅对比了两个较早或能力受限的方法(MusicInfuser, X-Dancer),刻意回避了与其基础模型Wan-I2V以及近期提出的强基线(如Seedance, FramePack)的直接对比,难以证明其优越性源于方法创新而非更强大的基座。3)全文未提及任何开源计划,所有实验在私有数据集上进行,可复现性几乎为零,严重削弱了其作为学术贡献的影响力。4)关键组件(如“Music block”)细节模糊,消融实验不完整。 📌 核心摘要 本文要解决的核心问题是:当前视频扩散模型受限于计算复杂度和长程时间一致性建模困难,无法生成超过20秒的连贯、高分辨率、且与音乐节奏精准同步的舞蹈视频。 为解决此问题,论文提出了名为Wan-Dancer的层次化框架。其核心创新在于将生成过程解耦为“全局关键帧规划”和“局部时序精修”两个阶段。在全局阶段,模型利用音乐的完整上下文生成稀疏的关键帧序列以把握整体编舞结构;在局部阶段,模型以这些关键帧为锚点,生成高质量的中间帧,确保细节连贯。 与已有方法相比,Wan-Dancer的新颖性体现在:1)提出了一种将RoPE与绝对时间映射结合的动态帧率适应机制,以处理不同时长的音乐;2)引入了基于光流的损失函数来增强运动连续性;3)采用运动速度分层训练策略。 实验结果表明,该框架能够生成时长超过1分钟、720p/30fps的连贯舞蹈视频。在与MusicInfuser和X-Dancer的定量对比中,Wan-Dancer在舞蹈质量、视频质量和提示对齐度上均取得了显著优势(例如,在舞蹈质量平均分上达到8.46分,而MusicInfuser和X-Dancer分别为6.23和6.06分)。消融实验验证了全局规划、光流损失和动态帧率等关键组件的有效性。 实际意义在于,该工作为生成长序列、高保真且与音频严格同步的视频内容提供了一套有效的工程解决方案,对内容创作领域有直接应用价值。 主要局限性包括:1)未开源任何代码、模型或数据,可复现性差;2)缺乏与更多先进端到端视频生成模型(如论文中提及的Wan、HunyuanVideo等)的对比;3)评估仅限于有限的定量指标和定性展示,缺少人类主观评估;4)框架仅处理单人舞蹈,未扩展到多人交互场景。 ...

2026-07-13 · 更新于 2026-08-14 · 3 min · 457 words

Vidu S1: A Real-Time Interactive Video Generation Model

📄 Vidu S1: A Real-Time Interactive Video Generation Model 标签:#音视频交互 #扩散模型 #多模态模型 #语音识别 #音频理解 5.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 📝 5.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #扩散模型 | #多模态模型 #语音识别 | arxiv 👥 作者与机构 作者列表:Jintao Zhang, Kai Jiang, Jintao Chen, et al. 机构信息:论文摘要中未提供任何机构信息,无法确认作者所属机构,均写为“未说明”。 💡 毒舌点评 这篇所谓的“论文”更像一份精心包装的产品技术白皮书,而非严谨的学术贡献。它成功地将一个具有巨大应用潜力的系统(实时语音驱动数字人)推向市场,但代价是完全牺牲了学术论文的基本准则:透明性与可复现性。通篇充斥着性能声明(如“最佳性能”、“42FPS”),却吝啬于提供任何可验证的数据、对比基线或技术细节。其核心组件“TurboDiffusion”和“TurboServe”被当作营销黑话而非可理解的算法,这使得整个工作沦为一个无法被学术界学习、验证和跟进的黑箱。审稿人只能为其在应用前景和工程集成度上鼓掌,但必须因其对科学可验证性的漠视而给予严厉的批评。 📌 核心摘要 本文介绍了Vidu S1,一个声称支持通过语音指令实时控制数字角色、并生成无限长度高质量视频的交互式系统。该系统基于名为“TurboDiffusion”的生成模型和“TurboServe”的推理服务框架构建。论文宣称其能在普通消费级GPU上实现540p分辨率下高达42FPS的实时生成,解决了长时间视频生成中常见的模糊、漂移和视觉失真问题。此外,系统支持用户上传自定义角色图像并选择语音音色以实现个性化。论文声称实验表明Vidu S1在所有测试指标上均达到最佳性能,并提供了一个在线Demo。然而,摘要中未提供任何关于具体实验指标、数值、对比基线、模型架构细节或训练方法的信息,其所有技术声明均缺乏证据支撑。 ...

2026-07-10 · 更新于 2026-08-14 · 1 min · 203 words

Vidu S1: A Real-Time Interactive Video Generation Model

📄 Vidu S1: A Real-Time Interactive Video Generation Model 标签:#音视频生成 #扩散模型 #实时处理 #高效推理 6.4/10 | 创新 1.2/2 | 严谨 1.5/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频生成 | #扩散模型 | #实时处理 #高效推理 | arxiv 👥 作者与机构 第一作者:张锦涛、姜凯、陈锦涛、王旭、罗洋、王玉洁(共同第一作者) 通讯作者:邓志劼、包凡、陈建飞、朱军 作者列表:张锦涛(清华大学, 生数科技)、姜凯(清华大学, 生数科技)、陈锦涛(清华大学, 生数科技)、王旭(清华大学, 生数科技)、罗洋(清华大学, 生数科技)、王玉洁(清华大学, 生数科技)、陈德川(清华大学, 生数科技)、李俊刚(清华大学, 生数科技)、叶成洋(未说明机构)、Marco Chen(未说明机构)、朱弘洲(清华大学, 生数科技)、赵旻(清华大学, 生数科技)、蒋宇轩(清华大学, 生数科技)、黄正坤(清华大学, 生数科技)、向辰东(清华大学, 生数科技)、郑凯文(清华大学, 生数科技)、王浩旭(清华大学, 生数科技)、王小航(清华大学, 生数科技)、贾琦(未说明机构)、陈鑫(未说明机构)、陈逸民(未说明机构)、蒋佑和(清华大学, 生数科技)、付方程(清华大学, 生数科技)、邓志劼(清华大学)、包凡(清华大学)、陈建飞(清华大学)、朱军(清华大学) 💡 毒舌点评 本文是一份典型的“工程重于科学”的系统技术报告。其最大价值在于详尽地展示了如何将学术界已有的技术(扩散模型、蒸馏、缓存策略、注意力加速)整合成一个可工作的实时交互视频生成产品,并坦诚地描述了工程实现中的关键瓶颈与解决方案(如TwinCache、量化策略选择)。然而,作为一篇寻求学术认可的论文,其严谨性令人失望:核心模型架构细节、训练超参数、数据集规模完全黑箱,实验设计回避与最强开源基线的直接对抗,评估深度不足,更像一份精心包装的营销技术白皮书而非可验证的科研贡献。对于追求可复现性与学术深度的读者,这篇文章提供的信息密度太低。 ...

2026-07-10 · 更新于 2026-08-14 · 3 min · 578 words

BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech

📄 BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech #语音合成 #多语言 #领域适应 #参数高效微调 #扩散模型 6.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | #语音合成 | #领域适应 | #多语言 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Ho Lam Chung(未说明) 通讯作者:未说明 作者列表:Ho Lam Chung(未说明)、Bo-Xuan Zheng(未说明)、Cheng-Chieh Huang(未说明)、Cheng-Han Chang(未说明)、Jung-Ching Chen(未说明)、Lok-Lam Ieong(未说明)、Ting-Lin Hsiao(未说明)、Yu-Cheng Lee(未说明)、Yi-Hsin Chung(未说明)、Yu-Kai Guo(未说明)、Hung-yi Lee(未说明) 💡 毒舌点评 论文从字节级 BPE 的 tokenizer 到十亿参数语言模型前端再到 TTS 合成,堆出了一条完整的台湾本土化语音合成栈。PangolinTokenizer 在台湾多脚本文本上做到了最低 token 率和最高词汇效率,Barbet 作为前端在中文生成任务上压过同类模型,BlueMagpie-TTS 的 CER 从 11.45% 降到 4.81%,盲听偏好遥遥领先。但整套方案的核心(声学堆栈、BPE、Mamba 混合架构)几乎全部复用现有组件,真正的创新在于针对台湾语境做数据适配和前端替换,并通过桥接蒸馏与联合微调把各部分粘在一起。更致命的是,所有资源一概未开源,整个 pipeline 的复现性极差,学术价值和社区推动力因此大打折扣。 ...

2026-07-08 · 更新于 2026-08-14 · 4 min · 798 words

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

📄 DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech #语音合成 #扩散模型 #参数高效微调 #低资源 7.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | #语音合成 | #扩散模型 | #参数高效微调 #低资源 | arxiv 👥 作者与机构 第一作者:Junwon Moon(未说明) 通讯作者:未说明 作者列表:Junwon Moon、Seungbeom Kim、Yejin Lee、Hoseong Ahn、Sewoong Park、Heeseung Kim、Kyuhong Shim(七位作者均未说明所属机构,但从致谢与主观评测部分可推断其隶属韩国学术机构) 💡 毒舌点评 本文把“先做容易的”这条直觉从文本领域搬运到语音合成,工程上灵巧干净,仅用585小时数据就在WER上掀翻了自家骨干和若干数据量百倍于己的对手。但数据量的鸿沟是荣耀也是隐忧,零开源更是让所有这些漂亮数字只能停留在纸面上,社区无法验证,只能姑妄听之。 📌 核心摘要 要解决的问题:传统自回归(AR)文本转语音(TTS)模型采用严格的从左到右依次生成语音token的方式,推理速度随序列线性增长,且无法利用未来上下文信息,导致在序列起始等证据不足的位置置信度极低,容易产生幻觉和错误累积。 方法核心:提出DELTA-TTS,一个基于LoRA的轻量级适配框架。它冻结预训练的AR TTS骨干网络,通过增加双向注意力、块级LoRA适配器和Conformer风格卷积模块,将其转换为一个按置信度排序生成的离散扩散语言模型(dLLM)。 新颖性:首次将AR-to-dLLM的转换范式从文本领域迁移到语音TTS。针对语音信号强烈的局部时序相关性,引入了卷积模块来弥补全局双向注意力对局部结构建模的不足,并设计了配套的1/t加权损失和时间偏移推理调度策略,系统性地实现了“先易后难”的生成顺序。 主要实验结果:仅使用585小时的LibriTTS数据训练,在Seed-TTS test-en基准上取得了1.75%的词错误率(WER),优于其AR骨干CosyVoice3的2.02%,并超越了多个参数量和数据量远大于它的基线模型,同时推理速度提升3.3倍。 类型 模型 参数量 训练数据 (小时) Seed-TTS test-en WER (%) ↓ SIM ↑ AR CosyVoice3 0.5B 1000K Multilingual 2.02 0.692 AR Seed-TTS N/A N/A 2.25 0.762 AR VoxCPM 0.5B 1800K Multilingual 1.85 0.729 NAR MaskGCT (50 NFE) 1.1B 100K Emilia 2.62 0.714 NAR F5-TTS (32 NFE) 0.3B 100K Emilia 2.00 0.647 Ours DELTA-TTS 0.5B+94M 0.585K LibriTTS 1.75 0.688 实际意义:为工业界大规模部署的AR TTS模型提供了一条低成本(仅需15%新增参数和少量适配数据)、高效率的升级路径,能显著提升推理速度并缓解幻觉问题,尤其是在长语音合成场景下加速效果更佳(4.46倍)。 主要局限性:目标语音长度目前依赖于一个基于文本长度的启发式规则,不够鲁棒;方法目前仅在英语和CosyVoice3这一单一骨干模型上进行了验证。 🔗 开源详情 代码:否。论文中未提及代码链接。 模型权重:否。论文中未提及。 数据集: 训练数据:LibriTTS(585小时),论文中未提供下载链接。 评估数据:Seed-TTS test‑en(1088条)、LibriSpeech‑PC test‑clean Subset B(1127条),论文中未提供下载链接。 Demo:否。论文中未提及。 复现材料:否。附录A.1提供了部分实现细节(LoRA配置、卷积核大小、学习率、batch size、混合精度训练等),但未提供代码、配置文件或模型检查点。 论文引用的开源项目或资源链接: CosyVoice: https://github.com/FunAudioLLM/CosyVoice CosyVoice HuggingFace评估页: https://huggingface.co/FunAudioLLM/CosyVoice-300M Spark TTS: https://github.com/SparkAudio/Spark-TTS FireRedTTS(FireRedTTS2): https://github.com/FireRedTeam/FireRedTTS2 IndexTTS2: https://github.com/IndexTeam/IndexTTS2 Llasa: https://github.com/LlasaTeam/Llasa VoxCPM: https://github.com/VoxCMTeam/VoxCPM DiTAR: https://github.com/DiTAR-project/DiTAR MaskGCT: https://github.com/open-mmlab/Amphion/tree/main/models/tts/maskgct E2 TTS: https://github.com/SWivid/E2-TTS F5-TTS: https://github.com/SWivid/F5-TTS Whisper: https://github.com/openai/whisper faster-whisper: https://github.com/SYSTRAN/faster-whisper WavLM: https://github.com/microsoft/unilm/tree/master/wavlm SpeechMOS (UTMOS): https://github.com/tarepan/SpeechMOS LoRA (Hu et al., 2022): https://github.com/microsoft/LoRA Conformer (Gulati et al., 2020): 未提供单独开源链接(通常指ESPnet等实现) 🏗️ 方法概述和架构 DELTA-TTS的整体流程是一个将预训练AR TTS模型转换为离散扩散语言模型(dLLM)的框架。其核心思想是冻结原AR模型的主体参数,仅通过添加少量可训练模块来改变其生成范式。输入为标准零样本TTS输入(文本、提示语音等),输出为目标语音波形。 ...

2026-07-07 · 更新于 2026-08-14 · 2 min · 379 words