📄 梵颂为何难唱:当吟诵的旋律不在文本里

英文题目:Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit

一句话:为把梵语诗节准确唱出来,Vāgdhenu 放弃在文本侧学习韵律,转而用韵律精确匹配的参考音频去“填充”流匹配模型,并在约 5 小时单人数据上首次完整唱对卷舌送气等密集辅音丛,代价是韵律只能靠参考模板克隆而无法自由设计。

标签:#语音合成 #流匹配 #低资源 #多语言

评分:7.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5

👥 作者与机构

  • Prathosh A P:机构信息未在 arXiv HTML 中可靠披露

💬 毒舌点评

把梵颂吟诵这个低资源高规约任务做成可交付流水线并用 Kannada 路由、韵律感知参考检索和半参考规则解决真实卡点,负结果剖析比多数正结果更有价值;短板是评估仅为单人专家非盲测且 MOS 跨代不可比,所谓韵律感知本质是参考检索而非可控生成,声学骨干与声码器均为现成组件复用,架构创新有限。

📌 核心摘要

本文解决梵语韵律诗节(śloka)到吟诵(parāyaṇa chant)的高保真语音合成问题,目标是保持长元音、尾随 visarga、卷舌与送气对立及密集辅音丛的正确发音并尊重诗律(vṛtta)结构。系统 Vāgdhenu 以现成流匹配(Flow Matching)语音合成骨干(Chen et al. 2024; AI4Bharat 2024,约 337M 参数的扩散变换器 DiT)与大规模对抗声码器 BigVGAN-v2(Lee et al. 2023)为基础,构建脚本感知前端、韵律感知的参考选择机制与面向源文本校验的质量控制栈。核心机制差异在于放弃文本侧韵律条件,转为通过精确匹配参考音频的韵律模板进行上下文填充式克隆,并通过 Kannada 文字路由规避 Devanagari 在指示模型中的固有元音删除问题。最能支撑结论的证据是同一单说话人数据上四代架构的演进中,流匹配骨干以约 5 小时微调在专家平均意见分(Mean Opinion Score, MOS)上达到约 4.6 分并首次完整渲染含卷舌送气在内的辅音丛,而此前三代 StyleTTS2(约 3.0 至 4.2)、VITS2、Matcha-TTS(约 4.2 至 4.3)均触及天花板。该系统已落地两个大规模部署(Mahābhārata Tātparya Nirṇaya 5183 诗节约 17.5 小时视频语料;Śrīmad Bhāgavatam 约 18000 诗节音频应用)并开源前端、推理与训练代码、模型权重与吟诵数据集。局限在于缺乏多听者盲测与置信区间,韵律可设计性在当前自填充骨干上被证明不可达,且评估依赖非可比的专家估计。

🔗 开源与复现资源

  • 代码:https://github.com/prathoshap/vagdhenu ,包含前端、推理路径、reference bank 和训练脚本,采用 permissive license
  • 模型权重:https://huggingface.co/prathoshap ,包含生产版本 voice、reference-driven fallback voice 和 fine-tuned vocoder,遵循基座模型的 permissive licenses
  • 数据集:单说话人 chant 数据集,约 1467 个 clips,约 5.3 小时,涵盖 2 种录制风格,其中主风格保留部分约 3.0 小时、764 首 verses、约 33700 个 syllables,覆盖约 9 个 meter families,获取链接为 https://huggingface.co/prathoshap ,采用 Creative Commons attribution license
  • Demo:https://huggingface.co/spaces/prathoshap/vagdhenu-demo ,支持任意 Brahmic script 输入、自动检测 vṛtta、检测不确定时回退到默认 meter,提供示例 verses 菜单,运行于 on-demand GPU hosting
  • 复现材料:训练基于 Indic checkpoint,学习率 1e-5,frame batch 约 12800 至 19200,显存约 28GB,使用 bfloat16 训练数百个 epoch,每 500 至 2000 步保存 checkpoint,采用 2 块 GPU 的 distributed-data-parallel,使用 100-band mel,采样率 24 kHz,另有基于 179 个 paired clips 的 voice-steering retrain,vocoder 在 backbone 自身 mel 上 fine-tune 并对最后若干 checkpoint 做 exponential-moving-average soup,推理采用 Euler solver,number-of-function-evaluations 为 64,sway-sampling coefficient 约 -0.7 至 0.7,speed factor 为 0.90,per-clip duration budget 按附录设定,训练与渲染使用 2 块 RTX A6000 48GB GPU,论文附录提供 locked inference 参数和训练细节
  • 论文中引用的开源项目:flow-matching TTS backbone 来自 Chen et al. 2024 与 AI4Bharat 2024,论文中未提供链接,大规模对抗 vocoder 来自 Lee et al. 2023,论文中未提供链接,semantic-token zero-shot synthesizer 来自 Du et al. 2024,论文中未提供链接,description-conditioned 模型来自 Lyth and King 2024 与 AI4Bharat and Hugging Face 2024,论文中未提供链接

🧭 深度解读

为什么梵语吟诵不是普通的朗读?

想象你拿到一首梵语诗节,文字上每个音节都标得清清楚楚,你让一个会说印地语的多语语音模型去读。它很可能把词尾本该保留的元音吞掉,把送气与不送气的对立读混,把 3 种不同的擦音读成同一个“s”,更别说把 ṭh、ḍh 这类卷舌送气辅音丛干净地吐出来。听感上,这就像让习惯英语连读的人去唱昆曲,字都对,但腔全错。

梵语的 parāyaṇa 吟诵,本质是一种唱。它的正确性有两层硬约束。一层是音系:长元音要拉住,词尾的 visarga(一种特殊的送气尾音)要根据前一个元音的长短决定是轻喷还是自然延长,鼻音 anusvāra 要随后面辅音的发音部位同化,jihvāmūlīya、upadhmānīya 这类 visarga 的同位异音也要保留。另一层是诗律 vṛtta:每个诗节由轻重音节 laghu/guru 排成的固定签名决定节奏与停顿 yati 的位置。模型如果只学会“把字读出来”,吟诵的旋律轮廓就立不住。

更麻烦的是资源。高质量的吟诵数据几乎没有现成的,而自然文本中 anuṣṭubh 一种韵律就占到近半甚至 8 成以上,长韵律天然欠采样。低资源加上高规约,让这个任务成为语音合成里典型的“数据少、规矩多、容错低”的角落。

在语音合成的版图里,它站在哪里?

近年的神经语音合成已经从自回归走向非自回归与端到端。VITS 及其后续、基于扩散的 StyleTTS2、以及流匹配(Flow Matching)类的 Matcha-TTS,都在普通朗读上逼近真人。声码器则由对抗式的 BigVGAN 等主导,负责把梅尔频谱还原成波形。这些都是 Vāgdhenu 的零件,而非它的论点。

另一条线是可控韵律。有人用音素级语言模型、语义 token、或自然语言描述来指挥语调。但这些方法大多假设有大量多说话人、多风格数据去学一个“文本到韵律”的映射。在只有几小时单人吟诵的场景里,强行学这个映射很容易过拟合,或出现内容漂移——为了换腔把字也改了。

Vāgdhenu 的位置因此很清晰:它是一份经验报告,不宣称新骨干。它的贡献是把现成的流匹配扩散变换器 DiT 与 BigVGAN-v2 组合起来,补上梵语真正需要的三样东西——懂文字与音系的前端、懂韵律的参考选择、以及面向真实部署的质量控制,并用四代架构的谱系对比来说明瓶颈到底在数据还是在骨干。

任务到底要解决什么?

输入是一首用任意婆罗米系文字书写的梵语诗节,可能是已经连声的 saṃhitā 连续文本,也可能是带引文标记的 pramāṇa。输出是一段带吟诵旋律的波形,要求同时满足可懂度与诗律:所有辅音丛可辨、送气对立与卷舌系列完整、三擦音分明、长元音与 visarga 的时值正确,且节奏与停顿符合该诗节所属的 vṛtta。

形式上,这是一个文本到吟诵的序列生成问题,但评估维度比普通 TTS 更苛刻。除了平均意见分 MOS 这类主观分,真正卡脖子的是两类客观失败:辅音丛含糊,以及韵律缺失或错位。前者让“kṣa、jña、tra”这类丛听成一团,后者让本该在 caesura 处换气的长诗节一口气念完,吟诵感立刻消失。

流水线全景:文字如何一步步变成吟诵?

整条流水线可以看成 6 步接力。任意婆罗米文字输入先进入前端做归一化与韵律扫描,转写到 Kannada 文字并完成音系重写与轻重扫描;随后按扫描出的韵律签名去参考库检索一条精确匹配的参考音频;接着流匹配的扩散变换器以该参考的梅尔频谱为上下文,做掩码填充式生成,得到目标梅尔;再由 BigVGAN-v2 声码器合成波形;最后做面向摩擦音与爆破音感知的静音与呼吸后处理。

关键设计在于“韵律由谁携带”。这个骨干没有显式的时长预测头与基频预测头,推理时它看的是参考梅尔里已经包含的音高与节奏,然后把当前文本“填”进这个韵律模板。换句话说,文本决定唱什么,参考决定怎么唱。时长预算也由参考决定:参考长度加上音节数乘以该韵律的每音节秒数,超预算时模型宁愿在诗节内部塞入静音,也不会去拉伸语音。

这种“上下文填充式克隆”的好处是稳定,坏处也直接:如果你想在文本侧加一个韵律嵌入去指挥旋律,模型会发现参考梅尔里已经泄露了答案,文本侧的嵌入几乎拿不到梯度。论文后半部分用一组探针把这一点钉死,也因此把系统从“学习韵律”转向“检索韵律”。

两个最关键的零件:前端与参考

前端要回答:送进骨干的到底是什么符号?输入是带空格与标点的原始文字,输出是两路:一路是送给骨干的 Kannada 字形序列,一路是用于对齐与扫描的转写序列。脚本路由把 Devanagari、Bengali、Gurmukhi 等 10 种文字无损转写到 Kannada,原因很具体——多语指示模型对 Devanagari 默认做印地语式的固有元音删除 schwa deletion,会把梵语读错,而 Kannada 正字法保留固有元音,恰好绕开这个偏置。显示与清单仍保留原文,只有模型看到的是 Kannada。

音系重写则按固定顺序做确定性规则:清理标点与转写方案转换后,可选地处理内部 visarga sandhi 的 utva、rutva、lopa、satva,仅在语音上真实时生效;anusvāra 做同部位鼻音 parasavarṇa 实现,需要跨空格前瞻到后随辅音;daṇḍa 末尾的 visarga 按前元音长短分流,短元音后回响为轻送气,长元音后裸露以自然延长;软腭音 k/kh 前的 jihvāmūlīya 与唇音 p/ph 前的 upadhmānīya 保留为声学上的同位异音而非替换;再加上长元音性 ṛ、两个难丛的换位、以及编辑性括号的剔除。前端同时完成每诗节的 laghu/guru 扫描,按 4 分之 1 诗节 pāda 匹配并忽略末音节任意性 anceps,混合韵律则按半诗节 hemistich 处理,并自参考库自校准签名。

参考机制要回答:哪一段声音来当模板?参考库按韵律组织,检索准则是每 pāda 轻重序列精确匹配、谐噪比最优且 daṇḍa 结尾干净。论文提出的半参考规则是工程上的要点:参考文本必须与参考音频的实际发音跨度在清晰词或 daṇḍa 边界对齐,约 7 秒的半诗节优于约 15 秒的整诗节——整诗节以终止式结尾会导致合成的首音节被吞没;而把半诗节重复 3 次扩展到约 20 秒,能显著改善旋律轮廓。短韵律则用整诗节渲染。这套规则让韵律感知从“文本侧条件”变成了“参考侧检索”。

它是怎么训练与推理的?

系统没有从零发明声学模型。生产骨干是约 337M 参数的流匹配 DiT,维度 1024、深度 22、16 头、前馈倍数 2、文本维度 512、卷积核 4。训练目标是在掩码梅尔填充任务上的条件流匹配速度回归,训练时以 0.3 概率丢弃音频条件、0.2 概率丢弃文本条件,以支持无分类器引导。声码器是 BigVGAN-v2,在骨干自身的梅尔表示上微调,并对末期检查点做指数移动平均融合。

语音的获得分两段。先用多语 Indic 检查点热启动,以约 1e-5 学习率、约 12800 至 19200 帧的批次、bfloat16 精度、2 卡分布式数据并行训练数百轮,每 500 至 2000 步保存检查点;再用 179 个配对片段做面向参考的语音微调 voice-steering retrain,让声音对参考更敏感,这版是最终交付的 production voice,另保留一个参考驱动的回退语音。推理时用 Euler 求解器,函数评估数 NFE 64 时实时率约 1.24,32 时约 0.63,后者是实际服务档位;引导强度批量渲染约 3.0、单句更低,sway 采样系数约 -0.7 至 0.7,速度因子 0.90。

有两个细节决定成败。论文对比发现,傅里叶域的替代声码器会在长元音上引入相位伪影,听感是颤抖的“长元音抖动”,而颤抖与抖动本身定位在声学模型而非声码器;此外声码器必须加载到正确的生成器类,否则会静默半加载,输出变得单调。这些都不是超参数,而是会让整条链路失效的工程坑。

数据与实验是如何组织的?

数据设计的核心是“按韵律与难音素均衡”,而不是随机采样自然文本。来源以 Mahābhārata Tātparya Nirṇaya 约 5100 诗节与 Sumadhvavijaya 约 1000 诗节为主,另加为覆盖 10 种韵律构建的 62 诗节录制表,整理出约 12487 个半诗节段的录制清单。清单在录制前就用审计工具检查阈值:每种卷舌音至少 300 次、长元音至少 500 次、repha 与 r-丛至少 200 次、kṣa/jña/tra 等难丛至少 150 次、57 个音素各至少 100 次,并刻意把 rucirā 与 mālinī 留作未见韵律测试。

实际发布的单说话人吟诵数据集约 1467 个片段、合计约 5.3 小时,含两种吟诵风格,主风格约 3.0 小时、764 诗节、约 33700 音节,覆盖约 9 个韵律家族。录制为 24-bit、48 kHz 无损采集后降采样至 24 kHz 训练,使用 100 维梅尔频谱。评估上,论文坦诚以专家单听者的 MOS 为主,未做多听者盲测与置信区间,跨代 MOS 不可直接对比,仅指示轨迹。

根据论文正文与图中报告值整理,数据集与协议如下:

构成项规模与处理设计意图与备注
录制清单约 12487 半诗节段,约 40 小时候选按韵律与音素阈值审计后筛选,避免 anuṣṭubh 主导
发布数据集约 1467 片段,约 5.3 小时,2 种风格主风格约 3.0 小时/764 诗节/约 33700 音节,覆盖 9 个韵律家族
韵律分布(主风格)anuṣṭubh 31%、triṣṭubh 17%、jagatī/vaṃśastha 13% 等相对自然文本 48-87% 的 anuṣṭubh 已显著扁平,rucirā/mālinī 作未见测试
音频与特征24-bit/48 kHz 录制,24 kHz/100 维梅尔训练固定话筒与 tonic drone 锚定基调,吟诵式连读无词间隙
训练与推理协议2×RTX A6000,bfloat16,NFE 64/32,RTF 约 1.24/0.63峰值显存约 2.5 GB,半精度模型约 900 MB,Euler 求解

部署则用来检验流水线是否真的可交付:Mahābhārata Tātparya Nirṇaya 32 章 5183 诗节约 17.5 小时视频语料,以及 Śrīmad Bhāgavatam 约 18000 诗节、16017 个渲染单元的音频应用,后者包含 14042 个韵律诗节、559 段散文 gadya 与 1416 个短连接词。

主结果与那条更有价值的负结果

最直观的对比是同一单说话人数据上的四代谱系。论文保留四代主方法,MOS 为专家单听者估计,数值不可跨行做统计比较,但天花板的迁移很清楚:StyleTTS2 与 VITS2 在辅音丛上含糊,Matcha-TTS 改善了辅音丛但韵律仍缺失,只有流匹配 DiT 的 IndicF5 微调以约 5 小时数据首次把含卷舌送气在内的辅音丛全部唱对,MOS 约 4.6,作者将其解释为骨干能力的突破而非数据量的胜利。商业系统在同一非正式尺度上约 4.0 至 4.6,人声吟诵约 4.6 至 4.7,生产克隆已接近人声上限,但同样是单人非盲测。

根据论文正文与图中报告值整理,关键结果如下:

比较或条件指标与方向明确报告值这项数字支持什么
四代骨干同数据对比专家 MOS,越高越好StyleTTS2 3.0-4.2,VITS2 高于前代,Matcha-TTS 4.2-4.3,流匹配 DiT 约 4.6仅流匹配骨干清除卷舌送气等辅音丛天花板,瓶颈在骨干
同参考异文本 vs 异参考同文本基频相关,越高越受该因素驱动同参考异文本约 0.13,异参考同文本约 0.40-0.54旋律轮廓由参考携带、而非文本驱动
文本侧韵律条件开/关服从度与半音偏移开关无差异,高引导下约 0 半音,条件梯度范数约 0.02文本侧条件在自填充骨干上惰性,架构性不可控
参考长度与重复主观旋律改善半诗节约 7 秒优于整诗节约 15 秒,重复 3 次至约 20 秒显著改善半参考规则有效,整诗节终止式会吞首音节
推理代价实时率 RTF,越低越快NFE 64 时约 1.24,NFE 32 时约 0.6332 步为服务档位,模型合计约 449M 参数

负结果的机理也很干净:自填充的流匹配骨干在填充时已能从上下文梅尔中恢复音高,文本侧的韵律嵌入因此冗余,梯度近零。论文据此给出可操作的杠杆——只有参考片段本身与面向参考的语音微调能真正改变韵律,任何在该骨干上重做文本侧嵌入调优的尝试都被判定为不应再试。

工程侧的另一条反证来自质量控制。作者曾用强制对齐做质量门控,在约 10220 片段上产生约 1648 个标记,但人工抽检几乎无真实缺陷,误报由辅音丛、擦音起始、长韵律与参考 priming 驱动。真正缺陷几乎全来自源文本:重复编号、合并条目、括号、转写笔误。最终流水线转向时长门控、内部静音门控、少量 best-of-N 重采样与基于识别的错误检测,旋律的最佳版本本身具有种子随机性,需要 best-of-N 筛选。

边界在哪里?哪些结论不能外推?

论文对局限的陈述相当坦诚。评估是单人专家非盲测,没有多听者盲测、没有置信区间、没有与主流多语基线的公平对比与显著性检验,MOS 的跨代比较只能看趋势,不能当作统计优于某基线的证据。客观度量如辅音丛准确率、识别字符错误率、时长保真度也未系统报告,“全部辅音丛正确”缺乏可核对的计数。

方法层面,韵律感知本质是检索式模板克隆,而非生成式控制。对于约 185 个 ardhasama 这类无匹配参考的诗节,只能回退到最近长度的模板,泛化边界未量化;约 4 个以上重复音节的深度、长元音后裸 visarga 等少数伪影,仍需单片段处理。更根本的是,在当前自填充骨干上, verse-independent 的可设计韵律被证明不可达,若想真正“设计”旋律,需要带显式时长预测与长度调节的新架构。

数据与部署的边界同样具体。发布的是单说话人、作者本人声音的数据与权重,非通用零样本克隆工具;零样本任意音色的吟诵需要多说话人吟诵微调。散文 gadya 并非生产模型的设计目标,需要启发式分块。部署虽大,但端到端延迟、成本与失败率等系统指标未完整披露,复现时对参考库质量与录制规范高度敏感。

开源与复现:能拿到什么,还缺什么?

可复现性是这份报告最扎实的部分。代码、权重、数据与可交互 Demo 全部公开:前端、推理与训练脚本及参考库在 GitHub,采用 permissive 许可;生产语音、回退语音与微调声码器权重在 Hugging Face,遵循基座模型的 permissive 许可;单说话人吟诵数据集约 1467 片段约 5.3 小时,采用 CC attribution 许可;Demo 支持任意婆罗米系文字输入、自动检测 vṛtta、检测不确定时回退到默认韵律。

论文附录锁定了关键推理参数:Euler 求解、NFE 64、sway 系数约 -0.7 至 0.7、速度因子 0.90、每片段时长预算为参考长度加音节数乘以每韵律每音节秒数;训练侧给出学习率约 1e-5、帧批次约 12800 至 19200、约 28 GB 显存、bfloat16、2 卡分布式、100 维梅尔、24 kHz,以及基于 179 个配对片段的 voice-steering 细节。硬件为 2 张 RTX A6000 48 GB,峰值推理显存约 2.5 GB。

缺口也很明确:少量正则与声码器损失权重未披露,增强策略细节未说明,质量门控的结论基于内部对齐器实现,未排除对齐器本身适配不足的可能。复现者最需要关注的不是超参数,而是参考库的洁净度与录制规范——词间无隙、daṇḍa 处换气、长元音拉住——这些一旦不满足,模型会把空格学成停顿,把终止式学成吞音。

给刚入行的你:带走哪几句话?

第一,低资源高规约任务的胜负手往往不在数据量。Vāgdhenu 用约 5 小时数据跨过前三代骨干的辅音丛天花板,说明选对骨干比堆时长更关键;但骨干的归纳偏置也会锁死某些控制路径,文本侧韵律条件在自填充流匹配骨干上的惰性就是 1 例。

第二,把“学习”换成“检索”有时是更诚实的设计。当模型已能从上下文梅尔中恢复答案,再去学一个文本到韵律的映射只会拿到近零梯度。此时把韵律检测转化为按 laghu/guru 精确匹配的参考检索,并用半参考规则与时长预算去约束生成,是可交付的工程解,虽然它把“可设计性”换成了“模板依赖”。

第三,部署会教你重新定义质量控制。强制对齐在小规模数据准备中好用,但在上万片段的生产中可能全是误报;源文本的结构错误反而是主要缺陷来源。轻量的时长与静音门控加上 best-of-N 与识别校验,往往比复杂的对齐门控更有效。把这些负结果与坑位公开,比多刷零点几个 MOS 更能帮后人省时间。

📎 论文与评分元数据

标签:#语音合成 #流匹配 #低资源 #多语言

7.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5

7.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #流匹配 | #低资源 #多语言 | arxiv

⚖️ 评分依据与证据(展开查看)

逐维得分、全文证据与扣分边界
  • 创新性 (1.3/2):将 Kannada 文字路由规避 Devanagari 固有元音删除与按 laghu/guru 精确匹配的韵律感知参考检索及半参考规则组合为可交付流水线,并在自填充流匹配骨干上给出文本侧韵律条件梯度约 0.02 的可验证负结果,属于有证据支撑的系统级组合创新。

  • 技术严谨性 (1.1/1.5):声学骨干为约 337M 参数 DiT 无显式时长与基频头,以掩码梅尔填充的条件流匹配速度回归训练,推理以参考梅尔上下文填充,逻辑自洽;以同参考异文本相关约 0.13 与异参考同文本相关约 0.40 至 0.54 支撑负结果,未见推导错误。

  • 实验充分性 (0.7/1.5):四代架构在同一单说话人约 5 小时数据上对比显示 MOS 从约 3.0 提升至约 4.6 并首次正确渲染卷舌送气辅音丛,但评估为单人非盲测且跨代不可比;明确承认缺乏多听者盲测与置信区间,且未报告与主流多语基线的公平对比及客观辅音丛准确率等统计检验。

  • 清晰度 (0.8/1):数据流按任意婆罗米文字输入到前端归一化与韵律扫描再到参考检索与 DiT 填充及 BigVGAN-v2 合成表述完整,以表格呈现 4 代参数量与 MOS 轨迹及天花板,结构清晰可核对。

  • 影响力 (0.8/1.5):针对梵语吟诵这一低资源高规约语音合成任务实现约 5183 诗节约 17.5 小时与约 18000 诗节两项大规模落地,并在约 5 小时数据上突破密集辅音丛,对语音合成读者具领域内方法与数据价值,但受众限于特定文化与单说话人场景。

  • 开源 (1.5/1.5):代码 https://github.com/prathoshap/vagdhenu 含前端与推理及训练脚本,模型权重与约 1467 片段约 5.3 小时数据集均在 https://huggingface.co/prathoshap 公开,Demo 可交互,均采用 permissive 或 CC attribution 许可,核心产物完整开放且文档完整。

  • 可复现性 (0.4/0.5):已披露 DiT 维度 1024 深度 22 等结构、学习率约 1e-5 与帧批次约 12800 至 19200 及 bfloat16 与 2 张 RTX A6000 训练,给出 100 维梅尔 24 kHz 与 Euler 求解器 NFE 64 与 sway 约 -0.7 至 0.7 等推理参数,关键配置大部分充分仅少量正则细节缺失。

  • 工程/实践价值 (1.3/1.5):提供可复用流水线含 10 种文字转写、音系重写与韵律扫描及半参考规则与时长预算,报告合计约 449M 参数约 900MB 半精度与峰值约 2.5GB 及 NFE 32 时 RTF 约 0.63,验证于约 5183 与约 18000 诗节真实部署,具备测量支撑的工程价值。


← 返回 2026-08-29 语音/音乐/音频论文速递