Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit

📄 梵颂为何难唱:当吟诵的旋律不在文本里 英文题目:Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit 一句话:为把梵语诗节准确唱出来,Vāgdhenu 放弃在文本侧学习韵律,转而用韵律精确匹配的参考音频去“填充”流匹配模型,并在约 5 小时单人数据上首次完整唱对卷舌送气等密集辅音丛,代价是韵律只能靠参考模板克隆而无法自由设计。 标签:#语音合成 #流匹配 #低资源 #多语言 评分:7.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Prathosh A P:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把梵颂吟诵这个低资源高规约任务做成可交付流水线并用 Kannada 路由、韵律感知参考检索和半参考规则解决真实卡点,负结果剖析比多数正结果更有价值;短板是评估仅为单人专家非盲测且 MOS 跨代不可比,所谓韵律感知本质是参考检索而非可控生成,声学骨干与声码器均为现成组件复用,架构创新有限。 📌 核心摘要 本文解决梵语韵律诗节(śloka)到吟诵(parāyaṇa chant)的高保真语音合成问题,目标是保持长元音、尾随 visarga、卷舌与送气对立及密集辅音丛的正确发音并尊重诗律(vṛtta)结构。系统 Vāgdhenu 以现成流匹配(Flow Matching)语音合成骨干(Chen et al. 2024; AI4Bharat 2024,约 337M 参数的扩散变换器 DiT)与大规模对抗声码器 BigVGAN-v2(Lee et al. 2023)为基础,构建脚本感知前端、韵律感知的参考选择机制与面向源文本校验的质量控制栈。核心机制差异在于放弃文本侧韵律条件,转为通过精确匹配参考音频的韵律模板进行上下文填充式克隆,并通过 Kannada 文字路由规避 Devanagari 在指示模型中的固有元音删除问题。最能支撑结论的证据是同一单说话人数据上四代架构的演进中,流匹配骨干以约 5 小时微调在专家平均意见分(Mean Opinion Score, MOS)上达到约 4.6 分并首次完整渲染含卷舌送气在内的辅音丛,而此前三代 StyleTTS2(约 3.0 至 4.2)、VITS2、Matcha-TTS(约 4.2 至 4.3)均触及天花板。该系统已落地两个大规模部署(Mahābhārata Tātparya Nirṇaya 5183 诗节约 17.5 小时视频语料;Śrīmad Bhāgavatam 约 18000 诗节音频应用)并开源前端、推理与训练代码、模型权重与吟诵数据集。局限在于缺乏多听者盲测与置信区间,韵律可设计性在当前自填充骨干上被证明不可达,且评估依赖非可比的专家估计。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 950 words

Your Voice Cloning System is Secretly a Voice Anonymizer

📄 克隆与匿名本是一体两面:把 27k 小时的 TTS 直接当成隐私滤镜 英文题目:Your Voice Cloning System is Secretly a Voice Anonymizer 一句话:论文把多语言语音克隆模型 XTTSv2 零样本复用为匿名器,用码本保留韵律、用复合伪说话人替换音色,并在 7 种语言上以接近随机猜测的 EER 和转正的音质证明复用可行,但代价是评估仍停留在单一攻击者与小规模人评的边界内。 标签:#语音转换 #语音大模型 #语音合成 #多语言 #零样本 评分:8.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Romolo Muletta:机构信息未在 arXiv HTML 中可靠披露 Felix Matthias Saaro:机构信息未在 arXiv HTML 中可靠披露 Mark Cieliebak:机构信息未在 arXiv HTML 中可靠披露 Jan Deriu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把 27k 小时训练的 XTTSv2 零样本语音克隆能力直接翻转为匿名化工具,无需重训即可在 7 种语言上拿到接近随机猜测的隐私保护且把合成质量拉回正向,工程复用思路非常聪明。短板是隐私评估仅用 ECAPA2 这一知情度极低的攻击者且缺乏对抗自适应攻击、韵律保真度量化与关键消融,所谓迭代精炼的谐波均值选优更像启发式补丁,离可信的匿名化保证还有距离。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 870 words

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

📄 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis 标签:#语音合成 #流匹配 #生成模型 #可解释性 9.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.6/10 | 前10% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #流匹配 | #生成模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Tianchi Liu(LIGHTSPEED) 通讯作者:Tianchi Liu;Zeyang Song 作者列表:Tianchi Liu、Zeyang Song、Tianrui Wang、Zhipeng Li、Chenglin Xu、Yiwen Guo(机构:LIGHTSPEED;National University of Singapore;Nanyang Technological University;Independent Researcher) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 708 words

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

📄 FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation 标签:#统一音频模型 #流匹配 #音频理解 #语音合成 #语音编辑 8.7/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:模型报告 | 评分置信度:高 | #音频理解 | #流匹配 | #统一音频模型 #语音合成 | arxiv 👥 作者与机构 第一作者:Junjie Li(Xiaohongshu(正文仅给出统一机构行,未逐作者映射)) 通讯作者:Fenglong Xie(正文脚注给出通讯邮箱) 作者列表:Junjie Li、Xuelong Geng、Kun Xie、Feiyu Shen、Yichen Wu、Ziqi Dai、Yichen Han、Yan Jia、Kai Huang、Junjie Chen、Yixuan Li、Manzhen Wei、Fenglong Xie、Lei Xie、Xu Tang、Yao Hu(机构:Xiaohongshu) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 742 words

Preference Optimization for Non-Verbal Vocalization Synthesis

📄 Preference Optimization for Non-Verbal Vocalization Synthesis 标签:#语音合成 #后训练 #模型评估 #SFT 7.1/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #后训练 | #模型评估 #SFT | arxiv 👥 作者与机构 第一作者:Haoyang Li(Nanyang Technological University, Singapore) 通讯作者:Chenglin Xu 作者列表:Haoyang Li、Chenglin Xu、Junchuan Zhao、Yuang Cao、Liumeng Xue、Yiwen Guo、Eng Siong Chng(机构:Nanyang Technological University, Singapore;LIGHTSPEED, Singapore;National University of Singapore, Singapore;Nanjing University, China;Independent researcher) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 760 words

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

📄 Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care 标签:#语音合成 #扩散模型 #数据集 #语音克隆 #低资源 7.6/10 | 创新 1.1/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.6/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #语音合成 | #扩散模型 | #数据集 #语音克隆 | arxiv 👥 作者与机构 第一作者:Kawshik Kumar Paul(Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) 通讯作者:正文未明确标注 作者列表:Kawshik Kumar Paul、Md. Nafiul Alam Fuji(机构:Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 426 words

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

📄 sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller 标签:#语音合成 #知识蒸馏 #模型压缩 #实时处理 10.0/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 10.0/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #语音合成 | #知识蒸馏 | #模型压缩 #实时处理 | arxiv 👥 作者与机构 第一作者:Ashish Thapa(正文未明确机构) 通讯作者:正文未明确标注 作者列表:Ashish Thapa(机构:正文未明确机构) 💡 毒舌点评 sanoTTS 的可信度来自“完整链真的在板上跑”和“每个 blob 都能核验”,而非参数数字。0.22× 实时、明确的参数拆分和开放 fixtures 很有工程价值。推荐给端侧语音与 TinyML 开发者;选型时必须同时看到 Kristin 的明显质量差距、24 句小门禁、缺 MOS/能耗,以及更高质量 Amy 包尚未实板部署。 ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 644 words

Tracking the Trend in How Speech Synthesizers Deceive People

📄 Tracking the Trend in How Speech Synthesizers Deceive People 标签:#语音伪造检测 #Transformer #语音合成 #音频质量评估 6.0/10 | 创新 1.1/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 ✅ 6.0/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音伪造检测 | #Transformer | #语音合成 #音频质量评估 | arxiv 👥 作者与机构 Milan Šalko、Anton Firc、Kamil Malinka、Vojtěch Staněk、Martin Perešini、Filip Pleško、Jakub Reš 来自布尔诺理工大学(Brno University of Technology)Security@FIT 实验室,捷克共和国。研究通过该校伦理委员会审批(EK:2024-002),受校内项目 FIT-S-26-9011 资助;生成内容刻意避开敏感、政治或冒犯性表述以保护被克隆的公众人物。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 407 words

X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance

📄 X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance 标签:#语音合成 #自回归模型 #流式处理 #高效推理 7.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #语音合成 | #自回归模型 | #流式处理 #高效推理 | arxiv 👥 作者与机构 第一作者:Rime Wen(机构未说明) 通讯作者:未说明 作者列表:Rime Wen、Zehan Liu、Shawn Qin、Lights Shi、Roy Gan、Hao Wang、Qian Wang(机构信息未在当前正文中完整说明) 💡 毒舌点评 流式文本到语音的因果 token 解码设计思路清晰,边界处理也讲究,但两个假设值得推敲:其一,受控实验以固定速率送入文本 token,真实语言模型的突发、停顿与自我修正会让延迟估计变得不稳定;其二,方法能延迟读音未定的后缀,却不能撤回已被上游语义性改写的内容——严格因果的代价是某些错误只能靠等待规避。分段不溢出的保证建立在固定预测容量假设上,最终仍要依赖实测健康门禁。中文为主的评测材料也让跨语言的数字与代码混读能力存疑。 ...

2026-08-20 · 更新于 2026-09-04 · 3 min · 489 words

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

📄 FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations 标签:#语音合成 #语音克隆 #语音编辑 #生成模型 #多语言 9.0/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 🔥 9.0/10 | 前10% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #生成模型 | #语音克隆 #语音编辑 | arxiv 👥 作者与机构 第一作者:Feiyu Shen(小红书) 作者团队:Kun Xie、Yichen Wu、Ziqi Dai、Yichen Han、Junjie Li 等;机构为小红书及合作团队。 💡 毒舌点评 这项工作抓住了连续语音表征的关键矛盾:既想保留声学细节,又想借助文本 LLM 的指令能力。RedAE 的语义教师设计确实漂亮,公开模型和多任务评测也很完整;但“简单”并不等于没有工程代价,训练 tokenizer、LLM-DiT 和多种编辑评测的成本很高,开放域音色、长文本和极端方言仍需要独立验证。此外还有几处需要追问:连续自回归表示在长文本与多说话人混合场景下的误差累积没有系统报告;多语言覆盖有限,粤语的高字符错误率被归因于 Whisper-large-v3 的识别能力上限而非方法本身;训练数据许可与商业使用边界也语焉不详——这些对想落地的团队都是关键信息。 ...

2026-08-19 · 更新于 2026-09-04 · 6 min · 1193 words