CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
📄 CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation #语音合成 #数据集 9.2/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 1.3/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 9.2/10 | 前10% | #语音合成 | #数据集 | arxiv 👥 作者与机构 作者:Shijun Luo 机构:未明确说明 💡 毒舌点评 这篇工作像一份严谨的“体检报告”,把当前中文新闻TTS产品的“发音健康状况”摆上了台面。优点在于问题定义清晰、评测协议扎实、工程复现性强,为社区提供了一个急需的、标准化的评测工具。缺点是它本质上是“测量尺”的研发,而非“治病方法”的提出;数据集为合成数据,可能无法完全覆盖真实新闻的复杂性和分布。对于追求算法创新的读者来说,贡献可能显得偏工程化;但对于整个语音合成社区,尤其是工业界,这是一份非常实用且必要的基准。作者在ASR路由的异质性分析和消融实验上展现了足够的严谨性,这是亮点。 📌 核心摘要 本文提出了CN-NewsTTS Bench v0.1,一个针对中文新闻TTS系统在处理原始文本中密集出现的书面化形式(如比分、型号、单位、缩写等)时发音准确性的开放式、目标级自动评测基准。基准包含一个合成新闻风格句子数据集(200条记录开发集,800条记录公开测试集,共1260个评测目标)、一个基于三个异构ASR系统多数投票的自动评分协议,以及对七个商业TTS系统的初始评测结果。结果显示,最佳系统(Volcano)的严格准确率为0.879,而多个广泛使用的系统低于0.60,且性能在不同文本类别上差异巨大。该基准强调“原始输入产品赛道”,禁止用户侧的文本预处理,以评估TTS产品端到端的处理能力。 🔗 开源详情 代码:https://github.com/Jayden-X-L/cn-news-tts-bench 模型权重:论文中未提及 数据集:CN-NewsTTS Bench v0.1 数据集(开发集200条记录,公开测试集800条记录)。可通过上述代码仓库的 v0.1 发布(Release)获取。 Demo:论文中未提及 复现材料:复现所需的所有材料(数据、模式、评分代码、固定的ASR转录本、排行榜文件、仪表板、校验和等)均包含在代码仓库的 v0.1 发布中。最小化复现步骤包括验证公开数据集、评分模型的ASR结果文件、聚合排行榜并校验清单。代码仓库的提交 ID 为 f94a679fc7fc。 论文中引用的开源项目: FunAudioLLM/FunASR 生态系统,包含: SenseVoiceSmall:开源本地语音识别器。 Paraformer-zh:开源本地语音识别器。 (论文中未给出具体链接,仅提及来自该生态系统) 标签 #语音合成 #评测基准 #数据集 #开源 主任务标签:#语音合成 主方法标签:#评测基准 补充标签:#数据集 #开源 ...