英文题目:Investigating the effect of automatic prosodic segmentation on speech synthesis for Brazilian Portuguese
会议身份:
conference:speechprosody:2026:conference-paper-id:galdino26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#评测协议 #韵律 #语音 #文本到语音
评分:6.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Julio Galdino:机构信息未能从会议 PDF 纯文本可靠映射
- Rian Pereira Fernandes:机构信息未能从会议 PDF 纯文本可靠映射
- Giovana Meloni Craveiro:机构信息未能从会议 PDF 纯文本可靠映射
- Caroline Adriane Alves:机构信息未能从会议 PDF 纯文本可靠映射
- Sidney Evaldo Leal:机构信息未能从会议 PDF 纯文本可靠映射
- Arnaldo Candido Junior:机构信息未能从会议 PDF 纯文本可靠映射
- Flaviane Romani Fernandes Svartman:机构信息未能从会议 PDF 纯文本可靠映射
- Sandra Maria Aluísio:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向巴西葡萄牙语自发语音的文本到语音合成,输入为转写文本、输出为声明句语音,难点在于自发语流边界模糊且1970年代卷轴磁带录音噪声大,常规按静音切分易破坏语调单元。方法链分三步:先用新版强制对齐器UFPAlign对NURC-SP Minimal Corpus做音素音节词级对齐,输出带起止时间的标注进入下一步;再用Parselmouth提取暂停时长、F0范围与能量等九维音节级声学特征,经随机森林判别终端边界TB并输出韵律切分TextGrid;最后将人工韵律切分、WhisperX自动切分与该自动韵律切分三版语料分别训练FastSpeech2并对比自然语音做语音学与音系学分析。相比仅按静音或语音活动切分的WhisperX,该方法显式建模暂停与F0变化等语调边界机制,因而能保留语调单元完整性并使F0曲线走向更接近人工切分,具有实际建库意义。在NURC-SP MC语料评测下,本工作方法的F1分数为61%,高于Craveiro et al.(2024)方法的F1分数31%。但70%合成核轮廓仍偏离自然模式,表明自动切分尚未系统捕获全部边界变异。该结论适用边界受限于单模型、约14小时51分训练切分语料与TB边界,不支持向大模型或多说话人外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/nilc-nlp/ProsSegue — 链接可访问(HTTP 200)
- 复现相关资源:https://nilc-nlp.github.io/entoa-tts-prossegue → https://nilc-nlp.github.io/entoa-tts-prossegue/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/YannickJadoul/Parselmouth — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文的输入是巴西葡萄牙语自发语音长录音及其文字转写,目标是检验自动韵律切分在构建语音合成训练集时能否起到与人工韵律切分相近的作用。研究对象是圣保罗变体的 CORAA NURC-SP 最小语料,原文报告总量约为 17 小时 35 分,共 21 个音频文件,包含正式发言、双人对话以及 informant 与 interviewer 对话 3 种体裁。录音最初在 20 世纪 70 年代用盘式磁带录制,后经数字化,人工标注者依据终结与非终结断裂理论在 Praat 中标出语调边界。
读者读完应能复述三件事。第一,实验比较了 3 种切分条件:人工韵律切分、WhisperX 自动切分,以及基于随机森林的自动韵律切分。第二,3 种切分分别用来组织训练数据并训练 FastSpeech2,再用同一位说话人的 30 个陈述句做语音学与音系学对照。第三,主要结论是自动韵律切分的 F0 曲线走向接近人工切分,但合成语音的调型类别和焦点位置更分散,约七成核轮廓与自然语音不一致。
需要保留的关键信息是实验条件而非修辞判断。语料有噪声、有重叠、有 70 年代录音质量限制;自动切分只判断终结边界;合成评估只针对陈述句、只用一个说话人样本、只训练了一个 FastSpeech2 模型并借助外部数据辅助词汇学习。这些条件限定了结论的适用范围。
已有哪些自动韵律切分路线,它们和本文任务有何不同?
论文把已有路线分为 3 类:基于规则与启发式的方法、传统机器学习方法、深度学习方法。启发式路线如基于停顿时长和语速突变检测边界,优点是无需大量标注,缺点是容易受声学偏置影响,例如只按停顿切分会漏掉没有静音但有调型完结 cues 的边界。传统机器学习路线如随机森林结合句法与声学特征,在准备好的英语广播语音上曾报告较高的准确率与 F1。深度学习路线如微调 Whisper 同时做转写与韵律切分,在英语自发语音上报告了较高的准确率与 F1。
葡萄牙语方面的对照需要按同语言、同语体理解。欧洲葡萄牙语有基于语谱图与卷积网络检测停顿的方法,报告准确率很高,但原文指出它本质上仍是停顿界限,且用的是准备好的语音。巴西葡萄牙语自发语音有线性判别分析方法,终结单元与非终结单元准确率不同,平均约七成多;也有用强制对齐加启发式的方法,在 NURC-SP 子集上 F1 较低;还有用 9 个声学韵律特征训练随机森林的方法,在 MuPe-Diversidades 上报告了较高的 F1 与准确率。
本文选择延续随机森林路线,理由在原文中明确写出:它是近期针对巴西葡萄牙语的方法,F1 较好,且训练数据同样是自发语音,与本任务的语体更接近。这不是说该方法在所有语言上最优,而是输入、目标与运行阶段更对齐。
研究问题是什么,为什么要用合成语音来回答?
研究问题是:自动韵律切分对合成语音韵律质量的贡献是否与人工切分相同,具体表现出的效应是什么。直接在切分器上算准确率只能回答边界找得准不准,不能回答错误切分是否会改变合成模型的语调学习。因此作者把切分器放进数据构建流水线,用切分后的数据训练同一个合成架构,再比较合成语音的韵律。
举例说明这种传导关系。假设一段话实际包含两个语调群,中间有 F0 下降、调域抬升与长静音。如果切分器漏检中间边界,就会把两个语调群拼成一个训练样本。模型于是可能学到过长的句内停顿分布、被抹平的句末降调,或者把本应在句首重读的词放错焦点位置。反过来,如果切分器把一句话从中间切断,模型可能学到不完整的降调尾巴。
论文还设置了 WhisperX 作为对照。WhisperX 是时间准确的长音频转写工具,切分主要服务于转写与对齐,不考虑话语的语调结构。把它与韵律切分对比,可以分离两种效应:按字词可懂度切分与按语调单元切分,对合成韵律的影响是否相同。
从长录音到可训练样本,全流程经过哪些步骤?
全流程可以沿一个调查录音走一遍。输入是一段约 20 分钟的长 wav 及其词级转写。第一步是预处理:把双声道 48 kHz 音频转为 16 kHz 单声道,保持 wav 格式;因为强制对齐器处理不了过长音频,人工把长文件切成约 20 分钟一段,部分因对齐限制再切到 5 到 10 分钟,切割时避开词内切断。第二步是文本归一化:把 TextGrid 转成以单个空格分隔的词序列,去掉标点与重叠部分。
第三步是强制对齐:用 UFPAlign 标出每个音素、音节与词的起止时间。第四步是特征抽取:用 Parselmouth 在音节区间上计算能量、基频、时长与停顿特征。第五步是分类:随机森林逐个音节判断其后是否为终结边界,输出新的 TextGrid 切分区间。第六步是 TTS 训练:按切分区间组织音频文本对,训练 FastSpeech2。
韵律切分 × TTS 训练数据构建: 韵律切分负责按语调短语的终结与非终结边界把长录音切成可训练的句子级片段,TTS 训练数据构建负责提供文本与音频对齐一致的训练单元,二者搭配的原因是切分位置决定了模型能看到的停顿、调群和调域变化,组合意义在于让合成模型从符合自然话语结构的片段中学习时长、基频与能量。
测试环节单独保留了一个调查 DID 234。它的音频参与切分误差分析,模型合成阶段用它的说话人做 30 个陈述句的韵律对照。另一个调查 D2 62 因元数据标注噪声过高被舍弃,没有进入自动切分。这种保留与舍弃需要在复现时同样执行,否则训练与测试划分就会与原文不一致。
随机森林切分器看哪些信号,三个改动改变了什么?
切分器只判断终结边界,不判断非终结边界。原文列出的特征按重要性排序包括停顿时长、能量极差、最大与平均能量差、F0 极差、核心元音时长、最大与平均 F0 差、最小与平均 F0 差、最小与平均能量差,以及音节平均 F0 与整句平均 F0 之差。直观理解是:终结处更可能出现长静音、整体响度收缩、音高起伏收窄或明显的句末下降,以及末音节拉长。
终结边界 × 非终结边界: 终结边界负责标记一个语调完整的结束处,常伴随明显的 F0 下降、长停顿与调域重置,非终结边界负责标记话语内部尚未完结的延续处,二者搭配的原因是自发话语由多个大小语调单元嵌套组成,组合意义在于自动切分器只判断终结边界时会把本应分开的两个语调群合并成一个训练样本。
作者对原方法做了 3 个改动。第一,对齐器版本统一为基于 m2m-aligner 的 UFPAlign 版本,因为旧版本已不再维护,而该版本在原研究中只用于处理疑难音频。第二,不再过滤 interviewer 的语音。原研究为保持受访者性别、年龄与出生地的均衡而去掉访问者提问,本文为保留更多数据而用完整 MuPe-Diversidades 重训随机森林,参数与原研究相同。第三,去掉依赖已标注边界才能计算的整句平均 F0 差特征,只用其余 8 个特征,使方法在无人工边界时仍可运行。这 3 个改动意味着复现时不能直接套用旧模型权重,必须按新特征集重训。
FastSpeech2 在这里控制什么,切分如何影响它?
FastSpeech2 是非自回归的端到端合成模型。它的编码器把音素序列变成隐表示,时长预测器决定每个音素占几帧,长度调节器据此扩展序列,再由基频预测器与能量预测器给出每帧的音高与响度,最后由解码器生成梅尔频谱并经声码器变成波形。训练时这 3 个预测器有真实语音抽取的时长、基频与能量作为监督;推理时则靠预测值生成韵律。
FastSpeech2 × 时长、基频与能量控制: FastSpeech2 负责把音素序列并行地映射为梅尔频谱,其内部的时长预测器、基频预测器与能量预测器分别负责决定每个音素持续多久、声调走多高和响度多大,搭配的原因是韵律切分直接改变了训练中看到的停顿时长分布与句末降调形状,组合意义在于切分质量会通过这 3 个显式变量传导到合成韵律。
切分通过改变训练样本的边界来改变监督信号。如果样本恰好是一个语调群,句末的 F0 下降与末尾停顿会被完整地放在样本尾部,模型更容易学到陈述句高峰后下降的形状。如果样本是 WhisperX 按转写窗口切出的片段,边界可能落在句子中间,句末降调被截断,停顿分布也被打乱,模型看到的基频目标就不完整。论文的假设正是:按语调单元组织数据有助于陈述句韵律,而与话语结构无关的常规切分会使合成语音更平、变化更少。
模型怎样重训与训练,有哪些已报告和未报告的细节?
切分器的训练是传统监督分类训练,不是神经网络端到端训练。作者先用原作者代码与相同方法在 MuPe-Diversidades 上复现,得到与原文相同的宏平均 F1,确认流水线可用,再用 8 特征与全部说话人数据重训随机森林,训练与测试划分沿用原研究的切分方式。特征来自强制对齐后的音节区间,标签是该音节后是否为人工标注的终结边界。论文没有报告树的数量、深度、随机种子与交叉验证折数的具体数值,复现时只能写沿用原研究参数,并记录实际使用的版本。
强制音素对齐 × 音节级声学韵律特征: 强制音素对齐负责给出每个音素、音节与词在音频中的起止时间,音节级声学韵律特征负责在这些时间区间上计算停顿时长、能量极差、F0 极差、元音时长等数值,二者搭配的原因是随机森林需要以音节为单位判断边界后是否有终结,组合意义在于对齐误差会直接污染特征并导致边界漏检。
合成模型的训练沿用此前同一团队的 FastSpeech2 配置,以保证与人工切分和 WhisperX 切分的对比公平。论文明确指出,为弥补 NURC-SP 小时数不足与词汇覆盖不足,训练中加入了 CML-TTS 数据辅助优化与词汇学习;同时只训练了一个合成模型,没有做多随机种子平均。未报告的缺项包括优化器学习率、 batch 大小、训练步数与声码器配置,复现时需要到配套网站核对脚本,不能从 FastSpeech2 的名称推定默认超参数。
数据、划分与评估协议如何保证三组可比?
数据主体是 NURC-SP 最小语料。音频为 wav,原始双声道 16 位 48 kHz,预处理后为 16 kHz 单声道;文本为 Praat TextGrid,UTF-8 编码。实验用 19 个调查做自动切分,其中 DID 234 留作合成测试与分析,D2 62 因噪声舍弃。评估样本是说话人 L1-234 的 30 个陈述句,分为 4 组对照:自然语音 30 句、人工切分训练的 FastSpeech2 合成 30 句、WhisperX 切分训练的 FastSpeech2 合成 30 句、自动韵律切分训练的 FastSpeech2 合成 30 句。
语音学评估固定 4 个 F0 定位点:句首音节、陈述句最高峰前一点、最高峰本身、句末下降最低点。用 AnalyseTier 脚本取最大 F0 并求平均,再把频率换算为相对 100 Hz 的半音值,以消除录音与合成音色差异带来的绝对音高偏差。比较方法是看连续两点之间的升降方向与幅度,以及相对序列均值的偏离曲线。音系学评估在 Praat 中设 3 层:声调层按 P-ToBI 标核轮廓,词切分层转写并分词,边界层只标语调短语边界。
公平性依赖两点:合成侧用同一架构与同一配置,只换训练数据的切分方式;评估侧用同一说话人、同一句数与同一种陈述语境。但限制也很明确:只测陈述句中性语境,没有覆盖疑问句与焦点句;只看一个说话人,不能推广到多说话人韵律泛化。
已有方法在葡萄牙语上表现如何,本文切分器落在什么位置?
要回答自动切分是否可用,先要看它在边界检测本身的表现。下表把论文回顾的葡萄牙语相关结果放在同一视野下,比较问题是:在准备语音与自发语音、欧洲与巴西变体之间,报告的准确率与 F1 有何差异。指标方向是准确率与 F1 越高越好,但语体与标注体系不同,不能直接排名,只能判断任务难度。
| 条件 | 语料与语言变体 | F1 | 准确率 | 言语类型 |
|---|---|---|---|---|
| 基于语谱图加卷积网络 | RTP 约 33 小时欧洲葡萄牙语 | 未报告 | 95.6% | 准备语音 |
| 线性判别分析 | C-Oral Brasil I 与 II 约 17 分钟巴西葡萄牙语 | 未报告 | 终结 80.8%,非终结 75.6%,平均 78.2% | 自发语音 |
| 对齐加启发式 | NURC-SP 最小语料 5 小时片段巴西葡萄牙语 | 31% | 未报告 | 自发语音 |
| 随机森林 9 特征 | MuPe-Diversidades 2 小时 30 分巴西葡萄牙语 | 77% | 97% | 自发语音 |
上表的主要收益是给出语体差异的参照:准备语音的停顿检测可以很高,自发语音的 F1 普遍更低。本文方法在 NURC-SP 上的 F1 比原 MuPe 结果下降约 16 个百分点,准确率仍较高,说明跨语料泛化存在损失。具体代价是它是所有回顾方法中 F1 第二低的,只高于 31% 的启发式方法。未胜出项恰好提醒读者:准确率高不等于 F1 高,因为终结边界是稀疏类别,多数音节后并无边界。
合成语音的 F0 曲线与核轮廓分别发生了什么变化?
语音学层面比较的是 F0 曲线的形状,而非绝对音高。下表要回答的问题是:3 种合成语音相对自然语音的逐段升降是否一致。公平条件是同一说话人、同样 30 句陈述句、同样 4 个定位点;指标方向不是越大越好,而是与自然语音的升降方向越一致、偏差越小越好。
| 条件 | 训练切分依据 | 句首到峰前相对自然语音偏差 | 峰前到峰顶方向 | 核轮廓与焦点表现 |
|---|---|---|---|---|
| 自然语音 | 人工语调标注 | 0 半音 | 上升至陈述高峰 | 约 77% 为下降型终结轮廓 |
| 人工韵律切分合成 | 人工终结与非终结边界 | -1.51 半音 | 上升但幅度偏小 | 与自动切分相近但仍偏离自然 |
| WhisperX 自动切分合成 | 转写窗口切分 | 接近自然但下一段失效 | 未能延续峰顶走向 | 变化更小,听感更平 |
| 自动韵律切分合成 | 随机森林终结边界 | -0.65 半音 | 上升但幅度偏小 | 70% 核轮廓与自然不一致 |
语音学韵律分析 × 音系学韵律分析: 语音学韵律分析负责测量 F04 个定位点的半音值与逐段升降幅度,音系学韵律分析负责按 P-ToBI 标注核轮廓类型与语调短语边界及焦点位置,二者搭配的原因是数值接近不等于调型类别正确,组合意义在于论文能同时发现自动切分在 F0 曲线倾向上接近人工切分,但在核轮廓类别分布上仍然发散。
表后解释需要分两层。语音学上,自动韵律切分与人工切分的曲线走向相似,句首到峰前都是下降,峰前到峰顶都是上升,只是幅度都小于自然语音,尤其句末下降的幅度差距最大。WhisperX 在第一段看似接近自然,但第二段未能跟上峰顶,论文认为更可能是数值巧合而非韵律连贯。音系学上,合成语音出现多种终结核轮廓,没有形成自然语音中占主导的下降型模式,且焦点常落在不应重读的位置,例如把重音放在代词或词首音节。代价是即使 F0 走向接近,调型类别仍发散,这正是需要两类分析互补的原因。
切分器在哪里漏检,漏检如何对应到合成错误?
论文用 DID 234 的一个片段做了误差剖析。自然标注把一句话分成两个终结单元:我一直常去,更喜欢去剧院而非电影院。自动切分只给出开头与结尾两个边界,把整段当成一个语调群。人工敏感的 3 个 cues 包括:第一段末尾 F0 曲线的明显下降,第二段起始调域整体抬升并保持平稳,以及语谱图上可见的长静音。自动模型对这三者的组合不够敏感,因而漏掉中间的终结边界。
这种漏检与合成错误存在机制对应。漏掉的恰好是语调完结的旋律运动与调域重置,训练样本于是缺少干净的句末降调模板。合成阶段的后果是陈述句高峰后的下降幅度偏小,核轮廓类型摇摆,焦点位置也更随机。论文没有做去掉某一特征后的消融,也没有量化每种漏检占多大比例,因此不能说补上停顿特征必然解决问题,只能说停顿与 F0 变化的系统性缺失是重要嫌疑。
另一个反证是 WhisperX 条件。它不是韵律切分器,切分点可能落在句子中间。结果是合成语音韵律变化更小,支持了按语调单元组织数据的价值。但原文也承认该 WhisperX 切分未经人工校对,未来需要补做校对后的对照,才能排除转写错误带来的混杂。
哪些条件限制了结论,什么还不能说?
第一是数据规模与质量。NURC-SP 可用小时数有限,模型泛化韵律的能力受限;70 年代盘式磁带录音的底噪与频响也会影响基频抽取与合成质量。加入 CML-TTS 虽然帮助词汇与优化收敛,但也引入混合语料的域差异,不能把结果简单理解为纯自发语音训练的结果。
第二是模型与评估覆盖。只用了一个 FastSpeech2,没有对比其他自回归或大语言模型架构的合成器;FastSpeech2 本身不能为训练集外的说话人生成语音,结论不能推广到零样本说话人。评估只用 30 个陈述句、一个说话人,没有测量可懂度、自然度 MOS、延迟与训练成本,也没有统计显著性检验。相关性不等于因果:F0 幅度偏小可能来自数据量、录音质量与模型本身,不能全部归因于切分。
第三是切分器覆盖。只有终结边界被自动切分,非终结边界未处理;跨语料 F1 下降表明方法对新录音条件敏感。缺失的验证包括深度学习切分对照、语言知识与数据驱动结合的中间路线,以及人工校对后 WhisperX 的公平对照。
要复现这条流水线,先准备什么,按什么顺序跑?
先确认资源状态。论文配套的切分代码与合成演示页面当前可用,Parselmouth 为第三方开源库可用。复现顺序建议按依赖关系推进:先跑通强制对齐,再跑特征抽取,再训随机森林,最后训合成。
具体动作是:下载 NURC-SP 最小语料并阅读元数据,舍弃高噪声的 D2 62,单独保留 DID 234 做测试;把音频转为 16 kHz 单声道 wav,把 TextGrid 归一化为单空格分隔、无标点、无重叠的词序列;人工把长音频切为约 20 分钟一段,避开词内切断,对齐困难的再切到 5 到 10 分钟;用 m2m-aligner 版本的 UFPAlign 做音素、音节与词对齐;用 Parselmouth 计算 8 个特征,不含整句平均 F0 差。
在 MuPe-Diversidades 上复现宏平均 F1 约 77% 后,再用全量数据重训并切分 NURC-SP;最后按原文 FastSpeech2 配置组织 3 组数据训练并各合成 30 句。
需要记录的细节包括对齐器版本、特征列表、随机森林参数、训练测试划分、CML-TTS 的混合比例,以及 F0 半音换算基准 100 Hz 与 4 个定位点的标注规则。若缺少某项超参数,应明确记为未报告,不用默认值替代。
何时值得尝试自动韵律切分,还需补哪项验证?
当任务是把大量自发长录音建成合成训练集,且人工逐句标语调边界成本过高时,值得尝试这种 8 特征随机森林切分。它的价值在于保留语调单元的完整性,使合成陈述句的升降走向更接近人工切分,而不是简单按固定时长或转写窗口切分。但应把期望放在形状接近,而非调型类别完全正确,因为核轮廓与焦点仍可能发散。
复现后最值得补的验证有三项。第一,在同一数据上补做人工校对后的 WhisperX 对照,分离切分策略与转写噪声的影响。第二,补做留出法与多随机种子的切分器评估,报告终结边界的精确率、召回率与 F1,而不只看准确率。第三,扩大评估到疑问句、不同说话人与主观自然度测试,并记录训练时长与推理开销。只有补齐这些,才能判断自动韵律切分在更大规模与更多语境下是否依然接近人工切分。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses