英文题目:PersianVox: A Prosody-Aware Approach for Speech Dataset Generation from In-the-Wild Data
标签:#文本到语音 | #数据集构建 | #语音质量评估 | #韵律 | #低资源
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Saeedreza Zouashkiani:机构信息未在 arXiv HTML 中可靠披露
- Soheil Khalesi:机构信息未在 arXiv HTML 中可靠披露
- Saman Soleimani Roudi:机构信息未在 arXiv HTML 中可靠披露
- Sajjad Amini:机构信息未在 arXiv HTML 中可靠披露
- Shahrokh Ghaemmaghami:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
低资源波斯语零样本语音合成面临海量无标注网络音频,目标是可训练的长上下文单说话人语句对,难点在于转写不准、静音切分截断韵律以及质量过滤跨语言失效。本文方法链为预处理标准化与音乐分离输出干净长录音,接着说话人分离标注与声学轮次检测合并生成语义完整语句,再经语音修复与语言加质量过滤剔除劣质样本,最后由两种解码机制不同的识别模型一致性校验保留可靠转写。与 Emilia 类静音切分加单模型转写的差异在于以轮次完整性替代静音阈值,并以跨架构一致替代单点置信,从而保留长程韵律并抑制相关误差。在 564 条人工平均意见分(Mean Opinion Score,MOS)子集上 SCOREQ 的皮尔逊相关为 0.6658,优于 DNSMOS 的 0.5590,同时流水线最终产出 2408.67 小时多说话人语料。结论仅在波斯语 YouTube 系数据与所用修复和识别组合下成立,换语言、换噪声类型或强口音场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
数据相关资源:https://huggingface.co/datasets/saeedzou/persianvox — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/saeedzou/persianvox_mos — 链接可访问(HTTP 200)
演示资源:https://saeedzou.github.io/persianvox-demo → https://saeedzou.github.io/persianvox-demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
这篇解读的输入是论文原文给出的流水线描述、数据量变化、质量评估对照和合成验证,目标是让刚进入语音、音乐与音频方向的研究生能复述出 PersianVox 如何从无标注网络音频得到可训练的波斯语语音语料。必须保留的信息包括原料规模与每步保留时长、切分目标分布与硬上限、双自动语音识别的模型结构与一致阈值、质量过滤器的选型依据、最终语料规模与可用链接状态。
输出是一套可核对的动作序列,而不是对低资源语音的泛泛议论。当前可用性方面,资源状态显示数据集 PersianVox 与人工平均意见分语料均已公开可达,演示页也可达,解读中凡写已公开均以该状态为依据。学习路径先建立任务依赖:零样本语音合成需要长上下文与可靠文本标注,而波斯语同时缺大规模干净配对数据和强波斯语识别模型,因此论文把重点放在切分完整性、转写可靠性与质量筛选有效性上,后续各节按此依赖展开。
已有路线为何在波斯语上走不通?
已有路线可分为两类。第一类是基于对齐的方法,白话说就是手里已有逐字文本,再用预训练识别模型的连接时序分类概率算出每句起止时间,代表是 CTC 切分。这类方法不依赖人工时间戳,且对首尾多余语音有一定鲁棒性,但前提是必须有逐字稿,而波斯语恰恰缺少这类干净配对资源,规模化受限。
第二类是野外流水线,白话说就是没有任何文本,从降噪去音乐、说话人日志、语音活动检测开始,再用一个强识别模型直接生成转写,最后用 DNSMOS 一类分数滤掉低质句,代表是 Emilia 流水线与 AutoPrep。这类方法在波斯语上遇到两个具体障碍,一是常用语音活动检测按超过约 2 秒的静音就切断,容易在句中切断,得到大量短于 5 秒的碎片,不利于建模长程韵律;二是论文实验发现 DNSMOS 在波斯语上泛化差,常给高质量音频打低分,不能作为可靠过滤器。
波斯语已有资源也印证缺口:ManaTTS 为单说话人约 86 小时,DeepMine 为 67 人 120 小时且获取受限,而 PersianVox 目标是 3248 人 2400 小时并以 CC-BY-4.0 公开。相关工作的对照维度因此是同输入的无标注长音频、同目标的单说话人语句级语料、同监督的无真值自动标注、同运行阶段的全自动处理,类别差异本身不构成优劣判决,后文对照都回到相同时长分布与同一评估集上比较。
要解决的具体问题与约束是什么?
论文要解决的是如何用全自动流程把知识共享许可的波斯语网络长音频变成语句级、多说话人、高感知质量且文本可靠的合成训练集。约束有 4 条。第一,无真值文本,不能靠人工校对,只能靠模型间一致与置信度过滤控制错误传播,论文明确指出流水线是顺序结构而无显式反馈,前期源分离与切分误差会向后传递。
第二,切分必须兼顾语言学完整性与时长适用性,太短则丢失短语与句子级韵律上下文,太长则增加对齐复杂度、显存占用与训练不稳定性。第三,转写必须在弱波斯语识别条件下可用,单模型输出不可信。第四,质量过滤必须在波斯语上有效,不能照搬英文上好用的阈值。
举例说,一段播客含背景音乐、多人轮流说话与中英混杂,若按静音切分会把一个完整问句切成前后两半,若按单模型转写可能把波斯语词误写,若按 DNSMOS 过滤可能误杀干净句。论文的解法是把切分、修复、过滤、转写四处都换成在波斯语子集上验证过的组件,并在最后用双模型一致做兜底。
流水线全景:一个样本如何走完输入到输出?
先沿一个样本走完全程。输入是一段从视频网站收集的长录音,格式、响度不一且可能含音乐。第一步做预处理:转成单声道 16 位 24 千赫兹波形,做峰值归一到负 20 分贝满刻度并限制增益在正负 3 分贝内,幅度缩放到负 1 到 1 区间,同时用 Ultimate Vocal Remover 的 UVR-MDX-Net 做音乐背景分离,并用随机抽取的语音主导片段做早期语言投票,只保留波斯语概率均值超 90% 的录音。
第二步做 2 阶段切分:先用 PyAnnote 社区版做说话人日志得到同说话人区间,再用 Pyannote Segmentation 3.0 找语音区并用 Smart Turn 3.1 判断候选边界是否完整,按高斯目标时长动态合并,硬上限 30 秒。第三步对切后语句用 SIDON 做语音修复,消除混响、编码失真与残留噪声。第四步做语言与质量过滤:用 Whisper Large v3 做语句级语言识别,只保留目标语言概率远大于 0.95 的句子,再用 SCOREQ 阈值保留高感知质量句。第 5 步做双识别一致:用 114M 参数 FastConformer 混合模型的 CTC 头与 600M 参数 Parakeet 的循环神经网络换能器分别转写,算两者之间的字错率与词错率,只保留字错率小于 12.5% 且词错率小于 15% 的句子,并检查首尾各 7 个字符的边缘字错率,丢弃边缘字错率大于 50% 的句子,最终标签取较大 Parakeet 模型的输出。
下段导读图 1 的整体结构,帮你把上述 5 步对应到方框与箭头,重点看清切分闭环与修复的前后位置。
看图路径: 1. 从顶部野外语音数据沿绿色箭头向下走,数出标准化、源分离、说话人日志的主路径;2. 观察语音活动检测与韵律感知合并构成的切分闭环,再向左进入语音修复;3. 确认底部双识别一致、质量过滤、语言检测的顺序与最终输出的多说话人语料图标
论文图 1。原论文 Fig. 1::“Overall pipeline structure.”。
图 1 展示了从顶部野外语音数据经标准化、源分离、说话人日志、语音活动检测、韵律感知合并、语音修复、双识别一致、质量过滤、语言检测到底部多说话人语料的完整链路。可见切分不是单一语音活动检测框,而是语音活动检测加韵律感知合并的组合;修复位于切分之后、过滤与识别之前,说明修复质量直接影响后续筛选与转写可靠性;双识别一致位于质量过滤之前,构成最后的文本可靠性关卡。复述时应按箭头顺序说出每步输入输出,而不是跳过源分离直接谈切分。
切分组件:如何得到 10 到 20 秒的完整句子?
标准语音活动检测流水线的问题是按静音时长机械切分,分布呈幂律状,短句占主导。论文的替代策略分三动作。动作用 Pyannote Segmentation 3.0 得到语音区,避免把长静音误当边界;动作用 Smart Turn 3.1 给每个候选边界打完整度分,该模型在论文标注的波斯语子集上准确率为 80%;动作按高斯分布抽目标时长,均值 12 秒、标准差 4 秒,迭代合并同一说话人的相邻片段,直到达到目标长度或遇到确信完整边界,硬上限 30 秒。
这个均值与方差是按当前神经合成系统的实用工作区经验选择的,白话说就是要长到能看到短语与整句的语调起伏,又不能长到对齐与显存难以承受。
说话人日志 × 韵律感知切分: 说话人日志负责把长录音按说话人身份切成同质区间,解决谁在说话的问题;韵律感知切分负责在同一说话人内部判断哪里是语言学上完整的停顿,解决哪里可以切断而不破坏韵律的问题。二者搭配的原因是只做说话人切分得到的段仍太长且含长静音,只做静音切分又会切碎句子,组合后先锁定说话人再用轮次检测合并短片段,既保证单说话人又得到 10 到 20 秒的完整语境。
目标时长采样 × 边界完整性: 目标时长采样指每次从均值 12 秒、标准差 4 秒的高斯分布抽一个期望长度,控制句子要有足够长的短语和句子级上下文;边界完整性指用 Smart Turn 判断候选边界是否为完整轮次,控制不能为凑长度而跨过完整句继续合并。二者搭配实现动态合并:未到目标长度且边界不完整就继续跨短间隙合并,到目标长度或遇到确信完整边界就停止,并受 30 秒硬上限约束。
复述时要强调这不是把阈值从 2 秒改大,而是把切分依据从静音能量换成声学轮次完整性,再用目标时长控制长度。若缺失 Smart Turn 的波斯语准确率报告,则无法判断完整性判断的可迁移性,论文给出 80% 是复现时必须记录的条件。
修复与过滤组件:先提升再筛选的顺序为何重要?
修复对象是去音乐后仍存在的低带宽、混响、编解码损伤与环境噪声。论文对通过预处理的所有语句统一用 SIDON 处理,该模型基于 w2v-BERT 2.0 特征预测器与 HiFi-GAN 风格声码器的参数重合成框架,把退化语音重建为接近录音室质量,输入是 UVR-MDX-Net 输出的音乐抑制轨。顺序上修复在切分之后按语句执行,有利于按句控制质量并减少长录音修复的边界问题,但也意味着切分边界误差会进入修复。
过滤分两层:语句级语言识别用 Whisper Large v3 内置模块,只保留目标语言概率远大于 0.95 的句子,用于剔除非波斯语与语码混杂;声学过滤用在波斯语人工分上验证过的 SCOREQ,只保留超过阈值的句子。论文未报告 SCOREQ 阈值的具体数值与语言概率的精确实现细节,这是复现时的缺项,只能记录为按原文阈值复现需查代码或公开配置。
语音修复 × 语音质量评估: 语音修复指用 SIDON 把去音乐后仍残留的混响、编码失真和噪声重建为接近录音室质量,承担提升信号的职责;语音质量评估指用 SCOREQ 预测每句的感知平均意见分并做阈值过滤,承担判断去留的职责。搭配理由是修复会改变音质分布,若不重新用在波斯语上验证过的评估器筛选,仍会混入低质句,组合意义是先统一抬高质量再统一按同一标尺截断。
教学例子是同一句带混响的播客语音:只做去音乐时仍闷且有尾音,SCOREQ 可能在 3.0 附近;加 SIDON 后混响收紧,分数向 4.0 移动,此时再用 SCOREQ 截断才能把真正干净的句子留下,而不是把修复前后的分数混在一起比较。
双识别一致组件:没有真值如何判断转写可靠?
动机来自两点已有观察:连接时序分类与循环神经网络换能器错误模式互补且 largely 不相关,一致性比单模型输出更能指示正确性;大规模数据整理常用跨模型转写一致代替参考真值。论文选用结构不同的两个专有模型,114M 参数 FastConformer 混合模型的 CTC 头与 600M 参数 Parakeet 的换能器,二者解码机制不同使相关错误最小化。
计算上对两路输出互算字错率与词错率,只保留字错率小于 12.5% 且词错率小于 15% 的句子,阈值是按转写保真与数据产率权衡经验确定的;另加边界精度检查,丢弃首尾 7 字符边缘字错率大于 50% 的片段,防止切分截断句首句尾;通过者取较大 Parakeet 模型的转写为最终标签。
CTC × RNN-T: CTC 指 FastConformer 的 CTC 头按帧独立预测字符再对齐,错误多为对齐相关的删除;RNN-T 指 Parakeet 按标签预测联合声学与语言上下文解码,错误多为替换或插入。二者解码机制不同使错误模式互补、无强相关,搭配做转写一致性检查时,只有两路独立犯错概率都低的一致才被保留,从而在没有人工参考转写时仍能筛掉不可靠标注。
复述时要说清监督来源不是人工,而是 2 模型互为参照;梯度路径与参数更新不涉及该阶段,因为两识别模型是推理调用而非本研究训练;重置时机也不适用。若把一致阈值收紧,产率会进一步下降,若放宽则混入更多误转写,论文选择 12.5% 与 15% 是产率与保真折中,复现时应固定同一阈值再比较。
本研究训练了什么,没有训练什么?
本研究没有训练切分、修复、识别与质量评估中的基础模型,而是调用既有模型做推理与筛选:PyAnnote 做日志,Smart Turn 做轮次判断,UVR-MDX-Net 做源分离,SIDON 做修复,Whisper Large v3 做语言识别,FastConformer 与 Parakeet 做转写,SCOREQ 等做质量预测。论文实际构造的是数据流水线加阈值筛选,没有报告这些基础模型的梯度更新、冻结策略或优化器配置,因此不能从模型名称推定其实现细节。
唯一涉及训练的是验证环节:为证明语料可训练合成模型,作者改造 LinaSpeech,将其 WavTokenizer 换成 Vevo 的流匹配声学解码器,理由是该解码器对波斯语感知质量显著高于标准编解码方案。论文未给出该合成模型的训练超参数、数据划分、训练步数与硬件预算,这是复现合成验证时的缺项,只能按原文描述重建模型结构,训练预算需另行记录。
理解这一点可避免误解:流水线本身是无训练的数据构造与规则过滤,训练只发生在最后的合成验证模型上。
数据来源、筛选协议与评估指标如何设定?
数据收集从知识共享许可的波斯语视频内容开始,采用关键词与频道 2 阶段搜索,共收集 9371.52 小时原始音频,覆盖 32207 个视频与 792 个频道。经早期语言过滤保留 6179.66 小时波斯语主导录音,后续切分、语言过滤、质量过滤、双识别一致都以这约 61,000 小时为起点。
下表提出比较问题:在相同原料下每步筛掉多少时长,瓶颈在哪一步,指标方向是保留时长越高则产率越高,但前提是质量与文本可靠。表前公平条件是各阶段输入均为上一步输出,无额外补充数据,单位均为小时。
| Stage | Hours Retained |
|---|---|
| Raw Audio | 6,179.66 |
| Utterance Segmentation | 4,355.86 |
| Language Filtering | 4,037.90 |
| Quality Filtering | 3,842.96 |
| Dual-ASR Agreement (Final) | 2,408.67 |
表后解释主要损耗与代价:从 6179.66 小时到切分后 4355.86 小时主要丢弃非语音与多说话人混杂的不可用区间;语言过滤到 4037.90 小时与质量过滤到 3842.96 小时降幅相对平缓,说明声学质量与语言纯度不是主要损耗;双识别一致到 2408.67 小时降幅最大,约丢掉 1400 小时,代价是为文本可靠性付出产率,收益是最终转写经过两路独立模型交叉验证。未胜出项是被双识别筛掉的高质量但转写分歧句,它们可能仍可听但不能作为可靠配对数据,这是产率与保真权衡的具体代价。
最终语料经全局说话人嵌入链接得到 3248 人,合并阈值为 0.6 余弦相似度。质量评估协议是取 1.6 小时 564 句做母语者平均意见分标注,比较 DNSMOS、NISQA、SCOREQ、VQScore、WhiSQA 5 种方法,指标为皮尔逊相关、斯皮尔曼相关越高越好,均方根误差越低越好。合成验证用 600M 参数 Parakeet 转写算词错率与字错率越低越好,用 CAM++ 算说话人嵌入余弦相似度越高越好,用 SCOREQ 算客观平均意见分越高越好。
主结果:质量评估选型与时长分布是否支持判断?
先看质量评估选型。下表比较问题是:在同一 564 句波斯语人工平均意见分子集上,哪种自动评估器与人评最一致,公平条件是同一音频、同一人评标签、同一相关与误差计算,指标方向是皮尔逊与斯皮尔曼越高越好、均方根误差越低越好。
| Method | PLCC | SRCC | RMSE |
|---|---|---|---|
| DNSMOS [18] | 0.5590 | 0.5182 | 0.6779 |
| NISQA [19] | 0.4786 | 0.4703 | 0.7179 |
| SCOREQ [7] | 0.6658 | 0.6271 | 0.6100 |
| VQScore [20] | 0.3826 | 0.3332 | 0.7554 |
| WhiSQA [21] | 0.6003 | 0.5704 | 0.6539 |
表后解释支持与限制:SCOREQ 以皮尔逊 0.6658、斯皮尔曼 0.6271、均方根误差 0.6100 全面最优,支持将其作为流水线过滤器的判断;次优是 WhiSQA 的 0.6003 与 0.5704,仍低于 SCOREQ;行业基线 DNSMOS 为 0.5590 与 0.5182,未胜出,印证其在波斯语上泛化差的报告;NISQA 与 VQScore 更低,VQScore 仅 0.3826 与 0.3332,说明并非所有表示型方法都自动适配波斯语。限制是相关性不是因果,且样本仅 564 句 1.6 小时,不能推广到所有频道与口音。
DNSMOS × SCOREQ: DNSMOS 是以降噪平均意见分为目标训练的通用质量预测器,在波斯语上常给高质量音频打低分;SCOREQ 是以对比学习建模感知质量流形的表示型评估器,对域外语言更稳健。论文用同一批 564 句人工平均意见分同时测 5 种评估器,正是因为要为过滤器选型,组合比较的意义是用相关性高低决定流水线中到底用谁做阈值,而不是沿用英文上好用的默认值。
再看时长分布。下图导读帮你确认韵律切分的结构改进效果,请先对照图例区分蓝色与橙色各自代表的流水线与时长范围。
看图路径: 1. 对比横轴分段时长与纵轴概率密度,先看蓝色 Emilia 在 3 到 5 秒的尖峰;2. 再看橙色本方法在 10 到 15 秒形成的宽峰与向 30 秒拖尾的分布;3. 确认两分布在 8 到 9 秒附近交叉,理解右移带来的长上下文增量
论文图 2。原论文 Fig. 2::“Utterance duration distributions.”。
图 2 横轴为分段时长秒,纵轴为概率密度,蓝色为 Emilia 方法,橙色为本方法。可见蓝色在 3 秒附近高达 0.14 以上并随长度快速衰减,呈短句主导的幂律状;橙色在 3 到 5 秒仅约 0.04,从 8 秒爬升并在 10 到 12 秒形成约 0.068 的宽峰,再向 30 秒缓慢拖尾。两分布交叉在 8 到 9 秒附近,右移结构增加了长片段比例,为合成模型提供短语与句子级韵律上下文。像素不能精确读出每柱数值时,只报告峰位区间与交叉区间,不硬写单柱概率。
修复对照:加 SIDON 到底改变了什么?
本节按消融逻辑组织:测的是语音修复是否提升感知质量,与谁比是仅去音乐与去音乐加 SIDON 按句修复,条件一致性是同一批切分后语句、同一 SCOREQ 标尺,指标方向是均值越高且方差越小越好。下表用原文连续句覆盖全部数字与单位,比较均值、离散度与高质量区堆积。
| 处理条件 | 平均 SCOREQ 分数 | 标准差 | 高质量区形态 | 比较对象 |
|---|---|---|---|---|
| 仅 UVR 去音乐 | 3.04 | 0.6 | 中心在 3.0 附近较分散 | 基线策略 |
| UVR 加 SIDON 修复 | 4.03 | 0.36 | 向高分右移且方差收窄 | 实际可运行策略 |
表后解释主要收益与代价:均值从 3.04 升至 4.03,标准差从 0.6 降至 0.36,支持修复有效减少混响与编解码残留损伤的判断;原文还报告修复后几乎全部超过 SCOREQ 3.5,这是具体收益。代价是修复为逐句神经重合成,虽未报告延迟与算力,但必然增加流水线成本,且若切分边界不准或源分离已失真,修复可能放大伪影。下图从分布形态补充验证,重点观察两组直方图峰位与重叠区的变化。
看图路径: 1. 对比横轴平均意见分与纵轴密度下蓝色仅去音乐与橙色加修复两组直方图的位置;2. 观察蓝色中心在 3.0 到 3.5 而橙色集中在 3.8 到 4.4,且方差明显收窄;3. 确认橙色在 3.5 以下几乎无质量堆积,验证修复对残留损伤的作用
论文图 3。原论文 Fig. 3::“SCOREQ MOS distributions comparing utterances processed with UVR only versus UVR followed by SIDON speech restoration.”。
图 3 横轴为平均意见分,纵轴为概率密度,蓝色为仅去音乐,橙色为去音乐加 SIDON 修复。可见蓝色宽峰在 3.0 到 3.5 之间峰值约 0.69,橙色窄高峰在 3.8 到 4.4 之间,4.1 附近密度高达 1.4 以上,且在 3.5 以下几乎无橙色堆积。趋势成立不等于每句都变好,个别句仍可能因修复伪影未改善,未测量误判率时不承诺修复降低所有失真。最终语料整体统计如下表,所有数字均由原文连续句逐字覆盖。
| 语料属性 | 数值 | 条件 | 聚合对象 | 说明 |
|---|---|---|---|---|
| 总时长 | 2408.67 hours | 双识别一致后 | 全语料 | 最终保留 |
| 语句数 | 625192 条 | 双识别一致后 | 全语料 | 语句级 |
| 说话人数 | 3248 人 | 余弦相似度 0.6 合并 | 全局链接 | 估计值 |
| 平均时长 | 13.87±6.32 s | 10 到 20 秒集中 | 全语料 | 接近目标高斯 |
表后解释分布落实情况:平均 13.87 秒接近目标均值 12 秒,证实目标采样落实到分布上;集中在 10 到 20 秒说明长上下文目标达成。合成验证报告合成语音词错率 2.1、字错率 0.3、说话人相似度 79.8、客观平均意见分 4.27,参考自然语音平均意见分为 4.31,差距仅 0.04,支持语料可训练出高可懂度与高自然度模型的判断。但需注意可懂度是用同一 Parakeet 模型转写评估,存在评估与标注模型同源的乐观偏差,且未报告主观听感平均意见分,这是适用边界。
哪些结论还不能下,边界在哪里?
论文直接报告的是各阶段保留时长、SCOREQ 在波斯语子集上相关最高、修复后分数右移、合成客观指标接近参考。有限解释是韵律切分提供更完整的语言学单位与更长的上下文,支持合成韵律更好,但论文未做拿掉韵律合并只留静音切分的同条件合成对比,因此不能把自然度提升完全归因于切分。
未验证推测包括流水线可直接推广到其他低资源语言,原文仅以波斯语验证,跨语言需重测语言识别阈值、轮次检测准确率与质量评估相关性。缺失证据不是技术错误,但复现时必须补记:SCOREQ 阈值具体值、语言概率远大于 0.95 的实现、说话人全局链接的误并率、双识别阈值的产率曲线、合成训练的划分与预算。
相关性不等于因果,SCOREQ 高相关不保证过滤后合成一定更好;总体趋势不等于每组都成立,修复均值提升不保证每句都提升。训练资源、推理开销、输出帧率与实际延迟需分别讨论,原文均未量化,不能承诺成本下降。
复现先做什么,需要哪些信息条件?
复现应按依赖顺序先做四件事。第一,重建预处理与语言初筛:统一转单声道 16 位 24 千赫兹、峰值归一到负 20 分贝满刻度、增益控制正负 3 分贝,用 UVR-MDX-Net 去音乐,用 Whisper Large v3 对每录音随机 10 个均方根大于 0.01 的语音主导片段投票,只保留平均目标语言概率超 90% 的录音。
第二,重建切分:先跑 PyAnnote 社区版日志,再跑 Pyannote Segmentation 3.0 与 Smart Turn 3.1,按均值 12 秒、标准差 4 秒抽目标时长动态合并,硬上限 30 秒,并记录 Smart Turn 在自标波斯语子集上的准确率是否接近 80%。第三,重建过滤:语句级语言概率远大于 0.95,SCOREQ 阈值按公开配置执行,记录每步保留小时数是否从 6179.66 经 4355.86、4037.90、3842.96 到 2408.67 的量级。
第四,重建双识别一致:同时跑 FastConformer 混合 CTC 与 Parakeet 换能器,互算字错率小于 12.5% 且词错率小于 15%,边缘 7 字符大于 50% 丢弃,取 Parakeet 为最终标签。关键超参数与信息条件是采样率、归一电平、目标高斯参数、30 秒上限、0.6 说话人合并阈值、双识别阈值与边缘检查窗口。代码开源、权重下载与系统可运行要区分:论文给出数据集与平均意见分子集链接当前可用,演示页可达,但各基础模型权重需按各自许可获取,拼起完整系统仍需整合工作。
何时值得尝试这个方案,如何一句话记住它?
当你面对无标注、多说话人、带音乐与混响的网络长音频,且目标是训练需要长上下文的语音合成,同时缺乏强本语言识别与可靠质量过滤器时,值得尝试该方案:先用轮次完整性而非静音能量决定切点并用目标时长控制长度,再用修复统一抬高质量,最后用结构不同的双识别一致代替人工真值。
论文特有的误解有三。其一,把长句等同于好韵律,实际上完整性与长度需同时满足,跨完整边界硬凑长度仍会破坏韵律。其二,把双模型一致等同于正确,实际上一致只是错误相关性低时的强指示,分歧句被丢弃不代表都是错句,而是为保真付出的产率代价。其三,把自动平均意见分高等同于人耳一定喜欢,实际上 SCOREQ 只是在 564 句上与人评最相关,合成验证的 4.27 仍是客观平均意见分,需补主观听感才能下最终判断。
记住它就是一句话:用完整边界换长度,用两路互认换文本可靠,用在波斯语上验证过的评估器换筛选有效,最终以约四成产率换来 2400 小时可用语料。
📎 论文与评分元数据
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
