英文题目:Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech

会议身份:conference:interspeech:2026:conference-paper-id:borodin26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #模型集成 #韵律 #文本到语音

评分:7.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Kirill Borodin:机构信息未能从会议 PDF 纯文本可靠映射
  • Nikita Vasiliev:机构信息未能从会议 PDF 纯文本可靠映射
  • Vasiliy Kudryavtsev:机构信息未能从会议 PDF 纯文本可靠映射
  • Maxim Maslov:机构信息未能从会议 PDF 纯文本可靠映射
  • Mikhail Gorodnichev:机构信息未能从会议 PDF 纯文本可靠映射
  • Grach Mkrtchian:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

针对俄语网络音频质量参差、移动重音与语调标注缺失导致文本到语音(Text-to-Speech,TTS)与语音增强(Speech Enhancement)自然度不足的问题,本文提出开源管线Balalaika并构建约5078小时多源俄语语料。原始长音频先经语义语音活动检测(Semantic Voice Activity Detection,Semantic VAD)切分为语义完整的话语块,再经时长、波峰因数(Crest Factor)、NISQA-S感知质量与pyannote说话人日志(Speaker Diarization)过滤保留干净单人片段。每个片段并行生成5路自动语音识别(Automatic Speech Recognition,ASR)假设并经识别器输出投票错误率降低(Recognizer Output Voting Error Reduction,ROVER)融合为共识文本,同时保留联结时序分类加语言模型(Connectionist Temporal Classification + Language Model,CTC+LM)一路的词级时间戳。共识文本再依次经RuPunctBig标点恢复、RuAccent词重音与е/ё归一化、轻量Transformer字音转换(Grapheme-to-Phoneme,G2P)转为保留标点与重音的国际音标(International Phonetic Alphabet,IPA)序列,形成可直接训练的多层标注。与已有俄语语料相比,机制差异在于异构解码互补与显式韵律代理,缓解形态丰富语言的误识与语调缺失。在25小时等预算下,单模型VITS在2000句共享异构测试集上取得平均意见分(Mean Opinion Score,MOS)3.618与语调MOS(IntMOS)2.532,自然度客观分领先但IntMOS次于单说话人RUSLAN的3.182;SEMamba去噪在3000样本测试下多数客观指标居首。结论限于俄语、固定预算非收敛训练与部分同源测试,跨语言迁移与更长训练排序尚未验证。原文未披露训练推理部署成本与硬件。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要保留什么?

本文的输入是公开渠道可获得的俄语长音频与附带文本资源,包括有声书、众包朗读、自发语音与字幕类数据,特点是时长很长、质量参差、说话人混杂、文本缺少重音与标点。目标是把这些原始音频变成生成模型可直接训练的多层标注语料,文本层要包含一致的转写、词级时间戳、标点、词重音与国际音标音素,音频层要保证单说话人、时长适中、感知质量达标。

阅读时必须保留的关键信息是每一步的取舍阈值、等量训练预算的比较条件、主观与客观指标的分工,以及作者明确承认的局限。输出是 1 篇可核对的方法复述,不评价语言优劣,只讲论文实际做了什么、在什么条件下测出什么。后续按学习依赖展开,先讲俄语难点与已有路线,再走完一个样本的完整流水线,然后讲构造与训练预算、实验条件、结果与反证,最后给出复现路径。代码当前可用,已公开在官方仓库。

数据集集合与主语料链接本次未能确认可达,不能写成已可下载;第三方引用中的部分链接当前不可用,需要按原文出处区分对待。

已有俄语语料路线解决了什么,还缺什么?

论文把已有路线分为 3 类。第一类是人工校对的朗读语料,例如戈洛斯系列,其优点是文本与音频对应经过人工检查,但论文指出其仍以指令式朗读为主,韵律模式相对固定,难以覆盖自发语音的停顿与语调变化。第二类是有声书衍生语料,例如俄语有声书与单说话人朗读库,其录音质量往往较高,适合合成基线,但说话人单一、风格偏书面朗读,泛化到多场景时受限。

第 3 类是大规模网络字幕与混合文本语料,例如开放语音识别大集合与视频字幕库,其规模优势明显,但转写噪声大、缺少标点与重音,难以直接支撑对自然度敏感的合成任务。论文的研究问题正是在此背景下提出的:如何在不依赖大规模人工的前提下,用可扩展的自动标注得到同时满足质量、说话人纯度与韵律信息的数据,并在等量预算下验证其对去噪与合成的实际作用。

理解这 1 对照很重要,后文所有比较都应回到同预算与同测试集的条件上看,而不是直接比较各语料的历史最佳成绩。

为什么俄语的标注不能只做语音转文字?

对初学者而言,一个容易误解的假设是只要语音转文字正确,合成自然会好。论文强调俄语有 3 个语言特异性使该假设不成立。第一是移动重音,重音位置可以改变词义与韵律,不标注重音会使合成模型在同形词上系统性读错。第二是元音弱化与腭化等音系现象,正字法与实际发音存在系统偏差,只给字形会迫使模型自行猜测发音规则。第三是语调结构依赖短语划分,缺少标点时模型难以学到合理的停顿与句调。

作为教学例子,可以想象同一串无标点无重音的词序列,人工朗读会先按语义分句再决定停顿与重音,而模型若只看到词序列,就只能按统计平均处理,于是出现停顿生硬或重音漂移。本文把例子明确标为例子,不代表论文报告过该句的数值效果。论文的解决思路是把转写只看作第一层,再叠加标点、重音与音素层,使文本条件更接近发音与韵律的真实决定因素。这一思路决定了后文流水线的顺序:先保证音频可训练,再保证转写稳定,最后做韵律富化。

流水线全景:一个样本经历了哪些关卡?

沿一个长音频样本走完全程,有助于建立整体坐标。输入是一段未经切分的原始长音频,首先进入语义切分,得到语义完整的短句片段并过滤语音占比过低或内部静音过长的片段,随后把相邻短片段拼成目标时长的语块。接着进入质量与说话人筛选,短于下限、冲击能量过高、感知质量过低或含多人重叠的语块被丢弃,只保留干净的单说话人片段。然后进入转写阶段,5 个异构识别假设经投票得到一致转写,并保留带词级时间戳的假设。

最后进入文本富化,依次恢复标点、标注重音并消解е与ё、转换为国际音标音素。输出是对每个保留语块的多层标注组合,可直接用于去噪与合成训练。论文报告最终语料约为 5078 小时,覆盖混合说话风格与多来源,标注层包括自动语音识别转写加标点加重音加音素加时间戳。需要强调的是,流水线是模块化的,俄语相关组件可以被替换,但论文实验只验证了俄语实例,不能直接推广到其他语言。

切分与过滤如何决定哪些音频能留下?

切分阶段使用语义语音活动检测模型识别完整话语,而不是按固定时长硬切。论文的操作是先得到候选片段,再剔除语音占比不足 70% 或内部静音超过 1 秒的片段,最后把连续短片段拼成上限 15 秒、目标 5 到 15 秒的语块。白话解释是,语音活动检测判断哪段有人声,语义一词强调切点应落在语义边界附近,以保护词语与韵律连续性。过滤阶段分四道关卡:删除过短话语,剔除脉冲能量过高的削波类片段,用感知质量模型剔除低分片段,再用说话人日志剔除重叠与多人片段。论文给出的可复述阈值包括时长下限、波峰因数阈值与质量分阈值,这些阈值直接决定数据量与质量的权衡。

语义语音活动检测 × SmartTurnV3.1: 语义语音活动检测负责按语义完整性决定在哪里切分,避免任意切断词与韵律短语;SmartTurnV3.1 是论文选用的具体实现,承担上下文感知的切分判断,二者搭配的理由是用语义连续性替代固定时长切分,组合后新增的作用是得到适合建模的 5 到 15 秒语块并保留后续标点与重音所需的上下文。

NISQA-S 质量过滤 × 说话人纯度过滤: NISQA-S 质量过滤负责预测感知质量并剔除低分与削波明显的片段;说话人纯度过滤使用说话人日志系统剔除重叠与多人片段,确保每段只有单一说话人,二者搭配的理由是一个管录音质量、一个管说话人归属,组合后新增的作用是只留下干净的单说话人训练材料,避免噪声与说话人混淆同时污染生成模型。

转写与时间戳如何兼顾稳定与可用?

转写阶段为每个语块生成 5 个假设:同一声学模型的直接连接时序分类解码、同一模型加外部词级语言模型的解码、同一家族的循环神经网络换能器解码,以及两个独立模型的解码。其中带语言模型的分支同时产生词级时间戳。白话解释是,连接时序分类与换能器代表不同的搜索与对齐方式,语言模型提供词汇先验,独立模型提供多样性。最终转写通过识别器输出投票得到,该方法把所有假设对齐为混淆网络并选择一致词序列,目标是最小化词错误。

论文的存储设计值得复述:主文本保存投票后的一致转写,用于文本训练与评测;同时保留带语言模型分支的假设及其词级时间戳,供需要时间信息的下游使用。这种双轨设计避免了在稳定转写与时间对齐之间二选一。

多识别器集成 × ROVER 投票: 多识别器集成负责提供差异化的候选转写,包含 CTC 解码、带语言模型的 CTC、RNN-T 以及独立的 Vosk 与 T-one;ROVER 投票负责把 5 个假设对齐为混淆网络并选出一致词序列以降低词错误,二者搭配的理由是搜索方式与模型来源互补,组合后新增的作用是得到更稳定的主转写,同时保留带词级时间戳的假设供下游使用。

标点、重音与音素各自补了哪块信息?

文本富化分 3 步,每步只做原文明确说明的事。第一步用标点恢复模型从无标点词序列直接恢复句末与句内标点,论文将其定位为短语划分与篇章结构的轻量代理,并与合成语调自然度关联。第二步用俄语重音模型做上下文相关的重音标注,并在发音需要时恢复ё,得到发音一致的文本表示,用于支撑韵律建模与同形词消歧。第 3 步用轻量变换器编码器解码器做词级字形到音素转换,把字形映射为国际音标并原样复制非字形符号。

白话解释是,字形到音素转换解决怎么写与怎么读不一致的问题,国际音标提供统一的发音符号库存。论文还报告了该转换模型的规模与训练设置,包括模型维度、前馈维度、层数、注意力头数、词表长度限制、优化器与学习率等,但未报告该模块自身的音素错误率,因此不能把合成收益直接等同于该模块的转换精度。

词重音标注 × 标点恢复: 词重音标注负责标出俄语移动重音并消解е与ё的歧义,支撑发音一致性;标点恢复负责从无标点词序列补回句界与句内停顿,作为短语划分与语调的轻量代理,二者搭配的理由是重音管词内韵律、标点管句级韵律结构,组合后新增的作用是在相同音频上改变文本条件,论文消融显示二者联合时合成自然度与可懂度权衡最好。

字形到音素转换 × 国际音标: 字形到音素转换负责把经过重音归一化的正字法映射为发音序列,并原样保留标点与重音符号;国际音标是其目标符号集,用于覆盖元音弱化与辅音清化等俄语音系现象,二者搭配的理由是正字法不能直接表达实际发音,组合后新增的作用是给出稳定的音素层标注,供对发音敏感的合成与分析任务直接使用。

语料构造与模型训练的计算过程是什么?

本节同时承担语料构造与验证性训练两部分,因为论文的训练不是提出新模型,而是用固定预算检验数据效果。语料构造没有神经网络梯度更新,其计算是流水线推理与规则过滤:切分模型推理、质量模型推理、说话人日志推理、多识别器推理与投票、标点与重音模型推理、音素模型推理,外加基于阈值的丢弃与分组。原文明确给出了可复述的构造参数,整理如下表,表中数值与单位均来自原文连续句,阅读时注意时长单位为秒、质量分为模型预测分。

验证性训练部分,去噪与合成分别使用固定配方从零训练,不使用早停,均在最终检查点评测。去噪统一加入音乐语音噪声与混响增强,合成统一使用相同文本测试集,这种等量设计使数据成为主要变量。论文未报告训练硬件时长与推理延迟等成本量,因此不能承诺效率改善。 下表提出一个可核对问题:在相同音频来源下,哪些阈值决定了最终留下多少秒的训练材料?表中条件为原文实际使用的过滤规则,指标方向是阈值越严则质量越高但数据量越少。

阶段操作对象保留条件阈值与单位论文说明的作用
切分后分组相邻短片段拼块上限与目标区间15 seconds,上限;5 and 15 seconds,目标区间平衡下游输入时长约束与语义连续性
质量过滤前过短话语删除过短3 s去除不可训练的极短片段
脉冲能量过滤高冲击能量片段剔除超阈值threshold 10去除削波类失真
感知质量过滤低分片段丢弃低分MOS < 4.2只保留高质量感知片段
语料总量保留后全部音频报告总量approximately 5078 hours of audio说明多源语料规模

表后需要解释主要收益与代价。

严格阈值的收益是进入训练的音频更干净且为单说话人,有利于生成任务的稳定性;代价是会丢弃大量原始音频,且阈值本身依赖质量模型的预测偏差。未胜出的替代是放宽到更低质量分,论文后文报告放宽会同时损害韵律与可懂度,因此阈值选择不是越大越好,而是在质量与数据量之间的经验折中。复现时应先原样复现这组阈值,再做单变量调整。

实验按什么问题组织,条件是否一致?

论文围绕 3 个研究问题组织实验。第一个问题比较框架产出的数据集质量,客观侧用原始感知质量模型的 5 个维度与东京大学语音合成主观分预测系统,主观侧用经典平均意见分与文本匹配率,文本匹配率定义为评委判断显示文本与实际说话内容一致的片段百分比。第二个问题比较去噪效果,统一从零训练相同增强模型,客观指标包括信号失真、背景抑制、整体质量、感知语音质量、短时客观可懂度、虚拟语音质量客观听众分数与尺度不变信号失真比。

第 3 个问题比较合成效果,统一从零训练单一样本的变分自编码器加对抗学习的端到端合成模型,客观侧用感知质量与合成专用自然度预测,主观侧用经典平均意见分与语调平均意见分,可懂度用识别模型的字错误率衡量。公平条件的关键是等量预算与不相交划分,下表把原文的预算语句整理为可对照形式。 下表要回答的比较问题是:去噪与合成的等量预算是否把数据作为唯一变量?

表中训练量、优化器与步数均为原文固定配方,测试集均为与训练抽样不相交的保留集,指标方向均为分数越高越好,字错误率越低越好。

任务训练预算固定配方测试集规模与构成公平性要点
语音去噪25 h,每数据集随机抽样Adam, lr=5×10−4, batch=8, 50k steps,最终检查点评测3,000 samples,500 clips 每来源,保留集不泄露统一加噪声与混响增强
语音合成25 h,每数据集音频Adam, lr=10−4, batch=32, 100k steps,最终检查点评测2,000 texts,多源保留集,所有系统共享相同文本集,训练抽样不相交
主观评测每音频至少 7 个母语人评分取中位数聚合,系统分取均值并报告 95% 置信区间合成主观抽 200-text 子集经典分与语调分分开报告

表后解释收益与限制。

等量预算的收益是能把数据质量与标注的作用分离出来,避免用更大算力掩盖数据差异;代价是所有系统都未训练到完全收敛,绝对分数可能被低估。未评测的边界包括训练资源消耗、推理延迟与输出帧率,原文未测量这些量,因此不能从质量分数推定部署成本。复现时必须保留相同的抽样量与最终检查点评测规则,否则跨数据集比较将失去意义。

等量预算下测出了什么,哪些没分出胜负?

论文报告框架比较显示,自建语料在客观预测与人工平均意见分上排名靠前,文本匹配率也居前列,支持多识别器融合带来了转写可靠性。但阅读时要区分直接报告与有限解释:论文同时承认部分主观差异小于置信区间,不能据此建立严格排序。去噪方面,论文报告在自建数据上训练的模型在多数客观指标上取得最高分,尺度不变信号失真比也最强,支持高质量数据同时改善感知质量、背景抑制与可懂度。

合成方面,论文报告自建数据训练的模型取得最高的客观质量分与人工平均意见分,同时保持有竞争力的字错误率;但语调平均意见分最高的是单说话人朗读库,自建数据排第二,论文将其解释为单说话人数据在表现力上的优势,这是一个重要的未胜出项,说明多源混合数据在整体自然度占优时,仍可能在语调表现力上输给精心录制的单说话人数据。

下表把原文对主结果的定性判断整理为可核对的对照,表中对象均为原文实际可运行的数据集训练策略,不含事后最优值。 下表提出的问题是:在共同测试集上,自建数据相对哪些基线取得了可报告的优势,又在何处未胜出?表中比较保留原文的策略名称与指标方向,客观分越高越好,字错误率越低越好。

任务自建数据的报告位置未胜出的对照原文的限定语支持的判断
数据集质量客观预测与人工分居前部分基线在单项接近最高与次高需看加粗与下划线标注流水线提升质量与转写一致性
语音去噪多数客观指标最高部分基线在个别指标接近顶分集中在多数而非全部指标高质量数据有助于去噪泛化
语音合成整体客观质量与人工分最高字错误率仅为有竞争力保持可懂度而非最低错误率自然度与可懂度权衡最强
语音合成语调语调分排第二RUSLAN 最高差异可能小于置信区间单说话人仍有表现力优势

表后解释代价与反例。

主要收益是混合多源数据在等量预算下同时改善去噪与合成;具体代价是合成测试集取自自建语料的多源保留子集,与部分来源数据集存在域对齐优势,因此这是一个受控的共同测试集比较,不是完全来源独立的评测。若要更强结论,还需补做与所有训练来源均不相交的第三方测试集。

标点、重音与过滤阈值各自贡献了什么?

消融固定音频、只改变文本标注与质量阈值,因此能较干净地分离标注的作用。论文比较了无附加标注、仅加 stress、仅加标点、同时加两者,以及不同质量分阈值的设置。报告的结论是标点与重音联合最有效,相比单加其一能进一步提升平均意见分与语调分并降低字错误率;把质量阈值从 3.5 提高到 4.2 能提升预测与人工自然度并降低字错误率(%),而降到大于 3 则所有指标变差,提示低质量音频伪影会同时传导到韵律与可懂度。

学习时不要把相关性读成因果承诺:论文测的是在该合成配方与该测试集上的联合变化,未测量误判率随阈值的连续曲线,也未报告不同说话风格下的分组效应,因此总体趋势不等于每组都成立。作为可操作的复现顺序,应先复现同时加标点与重音加严格过滤的基准,再单变量去掉重音或标点,最后再动阈值,每次只改一处并保留相同的训练步数与评测文本。

哪些结论不能推广,缺了哪些验证?

论文明确列出 3 类局限。第一是训练预算固定且未到完全收敛,所有系统都可能欠训练,跨数据集的相对比较成立,但绝对分数不能当作各数据集的上限。第二是流水线依赖俄语组件,包括识别、标点恢复、重音标注与字形到音素转换,直接迁移到其他语言需要替换相应工具,模块化降低了工程难度,但不等于跨语言效果已验证。

第三是合成测试集取自自建语料的混合保留划分,与部分来源数据集存在域重叠,模型可能受益于部分域对齐,因此只能视为共同测试集上的受控比较。此外,缺失的证据不是技术错误,但需要如实指出:原文未报告音素转换本身的错误率、未报告训练与推理的硬件预算与延迟、未报告低质量阈值下的误剔除率。这些缺项决定了本文不能承诺延迟改善、成本下降或每步都成立的单调趋势,后续验证应优先补第三方独立测试集与成本测量。

要复现这条流水线,先做什么、用什么?

复现应按数据可获得性分两条路径。第一条是复现标注逻辑,需要官方代码仓库,当前可用状态为已公开,可按原文顺序实现语义切分、质量与说话人过滤、多识别器投票、标点恢复、重音标注与音素转换,并原样使用原文阈值与分组规则。

第二条是复现语料总量,需要原始音频来源,论文说明原始音频仍按各自来源许可分发,且仅提供从原始来源复现标注的脚本,其中音乐切分部分指向特定语料集合,但该集合与主语料集合本次未能确认可达,因此不能假设 1 次点击即可获得全部 5078 小时,应先核对各来源许可与可达状态,再决定复现子集。验证性训练的复现要点是保留等量预算:去噪与合成均只抽 25 小时,固定优化器、学习率、批量与步数,在最终检查点评测,不使用早停。

主观评测若要复现,需使用相同的评分量表定义,区分经典平均意见分与语调平均意见分,并保证每条音频有足够数量的母语人独立评分后取中位数。第三方工具中部分历史链接当前不可用,遇到不可用链接应按原文引用寻找替代来源,不自行编造数据划分来补齐。

何时值得尝试这套方法,如何一句话记住它?

当任务是俄语生成语音且痛点集中在重音错误、停顿生硬或转写噪声大时,这套数据中心的方法值得优先尝试,因为它把质量过滤与韵律富化放在与转写同等重要的位置,并在等量预算下同时支撑去噪与合成。当任务是单说话人有声书风格的极致表现力,或测试域与训练来源完全不相交时,应降低预期,因为论文的语调最优仍属于单说话人库,且共同测试集存在域对齐。复现时先做严格过滤加标点加重音的完整基准,再做减法消融。

验证时至少补一项来源独立的测试集与一项成本记录,避免把自然度分数直接读成部署收益。一句话记住:先用语义切分保住句子,再用投票保住词,用过滤保住声音,最后用标点与重音把俄语的韵律还给模型。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总