英文题目:Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants

会议身份:conference:interspeech:2026:conference-paper-id:shigabeev26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #语音 #文本到语音

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Ilya Shigabeev:机构信息未能从会议 PDF 纯文本可靠映射
  • Ilia Latyshev:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

俄语对话助手需要的文本到语音(Text-to-Speech,TTS)必须输出富有表现力且符合轮次节奏的会话语音,而现有俄语语料多为中性朗读或非受控采集,难以支撑该目标。本文构建名为 Dialogs 的影棚级俄语对话语料,总时长 20.6 小时、11796 条 utterance、3 名说话人(Masha 女 9.9 小时、Sveta 女 4.4 小时、Dima 男 6.2 小时),44.1 kHz 16-bit 立体声。其链条分为三步:先以 GPT-3.5 辅助生成覆盖家庭、旅行、诗歌朗诵、绕口令、汽车与影评书评等场景的提示文本,再让木偶剧院职业演员面对面即兴表演并以 Behringer XM8500 立体声录制,最后经人工切分对齐与 Yandex Tasks 平台众包多标注者投票得到每句风格标签并按说话人与风格分层划分训练、验证、测试集。与朗读式基线相比,该流程的关键差异在于允许偏离脚本的即兴表达与面向对话的表演式录制,从而保留自然语调与接话节奏。在母语者众包语料质量评测下,Dialogs的表现力得分为4.11±0.08,高于Ruslan的表现力得分3.86±0.11。该结论适用边界为表演式影棚俄语三说话人范围,自发重叠对话与噪声场景的外推能力尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决哪件具体事?

这篇解读的输入是 Interspeech 2026 的 1 篇语料论文,目标读者是刚进入语音、音乐与音频方向的研究生。需要保留的关键信息是语料规模与录制方式、标注流程、切分方法、主观评测条件与基线、以及 VITS2 概念验证的训练与评测条件,输出是一套你可以核对和复述的构造与实验链条。本文只讲论文实际做的俄语对话合成用表情语料,不扩展到通用多语合成。

论文要解决的具体矛盾是:现代对话助手需要自然、有表情、能交互的语音,而俄语现有公开资源要么是单人朗读,要么是大而录制不可控,缺少同时满足工作室音质、对话录制风格和逐句情绪标注的资源。作者因此构建名为 Dialogs 的语料:20.6 小时面对面表演对话,在专业录音棚以 44.1 kHz 立体声录制,切分为 11796 句话,覆盖 3 位说话人,并提供 12 类风格与情绪标签。

验证分两步,先用人群打分证明录音质量与可懂度不输强基线且表情与对话自然度更高,再用 VITS2 证明即使每人只有几小时也能训出有对话感的合成语音。理解这条主线后,后续每一节只承担一个教学任务,先讲任务与路线,再讲语料全景与组件,最后讲评测与复现。

附:初学者易混概念的快速校准

平均意见分是让人听完打分再平均,主观但直接;UTMOS 是模型预测的自然度分,客观可重复但只是近似。风格标签是监督信号,不是合成效果本身;标签多不等于模型自动可控,还需要训练时正确使用。工作室质量保证的是底噪与清晰度,不保证对话感。

对话感来自面对面表演与即兴,音质好只是让这种风格可被模型利用。VITS2 在这里的角色是探针,用统一配置证明数据可用,不是论文要刷的模型创新。读懂这些区分后,再回看主结果就不会把小数据概念验证误读为通用最优,也不会把自动分当成人评。

已有哪些路线,为什么它们不够用?

论文把公开语音语料归为 3 类,这个分类是理解缺口的关键。第一类是朗读语料,例如有声书和新闻,优点是音频干净、文本准确,缺点是演员对麦克风念,语调单一中性,学不到轮转和情绪。第二类是网络挖掘语料,例如转写视频与播客,优点是自然有表情且像对话,缺点是文本质量受限于语音识别准确率,录制环境不可控。

第 3 类是工作室录制语料,是商业合成工业的标准做法:专业配音演员在吸声房间长时间录制,音质好且标签准,但情绪必然是表演出来的,好处是可可靠标注,坏处是商业价值高而很少公开。俄语已公开的工作室语料如 Ruslan 和 Natasha 属于单人朗读、无情绪标签,能做中性合成,但做不了表情与对话系统。英语已有 Expresso 和 DailyTalk 作为对话参考点,但不能直接解决俄语问题。

论文用表格对比了时长、采样率、风格数、是否对话、语言和许可,结论是没有现有俄语语料在同一规模上同时给出工作室音质、对话风格和逐句情绪标注。

朗读语料 × 工作室对话语料: 朗读语料分工是提供干净音频和准确文本,录制时演员对着麦克风念,风格单调中性;工作室对话语料分工是提供面对面交互的韵律、轮转和情绪着色,演员互相表演并允许即兴。搭配理由是仅有干净文本学不到对话韵律,仅有自然对话又难保证可训练的标注质量,Dialogs 把两者结合:保持 44.1 kHz 工作室录音与人工切分对齐,同时用对话式表演获得自然语调,新增作用是让表情合成模型能学到读语音里没有的轮转节奏。

这个判断限定了本文的任务边界:不是刷更大规模的通用识别数据,而是补一块可用于微调表情合成模型的高质量对话数据。

论文把什么定义为可验证的问题?

论文把问题拆成 3 个可验证的动作。第一,语料是否真的具备对话属性:演员不是照稿念,而是拿准备好的文本做提示,允许偏离和即兴发挥,用表情化的实现方式说出来,从而得到自然语调与节奏。第二,语料质量是否达到工作室水准:需要在相同打分协议下,与 Ruslan 和 Natasha 这两个俄语工作室基线比较音频质量与可懂度,同时在表情丰富度和对话自然度上拉开差距。

第三,语料是否真的能训练模型:用 VITS2 在训练切分上从零训出多说话人表情合成,并在保留测试句上做主观与自动评测,证明合成语音保留了对话风格。论文明确说这只是概念验证,预期生产用法是把 Dialogs 与更大俄语语料混合,以补表情和对话风格,而不是单独用它达到产品音质。这个定位很重要,避免把小数据验证误读为通用最优方案。

Dialogs 全景:一个样本走完全流程

沿着一个话语走一遍,你就能复述整套方法。输入是一段由 GPT-3.5 辅助生成的剧本提示,场景覆盖家庭互动、旅行、诗歌朗诵、绕口令、汽车讨论、影评书评等,文本层面还要求覆盖数字、地址、新词、即兴对话、副语言事件、朗读文本、疑问句、感叹句、外来品牌名,以及大声、小声、快、慢、喊叫、耳语等可变实现。演员是来自俄罗斯中部的专业木偶剧院演员,共 3 人,面对面坐着表演,提示文本只是起点,允许即兴。表示阶段是立体声波形文件,以 44.1 kHz、16 位 WAV 保存,环境噪声约 20 dBA,使用 Behringer XM8500 麦克风录制。

组件阶段做人工切分与文本对齐,只做最小降噪,得到平均约 6.3 秒的话语。目标阶段是给每句话打上一个或多个风格标签,12 类包括中性、高兴、惊讶、悲伤、厌恶、生气、绕口令、诗歌、耳语、傲慢、大笑、恐惧。输出是 11796 句话的训练、验证与测试切分,以及附带的说话人元数据与知情同意记录。整个设计用表演换取可标注性,用面对面换取轮转节奏,用工作室换取可训练的音质。

文本提示与表演规则如何配合?

文本材料与录制规则是两个分开的部件。文本部件负责提供可说的多样性:剧本覆盖生活场景与诗歌绕口令,还用清单强制包含数字、地址、新词、疑问与感叹、外来语和快慢强弱变化,目的是让合成模型在训练时见过俄语表情合成真正需要的文本现象。表演部件负责把文本变成对话:演员面对面坐着,允许偏离剧本、用符合上下文的表情方式即兴发挥,目标是自然语调与节奏。两者的搭配理由是,若只有多样文本而严格朗读,得到的是清晰但平淡的读语音。

若只有即兴而无文本清单,会漏掉关键的合成难点。组合后新增的是与对话合成直接相关的韵律:轮转时机、语调起伏和情绪着色,这是读语音数据给不了的。

风格标注 × 对话合成: 风格标注分工是给每个话语一个可监督的情绪或文体身份,如中性、高兴、惊讶、耳语等;对话合成的分工是根据文本生成带合适韵律和情绪的连续语音。搭配理由是若无逐句标签,模型只能学平均风格,无法按需表达;有了标签,训练时可把标签作为条件或数据筛选依据。组合新增作用是让 20.6 小时的多情绪数据变成可控的训练信号,而不只是一堆好听但不可复用的录音。

需要提醒初学者:这里的自然是有控制的表演自然,不是真实自发对话,论文在局限中明确说重叠语音与背景噪声是不包含的。

录制、切分与标注是如何实际执行的?

训练在这里不是指神经网络训练,而是指语料的构造与切分流程,这是数据集论文承担方法职责的部分。录制在专业录音棚完成,演员面对面,立体声采集,文件为 44.1 kHz、16 位 WAV。原始长录音被人工切分为话语并与文本对齐,只做最小降噪,保留表演细节。切分策略值得复述:测试集是语料质量主观评测用过的 188 句话,按每说话人每情绪各 5 句分层抽样,稀有组合不足则少取;验证集用同样分层策略从剩余话语中抽取,每说话人每情绪 5 句,随机种子 42,得到 180 句。

其余 11428 句为训练集。最终时长为 19.9 小时、0.30 小时与 0.37 小时。标注在 Yandex Tasks 众包平台完成,每句话由 3 名标注员独立审听,取多数标签为真值,若 3 人各不相同则选全局最不频繁的类别,以提升稀有风格的召回。这种平局规则是有意偏向稀有类的,不是简单的随机打破。 下面先看话语时长分布密度图,它直接反映切分结果是否为短轮转为主的对话形态。

该图横轴为秒数,纵轴为概率密度,柱状集中在数秒并向长尾延伸, teaching 上可用来判断训练时模型看到的上下文长度。

看图路径: 1. 先看横轴 Duration 秒数与纵轴 Probability density 的含义,确认是时长分布密度而非单条波形;2. 再找峰值位置与拖尾范围,判断多数话语集中在几秒、长话语延伸到多少秒;3. 最后把分布形状与平均 6.3 秒的报告对照,思考短轮转多对对话节奏训练的意义

原论文 Figure 1:Audio recording duration distribution density.

论文图 1。原论文 Figure 1:“Audio recording duration distribution density.”。

从像素可见,横轴标注为 Duration 秒,范围从 0 延伸到 35 秒附近,纵轴为概率密度,峰值在 3 秒左右高达约 0.15,1 到 2 秒快速爬升,5 秒后逐步下降,10 秒后明显变矮,15 到 20 秒仅剩很低的柱子,25 秒以上几乎为零。这说明多数话语是短句轮转,符合面对面即兴对话的节奏,同时存在少量长达十几秒的朗读或叙述。与报告的平均 6.3 秒一致:均值被长尾拉高,中位数更靠近峰值。复现时应按此分布检查切分是否正确,若你的切分出现大量超长句,很可能是切分过粗或包含了多轮。

VITS2 端到端合成 × 小数据多说话人训练: VITS2 端到端合成的分工是 1 阶段直接从文本学到波形,不依赖独立声学模型加声码器流水线;小数据多说话人训练的分工是在每人仅 4.4-9.9 小时、共 3 人的条件下让模型同时学 3 个音色和多种表情。搭配理由是论文要做概念验证而非追求最高音质,用统一的 VITS2 默认配置最能说明语料本身是否可用。组合新增作用是暴露真实代价:在数据不均衡时模型能保留对话风格,但可懂度和整体分偏低,提示生产时需与更大语料混合。

主观评测与客观评测的条件是什么?

实验条件分语料质量验证与 VITS2 验证两套,但打分协议一致。语料验证的测评对象是原始录音:Dialogs 取 188 句分层样本,每说话人每情绪 5 句;Ruslan 和 Natasha 因是单人读语音且无情绪标签,各随机取 100 句。子集大小不同不影响可比性,因为每组的平均意见分都带各自的 95% 置信区间。母语听众在 5 分制下打 6 个维度:总体、音频质量、韵律、可懂度、表情丰富度、对话自然度。

去除按作答模式识别出的异常标注员后,Dialogs 剩 41 人,Ruslan 剩 26 人,Natasha 剩 23 人。VITS2 验证的测评对象是合成语音:在保留的每说话人 20 句、共 60 个音频上打同样的 6 个维度,外加 UTMOS 神经网络预测分,分数越高越好。VITS2 训练用单卡 NVIDIA RTX 4090,批量 16,按原始 VITS2 默认超参数训 615000 步。论文还报告语料整体 UTMOS 为 3.17 加减 0.07,可作为录音基线。

人群平均意见分 × UTMOS 自动分: 人群平均意见分分工是由俄语母语者在 Yandex Tasks 上按 6 个维度打 5 分制主观分,直接反映听感;UTMOS 自动分分工是用神经网络预测自然度,提供低成本可重复的客观参照。搭配理由是主观分权威但贵且波动大,自动分便宜但与人耳不完全一致,两者并用可互相校准。组合新增作用是在语料验证和 VITS2 验证中同时看到人评趋势与机器趋势,避免只看一类指标下结论。

初学者要记住:不同指标的差值不能混放,自动分不能当成人评分,数值相同也不代表同一指标。

语料质量与合成效果的主结果是什么?

比较问题是:在公平的人评条件下,Dialogs 是否在保持录音质量的同时赢下表情与对话自然度,以及 VITS2 能否从中学生成对话感语音。公平条件是同一众包平台、同一 6 维度 5 分制、各自报告置信区间;指标方向均为越高越好。第一张表整理语料总体与切分,帮你核对数据量级与可运行的训练预算,5 列设计是为了同时看到话语数、时长、采样率与说话人结构,避免只看总时长误判每人数据量。

条件话语数时长采样率与声道说话人与标签
总体11796 句20.6 hours44.1 kHz stereo3 speakers,12 categories
训练切分11428 句19.9 h44.1 kHz stereo3 speakers
验证与测试切分180 句,188 句0.30 h,0.37 h44.1 kHz stereo3 speakers 分层抽样

表后解释需要同时讲收益与代价。收益是总量 20.6 小时、11796 句、3 人、12 类标签的组合在俄语公开工作室语料中是稀缺的,且训练集仍有 19.9 小时可用;代价是切分后验证与测试仅 0.30 与 0.37 小时,且风格时长极不均衡,中性 643.50 分钟、高兴 349.59 分钟,而耳语仅 6.13 分钟、诗歌 8.82 分钟、恐惧 9.37 分钟,意味着稀有风格的监督信号很少。

未胜出项是总量本身:与 350 小时的 Dusha 或 1240 小时的 Golos 比,Dialogs 并不以规模取胜,而是以对话风格与标注取胜。 第二张表整理 VITS2 概念验证的可运行条件与关键人评分,5 列设计是为了把训练预算、评测预算与效果放在同一行核对,防止把训练步数当成质量保证。

条件训练预算评测预算表情与对话人评分可懂度人评分
VITS2 在 Dialogs 训练切分上训练batch size of 16,615000 steps,单卡 NVIDIA RTX 409020 held-out sentences per speaker,60 audio files totalexpressiveness 2.56,conversational 2.59intelligibility 2.28

表后解释要区分报告与推测。

论文报告合成语音有清晰的对话与表情特征,且表情 2.56 与对话 2.59 明显高于可懂度 2.28,支持模型吸收了语料韵律风格的判断;同时报告总体 2.83、音质 2.97、韵律 2.55,自动 UTMOS 3.36,整体偏低。代价是每人 4.4 到 9.9 小时的不均衡预算,论文明确说混合更大语料才有望达到产品质量。未胜出项是可懂度,它是 6 维中最低的,说明小数据表情训练首先牺牲的是清晰度而非风格,这是复现时必须接受的权衡。

哪些对照说明收益来自对话风格而非录音更好?

论文没有做传统消融切模块,但用基线对照起到了反证作用。语料质量部分,Dialogs 与 Ruslan、Natasha 在音频质量与可懂度上基本持平,总体分分别为 4.15、4.26、4.16,音频质量 4.19、4.23、4.18,可懂度 4.14、4.17、4.16,置信区间重叠,确认工作室录音水准相当。关键差异在表情与对话维度:Dialogs 表情 4.11 高于 Ruslan 的 3.86 和 Natasha 的 3.88,对话自然度 4.08 高于 3.78 和 3.82,论文总结为高出约 0.23 到 0.25 分与 0.24 到 0.30 分。这支持收益来自对话表演与情绪多样性,而非单纯麦克风更好。

VITS2 部分没有对比在 Ruslan 上训练的同一模型,因此不能说 Dialogs 训出的模型全面优于读语音模型,只能说在 Dialogs 上能训出有对话感的模型,且风格分高于可懂度分。若要补强,需要增加同模型、同评测句、在不同语料上训练的对照,并固定说话人与文本难度,否则无法分离语料风格与模型能力。

边界在哪里,哪些结论不能推广?

论文明确列出 3 类边界。第一,表演边界:演员按剧本提示表演,真正的自发对话、说话重叠与背景噪声都不存在,因此学到的轮转是干净的轮转,不能直接推广到嘈杂重叠的真实对话。第二,数据均衡边界:3 人时长为 9.9、6.2 与 4.4 小时,风格时长从数百分钟到几分钟不等,单独使用会导致每说话人合成质量差异,生产建议与更大语料混合。

第三,评测边界:语料验证的基线各取 100 句随机样本,Dialogs 取 188 句分层样本,虽然置信区间已分别报告,但基线无情绪分层,跨库比较时仍需注意采样结构不同。资源状态也需谨慎:正文给出 Hugging Face 数据集链接并声明 OpenRAIL 许可允许商业使用,但本次没有收到来源绑定且完成 HTTPS 验证的资源证据,因此不能声称数据当前可用或已公开,只能说论文声明公开在该地址与该许可下,实际可达性需读者自行确认。训练代码地址同样只按论文原样转述,不做可达性承诺。

要复现,先做什么,需要哪些具体参数?

复现分语料复刻与模型复现两条线。语料复刻先做文本清单:准备家庭、旅行、诗歌、绕口令、汽车、影评书评等场景,强制覆盖数字、地址、新词、疑问、感叹、外来品牌名与快慢强弱变化;再做录制:专业棚、面对面、立体声、44.1 kHz、16 位 WAV,记录环境噪声与麦克风型号;然后人工切分对齐并最小降噪,统计平均时长与分布;最后按每说话人每情绪 5 句做分层测试与验证切分,验证切分固定随机种子 42,测试用评测过的 188 句,剩余为训练。

标注复现用 3 人独立标注取多数,平局选全局最稀有类。模型复现按 VITS2 原始默认超参数,批量 16,单卡 RTX 4090,训 615000 步,在每说话人 20 句保留句上做 6 维度人评加 UTMOS。先跑通小规模合成并检查表情与对话分是否高于可懂度分,再考虑混合大语料提升清晰度。缺项是论文未报告学习率、优化器细节与具体文本前端处理,复现时只能沿用 VITS2 原仓库默认,不猜论文用了特殊前端。

何时值得尝试这套做法?

当你的目标是俄语对话助手的表情与对话感,而非单纯把字念清楚时,这套做法值得尝试。它的适用条件是已有较大中性语料保证可懂度,需要一小块高质量对话数据来补韵律与情绪;Dialogs 的价值正在于提供这种可混合的表情成分。若你只有这 20.6 小时且要求产品级清晰度,则不值得单独依赖,因为人评显示合成可懂度仅 2.28 左右。复现时优先验证切分与标注是否保留稀有风格,再验证人评协议是否与论文一致,最后才调模型。还需补的验证是跨语料对照、同模型在读语音与对话语料上的并排比较,以及长对话上下文的连贯性测试,这些在原文中未测量,不能承诺延迟、误判率或成本会改善。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总