英文题目:LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control

会议身份:conference:interspeech:2026:conference-paper-id:ohmura26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集构建 #主观评测 #语音 #文本到语音

评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Junki Ohmura:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuki Ito:机构信息未能从会议 PDF 纯文本可靠映射
  • Emiru Tsunoo:机构信息未能从会议 PDF 纯文本可靠映射
  • Toshiyuki Sekiya:机构信息未能从会议 PDF 纯文本可靠映射
  • Toshiyuki Kumakura:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音印象控制需根据文本、参考音频与11维1至7分目标向量合成语音,在保留参考说话人身份的同时精确命中目标印象,难点在于参考音频自带印象会污染目标且长期缺乏公开语料。作者先构建首个公开语料LibriTTS-VI并训练印象估计器,为LibriTTS-R全库提供伪标签,其输出直接作为后续训练的目标向量真值。接着提出解耦训练VIC-dis,用同说话人另一句提供身份表征而仍从原句提取目标向量,以身份与印象来源分离切断同源耦合。再进一步提出参考无关分支VIC-srf,以高斯噪声替代身份表征并仅由目标向量驱动合成,在结构上消除泄露而保留零样本合成能力,这与单参考基线依赖同一参考同时提供身份与印象存在本质差异。在LibriTTS-R test-clean零样本评测下,VIC-srf的RVI-MSE为0.41,低于VIC-base的RVI-MSE 0.61。该结论适用边界受限于英语朗读语料与39个未见说话人零样本场景,强力感等维度响应仍弱且尚未验证跨语言与自发语音外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决哪两个卡点?

本文输入是待合成文本、一段参考音频与一个 11 维目标印象向量,目标是合成出保留参考人声特质但印象数值符合目标的语音。目标印象向量覆盖低到高音调、男性化到女性化、清晰到嘶哑、平静到不安、强到弱、年轻到年老、厚到薄、坚定到放松、暗到亮、冷到暖、慢到快,每个维度取 1 到 7 分。论文要解决的第一个卡点是没有公开语料,此前印象控制依赖私有语料,他人难以复现与跟进。

第二个卡点是印象泄露,即使用户单独指定了目标印象,合成音仍被参考音频自带的印象拽偏。输出是一段波形,其身份应接近参考说话人,其可测印象应接近目标向量。后续所有方法与实验都围绕这两个卡点展开,评价同时看可控性与合成质量。本文没有声称代码与模型权重当前可用,资源状态证据为空,因此不写已公开,只按正文描述语料构建与方法。 论文标题与任务来自语音合成中细粒度与可理解的矛盾。

直接调基频与能量足够精确但对普通用户太细碎,说话人编号与情感类别又太粗,示例音频受限于手头有无,自然语言提示则缺小数点级别的数值控制。声音印象控制选择折中路线,用人能听懂的 11 个词做轴,每个轴可加减分数。研究生复述时要抓住这个定位,它不是做更自然的合成,而是做可按数字微调的合成。理解这一点才能明白为什么后文用均方误差与调制斜率做主指标,而不是只报自然度。

同输入同目标的已有路线为何不够用?

同输入同目标的直接前身是印象控制研究,它用 11 维印象向量经控制模块调制说话人嵌入,训练时用印象估计器从参考音频预测目标印象。原文沿用了高丢弃率与梯度反转来压制中间向量中的印象线索,但预实验仍观察到泄露。另一条同目标路线是用感知维度做语音合成,例如按粗糙与气息感等临床量表控制,或按非专家主观评分控制,本文属于后者。

相关工作还包括从说话人嵌入空间找可控轴,以及无参考生成伪说话人嵌入的思路,后者启发了本文的无参考方法。 同运行阶段的另 1 对照是提示式大模型语音设计,例如用自然语言描述音色。论文构建了从数值到文本的提示生成器,把每个维度量化为 1 到 7 档并用大模型生成 5 个改写,再拼接数值标签,以测试提示能否实现同样任务。结果显示提示法在说话人相似度与印象误差上都弱于专用系统,且输出印象受文本语义干扰。

这组对照的教学意义是,输入模态不同带来控制精度的本质差异,不能把会写提示等同于会按数字控制。

自然语言提示 × 数值印象向量: 自然语言提示负责用句子描述想要的音色,优点是直观易写;数值印象向量负责用 1 到 7 的 11 维数字精确指定每种印象强度。二者搭配的比较意义在于提示难以表达 3.2 与 3.8 的差别且易受文本语义干扰,而数值向量可逐维加减,论文用此对照说明提示式大模型不能替代细粒度印象控制。

印象泄露的假设是什么,单参考为何会纠缠?

论文把印象泄露归因于训练时同一句话同时承担两种监督。形式上基线用参考音频同时提取身份中间向量与目标印象,即合成目标的真值音频就是参考本身,身份与印象来自同一波形。编码器因此没有压力区分谁是谁,参考音高偏亮,合成也偏亮,即使目标要求调暗。这种纠缠在推理时表现为换目标印象也拽不动,客观上随机换目标的误差与沿用参考印象的误差差距拉大。

教学例子是,假设参考是一句较快的朗读,目标要求慢 3 分,基线仍可能合成偏快,因为编码器记住了参考的快。例子只用于理解纠缠方向,不附加论文未报告的数值。论文的解决思路是切断同源,要么换另一句同说话人的音频供身份,要么干脆不要参考音频,只用目标向量生成。两种方法都不改主干合成器的基本目标,只改身份与印象从哪里来。

声音印象 × 说话人身份: 声音印象指 calm、bright 等可打分的听感维度,负责描述声音听起来怎样;说话人身份指区分是谁在说话的稳定特质,负责保持音色一致。二者搭配的理由是用户既想保留某个人,又想微调其印象,组合意义在于把同一参考音频拆成身份分支与印象分支分别控制,避免调印象时把人也调变了。

三种系统与一种提示对照的全景如何走通?

全景可沿一个样本走完。输入文本为问候语,参考为同一说话人的一句话,目标为 11 维向量。基线路径是参考经预训练语音表示与双向循环加注意力得到中间向量,经控制模块与目标向量融合,再经风格令牌层得到说话人嵌入,送入语音合成主干生成波形。解耦训练路径把供身份的参考换成同说话人另一句话,真值与目标印象仍来自原句,人为制造身份相同但印象不同的训练对。

无参考路径把身份分支输入换成标准高斯噪声,合成只看目标向量,从结构上消除参考印象。提示对照路径把数值向量转成多句自然语言提示,送入大模型做音色设计。 导读本节配图时,先看四块面板的输入输出箭头,重点是实线在训练与推理都走、虚线只在训练走。图 a 是单参考基线,图 b 多出一路同说话人音频,图 c 把参考换成噪声,图 d 把数值换成提示生成器。理解这张图就能复述全部实验分组。

看图路径: 1. 先沿左侧文本 t 与底部参考音频 r 两条输入线,看它们如何汇入说话人编码器再进入语音合成主干;2. 再对比图 b 中第二路参考 r′与图 c 中高斯噪声 z 替换了什么输入,确认解耦位置;3. 最后看图 d 中印象向量转提示生成器的链路,理解提示法与数值法的接口差异

原论文 Figure 1:Overview of the VIC systems (base, dis, and srf) and the Qwen3-TTS voice design interface for VIC.

论文图 1。原论文 Figure 1:“Overview of the VIC systems (base, dis, and srf) and the Qwen3-TTS voice design interface for VIC.”。

解释这张图时,关键是看红色虚线框内的控制模块与印象预测分支。基线与解耦都保留该框与梯度反转,只是身份来源不同;无参考保留该框但身份端无真实语音;提示法没有该框,靠语言模型隐式理解。图中还标出随机时长预测器在无参考微调时被去掉以稳定语速。复述时不要把提示生成器的句子当成数值本身,它只是数值的语言近似,会引入量化误差。

编码器、控制模块与估计器各自算什么?

参考编码器由预训练语音表示加双向循环注意力组成,把波形变成定长中间向量。它的训练目标不是直接预测印象,而是为合成主干提供说话人条件,印象信息是顺带混入的。控制模块把该向量先做高比率丢弃再经线性层,把目标印象向量经另一线性层,二者拼接后再线性投影回同样维度,得到融合向量。风格令牌层再把它变成最终说话人嵌入。这种两路拼接设计的理由是让网络显式看到要减弱的身份残留与要增强的目标数值。

声音印象估计器与参考编码器结构同形但参数独立,后接线性头输出 11 维预测。它在训练基线与解耦方法时提供目标印象,在评价时充当客观打分器。梯度反转分支接在拼接的第一项上,用两层线性预测印象但反转梯度,迫使身份向量去掉可预测印象的成分。原文明确控制模块是先联合预训练主干与编码器、冻结其他模块后再插入训练,训练目标沿用主干原目标以隐式学到音频与印象的对应。未报告梯度细节不猜。

参考编码器 × 控制模块: 参考编码器负责把参考音频变成中间向量 x,保留说话人线索;控制模块负责把 x 与目标印象向量 v 融合成 x′,执行印象指向的偏移。二者搭配是因为仅有身份向量无法按数值改印象,仅有印象向量无法落地到具体音色,组合后经风格令牌层得到同时携带身份与目标印象的说话人嵌入。

印象泄露 × 梯度反转层: 印象泄露指合成结果偏向参考音频自带印象而非目标印象的现象,负责解释控制失准;梯度反转层加在印象预测分支上,负责在反传时抑制 x 中的印象线索。二者搭配的原因是即使有高丢弃率,同一句话仍同时提供身份与印象监督,组合意义是用对抗方式逼 x 忘记印象,为后续双话语解耦做铺垫。

语料如何标注,估计器与主干如何训练?

语料构建从朗读修复语料的训练集中随机选 130 句不同说话人的话,10 个维度用文字标准加锚点音频做指南,4 名有经验标注者按 7 级量表打分,取均值得到 1300 个标签。慢到快维度不用人工打分,而是用带时间戳的语音识别算每分钟词数再线性缩到 1 到 7。标注一致性用等级间一致性系数报告,平均 0.470,虽低于可靠阈值但高于同类情感与歌声偏好任务,论文据此认为仍有偏好预测价值。发布内容按正文说是人工标注、指南与全库估计值,但本次无可用资源验证,不写可下载。

导读标注指南配图时,注意它不是结果曲线而是操作手册。示例为厚度维度,写明量表方向、共鸣丰富度的总体描述、中性参考文件名,以及 1 分厚、4 分中、7 分薄的文字标准。复述时要强调锚点音频的作用是统一耳朵,否则不同标注者对厚的理解会漂移。

看图路径: 1. 先读厚度维度的量表定义与 1 分厚到 7 分薄的两极描述,确认打分方向;2. 再看中性参考音频作为锚点的作用,理解标注者如何校准耳朵;3. 最后对照 1 分、4 分、7 分三档文字标准,体会主观量表的颗粒度

原论文 Figure 2:An example of VI annotation guideline.

论文图 2。原论文 Figure 2:“An example of VI annotation guideline.”。

解释该图后要接训练链条。用 100 句标注训练估计器时,把人工标签赋给同说话人声学最相似的 100 句,相似度按音高与能量距离及自监督嵌入余弦的平均排名算,相当于 100 倍增强,留 30 句做测试,根均方误差 0.68 分以内。主干用改进的端到端模型预训练 600,000 步,再微调控制模块 60,000 步,身份与印象投影到 32 维。解耦训练把身份参考换成同说话人另一句,无参考训练把身份输入换成高斯噪声并去掉随机时长预测器。提示微调模型用小批量与小学习率微调 5 轮。

声音印象估计器 × 数据增强: 声音印象估计器负责从音频预测 11 维印象值,为全库打伪标签与训练时提供目标 v;数据增强负责把 130 句人工标注扩到同说话人声学相似的 100 句上。二者搭配是因为人工标注太少无法训练可靠估计器,组合后用相似音高、能量与自监督嵌入筛选可共享标签的句子,缓解按说话人恒定假设带来的失配。

在什么数据与条件下测,与谁比,看什么方向?

客观评价用测试清洁集全部 4837 句,覆盖 39 个未见说话人,属零评价。对比包括真值、端到端主干、基线、解耦、无参考,以及提示模型的零样本与微调版。指标方向要记清,可懂度用字符与词错误率越低越好,音质用预测平均意见分越高越好,说话人相似度用编码器余弦越高越好但需对照同人与跨人边界。可控性定义两个误差,沿用参考印象的误差与随机换他人印象的误差,二者差值衡量泄露,差值应为零表示无泄露。

调制实验把单维度从 1 到 7 步进 1,每条件合成 10 句,用估计器预测并拟合斜率,斜率越大响应越好。 主观评价只做端到端三系统,选 1 男 1 女两说话人,报告以 8555 为代表。单维调制选 4 个代表维度正负 3 分,多维调制复用随机换目标的合成句。每系统每条件选 10 句,同 4 名标注者每人 1080 次打分,算与目标的均方误差。音质做平均意见分,30 名母语或近母语听者,每样本 30 次评分,每人 1014 句。

硬件与优化按原文交代,端到端系统批量 20、学习率 2 乘 10 负 4 次方在 8 卡上训练,提示微调批量 2 累积 4、学习率 1 乘 10 负 6 次方。文本语义干扰用岭回归从句嵌入预测印象,再算与音频估计印象的相关做代理。

可控性提升了多少,质量与相似度付出什么?

先看核心可核对数字。论文报告最优方法把 11 维印象均方误差客观从 0.61 降到 0.41,主观多维调制从 1.15 降到 0.92,解耦居中为 1.04。客观表中泄露差值从基线 0.22 降到解耦 0.14 再到无参考 0.05,无参考的两类误差无显著差异,支持结构上消除泄露。调制斜率平均从基线 0.121 升到解耦 0.159 再到无参考 0.199,提示零样本仅 0.068。强到弱维度基线与解耦为负斜率,无参考转正但仅 0.008,说明该维仍难学。

提示模型虽可懂度与预测音质好,但说话人相似度低于跨人边界,微调后印象误差反而变大。 导读结果曲线时,横轴是人为设定的目标分,纵轴是估计器测到的合成印象,蓝色无参考应随横轴上升,橙色提示法波动大。左图性别维蓝色上升 4.53 点,橙色虽也升 3.49 点但中段起伏;右图年龄维蓝色升 1.47 点,橙色仅 0.44 点且几乎平坦。阴影为正负 1 倍标准差,越窄越稳定。

看图路径: 1. 先看横轴目标值 1 到 7 与纵轴预测值 1 到 7 的对应关系,判断斜率越大控制越灵敏;2. 再对比左图男性化到女性化维度的蓝色稳定上升与橙色虚线的波动回落;3. 最后看右图年轻到年老维度的整体斜率与阴影宽度,确认可控范围与不确定性

原论文 Figure 3:VI modulation experiment for B) Masculine-Feminine and F) Youthful-Aged dimensions.

论文图 3。原论文 Figure 3:“VI modulation experiment for B) Masculine-Feminine and F) Youthful-Aged dimensions. Shaded areas: ±1σ.”。

解释该图要指出数值控制的精度差异。无参考在 2 维都保持单调,提示法在性别维 6 分处回落、在年龄维拉不开差距,支持自然语言缺细粒度刻度的判断。代价方面,无参考说话人相似度从 0.77 降到 0.72 但仍高于跨人 0.63,解耦为 0.75;可懂度与预测音质三系统与主干相当,主观音质无一致性下降,多维条件下三系统相当。重提结果时新增的对照是,提示法的大差值并非泄露,而是文本带感叹号就偏向不安等语义串扰,5 个维度文本预测与音频估计相关超 0.2,说明换目标时文本语义把输出拽偏。

换目标与逐分扫描分别证明了什么?

换目标实验是关键反证。沿用参考印象时三系统误差接近,随机换他人印象后基线误差跳升最多,无参考几乎不跳,差值显著性标记支持泄露排序。这个设计公平在于同一参考、同一文本、同一估计器打分,只换目标向量,因此差值可归因于对参考印象的依赖而非合成能力本身。逐分扫描进一步看方向性,11 维平均斜率排序与换目标排序一致,且基线在强弱维为负,说明不是整体平移而是该维学偏了。

下表把最强证据收敛为可复述的三行,条件、指标与基线都写清,方向为误差越低越好、斜率越高越好。比较对象保留实际可运行的基线、解耦与无参考,不用搜索最优或事后最优代替。

条件指标基线解耦方法无参考方法
沿用与随机目标综合客观 11 维印象均方误差0.610.510.41
多维随机目标主观主观印象均方误差1.151.040.92
单维 1 到 7 扫描平均调制斜率0.1210.1590.199

表后要讲代价与反例。无参考斜率最好但说话人相似度最低,强弱维三系统都弱,提示微调版反而更差,说明大模型适配非平凡。

单维主观中亮暗维正 3 分条件下无参考不如基线,是未胜出项。不同指标差值不能混放,自动估计误差不能当人评,百分点与相对百分比在此不适用。原文表头与算术无冲突,但主观仅报一个说话人为代表,推广到全集需谨慎。 换目标差值需要与绝对误差对照才能排除基线偏移,下表把同参考与随机目标两列误差与差值并置,并用说话人相似度锚定代价,数值越小表示泄漏越轻但相似度同步变化值得注意。

模型VI-MSERVI-MSE泄漏差值 ΔV说话人相似度 SECS
VIC-base0.390.610.22*0.77
VIC-dis0.370.510.14*0.75
VIC-srf0.360.410.050.72

表后结论是解耦把泄漏差值从显著的 0.22 压到 0.14,无参考进一步压到不显著的 0.05,同时相似度从 0.77 降到 0.72,说明结构去参考最彻底但有说话人保持代价,比较时不能只看单列最优。

哪些维度与条件仍不可信,边界在哪里?

第一个边界是标注一致性。多数维度低于可靠阈值 0.667,冷暖仅 0.197,平静不安 0.295,平均 0.470 虽高于情感与歌声任务,但仍属主观噪声大的量表。这意味着估计器与评价都带噪声,0.68 分的估计误差接近 1 分,调制斜率小的维度可能被噪声淹没。第二个边界是维度不均衡。强弱维客观斜率接近零或负,主观改用低到高音调代替,说明原维度未学会,复现时不应期待该维可调。

第三个边界是主观覆盖窄。仅两个说话人、每条件 10 句、同一批标注者既标语料又评合成,可能引入熟悉度偏差,且只报一个代表,另一说话人只说趋势一致而无数字。第 4 个边界是提示对照的公平性。提示生成经量化与改写,数值标签以附加标记形式出现,大模型可能忽略数字,且微调数据与轮数有限,不能据此断言所有提示法都不行。训练资源与推理延迟未报告,不能承诺更快更便宜。

要复现应先做什么,需要哪些超参数与信息条件?

复现先做三件事。第一,按原文重建 11 维量表与锚点指南,130 句不同说话人、4 人打分取均值、慢快用识别算语速,这是标签源头。第二,用音高能量与自监督嵌入相似度做 100 倍增强训练估计器,留 30 句测根均方误差,达 0.68 分以内再往下走,否则后续目标全是噪声。第三,先预训练主干 600,000 步再冻结插入控制模块微调 60,000 步,投影维度 32,身份与印象来源按分组切换,解耦用同说话人另一句,无参考用高斯噪声并去掉随机时长预测器。

评价用测试清洁集 4837 句,39 未见人,同一估计器打分,报告沿用与随机两类误差及其差值,再做 1 到 7 逐分斜率。 关键信息条件是参考音频的用法。基线训练与推理都用同一句,解耦训练用两句、推理仍用单句供身份,无参考训练与推理都不用真实参考。混淆这点就会复现不出泄露差值。超参数按原文保留批量、学习率与卡数,不从模型名推定未写明的优化器细节。

缺项要明示,风格令牌层尺寸、丢弃率具体值、解耦时另一句的采样策略原文未给全,复现时需记录自己的选择并做敏感性检查。不要把无训练等同于确定性,噪声输入与采样会带来波动。

何时值得尝试这两种方法,还需补哪项验证?

当任务是保留某人但按数字微调印象,且有参考音频可用时,优先试解耦训练,它改动最小且相似度保持最好。当参考本身印象太强或无合适参考,但能接受身份略漂移时,试无参考生成,它泄露最小且平均斜率最高。当用户只会写自然语言且不要求小数精度时,提示法可用,但要接受调不准与受文本情绪词干扰。选择依据是本文的排序在客观误差、主观误差与斜率 3 类指标一致,而质量无一致性下降。

还需补的验证是跨语料与跨标注者的一致性、强弱与冷暖等低一致维度的可学性,以及长文本与多轮对话中的稳定性。部署前要补测推理开销、实时率与误判率,本文未测这些量。常见误解是把预测音质分当人评,本文预测分与真值相当但人评低于 3.8,系指导语锚定所致;另一个误解是把斜率高当每分都准,实际上端点压缩与中段跳变并存,应看整条曲线而非平均数。记住一句话,同一句话不能既当身份老师又当印象老师,否则合成总像参考那句的心情。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总