英文题目:Intonation Perception in Real and Synthetic Speech across Varying Familiarity Levels: A Pilot Study of Equivalence Assessment
会议身份:
conference:interspeech:2026:conference-paper-id:zhou26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#心理声学实验 #韵律 #言语感知 #说话人验证 #语音属性识别
评分:4.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Hanrui Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Gaoyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yixiang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yujie Xing:机构信息未能从会议 PDF 纯文本可靠映射
- Feng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Xurong Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为普通话中性短句的自然陈述与疑问语音及经转换合成的目标音色语音,输出为听者在说话人相似性感知与语调识别中的准确率、反应时与相似度评分,难点在于疑问句末基频上扬等韵律细节在合成中易被压缩且加工受说话人熟悉度调节。方法链分三步:先在隔音室录制2名熟悉者与2名陌生女性说话人的11句六词中性句,每句陈述与疑问各录两遍择优并另录高表现力语音作转换源;再用基频条件化歌声转换模型保留源语义与基频轮廓并替换为目标音色,经说话人编码器余弦相似度与语音学专家筛选语调最佳版本;随后在PsychoPy中实施2×2×2被试内双任务实验并用混合模型与Firth回归分析。相比既有可懂度、自然度与音色相似度评估,该设计把韵律保真度与长期熟悉表征的交互作为等价性判据,对语言训练语料构建具有实际意义。在说话人相似性感知任务条件下,纯自然语音对的准确率为0.917,高于自然加合成混合对的准确率0.851。结论仅适用于受控实验室条件下的成年普通话母语听者、中性短句与女性嗓音,未验证儿童、障碍人群、情感韵律与长篇语料。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:语言训练为何需要可控的语音语料?
这篇解读的输入是 2026 年 Interspeech 的 1 篇试点研究,目标是帮助刚进入语音与语言领域的研究生复述其方法与证据。必须保留的信息包括被试量与分组、刺激构造方式、两个实验的任务流程、统计模型选择以及关键交互效应,输出则按学习依赖从任务到复现逐步展开。
语言训练依赖包含特定语言学材料的语料,理想语料要同时包含说话人身份与韵律特征,例如语调和情感韵律,以支撑语言学习中的复杂认知过程。但原文指出,这类语料稀缺,构建需要投入熟练演员、受控录音环境和大量数据,在经济和时间上成本都很高。这就是研究希望用人工智能语音克隆降低语料构建成本的现实动机。
对于初学者,白话理解是:自然语音是真人录制的声音,合成语音是模型模仿目标音色生成的声音;语调是陈述与疑问在音高走向上的区别,熟悉度是听者以前是否认识说话人。论文关注的不是合成语音好不好听,而是合成语音能否在身份可辨和语调可辨两个功能上与真人语音等价。
说话人熟悉度 × 语音类型: 说话人熟悉度指听者对发音人是否有长期听觉表征,负责提供自上而下的预期和更精细的分辨标准;语音类型指自然录音与 SVC 合成语音,负责提供自下而上的声学保真度。两者搭配的理由是语言训练必然伴随重复暴露,若合成语音的音色或韵律失真,熟悉度带来的加工优势可能被削弱或反转,因此必须联合考察才能判断合成语料是否可用。
本节之后的学习路径是先看相关路线如何评价合成语音,再看本研究把什么因素正交化,最后进入刺激生成与实验操作的具体动作。
相关路线如何评价合成语音?
已有合成语音评估主要围绕可懂度、自然度和说话人相似度展开。原文引用了近期工作,指出人们不擅长察觉人工智能语音克隆,在区分人工智能语音与真人语音时经常不可靠,尽管在声音辨别上略好于图像辨别,但总体仍然困难。这意味着仅凭能不能听出真假,不足以证明合成语音可用于训练。
普通话的特殊性在于疑问语调有时没有词汇标记,主要靠句末上升或高平 f₀轮廓来标示问句。原文强调语调是自然语音声学复杂性的重要来源,也是语音克隆难以完全复制的部分。因此,即使整体音色像目标人,疑问句的句末音高若不到位,仍可能影响训练效果。
熟悉度文献提供了另一条路线:熟悉说话人的特征有助于语言加工,熟悉声音帮助识别说话人并促进声学属性恢复,有研究将其归因于适应,即听者用已学知识与陌生刺激或新声学模式之间的差异调整反应。适应常表现为短暂暴露后反应时缩短和分类更稳定,而干预训练本身就包含重复暴露,所以检验熟悉度效应对于评估语音克隆的实用可行性至关重要。
研究提出哪两个可检验的问题?
论文把问题收敛为两个实验任务。第一个是说话人身份相似性感知,要求听两句不同句子,判断是否为同一人朗读,并给出 1 到 7 分的相似度评分。第二个是语调识别,要求听单句判断是陈述还是疑问。2 个任务分别对应语料构建的两种需求:保留谁在说话,以及保留说了哪种语调。
设计上采用 2×2×2 被试内设计,自变量为语音类型即自然与合成、熟悉度即熟悉与陌生、语调即陈述与疑问,因变量为反应时与准确率。熟悉度在这里是 2 分操作化,陌生指陌生人的声音,熟悉指熟人的声音。这种正交化允许检验交互,而不是只报告合成与自然的总体差异。
语调 × 说话人身份: 语调指陈述与疑问在基频轮廓上的区别,在普通话中疑问常靠句末上升或高平 f₀实现,负责传递句法和交际功能;说话人身份指依靠音色和发音习惯判断是否为同一人,负责建立稳定的 talker 表征。两者搭配的原因是语言韵律本身会塑造说话人印象,问句的额外音高变化既可能是身份线索,也可能掩盖合成痕迹,因此需要检验语调是否调节身份判断的准确率。
作者声明的贡献也是双重的:实践上初步支持把人工智能生成语音纳入语料的可行性,理论上探索熟悉与陌生声音加工以及自然与生成语音加工的认知差异。试点性质意味着样本小、条件有限,结论需要后续更大样本验证。
方法全景:一个句子如何走完两种实验?
沿一个样本走完全程有助于建立整体图像。以句子爸爸打开大门为例,先由 4 位女性母语者录制,自然刺激包括陌生人 A 和 B、熟人 C 和 D,每句录两遍陈述和两遍疑问,从中挑选质量较好的录音,避免引入可作为识别线索的非自然因素。合成刺激则用歌声转换模型把源语音的内容与 F0 轮廓转换为目标说话人 A 和 C 的音色,记为 A’和 C’。
在身份相似性感知中,该句子会与其他句子配对出现,例如陌生同人自然对 A 减 A、陌生跨自然与合成对 A 减 A’、陌生不同人自然对 A 减 B,熟悉侧对应为 C 减 C、C 减 C’和 C 减 D。每对随机配对且平衡频率,每对听两遍,共分 4 个组块。被试先听 1 对,等待绿色注视点后按键,再给出 1 到 7 分,7 分表示完全同一人,1 分表示完全不同人。
在语调识别中,同一句子则以单条形式出现,条件覆盖陌生合成陈述、陌生合成疑问、陌生真实陈述、陌生真实疑问、熟悉合成陈述、熟悉合成疑问、熟悉真实陈述、熟悉真实疑问,共 8 种,同样分 4 个组块。被试听完单条刺激后等待绿色注视点,按键判断陈述或疑问。两个实验在不同日期进行,正式实验前都有练习环节,且练习句不在正式实验中出现。
合成与筛选组件各自做了什么?
合成组件使用基于 F0 条件的歌声转换模型。原文描述其核心机制是从源说话人的歌声中捕获语义内容与音高变化即 F0 轮廓,并将其转换为目标说话人的音色。实现细节上,研究还要求说话人额外录制一段情绪表现最大化的语音,用于后续合成转换,但该段语音不呈现给被试。所有说话人为 25 到 45 岁的女性中文母语者,录音在语音实验室隔音棚内用 Praat 以 44.1 千赫采样完成,设备为 RODE Wireless GO II 麦克风。
筛选组件分为客观与主观两步。客观上使用广泛使用的开源说话人识别模型中的说话人编码器提取嵌入,计算转换语音与目标参考语音嵌入之间的余弦相似度,范围从负 1 到 1,越高表示越相似。报告显示陈述平均相似度为 0.55,标准差 0.28,疑问平均为 0.51,标准差 0.30,提示两种句式相似水平相当。在此基础上挑选每句中分数较高的合成语音。
歌声转换模型 × 说话人相似度: 歌声转换模型指基于 F0 条件的 SVC 模型,负责从源语音抽取语义内容与 F0 轮廓并转换为目标音色;说话人相似度指用说话人编码器提取嵌入后计算余弦相似度,负责客观筛选转换质量。两者搭配的理由是主观挑选语调之前需要先保证音色接近目标人,客观分数提供可比较的初筛,专家听辨再保证疑问与陈述的表达自然,从而避免把转换失败误读为认知效应。
主观上邀请 2 位语音学专家挑选语调表达最好的声音,若有分歧则邀请第三位专家评估并做选择。原文还展示了爸爸打开大门的自然陈述与自然疑问,以及人工智能陈述与人工智能疑问的代表性 f₀轮廓,用于说明语调形态得到保留。本次解读没有收到图像像素,因此不描述曲线的颜色、坐标或具体走向,只依据正文说明其教学用途是呈现句末差异。
被试与配对逻辑如何保证可比?
被试共招募 17 人,全部参加身份相似性感知,其中 11 人参加语调识别。听者年龄 22 到 41 岁,平均 28.176 岁,标准差 5.177,女性 6 人,男性 11 人,均为无听力障碍的普通话母语者,并按中国科学院软件研究所指南签署知情同意。实验前会让被试听 2 位熟悉同伴的自然声音并概述实验,若不能识别说话人,则将其从身份相似性感知分析中剔除,这保证了熟悉操纵的起点成立。
材料为 11 句中性普通话句子,每句 6 个词,其中 1 句用于练习,10 句用于正式实验。邀请 2 位陌生人和 2 位被试熟悉的人朗读这些句子,每句以陈述和疑问各录两遍。这种设计使句子内容、说话人性别和语言背景相对一致,把差异集中在熟悉度、语调和语音类型上。
配对逻辑借鉴了前人研究,6 种配对覆盖同人与不同人、自然对与自然加合成对、熟悉与陌生。每个刺激可归入 3 类条件之一,随机配对且频率平衡。每对听两遍并分为 4 个组块且平衡顺序,刺激列表全部做计数平衡。操作上,被试坐在距电脑 65 厘米的安静实验室环境,戴耳机听刺激,屏幕为 60 赫兹、1024 乘 768 分辨率,音量可调到舒适水平。
本研究训练了什么、没有训练什么?
本研究没有训练新的语音合成模型,也没有训练新的识别模型,必须明确这一点以避免误解。歌声转换模型是作为既有工具调用的,论文未报告对其参数的冻结或更新、梯度路径、损失函数或训练轮数,因此不能从模型名称推定其实现细节。同样,说话人识别模型只是用来提取嵌入并计算余弦相似度,属于推理调用而非本研究的训练对象。
实际发生的计算过程是转换、筛选与行为实验。转换是把源内容与 F0 映射到目标音色,筛选是用余弦分数初筛再加专家听辨,行为实验是用 PsychoPy 呈现刺激并记录按键反应时与准确率,统计分析在 R 中完成。身份任务中对数转换后的反应时用线性混合效应模型,准确率用二项连接的广义线性混合效应模型,评分离散的 7 点量表用累积连接混合模型;语调任务中对数反应时用线性混合效应模型,准确率因均值超过 95% 存在天花板与分离问题而用 Firth 偏差校正逻辑回归。
缺项需要指出:原文未给出 SVC 的训练数据、超参数、推理开销和合成耗时,也未报告录音挑选的具体质量标准和专家一致性数量。因此不能承诺合成成本更低或推理更快,只能说研究动机是降低语料构建成本,但本研究本身测量的是感知等价性而非工程成本。
实验条件与统计口径是什么?
两个实验的自变量完全相同,但因变量的操作不同。身份任务要求先做同一人与否的二选判断,再做 1 到 7 分评分,因此同时产生准确率、反应时和评分 3 个指标;语调任务只要求判断陈述或疑问,主要产生准确率与反应时。固定效应均为语调、熟悉度和语音类型,随机效应为被试和项目,这种设定把被试差异和句子差异都作为随机波动扣除。
下表整理被试与客观筛选等基础条件,目的是核对复现时的人群、材料与合成质量起点是否一致。阅读时注意单位与聚合对象:年龄是个体值,相似度是句子级转换分数的均值,反应时是试次级对数建模前的原始均值加标准误。
| 条件 | 指标 | 样本或条目 | 数值 | 聚合对象 |
|---|---|---|---|---|
| 被试总量 | 人数 | 身份任务 | 17 人 | 全部招募者 |
| 被试子集 | 人数 | 语调任务 | 11 人 | 其中参加者 |
| 年龄分布 | 年龄 | 22 到 41 岁 | 平均 28.176 岁,标准差 5.177 | 17 名听者 |
| 性别构成 | 人数 | 女性 6 人,男性 11 人 | 6 比 11 | 17 名听者 |
| 合成筛选 | 余弦相似度 | 陈述句 | 0.55,标准差 0.28 | 转换语音与参考语音 |
| 合成筛选 | 余弦相似度 | 疑问句 | 0.51,标准差 0.30 | 转换语音与参考语音 |
上述基础条件说明样本为成年普通话母语者的小样本试点,合成筛选分数在陈述与疑问间相当,因此后续组间差异更可能来自感知加工而非某一句式整体转换失败。但这只是起点可比,不能证明每一条合成都完美,还需结合主结果中的交互与反例理解局限。
身份判断中语调何时成为线索?
身份相似性感知的准确率分析显示语音类型主效应显著,自然对的准确率高于自然加合成对,前者均值为 0.917,后者为 0.851。更关键的是语音类型与语调的交互显著,说明语调的作用依赖于是否为全自然对。在全自然对中,疑问刺激准确率显著高于陈述,前者为 0.946,后者为 0.875;在自然加合成对中,疑问与陈述无显著差异,疑问为 0.826,陈述为 0.872。作者据此认为疑问可能作为说话人识别的线索,但可能受到合成特征的影响。
反应时 × 准确率: 准确率负责回答能否做对,反映分辨或识别的上限;反应时负责回答做得多快多省力,反映熟悉度带来的加工流畅性与适应效应。两者搭配的原因是本研究语调识别准确率超过 95% 出现天花板效应,此时准确率难以区分条件,反应时成为更敏感的加工差异指标,而在身份判断中两者分离则揭示了快与准并不一致。
下表把该交互的比较问题、公平条件和指标方向集中呈现,公平条件是同一被试内、同一配对逻辑下仅改变语调或语音类型,指标方向为准确率越高越好。
| 条件 | 指标 | 全自然对 | 自然加合成对 | 比较对象 |
|---|---|---|---|---|
| 总体准确率 | 准确率 | 0.917,标准误 0.014 | 0.851,标准误 0.018 | 语音类型主效应 |
| 陈述准确率 | 准确率 | 0.875,标准误 0.022 | 0.872,标准误 0.022 | 语调在不同语音类型下 |
| 疑问准确率 | 准确率 | 0.946,标准误 0.014 | 0.826,标准误 0.025 | 语调在不同语音类型下 |
| 交互检验 | 卡方检验 | 卡方 1 等于 5.988,p 等于 0.014 | 语音类型主效应卡方 1 等于 11.244 | 模型整体效应 |
表后解释需要同时看到收益与代价。全自然对中疑问带来约 7 个百分点的优势,支持语言韵律有助于说话人印象的观点;但一旦引入合成语音,该优势消失且疑问数值上更低,说明合成可能压缩或改变了有助于身份判断的韵律细节。未胜出项是混合对中的陈述与疑问差异不显著,这是一个反例,提醒不能把疑问优势推广到合成语料。
熟悉度为何加快反应却降低评分?
身份任务的反应时与评分呈现分离。反应时上熟悉度主效应显著,陌生人平均 0.848 秒,熟悉人平均 0.748 秒,熟悉声音反应更快,支持熟悉促进加工效率的解释,即长期记忆中的声学表征允许更快处理。评分上熟悉度同样显著,但方向相反,陌生人平均 3.930 分,熟悉人平均 3.560 分,熟悉人评分更低;语音类型也显著,双自然平均 3.900 分,自然加合成平均 3.600 分,后者评分更低但仅达边缘显著水平。
作者的解释是加工流畅不等于给高分:对熟悉人更容易精细处理声学表征,评价标准更严格,因而能察觉细微差异而打低分;反应更快反映加工省力,评分更低反映分辨更精细。这与知觉学习和说话人适应模型一致,即熟悉提高知觉表征的分辨率和对说话人内变异的敏感性。
语调识别的反应时则显示语调边缘显著,疑问平均 0.270 秒,陈述平均 0.249 秒,疑问更慢。原文将其归因于陈述与疑问的 F0 差异在句末更易辨别,需要听完句末才能判断,因此疑问多出等待与确认时间。由于未观察到显著交互,该句末效应被认为对真实与合成语音都成立,但原文用词是边缘显著,复述时应保留这种不确定性,不宜写成确定效应。
语调识别中熟悉度与语音类型如何交互?
语调识别的准确率存在天花板,平均超过 95%,因此作者明确指出任务对成人被试总体容易,反应时是更敏感的指标。在此前提下,准确率仍发现熟悉度与语音类型的交互显著。具体模式是交叉的:在自然语音中陌生准确率高于熟悉,自然陌生为 0.987,自然熟悉为 0.982;在合成语音中陌生低于熟悉,合成陌生为 0.973,合成熟悉为 0.992。但简单效应检验中两组差异均不显著,自然侧与合成侧的 z 检验 p 值分别为 0.640 和 0.198。
下表按可运行策略组织比较,基线是自然语音,待评估策略是合成语音,条件按熟悉度分开,指标方向仍为准确率越高越好。
| 条件 | 指标 | 自然语音 | 合成语音 | 比较对象 |
|---|---|---|---|---|
| 陌生声音 | 准确率 | 0.987,标准误 0.006 | 0.973,标准误 0.012 | 语音类型在陌生下 |
| 熟悉声音 | 准确率 | 0.982,标准误 0.008 | 0.992,标准误 0.007 | 语音类型在熟悉下 |
| 整体交互 | 似然比卡方 | 卡方 1 等于 4.078,p 等于 0.043 | 反应时 F1 等于 3.844,p 等于 0.050 | 模型整体效应 |
表后判断必须谨慎。交互显著支持语音类型改变了熟悉度的贡献,但在简单效应都不显著时,不能宣称某一格显著优于另一格。作者的有限解释是处理自然声音时被试对熟悉声音考虑更多细节并与认知结构中的表征比较,采用更谨慎的标准;而合成声音下模式相反,可能反映了判断标准在两类语音间不同。这属于支持性解释而非因果证明,仍待验证。未评测边界包括仅用中性六词句、仅女性说话人、仅陈述与疑问 2 分,推广到情感韵律或更长话语时需重新测试。
哪些结论不能从当前证据推出?
首先是样本与设计的试点局限。17 人与 11 人的样本很小,且身份任务剔除了不能识别熟悉人的被试,这虽然保证了熟悉操纵有效,但也限制了推广。材料仅 10 句正式句加 1 句练习句,句子短且中性,说话人仅女性、年龄跨度有限,因此不能推广到男性声音、情感语音或自发对话。
其次是测量局限。语调识别准确率天花板意味着准确率交互依赖于高区间的微小差异,简单效应不显著,过度解读单格高低会有风险。评分与反应时的分离虽然有趣,但原文未测量误判类型、置信度或加工策略,只能用更精细分辨作为可能解释,不能当作已证明的机制。
适应 × 熟悉度效应: 适应指听觉系统在短暂或重复暴露后对新声学模式调整分类边界与反应速度,负责解释学习过程;熟悉度效应指熟悉声音因长期记忆中有存储的声学表征而加工更快更精细,负责解释本研究中熟悉人反应更快但相似评分更低的现象。两者搭配的意义是把训练中的重复暴露与实验室中的熟悉操纵联系起来,说明评估合成语料必须考虑学习依赖,否则会高估一次性听辨的结果。
最后是技术归因局限。研究显示合成在复杂韵律与社会线索上仍有挑战,但由于未报告合成训练细节、未做消融例如去掉 F0 条件或更换模型,不能把交互确切归因于某一模块。相关性不是因果,缺失证据不是技术错误,未测量延迟与成本时也不应承诺效率改善。作者同样强调这只是初步探索,技术仍在演进,未来需要更大规模与多维度研究。
若要复现,应先固定哪些步骤?
复现应从人群与材料开始。招募普通话母语、无听力障碍的成人,记录年龄与性别构成,并预先验证被试能否识别所选熟人,否则按原文做法剔除身份任务数据。准备 11 句中性六词句,固定 1 句练习、10 句正式,邀请 2 位陌生人与 2 位熟人,均为女性母语者,在隔音棚以 44.1 千赫录制陈述与疑问各两遍,挑选质量较好者作为自然刺激,同时额外录制情绪表现最大化的语音用于转换但不呈现。
合成与筛选需保留关键信息条件。调用基于 F0 条件的歌声转换模型生成目标人 A’与 C’的每句陈述与疑问,用说话人编码器计算余弦相似度并记录陈述约 0.55、疑问约 0.51 的起点,再由语音学专家挑选语调表达最佳者,分歧时引入第三位专家。这一顺序不能颠倒,否则会把音色失败与语调失败混淆。
行为与统计需保持一致。身份任务按 6 种配对构造试次,每对听两遍、分 4 个组块,先做同人与否判断再做 1 到 7 分评分;语调任务按 8 条件单句呈现、分 4 个组块,练习句不进入正式实验。分析时身份反应时先对数转换再用线性混合效应模型,准确率用广义线性混合效应模型,评分用累积连接混合模型;语调准确率因天花板用 Firth 校正逻辑回归,反应时对数转换后用线性混合效应模型。资源状态方面,本次收到的证据未绑定完成 HTTPS 验证的开源资源,因此不得声称代码、模型或数据已公开,复现时应把合成模型与说话人编码器视为需自行准备的外部依赖。
何时值得尝试合成语料,还需补什么验证?
综合两类任务,直接报告是:身份任务中语音类型主效应与语音类型乘语调交互显著,语调任务中熟悉度乘语音类型交互显著;有限解释是疑问可作为身份线索但受合成影响,熟悉对加工的贡献因语音类型而异;未验证推测是具体哪个声学细节导致差异。支持的判断是 SVC 合成语音在受控实验语境下具有知觉可行性,有潜力用于语调研究的语料构建,但需进一步打磨说话人层面的韵律特征。
何时值得尝试取决于任务目标。若目标是提供大量可懂且语调可辨的中性短句用于重复训练,当前范式值得小规模试点;若目标是保留细腻的说话人内变异、情感韵律或需要被试对熟悉人做精细分辨,则应谨慎,因为熟悉人评分更低与混合对疑问优势消失都提示合成可能丢失身份相关细节。
还需补的验证包括扩大被试量与多样性、纳入男性与不同年龄说话人、延长句子与引入情感或焦点条件、补充误判率与置信度测量,以及报告合成与部署的计算成本。若能在保持余弦相似度相当的前提下系统比较不同合成模型,并预注册交互的简单效应检验,将更能回答等价性在何种熟悉度与语调组合下成立。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses