英文题目:Phonetic Accommodation to AI and Human talkers: A Case Study of Cantonese Tone Mergers

会议身份:conference:speechprosody:2026:conference-paper-id:hong26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#人类参与评测 #语音学与音系 #语音 #音视频交互

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Yitian Hong:机构信息未能从会议 PDF 纯文本可靠映射
  • Yusheng Tian:机构信息未能从会议 PDF 纯文本可靠映射
  • Grace Wenling Cao:机构信息未能从会议 PDF 纯文本可靠映射
  • Tan Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Peggy Pik Ki Mok:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究输入为香港粤语T2-T5上升调与T3-T6平调最小对读音,输出为基线朗读与影子跟读中的十点归一化基频轮廓,难点在于五调挤在中低音区差异细微且感知生产不对称易被归一化掩盖。首先以对立调反向启动材料诱发顺应,使基线区分轮廓成为后续比较基准。接着将人类女声录音与保留音色但加入合成特征的时长知情合成AI音频配对静态图像与动态视频呈现,使说话人类型与呈现模态进入被试内跟读。最后用STRAIGHT提取十点归一化F0并拟合广义可加混合模型比较轮廓差异,按K-S分数与平均F0差异划分合并者做探索性对照。在影子跟读任务条件下,主实验的被试人数指标为16人,高于预实验的被试人数指标12人。与交互校准模型预测的自动无差别趋同不同,该设计以交际顺应理论的社会动机解释差异,人类与视频条件因社会吸引与互动鲜活感引发更强趋同而具有实际意义。结论的适用边界仅限于单音节实验室跟读的短期声学趋同,不能外推为已稳定的音系合并或长期AI驱动音变。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:要解决的并调与听者角色是什么?

本解读的输入是论文报告的香港粤语声调跟读实验,目标是让研究生能复述从刺激构造到基频建模的每一步动作,并知道结论在什么条件下成立。必须保留的信息包括 2 对并调、真人与 AI 两种模型说话人、图片与视频两种呈现方式、基线与跟读与跟读后 3 个录音阶段。输出是一套可核对的方法复述,而不是对 AI 语音的总体评价。

先用白话讲清声调合并。声调合并指两个本应分开的调在发音或听辨上距离变小,英文为 tone merger。本研究只看 2 对正在进行中的合并:高升调 T2 与低升调 T5,以及中平调 T3 与低平调 T6。除高平调 T1 处在较高音区外,其余五调挤在中低音区,声学距离本来就小,因此这 2 对更容易进一步靠拢。论文把并调放在听者作为音变起源的框架下理解:当听到的实现偏离目标形式,听者可能做归一化,也就是忽略输入变异而还原为目标,也可能未能重建目标而直接采用听到的非目标形式;当听者转而说话时,后一种选择会把变体带入自己的产出,从而推动音变扩散。

归一化 × 采用: 归一化指听者把偏离目标的变体还原为词典目标调而忽略输入差异,采用指听者未能重建目标而把听到的非目标实现当作目标接受;二者分工是解释同一感知输入的两条后处理路径,搭配理由是跟读时字形提示目标调而耳机播放对立调,二者冲突,组合意义是用趋同程度判断被试走的是容忍并纠正还是直接跟随听觉输入。

这个框架直接决定了实验设计。研究者不去比较 AI 时代前后几十年的历时录音,而是用共时的短时语音趋同来探测:让被试听到对立调的发音并立即跟读,看其产出是否向启动调偏移。若被试更多采用听到的调,说明变体易被接受;若更多归一化为字形对应的目标调,说明变体被过滤。AI 的加入使问题变为听到的变体来自真人还是合成语音时,归一化与采用的比例是否不同。

背景再确认:粤语六调格局为何让这两对先变?

为避免把并调误解为随机口误,需回到六调格局。除 T1 高平调处在高音区,其余 T2 高升、T3 中平、T4 低降、T5 低升、T6 低平挤在中低音区,声学距离小。前人报告生产上调类仍可分,但正在合并的说话人在辨认时更慢,且调对与年龄组差异大,总体判断为音变初期。本研究选择已有多方证据的 2 对正在合并的调,既保证基线可分可测,又保证启动有牵引空间。若选择距离很大的调对,跟读偏移可能被天花板效应掩盖。

这一背景也解释了为何用对立调启动而非随机调启动:只有对立调才能在最小对内保持声韵相同而仅调不同,从而把基频偏移唯一归因于声调启动。

相关路线如何给出相反预测:自动对齐还是策略适应?

同学需要先分清两条解释路线,因为它们对人类与 AI 条件的预测不同。第一条是无中介的自动对齐观点,以交互对齐模型为代表,英文为 Interactive Alignment Model。它的分工是把对齐看作语言层面的自动过程,不被言语之外的社会因素中介。搭配理由是只要对话双方产出相同的语言语境,就应出现相同的对齐模式。按此预测,只要 AI 音频与真人音频的语言内容与基频轮廓匹配,人机交互与人人交互的趋同应相同。

第二条是有中介的适应观点,以交际适应理论为代表,英文为 Communication Accommodation Theory。它的分工是把适应看作为了提高交际效率和缩小社会距离而采取的策略。搭配理由是说话人会对交谈对象的交际能力与社会吸引力形成假设:若认为 AI 不能主动调整自己,说话人可能感到更有义务调整自己以保证顺畅,从而对 AI 趋同更强;若按社会吸引力,正常发展的人通常不会对 AI 产生强于对真人的社会亲近,从而对真人趋同更强。论文明确写出这两种相反推力,因此实验必须同时检验模型说话人类型的主效应。

交互对齐模型 × 交际适应理论: 交互对齐模型把对齐看作语言层面的自动过程,预测只要语言内容相同则对人类与 AI 的对齐相同,交际适应理论把适应看作受社交距离与交际效率调节的策略选择,预测对人类更强而对 AI 因需补偿其不能调整而可能更强;二者搭配的理由是给出相反预测,组合意义是用人类与 AI 条件之差来区分自动与受动机调节的解释。

视觉线索是第 3 条相关路线。自经典麦格克效应以来,视觉信息被证明影响语音感知,而语音趋同本质上是感知到产出的环路,因此视觉在场可能延伸到趋同。前人报告称交谈中有 interlocutor 的视觉在场比无视觉在场时关键词产出更向对方靠拢,噪声下可见眼神接触与动态口部动作比静态图像带来更强的语音趋同。尚未解决的是动态视觉配 AI 声音时效果是否相同,还是反而凸显人机差异而拉大趋同差距。本研究因此采用图片对视频的设计,把呈现模态与说话人类型交叉。

同类工作对照:同输入同目标下的差异在哪里?

按同输入、同目标、同监督与同运行阶段做有源对照。前人对香港粤语 T2-T5 与 T3-T6 的生产感知不对称研究与本研究同输入同目标,但为观察性描述而不操纵启动,本研究增加了影子跟读的因果操纵。前人用模仿逆转并调的研究与本研究同目标,均看模仿能否拉开调距,但本研究把模型说话人扩展到 AI 并交叉模态。前人关于人机语音对齐较弱的研究与本研究同运行阶段,均在交互中测量趋同,但本研究把因变量聚焦到词汇声调的基频曲线而非词法或整体音段。

类别差异不作胜负比较:观察性研究不能回答启动强度,合成质量研究不能回答社会调节,视觉在场研究若无 AI 条件不能回答人机差异是否被视觉放大。

研究问题是什么:四个可检验的提问如何对应操作?

论文提出 4 个研究问题,每个都对应一个可执行的操作。第一,被试在跟读体现并调特征的粤语词时是否出现语音趋同,操作是比较基线录音与跟读录音中同一字调的基频曲线是否向启动调移动。第二,趋同模式是否因 AI 与人类模型说话人而不同,操作是在语言内容与基频轮廓匹配的前提下比较跟读 AI 与跟读人类两个会话的偏移量。

第三,呈现模态是否影响趋同并与说话人类型交互,操作是把一半被试分到视频条件、一半分到图片条件,再看 T5 与 T6 等目标调在视频下是否更高。第四,个体合并状态是否与趋同模式相关,操作是用基线产出算出每人的可分性指标,再比较合并者与非合并者在跟读中是否更容易反转。

教学例子仅为例子:比如目标字虎本调为 T2,实验呈现时播放的是 T5 的实现,记作虎由 T2 读作 T5;目标字妇本调为 T5,呈现时播放 T2 的实现。例子不添加任何效果数值,真实效果必须回到结果部分的曲线与显著区间判断。关键在于启动调恒为对立调,被试看到的字形是目标调而听到的是对立调,因此每 1 次跟读都是 1 次归一化与采用之间的选择。

方法全景:从一个字到一条曲线的完整链路是什么?

沿一个样本走完全程有助于建立学习依赖。输入是一个汉字,例如吠,屏幕先显示该字 300 毫秒,随后播放模型说话人的录音并同时呈现一张图片或一段视频,被试被要求在听到后尽快自然地读出该字。表示是被试产出的声学波形,经人工在语音软件中切分出韵母段,再用算法在 10 个归一化时间点上估计基频并做对数标准化,得到一条长度为 10 的曲线。组件是广义加性混合模型,英文为 Generalized Additive Mixed Models,用于比较基线、跟读 AI、跟读人类、跟读后等会话之间曲线的形状差异,并检验与呈现模态的交互。目标是判断两调在哪些时间窗显著可分或重合,输出是平滑曲线加显著区间叠加的可视化与统计判断。

刺激构造保证了可比性。人类条件音频由 2 名经语音学训练的粤语母语女性研究助理录制,AI 条件音频由基于时长信息的合成模型生成的定制声音模型产生,训练数据是同一研究助理录制的 4000 多句粤语。论文报告 AI 音频保留了说话人的发音风格与音质,同时引入合成的非人类特征;每条人类音频与 AI 音频的基频轮廓经提取与可视化被完全匹配。3 名母语听者做自然度把关,若任一听者判为不自然则重新生成,直到 3 人一致通过。视频条件的人类与 AI 视频与人类音频同时录制,AI 视频用视频会议软件的虚拟化身录制,图片条件的图片取自视频截图。

下面这张图是理解模态操作的关键,左为真人图像,右为 AI 化身图像,二者在图片条件直接呈现,在视频条件则为动态版本,阅读时请先看整体对照再进入实验流程。

看图路径: 1. 先对比左右两图的真人照片与卡通化身在脸型与背景上的差异;2. 再确认两图均为正面半身构图且用于图片条件;3. 最后记住视频条件是在同一录制基础上加动态呈现

原论文 Figure 1:Images for the human condition and AI

论文图 1。原论文 Figure 1:“Images for the human condition and AI”。

上图左半为长发女性真人正面半身照,背景为浅色室内墙面,右半为卡通化身,正面半身,深色头发配浅色高领毛衣,背景为浅灰纯色。该对照说明图片条件的视觉差异本身就包含真人与非真人的社会线索,而视频条件在此基础上增加动态。复现时必须保留同一说话人录制、同一轮廓匹配、3 人一致通过这 3 条品控动作,否则无法把人机差异归因于说话人类型而非音高差异。

方法再核对:会话与随机化如何避免顺序混淆?

重提结果时增加适用条件。会话顺序在被试间平衡,避免先跟读人类再跟读 AI 的顺序效应被误读为人机差异。图片与视频为被试间分组,避免同一被试在两种视觉丰富度间切换带来的策略变化,但代价是组间个体差异需靠随机分配控制。录音者分配随机且先导无差异,使 2 名人类声音可视为同一人类条件。目标字随机呈现,避免调对内顺序固定带来的预期。每段 16 词的规模使单被试单条件曲线基于有限 token 平滑,置信区间宽度本身提示了估计不确定性,解读红色框的全程重合时应同时看阴影宽度。

组件与计算:切分、基频估计与分组判据如何衔接?

组件按顺序承担不同职责。第一步是韵母切分,人工在语音分析软件中对每个产出 token 切出韵母,避免声母与尾段噪声污染调形。第二步是基频估计,用经语音分析工具在矩阵计算环境中实现的抗混叠算法,在 10 个归一化时间点估计基频,再做对数标准化以消除个体音高水平的差异,使不同被试的曲线可比。

第三步是统计建模,以声调与会话为固定效应,以时间点的平滑项及其与声调、会话、呈现类型的交互为平滑项,并加入按被试的随机平滑以刻画个体基频差异,同时用 1 阶自回归过程建模时间自相关。第四步是差异检验,用差异函数在时间轴上识别两调显著可分的窗口并叠加在平滑曲线上。

语音趋同 × 声调合并: 语音趋同指跟读时把自己的基频曲线向听到的模型发音靠拢,声调合并指 T2 与 T5、T3 与 T6 在产出或感知上距离缩小;本研究把二者搭配是因为用对立调启动去探测合并是否会被即时牵引,趋同负责提供可测的偏移量,合并负责提供易受牵引的音系位置,组合意义是把历时音变问题转化为共时可重复的跟读偏移测量。

分组判据是理解个体差异分析的前提。论文用 K-S 分数与基线平均基频差两个指标,K-S 分数取 T3 与 T6 对的中点基频与 T2 与 T5 对的尾段基频计算分布可分性,平均基频差比较调对内两调的距离。若被试的平均基频差小于模型说话人对应调对差值的一半,或 K-S 分数低于 0.5,则判为合并者,其余为非合并者。该规则同时用均值距离与分布形态把关,避免单点波动误判。按此规则,每对调仅识别出 2 名合并者,其余 14 名为非合并者,这一小样本性质直接限制了后续个体比较的结论强度。

K-S 分数 × 平均基频差: K-S 分数比较被试基线产出中调内分布的可分程度,平均基频差比较两调在关键点上的距离大小;二者分工是从分布形态和均值距离两个角度判定合并状态,搭配理由是单一指标易受发音波动影响,组合意义是只有同时低于阈值才判为合并者,从而把个体合并状态与跟读可塑性联系起来。

复现时注意冻结与更新的边界。论文未报告训练新的声学模型,被试分组阈值与平滑建模结构按原文固定使用,不从模型名称推定额外实现。若缺失某参数的优化细节,应明确记为未报告,而不猜测梯度路径或重置时机。

本研究训练了什么:没有训练被试产出模型时真实计算是什么?

本研究没有训练被试的产出模型,也没有微调合成模型来拟合跟读数据,必须明确说明这一点以免误解。该节对应的真实计算分为两部分。第一部分是刺激侧的既有模型调用:AI 音频来自已训练好的时长信息合成模型,其训练数据是同一研究助理的 4000 多句粤语,调用时输入人类音频对应的文本与目标调实现,输出保留说话人风格但带合成特征的波形,再经 3 人听辨筛选与基频轮廓匹配检验。

论文未报告该合成模型的损失曲线、优化器与冻结层,因此不能从名称推定其内部更新方式。第二部分是分析侧的统计拟合:广义加性混合模型在被试产出的归一化基频上拟合平滑曲线,估计会话与声调效应及其随时间的交互,并用自回归项处理相邻时间点的相关。这里的拟合是回归意义上的参数估计,不是神经网络训练,不涉及反向传播到语音合成器,被试的基线录音仅用作比较基准而不用于更新任何生成器。

因此可重放的动作是标注与计算,而非训练:人工切分韵母、在 10 个时间点估计基频、做对数标准化、按阈值分组、拟合平滑模型并检验显著窗口。若要复现,必须保留同一批刺激的轮廓匹配与 3 人一致通过,否则人机比较的公平条件即被破坏。

实验条件:被试、会话顺序与数据规模如何保证公平?

实验按问题组织公平条件。测的是同一批字在不同启动下的基频偏移,与谁比是基线产出与跟读产出、AI 模型与人类模型、图片与视频条件。条件一致性靠 3 点保证:AI 与人类音频基频轮廓完全匹配,同一被试先后完成 AI 与人类跟读且顺序在被试间平衡,图片与视频分组为被试间设计而说话人分配随机。先导实验显示 2 名人类录音者之间无显著趋同差异,因此正式实验将被试随机分给其中 1 位录音者的条件。

被试为 16 名在香港出生长大的母语者,8 名女性、8 名男性,平均年龄 21.6±2.9 岁,无听力语言或神经发育问题。刺激为每对调 4 组单音节最小对,目标字共 16 个,每个被试完成基线、跟读 AI、跟读人类、跟读后 4 个录音段,每段产出 16 个目标词,共 64 个目标词产出。本分析是更大实验中与词汇声调合并相关的子集。

下表把数据规模与分组放在同一视图下核对,阅读时先确认比较问题是样本量是否足以支撑人机与模态的交叉,再看每格数量与单位是否与原文一致。

条件刺激与会话数量单位与说明比较对象
被试总量母语者人数16人,男女各半基线与跟读的被试内比较
录音者人类女性研究助理2人,先导无差异后随机分配AI 定制声音模型数量
调对刺激每对最小对数量4组,单音节最小对T2-T5 与 T3-T6 这 2 对
目标字每会话目标词16个,汉字随机呈现4 个会话共用词表
总产出每人目标词产出64个,16 乘 4 会话更大实验的子集

上表显示总产出 64 个是 16 词乘 4 会话的算术结果,2 名人类录音者与 2 个 AI 定制模型的对应保证了声音身份可比,而每对 4 组最小对使启动恒为对立调。代价是视频与图片为被试间设计,每组为半数被试,模态效应的个体噪声较大。未胜出的边界是跟读后会话在主结论中未显示持久音变,说明短时趋同不等于已习得的新调类。

主结果:基线可分而跟读靠拢的证据在哪里?

主结果按调对组织。基线时两调在每对内均可分:T2-T5 对中 T2 斜率更陡,两调约从轮廓中点开始分离;T3-T6 对在几乎全程保持分离。跟读时因启动为对立调,出现两类趋同。第一类为中度趋同,被试向启动调移动使两调走向中间并相互合并,在跟读 AI 视频条件的 2 对调中均未识别出任何时间点的显著差异区间,论文用红色框标出该全程重合。第二类为强趋同,被试过度趋同以致产出与刺激字调相反的位置,两调仍可分但位置互换,例如跟读人类视频条件的 T2-T5 对约从 65% 时间点起 T5 目标的基频抬高而形似 T2,T2 目标则被压缩而靠近 T5。

模态与说话人调节了趋同程度。总体上跟读人类比跟读 AI 的趋同更强,跟读视频条件的 T5 与 T6 曲线高于图片条件而显示更大靠拢,T2 与 T3 未显示此模式。论文据此认为被试更偏好人类发音,对 AI 的非目标调更容忍。

下图是全文证据核心,行是基线、跟读 AI、跟读人类、跟读后 AI、跟读后人类,列是 T2-T5 图片、T2-T5 视频、T3-T6 图片、T3-T6 视频,阅读时请按行列交叉定位后再判断显著区间。

看图路径: 1. 先沿横轴归一化时间点 1 到 10 看曲线走向再看纵轴归一化基频;2. 再对比基线行两调分开与跟读 AI 视频行两调重合的差异;3. 最后定位虚线显著区间与跟读人类视频行红色箭头附近的交叉

原论文 Figure 2:Smoothed curves of the two tone pairs produced in different sessions and presentation types.

论文图 2。原论文 Figure 2:“Smoothed curves of the two tone pairs produced in different sessions and presentation types.”。

上图以归一化时间点为横轴、平滑基频为纵轴,四色分别标记刺激的字调 2、3、5、6,虚线框为显著差异区间,阴影为 95% 置信区间。第二行红色框内两调几乎完全重叠而无虚线框,对应中度趋同;第三行第二列红色箭头指向约 65% 处两调交叉,对应强趋同。基线行各列均有大段虚线框,说明基线可分。复现时必须同时核对曲线重叠与虚线框有无,单一看曲线高低会误判。

中度趋同 × 强趋同: 中度趋同指两调向中间值靠拢而在全程无显著差异区间,强趋同指两调位置互换但仍保持可分;前者分工是显示音位对立在语音层被削弱,后者分工是显示音系对立被保留但实现被整体替换,搭配理由是同一启动范式下出现两种结果,组合意义是把 AI 与人类启动放在从融合到替换的连续体上比较其推动音变的潜力。

该结果支持交际适应理论中按社会吸引力的预测,而不支持无条件自动对齐的预测,但这只是支持而非因果证明,因为社会吸引力本身未被直接测量。

反证与个体差异:合并者是否更容易被启动牵引?

除核心人机与模态比较,论文做了两类特有细节展开。第一类是呈现模态的非对称性:视频增强趋同只出现在被跟读的 T5 与 T6 上,而 T2 与 T3 未显示,这说明动态视觉的作用不是对所有调同等放大,可能与升调尾段与低平调的感知权重有关,但原文未进一步分解眼神与口部动作的贡献。第二类是合并状态的探索性比较:按 K-S 与均值差判出的每对 2 名合并者与 14 名非合并者在基线与跟读中的曲线被分别平滑作图,基线时非合并者的调间距离更大符合预期,跟读时合并者反而显示更大的调间对比,且在跟读人类时比跟读 AI 时两调更分开。

下表把建模分辨率与分组阈值放在同一视图下核对,阅读时先确认问题是测量精度与分组是否足以支撑个体结论,再看每格阈值与样本量。

条件指标与会话数量单位与说明比较对象
基频采样归一化时间点10点,每 token 韵母段平滑曲线的横轴
合并者每调对人数2人,阈值判定非合并者每调对 14 人
判定阈值K-S 分数界线0.5分,低于判合并均值差小于模型差一半
基线距离非合并者更大14人,基线调间更分开合并者跟读反转更大

上表的主要收益是把 10 点分辨率、65% 交叉位置、0.5 阈值与 2 对 14 的人数不平衡放在一处,使个体结论的脆弱性可见。代价是合并者样本过小,论文明确写出无法得出确切结论。未胜出项是该探索未做统计检验,仅为平滑作图比较,因此不能把合并者更易被启动作为已验证效应,只能记为待验证的观察。

下图直接显示该个体比较,阅读时注意上行样本极少而曲线更易受单人影响。

看图路径: 1. 先区分上行合并者与下行非合并者在基线列的调间距离;2. 再沿基线到跟读 AI 再到跟读人类看 T2 与 T5 是否交叉反转;3. 最后对比 T3 与 T6 在两类人中是否同样出现反转或保持平行

原论文 Figure 3:F0 contours at baseline and shadowing sessions between the merging (2 speakers per tone pair) and…

论文图 3。原论文 Figure 3:“F0 contours at baseline and shadowing sessions between the merging (2 speakers per tone pair) and non-merging speakers (14 speakers per tone”。

上图横轴为时间点、纵轴为对数标准化基频,四色为刺激字调 2、3、5、6,上行为合并者、下行为非合并者,列为基线、跟读 AI、跟读人类。可见基线列下行 T2 与 T5 距离更大,而跟读列上行 T2 与 T5 交叉反转幅度更大;T3 与 T6 在两类人中均趋向平行或轻微交叉,但人类条件下的分离略大。该图支持合并者产出更灵活的解释,但因每格仅 2 人,必须标注为探索性而非确证性。

限制:哪些量未被测量而不能承诺?

缺失证据不是技术错误,但必须明确边界。第一,社会吸引力、信任度与对 AI 韵律的既往经验均未在本实验直接测量,论文用前人发现的 AI 声音社会吸引力较低、人类更信任真人声音来解释更弱的 AI 趋同,这属于有限解释,应表述为可能而非已证明。第二,AI 音频的自然度筛选依赖 3 人一致通过的主观判断,未报告误判率、合成瑕疵类型与可懂度分数,因此不能承诺 AI 刺激在所有听者耳中完全等同于真人。

第三,统计建模报告了平滑与显著窗口,但未报告训练资源、推理开销与延迟,因为本研究无部署系统,这些量与结论无关,不应承诺趋同测量更快或更省。第四,总体趋势不等于每调成立,视频增强只在 T5 与 T6 可见,不能推广到所有调。第五,跟读后会话显示基线可分恢复,说明短时趋同未被证明转化为长时音变,AI 引发音变的讨论应保留为推测。

相关性不是因果:人类条件更强趋同可能来自声音自然度、社会偏好或对 AI 变体的归一化容忍三者任一,当前设计把三者打包在人机标签下,未做正交分离。未来需分别操纵声音与化身、测量信任与经验,才能拆分贡献。

复现先做什么:按原文可执行的最小闭环是什么?

复现应从刺激与流程的最小闭环开始。先准备 2 对调的单音节最小对,每对 4 组,目标字表共 16 字,查表确认如虎本调 T2 启动为 T5、妇本调 T5 启动为 T2、吠本调 T3 启动为 T6、肺本调 T6 启动为 T3。录制 2 名女性母语者的自然读词,用同一说话人的 4000 多句数据训练或调用时长信息合成模型生成对应 AI 音频,提取两条件每条的基频轮廓并可视化核对完全匹配,再经 3 名母语者一致通过筛选。用视频会议化身同步录制 AI 视频,截图作为图片刺激。

再跑行为流程:被试基线按随机汉字自然朗读,跟读阶段每试次先显示汉字 300 毫秒再播放音频并呈现图片或视频,要求尽快自然跟读,被试内完成 AI 与人类两种跟读且顺序平衡,被试间分图片与视频组。产出侧人工切分韵母,在 10 个归一化点估计基频并做对数标准化,按 K-S 低于 0.5 或均值差小于模型差一半判定合并者,再拟合带被试随机平滑与自回归项的平滑模型并用差异函数标出显著窗口。

资源状态按本次收到的官方像素与链接核对:刺激示例库链接当前可用,已公开可访问;矩阵计算软件官网本次不可用,链接当前不可用;视频会议软件官网当前可用。复现不依赖后两者下载即可理解方法,前者用于核对刺激形态。区分代码开源、权重下载与系统可运行:论文未声明分析代码开源,合成模型权重未提供下载,影子跟读系统本身可在实验室用呈现脚本重建,但不等同于原系统可一键运行。

收束:何时值得尝试跟读范式,还需补哪项验证?

当研究问题是某对立调变体是否会被即时采用而非归一化,且能构造最小对使字形目标与听觉启动恒冲突时,值得尝试本研究的影子跟读加平滑曲线范式。它把历时音变转化为可在 10 点基频上重复测量的偏移,并用显著区间区分合并与互换。适用条件是必须先做到 AI 与人类轮廓匹配与 3 人品控,否则人机差异无法解释。

还需补的验证有三项。第一,扩大合并者样本并做跨世代比较,因为不同年龄代表不同并调阶段且 AI 暴露量不同,当前每对 2 人的探索无法定论。第二,正交分离声音自然度、社会评价与既往 AI 韵律经验,直接测量信任与容忍度,才能把中度趋同仅出现在 AI 条件的发现从推测变为机制。第三,纳入更多正在变化的粤语特征并追踪跟读后保持,才能判断中间融合实现是否会稳定为新调类。总体判断报告为:被试向启动调趋同,人类强于 AI、视频在部分调上强于图片。

支持社会调节的解释;AI 可引发语音层融合但程度较弱,其能否启动音变仍待验证。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总