英文题目:A barrier or a booster? Familiarity effects on Mandarin emotion prosody recognition using AI-powered voice cloning

会议身份:conference:interspeech:2026:conference-paper-id:xu26i_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #言语感知 #生理信号 #语音 #语音情感识别

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Feng Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Gaoyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shanshan Xue:机构信息未能从会议 PDF 纯文本可靠映射
  • Yixiang Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Hanrui Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Xurong Xie:机构信息未能从会议 PDF 纯文本可靠映射
  • Hui Chen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究处理普通话孤立听觉情绪韵律感知任务,输入为人类自然语音与AI克隆语音,输出为听者对高兴、愤怒、恐惧、悲伤4类情绪的判断准确率、反应时与心率变异性,难点在于合成音色保真但存在韵律微扰,同时身份熟悉度提供自上而下补偿或失调线索。方法链分为三环:先录制陌生播音员情绪语音与熟悉人中性语音,再经情感保持语音转换生成熟悉与陌生AI情绪刺激,最后开展被试内听辨并同步采集行为与生理信号,前一步输出的刺激集直接构成下一步感知比较条件。与以往匿名说话人研究相比,关键机制差异在于引入社会认知变量,检验熟悉度是补偿合成缺陷还是触发恐怖谷式审视。在陌生人语音比较条件下,高兴条件的准确率差异系数为7.74,高于恐惧条件的准确率差异系数1.51。结论边界限于无视觉与语境的孤立声学判断、单一女性陌生声源与单一熟悉音色,尚未验证多说话人、强噪声或临床人群外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://github.com/Plachtaa/seed-vc — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么要同时记录行为和生理?

本解读的输入是论文报告的 1 次被试内普通话情感韵律感知实验,目标是让刚进入语音或音乐与音频方向的研究生能够复述方法链条和判断边界。必须保留的信息包括刺激如何构造、声源和熟悉度如何分离、行为与生理指标如何定义、统计模型如何设定,以及哪些差异报告为显著、哪些报告为不显著。输出是 1 篇可核对的方法复述,不做超出原文的推广。

论文研究的任务是听觉情感韵律识别。术语首次出现时先说白话:情感韵律就是不靠字面意思、靠音高起伏、语速和音色变化传递情绪的那层声音表达,对应英文 emotion prosody;说话人身份就是听者判断这是谁的声音以及对其说话习惯的记忆,对应英文 speaker identity。听者每听到一句话,都要同时处理这两件事,既要听出是高兴还是生气,又要结合是谁在说来校准判断。

情感韵律 × 说话人身份: 情感韵律负责用基频、语速等声学线索传递高兴、生气、恐惧和悲伤等意图,说话人身份负责提供谁在说话及其基线风格等社会索引,二者搭配的理由是听者必须同时解码说什么情绪和这是谁的声音,组合意义是身份记忆可以为韵律判断提供自上而下的预测支架,也可能在克隆音色失真时产生冲突。

论文把声源分成真人录音和人工智能合成两类,把说话人熟悉度分成陌生人和熟悉同事两类。行为输出是四选一情绪判断的正确率和从刺激呈现到按键的反应时,对应英文 accuracy 和 reaction time。生理输出是心电推导的心率变异性,对应英文 heart rate variability,简称 HRV,用于观察自主神经层面的负荷是否随条件变化。研究问题有两个:去掉视觉和上下文后,合成情绪能否达到真人水平并带来多大负荷;把熟悉音色引入合成后,感知会如何改变。

已有路线如何比较真人与合成,熟悉度研究补了哪一块?

第一条路线是真人与合成的直接比较。原文回顾指出,以往评估反复发现真人自然情绪的分类准确率更高、反应时更低,合成语音存在不自然的协同发音、频谱畸变和韵律微扰动。作者强调,当视觉和复杂上下文被隔离后,需要先建立仅靠裸声学信号的基线,才能谈合成的独立认知代价。这就是本研究把刺激限定为中性语义句子、只让韵律承载情绪的原因。

第二条路线是熟悉度对自然语音情绪感知的影响。原文指出,日常互动中配偶或父母等高度熟悉人的身份提供了自上而下的认知支架,大脑保有其情绪记忆和特定韵律基线,有助于更准确和更省力地识别情绪。以往实验室常用匿名说话人,因此会低估这种先验的作用。

第三条路线是生理负荷测量。原文把 HRV 作为观察内部加工代价的窗口,引用其在情绪与自主神经反应研究中的用法,做法是连续记录心电并提取时域和频域特征。本研究的新交叉点是把熟悉人的音色克隆成语音转换目标,一边是匹配的身份声学签名,一边是可察觉的人工来源和韵律瑕疵,由此检验熟悉到底是补偿还是引发更长的审视。

论文把矛盾具体化为哪两个可检验的问题?

论文把大问题拆成两个可操作的问题。第一个问题是声源效应:在没有视觉和上下文帮助时,人工智能合成情绪的识别准确率是否与真人相当,认知负荷是否系统性升高。这里的负荷同时用反应时延长和 HRV 变化来操作化,但原文最终报告两者并不一致,需要分开陈述。

第二个问题是熟悉度效应:当合成目标换成熟悉同事的音色时,对合成情绪韵律的感知是否改变,改变是否依赖情绪类别。作者事先提出两种对立可能,一种是情绪记忆迁移带来补偿,另一种是线索冲突触发恐怖谷式的审慎评估。术语先说白话:熟悉度就是听者事先认识目标音色并能认出是谁,对应英文 familiarity;恐怖谷效应就是高度逼真但有细微失真时反而让人不适和更挑剔,对应英文 uncanny valley effect。

熟悉度 × 恐怖谷效应: 熟悉度负责调动听者对特定说话人韵律基线和情绪记忆的先验,恐怖谷效应负责描述高度像真但存在细微失真时引发的不适和审慎评估,二者搭配的理由是熟悉 AI 音色同时呈现匹配的身份签名和可察觉的人工瑕疵,组合意义是解释为何熟悉有时补偿解码、有时反而延长判断时间。

为检验上述问题,论文采用被试内设计,每个被试都听多种条件,避免个体差异混入声源或熟悉度比较。关键分离策略是声源比较只用陌生音色,以免熟悉度污染真人与合成的对比;熟悉度比较只用人工智能音色,以免真人熟悉录音无法获得的问题干扰结论。这一分离是复述时最容易混淆的地方,需要记住哪个对比锁定了哪一类音色。

从一句话到一次判断,完整链条经过哪些环节?

先沿一个样本走完全程。输入是一句语义中性的普通话句子,例如天上飞着飞机,长度控制为 6 个词,避免字面情绪泄露目标情绪。陌生音色条件由 1 名播音专业女学生朗读高兴、生气、恐惧和悲伤 4 种情绪,每句读两遍并挑选最佳版本作为真人基线,同时也作为语音转换的源内容。熟悉条件由被试熟悉的 1 位同事朗读同样句子的中性版本,只提供目标音色,不提供真人情绪基线,因为该说话人不能可靠产出目标情绪韵律。

随后系统把源内容的语义和基频轮廓搬到目标音色上,生成对应情绪的合成句。合成后由 2 位语音学专家听辨筛选,冲突时由第三位专家裁决,只保留一致通过的刺激进入正式实验。实验时被试先听熟悉同事的自然音色并接受说话人确认,认不出者剔除,再进入练习和正式判断。每次试验经过注视、听音、表情符号选择和间隔 4 个阶段,同时连续记录心电。输出是每次试验的正确与否、反应时,以及整段心电推导的 HRV 特征。

这条链条的教学要点是语义中性化、源与目标分工、专家筛选和说话人确认 4 个动作缺一不可。语义中性化保证判断只能靠韵律;源与目标分工保证情绪来自会演绎的陌生朗读者、音色来自熟悉人;专家筛选去掉明显失败的合成;说话人确认保证熟悉条件真的熟悉。

情感保持语音转换把什么留下,把什么换掉?

本节讲合成组件的分工。术语先说白话:情感保持语音转换就是在换音色的同时尽量保住情绪表达,对应英文 emotion-preserving voice conversion,简称 EPVC;基频轮廓就是一句话随时间变化的音高曲线,对应英文 fundamental frequency contour,简称 F0 contour。论文强调语音情绪与基频强相关,因此 EPVC 必须显式处理基频,不能只换音色。

情感保持语音转换 × 基频轮廓: 情感保持语音转换负责把源语句的语义内容搬到目标音色上同时保留情绪表达,基频轮廓负责携带情绪唤醒度的核心声学形状,二者搭配的理由是只换音色会丢失情绪强度,必须显式设计目标基频,组合意义是得到强度可控且音色为熟悉人的合成刺激,用于分离音色熟悉度和声源真实性的作用。

论文采用的底座是开源的基于基频条件的歌声转换模型,对应资源为 seed-vc,资源状态为 available,原文以脚注给出链接。它把源语义内容和基频轮廓迁移到目标音色,跨性别时先做移调。与普通歌声转换不同,目标音高不能直接照抄源基频,也不能直接用目标人平静时的参考基频,因此原文定义了一个计算式,用源情绪基频、源中性平均基频、目标中性平均基频和一个控制唤醒迁移的努力因子来构造目标基频。努力因子为零时接近目标人的中性音高,为一时近似保留源唤醒度。最终合成整合源语义内容、目标音色和计算得到的目标基频。

需要如实说明的缺项是原文没有给出该努力因子的具体取值表,也没有报告按情绪或按句子逐项调参的过程,只说明框架支持强度可控合成并经过专家筛选。因此复述时只能说模型支持通过该因子调节唤醒迁移,不能编造本实验用了哪几档取值。

刺激录制和筛选如何保证情绪来自表演、音色来自熟人?

录制分两条线。陌生线要求高表现力,选用播音专业学生,保证 4 种情绪可产出且可挑选。每句读两遍,选最佳版本,既做真人基线,也做转换源。熟悉线要求音色真实,只录中性朗读,不强求该同事表演情绪,避免不自然的情绪表演污染基线。熟悉人的自然情绪录音被明确排除在真人基线之外,只做转换目标音色。

录音设备与格式按原文交代,使用 RODE Wireless GO II 麦克风和 Adobe Audition 软件,采样率为 44100 Hz,每个选定 token 在句首和句尾分别保留 20 ms 前导静音和 50 ms 衰减静音。合成验证环节由 2 位语音学专家知觉评估和过滤,冲突由第三位专家裁决,只保留一致认可的刺激。

这一安排的理由是直接的:如果让不擅长表演的熟人硬演情绪,真人基线会变弱;如果用陌生人音色谈熟悉效应,熟悉操纵会落空。所以声源对比锁定陌生音色,熟悉对比锁定人工智能音色,都是为了让 1 次只变一个因素。

本研究有没有训练神经网络,真实计算发生在哪里?

本研究没有报告训练新的神经网络,也没有报告更新合成底座的权重、优化器、梯度路径或训练轮数。必须明确说没有训练阶段,不能把调用开源转换模型说成训练,也不能从模型名称推定参数冻结或输出确定性。真实计算发生在 3 个环节:调用已有转换模型做推理合成、按规则构造目标基频并做专家筛选、以及对行为和生理数据做统计建模。

合成侧的计算是推理式语音转换加基频构造,不是梯度优化。统计侧的计算是线性与广义线性混合效应模型,对应英文 linear mixed-effects models 和 generalized linear mixed-effects models,简称 LMMs 和 GLMMs,在 R 中用 lmerTest 拟合,用似然比检验选择模型,用 emmeans 做 Tukey 校正的事后两两比较。随机效应从最大结构出发,因奇异或收敛问题逐步简化。生理侧的计算是心电预处理与 HRV 特征提取,包括带通滤波、R 波检测、时域和频域估计,具体参数在实验设置节按原文展开。

这种无训练设计意味着结果只反映该合成配置加该筛选流程下的感知效应,不能推广为所有语音克隆系统的固有差距。复现时重点不是调参训练,而是复刻刺激构造、筛选标准和统计对照。

被试、 trial 流程和生理记录的具体条件是什么?

被试为 17 名普通话成人,年龄范围 22 至 41 岁,平均 28.18 岁,标准差 26.80,无听力或认知障碍报告,样本量与该领域被试内设计惯例一致。所有被试提供书面知情同意,遵循中国科学院批准的流程。实验前要求听 2 位熟悉同事的自然音色,认不出说话人者剔除,保证熟悉操纵成立。练习中出现的句子不进入正式实验。

反应时 × 心率变异性: 反应时负责从行为层面度量从听到刺激到做出情绪按键选择的加工耗时,心率变异性负责从自主神经层面度量连续心电中反映认知负荷和生理应激的波动,二者搭配的理由是行为快慢不能直接等同于生理应激,需要并行记录以检验负荷是否外显为自主神经变化,组合意义是本研究能同时回答准不准、快不快和生理上是否可区分。

试验流程用 PsychoPy 编程,分 3 个 block,呈现顺序经拉丁方跨被试伪随机。每个 trial 含 4 个阶段:注视阶段在屏幕中央显示十字 600 ms;听音阶段播放 auditory prompt;选择阶段先空屏 300 ms,再显示情绪表情图标直到被试按键;结束阶段空屏约 1100 ms 再进入下一 trial。实验室安静,被试距显示器 65 cm,显示器分辨率为 1024 × 768,刷新率 60 Hz,戴耳机,音量调至舒适自选水平。

生理记录用 Biopac MP 150 个系统,采样率 1000 Hz,标准三导联贴于双侧手腕和右脚踝,被试坐稳安定后开始记录。心电预处理用 5 至 20 Hz 带通 Butterworth 滤波去基线漂移和高频噪声,用 Pan-Tompkins 算法检测 R 波,并用 30 s 分段、85% 自适应阈值和 250 ms 最小间隔约束精修。时域特征包括平均心率和相邻 RR 间期差值均方根,对应 mean HR 和 RMSSD;频域把 RR 序列去趋势后以 4 Hz 线性插值重采样,用 Welch 功率谱估计得到低频功率、高频功率和低高频比值,对应 LF 为 0.04 至 0.15 Hz,HF 为 0.15 至 0.4 Hz,以及 LF/HF ratio。

下表把可直接复现的时间与采集参数集中为五列,数值与单位保留原文写法,单位留在同一格,裸值不另加单位。表前的问题是:哪些时间参数决定了注意、决策和生理采样的公平条件。

环节阶段或设备参数取值说明
注意注视阶段十字呈现600 ms吸引注意
决策选择阶段起始空屏300 ms-blank表情图标直至按键
间隔结束阶段空屏间隔1100 ms下一 trial 前
生理Biopac MP 150心电采样率1,000 Hz连续记录
音频RODE 加 Audition录音采样率44,100 Hz原始录制

上表说明正式试验的时间结构短而固定,生理采样远高于音频分析所需的心电频带,保证了行为与生理在同一 trial 流中对齐。代价是音量自选和舒适 seating 会引入个体差异,但被试内设计使其主要影响个体截距而非条件对比。未胜出或未报告的边界是原文未给出每个 block 的 trial 数和总时长,也未报告耳机型号和声压校准值,复现时需自行记录并保持恒定。

真人与合成相比,准不准和快不快如何随情绪变化?

本节先回答声源问题,且只用陌生音色做对比以隔离熟悉度。准确率用 GLMM 拟合,固定效应为声源和情绪,被试和条目为交叉随机截距。结果报告情绪和声源主效应显著,以及声源与情绪交互显著。事后比较显示,除恐惧外,真人音色在高兴、悲伤和生气上的准确率显著高于人工智能音色。反应时用 LMM 拟合,同样显示声源主效应和交互显著,事后比较显示除恐惧外,真人音色反应时显著更短。

声源 × 情绪类别: 声源负责区分刺激来自真人朗读还是 AI 合成,情绪类别负责区分高兴、生气、恐惧和悲伤 4 种目标,二者搭配的理由是合成失真对不同情绪的破坏程度不同,必须做交互分析而不能只看总平均,组合意义是揭示人声优势在 3 种情绪成立而在恐惧上消失,以及熟悉效应只出现在特定情绪上的情绪依赖格局。

作者的解释是合成存在声学非典型性,听者需要偏离自然模板的额外加工,因此更慢且更容易错;恐惧例外可能与其威胁显著性有关,使识别对合成畸变更稳健。需要区分措辞:行为差异是论文直接报告,威胁显著性解释属于有限解释,不是本实验直接验证的机制。

生理方面,对平均心率、RMSSD 和 LF/HF 比值分别拟合以声源为固定效应、被试为随机截距的 LMM,均未发现声源主效应显著,逻辑回归的似然比检验也显示生理特征不能可靠区分声源。也就是说,在本范式下,行为上更慢更不准并不系统地表现为自主神经应激,反应时延长不能直接读成生理应激升高。

把音色换成熟悉同事后,哪些情绪变好,哪些反而变慢?

本节回答熟悉度问题,且只用人工智能音色做对比以隔离声源。准确率同样用 GLMM 拟合,结果报告熟悉度主效应显著和熟悉度与情绪交互显著。事后分析显示,高兴刺激由熟悉音色产生时准确率显著高于陌生音色,其他情绪未发现显著熟悉度差异。反应时用 LMM 拟合,显示熟悉度与情绪交互显著,事后检验显示恐惧刺激由陌生音色产生时反应显著快于熟悉音色,其他情绪无显著熟悉度差异。生理方面,熟悉度对各项 HRV 指标均无显著主效应,逻辑回归也不能可靠区分熟悉与陌生。

比较问题是:在同样的合成质量下,熟悉是否一律帮忙。指标方向是准确率越高越好,反应时越短越快,但快不一定等于准,需要分开看。下表把原文连续句中实际出现的熟悉效应数字整理为五列,β、标准误、统计量和 p 值保留原文写法,不另算差值和百分比。

对比指标βSEz 与 p
熟悉相对陌生,高兴准确率更高0.660.13z = -2.098, ps = .036
陌生相对熟悉,恐惧反应更快-0.190.07z = -2.810, ps = .005

上表的主要收益是熟悉对高兴有补偿,代价是熟悉对恐惧有延迟。具体而言,高兴的支持证据是熟悉音色准确率更高,符合用先验韵律基线弥补合成瑕疵的补偿解释;恐惧的反例是熟悉音色反而更慢,作者用恐怖谷式的认知失调解释,即高唤醒负情绪来自已知身份却由机器合成,迫使听者做更长时间的批判性评估。该解释仍是有限解释,原文没有直接测量不适感或评估策略。未胜出项是悲伤和生气在熟悉对比中均无显著差异,未评测边界是熟悉程度本身未分级,只有认识与陌生两档。

如果去掉关键对照或换一种切分,结论还成立吗?

论文没有做模型消融,但做了两种关键的条件切分,可视为实验层面的对照。第一是声源分析限定陌生音色,熟悉度分析限定人工智能音色。这种切分保证 1 次只变一个因素,如果混在一起比较,真人熟悉条件缺失会使设计不平衡,结论会把音色质量和熟悉记忆混为一谈。复述时要强调这不是事后挑选,而是事先由刺激可获得性决定的公平条件。

第二是情绪分项检验。原文对 4 种情绪分别做事后比较,而不是只报告总平均。若只看总平均,会得出真人全面优于合成、熟悉全面有益的粗糙结论;分情绪后才看到恐惧在声源对比中不显著、高兴在熟悉准确率中显著而恐惧在熟悉反应时中反向显著。这种情绪依赖是全文最强的反证,说明总体趋势不等于每组都成立。

第三是行为与生理的双重检验。如果只看反应时延长就断言生理应激升高,会被 HRV 的零结果反驳。原文如实报告 HRV 在声源和熟悉度上均无显著区分,且判别模型不优于空模型,提示本范式下的认知努力未必外显为自主神经变化,也可能与记录时长、分段策略或样本量有关,但原文未做进一步分解,不能自行归因。

哪些条件没测,哪些数字不能互相比较?

首先是样本与生态限制。被试仅 17 人,虽符合被试内惯例,但对 HRV 这类个体差异大的指标可能 power 不足。刺激为 14 句中性句的实验室朗读,去掉了视觉和上下文,结论不能直接推广到有人脸、对话历史或噪声的真实交互。熟悉只有同事 1 级,未区分配偶、父母或长期好友等更强熟悉,也未量化熟悉时长和接触频率。

其次是指标不可比。准确率、反应时和 HRV 是不同量纲,差值不能混放一列;百分点变化和相对百分比也不同,原文未给出总平均准确率和平均反应时的绝对值,复述时不能用 β 值反推正确率提升了多少个百分点。自动声学指标未报告,人评筛选只说保留一致通过者,未报告通过率和失败类型,因此不能估计合成失败率。

第三是缺项声明。原文未报告合成努力因子的具体取值、按情绪的调参、推理耗时、实时因子和部署成本,也未测量误判分布、主观自然度和信任评分。训练资源与推理开销需要分开讨论,本研究无训练开销,但调用成本和专家筛选人力仍是复现预算的一部分。相关性不等于因果,熟悉与高兴准确率的相关不能直接说成记忆迁移的因果证明,还需补直接操纵先验或测量期望的验证。

要复现这条链条,先做什么,后验证什么?

先准备可核对的材料。按原文交代,招募普通话成人并记录年龄分布,准备 14 句语义中性、每句 6 词的句子,陌生朗读者需能稳定产出四情绪并每句读两遍备选,熟悉朗读者只录中性句。录制保持同一麦克风和软件,采样率 44100 Hz,句首保留 20 ms 前导、句尾保留 50 ms 衰减。合成调用 seed-vc 类基频条件转换,按源情绪基频与源和目标中性均值构造目标基频,跨性别先移调,生成后走 2 位专家加 1 位裁决的筛选,只保留一致通过者。被试实验前必须能认出熟悉音色,否则剔除。

下表把被试与材料的可复现配置集中为五列,数字与单位与原文连续句一致,用于开工前逐项勾选。表前的问题是:哪些数量决定了刺激集规模和可比性。

环节对象或处理指标取值备注
被试普通话成人人数与年龄22 to 41 years oldM = 28.18, SD = 26.80
材料中性句数量与长度14 neutral Mandarin sentences, each 6 words in length如天上飞着飞机
朗读四情绪遍数与挑选read twice in four emotions选最佳版本
编辑单句 token静音包络20 ms lead-in and a 50 ms decay period of silence句首与句尾

上表之后要验证三件事。第一验证熟悉操纵是否成立,记录辨认通过率;第二验证合成筛选是否可重复,记录送审数、通过数和按情绪的失败原因;第三验证统计是否同口径,用 GLMM 分析准确率、LMM 分析反应时,被试和条目设随机截距,固定效应为声源加情绪或熟悉度加情绪,并做 Tukey 校正的事后比较。生理部分按 5 至 20 Hz 滤波、Pan-Tompkins 检 R 波、30 s 分段、85% 自适应阈值、250 ms 最小间隔、4 Hz 重采样和 Welch 谱估计复刻,再检验声源和熟悉度主效应。资源方面,seed-vc 链接在原文脚注中声明为当前可用,但复现仍需确认版本、权重下载和运行环境与原文是否一致,不能把代码可用等同于权重可运行。

何时值得借用熟悉音色,何时应该谨慎?

综合可验证的部分,结论是双面的。声源侧,真人陌生音色在高兴、悲伤和生气上报告更高准确率和更快反应,恐惧为例外;生理侧未区分声源。熟悉侧,熟悉合成音色对高兴准确率有补偿,对恐惧反应有延迟;生理侧同样未区分熟悉度。因此熟悉不是一律的助推器,也不是一律的屏障,而是情绪依赖的调节。

何时值得尝试:如果应用以积极情绪传递为主,且用户能明确认出目标音色,熟悉音色可能帮助弥补合成瑕疵,但仍需先做小样本的四情绪分项测试,不能只看总平均。何时谨慎:如果场景涉及恐惧、警报或高唤醒负情绪,或用户对人工来源高度敏感,熟悉合成可能引发更长的审视和不适,应优先用真人录音或降低唤醒强度,并补测主观自然度与信任。

常见误解有三。其一是把反应时更慢直接等同于生理应激更高,原文 HRV 零结果不支持这种等同。其二是把无训练等同于系统输出确定,实际上合成推理、专家筛选和被试状态都会引入变异。其三是把 1 次实验室中性句结果当成所有人机交互的定论,原文明确建议未来加入视觉和上下文线索,并改变熟悉程度分级。下一步最需要补的验证是公开刺激通过率、报告绝对准确率和反应时均值、测量误判矩阵和主观评价,以及在更大样本和更强熟悉关系上重复情绪依赖格局。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总