英文题目:Voice parameter shifts and the perception of emotion in Irish synthetic utterances

会议身份:conference:speechprosody:2026:conference-paper-id:giovannini26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #韵律 #低资源 #语音 #语音合成

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Anna Maria Giovannini:机构信息未能从会议 PDF 纯文本可靠映射
  • Zihan Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Ailbhe Ní Chasaide:机构信息未能从会议 PDF 纯文本可靠映射
  • Christer Gobl:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文输入为ABAIR系统特定方言男声的中性合成语句,输出为指向多种情感状态的情感着色语音,难点在于低资源爱尔兰语缺乏情感语料且需兼顾方言重音结构与情感表达的交互。逆滤波分析先对同说话人情感录音与中性合成句做手动逆滤波与声门模型参数化,提取基频与激励及波形紧张度相关参数轨迹并完成时间对齐,为变换计算提供可比参数轨道。变换建模再基于回归与重音锚点插值计算全局均匀缩放与局部重音缩放因子,将对齐后的目标与中性差异转化为可施加的缩放参数并送入重合成。信号重合成最后经声源发生器生成新声源信号并用叠加算法调整时长与共振峰,输出全局与局部及组合多类情感刺激供知觉测试。相对心理学式全局均匀变换,其关键机制差异在于显式分离全局基线漂移与重音音节局部凸显并验证叠加效应,从而可独立控制并组合不同层级的情感线索。原文未提供可核对的关键定量结果。结论的适用边界在于高激活情感区分清晰而低激活状态高度混淆且仅在单句单说话人单方言上验证,尚需跨语句与多人多方言检验。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要解决哪个具体缺口?

本文的输入是一句情感中性的爱尔兰语合成语音,输出是听起来带有愤怒、快乐、悲伤、无聊和放松色彩的同一句话,任务是验证只改嗓音源参数能否让听者听出目标情感。研究对象不是从头训练高兴或愤怒的合成器,而是拿现有的爱尔兰语文本转语音系统中的男声科尔姆的凯里方言声音做基线,通过外部变换叠加情感。基线句是爱尔兰语 Geobhaimid bád ar an lá sin,词素直译是未来时我们得到船在那天,整句译为我们将在那天得到那条船,句中有 bád 船和 lá天两个承载高降调重音的词。

应用动机很具体:爱尔兰语辅助沟通设备需要让不能说话的使用者用合成嗓音表达情绪、心情和态度,而现有合成输出自然可懂但始终是中性,限制了沟通充分性。作者把这项工作定位为此前在真人录音上做变换实验的后续,这次把基线换成合成语音,更贴近实际部署条件。需要保留的关键信息是全部变换幅度都来自同一说话人的情感录音分析,不是凭经验随意调大调小,听辨指标同时看是否选对情感和情感强度有多强。

本文不训练新声学模型,不比较大语料人工智能合成路线,而是走知识驱动的小语料路线,这对爱尔兰语这类低资源语言是现实选择。初学者容易误以为只要整体提高音高就能表达快乐,本文恰恰要检验这种全局均匀变换是否足够,以及是否必须在重音音节上另做局部加强。

心理学全局观与语言学局部观为何在这里相遇?

心理学关于基频、强度和语速随情感变化的研究通常用全局术语描述,例如整体水平和动态范围,暗示整句均匀变换即可。语言学视角则提醒情感变化会与韵律结构交互,即使中性句中重音音节与非重音音节的嗓音源参数也有明显调制,因此情感信号可能落在重音音节的局部变化上。作者引用的前期工作显示特定嗓音质量并不唯一对应单一情感,低激活情感之间或高激活情感之间存在大量重叠,这为后文低激活混淆埋下伏笔。

另一条相关路线是爱尔兰语合成与辅助沟通应用,此前已建成多方言合成声音并在语言学习和无障碍场景使用,但情感表达仍是短板。本文与前人实验的直接联系是同一团队此前在真人嗓音上做过全局与局部控制,本次把方法搬到合成基线上。理解这条脉络很重要:本文不是要证明某种情感有固定声学指纹,而是要看在韵律结构固定的合成句上,全局基调与局部加重各自贡献多少。

对初学者而言,相关工作对照应按同输入、同目标、同运行阶段来理解,即同样是改造同一句话的韵律与音质并做听辨,而不是把情感分类准确率或大模型合成自然度拿来直接比较。

要回答的两个问题是什么,什么算成功?

第一个问题是 3 类刺激中哪类最有效:整句均匀变化的全局刺激、只动重音元音的局部刺激,还是两者都做的组合刺激。作者的明确假设是组合刺激最有效,推论是全局与局部效应可叠加。第二个问题是特定变换是否唯一指向一种情感,还是会同时提示多种情感。成功标准有两个层面:一是二元识别率,即听者是否把刺激判为目标情感而非中性或其他情感;二是强度评分,即在悲伤对快乐、无聊对感兴趣、放松对愤怒 3 个七点量表上偏向目标一端有多远。

量表从负 3 分到正 3 分,绝对值越大表示感知越强,零表示中性或当前子测试没有可选项。特别需要注意感兴趣这个选项,它是为与无聊配对而引入的反义词,也因为此前实验发现愤怒刺激常被听成感兴趣。激活度分组是解读关键:悲伤、无聊、放松属于低激活,快乐、愤怒、感兴趣属于高激活。本文报告显示高激活情感区分较好,低激活情感缺乏独特提示,这不是实验失败,而是与前人关于嗓音质量多对多映射的结论一致。

初学者复述时应先说清激活大类是否提示成功,再说具体情感是否唯一被识别,避免把大类成功误说成细类成功。

从一句中性合成语音到三类情感刺激的全景如何走通?

先沿一个样本走完全程有助于建立整体图像。以中性合成句为起点,研究者先用同一说话人的真人情感录音分析出目标参数轨迹,再把中性句的嗓音源参数向目标方向缩放,最后重新合成出可播放的刺激。全局、局部与组合的区别只在缩放系数作用范围不同:全局是整句乘上一个由回归线导出的比例,局部是只在两个重音元音区间内按插值曲线缩放,组合是先做全局再叠局部。

嗓音源之外的附加操作只出现在特定情感:悲伤与快乐有语速变化,快乐还有共振峰变化,其余情感只动嗓音源三参数。这种安排的理由是目标录音分析显示这些情感确有语速与共振峰差异,而不是为了让某类刺激占便宜。重新合成时嗓音源部分用嗓音源发生器生成,语速与共振峰部分用语音软件中的同步叠加算法实现。下面的示意图把 3 类变换画成三行,便于 1 次看清作用范围的差异。

为理解全局均匀抬升与重音局部凸起的搭配逻辑,需要先区分两种变换的分工与组合方式。

全局变换 × 局部变换: 全局变换负责整句均匀抬升或压低参数回归线以设定整体激活水平,局部变换负责只在 bád 与 lá两个重读音节元音上做凸起以模拟重音处的情感加重,搭配理由是语言学上情感应与韵律结构交互而非均匀铺开,组合意义是全局定基调加局部做焦点,二者叠加即组合刺激。

读图前需要明确图中每条线的身份与时间范围:蓝色是中性基线,橙色是变换后目标,横轴是时间,纵轴是 f0、Ee 或 Rd 参数,虚线表示中性与目标在锚点处的对应关系。

看图路径: 1. 先看三行面板标题如何区分 Global、Local 与 Combined 三种变换范围;2. 再看横轴时间与纵轴参数下蓝色中性线与橙色变换线的相对位置;3. 接着核对虚线与罗马数字锚点 I、II、III 在重音元音处的落点;4. 最后比较顶行整句抬升与中行只在凸起处抬升的差异

原论文 Figure 1:Schematic representation of the voice transforms.

论文图 1。原论文 Figure 1:“Schematic representation of the voice transforms.”。

该图实际可见三行面板分别标注全局、局部与组合。顶行两条线呈整句缓慢下降的回归直线状,橙色整体高于蓝色,虚线在多个时刻连接两线,说明全局变换是整句均匀缩放。中间行两线在非重音段基本重合,只在两处重音元音区间隆起为驼峰,橙色驼峰高于蓝色,锚点罗马数字标在驼峰起伏处,说明局部变换只动重音元音。

底行兼具两者特征:橙色基线整体抬高,同时在重音处仍有明显驼峰,虚线既出现在句首句尾也出现在驼峰处,说明组合是先抬整句再叠局部凸起。纵轴把 3 个参数画在同一示意尺度上,不代表三者数值相同,只是表示变换方向的示意。初学者应把该图记为方法总图:顶行定基调,中行做焦点,底行是二者叠加。

嗓音源三参数各自测量什么,如何得到目标数值?

3 个嗓音源参数分别是基频、激励强度与 Rd。基频即 f0,是声带振动频率的听感对应,白话就是音高。激励强度即 Ee 关联嗓音源信号整体强度,白话就是嗓音本身的响亮程度。Rd 是全局波形参数,定义式为 0.11 减 1 乘 f0 乘 Up 再除以 Ee,其中 Up 是声门脉冲峰值气流,低值对应紧张嗓音,高值对应松弛与气息声。目标数值来自对同一说话人情感录音的手工交互逆滤波分析。

录音在半消声室用专业设备录制,原采样率 44.1 千赫,下采样到 10 千赫后分析。研究者为每种情感挑选听感最好的一遍录音,与合成中性句一起做逆滤波,再用 LF 声门流模型参数化得到 3 条参数轨迹。手工方法耗时但精度高于现有自动方法,这是作者明确给出的方法选择理由。时间规整与可视化用脚本完成,以便选择分段点与计算缩放系数。附加的语速与共振峰改动用语音软件实现,不经过嗓音源发生器。

基频与激励强度的组合需要单独理解,因为二者在重音处常常同向变化。

基频 × 激励强度: 基频即 f0 负责音高高低与走向,激励强度即 Ee 关联嗓音源整体强度,二者分工是分别控制旋律骨架与响度能量,搭配理由是重音音节本就同时抬高音高与能量,组合意义是两者同向变化才能模拟自然重音的紧张发声而不只改变音高。

嗓音紧张维度的独立控制需要另一组概念来支撑。

Rd 参数 × 嗓音紧张度: Rd 参数是 Fant 提出的全局波形参数,用 0.11 减 1 乘 f0 乘 Up 再除以 Ee 计算,负责量化声门脉冲形状,嗓音紧张度是其听感对应,低 Rd 对应紧张嗓音而高 Rd 对应松弛气息声,搭配原因是只改音高和强度无法区分松紧,组合意义是用 Rd 独立控制紧张维度来区分愤怒与放松。

从分析到可操作数值的桥梁是逆滤波与参数化的衔接。

逆滤波分析 × LF 模型参数化: 逆滤波分析负责从录音中去掉声道共振影响而估计出嗓音源波形,LF 模型参数化负责把该波形压缩为 f0、Ee、Rd 3 条可操作的参数轨迹,分工是前者还原真实源信号而后者提供可缩放数值,搭配原因是手工交互逆滤波精度更高,组合意义是得到可逐点计算缩放系数的目标情感模板。

举例说明:若目标快乐录音在 bád 元音中部 f0 与 Ee 都高于回归线,而 Rd 低于回归线,则局部变换会在该元音中部施加大于 1 的 f0 与 Ee 缩放系数和小于 1 的 Rd 缩放系数,非重音段则保持接近 1,从而在听感上形成既更高更响又更紧的凸起。

全局回归线与局部锚点插值具体怎么算?

全局变换先对整句参数做 utterance 级线性回归,再只用特定一侧的数据点做 2 次回归:对 f0 与 Ee 只用回归线以下的数据点,对 Rd 只用回归线以上的数据点。这样做是为了削弱重音凸起对全局基线的干扰,更好代表全局嗓音特征。缩放系数用目标情感 2 次回归线的值除以中性句 2 次回归线的对应值得到,再乘到中性句上生成全局变换。由于中性句与目标句时长不同,用锚点时刻对齐回归线。

局部变换用语音层面的切分定锚点:重音音节元音的首尾浊音脉冲、从两端向内 20% 处的脉冲,以及每个重音元音中点。锚点之间的参数值用线性插值连成局部轮廓,缩放系数用插值除以目标 2 次回归线对应值,再乘到中性 2 次回归线对应值上。组合变换先施加全局改动,再把局部缩放系数直接作用到目标情感的 2 次回归线上。快乐刺激在上述三参数之外整句共振峰上移 4%,悲伤刺激时长增加 10% 而快乐刺激时长减少 10%。

初学者复述时要强调 2 次回归不是拟合得更准,而是故意避开凸起来估计基线,这是理解全局与局部可分离的关键。

本研究有没有训练神经网络,真实计算是什么?

本研究没有训练神经网络,也没有更新任何模型权重,因此不存在优化器、损失函数、梯度路径、早停或参数冻结与解冻的安排。真实计算是基于规则的信号变换与重合成:手工逆滤波加 LF 参数化得到数值模板,线性回归与线性插值得到缩放系数,嗓音源发生器按 LF 模型生成新源信号,同步叠加算法改语速与共振峰。调用的外部工具包括基于 MATLAB 应用设计器开发的嗓音源发生器、语音软件中的算法以及统计软件中的有序逻辑回归,均为推理与分析调用而非训练。

缺失的信息是具体的回归斜率、每种情感每个参数的逐点缩放量以及脚本阈值,原文未以表格给出,因此无法逐点复算,只能按描述的流程复现方法。若把无训练误解为输出确定是错误的:手工挑选最佳情感遍数、锚点切分与插值选择都会引入人工判断,不同操作者可能得到幅度略有差异的刺激。统计部分的混合效应有序逻辑回归是在听辨数据收集后才拟合的解释模型,不是生成语音的模型。

听辨实验测什么,条件是否公平,指标方向如何?

听辨实验测量两件事:一是二元识别率,即听者是否把第二句听成目标情感;二是强度评分在 3 个对立量表上的位置。刺激共 16 个:5 种目标情感乘 3 类变换加一个中性基线。每次试验先放中性句再放其中一个刺激,顺序随机。31 名爱尔兰语水平不一的听者参加,每人完成 3 个子测试,分别在悲伤对快乐、无聊对感兴趣、放松对愤怒上打分。

正式测试前有说明、中性句试听与每个子测试前的练习。公平条件是所有刺激共享同一基线句、同一说话人模板与同一重合成链条,差异只在变换类型与目标情感。指标方向是量表高激活端为正,低激活端为负,回归系数为正表示向高激活端移动,为负表示向低激活端移动。统计用 3 个量表各自拟合混合效应有序逻辑回归,因变量为有序评分,自变量为目标情感与变换类型,以中性和组合为参照类,加入听者随机截距并用 Holm-Bonferroni 校正,显著性水平为 0.05。

误差棒为均值正负 2 倍标准误的 95% 置信区间。需要说明的边界是听者语言水平不一可能影响对爱尔兰语句子重音的敏感度,但原文未按水平分组报告,这是复现时需补记的缺项。

组合最有效与高激活更清晰的证据是什么?

先提出比较问题:在相同目标情感下,组合是否高于全局与局部,以及高激活与低激活的提示是否同样唯一。公平条件是同目标情感内比较 3 类变换,指标方向是识别率越高越好,强度系数绝对值越大表示偏向该端越强。表后解释需同时看到主要收益与代价:组合在识别率上总体占优,但低激活刺激的代价是同时提示多个低激活标签。

下表整理原文明确报告的识别率区间,比较对象是 3 类变换在各自目标上的表现,指标是二元识别率,方向是越高越好。

条件指标组合变换全局变换局部变换
放松目标识别率53%未单独报告较差
悲伤目标识别率94%94%较差
快乐目标识别率高100%较低但仍高
全部目标总体趋势最高次高最弱
刺激总数设计规模16 个刺激含中性基线5 情感乘 3 变换

表后解释是组合变换识别率范围从放松的 53% 到悲伤的 94%,全局在快乐达 100% 且悲伤达 94%,局部总体最弱。未胜出项是局部变换,它在多数情感上强度评分更低,这是后文消融要细究的负结果。该表不能替代强度回归证据,识别率高不等于强度大,也不等于唯一指向目标。

为理解激活大类与具体情感的区分,需要区分两层含义。

激活度 × 情感类别: 激活度负责区分高唤醒与低唤醒的大类走向,情感类别负责在同类内区分具体标签如快乐与愤怒或悲伤与无聊,分工是前者判断能量方向而后者判断语义标签,搭配原因是嗓音质量常在同激活组内共享,组合意义是先看是否成功提示激活方向再看是否唯一指向目标情感。

右半部分强度置信区间的导读如下:三行分别对应不同对立量表,横轴是目标情感,纵轴是强度方向,误差棒不跨零即表示显著偏向一端。

看图路径: 1. 左列先按 Happy、Angry、Relaxed、Bored、Sad 五行找到每行的大圆点目标位置;2. 比较同一行内绿线全局、红线局部、紫线组合与黑色虚线中性的高低;3. 右列按 Happy-Sad、Interested-Bored、Angry-Relaxed 三行核对误差棒是否跨过零线;4. 注意低激活行中紫绿线在多个感知标签上同时抬高的混淆形态

原论文 Figure 3:Binary identification rate (left) of affect perception & intensity score confidence intervals…

论文图 3。原论文 Figure 3:“Binary identification rate (left) of affect perception & intensity score confidence intervals (right) for each affect”。

该图左列可见快乐行大圆点靠近顶部,愤怒行组合与全局高于局部,悲伤行组合与全局在放松、无聊、悲伤三列同时抬高而局部较低,放松行各线分散且峰值不高。右列可见快乐与愤怒目标显著偏向高激活端,悲伤与无聊目标显著偏向低激活端,放松目标多数区间跨零或偏向不稳定,说明低激活刺激能提示大类方向但不能唯一锁定标签。高激活的快乐与愤怒在感兴趣量表上也得高分,说明二者与感兴趣共享高能量提示,这是原文明确讨论的重叠而非误判。像素不能精确读出的具体百分比不应硬写,应以正文报告的区间与回归系数为准。

去掉全局或只留局部会怎样,快乐的叠加性有何特殊?

把组合拆开看相当于 1 次消融:全局单独保留时愤怒与快乐仍较强,局部单独保留时多数情感强度下降。证据是愤怒局部在 3 个量表上均为显著负向交互,悲伤对快乐量表系数为负 4.23,无聊对感兴趣量表为负 4.86,放松对愤怒量表为负 3.25,均达到显著,说明局部愤怒比组合更偏向低激活端。快乐局部在悲伤对快乐与无聊对感兴趣量表上同样显著为负,系数分别为负 3.71 与负 4.31,快乐全局在无聊对感兴趣量表上也显著为负 2.74,说明快乐的局部与全局各自都不如组合强。

低激活中只有无聊局部在无聊对感兴趣量表上有显著正向交互 1.75,方向是远离无聊端,恰恰说明局部更弱。下面的回归系数表把可运行策略限定为 3 类真实变换,不拿事后最优或理论上限冒充可部署收益。

下表比较不同变换在回归模型中的相对位置,参照类是组合变换,指标是强度量表上的对数优势比方向,负值表示比组合更偏向低激活端。

条件指标组合参照全局变换局部变换
快乐目标全量表高激活系数β=5.15 等低于组合显著偏低
愤怒目标放松对愤怒高激活系数β=3.26降低显著偏低
愤怒全局无聊对感兴趣交互系数参照零β=-1.98不如全局
快乐局部悲伤对快乐交互系数参照零未显著β=-3.71
无聊局部无聊对感兴趣交互系数参照零未显著β=1.75

表后解释是快乐的全局与局部效应呈叠加性,去掉任一部分都会显著减弱高激活指向,这是原文明确指出叠加推论在快乐上特别强的依据。代价是愤怒局部几乎完全失去高激活指向,甚至 tilt 到低激活端,说明局部不能独立承担愤怒提示。未评测边界是语速与共振峰未做单独消融,因为悲伤语速加长与快乐语速缩短及共振峰上移是与三参数变换绑定的,无法从现有数据分离各自贡献。

下表把附加的语速与共振峰操作与局部失效的极端值放在一起,以提醒复现时不要把所有差异都归因于嗓音源。

条件指标悲伤操作快乐操作愤怒局部极端
时长变化语速增加 10%减少 10%无附加
共振峰变化滤波器无上移 4%无
强度方向回归系数负向大正向大β=-4.23 等
显著性检验显著显著p<0.001
适用范围刺激全版本全版本仅局部

表后解释是语速与共振峰只出现在悲伤与快乐全版本中,因此快乐的强提示可能部分来自这些附加线索,而愤怒局部的极端负值则纯粹反映嗓音源局部不足。复现若想验证纯嗓音源贡献,需要补做去掉语速与共振峰的对照,这是原文未做而值得补的验证。

哪些结论有直接支持,哪些还只是待验证推测?

直接报告的是组合识别率最高、局部总体最弱、高激活区分较好、低激活互相混淆,这些都有识别率曲线与回归系数支持。有限解释的是快乐的叠加性,因为只有快乐同时显示全局与局部各自显著弱于组合,其他情感证据不完整。待验证推测是加上语境后无聊刺激可在不同语境下被明确听成悲伤或无聊,原文只提出未来用叙事或视觉线索来检验,尚未测量。

相关性不等于因果:回归系数显示变换与评分相关,但不能证明某个参数单独决定某种情感,因为三参数是联动缩放的。缺失证据不是技术错误:原文未报告误判率矩阵的完整数值、反应时、计算耗时、实时因子与部署成本,也未按听者爱尔兰语水平分组,因此不能承诺该方法改善延迟或适合实时辅助设备。总体趋势不等于每组都成立:组合最优是总体结论,但放松目标的组合识别率仅 53%,说明在该情感上优势有限。

初学者应使用报告、支持、可能 3 级措辞:用报告描述识别率与系数,用支持描述叠加性,用可能描述语境消歧与跨方言泛化。

要复现这套变换,先做什么,需要补哪项验证?

复现先做三件事:拿到同一基线句的中性合成输出并标注两个重音元音边界,拿到同一说话人 5 种情感的录音并各选一遍最佳范例,用手工逆滤波加 LF 参数化得到 3 条参数轨迹。接着按原文两步回归法算全局缩放系数,按锚点插值法算局部系数,先全局后局部生成组合刺激,快乐与悲伤额外做语速与共振峰处理。听辨部分需复刻 16 个刺激、先中性后刺激的配对、三子测试与七点量表,并记录听者语言水平。

关键超参数与信息条件是 2 次回归只取单侧数据点、局部锚点取首尾脉冲加内移 20% 加中点、悲伤加长 10% 而快乐缩短 10%、快乐共振峰上移 4%、统计显著性水平 0.05 并做 Holm-Bonferroni 校正。代码与资源方面,统计在 R 语言环境完成,R 官网当前可用;语音可视化脚本指向的代码仓库链接当前不可用,返回 404,因此不能写该脚本已公开可下载,只能写本次未能通过该链接获取。嗓音源发生器基于 MATLAB 应用设计器,原文给出版本信息但未提供完整可运行包。

还需补的验证包括分离语速与共振峰贡献的消融、跨其他爱尔兰语声音与方言的泛化、以及加入语境线索后低激活混淆是否解除。何时值得尝试是当目标语言缺乏大语料而已有可懂中性合成声音,且应用需要轻量可解释的情感着色时,这套方法比从头训练更现实。

这篇论文给低资源语音情感研究留下什么可带走的方法?

可带走的核心方法是把全局基调与重音局部加重分开建模再叠加,用 2 次回归避开凸起来估计基线,用锚点插值保留凸起形态,从而在韵律结构固定的合成句上检验情感提示。最强证据是组合在多情感上识别率与强度同时占优,且快乐显示清晰的叠加性。主要代价是局部单独使用普遍偏弱,低激活情感缺乏独特提示,特定变换会同时提示悲伤、无聊乃至放松。

常见误解是把高识别率等同于情感唯一被识别,实际上悲伤与无聊刺激在放松、无聊、悲伤三列同时抬高,正确读法是激活大类成功而细类混淆。另一个误解是把无训练等同于方法简单,实际上手工逆滤波与锚点选择的精度要求很高,且语速与共振峰的绑定可能夸大嗓音源的贡献。若要在自己的语言上尝试,应先验证重音音节是否同样承载嗓音源调制,再决定局部窗口的位置与宽度,并为低激活情感预留语境消歧的设计。

未来工作指向引入气息声等未建模的音质维度、调节参数偏移幅度看强度变化,以及测试变换能否跨声音、跨方言乃至跨语言迁移。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 15 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总