英文题目:The Impact of Perceived Emotions on Purchase Intention in Synthesized Advertising Speech

会议身份:conference:speechprosody:2026:conference-paper-id:nagano26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#多任务学习 #主观评测 #语音 #文本到语音

评分:6.0/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Mizuki Nagano:机构信息未能从会议 PDF 纯文本可靠映射
  • Kenichi Fujita:机构信息未能从会议 PDF 纯文本可靠映射
  • Yusuke Ijima:机构信息未能从会议 PDF 纯文本可靠映射
  • Sadao Hiroya:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文输入为广告文本、任意说话人参考语音与目标购买意愿值,输出为保留说话人身份且提升购买意愿的合成广告语音,难点在于韵律特征与购买意愿呈非线性关系且听者内部感知状态难以直接优化。方法链分三步衔接:参考编码器从参考语音提取384维语音嵌入作为韵律基线并送入修改模块;语音嵌入-购买意愿模型从嵌入预测购买意愿得分以提供优化目标;嵌入修改模块冻结该预测模型并经50轮反向传播迭代更新嵌入,再由零样本语音合成模型结合目标文本生成最终波形。与直接学习嵌入到购买意愿映射的无约束模型相比,关键差异是受约束模型在训练中间层额外以愉悦度与唤醒度情绪得分的均方误差为约束,使优化梯度蕴含听者感知方向,合成时并不直接输入情绪标签,从而避免学到单纯加快语速的伪相关。在闭集说话人配对比较评测下,受约束语音的说话人相似度得分为0.93±0.02,高于无约束语音的说话人相似度得分0.85±0.02。购买意愿与情绪听辨进一步显示受约束语音愉悦度显著更高而唤醒度与无约束语音无显著差异,说明增益主要经由愉悦度实现且同时更好地保留了原始音色。该结论适用边界受限于日语广告朗读短句的在线试听场景,尚未验证真实购买行为、长期效果与跨语言外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,先把任务边界说清

这篇解读的输入是论文正文与官方演示页像素,目标是让刚进入语音与音频方向的研究生能核对方法并复述流程。必须保留的信息包括任务定义、两类模型的训练监督差异、嵌入改写的迭代方式、听评的被试量与比较方法,以及购买意愿与知觉情绪的主结果数字。输出是 1 篇按学习依赖展开的技术解读,不做超出证据的效果承诺。

论文研究的任务是广告语音合成中的购买意愿增强。白话说,就是给定一句广告文案和一个说话人的参考语音,生成一段让人更有购买动机的同说话人语音。这里的购买意愿指听者报告的购买动机强度,不是真实下单行为。知觉情绪指听者自己感到的情绪,论文用愉悦和唤醒两个维度衡量,每个维度与购买意愿一样都用七点量表采集。需要先分清知觉情绪与说话人意图情绪:前者是听后的自我感受,后者是说话人想表达的情绪化朗读,二者不必然一致,论文明确研究的是前者。

为什么这个任务不能把声音直接丢给模型学一个端到端映射就结束。消费行为研究早就报告,氛围、设计、品牌形象、语速和基频等刺激与购买意愿之间往往是非线性的。刺激-机体-反应理论把这种非线性拆成层次结构,外部刺激先影响机体即人的内部状态,内部状态再塑造行为反应。论文把广告语音看作刺激,把听者的知觉情绪看作机体,把购买意愿看作反应。

作者进一步把这个层次结构类比为深度学习:输入输出之间有中间层作黑盒但能表达非线性,如果在中间层加上知觉情绪约束,就相当于刺激-机体-反应模型的工程实现。问题在于,现有深度学习是否可以直接用语音到购买意愿的输入输出数据学出最优模型而不需要情绪约束,过去没有直接比较,因此论文要构造性地比较 1 次。

刺激-机体-反应理论 × 知觉情绪: 刺激-机体-反应理论负责把广告语音到购买意愿的非线性关系拆成刺激影响内部状态、内部状态再影响行为的两段,知觉情绪负责充当其中机体一层的可测量代理,即听者自己感到的愉悦和唤醒,而非说话人想表达的情绪,二者搭配的理由是只有把中间状态显式建模,才能避免把韵律特征与购买意愿直接连成过于简单的映射,组合意义在于为深度模型在中间层加情绪约束提供了行为心理学依据。

官方演示资源当前可用,已公开,地址为论文脚注中的演示页,可试听合成样例和查看广告句。解读中凡是教学举例都会标为例子,不把例子里的数值当作论文报告的事实。

同输入同目标的前人做了什么,本文卡在哪一环

按同输入、同目标、同监督来对照,前人路线大致有 3 条。第一条是消费行为中的刺激与购买意愿研究,输入是商店氛围、设计、拥挤、颜色、气味和音乐等,目标是购买意愿,监督多为问卷量表,结论是关系常为非线性,需要层次模型解释。第二条是广播广告中播音员语音特征与消费者反应的研究,输入是基频、语速和音质等,目标同样是购买意愿或购买意愿的近似,监督也是听评,同样发现非线性。

第 3 条是把刺激-机体-反应模型用于广告语音的研究,机体层用过知觉人格、明亮感与温暖感等语义基元,以及知觉情绪中的愉悦和唤醒。长野等人此前报告,以愉悦和唤醒为中介能增强广告语音带来的购买意愿,语速加快能提高愉悦,但语速与购买意愿并非单调正相关。

本文卡在验证方式这一环。前人多为相关性分析或结构方程,说明情绪中介有效,但没有在生成端验证:如果训练一个直接预测购买意愿的深度模型,再用它反向改写语音,能否同样增强购买意愿。如果能,那么情绪约束就是多余的。如果不能,才说明中间约束在生成中有实际价值。论文的增量正在于此,它不只拟合关系,而是把 2 个模型都用于实际改写嵌入并合成语音,再做听评比较。这是一种生成式验证,比只报告回归系数更贴近应用。

同运行阶段的对照是零样本语音合成。近年零样本模型能用几秒参考语音保留任意说话人音色和风格,论文采用以自监督语音表示为条件的快速语音合成模型第二代加高保真生成对抗网络声码器。理解这一点很重要,因为后续所有购买意愿增强都不重训合成模型,只改输入给合成模型的嵌入,这样才能做到对未知说话人也适用。

要回答的具体问题与可证伪的预期是什么

论文要回答的问题很具体:在其他结构和参数量相同的条件下,训练时在中间层加知觉情绪约束的模型,相比不加约束的模型,能否生成让听者报告更高购买意愿的广告语音。预期是能,且伴随更高的知觉愉悦。如果结果是两者无差异或无约束更高,则不支持情绪中介在生成中的必要性。

为让问题可操作,作者把目标购买意愿定义为在初始嵌入估计值上加 1.0。白话说,不是定一个所有人都一样的 7 分满分,而是对每条初始语音都往上加一个单位,再让嵌入向这个目标移动 50 轮。这样既保证增强方向一致,又避免对本来就高的起点提出不切实际的目标。举例说明改写逻辑:比如某条男声朗读的估计购买意愿是四点几,目标就设为五点几,改写模块反复微调嵌入直到估计值靠近目标,这只是教学例子,不代表论文某条样本的真实分值。

另一个必须固定的问题是说话人身份是否被破坏。嵌入反复更新可能把音色改飘,因此论文同时考核说话人相似度。如果购买意愿上去了但人听出来不是同一个人,广告代言场景就不可用。所以问题是双重的:购买意愿是否更高,身份是否保持。

沿一条样本走完输入到输出的全景

先沿一条样本走完全程。输入是两样东西,一句广告文本,例如肉类或鞋类的网页广告句,以及一段参考语音。参考编码器把参考语音变成 384 维的初始语音嵌入,这一步保留说话人韵律起点。接着语音嵌入改写模块接管,它用语音嵌入到购买意愿模型估计当前购买意愿,计算与目标购买意愿的平方误差,再用反向传播只更新嵌入本身,模型参数冻结。重复估计与更新 50 轮,得到改写后嵌入。

最后把改写后嵌入与目标广告文本送入零样本合成模型,经由方差适配器和解码器生成梅尔频谱,再用声码器生成波形。采样率为 22 kHz,强度归一到平均 62 分贝。

这个全景里有 2 个模型承担不同职责。语音嵌入到购买意愿模型负责给出可微的购买意愿分数,是改写的梯度来源。零样本合成模型负责把嵌入渲染成自然语音,不参与购买意愿优化。训练与合成的分工要分清:情绪约束只出现在前者的训练阶段,合成改写阶段 2 个模型都不再用情绪输出。

下面这张总览图把三部分拼在一起,读图时先看主路径再看约束分支,才能理解约束只在训练时起作用。

看图路径: 1. 先从左路看参考语音经参考编码器到初始嵌入,再经改写模块到改写后嵌入,最后与文本一起进语音合成模型的纵向主路径;2. 再看中间粉色改写模块内目标购买意愿与估计购买意愿之间的双向箭头和 50 轮反向传播回路;3. 对比右路两个蓝色塔形模型在底部 384 维输入和顶部一维输出相同的结构,找出有约束模型中间用红色虚线引出二维情绪的分支;4. 确认红色虚线标注仅在训练时使用的含义,即合成改写时并不直接使用情绪输出

原论文 Figure 1:(a) Speech synthesis process using reference encoder, speech embedding modification module and…

论文图 1。原论文 Figure 1:“(a) Speech synthesis process using reference encoder, speech embedding modification module and TTS model.”。

这张图左侧是合成主路径,底部参考语音经参考编码器得到初始嵌入,经粉色改写模块得到改写后嵌入,再与文本一起进语音合成模型输出语音。中间粉色大框是改写模块的放大,蓝色小框是冻结的购买意愿估计模型,目标购买意愿与估计购买意愿之间有双向比较箭头,虚线箭头把误差反传回可更新的嵌入,标注为 50 轮。

右侧是两个蓝色塔形估计模型,底部都是 384 维嵌入输入,顶部都是 1 维购买意愿输出,中间由全连接层堆叠而成,有约束模型在中间维度为 2 的位置用红色虚线额外引出 2 维情绪输出,并标注仅在训练时使用。像素可见的维度标注从下往上为三十二、三十二、三十、二十、四,丢弃率等细节见训练节。理解这张图的关键是,有约束与无约束在合成时走的是同一条改写回路,差别只来自训练阶段中间表示被情绪监督塑造得不同。

估计模型的结构差异在哪里,合成模型又是什么配置

语音嵌入到购买意愿模型是比较的核心。2 个模型共享同样架构,输入都是 384 维嵌入,输出都是 1 维购买意愿,中间由多层全连接加线性整流激活加丢弃组成。论文图注明确,有约束模型在训练时从中间全连接层的输出额外预测知觉情绪,但在改写嵌入做语音合成时并不使用情绪输出。白话说,情绪分支是训练时的辅助监督,不是合成时的控制旋钮。

2 个模型参数量相同,丢弃率为 0.5,优化器为自适应矩估计,学习率为 0.005,训练 1000 轮后损失收敛到几乎相同的值。这个收敛到相同损失的细节很重要,它说明后续听评差异不是因为一个模型欠拟合或训练失败,而是中间约束带来的表示差异。

零样本合成模型采用以自监督语音表示为条件的快速语音合成模型第二代,编码器与解码器分别有 4 个和 6 个前馈变换器块,帧移 10 毫秒,参考编码器输出 384 维嵌入并送入方差适配器和解码器,其余参数沿用原论文设置,训练数据为来自两万多名日语说话人的二百多万句,推理时用高保真生成对抗网络生成波形。论文未报告合成模型的训练损失曲线与主观自然度打分,这是缺项,解读时不从模型名称推定其自然度必然足够好。

有约束模型 × 无约束模型: 无约束模型只用语音嵌入预测购买意愿,有约束模型在中间全连接层额外引出一路 2 维知觉情绪输出并在训练时同时最小化情绪误差,有约束负责在训练阶段把中间表示拉向能解释愉悦和唤醒的方向,无约束负责作为只学输入输出关系的对照,二者搭配的理由是结构参数量相同、训练数据中购买意愿部分相同,只有中间约束不同,组合意义在于能构造性验证情绪中介是否真的有助于生成更高购买意愿的语音。

改写模块的计算分 4 步循环。第一步用估计模型从初始嵌入估计初始购买意愿。第二步计算估计值与目标值的平方误差,经反向传播更新嵌入。第三步用更新后嵌入重新估计购买意愿。第 4 步重复第二与第三步直到指定轮数,论文设为 50 轮,学习率为 0.005。

整个过程估计模型参数冻结,只有嵌入被更新。需要区分原始目标、近似与优化步骤:原始目标是提高人评购买意愿,近似是用模型估计值代替人评,优化步骤是对嵌入做梯度下降。原文未给出梯度裁剪、嵌入范数约束或早停规则,这些是缺项,不猜测。

三种语音刺激是如何造出来的,韵律上发生了什么

实验用的语音刺激有 3 种。初始语音由初始嵌入直接合成,可视为增强前的朗读起点。无约束语音与有约束语音分别用无约束模型和有约束模型改写后的嵌入合成,目标购买意愿都是在初始估计值上加 1.0。为检验泛化,生成不仅覆盖训练中用过的 1 男 1 女两个封闭说话人,还覆盖未参与训练的 3 男 3 女 6 个开放说话人,年龄从三十多岁到六十多岁及以上。每位说话人读六句网页收集的广告句,3 种类型全做,共 144 条刺激。

参考编码器 × 零样本语音合成: 参考编码器负责把几秒参考语音转成初始 384 维语音嵌入,保证说话人韵律起点不丢失,零样本语音合成负责以后续的改写后嵌入和广告文本为条件生成波形,分工是前者只管抽表示、后者只管按表示和文本渲染,二者搭配的理由是需要对任意说话人都能从朗读起点出发去增强购买意愿,组合意义在于改写嵌入即可换风格而不必为每个说话人重训合成模型。

下表比较 3 种语音的平均韵律特征,比较问题是改写是否系统性地改变了基频均值、基频标准差和语速,公平条件是同一批句子与说话人、同一合成后端,只有嵌入改写模型不同,指标方向本身无好坏,只是为解释听评提供声学依据。表前说明已给出,读表时注意单位保留原文写法。

SpeakerMean F0SD F0Speech rate
Initial130.1819.587.19
Male Unconstrained147.8933.5212.17
Constrained136.2425.6510.05
Initial237.8838.117.14
Female Unconstrained263.9656.4311.84
Constrained254.7750.6810.18

表后解释需要同时看到收益与代价。数据显示无约束与有约束语音相比初始语音都明显变快,语速从每秒 7.19 个莫拉左右升到 10 到 12 个莫拉左右,基频标准差也变大,基频均值在统计检验中未显示显著差异。具体检验报告为初始与无约束在基频标准差和语速上差异显著,在均值上不显著,初始与有约束趋势相同。代价是无约束语音的语速推得更猛,男声达每秒 12.17 个莫拉,女声达 11.84 个莫拉,而有约束语音相对克制。

结合后文听评看,推得更猛并没有换来更高的愉悦与购买意愿,这构成一个反例,说明只加快语速不等于更想买。相似度方面用语音编码工具计算的客观分数都在 0.85 以上,有约束与初始的相似度达 0.93 左右,高于无约束的 0.85 到 0.87,说明身份都保持,但有约束保持得更好。

估计模型用什么数据和监督训练,冻结与更新如何分工

估计模型的训练数据来自听评采集。训练集有 17629 对,来自 400 名被试对 1 男 1 女两个说话人广告语音的知觉情绪与购买意愿反应,其中语音的基频和语速做过系统性修改,情绪分数为愉悦和唤醒,购买意愿与情绪都用七点量表。验证集有 338 对,来自 26 个说话人,用于考察泛化。训练准则对 2 个模型都是购买意愿的均方误差,有约束模型额外最小化情绪的均方误差。2 个模型参数量相同,丢弃率 0.5,优化器与学习率如前所述,训练 1000 轮。

参数冻结与更新的分工必须按证据讲清。训练阶段更新的是估计模型的参数,情绪监督只在此时通过中间层输出进入损失。合成改写阶段冻结估计模型全部参数,只更新语音嵌入,情绪分支不再参与。监督来源在训练时是人评的购买意愿分数加情绪分数,在改写时是冻结模型的估计购买意愿。重置时机是每条样本都从各自的初始嵌入出发改写 50 轮,不跨句子累积。论文未报告估计模型在验证集上的均方误差数值与人评相关系数,这是缺项,不能从训练损失收敛推定其预测精度有多高。

语音嵌入 × 购买意愿: 语音嵌入负责把参考语音的说话人韵律和风格压缩成 384 维可改写的连续向量,是合成的控制把手,购买意愿负责作为 1 维标量目标给出改写方向,二者搭配的理由是直接改波形或文本不可控,而在嵌入空间做梯度上升可以保留音色同时调整韵律,组合意义在于把购买意愿估计模型当成可微的评价函数,用误差反传直接更新嵌入。

听评测什么、与谁比、条件是否一致

购买意愿实验测的是哪段语音更让人有购买动机。被试为 408 名日本人,男性 205 人女性 203 人,平均年龄 46.3 岁,标准差 15.0。每人对单个说话人做 18 次对偶比较,三句话乘 6 种顺序组合,比较初始、无约束、有约束 3 种语音的同一句子,指示是不考虑真实掏钱,只评动机。指标是瑟斯顿对偶比较法换算的量表值,方向是值越大表示被选为更有购买意愿的次数越多。比较的三方条件一致,文本、说话人与合成后端都相同,只有嵌入改写模型不同。

说话人相似度实验测的是改写后谁更像原来的朗读。被试为 193 名日本人,男性 111 人女性 82 人,平均年龄 46.6 岁,标准差 15.3。采用 XAB 范式,先听初始语音作参考,再随机顺序听无约束与有约束语音,选出更像参考的一方。每人对单个说话人听 12 个样本,六句话乘两种呈现顺序。

知觉情绪实验测的是哪段语音带来更强愉悦或唤醒。被试为 16 名日本人,男性 7 人女性 9 人,平均年龄 44.2 岁,标准差 9.7。用语音与购买意愿实验相同的刺激,每人对单个说话人做 18 次对偶比较,听同一句子的两段语音并选出愉悦或唤醒更强的一方。为帮助理解,主试给出愉悦指感觉良好等定义。所有实验都在网页浏览器中在线进行,被试先用样例语音调到舒适音量,实验中不允许再调,样本顺序随机。

瑟斯顿对偶比较法 × 说话人相似度: 瑟斯顿对偶比较法负责让被试每次只听同一句子的两个样本并选出购买意愿或愉悦感更强的一方,再换算成等距量表值,说话人相似度负责用 XAB 检验确认改写没有把人改丢,分工是前者管效果排序、后者管身份保持,二者搭配的理由是嵌入反复更新可能破坏初始韵律中的身份信息,组合意义在于只有在身份保持的前提下谈购买意愿提升才有广告应用价值。

购买意愿的主结果:谁赢了,赢面有多大

购买意愿的量表值显示,有约束语音在封闭与开放说话人上都是最高。比较问题是有约束是否同时打败初始与无约束,公平条件是同一句子内比较、量表方向越大越想买。下表把卡方检验的关键数字按可运行策略整理,初始、无约束、有约束都是实际可合成的策略,没有用事后最优或预言值代替。

对比说话人集合卡方值自由度显著性
有约束对初始封闭150.781p < .01
有约束对初始开放95.391p < .01
无约束对初始封闭1.651p = .07
无约束对初始开放1.871p = .053
有约束对无约束封闭85.841p < .01
有约束对无约束开放226.001p < .01

表后解释要看到主要收益与具体代价。有约束对初始在封闭与开放上都显著更高,无约束对初始在两类说话人上都不显著,有约束对无约束在两类说话人上都显著更高。这支持论文假设,即中间加情绪约束的生成更能提升购买意愿,且对未知说话人也成立。代价或限制是,无约束改写并非完全无效声学变换,它确实改变了语速与基频起伏并保持了说话人身份,只是在人评购买意愿上没有换来显著增益。

未胜出项是无约束语音,它在两类说话人上都没能显著超过朗读起点,这是明确的负结果,不应略去。论文图用 95% 置信区间展示量表值,但像素不能精确读出每点数值,这里只引用正文报告的检验统计量,不猜曲线坐标。

说话人相似度的主观结果显示,有约束被选为更像初始的比例在封闭说话人为 81.8% 加减 1.6,在开放说话人为 73.5% 加减 1.1,说明有约束比无约束更能保持身份。但论文讨论部分明确提醒,两个听评实验独立进行,购买意愿实验并非每次都呈现初始语音,因此不能把购买意愿更高简单归因于更像原音,作者将其归因于情绪约束塑造的模型差异,这个因果表述应理解为有限解释而非已证明的因果链。

情绪维度上的对照:愉悦拉开了,唤醒没有

如果有约束的增益真的来自情绪中介,那么有约束语音的知觉情绪应高于无约束语音。论文为此单独做了情绪对偶比较,这相当于对机制的消融验证。比较问题是愉悦与唤醒两个维度是否都跟随购买意愿一起提升,公平条件仍是同一句子、同一批刺激、同样瑟斯顿方法。下表整理正文报告的检验数字,策略都是可运行的合成类型。

对比情绪维度说话人集合卡方值显著性
有约束对初始愉悦封闭12.00p < .01
有约束对初始愉悦开放25.00p < .01
有约束对无约束愉悦封闭12.00p < .01
有约束对无约束愉悦开放21.78p < .01
有约束对初始唤醒封闭12.00p < .01
有约束对初始唤醒开放25.00p < .01
有约束对无约束唤醒封闭.75p = .22
有约束对无约束唤醒开放1.36p = .10

表后解释要区分两个维度的不同命运。愉悦上,有约束显著高于初始,也显著高于无约束,封闭与开放一致,这与购买意愿的走势一致,支持愉悦中介的解释。唤醒上,有约束显著高于初始,但与无约束之间在封闭与开放上都不显著,说明两种改写都提高了唤醒,唤醒不能解释购买意愿的差距。论文讨论给出一个可能待验证的解释:唤醒与购买意愿关联较弱,却对语速加快更敏感,而无约束把语速推得更快,所以唤醒被推高但愉悦反而没上去。这仍是有限解释,不是因果证明。未评测边界是除愉悦唤醒之外的情绪维度与人格维度,论文未测,不能推广。

结合声学表看,无约束语速最快但愉悦最低,这反驳了语速越快越想买的简单推论。论文据此认为,无约束模型学到了过于简单的相关,把加快语速直接当成提高购买意愿的手段,而有约束模型因中间要解释愉悦,学到的映射更贴近人的内部状态变化。这个判断应读作对结果的解释,不是训练梯度的直接观测。

哪些结论有边界,哪些量根本没测

先说支持什么。报告显示有约束语音在购买意愿和愉悦上高于无约束语音,封闭与开放说话人一致,这支持在中间层加知觉情绪约束更有效。再说限制。被试都是日本人,广告句来自网页收集的日语语料,说话人与听评的语言文化背景单一,论文结尾明确把语言依赖差异列为未来工作,因此跨语言是否成立待验证。情绪实验仅 16 人,远少于购买意愿实验的 408 人,统计效力与人群代表性较弱,愉悦差距虽显著但量表值的置信区间与效应量需谨慎解读。

未测量的量要逐项点名。论文未报告合成语音的自然度与音质打分,未报告估计模型在验证集上的预测误差,未报告训练与推理的硬件预算、耗时与实时率,也未测量真实购买行为。相关性不是因果,愉悦与购买意愿同向提升不能证明愉悦导致购买意愿,还可能是两者被同一韵律变化共同驱动。总体趋势不等于每组每句都成立,论文只给出聚合后的量表值与检验,未公开按句子或按说话人的细分解。客观相似度用工具分数报告,阈值引用前人工作说明身份保持,但工具分数不能等同于人评相似度,人评部分只做了相对选择,没有绝对相似度打分。

还有一个方法边界。目标购买意愿是在初始估计值上加 1.0,这种相对目标保证了可比性,但没有测试更大步长或多轮迭代是否单调更好,也没有测试向低购买意愿方向改写是否对称可控。嵌入更新没有报告范数约束,50 轮与学习率 0.005 是固定选择,不是搜索最优,不能当作可部署的最优超参数。

要复现这条路,先准备什么、按什么顺序做

复现前先区分代码、权重与系统可运行三件事。论文未在正文给出代码仓库链接,只给出演示页链接,当前可用,可试听样例。以下步骤按论文实际流程排序,给出必须固定的信息条件。

第一步准备合成后端。按论文配置搭建以自监督表示为条件的快速语音合成模型第二代与高保真生成对抗网络声码器,或直接调用等价的零样本合成实现。关键信息条件是参考编码器输出 384 维嵌入,帧移 10 毫秒,合成采样率 22 kHz,强度归一到平均 62 分贝。若后端不同,韵律改写的听感可能不同,需先对齐朗读基线。

第二步采集估计模型训练数据。对 1 男 1 女朗读做基频与语速的系统性变换,招募被试用七点量表评购买意愿、愉悦和唤醒,得到嵌入、情绪与购买意愿三元组。论文训练集为 17629 对,验证集为 338 对来自 26 个说话人。划分与采样口径按原文交代为准,不要自行编造分层比例。

第三步训练两个估计模型。结构保持相同参数量,输入 384 维,输出 1 维购买意愿,有约束模型在中间维度为 2 处加 2 维情绪输出。损失为购买意愿均方误差,有约束再加情绪均方误差。丢弃率 0.5,自适应矩估计学习率 0.005,训练 1000 轮直到损失收敛到相近值。需记录验证集误差,否则无法判断改写用的梯度是否可靠。

第 4 步做嵌入改写与合成。对每条初始嵌入设目标为估计值加 1.0,冻结估计模型,反向传播只更新嵌入,50 轮学习率 0.005,再与广告文本一起合成。对封闭与开放说话人分别生成初始、无约束、有约束 3 种语音,每人六句,共 144 条的规模可按资源缩小,但须保留三方同句比较。

第五步做听评。购买意愿用瑟斯顿对偶比较,每人对单说话人做 18 次比较。情绪实验同样 18 次,并给出愉悦为感觉良好等定义。相似度用 XAB,每人对单说话人 12 次。统计用卡方检验,报告自由度与显著性。复现时还需补论文未报告的验证:合成自然度、验证集预测误差、推理耗时与按句分解,以确认增益不是以自然度为代价。

何时值得尝试这种中间约束,记住哪条误解

何时值得尝试很明确。当目标是让人行动的语音设计,且刺激到行为的关系已知非线性,而你又有可采集的中间主观量时,可以考虑在中间层加知觉情绪或类似内部状态约束,再用冻结模型的梯度去改写可控表示。它的价值不在提高训练损失,而在塑造中间表示,使改写方向更贴近人的感受变化。本文的证据是购买意愿与愉悦同向提升且泛化到开放说话人,代价是需要额外采集情绪标注,改写仍需调步长与轮数,且自然度与成本未经验证。

需要纠正的特有误解有 3 条。第一,语速快不等于更想买。无约束语音最快但愉悦与购买意愿都低于有约束,说明单调加速是错误捷径。第二,唤醒高不等于愉悦高。有约束与无约束在唤醒上无显著差异,但在愉悦与购买意愿上有差异,两个维度要分开考核。

第三,更像原音不等于更想买。相似度实验与购买意愿实验独立,有约束确实更像初始,但作者明确不把购买意愿增益简单归因于相似度。

回到起点,刺激-机体-反应理论在这里不是装饰,而是可操作的训练约束。把知觉情绪放在中间层,相当于告诉模型不要只记语音到购买意愿的表面相关,要经过能解释愉悦的表示再做预测。复现时先把朗读基线、改写步长与三方同句比较做扎实,再谈是否引入情绪约束。若未来补上跨语言、自然度与真实行为验证,这条路才更接近可部署的广告语音设计。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 27 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总