英文题目:Listenability of Synthetic Speech: On the Effect of Linguistic Registers in Text-to-Speech Input

会议身份:conference:interspeech:2026:conference-paper-id:hjuler26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #主观评测 #言语感知 #语音 #文本到语音

评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Maja Jønck Hjuler:机构信息未能从会议 PDF 纯文本可靠映射
  • Tuyet Katie Nhi Tran:机构信息未能从会议 PDF 纯文本可靠映射
  • Laurianne Sitbon:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究考察文本到语音合成输入的语言语域如何影响可听性,输入为谈话电台转写、简明维基、标准维基与大语言模型生成文本,输出为听者加工合成语音时的主观努力与理解记忆,难点在于文本可读性指标无法预测听觉加工代价。方法先按相同百科话题采集四类语域文本以控制主题差异,其输出文本直接作为语音合成的输入材料。接着经同一合成引擎生成澳大利亚口音语音并做最小停顿修复,输出的16段刺激以随机顺序进入被试内听音环节。然后收集5项任务负荷指数、3项投入精神努力量与3道线索回忆题,并以可读性与多维分析标注器解释语域来源。与只评自然度或可懂度的传统评估不同,该工作把Biber语域维度与听努力直接关联,揭示口语相似性不等于易听性,可指导语音交付文本选型。在47名被试16段刺激的评测设置下,电台转写的AIME得分为62.9,高于GPT生成文本的AIME得分25.2。结论适用边界受限于短百科话题、单引擎与在线无控听音条件,长篇、对话交互或多说话人场景尚未验证。原文未披露训练、推理或部署成本

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么听合成语音费力不能只看音质?

这篇论文讨论的输入是送入语音合成器的文本,目标是比较不同语言语域文本被合成后好不好听懂、好不好记住。语域在这里是白话说的说话场合带来的语言差别,例如和朋友闲聊与写百科条目用词和句式完全不同。作者关心的可听性不是声音是否清晰动听,而是听者处理和保持口语内容需要付出多少心理努力。

这一点对研究生很重要,因为语音合成评测常用平均意见分评价自然度,用词错率评价可懂度,这些指标主要反映表层声学质量,不能回答听者是否容易跟上内容。论文明确把研究对象限定为输入文本的语言属性,而不是比较不同合成器谁的声音质量更高。研究背景还包括一个实际假设,当前很多对话系统把大语言模型输出直接作为合成输入,默认这种书面训练为主的文本适合朗读,但原文指出大模型输出的语域未必符合口语传递的要求。

作者因此提出两个具体问题,第一是书面语域合成的语音与会话语音合成的语音在可听性上有何差异,第二是书面来源之间的语域差异是否会转化为可测量的可听性差异。需要保留的关键信息是这是一项初步研究,采用被试内设计,用主观努力和线索回忆同时测量加工代价和记忆效果,并用可读性指标和语域多维分析刻画文本。

已有路线在测什么,为什么还缺语域这一块?

同输入同目标的已有工作主要集中在合成语音输出质量。典型做法是请听者给自然度打分,或者统计听写词错率。作者引用的一项研究用双任务范式和瞳孔测量证明合成器质量会影响听努力,但那项工作比较的是合成器之间的输出质量,没有触及输入文本的语言属性。同运行阶段的另一条路线是文本生成和简化模型,它们优化的是可读性,即书面文本易于理解的程度。

相关研究曾尝试用提示策略把大模型文本改得更适合语音,并用阅读流畅度、句长和句法依存深度等自动语音适切性指标评价输入文本。但论文引用观点强调可听性与可读性必须独立评价,因为阅读和听在加工需求上不同,利于阅读的因素不一定利于听。面向辅助技术的易听音频指南同样区分两者。

另一项近期工作注意到文本最优与口语最优之间存在错位,提出在思考和说话之间增加口语化转换步骤,并用人评的自然度、简洁度、可理解度和总体质量评价。作者认为这些工作仍未系统回答输入语域如何影响可听性。同监督或同测量思路上,减少听的认知负荷被认为是提升语音合成用户体验的关键,但直接针对可听性的知觉实验仍然稀少。

语域分析方面,多维分析已被广泛用于刻画英语语料在信息密度和叙事立场等功能维度上的变异,也有研究记录了自发语音与朗读文本在自然度感知上的差异,以及人类对话与大模型对话在语言变异性和真实性上的差异。但原文明确指出,尚未有人把这种语言变异分析用于刻画语音合成输入来源,也没有把语域位置与合成语音的可听性结果联系起来,这正是本研究的缺口。

要回答的具体问题是什么,不能回答什么?

论文把任务界定为在合成传递条件下比较 4 种语域的可听性,而不是比较合成器或朗读人。4 种刺激类型占据语域连续体上的不同位置,分别是澳大利亚电台谈话转写、维基简明英语、维基标准英语和大模型生成文本。每种类型覆盖 4 个相同主题,目的是降低单一怪异文本主导结果的风险。主题包括大学、哈勃超深场、某种树木和抽筋,原文用英文主题词给出。测量分为两类,一类是听过程中的主观努力和认知负荷,另一类是听后的线索回忆选择题。

作者关心的是书面来源合成语音是否比会话转写合成语音更可听,以及书面来源内部的语域差异是否足以产生可听性差异。不能回答的是语义内容完全相同只改变语域会怎样,因为 4 种条件只做到主题匹配,实际传达的信息并不相同,语义差异可能与语域混杂。也不能回答哪种合成器更好,因为全研究只用同一家免费层语音合成接口。也不能用阅读分数代替听的结果,因为论文的立场恰恰是两者需要分开测量。

初步研究的定位意味着样本量、刺激量和控制条件都有限,结论需要后续更大规模和更严格的内容控制来验证。

整个流程如何从四种文本走到听者分数?

先沿一个样本走完全程有助于建立整体图像。假设取主题是大学,电台来源先随机抽取并人工截取一段多人谈话转写,维基来源再按同一主题收集对应条目,大模型来源则调用接口按主题生成一段文本。接着所有文本都送入同一语音合成接口,选用澳大利亚口音,主体用同一个男声,电台多人部分再加入澳大利亚女声和男声设置,必要时人工加入停顿,特别是处理电台转写的连写长句。

然后把 16 段音频随机顺序呈现给每位被试,每听完一段就填写精简版任务负荷问卷和投入心理努力问卷,并在滑动条上从 1 到 100 打分,再回答三道关于主题和内容的回忆选择题。最后研究者一方面用自动可读性和依存句法复杂度以及多维分析标注器刻画文本,另一方面用重复测量方差分析比较 4 种刺激类型在 3 种因变量上的差异。

输入是 4 种语域文本,表示包括可读性数值和 6 维语域分数,组件包括在线问卷流程、主观量表和回忆题,目标是得到可比较的努力分数和回忆正确率,输出是组间差异是否显著以及文本语域定位。这个全景先把数据构造、合成调用、行为测量和文本分析放在同一条链上,后续各节再分别展开每个环节的具体操作和条件。

文本一侧用什么工具刻画难度和语域?

文本分析有两个并行的工具。第一个是自动可读性评价,包括词数、平均句长、阅读流畅度、阅读年级水平和依存深度。阅读流畅度是 100 分制,分数越高表示越易读。阅读年级水平把文本映射到美国学制年级。依存深度用句法依存图的深度表示句子结构复杂度,灵感来自此前语音适切性研究。

原文说明对电台转写省略阅读流畅度和年级水平,因为这两个指标不适用于转写口语。第二个是多维分析标注器,它基于 67 个共现语法和词汇特征,把语域变异量化为 6 个功能维度。维度 1 是卷入交互还是信息密集,维度 2 是叙事还是非叙事,维度 3 是显性表达还是情景依赖,维度 4 是明显劝说,维度 5 是抽象还是非抽象,维度 6 是在线信息 elaboration。标注器还提供压缩过大分数的标准化修正,并用与已知语类中心的欧氏距离指派最接近的文本类型。

与神经嵌入隐式捕捉语域不同,多维分析提供特征层面的可解释说明,能讲清文本为何不同。

可听性 × 可读性: 可读性负责刻画书面文本读起来有多省力,常用词长句长和阅读等级表示;可听性负责刻画听一段语音并留住内容有多省力,本研究用主观努力和线索回忆表示。二者搭配的原因是文本越易读不等于合成后越易听,组合意义在于把文本分析与听者实测分开,避免用阅读分数直接代替听觉加工难度。

语言语域 × 多维分析: 语言语域负责说明语言随交际场景变化的功能位置,例如交互卷入还是信息密集;多维分析负责把这种位置量化为 6 个功能维度上的分数,分工是前者提供解释框架、后者提供可比较的测量。搭配理由是仅凭直觉说某文本偏口语或偏书面不够稳定,组合后可以用同一套维度定位电台转写、简明维基、标准维基和大模型文本。

听者一侧如何测量努力和记住?

行为测量同样有两个并行的工具。主观努力一侧使用五题精简版任务负荷问卷和三题投入心理努力问卷。原版任务负荷问卷有六题,研究者去掉涉及身体需求的一题,因为不适用于听的任务。原版投入心理努力问卷有四题,去掉涉及更广泛受众的一题。所有题目都用在线问卷滑动条记录,范围是 1 到 100。

回忆一侧采用基于词水平的理解框架,按每段主题编制三道线索回忆选择题,选项顺序随机。每个被试总共听 16 段音频,每种刺激类型 4 段,每段主题不同,类型和主题的呈现顺序都随机。问卷还收集年龄、性别和英语是否为母语等基本信息,并说明研究目标。伦理方面原文报告已获得昆士兰科技大学伦理委员会批准。这种设计把加工过程中的感受与加工后的结果分开,既能看到哪种输入让人觉得累,也能看到哪种输入让人记得牢。

主观心理努力 × 线索回忆: 主观心理努力负责记录听者在听的过程中感觉投入了多少认知资源,本研究用精简版美国国家航空航天局任务负荷指数和投入心理努力量表测量;线索回忆负责检验听后实际记住了多少主题和内容,用三道选择题测量。二者搭配是因为感觉费力不等于没有记住,组合意义在于同时看到加工代价和记忆结果,才能发现高努力低回忆这类分离现象。

大模型生成文本 × 语音合成输入: 大模型生成文本负责按需提供可控的书面内容,本研究用小参数模型按主题生成;语音合成输入负责决定合成器实际要朗读的词句、停顿和多说话人安排。二者搭配的理由是现代对话系统常把大模型输出直接送入合成器,组合意义在于检验这种默认做法是否成立,即生成文本作为朗读材料是否与已有书面来源同样可听。

本研究训练了什么,没有训练什么?

本研究没有训练任何语音合成模型,也没有训练文本生成模型或听努力预测模型。方法职责由数据构造、既有模型调用和统计计算承担。真实计算过程包括三部分。第一是刺激构造,电台样本随机选择并人工截取,维基样本按主题收集,大模型样本用公开接口生成,提示词原文大意是说明这是人与人之间的对话、尽量可听、然后询问指定主题,提示工程保持最小化。

第二是语音合成调用,全部刺激使用同一免费层接口和固定口音与嗓音设置,多说话人用电台样本的附加嗓音呈现,人工只做插入停顿等最小调整。第三是文本分析和行为统计,文本一侧运行可读性计算、依存解析和多维分析标注,行为一侧清理未完成问卷后做单因素重复测量方差分析。原文没有报告模型参数冻结或更新、梯度路径、监督来源和重置时机,因为不存在需要训练的参数,这些缺项不是遗漏,而是研究类型决定的。

同样不能把调用固定接口等同于确定性求解,合成输出仍受接口版本和文本预处理影响。复现时应把重点放在刺激来源版本、提示词、嗓音设置和问卷题目删减上,而不是寻找训练代码。

被试、材料和统计条件是否一致?

先看被试构成与公平条件。实验采用被试内设计,每位被试都听完 4 种类型,有利于控制个体差异。呈现顺序在类型和主题上随机,回忆选项顺序也随机,减少顺序效应。合成嗓音主体保持一致,口音与多数被试的人口背景匹配。主题在 4 种来源之间匹配,但语义内容并不相同,这是后续解释必须记住的边界。

统计上以刺激类型为被试内因子,样本量为 47,对主观努力、任务负荷和回忆分别做分析,用球形检验并在违反时用温室校正,事后两两比较用 Bonferroni 校正,显著性水平为 0.05。 下表整理被试基本构成,比较问题是样本是否以年轻人和英语母语者为主,公平条件是同一批人完成全部条件,指标方向是人数和占比越高代表该亚组权重越大。

组别人数占比年龄均值年龄标准差
女性26 人55.3%不适用不适用
男性19 人40.4%不适用不适用
未透露性别2 人4.3%不适用不适用
英语为母语30 人63.8%不适用不适用

表后需要说明主要构成与代价。年轻均值和英语母语占多数意味着结果更适用于该人群,对非母语者或年长听者的推广需要额外验证。未胜出或未评测的边界包括只用单一合成嗓音、在线听音环境不受控、未控制先验主题知识,以及方差分析未把主题作为因子,无法分离语域效应与主题难度。

电台样本更长更口语,维基和大模型样本相对更短更书面,这些长度和句法差异本身也是条件的一部分,比较时不能假装只有语域标签不同而其他完全相等。资源状态方面,原文脚注给出刺激与分析文件的代码仓库链接,但本次收到的资源状态证据为空,因此不得声称代码、模型或数据当前已公开,只能按论文文字转述作者的存放说明。

书面合成为何比电台转写合成更省力?

先看多维分析给出的语域定位,再看听者分数。图前导读如下:该图横轴是 6 个功能维度,纵轴是标准化后的维度分数,4 种符号代表 4 种刺激来源,每个点是该来源在 4 个主题上的均值,竖线是主题间标准差,阅读时应先确认维度 1 的两极含义,再看其他维度是否分离。

看图路径: 1. 先看横轴六个维度与纵轴分数,确认零线上下分别代表维度两极;2. 再对比维度一上红色电台点与绿色标准维基点的位置和误差线长度;3. 最后检查维度二至维度六上四种符号是否都聚集在零线附近并重叠

原论文 Figure 1:MDA scores across all six dimensions (D) for the four stimulus types, computed with z-scores and…

论文图 1。原论文 Figure 1:“MDA scores across all six dimensions (D) for the four stimulus types, computed with z-scores and all linguistic fea- tures.”。

图中可见内容解释如下:维度 1 上红色电台点明显位于正值高位,误差线很长,表明高度卷入和交互性;绿色标准维基点位于负值低位,表明强书面化和信息密集;橙色简明维基和蓝色大模型点位于中间偏负,彼此重叠,表明书面但非正式。维度 2 和维度 4 上 4 种来源都位于零线附近偏负,说明都是说明性而非叙事或劝说性文本,符合百科和主题介绍的性质。维度 3 上简明维基和大模型略偏正,标准维基离散较大。

维度 5 和维度 6 差异较小。文本类型指派结果是电台接近信息性交互和卷入性劝说,标准维基接近 learned 和科学说明,简明维基和大模型接近一般叙事说明。可读性方面,简明维基平均句最短、结构最简单、阅读流畅度最高,标准维基句最长、流畅度最低、年级水平约 14 级,大模型居中。电台样本词数和句长明显更大,符合自发对话特征。

下表整理主观努力与回忆的核心数字,比较问题是在合成传递下哪种输入更可听,公平条件是同一批被试、同一合成设置和随机顺序,指标方向是努力分数越低越好、回忆正确率越高越好。

测量电台转写简明维基标准维基大模型文本显著性结论
主观努力62.928.928.725.2电台显著高于其余
任务负荷46.816.717.814.8电台显著高于其余
回忆正确率78.782.394.388.7仅电台低于标准维基显著

表后解释主要收益与代价。

电台转写在两种努力测量上都是明显离群值,主观努力约为其他来源的 2 倍以上,任务负荷也高出约 30 分,而回忆反而最低。3 种书面来源之间在努力和负荷上无显著差异,大模型所需努力数值上最低。回忆上标准维基最高且最稳定,其次是大模型和简明维基,但后两者与电台的数值差异未达到显著。未胜出项是电台转写,它最接近自然口语却最不可听。

负结果是书面内部的可读性梯度没有转化为可听性差异,最易读的简明维基并没有显著优于最难读的标准维基。边界是语义内容不同,因此不能断言努力差异完全由语域造成。

大模型文本与维基文本相当意味着什么?

这一节重提结果但增加新对照。原文报告大模型文本在三项测量上都与两种维基来源无显著差异。结合文本分析看,大模型在可读性上居中,在语域上与简明维基重叠,都被归为一般叙事说明,且都是名词重、信息性的语域。这支持了一种有限解释,即在最小化提示要求可听的条件下,大模型生成文本作为合成输入是可行的替代方案,具有按需生成和语域可控的实际优点。但这只是支持,不是证明其在所有主题、所有提示和所有合成器下都同样可听。

另一个值得注意的对照是标准维基的分离现象,它付出与其他书面来源相近的努力,却获得最高的回忆分数和最低的离散度。这提示认知负荷与记忆保持之间可能存在分离,信息密度高的规范说明在合成后未必增加感受负荷,反而可能因结构完整而利于回忆。该推测有待验证,因为回忆题是按主题编制的选择题,题目难度和信息可猜测性可能随来源变化。

电台转写的高努力低回忆则与面对面交互中有吸引力的语域特征在合成语境中带来认知代价的解释一致,但同样受语义不匹配的限制。两个主观量表独立得到相同模式,原文认为这支持它们作为听努力测量的并行效度,未来可听性研究可能只需选用其一,但这不等于两者可以互换为同一指标,复现时仍应分别报告。

哪些限制决定了结论不能走多远?

论文在讨论部分明确列出多项限制。第一是刺激集小,每种类型只有 4 个主题样本,单一合成嗓音、在线听音条件不受控、未控制先验主题知识,都限制推广性。第二是统计设计用单因素重复测量方差分析,没有把主题作为因子,无法用来源与主题的双因子设计分离语域效应与主题难度。第三也是最根本的,4 种条件没有共享语义内容,只是主题匹配,实际信息不同并可能与语域混杂。

未来工作可以把电台内容改写为书面语域版本,从而在内容相同的情况下分离语域效应。第四是刺激集多样性、合成系统多样性和可听性维度覆盖都不足,如何优化文本的语言属性以适应语音传递仍是开放问题,语音传递的信息远超文本信号本身。这些限制意味着当前发现应表述为报告和支持,而不是因果证明。相关性不是因果,缺失证据也不是技术错误。

未测量的误判率、延迟和成本不能承诺得到改善,训练资源、推理开销和实际延迟在本研究中也不适用,因为没有训练和部署比较。总体趋势不等于每组主题都成立,维度 1 上的大误差线已经提示主题间变异不可忽略。

要复述方法需要固定哪些动作和条件?

复现先做三件事。第一是固定材料构造,按原文主题清单收集 4 种来源,电台做随机抽取和人工截取,维基按主题收集简明与标准版本,大模型用原文提示思路生成并记录模型版本和调用日期,因为接口行为可能变化。第二是固定合成调用,记录接口名称、免费层版本、澳大利亚口音、主体男声设置、电台多说话人设置,以及为处理连写句插入停顿等最小人工调整,否则不同停顿会直接改变可听性。

第三是固定行为流程,使用在线问卷、随机化类型和主题顺序、1 到 100 滑动条、精简后问卷题目数、三道回忆选择题并随机选项顺序,同时记录年龄、性别和母语信息。分析侧需要保留可读性指标定义、依存解析工具、标注器版本和标准化修正选项,以及方差分析的球形检验、校正方法和多重比较校正。还需补做的验证包括内容控制版本,即同一语义内容的不同语域改写;主题作为因子的分析;更多合成器和更多嗓音。

更大更多样的刺激集;以及更广泛的可听性维度。关于可用性,原文脚注给出仓库链接,但本次没有收到可验证的资源可达证据,因此在写作中只能说作者声明存放位置,不能写当前可用或已公开。权重下载和系统可运行的区分在这里不适用,因为没有发布模型权重。

何时值得尝试用大模型文本做合成输入?

综合全文,何时值得尝试是有条件的。当应用需要按需生成说明性内容并用语音播报,且内容结构接近百科式叙事说明时,大模型文本在本研究的 4 个主题和单一合成设置下显示出与维基来源相当的可听性,可以作为候选输入。但当输入是多人谈话转写这类高卷入、高交互的口语记录时,直接合成可能让听者付出更高努力且记住更少,此时值得先做书面改写或口语化转换,而不是直接朗读。

复述时常见的误解是以为越像说话越好听,本文的证据恰恰相反,语域上最像说话的电台转写在合成后最不可听。另一个误解是把阅读年级低等同于听起来省力,本文显示简明维基在阅读上最易,但在听努力和回忆上并未显著优于标准维基。还有一个误解是把大模型数值最低的努力分数当成显著优势,原文的统计结论是三者之间无显著差异,数值排序不能当作胜负。

最终结论应保留原文的谨慎措辞,书面来源合成语音比会话转写合成语音更可听,书面来源内部的语域差异没有转化为可测量的可听性差异,大模型文本与维基文本表现相当,支持其作为合成输入的可行性,但语义混杂和样本规模意味着仍需内容控制的后续验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总