英文题目:Prosodic Markers in Mandarin Stand-Up Comedy: An Acoustic and Perceptual Study of Pauses

会议身份:conference:speechprosody:2026:conference-paper-id:zhong26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #韵律 #言语感知 #语音 #音频理解

评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Ruiyao Zhong:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究处理普通话单口喜剧中笑点前停顿是否为系统性时间标记及其能否提升幽默感知难题,输入为现场演出音频与重合成音频,输出为停顿分布差异与趣味度评分关系。方法先对约八十分钟职业演出语料做声学分析,按笑话内配对提取笑点前最终静音段与 setup 基线均值并排除笑声重叠,以检验产生端标记。接着经文本趣味与熟悉度筛选选出二十个陌生笑话,按对数感知设置二百至一千八百毫秒五档时长插入笑点边界并保持其他声学特征不变,交由五十名被试单次平衡呈现评分。相对英语业余讲笑话无标记结论与重音语言自由调动音高机制,本研究聚焦职业演员与声调约束,提出表演驱动的显性时间切分而非内容理解必需机制,有助于区分舞台结构需求与听众认知需求。在职业单口喜剧语料条件下,笑点前停顿的平均时长指标为634.50 ms,高于基线停顿的平均时长指标477.91 ms。感知端陌生试次混合模型显示停顿主效应不显著,表演偏好的六百毫秒附近时长并未带来评分优势,说明语义保留时时间微调作用受限。结论适用边界限于保留语义的叙事类文本笑话纯音频评分任务,尚未验证多模态现场互动及语速节奏协同变化下的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要回答的喜剧时间问题是什么?

这篇解读的输入是论文原文提供的两个实证研究,不引入外部喜剧理论和新的声学数据。目标是让刚进入语音、音乐或音频方向的研究生能够复述方法并核对关键数字。必须保留的信息包括研究对象是职业普通话脱口秀的笑点前停顿,比较基准是同一笑话铺垫内部的基线停顿,感知检验是只改变停顿时长的重合成音频评分。输出是按学习依赖展开的方法复述,不是效果宣传。

喜剧里常说时机决定一切,直觉是演员通过节奏和韵律塑造笑点。但对初学者来说,第一个要分清的概念是表演者的时间选择和听众的幽默感受是两件事。演员停得久,不等于听众因此觉得更好笑。本文恰好把这两件事拆成两个研究分别测量。第一个研究看产生端,第二个研究看感知端。

白话来说,铺垫就是讲故事打底的部分,让你形成一个顺理成章的预期。笑点英文叫 punchline,就是最后抖包袱的那一句,让你发现前面的理解要推翻重来。论文采用学界常用的两段式笑话观,铺垫建立前提,笑点制造不协调。这种划分的教学价值在于,它把连续演出切成了可标注的单位,后续所有停顿测量都挂在这个切分上。

铺垫 × 笑点: 铺垫负责建立叙事前提和听众预期,笑点负责在结尾处制造转折并迫使重新解释前文,二者搭配的理由是只有先形成稳定预期,转折才构成不协调,组合意义在于给停顿标注提供了明确结构位置:铺垫内部的停顿是结构基线,铺垫与笑点之间的最后一段静音才是待检验的标记。

本研究之所以选普通话脱口秀,还有语言层面的理由。英语是重音语言,音高和重音可以比较自由地标记句法和语用结构。普通话是声调语言,音高首先要区别字调,不能随意挪用。于是研究者提出,普通话说话人可能更依赖时间手段组织话语和标记重要边界。这就把笑点前停顿从舞台技巧变成了值得声学测量的韵律问题。

前人为什么吵起来:不标记与标记的两条路线

要理解本文的站位,需要先走一遍前人分歧。最早的系统检验来自皮克林等人对非职业讲笑话者的研究,结论是没有发现笑点前停顿更长或语速放慢,被称为无标记假设。这个结论挑战了时机决定一切的常识。随后多项研究支持了无标记观点,包括会话幽默、自然情境中的自发幽默,以及剧本电视剧和非剧本脱口秀节目。弗拉姆森等人还提出加密理论,认为在共享知识很高的熟人情境里,讲笑话的人不需要明显韵律提示,靠共同背景就能懂。

另一条路线报告了相反结果。希腊会话叙事和职业单口喜剧的研究都发现笑点前有系统性韵律标记,纳兹等人发现有经验的喜剧演员使用明显更长的停顿。这提示经验和职业情境可能是关键变量。业余课堂讲笑话和剧场面对大群陌生观众,对清晰度的要求完全不同。

本文作者从分歧中提炼出 3 个缺口。第一是经验因素,业余与职业的对比没有控制好。第二是表演场景,私人共享语境和大型剧场对时间线索的需求不同。第三是语言系统,以往结论多基于英语,对声调语言的检验很少。第四是产生与感知脱节,以往多只测产生,很少操纵停顿看感知变化。因此本文同时做产生端语料测量和感知端受控实验。

声调语言 × 时间线索: 声调语言指普通话中音高变化首先承担区别词义的词汇声调功能,不能自由地用于重音和语用标记,时间线索指通过静音时长、边界前 lengthening、语速和节奏组织话语结构,二者搭配的理由是当音高通道受限时,说话人更可能依赖时间通道标记重要边界,组合意义是把普通话脱口秀的笑点前停顿从一般喜剧技巧问题转化为受语言系统约束的韵律问题。

对初学者而言,相关工作的学习点不是记住谁对谁错,而是学会按同输入、同目标、同监督和同运行阶段做对照。课堂讲笑话、巴西农场的自发幽默、希腊日常叙事和职业剧场单口,在说话人经验、观众规模、共享知识和语言类型上都不一致,不能直接当成同条件胜负。本文的对照策略是固定语言为普通话,固定场景为职业剧场,再在内部拆分产生与感知。

问题如何形式化:要测的两个判断是什么?

本文把大问题拆成两个可检验的小问题。第一,职业演员是否系统性拉长笑点前停顿,相对于同一笑话铺垫内的基线停顿。第二,这种产生端的时间模式是否在感知端带来可测量的好笑度差异。这里的例子只是帮助理解:比如一个笑话铺垫里有 3 段短静音,平均四百多毫秒,而笑点前最后一段静音达到六百多毫秒,差值就是标记量。例子中的数字仅为示意,不作为证据。

形式化的关键是配对比较。每个笑话产生 1 对值,一个是笑点前停顿,一个是该笑话铺垫内其他停顿的均值。这样每个笑话是自己的对照,避免不同演员语速不同带来的混淆。感知端的形式化是单变量操纵,其他声学特征保持不变,只插入不同时长的静音,看好笑度评分是否变化。

论文还明确了边界条件。只研究大于 200 毫秒的静音区间,更短的不算停顿。只研究铺垫内至少包含一段大于 200 毫秒静音的笑话,否则无法计算基线。笑点必须是句末且紧后有观众大笑,并经人工核查排除非幽默互动。这些条件决定了结论的适用范围,也决定了复现时必须照做的筛选步骤。

方法全景:一个样本如何走完两条流水线?

先沿一个样本走完全程。假设截取某位演员连续 10 分钟演出中的一个笑话,标注流程先找到句末候选笑点,再检查其后是否有持续至少 2 秒的观众大笑,人工听辨确认后保留。从该笑话第一个音节起点到最后一段笑点前静音起点之间记为铺垫,笑点是紧后有大笑的句末片段。铺垫内所有大于 200 毫秒的静音取均值作为基线,最后一段静音作为笑点前停顿,得到 1 对时长值。

感知流水线则另起炉灶。先用文本评分筛选出陌生、低难度、中高好笑度的笑话文本,请 1 位普通话水平测试 1 级 2 级的女性母语者以中性语调录音,在铺垫结束与笑点开始之间标注边界,插入 5 种固定时长静音,生成仅停顿不同的 5 个版本。请听众在线戴耳机听音,每个笑话只听一种版本,对好笑度和熟悉度打分。

两条流水线共享笑话两段式定义,但数据来源不同。产生端用腾讯视频公开高质量录像,来自脱口秀和她的朋友们第二季 8 位操标准普通话的职业演员,男女各 4 人,每人连续约 10 分钟,每人取 8 个符合条件的笑话,共 64 个。感知端用重新录制的陌生笑话,避免观众对原演员风格和现场氛围的记忆干扰。

笑声 × 删除测试: 删除测试分工是从文本结构上定位笑点,即从结尾逐段删除直到幽默效果消失,笑声分工是从听众反应上定位成功幽默,即笑点后紧跟的观众大笑,二者搭配的理由是单一线索都可能误判,结构线索可能标出文本转折但现场没响,笑声可能来自互动而非转折,组合意义是本研究把句末候选与自动检测到的笑声交叉核对,只保留句末且紧后有大笑的片段作为笑点。

对初学者来说,全景的要点是可比性和概念清晰。产生端比较的是同一笑话内的两种停顿,感知端比较的是同一语义内容的 5 种停顿版本。两端都不比较不同笑话的好笑程度,因为文本内容差异太大。只有先固定内容,才能把时间的作用分离出来。

组件与计算:停顿和笑点是如何算出来的?

产生端的第一个组件是停顿检测。论文使用普拉特 6.4.26 版本中的音节核版本 3 脚本,基于强度峰检测、有声无声滤波、边界插值自动计算语速和发音时间。所有停顿边界、短语边界和静音区间直接取脚本输出,没有做人工时间调整。脚本被配置为只检测大于 200 毫秒的静音区间,笑话筛选也基于这个输出。这意味着 200 毫秒是硬阈值,不是事后划分。

第二个组件是笑声检测。流程是对每个录音生成强度、基频和谐波噪声比层级,以 100 毫秒窗口扫描,把强度高于负 20 分贝且谐波噪声比低于 10 分贝的连续窗口暂标为笑声,只保留最短持续 2 秒的候选,再对照波形、语图和回放人工剔除误报和背景噪声。这个 2 秒门限保证了只有成 burst 的观众大笑才算数,零星笑声不会触发笑点判定。

第 3 个组件是笑点判定。结构线索用霍克特的删除测试思想,从结尾逐段删除直到幽默消失,操作上体现为只看句末片段。反应线索用笑声位置,操作上要求句末片段紧后即出现观众大笑。论文还引用前人对 2000 个笑话的统计,92% 的笑点出现在文本末尾,支持以句末为主要候选。最终定义是句末且紧后有大笑的片段,全部人工检查语境适当性,排除互动寒暄。

基线停顿 × 笑点前停顿: 基线停顿分工是刻画同一笑话内部常规的句法和呼吸性断裂水平,取铺垫内除最后一段外所有大于 200 毫秒静音的均值,笑点前停顿分工是刻画临近转折点的那一段最终静音,二者搭配的理由是同一笑话内比较可以控制说话人语速和话题差异,组合意义是差值直接回答演员是否在笑点前做了额外的时间标记。

计算细节值得复述。每个笑话提取两个量,笑点前停顿是紧邻笑点的最后一段静音时长,基线停顿是同一笑话铺垫内其余静音的均值,不含最后一段。与观众笑声重叠的停顿被排除,避免把笑声能量误算成说话停顿。最终每个笑话贡献 1 对值,用于配对检验是否前者系统性更长。

本研究训练了什么:没有训练阶段时算了什么?

本研究没有训练神经网络,也没有更新任何模型参数,因此不存在优化器、梯度路径、参数冻结或早停等训练概念。必须明确说明这一点,避免把无训练误解为确定性求解。实际计算分为 3 类,全部是测量、筛选和统计推断。

第一类是信号处理计算。普拉特脚本完成音节核检测和静音边界输出,笑声脚本完成基于强度和谐波噪声比的扫描和 2 秒筛选,人工只做真伪核对,不改时间边界。录音部分做了峰值归一化保证响度一致,采样率 44.1 千赫,位深 16 比特,录制环境是安静实验室,朗读者语调要求中性。

第二类是文本筛选计算。30 名大学生在线对 30 个脱口秀笑话文本按 5 分制评价好笑度、熟悉度和理解难度,基于评分选出 20 个。筛选优先中高好笑度、低熟悉度、低理解难度、低评分方差,并对描述统计做标准化后计算综合分,综合分等于好笑度标准分减去 0.5 倍熟悉度标准分减去 0.3 倍难度标准分减去 0.3 倍好笑度标准差标准分,熟悉度大于 3.0 或难度大于 3.0 或好笑度标准差大于 1.3 的直接过滤,取综合分最高的 20 个。

第 3 类是统计建模计算。产生端用单尾配对 t 检验和按性别的单因素方差分析,感知端用以暂停水平为固定效应、被试和笑话为交叉随机截距的线性混合效应模型,加趋势分析和邦费罗尼校正的两两比较。这些都是推断工具,不是可部署的预测模型。

实验条件:数据、划分、采样与指标如何对齐?

产生端数据是 8 位职业演员每人约 10 分钟的连续表演片段,共约 80 分钟。每人从片段开头顺序选取满足笑点识别标准且铺垫内至少含一段大于 200 毫秒静音的前 8 个笑话,共 64 个笑话标记。说话人限定为标准普通话且地域口音可忽略,男女各 4 人,保证风格一致性和语境连贯。数据划分不是训练验证测试划分,而是每个笑话内部配对,不存在跨笑话聚合时的说话人混淆。

感知端材料是 20 个经文本筛选的陌生笑话,由同一位女性朗读者录制,每个笑话合成 5 个版本,共 100 条刺激。5 个暂停水平基于人类时长感知的对数特性设置,分别为 200 毫秒、350 毫秒、600 毫秒、1000 毫秒和 1800 毫秒。插入位置是标注好的铺垫结束与笑点开始之间,其他声学特征保持不变。采样上招募 50 名 18 至 35 岁大学生,其中女性 26 人,在线实验要求戴耳机在安静环境完成。每人听 20 个笑话的伪随机顺序,每个笑话只呈现 5 种条件中的一种,条件在被试间平衡,保证组水平上每个条件获得充足且均衡的评分。

指标方面,产生端指标是停顿时长毫秒数,聚合对象是笑话内配对差值。感知端指标是 7 分制好笑度和熟悉度评分,分析时只保留自报完全陌生即熟悉度等于 1 的试次,共 815 个有效观测,避免熟悉笑话的记忆效应。统计方法已在上一节说明,显著性方向是产生端预期笑点前更长故用单尾检验,感知端检验暂停主效应及线性和 2 次趋势。硬件预算原文未报告,不能推定录音和在线听音的设备延迟一致,复现时应记录耳机类型和环境噪声。

产生端结果:笑点前停顿是否系统性拉长?

产生端要回答的比较问题是,在同一笑话内控制说话人和内容后,笑点前最后一段静音是否长于铺垫内其他静音的均值。公平条件是同一笑话配对、同一 200 毫秒阈值、同一自动边界无人工调整、排除与笑声重叠的停顿。指标方向是时长越长视为标记越强。

下表整理产生端的关键数字,单位保留原文毫秒写法,检验量保留原文精度。表前提出的问题是职业演员是否存在可重复的时间标记,表后将解释效应大小与性别一致性。

条件均值标准差平均长出配对检验
笑点前停顿634.50 ms337.25 ms157 mst(63) = 3.73, p < .001, d = 0.47
铺垫基线停顿477.91 ms185.24 ms——

表后解释如下。配对 t 检验显示笑点前停顿显著长于基线,平均长出约 157 毫秒,效应量 d 为 0.47,属于中等偏小但稳定的差异。按笑话内差值做的单因素方差分析显示性别无影响,F 值为 0.003,p 为 0.96,说明男女演员的标记策略一致。未胜出项在这里是基线停顿,它代表常规结构停顿,没有在笑点前获得额外拉长。限制是该结论只覆盖铺垫内至少含一段有效停顿的笑话,没有停顿的笑话不在检验范围内。

为帮助核对分布形态,请先看下面官方原图的前导读。该图横轴只有 2 个条件,纵轴是停顿时长,箱体与散点叠加显示集中趋势与离散程度,右侧是否整体上移是判断标记是否系统性的直观依据。

看图路径: 1. 先确认横轴只有两个条件:左侧基线停顿与右侧笑点前停顿;2. 再比较两组箱体中线高度与箱体上下范围,判断哪组更高更散;3. 最后看叠加的散点分布,确认右侧高值点更多且整体上移而非个别离群造成

原论文 Figure 1:Comparison of baseline structural pauses

论文图 1。原论文 Figure 1:“Comparison of baseline structural pauses”。

该图显示左侧基线停顿箱体较矮且中线较低,散点集中在 400 毫秒附近,右侧笑点前停顿箱体明显更高更宽,中线约在 650 毫秒附近,高值散点延伸到 1500 毫秒以上。像素可辨的是右侧分布更分散,说明拉长是总体趋势但个体差异大,与标准差 337 毫秒大于 185 毫秒一致。不能从该图读出精确均值,精确值以正文报告为准,也不能把最上方个别点当成典型值。

产生 × 感知: 产生分工是记录职业演员在剧场情境下实际做出的时间选择,感知分工是检验受控听音条件下听众好笑度是否随该时间选择变化,二者搭配的理由是只有两端用可对齐的停顿时长标尺才能判断标记是否有效,组合意义是形成产生与感知是否分离的判断,而不是只看一端就下结论。

感知端反证:换停顿长度好笑度会变吗?

感知端要回答的比较问题是,当语义内容完全保留而只改变笑点前静音时长时,听众好笑度评分是否变化。公平条件是同一朗读者、同一中性语调、同一响度归一化、同一插入边界,其他声学特征不变,只有时长取 5 个水平。指标方向是评分越高表示觉得越好笑。

下表整理感知操纵与评分结果,时长与评分数字保留原文写法,统计结论保留原文检验值。表前的问题是产生端最常用的时长是否在感知端对应更高评分,表后将解释为何数值下降但统计不显著。

条件暂停时长平均好笑评分整体检验两两比较
Level 1 基线短暂停200 ms3.22F(4, 747) = 1.86, p = .12p > .87
Level 5 最长暂停1800 ms2.95F(4, 747) = 1.86, p = .12p > .87

表后解释如下。描述统计上评分随暂停拉长略降,从 Level 1 的 3.22 降到 Level 5 的 2.95,但线性混合效应模型显示暂停主效应不显著。以 Level 1 为参照,其余延长条件均未显著改变评分,2 次趋势不显著,拒绝中等时长最优的假设,线性趋势仅边缘且为负向。邦费罗尼校正的两两比较确认任意两水平间均无显著差异。未胜出项是所有延长条件,它们都没有带来感知优势。人口学探索显示性别和观看频率无交互,年龄主效应显著但不与暂停趋势交互,说明不敏感性跨人群成立。

为核对产生与感知是否脱节,请先看下面第二张官方原图的前导读。该图横轴是停顿时长毫秒,蓝色面积是产生端分布,粉色折线带误差棒是感知评分,关键是看分布峰值处是否有评分峰值与之对应。

看图路径: 1. 先沿横轴找到五个操纵点 200、350、600、1000、1800 毫秒;2. 再看蓝色面积表示的产生端分布峰值集中在 600 至 800 毫秒附近;3. 最后看粉色折线与误差棒表示的感知评分,检查峰值处是否出现对应的评分高峰

原论文 Figure 2:Comparison of pre-punchline pause

论文图 2。原论文 Figure 2:“Comparison of pre-punchline pause”。

该图显示蓝色分布在 600 至 800 毫秒附近形成明显主峰,这正是产生端最常用的范围,但粉色评分折线在该处反而处于低谷附近,5 个操纵点的评分大体持平且误差棒重叠较多。从 200 毫秒到 1800 毫秒没有出现随分布峰值升高的评分峰,支持感知中立的判断。像素不能精确读出纵轴评分刻度,精确均值以正文的 3.22 与 2.95 为准,不能把折线斜率直接解读为显著下降。

边界与缺项:哪些结论不能推广?

论文直接报告的是产生端存在时间标记而感知端单线索操纵无效应,这是有配对检验和混合模型支持的。有限解释是作者认为该脱节源于多线索依赖和现场表演需求,职业演员的停顿原本与边界前 lengthening、基频重置、强度变化以及表情、手势、 gaze 等多模态线索协同工作,实验室只操纵静音时长等于剥离了协同线索,因此单看静音时长不显著是可解释的。这部分属于支持性讨论,不是直接检验。

未验证推测是时机格言更多反映表演风格而非听众理解的必要认知约束,以及内容驱动的观点,即一旦语义不协调被理解,细微时间差异作用有限。这些表述在原文用可能和待验证语气出现,不能当成因果结论。相关性不等于因果,产生端更长不证明更长导致更好笑。

明确缺项有助于复现。原文未报告语速和节奏模式的协同操纵,未测量误判率、延迟和计算成本,未提供代码、模型或数据的公开链接,本次收到的资源状态也没有绑定可验证的开源声明,因此不得声称材料已公开。训练资源、推理开销和输出帧率不适用于本研究,在线听音的设备差异也未控制。总体趋势不等于每组都成立,产生端标准差很大,说明部分笑话的标记很弱,感知端边缘负向趋势也不能推广为长停顿必然有害。

复现先做什么:按原文重走一遍的清单

复现产生端先准备 8 位标准普通话职业演员的连续表演视频,每人截取约 10 分钟的单场连续片段以保证风格一致。从每段开头顺序筛选,保留句末且紧后有观众大笑的笑话,要求铺垫内至少含一段大于 200 毫秒的静音,凑满每人 8 个共 64 个即停止,不做笑话质量主观评价。用普拉特 6.4.26 和音节核版本 3 脚本直接输出停顿边界,不做人工时间修改。用强度高于负 20 分贝且谐波噪声比低于 10 分贝的 100 毫秒窗口扫描笑声,只保留最短 2 秒的候选,再对照波形语图和回放人工剔除误报。排除与笑声重叠的停顿后,计算每笑话的 1 对值并做单尾配对 t 检验,复核均值 634.50 毫秒与 477.91 毫秒附近的差值方向。

复现感知端先招募 30 名大学生对 30 个笑话文本做 5 分制好笑度、熟悉度和难度评分,按综合分公式筛选出 20 个,要求熟悉度不高于 3.0、难度不高于 3.0、好笑度标准差不高于 1.3。请 1 位普通话水平测试 1 级 2 级的女性母语者在安静实验室以中性语调录音,做峰值归一化,保持 44.1 千赫 16 比特。在普拉特中标注铺垫结束与笑点开始之间,插入 200、350、600、1000、1800 毫秒 5 种静音,生成 100 条仅停顿不同的刺激。招募 50 名 18 至 35 岁听众在线戴耳机听音,每人听 20 个笑话且每个笑话只听一种条件,条件跨被试平衡,用 7 分制评价好笑度和熟悉度,只分析熟悉度等于 1 的试次并拟合被试与笑话交叉随机截距的混合模型。

还需补的验证包括同步操纵语速和边界前 lengthening 的多线索实验,加入视频和手势的多模态条件,以及覆盖无停顿笑话和不同性别朗读者的泛化检验。记录耳机型号、环境噪声和试次剔除率,才能判断在线评分的稳定性。

收束:何时值得尝试这种时间标记?

综合两端,值得记住的判断是职业普通话脱口秀确实用拉长笑点前停顿来切分叙事并提示转折,但在语义保留的纯音频听音任务里,单改这一段静音时长不改变好笑度。这不是说时机不重要,而是说时机在现场是多线索协同的包装,拆成单线索后听众主要依赖内容理解。

何时值得尝试,取决于你的任务阶段。如果你做语音合成或表演性朗读,需要在剧场风格下组织边界,参考 600 毫秒附近的常用范围并搭配语速、重音和停顿的协同设计是合理的。如果你做幽默理解或好笑度预测,优先保证文本的不协调结构清晰可懂,单调停顿时长大概率不是主要特征,不应承诺靠调停顿就能提升误判率或延迟。

对初学者的误解要澄清三点。第一,无标记与有标记之争不是谁的方法错,而是业余课堂、日常叙事和职业剧场本就不同,语言类型也不同。第二,平均长 157 毫秒不等于每个笑话都长这么多,分布很散,复现时要看配对差值而非单点。第三,感知无显著差异不等于证明停顿无用,只是证明在当前音频单线索、陌生文本、中性朗读条件下,200 至 1800 毫秒范围内的差异没有带来可测的评分优势。下一步最有信息量的工作是补上多线索和多模态的对照,而不是在单静音时长上继续细分。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 18 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总