英文题目:Dynamic Prosodic Grouping—Evidence from Recitation of Classical Chinese Poetry
会议身份:
conference:speechprosody:2026:conference-paper-id:zhang26c_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Jiangxin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuyin Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究以汉语古典格律诗整首对句朗诵音频为输入,以每音节边界强度估计与韵律分组结构推断为输出,难点在于缺乏重音的汉语中音步边界本就没有公认声学标记,而传统理论又预设了稳定的二分层级。先以四十名被试对五言与七言对句在三种朗诵风格下的三次重复录音为输入,负责采集共两千余条语音并用ProsodyPro切分标注,输出每音节时长数据。再以输出的音节时长为输入,负责按当前音节时长除以前一音节时长计算音节时长比,输出SDR边界强度估计。最后以输出的SDR为因变量输入,负责拟合以诗行、风格和音节位置为固定效应且被试为随机截距的线性混合效应模型,输出不同位置与风格下的边界差异比较。在五言与七言对句朗读语料下,五言行第二音节的平均SDR指标为超过1.8,高于七言行第二音节的平均SDR指标1.0。与静态韵律层级理论的关键机制差异在于分组被视为语速与句长动态博弈的结果而非句法直接投射,因此慢速诗体中的二加三分组可在日常语速下合并为整体。该结论适用边界仅限于熟悉格律诗的普通话朗读语料,尚未验证自发对话与其他方言的外推性。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
要解决的矛盾是什么:诗句切分是死的还是活的?
这篇论文面对的是语音韵律研究中的一个基础分歧。传统韵律层级理论认为,说话内容一旦从句法和词法映射到语音,就得到音节、音步、韵律词、音系短语、语调短语这样逐层包含的固定单位,分组不再变化。初学者容易把这种层级想象成切蛋糕,事先画好线,朗读只是照线切开。作者要检验的恰恰是这条线会不会动。
白话来说,韵律分组指听者感觉到的说话中的一顿一顿,英文为 prosodic grouping;边界强度指这一顿有多明显,英文为 boundary strength。论文用时长来估计它:如果某个字比前一个字明显拖长,就认为这里更像一个组的结尾。如果分组真是静态层级投射的,那么同一首诗无论读得诗意还是随意,同一位置都应出现同样的拖长。
作者特意挑选了一个按理最稳定的检验场:格律诗。五言和七言在文献中被描述为高度规范的 2+3 和 2+2+3 结构,学生从小背诵,字数、停顿似乎早已固定。如果连这里的边界都会随读法消失或合并,那么日常口语中那些从句法推导出的音步和韵律词就更难说是固定不变的。这就是全文的学习目标:用可复述的时长测量,判断分组是静态投射还是多因素动态决定。
韵律层级 × 动态分组: 韵律层级指从音节、音步、韵律词到语调短语的固定多层划分,负责把句法形态结构直接映射为不变的语音分组;动态分组指同一串音节的切分位置和组块大小会随语速和句长改变,负责解释为何边界时有时无。本研究用后者搭配前者:先按层级理论写出五言应为 2+3、七言应为 2+2+3 的预测,再看时长证据是否在不同风格下守住这些切分,组合的意义是把层级当作待检验的零假设而不是默认事实。
本解读的输入是论文正文提供的文字证据和官方原图像素,目标是让研究生能复述被试、材料、指标、统计和关键对照,不做超出证据的效果承诺。必须保留的信息包括 3 种朗诵风格的操作定义、音节时长比的计算方向、五言第二字和七言第四字这两个关键边界位,以及行长效应的比较。输出按学习依赖展开,先讲路线与方法全景,再讲组件计算与实验条件,最后讲结果与复现边界。
已有路线如何从诗脚走到中文自然音步?
论文第一部分梳理了音步概念的迁移史。白话来说,音步英文为 foot,最早是古希腊音乐和诗律中的节奏步,莎士比亚十四行诗中的轻重交替就是典型例子。二十世纪后雅各布森主张诗律与自然语言节奏连续,海斯进一步把音步与可感知的重音和时长联系起来,形成格律重音理论。读者需要先理解这条路线:从文学节拍到语言学节拍,音步始终承担切分节奏单位的分工。
中文研究沿用了这套词汇。朱光潜把西方的 foot 比作顿,王力提出诗行、音步和韵的 3 层结构,陈麦可用二叉格律树分析格律诗,段茂利用莫拉和音节扬抑格解释重音分布,冯胜利提出自然音步为双音节、三音节构成超音步。论文指出,这条路线虽然术语完整,但音步和超音步的边界缺乏公认的语音标记,尤其在没有词重音的中文里,哪里是脚的结尾更多依靠直觉和个例。
音步 × 顿拍: 音步是西方诗律和音系学中承担节奏单位的分工,指由轻重对立构成的双音节或多音节节律块;顿拍是朱光潜等人引入中文后对应的概念,负责描写中文朗诵中可感知的停顿节拍。二者搭配的理由是都想用双音节为基本节拍解释五言和七言的内部切分,组合后形成中文自然音步为双音节、三音节为超音步的说法,本研究正是检验这种双音节默认组在声学上是否成立。
另一条路线是声学边界线索。论文总结了 3 类证据:组末延长指组末音节或词拉长;静音停顿常出现在较大边界并与延长叠加;组内缩短指组中间音节被压缩。近年陈和夏用语料研究发现,大量多音节词本身并不显示末端延长,而是与后词合并成更大组才出现延长。
杨等人用音节时长比研究三声变调的边界阈值,发现语速变慢和句子变长都会提高边界强度从而阻碍变调。这些工作共同提出疑问:话语是否真的被切成整齐固定的音步和韵律词。论文把古典诗歌朗诵作为对立检验:如果固定切分连诗歌都解释不了,静态层级假设就需要修正。
具体检验什么预测:2+3 和 2+2+3 守得住吗?
论文把理论预测写得非常具体,便于证伪。按冯胜利的说法,规范五言行为 2+3 结构,规范七言行为 2+2+3 结构;按陈麦可的二叉音步框架,每行必须由两个韵律脚组成,每脚典型为两音节。换成联为单位,一副五言对联就是两个五字大组,每组内第二字后应有组边界;一副七言对联就是两个七字大组,每组内第二字后为小边界、第四字后为大边界。
作者提出的替代假设是分组不固定而随朗诵风格相关语速变化。直白版本是:五言会从诗体的 2+3 变为日常口语中整体的 5,七言会从 2+2+3 变为 4+3。注意这不是猜测情绪表达,而是操作化的时长预测:在诗体中最慢的读法下第二字和第四字应出现高时长比,在日常口语中最快的读法下这些高比值应大幅减弱乃至消失,相邻小组因此合并。
检验逻辑分 3 步。第一步验证指标有效:无论哪种风格,逗号前和对联末尾整句末都应显示高边界,因为这是无争议的大边界。第二步验证诗体下理论边界存在:五言第二字和七言第四字在慢速风格中应显著高于同行其他位置。第 3 步看日常风格下这些边界是否消失,以及七言第二字是否从一开始就没有清晰边界。只有 3 步都报告,才能区分指标失效、理论部分成立和动态合并 3 种可能。
方法全景:从一副对联到边界强度曲线要走哪些步骤?
跟着一副五言对联走完全流程最容易理解。输入是印在纸上的两行诗,例如床前明月光配疑是地上霜,共 10 个字。同一位被试要把这副对联读三遍风格:风格 a 为诗体朗诵,不夸张但允许短语间停顿;风格 b 为中间体,清晰但连续无停顿;风格 c 为日常口语,也无停顿。每种风格重复 3 次,全部被试和全部对联合在一起共得到 2160 个话语用于分析,这个总数来自 6 副对联乘 3 种风格乘 3 次重复乘 40 人。
表示阶段是人工标注。所有录音用 ProsodyPro 工具在 TextGrid 中逐字切分音节边界,软件自动保存每个音节的时长值。组件阶段计算边界强度:对联中从第二个字开始,每个字的时长除以前一个字的时长,得到音节时长比,英文为 Syllable Duration Ratio,缩写为 SDR。比值大于 1 表示当前字比前字长,提示可能是组结尾;接近或小于 1 表示无延长甚至压缩。
目标与输出是位置曲线和统计比较。把同一位置上所有被试、所有诗行和重复的 SDR 取平均,画出随音节位置变化的曲线,误差条为 95% 置信区间。再用线性混合效应模型,以 SDR 为因变量,诗行、重复、风格、音节位置及其交互为固定效应,被试为随机截距,对五言和七言分别建模,并用 emmeans 做各位置上风格两两比较,辅以科恩 d 效应量判断实际重要性。最终输出回答两个问题:关键位置的峰是否存在,以及峰高是否随风格和行长系统变化。
核心组件如何计算:时长比量的是什么、怕什么?
音节时长比的计算方向必须记准:分子是当前音节时长,分母是前一音节时长。沿样本走一遍:读到明字时,用明的时长除以床前中的前字时长;读到月字时,用月的时长除以明的时长,以此类推。对联首字没有前字,不计算比值。论文明确指出,由于使用真实古诗,音节固有结构差异没有控制,例如不同声韵母本身长短不一,解决办法是不直接比较不同位置的绝对比值,只比较同一位置跨风格的变化。这样语速和结构偏置在同一位置上大致相同,风格差异更可信。
末音节延长 × 音节时长比: 末音节延长负责提供边界的生理声学表现,指组末音节时长被拉长并常伴随静音停顿;音节时长比负责把这种表现量化为可比较的指标,用当前音节时长除以前一音节时长得到边界强度。二者搭配是因为只看绝对时长会混入音节固有长短和语速快慢,而比值能突出局部拉长与压缩的对比,组合后即使跨风格语速不同也能比较边界是增强还是消失。
组内缩短与边界合并的配合需要单独理解。假如五言真是 2+3,那么第二字应拉长,第三字作为新组开头相对较短,比值在第二字处形成峰、在第三字处回落。如果日常口语中第二字不再拉长而第三字也不再压缩,峰谷差消失,就判定为前两字小组并入后三字大组。论文还提醒,SDR 在本研究中结合了音节时长和可选的后音节静音,因为风格 a 允许停顿,停顿会计入分母或分子的延续效应,从而推高大边界处的比值,这正是逗号和句号处高比值的来源之一。
组内缩短 × 边界合并: 组内缩短指位于组中间的音节时长被压缩,负责从组内部反衬边界的存在;边界合并指原来独立的小组失去末端延长而并入后一组形成更大组块,负责解释为何边界强度会整体下移。二者搭配的理由是只看边界峰会忽略谷底变化,而同时观察中间音节是否被压短才能确认是真合并还是测量噪声,组合意义是把 2+3 变为整体 5 这类变化表述为可验证的时长重分布。
复述时要注意该指标的适用条件。它假设延长主要出现在组末且可被局部比值捕捉,对诗体中夸张的拖腔和停顿敏感,但对音高、音强等其他边界线索不作建模。论文没有给出公式的编号展示式,也没有报告停顿段的具体切分阈值,复现时只能按 ProsodyPro 默认的音节切分加人工校对来执行,并在同一位置内做风格比较,不做跨位置绝对排序。
本研究训练了什么模型:无训练时真实计算是什么?
本研究没有训练任何神经网络模型,也没有更新或冻结模型参数,不存在梯度路径、损失函数、优化器和早停等概念。把无训练等同于确定性求解是误解:这里的计算是声学测量加统计推断,每一步仍有人工判断和抽样变异。
朗诵风格 × 言语速率: 朗诵风格负责给出操作定义,指本研究设定的 3 级读法:允许短语间停顿的诗体、连续清晰的中间体和无停顿的日常口语;言语速率负责给出可测量的操纵检验,用平均音节时长从风格 a 到风格 c 是否递减来确认风格确实改变了快慢。二者搭配是因为风格是指令概念而速率是声学后果,只有速率随风格单调变化才能把边界变化归因于快慢而非随意发挥。
真实计算过程分 4 段。第一段是录音采集:40 名 18 到 25 岁大陆长大、无言语听力障碍、精通普通话的母语者,男女各 20 人,在安静环境用个人设备按指令录音,保证风格操纵来自同一批说话人。第二段是标注与时长提取:人工在 TextGrid 中切分每个汉字音节,ProsodyPro 自动保存时长,这是唯一的原始测量。第三段是派生指标:逐字计算当前除以前一的比值,得到每个位置的边界强度。第 4 段是统计建模:对五言和七言分别拟合线性混合效应模型,固定效应包括诗行、重复、风格、位置及交互,随机效应为被试截距,再做风格两两事后比较并报告科恩 d。
论文未报告的内容要明确指出缺项:没有报告标注者一致性、切分边界的具体声学准则、异常时长值的剔除规则,也没有报告模型的随机斜率或方差成分。这些缺项不否定结果,但复现时需要自行记录并报告,否则他人无法判断峰高差异中有多少来自切分习惯。
实验条件如何保证可比:材料、风格与语速证据是什么?
材料是六副耳熟能详的格律诗对联,包括四副五言和两副七言。论文表格列出原文、英译和逐字 gloss,例如床前明月光对应 Bed front bright moon light,深林人不知对应 Deep forest person NEG know,岱宗夫如何对应 Mount Tai EXCL how,两岸猿声啼不住对应 Both bank ape sound cry NEG stop,朝辞白帝彩云间对应 Morning leave Baidi colored cloud between。选用熟诗的理由是减少认读困难,让风格差异主要反映韵律处理而非识字迟疑,但这也带来局限:被试可能带有记忆中的吟诵调,诗体风格可能被强化。
3 种风格的指令差异要准确复述。风格 a 允许短语间停顿,风格 b 和风格 c 都不允许停顿,区别在于风格 b 要求清晰连续,风格 c 要求自然日常。所有被试都完成全部对联在全部风格下的 3 次重复,因此风格比较是被试内设计,个体基线语速差异被随机截距吸收。录音设备为个人设备而非统一实验室话筒,环境仅描述为安静,这意味着绝对音质和底噪不完全一致,但同一被试内跨风格比较仍成立。
语速操纵是否成功由平均音节时长验证。论文报告的趋势是风格 a 到风格 c 逐级递减,表明语速逐级递增,这是把风格效应解释为速率效应的关键证据。下表完整引用原表矩阵,提出的问题是:在控制行长后,风格是否确实改变了平均时长,以及五言和七言的基线时长是否不同。指标方向是平均秒数越小表示语速越快,公平条件是同一样本量结构下比较,同为五言 480 个样本或七言 240 个样本。
| Line length | Sample size | Average (s) | sd_sec |
|---|---|---|---|
| a 5-char. | 480 | 0.423 | 0.074 |
| b | 480 | 0.317 | 0.057 |
| c | 480 | 0.239 | 0.037 |
| a 7-char. | 240 | 0.385 | 0.065 |
| b 7-char. | 240 | 0.300 | 0.054 |
| c 7-char. | 240 | 0.230 | 0.035 |
该表显示五言风格 a 平均 0.423 秒、风格 b 平均 0.317 秒、风格 c 平均 0.239 秒,七言风格 a 平均 0.385 秒、风格 b 平均 0.300 秒、风格 c 平均 0.230 秒。解释时要注意两点代价与边界:一是七言在风格 a 下反而比五言略快,说明行长本身也影响语速,不能把风格 a 的七言直接等同于最慢条件;二是标准差在慢速下更大,表明诗体拖长个体差异大,日常口语更集中。未胜出项是论文没有报告分被试语速分布和停顿时长占比,因此无法区分加速中有多少来自压缩音节本身、有多少来自删除停顿,复现时应补充统计静音段。
主结果是什么:哪些峰守住了、哪些峰消失了?
五言对联的位置曲线显示 3 层事实。第一,所有 3 种风格在第 5 字和第 10 字处都有较高边界强度,这对应逗号和句号位置,验证了指标能抓住无争议大边界。第二,风格 a 在第 2 字和第 7 字处出现最强边界,平均比值超过 1.8,风格 b 在同样位置也超过 1.2,表明诗体和中间体下 2+3 切分存在。第三,风格 c 在除逗号句号外的所有位置比值处于或低于 1.0,意味着第二字后的边界基本消失,五字连为整体。统计上由于样本大几乎所有比较都达到显著,论文转而用科恩 d 聚焦大效应,第 2 字和第 7 字显示极大的正效应量,而多数其他位置为负值,反映从风格 a 到风格 c 边界线索整体减弱。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 5 | 2 | +3 | 7;+2;4;1;2.1 |
| 来源句二 | 1.2 | — | — | — |
| 来源句三 | 1.2 | 1 | 2 | 3 |
| 来源句五 | 1 | 5 | 7 | — |
七言对联的位置曲线提供了更 surprising 的对照。所有风格在第 7 字和第 14 字行末处较高,风格 a 和风格 b 在第 4 字和第 11 字处最高,风格 b 也在这两处隆起,而风格 c 除第 7 字和第 14 字外分布平坦。这支持 4+3 中的大边界在诗体下存在,但关键反例是第二字处从未出现清晰边界,即使在最慢的风格 a 下也是如此。换句话说,理论预测的 2+2+3 中的首个双字边界没有声学支持,初始双字组直接与后双字组合成四字大组。
读五言效应量图时要先建立坐标意识。该图横轴为对联中音节位置 2 到 10,纵轴为效应量,3 种颜色分别对应 a 对 b、a 对 c、b 对 c,纹理深浅表示显著性水平。正值表示前者边界更强,负值表示整体减弱。
看图路径: 1. 先找到横轴音节位置 2 和 7 处的三根柱子,比较红色黄色蓝色高度差异;2. 再看位置 3 到 6 和 8 到 10 处柱子是否翻到零线以下,确认整体下移;3. 对照图例中 a 对 b、a 对 c、b 对 c 的颜色与显著性纹理,确认大效应只集中在边界位
论文图 4。原论文 Figure 4:“p and d values of 5-syllable lines in cou- plets. The shading depth of the bars indicates the sig-”。
该图显示位置 2 和位置 7 处三根柱子高高向上,其中 a 对 c 最高,位置 3 到 10 处多为向下的小柱,说明大效应只集中在理论边界位,其他位置随语速加快而减弱。未胜出项是位置 6 附近效应接近零,表明该处本来就不是边界,风格变化也不产生差异,这反而增强了位置 2 和 7 的特异性。读七言平均边界图时同样先看峰位而非绝对高度。
看图路径: 1. 沿横轴 2 到 14 逐点跟踪红蓝绿三条折线,记下峰值出现在哪些位置;2. 比较位置 4 和 11 处红线与绿线的垂直距离,判断风格差异大小;3. 观察位置 2 处三线是否基本贴合在 1.0 附近,与位置 4 形成对照
论文图 1。原论文 Figure 1:“Average SDRs in seven-syllable lines in cou-”。
该像素图显示红蓝绿 3 条折线在位置 4 和 11 处形成尖峰,红线最高超过 2.0,蓝线约 1.5,绿线仅略高于 1.0;在位置 7 处三线汇合于约 1.8 附近,确认为行末大边界;在位置 2 处三线均贴近 1.0 无峰,直接对应首个双字边界缺失的判断。误差条为 95% 置信区间,红线在峰顶的误差条仍远高于绿线,表明差异不是抽样噪声。
反证与行长效应:七言为何连最慢也立不起首个双字脚?
把行长作为对照是本研究最有教学价值的消融式比较。这里的消融不是去掉模型模块,而是比较五言第二字与七言第二字在同样风格下的边界强度。如果双字脚是默认基本单位,那么只要语速足够慢,任何位置的双字都应独立成组,七言第二字也应出现峰。事实相反:在风格 a 下五言第二字平均比值超过 1.8,而七言第二字仅略超 1.0;风格 a 和 b 在五言的值均高于七言,差异在风格 a 最突出。论文还指出,七言风格 a 的平均音节时长远长于五言风格 c,而后者已发生合并,前者仍无首边界,说明不是不够慢,而是结构条件不满足。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 1 | 2 | +3 | — |
| 来源句二 | 1 | 2 | +3 | — |
| 来源句三 | 1.0 | 1 | — | — |
| 来源句四 | 1 | 2 | +3 | — |
| 来源句五 | 0.05 | 7 | — | — |
该表的主要收益是区分两种消失:五言第二字是从有到无的动态合并,七言第二字是从未出现过的结构缺席。代价是论文只用了两副七言对联,样本量为五言的一半,首边界缺席是否适用于所有七言句式仍待验证。未评测边界包括不同七言句法切分是否会改变首边界,例如主谓结构与偏正结构是否不同,原文未分组报告。
七言风格比较的显著性描述需要单独核对。原文指出位置 4 和 11 的风格差异高度显著,全部比较达到 p 小于 0.001 并伴随极大正效应量,风格 a 远高于风格 b 和 c。
看图路径: 1. 先确认该图只显示文字描述而无完整柱状像素,阅读位置 4 和 11 的显著性陈述;2. 比较 a 对 b、a 对 c、b 对 c 三组比较是否都在这两处达到报告阈值;3. 注意效应方向为正且很大,说明风格 a 的边界强度远高于其他两组
论文图 3。原论文 Figure 3:“p and d values of 7-syllable lines in couplets.”。
该图在本次收到的像素中只保留了文字描述部分,未显示完整柱状细节,因此只能归因引用正文结论,不能猜测各柱高度或颜色映射。可以确认的是大效应集中在第 4 字和第 11 字,与平均曲线图的峰位相互印证,而第 2 字处没有对应大效应,这与七言首双字不独立的判断一致。把平均曲线与显著性描述结合,才能避免把末步结果推广为全程成立的错误:行末边界始终成立,行内大边界仅在慢速成立,行内小边界从不成立。
哪些结论不能推:样本、标注与指标的边界在哪里?
首先是材料与人群边界。被试为 40 名 18 到 25 岁大陆普通话母语者,高度熟悉这些名篇,年龄和地域高度集中,不能推广到方言区、儿童、老年人或不熟悉古诗者。材料仅六副对联,四五言两七言,且均为传统格律整齐句式,未覆盖拗句、长短句或现代朗诵流派。七言样本量减半,首边界缺席的结论统计效力弱于五言合并结论。
其次是指标与控制边界。音节固有结构差异未控制,只做同位置跨风格比较是合理的补救,但这意味着不能直接比较第 2 字与第 4 字的绝对高低来争论哪个边界更大,只能说各自位置上风格引起了多大变化。风格 a 允许停顿而另两种不允许,停顿对 SDR 的贡献未单独量化,加速效应中压缩与删停顿各占多少未知。音高、音强、音质等线索未建模,不能断言日常口语中听感上完全无切分,只能说时长标记消失。
最后是理论表述边界。论文用报告显示慢速下五言 2+3 和七言 4+3 存在,用支持表达动态分组假说,用可能待验证表达双字脚仅在特定条件成立的推测。相关性不等于因果:语速与边界共变不能证明语速单因驱动,行长、句法、记忆韵律都可能参与。未测量误判率、延迟和成本,不承诺任何应用收益。复现时若发现七言第二字在某些句式出现小峰,不应视为推翻全文,而应按原文建议检查句子结构是否允许其与后三字强组分离,以及语速是否低至每秒 3.2 音节左右的诗体水平。
要复现这项研究先做什么:最小可运行步骤是什么?
先准备材料与指令。选用同样的六副对联或另外挑选字数相同、知名度相当的五言四副和七言两副,记录简繁、标点和 gloss,保证逗号在行末。招募普通话母语者,记录年龄、性别、籍贯和古诗熟悉度。录音指令逐字复述:风格 a 为诗体不夸张但允许短语间停顿,风格 b 为清晰连续无停顿,风格 c 为自然日常无停顿。每人每副对联每种风格读 3 次,顺序平衡以抵消疲劳效应,在安静环境用同一话筒和采样率录音,保留原始 wav。
再做标注与计算。用 ProsodyPro 或 Praat 在 TextGrid 中逐字切分音节,统一停顿是否计入音节时长的规则并记录。导出时长后从每行第二字起计算当前除以前一的比值,得到每个话语的位置序列。按风格和行长分组,计算各位置均值与 95% 置信区间,画出与论文同横轴的曲线。统计用线性混合效应模型,五言七言分开拟合,固定效应为诗行、重复、风格、位置及交互,随机截距为被试,用 emmeans 做各位置风格两两比较并计算科恩 d。
先检验操纵与指标:平均音节时长是否从风格 a 到 c 递减,逗号前和对联末是否在所有风格下仍为高点。若这两项不成立,先检查切分和停顿处理,不急于解释理论边界。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码模型或数据已公开,复现需自行实现上述标注与统计流程。
何时值得借用这个结论:给研究生的行动建议是什么?
当你的研究涉及中文韵律切分、停顿预测或诗歌语音合成时,这个结论值得借用:不要把双字组当作任何语速下都存在的默认块。慢速诗体中五言第二字后的边界可以作为双字脚存在的证据,日常语速下应将其合并为整体五字组;七言应优先假设为 4+3 而非 2+2+3,首个双字不单独建模,除非你有证据表明特定句式和极慢语速下它能分离。做韵律标注时,建议分语速设立两套切分指南,而不是一套层级切到底。
常见误解需要澄清。第一,曲线向下不等于性能变差,这里的纵轴是边界强度,日常风格整体下移恰是合并的证据,不是录音质量下降。第二,同为高比值不等于同一级别,逗号句号处的大边界与行内小边界机制不同,不能混为一谈。第三,p 小于 0.05 遍地显著不等于处处重要,必须看科恩 d,论文正是用效应量聚焦到第 2、7、4、11 这几个位置。
还需补的验证包括:扩大七言句式与样本量,分离停顿时长与音节压缩的贡献,加入音高和感知实验检验时长消失处听感是否仍有边界,以及测试自然对话语料中双字词的合并规律是否与诗歌一致。完成这些后,才能判断音步、韵律词和韵律短语在普通话中是否还能作为可区分的层级,还是应改写为语速和结构共同决定的动态组块。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


