英文题目:Effects of distributional bias in vowels and consonants on the Speech-to-Song Illusion
会议身份:
conference:interspeech:2026:conference-paper-id:kagotani26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#心理声学实验 #语音学与音系 #言语感知 #语音 #音乐理解
评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Haruki Kagotani:机构信息未能从会议 PDF 纯文本可靠映射
- Hiroko Terasawa:机构信息未能从会议 PDF 纯文本可靠映射
- Makiko Sadakata:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理日语短语重复聆听后由话语向音乐的知觉转化,输入为9摩拉自然朗读语音,输出为重复前后的类歌度与类说唱度评分,难点在于韵律与语义之外的音段分布是否独立驱动音乐化。方法链分三步推进:先以9摩拉真词约束为输入,负责按元音偏置与辅音偏置2×2设计构造40条短语并用香农熵校验偏置强度,输出四条件刺激文本集;再以该文本集为输入,负责由不知假设的播音员录音并做修剪与归一化转码,输出可在线随机呈现的音频文件,使文本集进入录制环节;最后以该音频文件为输入,负责分为两套并在歌曲指令与说唱指令下采集单次与10次重复评分并计算变化量,输出感知变化量,使录制音频进入众包重复聆听评测。与既往聚焦音高稳定与节奏规则的研究不同,本文直接操纵音素分布并引入说唱框架以容纳音高起伏语音的节奏性音乐化。在歌曲与说唱指令合并的重复聆听条件下,有元音偏置刺激的感知变化得分为1.00,高于无元音偏置刺激的感知变化得分0.80。该结论限于日语母语众包聆听与人工高偏置短语,对自然语义连贯语音及跨语言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要回答什么?
本文的输入是日语短语音短语的录音,目标是解释短语在重复聆听后从话听成歌或说唱的强度变化。研究对象是刚接触语音与音乐边界的研究生需要掌握的可复述流程,因此本文只讲该论文实际做的操纵与测量,不引入外部语料或外部模型效果。必须保留的信息包括 4 种分布条件、无偏向、仅元音偏向、仅辅音偏向、双偏向,两种指导语、歌相似度与说唱相似度,重复前后差作为错觉强度,以及 120 名日语母语者、约 9 莫拉、单次加 10 次重复的基本协议。输出是一套能照着重做刺激构造、分组平衡、评分与方差分析的步骤说明。
言转歌错觉通俗说就是一句话听一遍像说话,连听十遍忽然有了歌曲感,英文名是 Speech-to-Song illusion,后文简称言转歌错觉。重复呈现通俗说就是先放一遍打分,再把同一条连放十遍再打分,后文简称重复。
言转歌错觉 × 重复呈现: 言转歌错觉负责描述短语音短语在多次重复后被听成歌的现象,重复呈现负责提供从单次听到 10 次重复的对比操作,二者搭配的理由是只有重复前后评分差才能把一过性的好听与真正的知觉转化分开,组合意义是把因变量定义为后减前的变化量而非绝对分。
沿一个样本走一遍有助于建立整体图像。输入一条例如无偏向短语,录音后先让被试听一遍并在 1 表示完全像话、7 表示完全像歌的量表上打分,接着把同一条以 400 毫秒间隔连放十遍,再用同一量表打 1 次,2 次之差就是该试次的错觉强度。论文把这个差平均到条件与指导语上,再检验偏向是否存在与指导语是否为说唱是否系统抬高差值。这条主线贯穿刺激构造、实验流程与统计,后文按此顺序展开。
术语小结:后文简称如何固定?
为保证全文回指唯一,这里固定简称。言转歌错觉指重复后话听成歌的现象,说唱框架指以节奏与音色相似为核心的音乐化评价,分布偏向指特定音类在短语内高频集中,香农熵指量化分布均匀度的描述指标,响音与阻碍音指按发音方式划分的两大辅音类别,重复前后差指重复后评分减单次评分的错觉强度。后文使用这些简称时均指向本节定义,不引入新含义。教学例子会明确标为例子,例如为说明流程而设想的试次顺序,不添加无源的数值或效果断言。
此前路线把错觉归因到哪里,本文补哪一块?
此前路线主要有 3 条。第一条是韵律声学路线,关注音高稳定、明确的音程与节奏规则性,认为这些特征让语音更易被听成音乐。第二条是听者与语言背景路线,涉及音乐能力、音乐老练度、声调语言经验与日语这类音高重音语言中错觉较弱的现象。第 3 条是语言可达性路线,认为外语难发音、低语义合理性、高句法复杂度或语音饱和使语义加工暂时让位,声学与音系信息随之凸显。
在音系层面,已有工作提示音节响度、元音空间集中可能促进错觉,但分布偏向即同一短语内相似音素高度集中是否直接推动错觉,此前没有在言转歌范式里直接检验。本文的切入点受说唱启发,说唱在旋律极简时仍可凭相似音系模式与节奏组织听起来像音乐,因此作者把偏向结构本身作为自变量,并把传统歌感量表扩展到说唱感量表。
语义饱和 × 节点结构理论: 语义饱和负责解释重复使词义通达暂时下降从而语言锚定减弱,节点结构理论负责进一步说明语义加工被抑制后被压制的声学与音系信息浮到表面,搭配理由是二者都把重复效应归因于语言加工让位而非单纯好听,组合意义是为分布偏向干扰言语加工进而凸显声音结构的假设提供理论起点。
对照时要注意运行阶段一致。本文与韵律路线同输入同目标但监督与测量不同,韵律路线多为声学相关分析,本文是操纵音素分布的因果设计。与听者特质路线相比,本文用问卷收集音乐老练度与说唱接触等背景,但主分析是条件内重复测量而非个体差异建模。与语义路线相比,本文同样记录主观理解度,但正文主结果未把理解度作为协变量,未来工作才计划纳入。因此不能把本文结果读成否定韵律或语义的作用,只能读成在自然语音录音与当前设计下,音段分布结构也贡献了可观测的增量。
同输入同目标的对照应如何公平表述?
公平对照要求同输入、同目标、同监督与同运行阶段放在同一句话里比较。韵律研究与本文同输入同目标,但一方是声学相关一方是分布操纵,不能直接比胜负,只能说本文在未控制韵律时观测到偏向增量。语义研究与本文同目标但操纵的是合理性与复杂度,本文虽记录理解度但未建模,因此不能说本文证伪语义解释。听者特质研究关注音乐能力与语言背景,本文收集音乐老练度与说唱偏好但主分析未纳入个体建模,因此不能把个体差异结论套用到本文。
类别差异不是同条件胜负,任何跨范式的优劣判断都需待未来在同一刺激集上并行建模音高稳定、节奏规则、理解度与连续偏向度后才能做出。
两个假设具体在预测什么?
第一个假设预测分布偏向促进错觉。机制表述是偏向的音系信息在重复中干扰言语加工,使注意转向声音的声学侧面,从而音乐化增强。操作化预测是含元音偏向或辅音偏向的刺激,其重复前后差大于完全无偏向刺激。第二个假设预测说唱指导语产生更强的错觉,且该效应在含偏向刺激中更突出。理由是歌框架引导注意去找稳定旋律与明确音程,而自然语音音高起伏大难以套入西方常见歌曲框架,说唱框架容忍音高起伏而强调节奏组织与押韵,因而与自然语音亲和度更高。
需要区分直接报告与待验证推测。论文报告的是主效应与交互的显著性模式,支持偏向促进与说唱整体更高,但不支持说唱效应被偏向特异放大的第二半句,因为指导语与任一偏向的交互都不显著。把说唱容忍音高起伏作为解释属于有限解释,不是被直接操纵音高稳定性所验证的因果结论。复述时应保留这种分层,不把机制故事当成已检验的中介。
方法全景:从短语到差值的四步如何串起?
全景可分为 4 步。第一步构造 40 条约 9 莫拉的日语短语,按元音偏向有无与辅音偏向有无组成 4 个条件,每条件约 10 条。第二步由 1 名受过播音训练的男性母语者录音,实验者意图对其保密,录音经剪除首尾静音、峰值归一与转码后用于在线实验。第三步实施平衡设计,把 20 条分为集合 X 与 20 条分为集合 Y,被试随机分 4 组完成歌块与说唱块各一块,每块内先单次后 10 次重复并评分。第 4 步以重复后减重复前的平均变化为因变量,做指导语乘元音偏向乘辅音偏向的三因素重复测量方差分析,并对显著的元音与辅音交互做校正后的简单效应比较。
元音偏向 × 辅音偏向: 元音偏向负责通过重复 5 个日语元音与 moraic nasal 中的特定音实现听感上共鸣的集中,辅音偏向负责通过提高响音与阻碍音两类中某一类的出现率实现节奏切分与音色相似,搭配理由是二者分别操纵共鸣载体与阻碍切分,组合意义是形成无偏向、仅元音偏向、仅辅音偏向、双偏向的 2 乘 2 设计以分离各自贡献。
这一步先明确偏向的含义。偏向不是指好听或押韵的主观印象,而是指短语内特定音类出现率被人为拉高。元音偏向通过在短语内重复特定元音实现,辅音偏向通过提高响音或阻碍音中某一大类的出现率实现。响音通俗说是由鼻音、流音与滑音构成的持续平滑的音,阻碍音通俗说是由塞音、擦音与塞擦音构成的靠气流闭塞或摩擦切分节奏的音。这种二分让节奏与音色差异更易被听出,也为后续用更细的发音特征扩展留下接口。
刺激的两个操纵各怎么做,熵在其中起什么作用?
元音操纵的做法是在真实日语词、日语语音规则与固定 9 莫拉长度约束下,尽量让特定元音集中出现。论文举例仅含元音/a/的短语,全部元音都是/a/,以最大化类别集中。作为代价,部分短语语义连贯性低或词汇搭配不自然,这一点作者明确说明。量化上用短语内元音出现频率的香农熵确认集中程度,熵越大表示分布越均匀,报告范围从 0.00 到 2.50。熵在这里不是目标函数,而是事后核对操纵是否成立的描述指标。
辅音操纵的做法是按发音方式大类控制出现率,分为响音与阻碍音两类,系统提高其中一类的比例以增大听觉节奏与音色相似性。论文举例全部辅音为阻碍音且 9 个中有 8 个是塞音的短语,听感上爆破切分密集。同样用香农熵描述辅音分布均匀度,报告范围从 0.00 到 0.99,越大越均匀。熵的计算细节如是否计入特殊音拍、是否按音素还是按类别计数,原文未给出完整公式与代码,因此复述时只能说明用量化确认集中,不能复述具体计数规则。
分布偏向 × 香农熵: 分布偏向负责指短语内特定元音或特定发音方式辅音高频集中,香农熵负责把集中程度量化为元音 0.00 到 2.50 与辅音 0.00 到 0.99 的均匀度数值,搭配理由是人工构造的偏向需要可核对的度量而非主观押韵感,组合意义是用熵值确认偏向条件确实比非偏向更集中。
两个指导语的搭配需要紧接说明。
歌相似度指导语 × 说唱相似度指导语: 歌相似度指导语负责引导被试关注音高稳定与旋律感并在 1 到 7 点量表上评歌感,说唱相似度指导语负责引导被试关注节奏规则与音色重复并在同样量表上评说唱感,搭配理由是自然语音音高起伏大可能天然不利歌曲框架,组合意义是检验音乐化是否只等于旋律化还是包含节奏组织。
歌块每试次先听一遍评歌感,1 为完全像话、7 为完全像歌,再听 10 次重复评 1 次,同时评主观理解度。说唱块流程与呈现条件完全相同,只是把歌感换成说唱感,1 为完全像话、7 为完全像说唱,并同样评理解度。两块使用不同刺激集合以避免同一条在两种框架下重复曝光,块顺序与集合搭配在 4 组间平衡。
本研究有没有训练模型,真实计算是什么?
本研究没有训练神经网络,也没有更新任何模型参数,因此不存在优化器、梯度路径、冻结与解冻或早停等安排。把无训练等同于确定性求解是误解,在线行为实验的输出仍受被试、设备与环境变异影响。真实计算分为 3 类。第一类是刺激准备计算,包括录音、剪除静音、峰值归一到负 3 分贝、时长控制在 1.0 秒到 1.5 秒、转码为立体声 320 千比特每秒的 MP3 以防加载延迟。
第二类是行为采集计算,包括单次呈现、400 毫秒间隔的 10 次重复、7 点量表评分与理解度评分,以及实验前用日语版音乐老练度量表与说唱接触、方言经历问卷收集背景。第 3 类是统计计算,以后减前差为因变量做三因素重复测量方差分析并做 Bonferroni 校正的简单效应。缺项需要明确指出,熵的具体计数实现、随机种子、在线环境校准数据与个体听音设备型号均未报告,不能从任务名称推定这些实现。
被试、录音与平衡如何保证条件可比?
被试为 120 名听力正常的日本语母语成人,通过众包服务招募,在安静环境用耳机或耳塞经在线平台完成,伦理审批号为筑波大学相关委员会的 25-69 与 25-111。录音者为 1 名受过专业播音训练的男性母语者,对假设不知情,在低噪声环境用指定电容话筒与音频接口录制,编辑软件用于剪除首尾静音。刺激总数 40 条,4 条件各约 10 条,长度约 9 莫拉,峰值归一,时长 1.0 秒到 1.5 秒。
平衡设计是公平比较的关键。40 条被分为集合 X 与集合 Y 各 20 条,且 4 种偏向条件在两集合间均衡。每名被试完成两块,一块用一种指导语配一个集合,另一块用另一种指导语配另一个集合,共 4 种组合随机分配。块内 20 条顺序对每名被试随机。这种安排使指导语效应与集合效应正交,偏向效应在两种指导语下都有观测机会。
下表把可重放的实验配置集中为三列以上的对照,数字与单位保留原文写法,表头单位与裸值不互相改写。表前问题是哪些配置是原文明确给出的可复现锚点,公平条件是同一录音者、同一归一与同一重复间隔,指标方向不适用此表,重点是核对人数、长度、时长与间隔。
| 配置项 | 具体安排 | 数量与单位 | 来源说明 | 可复现要点 |
|---|---|---|---|---|
| 被试规模与母语 | 成年日语母语者听力正常 | 120 名 | 在线众包招募 | 需筛听力与母语 |
| 刺激总量与分组 | 4 条件各约 10 条共 40 条 | 40 条 | 2 乘 2 偏向设计 | 每条件约 10 条 |
| 评定量表 | 歌感或说唱感加理解度 | 7 点量表 | 1 为完全像话 | 前后各评 1 次 |
表后解释需要同时说明收益与代价。收益是录音者盲法、集合平衡与块内随机共同降低了实验者意图与顺序效应,单次加 10 次的固定协议使差值可比。代价是为最大化偏向而牺牲了部分语义自然度,在线环境无法统一耳机型号与背景噪声,且理解度虽有采集但主模型未纳入协变量。因此主效应应读成在当前自然度代价与在线变异下的平均效应,不能推广到实验室严格控制或语义完全自然的语料。
主结果:偏向与指导语各抬高了多少变化量?
主结果的因变量是重复后减重复前的平均变化,数值越大表示重复带来的歌感或说唱感提升越大。论文先用图展示原始分的前后上升,再用变化量图聚焦错觉强度。三因素重复测量方差分析显示指导语、元音偏向、辅音偏向 3 个主效应均显著,元音与辅音之间存在显著双向交互,指导语与任一偏向的交互均不显著。
下表把 3 个主效应的均值与标准误集中为五列,数字保留原文的 1 位或 2 位小数与标准误写法。表前比较问题是在保持重复协议与量表一致时,存在偏向是否大于不存在偏向,说唱指导是否大于歌曲指导,公平条件是同一批被试的重复测量设计,指标方向是变化量越大错觉越强。
| 因素 | 存在偏向或说唱指导均值 | 不存在偏向或歌曲指导均值 | 均值差方向 | 标准误对照 |
|---|---|---|---|---|
| 指导语说唱对比歌曲 | 0.95 | 0.84 | 说唱更高 | 0.069 对比 0.070 |
| 元音偏向有对比无 | 1.00 | 0.80 | 有偏向更高 | 0.074 对比 0.064 |
| 辅音偏向有对比无 | 0.97 | 0.82 | 有偏向更高 | 0.070 对比 0.066 |
表后解释要给出具体判断与限制。说唱指导的平均变化为 0.95,歌曲指导为 0.84,差约 0.11 且显著,说明在全部偏向条件上平均,说唱框架带来更大的重复增益。元音有偏向为 1.00、无偏向为 0.80,差约 0.20 且显著。辅音有偏向为 0.97、无偏向为 0.82,差约 0.15 且显著。限制是这些是跨条件平均的主效应,不能读成每 1 对刺激都成立,也不能把 0.11 到 0.20 的量级直接当成绝对歌感,还需看下一节简单效应揭示的非叠加模式。
以下导读针对原始评分前后变化图,重点是同时看到起点抬升与增量并存。该图上方面板为说唱、下方面板为歌曲,横轴均为 4 种偏向条件,纵轴为平均相似度分数,每个条件内连线连接单次与重复 10 次两点。
看图路径: 1. 先看上下两块面板标题区分上方为说唱下方为歌曲;2. 再看每块内横轴四个偏向条件与纵轴平均相似度分数;3. 比较每个条件下圆点单次与方块重复十次之间的连线上升幅度;4. 注意无偏向起点最低而双偏向起点与终点都更高的整体抬升
论文图 2。原论文 Figure 1:“Changes in mean ratings of “song-likeness” and”。
解释该图可见内容时要区分绝对分与变化量。上下面板中每条连线都向上,说明重复普遍提高评分。无偏向条件的单次起点最低,终点也最低,双偏向起点与终点都更高,说明偏向不仅增大增量,还抬高了未重复时的音乐感基线。说唱面板的整体位置高于歌曲面板,与说唱主效应一致。但该图纵轴是原始分,不能单独证明增量差异,需结合变化量图与方差分析读数,像素不能精确辨别的纵轴小数不应硬写。
反证:无偏向是否唯一最低,双偏向是否继续叠加?
把双因素交互拆开是理解边界的关键。由于元音偏向与辅音偏向交互显著,论文做了校正后的简单效应比较。结果是无偏向显著低于其余三者,与仅元音偏向差负 0.28,与仅辅音偏向差负 0.23,与双偏向差负 0.35,校正后均显著。而含偏向的三者之间两两无显著差异,校正后均大于 0.10 的显著性阈值表述,虽双偏向数值最高但未显著超过任一单偏向。这支持任一偏向即足以促进错觉,不支持双偏向必然叠加。
下表把显著性模式与效应量集中为五列,保留原文 F、显著性与效应量写法。表前问题是交互是否存在、简单效应中谁是未胜出项,公平条件是同一因变量与同一校正,指标方向是 F 越大、显著性越小、效应量越大则证据越强。
| 检验项 | 统计量 | 显著性 | 效应量 | 结论方向 |
|---|---|---|---|---|
| 指导语主效应 | 6.20 | 0.014 | 0.011 | 说唱高于歌曲 |
| 元音偏向主效应 | 19.11 | 小于 0.001 | 0.033 | 有高于无 |
| 辅音偏向主效应 | 19.90 | 小于 0.001 | 0.019 | 有高于无 |
| 元音乘辅音交互 | 6.25 | 0.014 | 0.006 | 无偏向唯一最低 |
| 偏向三者间比较 | 未报告 F | 大于 0.10 | 未报告 | 双偏向未显著叠加 |
表后解释要同时给出收益与反例。收益是无偏向作为基线被 3 个偏向条件一致超越,效应在两种指导语下都存在,说明偏向效应具有跨框架稳定性。代价或反例是双偏向未显著高于单偏向,指导语与偏向无显著交互,因此第二假设的后半句未获支持。未评测边界包括连续偏向度、局部成簇重复与音高稳定性的并行建模,这些在未来工作才计划用混合效应模型检验。
以下导读针对平均变化量图,该图直接显示错觉强度,是主结果的核心视觉证据。上下两块分别对应说唱与歌曲,纵轴为平均相似度差,横轴为 4 种偏向条件,每个菱形点带 95% 置信区间误差线。
看图路径: 1. 先看上下两块面板同样区分说唱与歌曲指导语;2. 再看纵轴已变为重复后减重复前的平均变化量且零线附近有虚线;3. 比较无偏向菱形点明显低于其余三个偏向点的高度;4. 观察误差线代表的百分之九十五置信区间在偏向条件间大量重叠
论文图 1。原论文 Figure 2:“Mean perceptual change (post-repetition minus pre-”。
解释可见内容时抓住两点。第一,无偏向点在上下两块中都明显最低,与其余三点分离,这与简单效应中无偏向唯一最低一致。第二,其余三点高度接近且误差线大量重叠,双偏向虽在数值上略高但区间重叠大,这与三者间无显著差异一致。上下两块整体高度相近但说唱略高,与指导语主效应量小但显著的模式相符。不能把误差线不重叠直接等同于显著,需以报告的方差分析与校正比较为准。
哪些混淆还没有排除,结论边界在哪里?
第一个边界是韵律混淆未建模。论文明确承认音高稳定、明确音程与节奏规则性等已被证实能驱动错觉,但本研究未在刺激水平建模这些声学指标,也未检验分布偏向是否在控制它们后仍解释增量方差。因此不能把偏向效应读成独立于韵律的净效应。第二个边界是语义可达性未纳入主模型。刺激为最大化偏向而牺牲自然度,部分短语理解度可能偏低,虽采集了主观理解度评分,但未作为协变量,未来才计划纳入。
第 3 个边界是偏向定义的二值化。当前只有有无两档,未量化连续偏向度与局部相似音丛,也未细分浊音、延续音等发音特征,未来计划用基于 n 元语法的度量与更细特征重算。第四个边界是在线实验的控制力。设备、音量与环境噪声不统一,虽要求安静环境与耳机,但变异仍大于实验室。总体趋势不等于每条刺激或每名被试都成立,双偏向未叠加也提示天花板或基线抬升的可能。
若要重做,先固定哪些步骤与参数?
复现应先固定刺激构造。按 2 乘 2 设计各准备约 10 条、每条约 9 莫拉的真实日语短语,元音条件集中特定元音并计算香农熵核对,辅音条件按响音与阻碍音大类控制出现率并同样核对熵值,保留语义不自然的实例以忠实原约束。录音固定为男性母语者盲法录制、低噪声环境、剪除首尾静音、峰值归一到负 3 分贝、时长 1.0 秒到 1.5 秒、转码为立体声 320 千比特每秒。再固定分组与流程,把 40 条分为两集合各 20 条且 4 条件均衡,4 组分别对应说唱加集合 X 配歌曲加集合 Y 等组合,块内顺序随机,每试次先单次评分再以 400 毫秒间隔 10 次重复后复评,歌与说唱均用 1 到 7 点量表并加理解度评分。
统计复现以重复后减重复前为因变量,做指导语乘元音偏向乘辅音偏向的重复测量方差分析,显著交互后做 Bonferroni 校正的简单效应。需保留的关键超参数是莫拉数、间隔、重复次数、量表锚点与集合平衡,缺失的随机种子与熵计数细节应在复现报告中明确标注为自定。资源状态方面,本次未发现来源绑定且完成验证的公开代码、模型或数据,不得声称材料已公开,只能按论文文字重建流程。建议新增验证是并行提取音高稳定与节奏规则性并用线性混合效应模型检验偏向增量,以及把理解度作为协变量。
何时值得尝试说唱框架,何时仍用歌曲框架?
当研究问题涉及节奏组织、音色重复或自然语音的音乐化,且刺激音高起伏大难以套入旋律框架时,值得尝试说唱感量表作为补充因变量。本文显示说唱指导平均变化更高,且偏向效应在两种框架下都存在,说明说唱框架能捕捉更宽的音乐化效应。但当研究目标是旋律知觉、音高稳定或跨语言歌曲比较时,仍应保留传统歌感量表,因为说唱更高不等于替代歌曲,交互不显著也说明偏向并未特异放大说唱效应。
对初学者的实践建议是先复述无偏向唯一最低与单偏向即足够的模式,再复述双偏向未显著叠加与指导语效应量小的细节,避免把显著读成巨大或普适。常见误解是把偏向当成押韵本身,实际上本文操纵的是类别出现率的分布集中,不是同一音节序列在同一短语内的字面重复,作者把后者列为未来工作。另一个误解是把在线显著性当成个体必然体验,实际上这是 120 人平均的变化量,需结合置信区间理解不确定性。收束时应回到可核对的动作,只有固定上述构造、录音、平衡与差值统计,才能有意义地讨论语音、诗歌、说唱与歌曲的边界。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

