英文题目:Perception de parole sifflée par des auditeurs naïfs hors du laboratoire : Une exploration de l’impact du contexte expérimental.
会议身份:
conference:jep:2026:conference-paper-id:crouzet26_jep
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#心理声学实验 #统计分析 #言语感知 #语音 #音频分类
评分:4.4/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Olivier Crouzet:机构信息未能从会议 PDF 纯文本可靠映射
- Anna Marczyk Buklaha:机构信息未能从会议 PDF 纯文本可靠映射
- Alain Ghio:机构信息未能从会议 PDF 纯文本可靠映射
- Yohann Meynadier:机构信息未能从会议 PDF 纯文本可靠映射
- Maxwell Yeoman:机构信息未能从会议 PDF 纯文本可靠映射
- Philippe Biu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以户外庙会采集的贝阿恩奥克语哨语刺激为输入,以 naive 听者在多选任务中的作答与缺失为输出,实际难点在于开放噪声、集体扬声器播放与人群流动同时损害可听性与任务投入。采集步骤通过手机问卷并行作答与大屏呈现选项并由主试统一播放且允许按要求重复,提交后不可修改,无反应记为缺失,形成逐试次原始行为序列。统计步骤按试次顺序计算每题缺失占比与正确占比的变化轨迹,并拟合最小二乘回归斜率刻画时间趋势,其输出的斜率估计直接进入下一步检验。推断步骤对词汇相关后段试次做重抽样检验,以显著性阈值与百分位置信区间是否包含零双标准判定斜率是否异于零,其结论直接决定缺失上升与正确率下降是否成立。相对既往实验室哨语元音辅音分类研究,关键机制差异在于把采集情境本身作为比较对象,对比户外公众组与课堂学生组的行为轨迹而非仅报告平均正确率,其实质意义在于分离生态效度与数据质量损耗。原文未提供可核对的关键定量结果。该结论适用边界受限于该次短任务与特定人群的探索性比较,无法分离声学环境、动机与人口学混淆,尚未验证向一般实验室与田野差异的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么口哨话是检验言语感知的极限情形?
输入是本解读的来源与目标。事实只来自论文正文与本次收到的官方原图像素,不引入外部评价。目标读者是刚进入语音、音乐与音频领域的研究生,需要能核对每一步做了什么、条件是什么、数字从哪里来。必须保留的信息包括刺激数量与构成、3 个组的样本量、缺失数据的定义与处理、随时间变化的回归对象、bootstrap 的判定规则,以及户外组与教室组在缺失趋势和识别水平上的差异。输出按学习依赖展开,先讲任务与背景,再讲方法全景与组件计算,然后讲施测条件、结果与反证,最后讲复现要点。
口哨言语研究把日常发音转换为口哨实现,声学信息被大幅削减,但说话人仍试图传递有结构的语言消息。论文把贝阿恩奥克语口哨形式作为对象,关心的不只是发音如何转写共振峰,而是普通听者能否利用残留线索区分音系类别。对于初学者,可以这样理解输入到输出的链条:说话人先产生一个语言单位,口哨载波保留其中一部分频率与时间包络,听者在噪声与注意波动下接收该信号,再从 4 个文字选项中选出自认为对应的那一个。实验室已有工作报告朴素听者不经强化训练也能对口哨元音与辅音做一定程度的归类,但那些结论多来自隔音室、孤立片段与严格控制流程。
口哨言语 × 朴素听者: 口哨言语指把日常口语的声学信息大幅压缩后用口哨载波重新传达语言结构的发话方式,它的分工是提供一种信息受限但仍有音系对比的输入;朴素听者指未经专门训练、不熟悉该口哨系统的普通听者,它的分工是检验这种压缩信号在没有学习的情况下能否被解码;二者搭配的理由是只有用朴素听者去听口哨言语,才能把可懂度归因于信号本身保留的线索而不是归因于长期训练,组合意义是为 revitalisation 语境下的可学性与传播可能性提供基线。
本研究的特殊之处在于双重目标。一方面要做语音学与音系学描述,另一方面要服务语言与文化的 revitalisation,也就是希望这种口哨实践能被更多人了解与重新使用。因此作者选择在露天节日人群中做感知收集,同时在两间教室复制同一实验。这种选择天然带来张力:更自然的使用场景更接近口哨话常在户外山林中使用的生态,但开放人群、集体播放、手机作答与走动都会改变被试如何接入声音与如何维持任务。解读后续所有数字时,都要把这种张力放在心里:差异可能来自声学与注意条件,也可能来自人群本身不同。
已有实验室结论与本研究的田野转向有何不同?
同输入同目标的已有工作主要是在实验室让朴素听者匹配口哨形式与元音或辅音类别。论文引用的路线包括对非声调语言口哨元音转写策略的讨论,例如特别转写第二共振峰,或在第一到第四共振峰之间收敛相邻共振峰等不同假说,以及用自然口哨元音与辅音做范畴化的行为实验。这些工作的输入是受控刺激,目标是检验无训练匹配能力,监督来自正确答案,运行阶段是隔离试听。它们的优势是变量控制精细,劣势是远离真实使用中的开放声场景与社交情境。
本研究不重复那些实验室范畴化实验,而是把问题换成方法学问题:在参与式科学与节日场景下收集感知数据时,情境会如何改变可利用数据量与识别表现的时间轨迹。作者还联系到网络问卷与临床评估中的类似担忧:在线收集会出现中断、偶发无回答与投入差异,而临床可懂度评估同样需要在接近真实使用的条件下知道听者实际听懂了多少。
教学上可以把这理解为 1 次例子:假设你在安静房间测得某种口哨元音可辨,不等于在广场人群中用手机加外放也能测到同样行为,因为呈现链条与被试动机都变了。论文因此没有把田野数据当作实验室数据的简单替换,而是用教室组作为参照,重点看缺失与正确率如何随题序演变。
本研究要回答的两个可检验问题是什么?
论文把分析收敛为两个问题。第一,收集条件与户外组人群特征是否影响结果及其解释,也就是与教室组相比,户外行为是否系统不同。第二,缺失数据量是否影响正确识别率的结论,也就是把无回答当作错误计入后,时间趋势与水平差异是否依然成立。注意这里的相关性不等于因果:作者能报告的是 3 组行为模式不同,不能直接证明是风声、人群走动或手机音质中哪一个因素造成的,因为环境与人群是同时变化的。
为使问题可操作,作者把时间维度显式化。全部 10 个题目按固定顺序呈现,前 3 题是孤立元音,后 7 题包含词汇与非词汇混合。分析时对每个题目计算该题在全组中的缺失百分比与正确百分比,再对题序做回归,重点看后 7 题的斜率。斜率大于 0 意味着缺失随时间增多,斜率小于 0 意味着正确率随时间下降。这种设计把疲劳、脱离、难度起伏与刺激性质混在一起,因此作者进一步把前 3 个元音题单独画出红色分段线,并把推断只放在后 7 题上,以减少刺激类型切换带来的混淆。
从声音到问卷回答的完整链条是怎样的?
沿着一个试次走完流程最有助于复述方法。起点是 1 名有经验的男性双语教师发出的贝阿恩口哨实现,他也是论文作者之一。每个声音被嵌入一个四选一问卷,每题恰有 4 个文字选项。被试先在手机上接入在线问卷系统,大屏幕同步显示 4 个选项,负责收集的人用扬声器统一播放声音。被试可以在回答前要求反复听,由主试根据现场需求控制重播次数,一旦确认回答就不能修改。
答完所有题目后,被试可以回到开头查看正确答案并重听,但不能更改已记录的回答。若某题没有作答,则记为 1 次缺失。
为兼顾友好性与流失控制,作者把总题量压缩到 10 题。其中 4 题是无意义片段,分别对应 3 个孤立元音与 1 个词首辅音,另 6 题是词或词组。选项设计并非严格等长:在非词汇题中所有选项都是 1 个音节,而在词汇题中口语原形的音节数从 1 到 6 不等,其中 3 题的选项音节数相同,另 3 题在音节数上有明显差异。作者明确指出这种差异可能提供额外线索,使随机猜对的理论概率不再恰好等于 1/4。初学者要记住:正确率的随机基线标为 25% 只是理论起点,若选项长短不一,实际可猜性可能被抬高,解读词汇题优势时必须考虑这一点。
呈现方式上作者做了一个关键取舍。无论户外还是教室,都用扬声器集体播放而不是让每个人用自己手机扬声器各自播放,目的是避免几十台手机混响叠加带来额外干扰。被试仍用各自手机并行作答,从而在集体呈现下保留个体记录。实验前还会询问音乐知识、贝阿恩语知识与口哨贝阿恩语知识,但正文篇幅原因没有展开这些个体变量的建模,复现时应把它们当作待补的协变量。
刺激构成与选项设计各自承担什么功能?
刺激与选项是两个配合的组件。刺激负责提供待解码的声学证据,选项负责定义决策空间与猜测基线。把无意义片段与词汇项放在同一问卷的理由是兼顾两类推断:前者更接近音类映射能力,后者更接近在真实词库中的可用性。作者让前 3 题都是孤立元音,相当于给被试一个相对简单且性质一致的热身段,再进入难度与性质更杂的后 7 题。这种固定顺序简化了现场组织,但代价是时间效应与难度效应完全混淆,只能通过分段回归与图形检查来缓解,不能靠随机化顺序来分离。
词汇项 × 非词汇项: 非词汇项指本研究前 4 题中的孤立元音与词首辅音等无意义片段,它的分工是检验最局部的音类映射;词汇项指后 6 题中的词或词组,它的分工是检验在音节数、词长与词库竞争下的整体识别;二者搭配的理由是前者受高层词汇知识影响小而后者受候选词长短线索影响大,组合意义是把前 3 个元音题与后 7 题分开做回归,避免把刺激性质差异误读成时间疲劳。
选项音节数的处理值得初学者细读。对于非词汇题,所有选项都是单音节,长度线索无用。对于词汇题,作者保留了自然词长的差异,没有强行把所有干扰项都配成等长。好处是任务更自然、更短、更友好,坏处是某些题可能因为选项长短悬殊而更容易排除,从而虚增正确率。论文明确点出第 5、第 7 与第 10 题存在这类差异。
因此在复述时不能说每题随机基线都是严格 25%,而应说理论基线是 25%,但长短线索可能使有效猜对率上移。后续看到词汇题波动大时,要同时考虑声学难度、选项设计与时间投入三方面的贡献。
缺失数据 × 任务投入: 缺失数据指某题没有给出任何回答而被记录为空,它的分工是量化可利用数据量的损失;任务投入指被试在整个序列中持续注意、愿意作答的参与状态,它的分工是解释为什么缺失会随时间变化;二者搭配的理由是户外嘈杂、走动、集体播放等情境首先改变的是投入而不是听觉能力,组合意义是把缺失率的时间斜率当作投入变化的行为代理指标,再去判断识别率下降是能力问题还是投入问题。
缺失数据的定义在本研究非常明确:有机会作答但没有给出回答即记为缺失。作者没有用事后插补,而是保留缺失作为行为信号,并在正确率分析中把缺失按错误计入,得到保守估计。这种两步处理使读者能分别看到数据量损失与识别水平损失,避免用删除缺失后的条件正确率掩盖投入问题。
没有模型训练时,真正的计算发生在推断统计里
本研究没有训练神经网络,也没有更新任何声学模型参数,因此不存在梯度路径、参数冻结或早停等概念。真正的计算是行为数据的聚合与推断:先把个体回答聚合成每题的缺失百分比与正确百分比,再对题序拟合最小二乘直线,最后用自助法判断斜率是否区别于 0。初学者容易把无训练误解为结果确定,实际上重抽样与人群抽样都带来不确定性,必须用区间与 p 值同时表达。
回归斜率 × 自助法: 回归斜率指用一条直线拟合每题缺失率或正确率随题序变化的快慢与方向,它的分工是把时间趋势压缩成一个可检验的数;自助法指在只有 10 个题点的小样本上反复有放回重抽样来估计斜率分布,它的分工是在不依赖大样本正态假设时给出 p 值与置信区间;二者搭配的理由是斜率点估计本身不稳定,必须靠重抽样看 0 是否在合理范围内,组合意义是只有当 p 值与置信区间同时指向同一结论才判定趋势显著。
具体做法是只对后 7 题估计斜率。对缺失分析用 33000 次自助重复,作者报告超过该次数后 p 值结论稳定,而置信区间在更少的重复数下就已稳定。对正确率分析用 2000 次重复,结论在测试过的重复数下稳定。判定规则是双重标准:只有当自助 p 值与基于百分位的 95% 置信区间同时指向同一结论,才认为斜率区别于 0。若 p 值显著但区间包含 0,则按证据不足处理,倾向于不拒绝无趋势假设。这种保守规则直接影响对教室组的解读,也是本解读后面表格需要核对的核心。
需要指出的缺项是论文没有报告反应时、重播次数、设备型号与现场声压级,也没有报告个体音乐或语言背景如何调节斜率。这些不是技术错误,而是本轮探索性分析未覆盖的验证项。复现时若要把斜率差异归因于环境,必须补测这些协变量,否则只能说情境与人群联合导致了行为差异。
三组人在哪里、用多少题、在什么播放条件下比较?
比较的公平条件是同一套 10 题、同一四选一界面、同一集体扬声器播放加手机并行作答、同一固定题序与同一不可改答规则。不同的是地点与人群:户外组是在节日广场自愿参与的普通公众,教室组是两组课程中的学生,相对更不易中途离开。户外节日具体为法国西南部 Laruns 的奶酪节,时间为 2025 年 10 月 4 到 5 日。分析用 R 完成,推断用 boot 包实现自助法。
田野施测 × 实验室施测: 田野施测指在节日广场等真实使用场景附近、开放人群中收集数据,它的分工是提高人群多样性与生态效度;实验室施测指在隔音、隔离、流程受控的条件下收集数据,它的分工是保证声学呈现与注意条件一致;二者搭配的理由是同一套问卷与播放流程可以固定,而环境与被试来源可以对照,组合意义是把差异解读为情境与人群共同作用的上限,而不是纯粹的环境因果效应。
样本量与缺失总量的对照是理解后续时间趋势的基础。下表把 3 组放在同一口径下比较,指标方向是缺失率越低越好,超阈值人数越少越好。表中缺失率是全组全题聚合,超阈值指个体缺失超过 3 分之一,时间趋势留待正文图形与回归细讲。
| 条件 | 样本量 | 全程缺失率 | 超三分之一缺失人数 | 个体缺失分布特征 |
|---|---|---|---|---|
| 户外广场公众组 | 31 人 | 28.1% | 13 人(共 31 人) | 相当部分被试缺失很多 |
| 教室组 1 | 28 人 | 10.4% | 2 人(共 28 人) | 多数被试缺失很少 |
| 教室组 2 | 19 人 | 2.6% | 0 人(共 19 人) | 几乎无缺失 |
上表显示户外组不仅平均缺失率高,而且高缺失个体集中出现,而教室组多数人缺失很少。这一分布特征支持作者进一步做两种样本的平行分析:全样本与仅保留缺失不超过 3 分之一的积极子样本。若子样本结论不变,则说明水平与趋势差异不只是由少数完全脱离者驱动。反例也要记住:教室组 2 的缺失率极低,说明即使同一施测流程,在更受控与更具约束的人群中数据完整性可以很好,这为规划后续大规模收集提供了参照,但不能直接推广到广场人群。
缺失数据是否随题序爬升?户外组与教室组有何不同?
本节只讲缺失,不讲正确率。测的是每题缺失百分比随题序的变化,与谁比是户外组对两个教室组,条件是否一致是同一问卷与播放流程但地点人群不同,指标方向是斜率大于 0 表示越到后面越不答。关键数字是全样本下户外组斜率显著为正,而教室组按双重标准证据不足。支持的判断是户外存在随时间增强的无回答趋势,限制是无法区分注意下降、走动离场、听不清与动机变化。
下图前导读帮助初学者定位观察对象。图 1 左右两大块分别为全样本与积极子样本,每大块内又有 3 个小面板对应户外组与两个教室组,横轴都是从 Q1 到 Q10 的题序,纵轴是该题缺失百分比,黑点是每题观测值,蓝色虚线是全程回归,红色实线是前 3 题与后 7 题的分段回归,推断只针对后 7 题红色线。
看图路径: 1. 先确认左侧大面板为户外组全样本、中间与右侧为两个教室组,横轴都是题序 Q1 到 Q10;2. 再对比黑色折线代表的每题缺失百分比在户外组是否随题序明显爬升;3. 最后看红色分段回归线中后 7 题的斜率与蓝色全程虚线的差异
论文图 1。原论文 Figure 1:“Évolution du pourcentage de données manquantes par item en fonction de sa position séquentielle dans l’expérience.”。
从像素可见的内容看,左侧户外全样本面板的黑线从 Q1 到 Q10 爬升幅度最大,后段红色线明显上扬,而中间与右侧教室面板的黑线整体贴近底部,波动小。右侧积极子样本大块中户外面板的爬升幅度有所降低,但仍可见上扬,而教室面板依然低平。描述性上作者也指出全样本下户外回归斜率明显高于另两组,剔除高缺失个体后 3 组斜率看起来更接近,但推断结论不变。
数值上全样本户外组斜率显著大于 0,p 小于 0.001,置信区间为 3.47 到 7.8,不包含 0,而教室组两组的置信区间分别为负 0.67 到 2.49 与负 0.51 到 3.49,都包含 0。即使只看积极子样本,户外组依然显著为正,p 小于 0.05,区间为 1.48 到 6.35,而教室组区间仍包含 0。也就是说,无论是否剔除高缺失者,户外缺失随时间增加的模式都更突出。未胜出项是教室组 1 的 p 值曾小于 0.05,若只看 p 值会误判为显著,但因区间包含 0 而按作者规则不认定,这正体现了双重标准的保守作用。
把缺失算作错误后,正确率的时间趋势还成立吗?
本节把缺失按错误计入,得到保守的正确率,再看它是否随题序下降。这相当于 1 次反证检验:如果缺失增加只是不答但答了就对,那么条件正确率可能不变;但若把不答也算错,整体可用信息就是下降的。测的是每题正确百分比随题序的斜率,与谁比仍是 3 组对照,指标方向是斜率小于 0 表示越到后面越差。关键数字是 3 组表面都有下行趋势,但自助检验中没有一组达到双重显著标准。支持的判断是不能断言正确率随时间系统下降,限制是题间难度波动很大,尤其是第 7 到第 9 题系统偏难。
下图前导读明确基准线含义。图 2 同样左右分为全样本与积极子样本,横轴为题序,纵轴为该题全局正确百分比,橙色水平虚线为 25% 理论随机水平,深绿色水平虚线为二项检验下显著高于随机的阈值,黑点为每题观测,蓝色虚线与红色分段线含义与图 1 对应。
看图路径: 1. 先找到橙色随机水平虚线 25% 与深绿色二项显著阈值线作为判断基准;2. 再看户外组后 7 个词汇题的黑点是否多落在橙色线之下;3. 最后比较红色后 7 题回归线在三组中是否都向下但波动很大
论文图 2。原论文 Figure 2:“Évolution de la performance de reconnaissance au cours de l’expérience.”。
从像素可见,左侧户外面板的后段黑点多落在橙色随机线之下,起伏虽大但整体偏低,而教室面板的黑点分布更分散,有高有低,部分点能超过绿色阈值。红色后 7 题回归线在 3 组似乎都向下,但黑点离散使斜率估计不稳。数值上全样本 3 组的 p 值分别为 0.059、0.069 与大于 0.1,置信区间分别为负 7.22 到 1.06、负 15.48 到 4.22 与负 23.15 到 9.59,都包含 0。积极子样本结论相同。因此原文报告为尽管视觉上有下降趋势,但统计上没有一组显著。
需要强调的反例是户外组词汇题几乎系统低于随机水平,而教室组模式更多变,这不是时间斜率的结论,而是水平差异的描述。把它与缺失结论合在一起看,户外组的问题既表现为越到后面越不答,也表现为答了也多在随机之下,但后者的时间趋势证据不足,只能说水平低,不能说随时间显著恶化。
哪些混杂让情境效应不能直接读成因果?
缺失与水平的组间差异是论文直接报告的内容,有数字与区间支持。把差异解释为声学环境更差、注意更分散或投入渐减,属于有限解释,因为这些中介变量没有被直接测量。把差异归因于某一个具体因素,例如风声或手机音质,则属于未验证推测,不应写成定论。人群差异是明确的混杂:户外是节日自愿公众,教室是课程学生,年龄、社会背景、音乐与语言经验都可能不同,而正文没有建模这些协变量。
刺激与流程的限制也要如实交代。题序固定使时间与难度无法分离,选项音节数不完全平衡使随机基线不严格等于 25%,重播次数由主试按现场需求控制而没有记录,前 3 题只有 3 个点而不适合做回归。这些都不是要否定田野价值,而是指出若要把当前探索性结论用于最终数据分析,必须补采个体信息并尽量控制呈现条件。作者在讨论中也明确提出后续要收集更多个体信息并更好控制这些方面。
下表把推断数字放在同一框架下核对,指标方向是区间包含 0 则不认定斜率区别于 0,p 值与区间必须一致才认定。表格不能替代分布图,但能让初学者看到为什么同样的表面趋势会得到不同结论。
| 条件 | 分析样本 | 缺失斜率 p 值 | 缺失斜率 CI95% | 正确率斜率结论 |
|---|---|---|---|---|
| 户外广场组 | 全样本 | p 小于 0.001 | 3.47 到 7.8 | p 为 0.059,区间含 0,不显著 |
| 户外广场组 | 积极子样本 | p 小于 0.05 | 1.48 到 6.35 | p 大于 0.1,区间含 0,不显著 |
| 教室组 1 与组 2 | 积极子样本 | p 小于 0.05 但区间含 0 | 含 0 | p 为 0.054 与大于 0.1,均含 0,不显著 |
上表的主要收益是区分两种显著:户外缺失趋势在两种样本下都通过双重标准,而教室缺失趋势即使 p 值偶尔小于 0.05,也因区间包含 0 而不认定。代价是正确率趋势在所有条件下都不显著,说明不能用疲劳导致越来越错来简单概括。未评测边界包括个体音乐与语言背景的作用、重播次数的作用与现场噪声的作用,这些在原文中没有量化,复现时需要优先补上。
要复现这套田野对照,先固定什么、再记录什么?
复现先固定可固定部分。刺激沿用同一说话人的 10 个口哨实现,保持 4 个无意义片段加 6 个词汇项的结构与固定题序,以便与原文题序效应可比。问卷保持每题 4 选项,大屏幕显示加扬声器集体播放加手机并行作答,不允许各自用手机扬声器播放。记录规则是无回答记缺失,回答后不可修改,结束后可回看正确答案但不改分。正确率分析沿用把缺失计为错误的保守口径,并同时报告全样本与缺失不超过 3 分之一的子样本。
再补上原文缺失的记录项。必须记录每题重播次数、播放设备与现场声级、被试是否中途离场、作答设备类型,以及音乐训练、贝阿恩语理解与口哨经验等个体变量。聚合时先算每题缺失百分比与正确百分比,再对后 7 题拟合最小二乘斜率,最后用自助法同时看 p 值与百分位置信区间,只有两者一致才下结论。样本量上原文 3 组分别为 31 人、28 人与 19 人,属于小样本探索,后续若要稳定估计斜率,应扩大每组人数并考虑在教室组也引入噪声对照,以分离人群与环境的贡献。
关于可用性声明,本次收到的证据中没有发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开。原文提到分析用 R 与 boot 包,但这不等于本研究数据与问卷已可下载。复现者应按方法描述重新搭建问卷与刺激呈现,而不是假设存在可直接运行的系统。
何时值得把感知实验搬到广场上?
当研究目标同时包含科学描述与社区 revitalisation,且需要接触实验室难以覆盖的人群时,值得尝试田野施测。它的收益是人群更多样、情境更接近口哨话的户外使用生态,并能带动公众参与。它的代价在本研究中很具体:户外组全程缺失率高达 28.1%,远高于教室组的 10.4% 与 2.6%,且缺失随题序显著上升,而词汇题正确率多在随机水平之下。也就是说,能收集到更具代表性的行为,但单位时间内的可用数据更少,且需要更谨慎的统计处理。
是否采用取决于能否接受并处理这种代价。如果后续目标是估计音系线索的可懂度,应缩短任务、减少后段负载、控制重播与声级,并把缺失建模为投入指标而不是简单删除。如果目标是评估广场人群的实际理解水平,则应保留集体播放与开放参与,但必须同步记录个体背景与环境变量,否则组间差异无法归因。论文的探索性结论为这种权衡提供了起点:即使只看积极子样本,户外缺失的时间趋势与低正确率水平依然存在,说明问题不只是少数人完全脱离,而是情境本身对持续作答提出了更高要求。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 9 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

