英文题目:DYE (Design Your Experiment) : une interface graphique en ligne pour la conception d’évaluation perceptives avec PsyToolkit

会议身份:conference:jep:2026:conference-paper-id:audibert26c_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#开源工具 #主观评测 #言语感知 #语音 #语音可懂度评估

评分:5.9/10 | 创新 0.8/2 | 技术严谨 1.0/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Nicolas Audibert:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本任务以语音刺激与感知范式需求为输入,以可在PsyToolkit中直接导入编译的感知评估实验为输出,实际难点在于非编程用户需手写脚本并为每个视觉元素指定图像坐标与呈现逻辑。DYE构建了三步方法链:首先图形化配置模块收集强制选择选项、李克特量表点数与指导页等参数并提供实时预览与对齐网格,其输出的版式参数进入版式计算与素材渲染器以生成各元素中心坐标、范围与对应位图。随后代码生成与导出管理器将上述定位结果转换为带详细注释的PsyToolkit脚本及配套图像,并打包为可直接导入编译的压缩档案,同时支持项目存档复用与预定义受控随机呈现顺序。相对已有方法的关键机制差异在于以模块化R与Shiny封装的图形交互替代手写坐标脚本,既保留Go Listen式免编程易用性,又继承PsyToolkit对多样范式的覆盖能力,具有降低使用门槛与节省资深用户时间的实际意义。原文未提供可核对的关键定量结果。该结论的适用边界受限于当前仅覆盖强制选择加少量量表与指导页的简单组合,当多量表与强制选择按钮需同步呈现或复杂布局时,会因rate命令仅顺序呈现而出现失败条件。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?为什么在线语音感知评测需要专门工具?

这篇论文的输入是语音感知研究中常见的听辨与评价需求,目标读者是刚进入语音、音乐与音频领域的研究生。作者首先交代的背景是,近几年在线感知评测已经成为实验室受控施测之外被认可的替代方案。也就是说,研究者把录好的语音刺激放到网上,让被试用自己的电脑和耳机完成听音判断。

这种做法必然失去一部分实验控制,例如无法完全统一播放设备、环境噪声与被试注意力。但论文引用的已有结论是,只要明确规定并记录材料播放条件,在线收集的结果可以直接与实验室结果比较。这就确立了本文要解决的问题不是要不要做在线评测,而是如何让不懂脚本语言的学生也能规范地做出在线评测。

在线评测 × 实验室控制: 在线评测负责扩大被试来源与降低组织成本,分工是可及性;实验室控制负责固定设备、环境与指导语,分工是可比性。两者搭配的理由是只要明确记录材料播放条件,在线结果可与实验室结果直接比较,组合意义是在承认失去部分控制的前提下,用规范的条件说明换取可比较的数据。

对于初学者,白话理解是:在线评测解决的是人从哪里来的问题,实验室控制解决的是条件是否一样的问题。论文没有给出新的对比实验来证明在线与实验室等价,而是把这个等价性作为前提引用,重点放在降低工具门槛上。因此阅读时不要把本文误读为在线与实验室比较的实证研究,它是 1 篇工具设计与实现介绍。

已有路线有哪些?PsyToolkit 与 Go Listen 各解决什么?

论文梳理了两条已有路线。第一条是以 PsyToolkit 为代表的免费完整工具。它提供实验设计用的简单脚本语言、被试施测管理与结果导出。最初主要面向视觉刺激的心理学实验,但同样支持音频呈现,因此在语音领域用得越来越多。它的优点是能实现多种范式,缺点是必须写脚本,并且每个视觉元素都要准备对应图片并指定坐标,这会劝退一部分潜在用户,使他们转向需要购买许可的商业平台或效果打折的临时方案。

第二条是以 Go Listen 为代表的免费开放端到端听音测试平台。它的优点是把在线流程各步骤集成在同一在线工具中,不需要编程或脚本语言。论文明确指出它的局限是可实现的范式种类不如 PsyToolkit 广泛。也就是说,易用性与覆盖面之间存在矛盾。

理解这组对照对后续方法很关键:DYE 不是要替代 PsyToolkit 的执行引擎,而是做在它之前的设计辅助层。DYE 保留 PsyToolkit 作为最终运行与计分平台,用图形界面解决写脚本与摆坐标最费时的部分。这一定位解释了为什么 DYE 的输出是代码加图片压缩包,而不是自己播放刺激或自己统计结果。

DYE 要解决的具体任务是什么?不解决什么?

DYE 要解决的具体任务是:让非专家用户通过简单图形界面,拼装出一项包含指导语页、强迫选择判断、可变数量李克特量表的感知评价,并自动得到可在 PsyToolkit 中直接导入编译的实验档案。举例来说,论文图 1 展示的例子是一个元音识别任务,被试先听一个刺激,然后从多个元音选项中选一个,再用一个量表评价口音的非母语程度。教学例子明确标为例子,不代表论文测试了该元音实验的识别率。

论文同时明确了不解决的范围。首先,DYE 目前只覆盖 PsyToolkit 功能的一个有限子集,采用模块化设计以便以后扩展,但当前版本不支持任意范式。其次,它不负责在线招募被试、播放控制之外的设备校准,也不报告新的感知实验结果。它的输出是实验构造,不是实验结论。

因此检验 DYE 是否成功,要看它是否真正降低了构造步骤、生成的代码是否可编译、是否保留了后续手工修改的可能,而不是看它是否提高了某个识别分数。这一区分有助于避免用效果类指标去要求 1 篇工具论文。

DYE 全景:从界面操作到可编译实验经历哪些步骤?

DYE 是用 R 与 Shiny 开发的在线应用。用户操作的主路径可以沿一个样本走完:假设用户要做 5 个元音刺激的识别加口音评价。第一步是上传或指定音频文件集合,第二步是在强迫选择页设置选项文字与排列,第三步是启用并设置李克特量表数量与点数,第 4 步是填写指导语与全局设置,最后在实时预览中检查布局,确认后导出压缩包。

实时预览 × 导出压缩包: 实时预览负责在调整选项数量、行数、量表点数与位置时即时显示布局,分工是设计反馈;导出压缩包负责把生成的代码与图片打包为可导入 PsyToolkit 的档案,分工是部署衔接。两者搭配的理由是所见即所得减少坐标试错,组合意义是预览确认后一键得到可编译实验,熟练用户也可在此基础上继续改代码。

压缩包内包含两类产物:一是补全了详细注释的 PsyToolkit 代码,方便之后手工改逻辑;二是与视觉元素对应的图片,用于在 PsyToolkit 中按坐标呈现。用户把压缩包导入 PsyToolkit 并编译,即得到可发布的实验。论文还提到两个辅助能力:一是可以保存实验设计工程以便以后继续修改,二是支持从预先定义的多套受控呈现顺序中随机选择一套,而这种多顺序逻辑在 PsyToolkit 中手写更复杂。

下面先看论文图 1 的界面实例,理解预览与最终实验元素之间的对应关系。该图是本次唯一收到像素的图,具有教学价值,因为它把抽象的选项数、量表数与坐标概念变成了可见布局。

看图路径: 1. 先看顶部状态条确认强迫选择选项数、李克特量表数与音频刺激数;2. 再看黑色画布中央五个元音按钮 i、u、e/ɛ、o/ɔ、a 的相对位置;3. 接着看底部从 Non natif 到 Natif 的六个圆点量表与两端标签;4. 最后对照横轴 X 负 400 到正 400 与纵轴 Y 负 300 到正 300 确认坐标系

原论文 Figure 1:Aperçu de l’interface de l’application DYE appliquée à un test d’identification en choix

论文图 1。原论文 Figure 1:“Aperçu de l’interface de l’application DYE appliquée à un test d’identification en choix”。

这张图显示的是 DYE 实时预览区的样子,不是 PsyToolkit 最终运行截图,但元素一一对应。顶部状态条提示当前设计包含强迫选择 5 个选项分 3 行、李克特量表 1 个、音频刺激 5 个。黑色画布是 PsyToolkit 坐标系,中心为原点。中间 5 个米黄色矩形是元音按钮,底部一行 6 个圆点是 6 点量表,两端分别标有 Non natif 与 Natif 文字标签。右侧与下方的网格与数字是设计者用来对齐的辅助信息。理解这张图后,再看后文的组件设置与坐标参数就有了具体落点。

组件一:强迫选择与李克特量表如何拼装与呈现?

强迫选择在这里指被试必须从给定类别中选一个的判断任务,白话就是单选题。李克特量表指用多个离散点表示程度的评价条,例如从非常非母语到非常母语。DYE 允许只用其中一种,也可以两者结合,并可设置可变数量的量表,再加上一页指导语。

强迫选择 × 李克特量表: 强迫选择负责让被试从固定选项中选出听到的类别,分工是类别判断;李克特量表负责让被试在连续程度上打分,分工是程度评估。DYE 把两者搭配的理由是同一试次既要身份判断又要口音度等附加维度,组合意义是生成一套先呈现按钮再顺序呈现量表的 PsyToolkit 流程,而不是同时显示。

关键实现细节是呈现时机。论文界面中的提示明确说明,李克特量表是用 PsyToolkit 的 rate 命令实现的,该命令只在收集反应时显示量表。当把李克特量表与强迫选择按钮结合,或使用多个李克特量表时,这些元素在最终实验中是顺序出现而不是同时出现。初学者容易误以为预览中上下同屏就等于被试同时看到,实际上执行时是先做选择再逐个打分。这一约束直接影响指导语写法与试次时长估计。

PsyToolkit 脚本 × 坐标定位图片: PsyToolkit 脚本负责定义试次逻辑、呈现顺序和计分,分工是实验控制;坐标定位图片负责定义每个按钮与文字在屏幕上的视觉位置,分工是界面布局。DYE 搭配两者的理由是非专家难以手写坐标与脚本,组合意义是由界面预览自动生成带详细注释的代码加对应图片,使用户可直接导入编译。

沿样本继续走:用户把 i、u 等 5 个标签填入强迫选择,把 6 点量表的左右标签填为 Non natif 与 Natif,DYE 即按当前字体、形状、颜色与间距生成按钮图片,并计算每个元素的中心坐标与纵向范围。用户不需要手写呈现代码,只需在预览中拖动或调整数值确认不重叠。

组件二:坐标、样式与顺序控制如何工作?

PsyToolkit 用以屏幕中心为原点的坐标系定位视觉元素。论文图注下方明确写出横轴从左负 400 到右正 400,纵轴从下负 300 到上正 300,中心为 0 点。DYE 的预览区叠加了对齐网格与颜色选择,让用户直观看到每个元素占据的纵向区间与偏移。

受控呈现顺序 × 随机选择: 受控呈现顺序负责事先定义多套平衡了练习效应与顺序效应的刺激序列,分工是实验设计;随机选择负责在被试开始时从这些序列中抽取一套,分工是执行公平性。DYE 搭配的理由是在 PsyToolkit 中手写多套顺序逻辑较复杂,组合意义是由图形界面保存顺序集合并自动生成抽取代码。

样式控制包括条目形状、颜色、大小、间距与标签字体大小。图 1 例子使用默认颜色,条目形状为实心圆。全局设置提供自动垂直间距选项,以及是否为所有量表统一条目样式的开关。这些看似琐碎的选项实际决定了生成图片的尺寸与代码中的坐标数字,统一 estilo 可以减少逐个量表调参的工作量。

顺序控制是 DYE 强调的省时点。用户可预先定义多套受控呈现顺序,运行时随机选用一套。论文指出这种逻辑在 PsyToolkit 中实现更复杂,因此由 DYE 生成相应代码。对于教学而言,理解要点是:受控指事先平衡好的多套序列,随机指执行时抽取哪一套,而刺激在套内的顺序仍受控,不是完全随机打乱。

有模型训练吗?DYE 的真实计算过程是什么?

本研究没有训练任何神经网络模型,也没有报告梯度、损失、优化器、冻结或更新参数等训练细节。该节按要求明确说明无训练阶段,以免初学者误以为每个技术解读都必须有模型训练。

DYE 的真实计算过程是实验构造而非模型学习,可以分为 3 类。第一类是界面到产物的确定性生成:把用户填写的选项文字、量表点数、超时时间、字体与坐标转换为 PsyToolkit 脚本语句与对应图片,不涉及统计估计。第二类是布局计算:根据条目大小、间距与自动垂直间距计算每个元素的中心与纵向范围,避免重叠。第 3 类是调用既有执行引擎:最终的刺激呈现、反应收集与数据导出仍由 PsyToolkit 完成,DYE 不替代计时与计分。

因此复现时不需要准备算力或调参,只需确认 R 与 Shiny 环境能打开应用、能上传音频、能导出压缩包并在 PsyToolkit 中编译通过。缺项是论文未给出生成代码的行数、图片分辨率规则与编译耗时,这些与感知结论无关,但影响工程预期。

实验条件:论文给出什么可核对的配置?缺什么?

由于是工具论文,实验条件指可核对的构造配置与运行环境,而不是被试分组与统计检验。论文给出的可核对信息包括:应用访问地址与源代码地址,开发语言为 R 与 Shiny,源代码以 GPL 3.0 自由许可发布;功能上支持指导语页、强迫选择、可变数量李克特量表、工程保存与加载、实时预览、导出压缩包、多套呈现顺序随机选用。

图 1 实例给出的具体配置是理解条件的抓手。下表把预览状态条中的 3 类数量整理为可核对的一览,解决初学者分不清选项数、行数、量表数与刺激数的问题。该表所有数字都来自界面原文,不添加无源的效果值。

配置对象指标名称强迫选择李克特量表音频刺激
图 1 示例设计数量与布局5 options (3 rows)1 scale(s)5 stimuli
图 1 示例设计元素类型类别按钮程度量表待评语音
图 1 示例设计呈现方式点击选项顺序打分播放后作答
图 1 示例设计产物对应按钮图片加坐标圆点图片加 rate 代码音频文件列表

上表的主要价值是建立一一对应:5 个选项对应 5 个按钮图片,1 个量表对应一组圆点与 rate 语句,5 个刺激对应 5 次重复试次。代价是该表只描述实例配置,不能推广为 DYE 支持的上限。论文未报告支持的最大选项数、最大量表数、最大刺激数、音频格式要求与浏览器兼容性,这些是复现前需要自行验证的边界。

论文致谢交代资助来自法国 2030 投资计划下巴黎西岱大学 IdEx 项目中的 inIdEx EFL 项目,参考文献列出 PsyToolkit、Go Listen 与在线可懂度研究的出处。这些信息用于核对来源,不构成方法证据。

主结果是什么?实例配置的数字如何核对?

论文直接报告的结果是工具能力本身:非专家用户可以通过图形界面完成设计并获得可直接导入编译的档案,熟练用户也能节省时间。不存在以准确率或显著性表示的感知实验主结果,因此本节不构造胜负表,而是核对实例中给出的真实参数,说明它们如何支撑可用性判断。

以下问题是:图 1 的 6 点量表与布局参数具体是多少?公平条件是只引用界面原文与图注,不推测其他设计的数值,指标方向不适用好坏,只核对一致性。下表把量表点数、超时与纵向布局放在同一行,便于对照预览与代码的一致性。

实例量表点数超时设置强迫选择纵向中心强迫选择纵向范围量表纵向偏移
元音识别加口音评价61000080[-75, 235]-20
元音识别加口音评价6 点量表超时毫秒数中心坐标值占据区间位置微调
元音识别加口音评价默认颜色顺序呈现上部按钮区覆盖三行按钮下部量表区
元音识别加口音评价左右标签为母语度反应收集窗口网格对齐结果避免重叠与量表区分

上表显示的主要收益是参数具体可执行:6 点量表对应底部 6 个圆点,超时 10000 毫秒定义了每步等待上限,纵向中心 80 与区间等数字定义了按钮区与量表区的分离。结合像素可见内容,按钮区在上、量表区在下,两者纵向不重叠,这与顺序呈现的说明一致。具体代价是多元素不能同屏同时操作,被试需要两步完成,指导语必须写清先选类别再打分,否则会增加困惑与试次时长。未胜出项是论文没有比较 DYE 生成与手写代码在编译成功率或设计耗时上的差异,也没有报告用户测试数据,因此节省时间的判断是基于功能提供的有限解释,不是测得的效率提升,表达上应写为支持而非证明。

如果拿掉某部分会怎样?论文给出哪些反证与边界?

论文没有做消融实验,因此不能写拿掉某组件后指标必然下降。本节按证据展开论文特有的边界条件,可视为工具意义上的反证。

第一个边界是同时呈现的不可行。当结合强迫选择按钮与李克特量表,或使用多个量表时,最终实验只能顺序呈现。这意味着如果教学例子假设被试能边看选项边打分,该假设不成立。设计者必须接受两步流程,或改用单一评价方式。

第二个边界是功能子集。DYE 在当前状态只覆盖 PsyToolkit 有限可能性,模块化只是为以后扩展留接口,不等于现在就能实现任意范式。如果研究需要反应时精细控制、眼动联动或复杂分支逻辑,仍需手写脚本。

第三个边界是样式与坐标的依赖。自动垂直间距与统一条目样式能减少工作量,但一旦关闭自动间距或混用样式,就需要更仔细地检查纵向区间是否重叠。图 1 中强迫选择区间与量表区间分离是一个具体正确例子,反例是若把量表上移而未调整偏移,就会在预览网格中看到重叠,导出后也会在 PsyToolkit 中重叠。这些都是可通过预览发现的问题,而不是需要重新训练解决的问题。

限制有哪些?哪些验证还没有做?

论文直接承认的限制是覆盖面有限。DYE 只实现强迫选择、李克特量表与指导语等常用需求,远非 PsyToolkit 全部能力。模块化设计是缓解方向,不是已完成的覆盖证明。

未验证的方面需要明确列出。论文未报告可用性测试,例如非专家用户完成同一实验设计所需时间、出错率与求助次数;未报告生成代码在不同浏览器与 PsyToolkit 版本下的编译通过率;未报告在线收集数据的质量对比,例如缺失率与超时率;未测量服务器部署成本、并发承载与音频加载延迟。这些缺失不是技术错误,但意味着不能承诺使用 DYE 一定更快、更可靠或更便宜。

另一个限制是呈现时序的固有约束。由于量表基于 rate 命令只在反应收集时显示,任何需要同时比较选项与量表的操作都不适用。研究者在选题时应先判断任务是否允许两步完成,再决定是否采用 DYE 当前版本。

复现先做什么?需要准备什么信息条件?

复现 DYE 的第一步是确认可达性。根据资源状态,代码地址与演示地址当前均可用,已公开。代码以 GPL 3.0 发布,演示部署在语音学与音系学实验室的 Shiny 服务上。复现者应先打开演示地址,加载图 1 类似的元音示例,检查实时预览是否正常显示,再尝试导出压缩包。

第二步是准备最小可运行材料。需要准备若干音频刺激文件、选项文字列表、量表点数与左右标签文字、指导语文本、超时时间与样式参数。下表把复现所需的信息条件整理为清单,解决初学者不知道先填什么的问题。

环节需要准备示例取值DYE 产物下游动作
音频与指导语音频文件加说明页5 stimuli 加指导语文件列表加文本图片导入 PsyToolkit
强迫选择选项文字与行数5 options (3 rows)按钮图片加坐标编译呈现按钮
量表设置点数超时与标签6 点加 10000圆点图片加 rate 代码顺序收集打分
工程管理保存与顺序集合受控多套顺序带注释代码加压缩包随机选用一套

上表的主要收益是把复现拆成可检查的 4 步,每步都有明确产物与下一步动作。具体代价是仍需在 PsyToolkit 中完成导入、编译与发布,DYE 不包办全程。未评测边界是音频格式、文件大小上限与中文标签换行等问题需自行测试。

第三步是核对生成物。打开导出的带详细注释的代码,确认强迫选择与量表部分是否顺序出现,确认图片文件名与代码引用一致,确认坐标区间与预览一致。熟练用户可在此基础上改代码,例如调整超时或增减量表。遇到问题时优先回看预览网格与偏移数值,而不是猜测 PsyToolkit 内部实现。

何时值得尝试 DYE?一句话收束

当研究任务恰好是听音后做类别选择加程度打分,且团队中没有人愿意手写 PsyToolkit 脚本与坐标时,DYE 值得尝试。它把最耗时的拼装与对齐工作变成填表与预览,把多套顺序的复杂逻辑变成自动生成代码,同时保留详细注释供后续手工修改。

当任务需要复杂分支、精细计时或多元素同屏交互时,应直接手写 PsyToolkit 或选择其他平台,并在采用前补做小规模试测,验证顺序呈现是否改变被试策略、超时设置是否合适、在线设备差异是否可接受。

收束来说,DYE 的贡献不是新的感知发现,而是一条务实的衔接:用图形界面降低进入门槛,用可编译档案保留专业扩展性,用模块化为以后覆盖更多范式留出位置。研究生复述时记住这条线,就能准确讲清它做了什么、没做什么以及如何核对。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总