英文题目:The ArtComp dataset: Articulatory and Acoustic Measurements of Swedish in Speech with Naturally Manipulated Jaw Position

会议身份:conference:interspeech:2026:conference-paper-id:cortes26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #发声与构音 #语音 #语音属性识别

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Elísabet Eir Cortes:机构信息未能从会议 PDF 纯文本可靠映射
  • Lisa Gustavsson:机构信息未能从会议 PDF 纯文本可靠映射
  • Ellen Marklund:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作输入为中央标准瑞典语18个元音在i"b b双唇塞音语境中从极弱到喊叫的朗读发音过程,输出为时间对齐的电磁发音仪关节点轨迹、声门图波形、唇部双视角视频与高质量音频的声学分析结果,难点在于可控地制造超出日常会话范围的下颌开度扰动并观测其余发音器官的自适应代偿。方法链分为三步:先用阻尼输出加视觉辅助装置诱发连续可变的发声努力以自然撑大下颌开度,其输出进入多模态同步采集环节完成关节点、声学与生理信号配准,最后经咬合板坐标归一化与三法融合的共振峰估计进入声学标注。相比咬合块、机械负载与Lombard噪声等已有扰动手段,该范式同时覆盖过弱与过强两端且避免口内异物与听觉不适,具有更高的自然度与动态范围。在以环境噪声诱发Lombard语音为对照的发声努力对比任务下,DOVA条件的相对强度范围指标高于环境噪声对照的相对强度范围指标,研究以10 dB步进设置四或五个衰减等级以覆盖从极弱到喊叫的连续区间。该结论目前仅适用于受控朗读元音的下颌开度代偿分析,尚不能外推至辅音、连续会话或病理人群。其适用边界受限于7名发音人的3000个元音语料中仅1100个被完整分析的受控朗读条件,尚未验证连续会话与病理人群的外推。原文未披露训练、推理或部署成本,本工作无模型训练。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决什么学习依赖?

本文的输入是论文原文提供的采集与后处理描述,目标是让刚进入语音发音研究的研究生能够不依赖二手解读,直接复述出数据如何产生。必须保留的信息包括说话人数量与构成、语音材料范围、传感器布置、诱发方法、设备参数和后处理坐标变换,输出是 1 篇按学习依赖展开的技术解读。学习依赖的第一环是理解任务:研究者想观察当下颌位置被扰动时,唇和舌如何自适应补偿。如果只录日常会话,下颌变化太小,补偿行为看不清楚。

如果用咬块强行固定下颌,虽然扰动大,但口中有异物,行为不够自然。因此论文选择用从极轻到喊叫的发声努力度连续拉大下颌开度,把下颌当作可控的自变量,把其他发音器的运动当作因变量。这种设计决定了后文所有设备选择和标注流程,读懂这一因果链,才能理解为什么要同步记录发音、声门和音频 3 路信号。

已有电磁发音数据做了什么,为什么还需要瑞典语大努力度数据?

电磁发音仪,英文名 electromagnetic articulography,简称 EMA,白话说就是在发音器上贴小线圈,在电磁场里跟踪它们位置的方法。原文先列出英语、意大利语、普通话、粤语、客家话、潮州话、波兰语、德语、挪威语、法语、芬兰语、俄语、冰岛语、爱沙尼亚语和日语的 EMA 数据集,说明多语种已有积累。瑞典语方面,作者回顾了舒尔曼在 1985 至 1989 年记录的 9 名说话人,传感器在下颌、上唇和下唇,材料为正常与大声元音;恩沃尔记录的 1 名说话人,5 个传感器加腭电图,材料为元音语境中的擦音;贝斯科等人记录的 1 名说话人用于重合成。

舍茨等人用 2 个唇传感器记录 50 人研究年龄差异,以及用 10 个传感器记录 27 人研究方言元音。相关路线之二是扰动下颌的方法,传统做法是咬块,让说话人用磨牙咬住小块固定物,另有机械负载和牵张反射等方法,更自然的尝试包括边嚼口香糖边说话。大声导致下颌张大早有报道,因此被作者称为自然咬块。作者指出,据其所知,只有盖乌曼对德语和舒尔曼对瑞典语采集过不同努力度下的发音数据,且都只有正常和大声两档。

于是缺口很清楚:瑞典语缺少覆盖 18 个元音、从极轻到极响连续多档、带舌传感器的自然扰动数据,ArtComp 正是为填补这一缺口而建。

要观察的补偿行为到底指什么?

补偿行为指当下颌因大声而张得比平时更大时,说话人为了仍发出可辨认的元音,用唇、舌等其他发音器做出的调整。举例来说,这是一个教学例子,不是论文报告的数值结论:假设某元音平时下颌只张开一指宽,大声时张开两指宽,如果舌位不变,共鸣腔形状会完全走样,说话人就可能把舌体抬高或把唇收圆来抵消多余的开口。论文要提供的就是能算出这种抵消的数据。为此需要同时满足 3 个条件。

第一,下颌开度变化要足够大且连续,否则看不到夸张条件下的策略。第二,其他发音器的位置要与声音严格时间对齐,否则无法判断运动对应哪段元音。第三,材料要覆盖中央标准瑞典语,英文名 Central Standard Swedish,简称 CSS 的全部元音对立,否则无法比较不同元音对下颌扰动的敏感度。ArtComp 把 18 个 CSS 元音放在双唇音语境中,正是为了给每个元音提供自然的高起点和高终点,便于切分和比较。

从说话人进棚到数据可用,全流程如何串起来?

先沿一个样本走完全程。某说话人坐在隔音室的专用椅上,头靠支撑保持在电磁场内,身上贴好参考传感器和发音传感器,戴好声门图电极和同步用头戴麦克风,眼前是呈现语音材料的屏幕和显示音量的 VU 表。她看到提示词,用当前要求的努力度读出一个词,声音经主麦克风进入录音软件,同时头戴麦克风把声音送入 EMA 同步盒,声门图记录声带接触,摄像机拍唇部,EMA 以每秒 100 次记录线圈位置。

读完所有努力度档后,研究者在控制室用软件切分元音、测量强度与基频、估计共振峰,再把 EMA 数据旋转平移到个人咬合平面坐标系,最后用拍板声光信号把视频、声门图、发音和音频对齐。走完这个闭环,就得到一条时间对齐的多通道样本。

自然咬块 × 可变发声努力度: 自然咬块指不用口含固定物而靠大声说话让下颌自然张大的扰动方式,可变发声努力度指从极轻到喊叫连续调节用力程度的操作手段,前者负责提出扰动原理,后者负责提供可执行的操作,二者搭配是因为只有努力度连续变化,下颌开度才会连续且夸张地变化,组合后使研究者可以在不放入异物的情况下观察唇和舌如何补偿。

全流程的关键选择是放弃隆巴德效应,即在噪声中不自觉提高音量的方法。原文给出两个理由:第一,噪声只能诱发比正常更大的声音,无法诱发极轻音,而本研究要从仍能发声的最轻到最响全覆盖。第二, eliciting 最强档时大噪声会引起听觉不适。改变说话人与听者距离虽最自然,但不适合需要固定电磁场的控制实验。因此第一作者自制了 DOVA 方法,英文全称 Damped Output and Visual Aid,白话说就是把话筒输出衰减后再送回 VU 表,迫使说话人更用力才能让红灯亮起。

研究者在控制室以 10 分贝为步长逐步衰减,共四到五档,具体档数取决于个人能力。说话人反馈说盯着红灯后不用分心想音量,可以专注发音。作者引用对比研究称该方法在发音响应和强度范围上不亚于噪声法,这构成方法合理性的直接证据。

传感器贴在哪里,设备参数如何保证可比?

发音记录用 Northern Digital 的 Wave 系统,采样 100 赫兹,场体积为 50 毫米立方,测量传感器为 3 毫米立方、5 自由度,参考传感器为 6 自由度,用于头动校正。音频用 AKG CK93 超心形电容麦克风加 Scarlet 2i2 声卡,用 Reaper 录制,双通道立体声,采样 48000 赫兹,麦克风距口约 40 厘米,略偏角度指向嘴。声门图用 EG2-PCX 设备,4 个电极用尼龙搭扣固定在喉两侧,信号分路送声卡和示波器监看。视频用两台运动相机从正面和侧面拍唇部,1080p、每秒 30 帧、线性视场,用平板经无线同步启停。

传感器布置贴近已有公开库:下颌传感器粘在系带右侧牙龈下方,上唇、下唇各一在唇红缘中央,左口角一枚,舌尖距舌尖约 1 厘米中线一枚,舌体在舌背一枚,鼻梁一枚参考传感器。舌传感器先用无毒笔标记位置以便脱落后续贴,口内用组织胶,口外用硅胶加手术胶带,线从右口角引出留出前突余量。个性化咬合板用加热的蜡片包绕压舌板制成,含上颌咬合印和中矢状线,线上贴两枚传感器,分别在门齿唇侧和第一二磨牙之间,用于后文坐标变换。

下面这段先说明看图任务:这张侧面轮廓图是理解所有运动数据空间含义的基础,需要确认每个红点对应哪个发音器,以及参考点在哪里。

看图路径: 1. 先找到鼻梁处的参考传感器,再沿中矢状轮廓向下找上唇、下唇和下颌点;2. 再在舌面上定位舌尖与舌体两个绿点,确认舌传感器都在中线上;3. 最后看左下角唇部俯视小图,确认口角传感器在左侧口角

原论文 Figure 1:REF: reference sensor, UL: upper lip, LL: lower lip, JW: jaw, TT: tongue tip, TB: tongue body,…

论文图 1。原论文 Figure 1:“REF: reference sensor, UL: upper lip, LL: lower lip, JW: jaw, TT: tongue tip, TB: tongue body, MC: mouth corner”。

这张图显示右侧为面部前方、左侧为后方还是以常规解剖为准的侧面示意,鼻梁顶部红点为参考传感器,上唇和下唇红点在唇缘,下颌红点在下唇下方,舌尖与舌体红点沿舌面中线分布,左下小图补充了上唇、下唇和左口角的正面关系。读图时应注意该图只是协议示意,不是某次实际发音的轨迹,点的大小不代表传感器实际尺寸,线条为示意轮廓。它的教学价值在于把后文所有毫米坐标锚定到解剖位置,缺少这张图就无法理解纵向与前后向的含义。

电磁发音仪 × 声门图: 电磁发音仪负责追踪唇、下颌和舌面上粘贴线圈的 3 维位置,给出构音器的运动轨迹,声门图负责记录声带接触面积的变化,给出发声源的开闭状态,二者搭配的理由是发声努力度同时改变声源和声道形状,只有把运动数据和声门数据在时间上对齐,才能区分下颌被动张大和主动补偿,组合后新增的作用是为每个元音同时提供滤波器形状和声源状态。

没有模型训练时,真正的计算工作在哪里?

本研究没有训练神经网络,因此本节明确说明没有训练阶段、没有梯度更新、没有参数冻结与解冻,真实计算是标注、归一化、共振峰聚合估计和坐标变换 4 类确定性处理。音频后处理先经听辨和声学检查确认音位身份,再在 Praat 中手工切分,元音按声学定义从第一个声门脉冲到后接双唇塞音完全闭合处,并参考视频辅助。强度处理把每次录音在距口 40 厘米处测得的电平归一化,再换算为个人强度范围的百分比,即相对强度,英文名 relative intensity。

这样做使跨录音和跨说话人的努力度可比。高基频下自动共振峰跟踪不可靠,作者未采用自动估计,而是用三法聚合:宽带语图人工在横纹能量带上凭经验定位;Sopran 中半手动逆滤波,以声源谱包络平滑和闭合相无纹波为调谐准则;自编代码在稀疏谐波线谱上按谐波相对幅度修正,以等强谐波之间为中心、越强越靠近强谐波为规则。三法结果再用 Madde 合成验证。

发音后处理把头动坐标系经咬合板数据平移旋转到说话人参考工作空间,水平面为上颌咬合平面,原点在上门齿尖,前后向按个人咬合平面对齐。视频经同步后按材料分段、裁剪放大唇部并增强对比与清晰度。同步靠拍板在多通道留下的声光标记手工对齐。

相对强度 × 基频: 相对强度指把每次录音在距口 40 厘米处测得的强度归一化为个人强度范围百分比的量,基频指声带振动频率,前者负责统一不同录音增益和个人音量差异,后者负责标记发声努力度升高时必然升高的声学副产品,二者搭配是因为只看相对强度会忽略基频对共振峰估计和发音的混淆,组合后提醒使用者在分析补偿时必须同时报告二者。

宽带语图人工判读 × 逆滤波: 宽带语图人工判读负责在能量横纹上凭语音学经验直接定位共振峰,逆滤波负责在 Sopran 软件中手动调整滤波器以得到平滑声源谱和无纹波闭合相,前者分工是快速给出候选,后者分工是用声源模型验证候选是否合理,二者搭配是因为高基频下谐波稀疏使自动跟踪不可靠,组合后通过合成再验证形成第一作者提出的聚合估计流程。

咬合板定标 × 说话人参考工作空间: 咬合板定标负责用带有两个传感器的个性化蜡板记录每人上颌咬合平面和中矢状线,说话人参考工作空间负责把头动坐标系平移旋转到以上门齿尖为原点、咬合平面为水平面的统一坐标系,前者提供个体解剖基准,后者提供跨说话人可比的数学框架,二者搭配才能把不同头位和头形的原始数据投影到同一平面,组合后新增的作用是使毫米级的舌位比较在 7 人之间成立。

谁来说,说什么,在什么条件下说?

为回答补偿问题,实验条件必须交代说话人、材料、努力度档和录制流程。下面这段提出比较问题:在多大的人群和材料覆盖下讨论补偿才公平,设备条件是否一致,强度指标方向如何理解。公平条件是同一人、同一元音、同一语境下比较不同努力度,指标方向是相对强度越大表示越用力,下颌预期张得越大。

条件指标轻端重端备注
说话人构成人数与年龄7 人母语者3 女 4 男 31 岁范围 22 至 37 岁无听力问题
发音采样采样与场100 赫兹50 毫米立方传感器 3 毫米立方 5 自由度
努力度控制衰减步长与档数10 分贝步长四到五档按个人能力调整
材料规模样本与已分析3000 个样本1100 个已分析覆盖 18 个元音

表后需要解释主要安排与代价。7 人规模在 EMA 研究中不算小,且招募自第一作者同事与熟人,均签署知情同意并通过斯德哥尔摩地区伦理审批,每人获 3 张电影票。材料为 18 个 CSS 元音放在重读语境中,双唇语境提供自然的高起止点,元音列表覆盖长短与圆展对立。流程上每人约 3 小时,先读变努力度块,感到达极限或不想再伤嗓即停止,块间休息并检查传感器,舌体传感器最易脱落需重贴,1 名说话人缺视频属技术故障。

代价是伦理与疲劳限制了极响端的样本量,且传感器线和胶水不可避免带来轻微机械干扰,作者明确承认不能排除影响。资源状态方面,本次未发现来源绑定且完成验证的公开链接,因此不得声称数据或代码已公开,只能按论文描述复现流程。

处理后的数据长什么样,能支撑什么判断?

论文报告的数据预览不是统计检验,而是可视化验证处理链是否跑通。对象为同一说话人读两个词在 0 分贝和 85 分贝相对强度下的数据,左两列为传感器垂直位置随时间变化,虚线标出声学定义的元音起止,右两列为同一段在中矢状面的 2 维轨迹,叠加在说话人轮廓示意上,颜色按深红上唇、红下唇、蓝下颌、绿舌尖、深绿舌体区分。下面这段先提出读图任务:需要确认轻响两端在时间深度和空间幅度上是否拉开,以及不同元音是否有别。

看图路径: 1. 先对比左两列时间曲线的上下两行,看 85 分贝时蓝色下颌线下探深度;2. 再看虚线标出的元音起止段内舌体与下唇是否同步下移;3. 最后看右两列二维轨迹中绿色舌轨迹在纵向上的拉长幅度

原论文 Figure 2:Two leftmost columns: Time variations of vertical dimension of sensor data from one speaker…

论文图 2。原论文 Figure 2:“Two leftmost columns: Time variations of vertical dimension of sensor data from one speaker uttering [i"6:b] and [i"bu:b].”。

从像素可见,上行 0 分贝时各线起伏平缓,蓝色下颌线接近水平,下行 85 分贝时蓝色线在元音段内明显下探呈 U 形,下唇红线同步下移,舌尖与舌体绿线也向下并拉长,右列 2 维轨迹在纵向上显著伸长,且两个元音的舌形走向不同。这显示处理后的数据保留了元音间差异和努力度间差异,尤其下颌差异最大,支持该数据集能用于研究补偿的判断。

但这只是单人单次展示,不能推广为所有说话人或所有元音都如此,论文也只称三分之一材料已完全分析,侧重发音适应的初步观察。未胜出的边界是共振峰聚合估计未给出误差数字,视频缺失 1 人,极轻与极响端的频谱稀疏问题仍依赖人工,这限制了直接拿来训练声学到发音反演模型的即插即用程度。

为落实可核对的规模,下面整理第二张数字表,它只用原文连续原句逐字覆盖,不做计算与换算。表前问题是:材料量和努力度档是否足以支撑跨元音比较,条件是否在同一语境下可比。

条件指标基线端高努力端比较对象
语音材料样本量3000 个样本1100 个已分析18 个瑞典元音双唇语境
努力度档衰减与档数10 分贝步长四到五档从极轻到喊叫
预览示例相对强度0 分贝85 分贝同一说话人两元音

表后解释是:3000 与 1100 的数字表明总量可观但已分析仅约三分之一,适合先做小样本方法验证再扩展;四到五档乘以 18 元音可形成每人稠密的努力度曲线,优于以往只有正常与大声两档的设计;0 与 85 分贝的预览跨度显示强度动态足够大。代价是档数因人而异,跨人比较必须用相对强度而非绝对分贝,且高努力端伴随基频升高,共振峰估计需人工介入,自动化程度低。

如果换一种诱发方式,结果会一样吗?

论文没有做消融实验式的模型对照,但报告了诱发方法的已验证对照,可视为方法层面的反证。作者比较了 DOVA 与传统环境噪声法在元音子集上的声学与发音特征,报告显示 DOVA 的发音响应和相对强度范围更大,结论是 DOVA 至少不亚于传统方法,甚至更高效。这支持选择 DOVA 而非隆巴德效应的决定。但需注意该对照只在子集上完成,未给出完整被试数、统计方法和效应量数字,因此只能表述为支持,不能表述为证明全面优胜。

另一个隐含对照是咬块传统:咬块固定下颌位置恒定,而本方法下颌位置连续可变且无异物,优势是自然度,代价是下颌位置不可精确预设,只能事后用相对强度排序。若研究目标是固定开口下的即时补偿,咬块仍是更直接的工具;若目标是观察连续夸张开口下的适应策略,本数据集更合适。未评测的边界包括未比较改变距离法,未测量听觉不适评分,未报告重测信度,这些都是复用者需要补的验证。

哪些混淆和缺项必须在使用前讲清?

作者在讨论中主动列出两点限制。第一,发声努力度升高同时升高基频,因此努力度和基频对发音的影响必须分别考虑,不能把下颌张大全部归因于用力。第二,EMA 传感器虽设计为微创,仍不能排除机械干扰,舌面贴片和引线可能改变自然发音。除作者所列,还应指出三项缺项。第一,共振峰聚合估计依赖人工与合成验证,主观性较高,且未报告跨标注者一致性。

第二,强度归一化依赖 40 厘米处 VU 表读数和录音增益微调,若复现时距离或指向不同,相对强度不可直接比较。第三,数据集仍在建设中,计划增加说话人和处理更多元音,当前已分析量有限,总体趋势不等于每组每步都成立。相关性不等于因果:下颌与舌位同步下移可能是被动牵连,也可能是主动补偿,需结合功能主成分分析等后续建模才能分离,论文预告的后续研究正是此方向。未测量误判率、延迟或成本,因此不承诺在合成或识别任务上带来改善。

要复现采集与处理,先做什么,需要什么条件?

复现应按依赖顺序先做三件事。第一,重建 DOVA 环路:准备可调衰减器、VU 表和呈现屏幕,把话筒输出经衰减送回 VU 表,训练说话人盯住红灯并以 10 分贝步长逐档加力,记录每人在距口 40 厘米处的强度范围以便事后换算相对强度。第二,重建 EMA 基准:为每人定制咬合板,在中矢状线上贴两枚传感器,记录咬合平面,正式记录时用鼻梁参考传感器做头动校正,采样设 100 赫兹,音频设 48000 赫兹双通道,声门图与视频同步用拍板打点。

第三,重建标注链:用 Praat 按从首个声门脉冲到后接双唇闭合的声学定义切分,高基频元音不用自动共振峰跟踪,改用语图人工加 Sopran 逆滤波加线谱修正三合一,再用合成验证。关键超参数与信息条件包括电磁场 50 毫米立方、传感器 3 毫米立方、麦克风距口 40 厘米、视频 1080p 每秒 30 帧、每会话约 3 小时并允许随时重读。常见误解是以为相对强度是绝对声压级,其实它是个人范围的百分比,跨人比较绝对分贝会错。

另一误解是以为坐标原点在电磁场中心,其实已转换到上门齿尖为原点的咬合平面坐标系。建议先用 1 人的两元音两档跑通全链,再扩展到 18 元音。

何时值得尝试这个数据,还需补哪项验证?

当研究问题是下颌被自然扰动时唇舌如何补偿,或需要大动态发声努力度下的瑞典语发音与声门配对数据时,值得尝试本数据集的思路。它同时给出运动、声源和声音 3 路时间对齐数据,且材料覆盖全元音、努力度从极轻到喊叫连续多档,这是以往两档设计做不到的。不适合的场景包括需要固定开口的即时补偿实验、需要大样本训练端到端反演模型、需要无传感器自然语音的场景。复用前还需补三项验证:报告共振峰人工估计的一致性与误差。

报告跨说话人相对强度与基频的联合分布,以分离二者混淆;补测传感器佩戴前后的声学对比,量化机械干扰。本文无公开链接可确认,因此按未发现可用资源处理,不作已公开表述。总体判断是:方法细节足够复述,预览数据支持其能呈现夸张下颌与补偿运动,但定量结论仍待后续功能主成分分析与更大样本验证,可能的扩展包括声学到发音反演、发音合成与模型训练,使用时应保留努力度与基频双变量视角。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总