英文题目:English with Brazilian beat: Brazilian English word stress and vowel reduction

会议身份:conference:speechprosody:2026:conference-paper-id:silveira26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别

评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Amanda Post da Silveira:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究输入为美式英语三音节词孤立朗读录音,输出为全元音与弱化元音在时长、共振峰谱、基频与强度上的母语与二语差异判定,难点在于巴西葡萄牙语无频谱央化导致范畴合并与策略代偿难以分离。方法链分四步:朗读采集获取可比语料并送入Praat切分标注,中点第一、第二共振峰与三分点半音基频及平均强度的声学测量提取多维参数,说话人内标准化消除语速与声道差异,分组回归检验语言组与元音类别效应。相对已有重音研究,该工作把频谱弱化缺失作为核心机制差异,揭示二语者以强度夸张补偿时长与频谱弱化不足,具有解释口音成因的实际意义。在三音节词朗读语料下,巴西二语者弱化元音/ə/的时长指标为82(37),高于美式母语者的时长指标68(34)。频谱上母语者央元音与开中后元音在第一共振峰上显著分离而二语者无显著差异,强度上两组全元音均更强但二语组对比更大,基频峰则无组间差异。结论适用边界受限于高水平巴西学习者朗读首音节与次音节重音词,尚未验证自发语篇与感知层面的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,读完要保留什么?

本文的输入是论文原文提供的朗读实验证据,目标是让刚进入语音与音频方向的研究生能够核对方法并用自己的话复述流程。需要保留的信息包括被试构成、刺激规模、录音与标注方式、4 个声学通道的测量与统计处理,以及主要结论的适用边界。输出是 1 篇按学习依赖展开的技术解读,不做超出证据的推广。研究对象是美式英语单词重音在母语者和巴西葡语母语的二语者身上的实现差异。

核心矛盾是英语重音高度依赖元音弱化,而巴西葡语的非重读元音基本保持完整音色且时长对比不如英语极端,因此巴西学习者可能把重音位置读对,但弱化做不到位。全文围绕时长、频谱、基频和响度 4 个可测量通道展开,先讲任务与语言背景,再讲方法全景与每个组件的计算,然后讲样本与统计条件,最后讲结果、反例与复现要点。

例子仅为教学示意,例如把字母词首音节读得更长更响而把非重读音节读得又短又糊,是否做到位要用后文的测量流程来检验,不能凭听感下结论。

英语和巴西葡语的重音路线有何不同?

英语路线把重音看成音段与超音段共同作用的结果。重读元音通常更长、更响、频谱更清晰,非重读元音趋向中央化,常实现为央元音。孤立或焦点语境下音高峰常落在重读音节。原文强调,在众多线索中元音音质对词识别的影响最大,超过基频运动等超音段特征。这意味着判断重音是否地道,不能只看音高曲线是否上扬,还要看弱音节是否真正中央化。

巴西葡语路线则不同。原文报告其最突出音节上有基频峰与下降,时长被视作主要重音线索,非重读元音明显短于重读元音,但差异不如英语极端。关键区别在于巴西葡语非重读元音保持频谱特性,不发生英语式的中央化。两条路线放在一起,就能理解跨语言影响的预测。巴西学习者可能把英语的高前元音与次闭前不圆唇元音等范畴合并,造成词库竞争和检索困难,也可能把母语的时长为主、频谱不变的策略带入英语,导致弱化元音偏长且频谱分布偏宽。

原文还提到巴西葡语与美式英语基频轮廓不同,前者常在重读音节出现平台后接陡降。这些背景不是为了证明哪种语言更优,而是为后文假设提供方向。时长对比幅度、频谱是否集中、基频是否区分、响度是否区分,都要在同一批三音节词上分别检验。

要回答的具体问题是什么?

本文要回答的问题是,在可控的单词朗读任务中,巴西二语者是否像美国母语者那样用元音弱化来支撑单词重音。具体分解为 4 个可检验问题。第一,时域弱化是否存在组别差异,即重读完整元音与非重读弱化元音的时长对比是否在母语者身上更大。第二,频谱弱化是否存在组别差异,即弱化元音在第一与第二共振峰空间是否更集中,是否与邻近完整元音保持距离。第三,基频运动是否区分完整与弱化元音,是否受语言组影响。

第四,平均响度是否区分完整与弱化元音,语言组是否整体抬高响度或放大对比。研究假设集中在第一点。因为巴西葡语通常在重读与非重读之间频谱完整且时长对比小,预测巴西被试的重读与弱读时长比更小。频谱部分的预测是巴西被试不会像母语者那样把弱化元音收窄。基频与响度则作为对照通道,用来判断二语者是否用非母语式声学策略去近似母语目标。

任务限定为三音节词,重音落在第一或第二音节,只分析前两个音节以避开句末 lengthening 对时长的污染。教学上可以这样把握问题边界。本文不研究连续语流中的重音感知,不研究听辨实验,只研究朗读产出中的声学实现。回答问题的方式不是听感打分,而是逐元音测量并做统计建模。

方法全景:一个词从屏幕到数字经历了什么?

先沿一个样本走完全程。某次试验中,屏幕中央先出现注视十字,随后单独呈现一个三音节英文单词,字体为黑色,呈现时间为 1000 毫秒,被试在 3000 毫秒内读出,录音窗口为 4 点 5 秒。录音使用高质量麦克风,在隔音亭内距离屏幕约六十厘米完成。软件使用 E-Prime 2.0,正式实验分 4 个组块,之前有用 20 个非实验词的练习阶段。录音得到后,用 Praat 脚本做切分、标注与音系转写。

脚本由莱顿大学语言学中心的工程师编写并由第一作者改编。自动转写由第一作者和另 1 位语音学家核对,含糊转写直接丢弃。原文报告因此排除了 9 个词,后文在 token 层面又报告排除了 16 个词并保留 6880 个词 token,分析只取第一和第二音节。接着对每个目标元音提取 4 类测量。时长经按说话人标准化以去掉语速差异。

共振峰在元音时间中点测量并从赫兹转为 Bark 感知尺度,再按说话人标准化以控制声道大小差异。基频在元音时长 1/4、二分之一、四分之三处测量并转为半音后标准化。响度取平均声强并标准化。最后按声学通道分别做回归分析,自变量为语言组与元音类型及其交互。这种全景安排的理由是原文明确给出的。

只看前两个音节是为了避开末音节 lengthening,只用孤立词是为了让基频峰与重音对齐更可比,用标准化是为了让组间比较不受个体语速和生理差异主导。

时长组件如何计算弱化对比?

时长组件的白话含义是弱化元音比完整元音短多少。英文名是 duration,弱化对比常用完整与弱化时长之比表达。操作上先切出每个元音的起止点得到毫秒时长,再按说话人转为标准化分以消除有人天生语速快、有人慢的问题。原文报告标准化分范围与离群值剔除区间,并保留 11459 个元音 token 进入时长主模型。模型把语言组与元音数量作为固定因子,检验二语者是否整体更长、重读是否整体更长,以及组别是否改变长短对比的幅度。预测是母语者对比更大。

重音 × 元音弱化: 重音指词中某个音节在时长、响度、音高或音色上更突出,承担区分词义和引导听辨的分工;元音弱化指非重读音节元音在时长上变短、在频谱上向中央集中甚至变为央元音的分工;二者搭配的理由是英语用弱化程度来反衬重音位置,组合意义在于只看重音音节是否响亮不够,还要看非重读音节是否真正弱下去才能判定重音格局是否母语化。

沿样本理解,假设目标词重音在首音节,首元音为完整元音,次音节为弱化元音。理想母语实现是首元音长而清晰,次元音短而糊,二者比值大。巴西二语实现可能首元音也长,但次元音不够短,比值被压缩。后文还要把弱化元音单独拿出来看,分为央元音与次闭前不圆唇元音两类,分别检验二语者是否把这两类都读长了。这种两步走的设计很重要。第一步看整体对比是否随组别变化,第二步看弱化元音本身是否偏长,才能区分是重读读得不同还是弱读没有到位。

频谱组件如何判断音色是否收窄?

频谱的白话含义是元音听起来像哪一个元音。英文名是 spectra 或 vowel quality,常由第一共振峰与第二共振峰刻画。第一共振峰对应开口度与高低,第二共振峰对应前后与圆唇。操作上在元音时间中点测量两个共振峰,从赫兹转为 Bark 以贴近听觉尺度,再按说话人标准化以去掉声道大小差异。原文还报告离群值剔除区间与保留 token 数。

比较逻辑是看弱化元音是否与邻近完整元音拉开距离。第一组比较是次闭前不圆唇元音与其完整邻居高前元音,二者在英语和葡语中都存在,适合检验跨语言范畴是否合并。第二组比较是央元音与其邻近的开中后元音,检验弱化央元音是否真正独立。

时长 × 共振峰: 时长指元音持续时间的长短,负责实现时域弱化对比;共振峰指第一共振峰反映开口度、第二共振峰反映前后位置,负责实现音色空间上的弱化集中;搭配理由是英语母语弱化同时走两条路,时间变短且音色变糊,组合意义在于巴西被试时间上缩减不足且频谱上分布更宽,说明两条弱化通道可以分离受损。

沿样本理解,若次音节目标是弱化前元音,母语实现应比高前完整元音更低更靠后且分布集中。若二语实现把两者都发得更高更靠前且彼此靠近,就支持合并解释。若央元音与开中后元音在母语者身上高低分明而在二语者身上高低与前后都不分,就支持弱化空间更宽、范畴重叠的解释。原文对这两组分别做了多元回归,语言组对前一组的高前与弱化前元音无显著影响,但对后一组的央元音与开中后元音呈现母语分、二语不分的格局。这种不对称结果提示不能把所有弱化元音混为一谈,需要按音位邻居分别讨论。

基频与响度组件各自测什么?

基频的白话含义是声音的高低走势。英文名是 fundamental frequency,常记作 F0。响度的白话含义是声音的能量大小。英文名是 intensity,常取平均声强。操作上基频在每个元音的 1/4、二分之一、四分之三时长点测量并转为半音后标准化,目的是复现元音上的音高运动而不是只取单点峰值。

响度取元音段平均声强并剔除过低与过高离群值后标准化。统计上两者都检验语言组、元音类型及其交互。

基频 × 响度: 基频指声带振动频率对应的音高走势,负责在孤立朗读中标记突出音节的音高峰;响度指平均声强能量,负责标记发音用力程度;搭配理由是二者都是超音段重音线索但可分可合,组合意义在于本研究中基频在组别和元音类型上均无显著效应而响度稳定区分重读与弱读,说明二语者可以用响度通道近似实现重音目标。

沿样本理解,若重音在首音节,母语孤立朗读常在首元音出现音高峰,次元音音高较低,同时首元音响度更大。若两组基频在 3 个时间点都不受组别与元音类型影响,就说明音高不是本任务中的可靠重音标记。若响度在两组都显示完整元音更响,且二语者整体更响、对比更大,就说明响度是跨组稳定的重音通道,而二语者可能用力更大来补偿弱化不足。后文结果正是这个格局。教学上要注意,响度大不等于发音标准,它只说明产出策略不同,需要结合时长与频谱一起解读。

央元音 × 次闭前不圆唇元音: 央元音指发音位置居中的弱化元音,常记作施瓦音,承担英语非重读音节最典型的弱化目标的分工;次闭前不圆唇元音指位置靠近高前元音但略低略后的短元音,承担另一类弱化元音的分工;搭配理由是二者都是本数据集中的弱化元音但来源和邻居不同,组合意义在于分别检验它们是否被缩短和集中,可以定位巴西被试是整体弱化不足还是只在某类元音上合并。

此处再回看两类弱化元音的分工。央元音是英语弱化的典型归宿,次闭前不圆唇元音是另一类弱化目标。把它们分开建模,可以避免把不同舌位高度的弱化混在一起平均掉。原文对央元音保留三千多 token,对次闭前元音保留两千多 token,样本量足以分别检验组别效应。

本研究训练了什么,没有训练什么?

本研究没有训练神经网络模型,也没有更新任何模型权重,因此不存在优化器、学习率、梯度路径与参数冻结问题。真实计算过程是既有工具推理加统计建模。已有工具包括呈现刺激的 E-Prime 流程、切分标注的 Praat 脚本、声学测量流程与 R 语言回归分析。需要明确说明的缺项是原文未报告 Praat 切分阈值、共振峰跟踪参数与回归随机效应结构,只给出固定因子、标准化方式与离群值剔除区间,不能从工具名称推定具体实现细节。

归一化 × 多元回归: 归一化指按说话人对时长、共振峰、基频和响度做标准化,负责去掉语速快慢和声道大小等个体差异的分工;多元回归指以语言组和元音类型为固定因子检验主效应和交互作用的分工;搭配理由是先把个体量纲对齐再检验组别效应才公平,组合意义在于显著的交互作用才能说明弱读与重读的对比幅度本身随母语背景而变化,而不只是整体说话大声或说话慢。

可重放的计算链条是先按说话人标准化,再按通道建模。时长主模型检验语言组、元音数量与交互。弱化元音时长分两类各自检验语言组。频谱按元音对分别检验语言组或元音质量对第一与第二共振峰的影响。基频在 3 个时间点分别检验语言组、元音质量与交互。

响度检验语言组、元音质量与交互。这种分通道建模不是多此一举,而是因为每个通道的量纲、离群值与语言学含义不同,混在一起无法解释。没有训练不等于结果确定。朗读表现仍受被试状态、麦克风距离与标注一致性影响,原文用双人核对与丢弃含糊转写来控制,但未报告一致性系数,这是复现时需要补记的环节。

被试、刺激与数据规模如何保证可比?

被试分为两组各 10 人,男女各半。美国母语单语者年龄十九至四十八岁,平均 25.6 岁。巴西二语者年龄二十一至四十四岁,平均三十岁。巴西被试需报告英语水平分数并参加词汇量测试,只有超过三千五百分且满分五千分者纳入,代表中高级水平。所有被试视力正常或矫正正常,无报告听力问题。

刺激为 360 个三音节英语词,重音在第一或第二音节各半,取自英葡双语语料库。完整词表在 Zenodo 数据集公开,原文给出引用。当前资源状态显示该数据集链接可用,已公开可下载。实验流程为隔音亭朗读,呈现与录音时序固定,含练习阶段与 4 个正式组块。数据规模与筛选条件需要放在一起核对。

原文报告每人产出 360 词共 7200 词,重音分布在第一与第二音节,排除转写含糊后保留 6880 个词 token。弱化元音总数为五千六百七十三,剔除离群后剩余五千五百三十五项进入细分析。响度分析剔除过低过高值后保留一万一千三百数据点。指标方向要先讲清。时长越长代表弱化越不足。

共振峰分布越宽代表集中越差。基频差值越大代表音高区分越强。响度差值越大代表用力对比越强。聚合对象是按元音 token 与按说话人标准化后的值,不是按词平均后的单一分数,统计方法为线性与多元回归,显著性以回归系数与检验值报告。

时长与频谱的主结果是什么?

比较问题是母语者与二语者的弱化对比是否公平可比。公平条件是同一批三音节词、同一朗读流程、同一按说话人标准化,且只比较前两个音节以避开末音节 lengthening。指标方向是完整与弱化时长比越大代表时域弱化越充分,频谱上母语弱化元音与邻近完整元音分得越开代表音色弱化越到位。时长主模型显示语言组与元音数量均有显著主效应,且交互显著,说明时长对比幅度本身随语言背景变化,非母语者对比更小。

单独看弱化元音,两类弱化元音都显示二语者显著更长,支持时域弱化不足的判断。频谱主结果呈不对称格局。高前完整元音与弱化前元音在两组间高低与前后均无显著组别效应,声学上相似。但央元音与开中后元音在母语者身上第一共振峰显著区分而第二共振峰不区分,在二语者身上第一与第二共振峰都不区分,指向弱化央元音与邻近完整元音重叠。

下表整理时长主模型的回归效应,数值与单位保留原文写法,估计值与标准误为标准化量纲,检验值无量纲,概率为显著性水平。

效应EstimateSEtp
语言组主效应0.220.073.07.02
元音数量主效应-1.160.16-7.23<.01
语言组与元音数量交互0.220.102.16.03

表后解释需要同时讲收益与代价。收益是时长对比的组别差异得到统计支持,且弱化元音偏长的方向在两类弱化元音上一致,说明结论不依赖单一元音。代价是原文表格中的毫秒均值与比值属于描述统计,不能直接当作标准化模型的效应量,且频谱前一组未胜出,说明不能把弱化不足推广到所有元音对。未胜出项恰是教学重点。

高前与弱化前元音无组别差异,提醒复现时不要只检验最容易合并的 1 对,而要同时检验央元音系统,否则会得出二语频谱完全正常的片面结论。反例是二语者的弱化前元音与母语高前元音在声学空间接近,但统计上组别主效应不显著,听感接近与统计显著是两回事,需要保留原文的谨慎表述。

去掉音高线索后响度能否独立支撑重音?

比较问题是当基频不能区分重读与弱读时,响度是否仍能区分,以及二语者是否放大了响度对比。公平条件是同一批元音 token、同一标准化流程,基频在 3 个时间点分别建模,响度在剔除离群后建模。指标方向是完整元音响度高于弱化元音代表响度区分成立,语言组系数为正代表二语者整体更响,交互为正代表二语者对比更大。基频结果在 1/4、二分之一、四分之三处均显示语言组、元音质量与交互不显著,说明在本任务中音高峰不是可靠的重音标记。

响度结果相反,语言组、元音质量与交互均显著,完整元音更响,二语者整体更响且对比更大。下表整理响度模型的回归效应,单位与精度保留原文。

效应EstimateSEtp
截距基线59.290.19312.08<.01
语言组主效应3.030.349.02<.01
元音质量主效应-1.970.28-7.01<.01
语言组与元音质量交互2.910.495.98<.01

表后解释要讲清主要收益与具体代价。收益是响度作为重音线索跨组稳定,且二语者用更大的响度对比近似母语目标,支持用非母语声学策略实现音系目标的观点。代价是更大对比不等于更地道,因为时长与频谱仍显示弱化不足,响度补偿可能带来用力过度的听感。负结果是基频全线不显著,不能把孤立词朗读中的音高峰默认当作重音证据。未评测边界包括连续语流、不同焦点条件与不同重音位置是否改变基频格局,原文未覆盖,复现时不应推广。

把两张表放在一起看,时长表说明弱化幅度不够,响度表说明用力对比来补,基频的缺席说明补偿通道不是音高,这正是巴西口音英语在本研究中的声学画像。

哪些结论站得住,哪些还只是可能?

直接报告的部分包括时域弱化组别差异显著、两类弱化元音在二语者身上更长、央元音与开中后元音在母语分而二语不分、基频三时间点无显著效应、响度完整高于弱化且二语整体更高对比更大。这些都有回归系数与检验值支撑,可以复述为显示或报告。有限解释的部分是频谱更宽反映母语巴西葡语影响,以及二语者合并范畴形成混合系统。

原文用可能与似乎等措辞连接声学事实与语言背景,支持但不证明因果,因为本研究没有操纵母语经验或追踪学习过程。待验证的推测包括词汇竞争增加、词检索受影响等心理机制,本文为产出实验,未测量听辨误判率与反应时,不能承诺这些量得到改善。缺失证据不是技术错误,但需要点名。样本每组仅 10 人,年龄跨度大,词汇量门槛只保证下限,无法代表所有水平。

标注一致性无系数,Praat 参数与随机效应结构未报告,毫秒均值的聚合口径与标准化模型的对应关系需要细读。总体趋势不等于每组每步成立。例如响度整体趋势成立,但不能推出每个说话人或每个词都如此。训练资源、推理开销与延迟在本研究不适用,因为无模型训练,但人工核对成本与录音时长是实际成本,复现时要预算双人核对与离群值复检时间。

复现先做什么,需要补哪项验证?

何时值得尝试这种方法。当研究问题是二语重音的声学实现而非听辨,且刺激可控制为三音节词并能避开末音节 lengthening 时,本文流程值得借鉴。当目标是连续语流或自发对话时,不应直接套用孤立朗读的基频结论。复现先做四件事。第一,按原文招募条件筛选被试并记录年龄、性别、词汇量分数与听力视力状态,保证组间可比。

第二,使用公开词表与相同呈现时序,固定麦克风距离与录音窗口,保留练习阶段。第三,用 Praat 做切分与转写并安排双人核对,明确丢弃标准与离群值区间,分别记录词 token 数、元音 token 数与各通道保留数。下表整理原文报告的数据规模链条,用于核对复现时每一步是否对齐,数字保留原文写法。

环节对象数量保留或排除备注
刺激呈现每人三音节词360共 7200 词重音在第一或第二音节
词筛选词 token6880排除 16 词只取前两个音节
弱化元音池弱化元音5673剔除后 5535 项含两类弱化元音

表后解释要说明该表的用途与局限。用途是提供可核对的样本流水账,复现时若某一步数量级偏离过大,应先检查切分与转写而不是直接解释为口音差异。局限是毫秒均值、共振峰 Bark 值与基频半音值的具体质控阈值在原文分散报告,复现时需把每次剔除前后的数量都记下来。还需补的验证包括报告标注一致性、公开 Praat 与 R 脚本版本、补充随机效应结构、按重音位置分层报告效应,以及增加听辨实验检验响度补偿是否真正帮助母语听者判断重音。

只有补上这些,才能把产出差异与交际效果连接起来。数据集方面,刺激词表已公开可用,但录音本身未说明是否公开,复现时应按原文引用并遵守被试隐私。

一句话收束:该记住的方法与边界是什么?

记住的方法是先按说话人标准化消除个体差异,再分通道检验组别是否改变重读与弱读的对比幅度,而不是只比较绝对值。记住的事实是母语者时域弱化更充分,二语者弱化元音偏长且央元音系统频谱更宽,基频在本任务中不区分而响度稳定区分且二语对比更大。记住的边界是结论限于三音节孤立词朗读与中高级巴西二语者,不能推广到自发语流、其他水平段或其他母语背景。常见误解需要纠正。

第一,重音读对位置不等于弱化做到位,时长与频谱要分别看。第二,响度对比大不等于发音更标准,它可能是补偿策略。第三,基频曲线平坦不等于没有重音,可能是任务与语言共同作用的结果。第四,个别元音对无差异不等于整体无差异,需要按邻居分别检验。学习依赖至此闭环。

从任务与路线差异出发,经过测量与建模,再到结果与反证,最后落到可执行的复现清单,初学者可以沿同一条链条用自己的数据重走一遍,并用本文的表格与回归结构核对每一步是否对齐。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 48 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总