英文题目:Masculinity and Sexual Orientation as Predictors of f0 Variation in the Speech of Australian English Speaking Men
会议身份:
conference:interspeech:2026:conference-paper-id:shea26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#统计分析 #社会语音学 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Timothy Shea:机构信息未能从会议 PDF 纯文本可靠映射
- Hannah White:机构信息未能从会议 PDF 纯文本可靠映射
- Joshua Penney:机构信息未能从会议 PDF 纯文本可靠映射
- Anita Szakay:机构信息未能从会议 PDF 纯文本可靠映射
- Felicity Cox:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为77名澳大利亚英语男性的图片描述连续语音,输出为局部f0、f0差分动态性与f0极差三类指标,难点在于性取向、男性角色态度与话题在人内与人际层面交织且年龄分组带来异质性。方法分四步依次推进,先过滤元音与响音辅音并剔除犹豫标记以净化可测区间,再用MacReaper提取声门闭合时刻并以10毫秒步长估计局部f0。接着按200毫秒静音切分话语并计算相邻f0差分与话语内极差,最后将三类指标送入线性混合效应回归检验性取向、男性角色态度得分、年龄组与话题的交互,上一步的话语级指标直接构成下一步建模的因变量。与仅比较平均f0的已有方法不同,本文同时建模动态性与话题切换并引入男性角色态度量表,使社会意义索引过程可在人内条件下被量化检验。在图片描述任务语料条件下,年龄组与性取向交互的f0差分指标为3.219,高于话题与性取向交互的f0差分指标0.979。局部f0仅年龄组达到显著,30岁以上组预测f0低于30岁及以下组,同时30岁以上组男性角色态度得分越高f0差分越小而年轻组无此趋势。该结论适用边界限于在澳大利亚完成中小学教育的成年男性图片描述语体,尚未验证自发对话与跨方言外推,受限于女性群体与自然对话场景。原文未披露训练、推理或部署成本
🔗 开源与复现资源
- 第三方资源:https://github.com/google/REAPER — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?要解决的声音社会学问题是什么?
本文的输入是澳大利亚英语男性的连续朗读式描述语音,以及每位说话人的自我报告信息。研究者想回答的不是语音识别或合成问题,而是一个社会语音学问题:在澳大利亚英语语境下,男性的性取向和对传统男性气质的认同程度,是否能预测基频相关声学特征,以及说话内容是否为 LGBTQ 相关话题时会不会改变这些特征。
白话先说 3 个声学概念。基频就是声带振动的快慢,用赫兹表示,听起来是声音的高低。局部基频是每隔很短时间估计出的瞬时高低。基频动态性是基频变化的速度,本文操作为相隔一段时间的两个基频估计值之差的绝对值,差越大说明声音抖动越快、语调越活。基频范围是一句话内最高与最低基频拉开的距离,反映整句的伸展程度。
性取向 × 霸权男性气质: 性取向分工是区分说话人自我报告的群体归属,本文操作为男同性恋与双性恋以上合并组对比异性恋组;霸权男性气质分工是描述要求男人回避女性化、回避情感表达的社会压力,本文用对传统男性角色的态度量表来代理。搭配理由是前者是身份类别,后者是价值观连续体,二者可能交叉。组合意义是检验声音差异到底来自群体标签,还是来自对男性规范的认同程度,以及二者是否被年龄调节。
本文必须保留的关键信息是样本只包含在澳大利亚完成全部中小学教育的男性,排除了有言语或听力问题的人,最终 77 人。输出不是分类谁是同性恋,而是报告 3 组因变量在统计模型中的显著效应和交互。初学者容易误以为音高高就等于听起来 gay,本文恰恰要检验这种简化说法在澳大利亚数据中是否成立。
前人关于音高与性取向争了什么?为什么还要看男性气质?
从 1990 年代开始,男性性取向与语音的关系被系统研究,音高是最常被检验的变量之一。原文回顾指出,局部基频在多数研究中没有与性取向建立稳定联系,只有一个比利时荷兰语研究发现男同性恋平均基频更高。与之相反,感知实验多次发现听者会把更高音高的变体判断为更 gay,但这说的是听者的联想,不是说话人实际生产时一定更高。
动态性方面的证据更偏向存在差异。法语男同性恋与异性恋对比、德语男同性恋与异性恋对比都报告了更大的基频变化。范围方面,有个案研究描述某说话人用假声来标示身份,但原文强调那只发生在特定社交语境,且经过多层索引,不是稳定的群体标记。作者还提醒不同研究在目标人群、样本量、诱发任务和数据类型上差异很大,解释分歧时必须考虑方法差异。
男性气质这条线来自霸权男性气质理论。该理论认为西方主流男性规范要求回避女性化、回避除愤怒外的情感表达、回避与同性恋的关联,违反会受惩罚。按此逻辑,男人应避免偏女性化的高音高和大起伏。感知研究确实发现被听成 gay 的声音也被评为不够男子气。但生产研究并不一致,有研究没有发现男性气质与音高的稳健关系。于是问题变成:认同传统男性角色的男人是否真的说得更低、更平,而澳大利亚英语此前几乎没有从性取向角度检验过这些变量。
三个预测到底在赌什么?为什么要拆成三个因变量?
本文目标很明确:同时检验说话人性取向和对传统男性性别角色的态度,对 3 个基频变量的影响,并加入指涉话题作为语内变量。3 个预测是:第一,性取向和传统性别角色认同都不显著影响局部基频;第二,男同与双性恋以上组比异性恋组有更大的基频动态性,越认同传统男性角色则动态性越小;第三,前者在基频范围上更大,后者在范围上更小。
把局部基频、动态性、范围拆开是有意为之。如果只看平均音高,语调活泼但均值不高的人会被误判为没有差异。动态性捕捉相邻时刻的变化速度,范围捕捉整句的跨度,二者分别对应说话是否单调这个社会评价。预测 1 赌的是高低本身不区分群体,预测 2 和预测 3 赌的是用法区分群体。
另一个关键是交互思维。作者不预期简单的男同更高更活,而是预期效应被年龄和话题调节。例如年长组可能更受传统规范约束,年轻组成长环境更自由;又如只有特定群体在 LGBTQ 话题下才放开音高。因此模型从包含性取向、态度分数、年龄组、话题的复杂交互出发,再逐步简化。
从一张照片描述到三个数字:全流程如何走通?
先沿一个样本走完全程。假设 1 名 30 岁以下的男同性恋参与者进入安静房间,第一作者用录音机录下他描述 9 张照片的语音,前 6 张被选为性取向中性主题,后 3 张为 LGBTQ 主题。录音后他填写出生日期、性取向和 8 道传统男性角色态度题。研究者只保留元音和响音辅音,去掉嗯啊等犹豫标记,用 MacReaper 计算每次声门闭合瞬间的时间间隔,再每 10 毫秒算出一个局部基频估计值。停顿超过 200 毫秒就切分为一句话,在每句话内每隔 5 个估计点算 1 次差值绝对值,同时算整句最大值减最小值作为范围。最后这 3 组数字分别进入 3 个线性混合效应回归模型。
指涉话题 × 话题风格转换: 指涉话题分工是说话内容本身,本文操作为描述中性照片对比描述 LGBTQ 主题照片;话题风格转换分工是同一个人在不同话题下改变发音的现象。搭配理由是话题是可操纵的语境变量,风格转换是待观察的语内变化。组合意义在于把话题作为被试内条件,与性取向做交互,可以检验是否只有特定群体在特定话题下扩大音高变化,而不是所有人都随话题变化。
这个流程的安排理由是:图片描述能自然诱发话题对比,又比朗读更接近自发语音;只保留浊音段是为了让基频估计可靠;每隔 5 个点算差是为了既不跳过起伏,又不把声门抖动当成语调变化。随机结构为说话人截距上加话题斜率,允许每个人对话题的敏感度不同。
三个因变量和四个自变量各自怎么算?
因变量有 3 个。局部基频由每 10 毫秒的估计值直接构成,单位赫兹。自变量差值由每隔 5 个估计点的差值绝对值构成,单位也是赫兹,但它度量的是变化量。基频范围由每句话内估计值的极差构成,单位赫兹。注意三者聚合对象不同:前两者是大量逐点观测,后者是一句话一个值。
局部基频 × 基频动态性: 局部基频分工是描述某一时刻声音振动有多快,对应听感上的高低;基频动态性分工是描述基频在短时间内变化有多快,对应听感上的活泼或单调。二者搭配的理由是只看高低会漏掉语调起伏的信息,而只看起伏又不知道基准高低。组合意义在于本文把三者分开建模:局部基频看位置,动态性看变化速度,范围看一句话内拉开的幅度,从而能区分音高本身和音高用法。
自变量有 4 个。性取向最初有 gay、straight、other 3 类,other 需手写具体标签如 bisexual、pansexual、queer,但因年龄分布太散,合并为 gay and bi+ 对比 straight。年龄按出生日期分为 30 岁及以下 45 人、30 岁以上 32 人。话题按照片分为中性与 LGBTQ。态度分数是 8 题均值再标准化,越高越传统。
基频范围 × 话语: 基频范围分工是刻画一句话内最高与最低基频估计值拉开的距离;话语分工是本文的计算单位,用 200 毫秒以上的停顿切分出的语音段。搭配理由是范围必须依附于一个时间窗口才有意义,话语提供了这个窗口。组合意义是范围反映整句的伸展程度,而动态性反映句内逐段的抖动速度,二者互补,避免把大起伏等同于快速抖动。
初学者要记住:性取向和年龄是人间变量,话题是句间变量,态度是人间连续变量。模型同时放 3 阶交互的 4 个组合,再逐步删除不显著的高阶项,每步用似然比检验确认简化没有显著损失拟合。
本研究训练了什么?没有训练时实际计算了什么?
本研究没有训练神经网络,也没有更新任何声学模型参数,不存在梯度路径、冻结层、优化器或早停。必须明确说没有训练阶段,避免把统计建模误当成深度学习训练。
男性角色态度量表 × 年龄组: 男性角色态度量表分工是把 8 个六点李克特题目取均值再做标准化,分数越高表示越认同传统男性角色;年龄组分工是按 30 岁及以下与 30 岁以上切分样本。搭配理由是前者是连续价值观变量,后者是代际变量,二者可能共同塑造语言社会化背景。组合意义是模型检验价值观效应是否只在年长组出现,从而把单纯的个人态度与成长年代的规范压力分开。
实际计算分两类。第一类是信号处理计算:用外部工具 REAPER 与 MacReaper 从波形算声门闭合时刻,再换算为基频,这是确定性算法调用,不是学习。第二类是统计推断计算:用线性混合效应回归拟合 3 个因变量,通过模型简化选出最简约的显著结构,并对含二分类变量的交互做估计边际均值的两两比较。资源状态方面,原文引用的第三方工具地址当前可用,已公开,链接为 REAPER 的代码仓库,但这不等于本文 77 人的语音数据公开。原文未报告硬件预算、运行时间或推理延迟,缺项就是缺项,不能从工具名称推定速度。
谁来说话?说什么?在什么条件下比较?
被试条件按原文交代:77 名自认男性的澳大利亚英语说话人,要求在澳大利亚完成全部中小学教育,无言语听力问题,年龄 18 到 52 岁,均值 30.4 岁。其中 27 人 gay,38 人 straight,12 人报告其他取向。合并后 gay and bi+ 在 30 岁及以下 21 人、30 岁以上 18 人,straight 在 30 岁及以下 24 人、30 岁以上 14 人。仅 1 名 30 岁及以下者报告跨性别身份。录音为 1 对一安静环境,采样率 44.1 千赫兹。
下面这张表把人数结构摆出来,读表时先问分组是否平衡、合并是否带来异质性。公平条件是所有人都做同样的 9 图描述,话题顺序固定,前 6 中性后 3 LGBTQ,因此话题效应与顺序效应在设计上是混杂的,解释时要谨慎。指标方向是:局部基频看高低,差值和范围看大为更活、更展开。
| 分组维度 | 分组水平 | 人数 | 年龄细分 | 备注 |
|---|---|---|---|---|
| 总样本 | 自认男性 | 77 人 | 18 到 52 岁 | 均值 30.4 岁 |
| 性取向原始 | gay | 27 人 | 未单独分年龄 | 原始三分类之一 |
| 性取向原始 | straight | 38 人 | 未单独分年龄 | 原始三分类之一 |
| 性取向原始 | 其他取向 | 12 人 | 分布散需合并 | 如 bisexual 等 |
上表显示原始 other 组只有 12 人且年龄分散,单独建模会不稳定,合并是不得已但代价是组内异质性增大。年龄切分后最小格只有 14 人,交互估计的误差不会小。话题照片只有 9 张,其中 LGBTQ 仅 3 张,语料量上中性话题占优,这会影响范围估计的稳定性。原文未报告每人时长、每话题话语数、标注一致性,这些是复现时需要补记的缺项。
局部基频:为什么只有年龄显著?
先看局部基频的比较问题:在控制说话人随机效应后,性取向、态度分数、话题是否改变声音高低。公平条件是同一套混合模型简化流程,指标是赫兹值,方向是数值大为更高。结果报告显示唯一显著的简单固定效应是年龄组,30 岁以上组预测基频比 30 岁及以下基准低,估计值为负 7.327 赫兹,标准误 3.227,t 为负 2.27,p 为 0.026。性取向和态度分数都不显著,这支持了预测 1。
下图把该效应可视化,导读是横轴只有两个年龄组,纵轴是赫兹,每个叉号是 1 名说话人的均值。
看图路径: 1. 先看横轴两个年龄组和纵轴基频单位赫兹;2. 再看每个叉号代表一名说话人的均值分布;3. 比较中间蓝色估计均值连线是从左向右下降还是上升;4. 注意两侧误差线长度,判断组间重叠程度
论文图 3。原论文 Figure 1:“Effect of Age Bracket on local f0.”。
从像素看,左侧 30 岁及以下云团整体偏高,右侧 30 岁以上整体偏低,中间蓝色均值连线向右下倾斜,两侧误差线有重叠但趋势明确。这与文献中随年龄音高下降的预期一致。教学要点是:没有发现群体差异不是证明完全相等,而是说在当前样本量、任务和模型下,性取向和态度对高低的解释力不如年龄。把均值差异误读为所有年长者都低是错的,图上两组内部散布都很大,个别年长者仍高于不少年轻人。
| 因变量 | 比较条件 | 模型估计 | 检验量 | 显著性 |
|---|---|---|---|---|
| 局部基频 | 30 岁以上 对 30 岁及以下 | Est -7.327 | SE 3.227 | p 0.026 显著 |
| 基频差值 | 年长组随态度上升 | Est -2.805 | SE 0.840 | p 0.001 显著 |
| 基频差值 | 年龄组 乘 性取向 | Est 3.219 | SE 1.493 | p 0.034 显著 |
| 基频差值 | 话题 乘 性取向 | Est 0.979 | SE 0.372 | p 0.010 显著 |
| 基频范围 | 话题 乘 性取向 | Est 4.345 | SE 2.130 | p 0.046 显著 |
读这张汇总表要先确认每行因变量不同,不能跨行比大小。局部基频行是位置效应,后四行是变化效应。显著不等于效应大,最后一行 p 为 0.046 刚过阈值,需要更谨慎对待。未胜出项是性取向和态度对局部基频的主效应,它们在简化过程中被删除,说明至少在高低维度上,身份标签和价值观没有可检测的稳定作用。
基频范围:话题效应为何只出现在特定群体?
基频范围模型的最终结构只有一个显著双向交互:话题乘性取向,估计 4.345,p 为 0.046。模式与动态性类似:gay and bi+ 在 LGBTQ 话题下范围大于中性话题,straight 无此差异。事后检验确认仅前者的中性对 LGBTQ 对比显著,p 小于 0.001。
比较问题是整句伸展程度是否随话题扩大,公平条件是同一套话语切分和混合模型,指标方向是大为更展开。导读是左右面板为性取向,横轴为话题,纵轴为范围赫兹。
看图路径: 1. 先确认左右面板为不同性取向组,横轴为两种话题条件;2. 再看纵轴为话语内基频范围赫兹,数值明显大于动态性图;3. 比较左侧组从中性到 LGBTQ 是否上扬,右侧组是否持平;4. 观察两组在 LGBTQ 条件下上方均有离群高点
论文图 5。原论文 Figure 5:“Effect of Topic & SO on f0 range.”。
像素显示左侧均值连线从中性到 LGBTQ 上扬,右侧持平。纵轴达 150 赫兹以上,远大于差值图的量级,因为范围是整句极差。两组散点在 50 到 100 赫兹最密,上方各有少数超过 100 赫兹的点,LGBTQ 侧出现接近 170 赫兹的极值。解释时不能把末端极值推广为全组都大幅扩大,均值移动其实只有几个赫兹。
| 测量环节 | 参数设置 | 样本条件 | 计算单位 | 切分规则 |
|---|---|---|---|---|
| 话题材料 | 9 张照片 | 6 中性 3 LGBTQ | 张 | 前 6 后 3 固定 |
| 态度测量 | 8 题量表 | 77 人全答 | z 分数 | 均值再标准化 |
| 基频估计 | 10 毫秒间隔 | 仅浊音段 | 毫秒 | 去犹豫标记 |
| 话语切分 | 200 毫秒停顿 | 逐话语算范围 | 毫秒 | 停顿定界 |
这张配置表不能替代结果表,它只说明可运行条件。关键细节是话题材料不平衡、话语切分阈值固定为 200 毫秒、基频只在浊音段估计。若改阈值或改浊音筛选,范围和差值都会变,因此复现必须沿用同一套预处理,否则数字不可比。未评测边界包括不同录音设备、不同切分阈值、不同基频算法下的稳健性。
基频动态性:三个双向交互如何互相牵制?
基频差值模型的最终结构有 3 个显著双向交互,没有可单独解读的主效应。第一个是年龄组乘态度分数:30 岁及以下组态度几乎不影响差值,30 岁以上组随态度分数上升而下降,估计负 2.805,p 为 0.001。第二个是年龄组乘性取向:30 岁及以下 gay and bi+ 大于 straight,30 岁以上则反转,估计 3.219,p 为 0.034,但事后两两比较中该交互的对比都不显著,说明整体交互显著不等于任 1 对均值差都显著。第 3 个是话题乘性取向:gay and bi+ 在 LGBTQ 话题下差值大于中性话题,straight 则无此差异,估计 0.979,p 为 0.010,事后检验确认前者的中性对 LGBTQ 对比 p 为 0.005。
先看态度与年龄的交互图,导读是左右面板为年龄组,横轴为标准化态度,纵轴为差值赫兹。
看图路径: 1. 先确认左右两面板分别为 30 岁及以下和 30 岁以上;2. 再看横轴标准化后的男性角色态度分数,纵轴为基频差值赫兹;3. 比较左侧回归线是否接近水平,右侧是否明显下行;4. 观察右侧高分数端阴影带变宽,提示高分数段样本稀疏
论文图 1。原论文 Figure 2:“Effect of MRAS Score on f0 Diffs by age.”。
像素显示左侧回归线近乎水平,散点围绕 10 赫兹上下波动,上方有个别高点;右侧回归线从左上向右下明显下滑,阴影带在右端变宽。这支持预测 2 的后半句只在年长组成立。作者的有限解释是年长组更受霸权规范约束,越传统越单调,年轻组即使分数高也不通过单调来区分自己,但这属于事后推测,待验证。
再看话题与性取向的交互图,导读是左右面板为性取向,横轴为话题。
看图路径: 1. 先确认左右面板为不同性取向组,横轴为中性话题与 LGBTQ 话题;2. 再看纵轴基频差值和每个叉号代表的说话人或话语聚合点;3. 比较左侧组两话题均值连线是否上扬,右侧组是否接近水平;4. 注意左侧在 LGBTQ 条件下上方出现个别高值点
论文图 4。原论文 Figure 4:“Effect of topic & SO on f0 diffs.”。
像素显示左侧 gay and bi+ 从中性到 LGBTQ 均值连线轻微上扬,右侧 straight 近乎水平。注意纵轴只有 0 到 30 赫兹,均值都在 10 赫兹附近,变化幅度不大,上方离群点拉高了视觉印象。代价是话题顺序固定,无法排除越说越放开的顺序效应;反例是 straight 组完全不随话题变化,说明至少不是所有人都越说越活,这削弱了纯顺序解释,但不能彻底排除。
哪些结论不能下?样本与统计的边界在哪里?
直接报告的是:局部基频只与年龄有关;动态性受 3 个双向交互影响;范围受话题与性取向交互影响。有限解释是年长传统者更单调、特定群体在 LGBTQ 话题下更展开可能与认同或舒适表达有关。未验证推测是代际自由化导致年轻组不受态度约束,以及用更女性化风格标示团结,这些都用了可能、待验证的语气。
边界有 4 条。第一,性取向合并把 gay、bisexual、pansexual、queer 压成一组,组内差异被抹掉,不能推广到每个子身份。第二,年龄二分把连续年龄压成两格,30 岁切点附近的人被硬分开,趋势可能不是跳变而是渐变。第三,话题顺序固定且数量不平衡,中性 6 张在前,LGBTQ 3 张在后,话题效应与疲劳或熟悉效应混杂。第四,差值计算选每隔 5 个估计点、停顿选 200 毫秒,这些是研究者自选参数,未做参数敏感性分析。
统计上 p 为 0.046 的范围交互最脆弱,多重比较和模型简化路径都可能影响显著性。年龄乘性取向交互的事后两两都不显著,说明不能断言某个年龄段内两组一定有差异。相关性不是因果,没有测量听者感知、误判率、延迟或成本,不能承诺法医或文化敏感应用一定有效。
要重做这项研究,先做什么才能对上数字?
先招募符合 schooling 条件的澳大利亚英语男性,记录出生日期和自我报告性取向,保留原始三分类标签再记录合并规则。录音用同样安静条件和 44.1 千赫兹设置,用 9 图描述任务并保持前 6 中性后 3 LGBTQ 的顺序,若要解混顺序效应需另设平衡顺序对照组。态度部分必须用同样的 8 题男性角色态度量表,六点计分,取均值后全样本标准化得到 z 分数。
信号处理要复刻过滤步骤:只留元音和响音辅音,去掉 ums、ahs,用 MacReaper 算声门闭合间隔,每 10 毫秒输出局部基频,每隔 5 个点算差值绝对值,200 毫秒以上停顿切话语并算极差。建模用带说话人随机截距加话题随机斜率的线性混合模型,从 4 个 3 阶交互出发逐步删除最大 p 值的不显著高阶项,每步做似然比检验。作图时每个叉号为 1 名说话人均值,报告估计值、标准误、t 和 p 并做二分类交互的事后边际均值比较。缺失证据是原始语音不公开、具体题项文本和 MacReaper 版本参数未在正文详述,需向作者索取才能完全重放。
何时值得借鉴这套做法?下一步还缺哪项验证?
当你的问题也是群体标签加价值观加语境共同塑造语音时,这套把位置与用法分开、把人间变量与句间变量放进同一混合模型的做法值得借鉴。它提醒初学者不要只比平均音高,动态性和范围往往更敏感,且效应常藏在交互里。复现时优先保证话题材料、切分阈值和随机斜率结构一致,否则交互方向可能翻转。
还需补的验证有三项。一是把年龄当连续变量重跑,看态度效应是渐变还是只在 30 岁后出现。二是平衡话题顺序或增加 LGBTQ 材料量,排除顺序解释。三是检验动态性变化到底来自模态内音高起伏,还是模态与嘎裂声之间切换,原文未来方向已点名这一点。若要谈应用,需另测听者判断准确率、法医场景的错误率和计算开销,不能从声学差异直接跳到身份识别。最终判断是:澳大利亚男同与双性恋以上群体不是单一语音风格,而是在特定话题下更展开、年长传统者更收敛,结论成立的前提是保留年龄和话题条件。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



