英文题目:Sexualised Synthetic Personas Encode and Amplify Gendered Power Asymmetries through Voice

会议身份:conference:interspeech:2026:conference-paper-id:ross26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#主观评测 #公平性 #言语感知 #语音 #语音属性识别

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Alice Ross:机构信息未能从会议 PDF 纯文本可靠映射
  • Ariadna Sanchez:机构信息未能从会议 PDF 纯文本可靠映射
  • Elin Kanhov:机构信息未能从会议 PDF 纯文本可靠映射
  • Catherine Lai:机构信息未能从会议 PDF 纯文本可靠映射
  • Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文输入为ElevenLabs语音库中以调情与诱惑标签出售的男声与女声合成语音,输出为听众对其性别化权力感知的系统性差异,难点在于剥离文本露骨程度与声音风格本身带来的刻板印象。首先按性别与性化标签选取热门声音并分别合成性化文案与彩虹通道中性文本,形成风格与内容正交的刺激集并进入听辨环节。接着通过在线听辨让被试每轮从36个形容词中三选并辅以自由评论,将评价映射到积极消极与支配顺从及性化维度。然后结合广义线性混合效应回归与平均基频及语速测量检验差异来源,区分声学特征与文本效应的贡献。与只谈默认女声的语音助手性别研究不同,本文证明可售卖的性化人设本身即编码了不对称的亲密脚本。在语音声学评测条件下,性化男声的平均基频指标为70.08 Hz,低于中性男声的平均基频指标110.88 Hz。结论仅适用于英语商业性化人设与美国和加拿大常住听众,未验证其他语言文化与长期交互中的顺应效应。该结论的适用边界受限于英语语料与美加听众,跨语言长期交互效应尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:为何要研究商店里出售的性感声音?

本解读的输入是 Interspeech 20261 篇关于商业语音人工智能中性别表征的论文,目标是让刚进入语音与音乐音频领域的研究生能复述其方法与证据边界,必须保留的信息包括刺激来源、文本交叉设计、被试分组、形容词分类逻辑与声学核对,输出是 1 篇可核对的技术解读而非观点评论。

论文研究的对象不是传统语音助手问答,而是直接出售的人声商品。作者观察到 ElevenLabs 网站语音库中存在以调情、诱惑等标签推广的人格,2025 年可见的分类包括 seductive 与 sultry,名字多为明显女性化名字如 Natasha,后来部分转为提示词生成人格如 The midnight enchantress。表面上平台给男女各配了相似数量的性感人格与调情示例文本,似乎做到了性别 parity,但作者追问的是听众是否真的对称感知,以及这些声音是否携带特定的性别与权力表演。

女性主义人机交互 × 听辨实验: 女性主义人机交互分工是提供问题框架,追问技术如何编码性别关系与谁获利谁被物化;听辨实验分工是提供证据方法,让多样性取向的北美听众在控制条件下评价声音;搭配理由是仅靠文本分析提示词无法证明感知后果,仅靠声学测量无法解释权力含义,组合意义是把平台修辞、声音信号与听众判断连成一条可复述的证据链。

理解这项工作的前提是区分两种赋能叙事与伤害现实。白话说,互联网确实为女性性表达与酷儿跨性别身份实验提供了空间,但骚扰与 victimisation 仍是常见特征;语音合成把这种张力带入听觉,听众会从音质推断说话人的长相、性格与人格。早期 Alexa 与 Siri 因默认女性秘书人格受到批评,现在商品从完成闹钟等任务转向出售声音本身,用户可以像 Pygmalion 那样定制提示词、指定文本并加入笑声叹息等具身副语言特征。因此问题不再是助手是否有礼貌,而是被出售的性感风格如何构造 femininity 与 masculinity,以及是否在重复二元异性恋脚本。

相关路线:语音感知与合成人格研究此前做到哪一步?

第一条路线是人类语音的社会评价。已有研究显示听众对男女说话人的同一种音质会做出不同人格判断,例如气泡音对女性更不利,而微笑音对女性评价更高;支配感与吸引力与基频、语速等参数相关,但结论依赖说话人性别与语境。这提示不能把声学参数直接等同于感知标签,必须按感知性别分组检验。

第二条路线是拟人化合成语音的社会索引。以往工作考察了听众如何从 Siri 等声音中听出种族、非二元性别表达与 kawaii 感,也有工作讨论吸引力与能动性在人类语音中的感知,但作者指出在人工智能生成声音中、尤其纳入多样性取向听众的研究仍是空白。本研究正是补这一块:不是测自然度平均意见分,而是测性别化权力形容词的分布。

第三条路线是机器学习中的刻板印象放大。词嵌入会复现并放大训练数据中的性别与种族偏见,文本到图像模型对非顺性别身份存在刻板与色情化表征,提示词表面可定制但设计中嵌入的 straight values 会边缘化酷儿用户。作者把同一担忧迁移到语音:自然语言提示看似给用户创造力,但 breathy、honeyed、smooth、aged whiskey 等现成提示词已经把女性化与男性化说话方式与价值判断绑定,还伴随对法国与地中海口音的异国情调化。

要回答的具体问题是什么?

论文把大问题拆成 3 个可操作问题。第一,男女编码声音在评价分布上是否不同,特别是在积极、消极、支配、顺从与性感化 5 类形容词上的总体差异。第二,这种差异来自声音风格还是语言内容,为此独立操纵声音风格与朗读文本,比较同一性感化声音读性感文本与读彩虹通道文本时的变化。第三,听众自身特征是否调节感知,包括性别身份与被吸引对象,作者按性别与吸引对象分成 4 组并纳入年龄协变量。

需要强调的边界是,论文不声称测量了真实说话人的意图或平台训练数据构成,也不做因果归因到某个声学参数。它报告的是在给定商品与给定听众池下,评价分布是否系统不对称,以及不对称在多大程度上可被文本内容解释。凡超出此范围的推广,例如断言所有合成语音都如此或所有文化都如此,都属于待验证推测。

方法全景:一个样本如何走完输入到判断?

先沿一个样本走完全程。输入是一个商品人格,例如 The Parisian temptress,标签为 flirt 且提示词含 female;研究者用 ElevenLabs Voice Library 中该人格合成两类文本,一类是网站展示的性感脚本,另一类是改写的彩虹通道说明文摘录。音频进入由 jsPsych 搭建的网页听辨界面,被试可重复播放,每试次从 36 个形容词中选 3 个最贴切词,并可选择留下自由文本评论。输出是每个试次 3 个标签加上可选评论,随后按预设的 5 类映射聚合为比例,再用混合效应模型检验声音性别、文本类型、被试分组与年龄的作用,最后辅以平均基频与语速核对。

性感化声音风格 × 语言内容: 性感化声音风格指由提示词与韵律副语言塑造的听感,如气息声、叹息、慢速与低音处理,分工是提供独立于字面的身份线索;语言内容指朗读的是调情脚本还是彩虹通道说明文,分工是提供字面语义线索;两者搭配的理由是只有交叉配对才能分离是词让人觉得性感还是声音本身让人觉得性感,组合意义在于发现女声在中性文本下仍被性感化,说明风格本身携带了性别化权力含义。

刺激总数设计兼顾控制与时长。性感化声音共 6 个,每个合成 1 条性感文本与 2 条彩虹通道文本;非性感化声音包括 informative、presenter、educational 等共 4 个,每个合成 2 条彩虹通道文本。全部试验为 30 试次,随机化音频顺序与词表列顺序以避免顺序效应,目标时长控制在 20 分钟内。形容词表按效价与支配度平衡,正负与支配顺从词数相等,分类经 Warriner 等人的效价唤醒支配规范校验,并在多轮预实验中删除歧义词并补充被试自发填写的词。

组件一:声音与文本如何构造对照?

声音选择遵循最流行原则。在 flirt、flirty、temptress 3 个性感类别中各选最流行的 female 与 male 声音,得到 The Parisian temptress、The Southern gentleman、The sophisticated charmer、The velvet rogue、The midnight enchantress、The velvet gentleman;非性感基线选择 The tech expert、The documentary narrator、The professional news anchor、The science enthusiast。这种选法的好处是代表用户最可能遇到的展示位,代价是不能代表长尾提示词或用户自创人格。

女性编码声音 × 男性编码声音: 女性编码声音与男性编码声音在本研究中不是生理性别鉴定,而是 ElevenLabs 提示词中明确写了 female 或 male 所生成的商品人格,分工是承载平台对两性说话方式的刻板构造;搭配比较的理由是平台表面上男女各给两个性感人格、似乎做到了数量 parity,只有并置才能检验听感是否对称;组合意义是揭示不对称评价:同为性感化商品,男声通向支配与积极,女声通向顺从与性感。

文本对照是本研究的关键操作。性感文本直接采用平台展示给用户的文案,信息文本采用改写的 Rainbow Passage。同一性感化声音配两种文本,就能观察评价变化是否跟随文本;不同声音读同一彩虹通道文本,就能观察风格残留。作者还保留了非性感声音读同一彩虹通道的基线,用于判断信息类声音的默认评价位置。

形容词选择任务 × 自由文本评论: 形容词选择任务要求每试次从 36 词中选 3 个最贴切词,分工是以可计数的受控词表获得分布差异并减轻量表理解偏差;自由文本评论允许听众补充评价与比喻,分工是捕捉词表装不下的厌恶、讽刺与使用场景联想;搭配理由是定量分布需要定性语境来解释方向,组合意义在于数字上的顺从与性感差异与评论中的做作、男性幻想、威胁感等叙述相互印证。

形容词表的构成需要复述清楚,因为它是全部定量的来源。36 词分为积极、消极、支配、顺从、性感 5 组,论文表 1 列出如 charismatic、charming、confident 等为积极,annoying、creepy、fake 等为消极,dominant、forceful、intense 等为支配,shy、submissive、timid 等为顺从,exotic、flirty、seductive 等为性感。每个词被赋予 1 至 2 个标签,性感词在效价唤醒支配 3 维度得分都高。被试界面以 4 列 9 行呈现并随机化,避免位置偏好。

有无模型训练:本研究真正计算了什么?

本研究没有训练任何语音合成或感知模型,必须明确说明这一点。它调用的是 ElevenLabs TTSv3 商业平台的现成 Voice Library 人格,属于既有模型推理与采样,而非参数更新;论文未报告梯度路径、冻结层、优化器或训练预算,这些缺项不应从模型名称推定。因此 training 一节的职责是讲清实际发生的构造与统计计算。

真实计算有 3 类。第一是刺激合成与组织:按人格与文本矩阵生成音频,不做音高归一化或时长对齐,保留商品原始风格。第二是行为数据聚合:把每试次 3 个选择映射到 5 类,计算各类比例,随机效应纳入被试编号以处理重复测量。第三是声学核对:计算每个声音的平均基频与语速,语速定义为音节核总数除以秒数,用于描述性对照而非因果建模。

平均基频 × 语速: 平均基频分工是刻画声音高低的整体位置,语速分工是刻画单位时间音节核数所反映的松弛或拖长感,搭配理由是两者都是可复算的韵律指标,能检验性感化是否只是变慢变低;组合意义是数据显示男女性感化声音都变慢,但基频下降主要出现在男声,说明女声的性感化感知不能只用变低变慢解释,还需气息声等副语言特征参与。

统计建模使用 R 的 lme4 与 nlminbwrap 优化器,显著性阈值为 0.05。整体模型以声音性别、文本类型、被试分组与标准化年龄为固定效应,被试编号为随机效应,逐类形容词拟合广义线性混合效应模型;随后针对性感化声音子集再拟合以被试分组与年龄为固定效应的模型。这种设计能同时回答总体不对称、内容效应与听众调节,但未对多重比较做额外校正的说明是复现时需注意的缺项。

实验条件:谁在听、在哪听、听到什么?

被试通过 Prolific 招募,限定为美国或加拿大现居民且自报无听力状况。研究询问性别与吸引对象,分为 4 组:第 1 组为女性且被女性吸引、第 2 组为女性且仅被男性吸引、第 3 组为男性且被男性吸引、第 4 组为男性且仅被女性吸引,目标每组约 30 人,实际为 40、21、34、25 人,其中第 1 与第 3 组包含被多性别吸引者。作者避免使用 straight 或 queer 标签,因为未直接询问身份认同,这种谨慎在复述时应保留。

流程上每人完成 30 试次,可重复播放,每屏选 3 词并可留评论,最后询问总体印象、对研究目的的猜测及年龄、性别、吸引、族裔与常用语言。伦理批准来自爱丁堡大学信息学院伦理委员会,编号 296750。演示页当前可用,资源状态显示 available 且状态码 200,链接为论文脚注中的 synth-personas 页面,可试听示例但不应视为完整刺激集。

需要记录的公平条件是,所有比较共享同一词表、同一界面与同一随机化逻辑;声音性别与文本类型的交叉是核心公平设计,而被试分组比较则因样本量不均衡与自我选择偏差而解释力较弱。年龄以标准化分数进入模型,但族裔与语言背景未进入主模型,这是后续可补的调节变量。

主结果:不对称分布与文本效应的分离

总体分布显示系统不对称。混合效应模型报告男声更频繁获得支配与积极形容词,女声更频繁获得顺从与性感化形容词,消极词在男女声间大致均等。作者的措辞是报告差异显著,而非断言某个声学特征导致差异,这种措辞在复述时应保留为报告而非因果。

文本效应的关键数字是性感化词比例的变化。同一批性感化声音读性感文本时男女差异较小,换成彩虹通道后男声的性感化比例下降更多,女声仍保留较高比例,说明女声感知更多由韵律副语言驱动。最常用词也支持这一点:三分之 2 男声的 top 词随文本从 seductive、sensual、creepy 变为 confident、serious、intense,而三分之 2 女声的 top 词在两种文本下都是 seductive、sensual、intimate。

以下导读指向雷达图,它把 5 类比例放在同一极坐标下,便于一眼看到形状差异而非单点胜负。看图时先确认图例中 f 与 m 分别代表女性编码与男性编码,sexualised 与 informative 分别代表声音类型与文本类型的组合,避免把颜色深浅误读为显著性。

看图路径: 1. 先看左右两幅雷达图的标题与图例,确认左侧比较性感化声音配两种文本,右侧比较信息类声音与性感化声音读中性文本;2. 沿 positive、negative、dominant、submissive、sexualised 五个轴比较红色系与蓝色系多边形的伸展方向;3. 重点观察左侧性感文本下两性在 sexualised 轴接近,而换成信息文本后蓝色多边形向 dominant 与 positive 回缩、红色仍留在 sexualised;4. 注意右侧图中红色菱形在 sexualised 轴的残留,对应女声风格效应大于文本效应

原论文 Figure 1:Comparing the proportions of positive, negative, dominant, submissive, and sexualised adjectives…

论文图 1。原论文 Figure 1:“Comparing the proportions of positive, negative, dominant, submissive, and sexualised adjectives given to different sets of male and female voices.”。

该图左面板显示性感化声音在两种文本下的 4 条多边形,右面板显示信息文本下信息类与性感化声音的对比。可见的教学要点是:左侧红色系在 sexualised 轴外扩且换文本后回缩较少,蓝色系回缩较多并向 dominant 轴移动;右侧即便都读信息文本,红色残留仍高于蓝色。这支持了正文判断,即文本内容对男声影响更大,而女声风格本身携带性感化含义。像素不能精确读出的具体刻度不应硬写,应以正文报告的 57% 与 46% 等数字为准。

声学核对提供了有限解释。以下表格整理了原文报告的平均基频与语速,比较问题是性感化是否等于变慢变低,公平条件是同一批声音的描述性均值,指标方向是数值越低表示越低音或越慢,但好坏不直接对应质量。

条件指标性别编码性感化声音值信息类声音值
声音风格对比平均基频男性编码70.08 Hz110.88 Hz
声音风格对比平均基频女性编码204.73 Hz211.43 Hz
声音风格对比语速不分性别2.43.8

表后解释需要同时讲收益与代价。收益是数字清晰显示性感化声音更慢,且男声基频下降幅度远大于女声,这与听感上男声威胁或低沉、女声气息化的评论相互呼应;代价是这只是均值对照,未控制文本时长与内容,也未测量气息声、叹息频率等更可能解释女声残留的特征,因此不能把基频差当成因果证据。未胜出项是女性基频几乎不变,这恰好提醒初学者不要把性感化简单等同于降调。

听众分组与评论:谁的评价不同,词表之外说了什么?

听众分组的效应集中在第 4 组,即仅被女性吸引的男性。与其他组相比,该组更可能给性感化女声贴性感化标签,更少给性感化女声贴消极标签,更可能给性感化男声贴积极标签。作者报告了相应 p 值,但样本量较小且分组基于吸引对象而非身份标签,因此应表述为支持组间差异而非断言某类人群本质如此。

以下导读指向按被试分组拆分的柱状图,它相当于对主结果的调节检验。看图时注意左右大面板的文本条件不同,纵轴为回应比例,横轴为 5 类形容词,颜色代表 4 个被试组,避免把组间小差异过度解读为全程趋势。

看图路径: 1. 先确认左右大面板分别为性感文本与信息文本,子面板分为 female 与 male,横轴为五类形容词;2. 按颜色找到 Group1 至 Group4,比较同一形容词下四组柱高是否一致;3. 重点看左侧 female-sexualised 柱在 Group4 是否略高,以及 negative 柱是否略低;4. 再看右侧换成信息文本后 sexualised 柱整体下降但女性面板仍高于男性面板

原论文 Figure 2:Breakdown of adjective types for sexualised voices with different types of text…

论文图 2。原论文 Figure 2:“Breakdown of adjective types for sexualised voices with different types of text (sexualised/informative) per participant group.”。

该图左半显示性感文本下性感化标签占据主导,男女面板都高,但女性面板的性感化柱在第 4 组略高;右半换成信息文本后性感化柱整体下降,积极与支配柱上升,但女性面板的性感化残留仍可见。这种模式与雷达图一致,区别在于此处强调听众异质性:总体趋势不等于每组每步都成立,第 2 组在某些支配柱上反而更高,提示调节效应是局部的。

定性评论提供了反证与边界。共分析 280 条评论,其中女性声音 151 条、男性 129 条;53 条为积极、143 条为消极,其余 84 条为中性或场景描述。以下表格把文本效应与评论量放在一起,比较问题是数字差异是否有言语证据支撑,公平条件是同一批刺激与同一批听众,指标方向是比例越高表示该类评价越常见。

声音类型文本类型女性性感化词比例男性性感化词比例评论量对照
性感化声音性感文本57%46%280 条评论中女性 151 条,男性 129 条
性感化声音信息文本36%18%积极 53 条,消极 143 条
信息类声音信息文本基线未单独报告性感化比例基线未单独报告性感化比例中性 84 条含场景与快慢描述

表后解释需指出具体代价与反例。收益是文本切换后男女降幅不对称,女性从 57% 降至 36% 仍显著高于男性的 18%,与评论中女声被写成 sexy、flirty、porn voice 而无价值判断的 24 条记录相呼应;代价是消极评论在男女声间数量接近,男声被批 bland、flat、threatening、rapey,女声被批 annoying、forced、trying to sound sexy,说明不对称不等于女声单向差评。未评测边界是 robotic 等指向合成痕迹的评论占消极的 24%,这部分与性别无关却影响整体积极率,不应计入性别效应。

限制:哪些结论不能从本证据推出?

第一,刺激代表性有限。仅选用最流行的现成商品人格与两类文本,未覆盖用户自创提示、长篇对话与多轮交互,也未系统操纵口音与年龄。提示词中 breathy、honeyed 与 aged whiskey 等修辞的分析是描述性的,没有做剔除该词后重新生成的对照,因此不能推出去掉某个词必然消除差异。

第二,听众与语言范围有限。仅限北美英语听众且样本量约 120 人,4 组不均衡,族裔与常用语言未建模;仅测英语,法国口音等异国情调化观察依赖听众主观报告,有人听成爱尔兰口音即说明口音标签不可靠。跨文化推广属于待验证。

第三,测量与统计边界。形容词映射依赖预设分类与外部规范,sexualised 词本身在效价唤醒支配上得分高,可能与积极词重叠;声学仅报告均值基频与语速,未报告分布、基频变程、频谱倾斜、气息声量化或叹息标注;混合模型细节如随机斜率与多重比较校正未充分交代。相关性不是因果,未测量误判率、延迟或部署成本,不承诺任何性能改善。

复现先做什么:可重走的最小步骤

第一步是重建刺激矩阵。访问演示页确认人格名称与示例,记录每个性感人格的标签与提示词原文,然后用同一平台合成性感脚本与改写彩虹通道各至少一条,注意保存采样参数与日期,因为商业模型会更新。若无法获得完全相同的声音,应明确标注为概念复现而非精确复现。

第二步是重建测量工具。复用论文表 1 的 36 词并保留 5 类映射,界面实现每试次选 3 词、可重复播放、顺序随机化,每人 30 试次。自由文本框保留原问法,编码时先分积极、消极、中性,再在中性下分场景、性别标签、语速描述与性感描述,避免把 sexy 等词直接计入效价。

第三步是重跑分析。按声音性别、文本类型、被试分组与标准化年龄拟合混合效应模型,被试编号为随机效应,逐类检验;子集分析聚焦性感化声音;声学部分用 Praat 脚本计算平均基频与音节核语速。还需补的验证是增加气息声与语速的量化标注、均衡被试组并预注册多重比较方案,才能检验风格残留是否稳健。

收束:何时值得尝试这种听辨设计?

当研究问题涉及商品化人格的感知后果而非合成自然度时,这种设计值得尝试。它的价值在于用交叉配对分离风格与内容,用受控词表获得可比较分布,再用自由评论与声学均值做三角验证,适合揭示表面 parity 下的隐性不对称。对于语音产品评审,它提供了一个低成本模板:同一声音读两类文本即可初步判断风格是否过度携带性别含义。

不适合的场景是需要因果归因或跨文化推广时。此时应补充参数化重合成对照、更大更多样听众池与声学细粒度标注,并明确区分代码开源、权重下载与系统可运行:本研究既无开源代码也无可下载权重,可运行的是商业平台与演示页,复现依赖外部服务可用性。最终判断应保留为论文直接报告的是分布不对称与文本效应差异,有限解释是副语言风格可能驱动女声残留,未验证的是具体声学因果与跨语境普适性。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总