英文题目:Lived Experiences of Power and Agency: Achieving Voice Sovereignty in Assistive Speech Technology for Nonbinary Users

会议身份:conference:interspeech:2026:conference-paper-id:hope26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#用户研究 #社会语音学 #语音 #语音合成

评分:4.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Maxwell Hope:机构信息未能从会议 PDF 纯文本可靠映射
  • Juliana Francis:机构信息未能从会议 PDF 纯文本可靠映射
  • Joakim Gustafson:机构信息未能从会议 PDF 纯文本可靠映射
  • Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究面向依赖语音生成设备SGD的性别 expansiveness用户,输入为其日常沟通叙述与身份表达困境,输出为可指导下一代辅助语音设计的主题洞察,难点在于群体高度异质且长期被排除在研究之外。方法链分为三环:先通过两轮间隔一周的匿名问卷收集日常生活与身份表达叙述,再以归纳式主题分析提炼整合与表达与权力三主题,最后将用户诉求映射到当代语音合成能力并提出关系主权式设计方向。与既有工作只问声音是否像某一性别不同,本研究把可懂度与本真性冲突以及对话节奏权等社会技术约束纳入主权框架,具有更完整的权力视角。原文未提供可核对的关键定量结果。结论仅适用于所调查的英语语境小众经验,不支持向其他语言文化或大样本效应的外推,且未验证所提技术映射的实际效果。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:为何辅具语音不只是把文字转成声音?

这篇论文的研究对象是依赖语音生成设备沟通的非二元使用者。语音生成设备英文为 speech-generating device,缩写为 SGD,属于高技术辅助与替代沟通,即 augmentative and alternative communication,缩写为 AAC。它把使用者通过符号、图片或键盘键入的语言信息转为合成语音。

对于刚进入语音领域的读者,容易把它当成普通文字转语音演示。论文的起点不同,它把 SGD 看作贴身使用的沟通身体。原文回顾具身讨论,指出这类设备因贴近身体且被频繁使用,可能成为身体图式的一部分。一旦设备被体验为身体,设备限制就不再是外部工具不好用,而是对自我的直接约束。

声音还会快速泄露身份。论文引用听知觉研究,指出听者在不到 1 秒内就能对说话人身份形成高度一致的判断,合成语音同样触发这类判断。因此 SGD 使用者被如何听见,直接影响被如何对待。

对于非二元使用者,即不完全认同男性或女性身份的人,若合成语音不能反映性别认同,可能带来误称并加重心理负担。论文强调无论是否发生误称,每个人都值得拥有准确反映性别认同的声音。

声音主权 × 关系主权: 声音主权指被承认的权威去定义、控制和施行符合自身身份与意图的声音,分工是回答谁有权决定声音像谁;关系主权指有权决定何时独立、何时互依以及在何种条件下使用技术,分工是回答互动方式由谁设定;二者搭配是因为声音选择离不开对话场景,组合意义在于把换音色、换口音与要求对话者等待视为同一主权的不同行使。

后文按学习依赖展开,先讲已有路线与研究问题,再讲方法全景与组件,接着讲构造与实验条件,最后讲结果、限制与复现。需要记住的核心事实是 3 名成年参与者、两轮匿名问卷、归纳主题分析与三主题结构。

已有路线走到哪里:性别语音之外还有哪些未被回答?

论文把已有工作分成 3 条线。第一条是 SGD 使用体验的质性综合。已有证据显示使用者看重的远不止信息传输,还包括沟通情境因素和被听见的个人意义。设备是否可靠、响应是否及时,都属于沟通条件的一部分。

第二条是身份对齐的语音研究。近期由辅助沟通使用者主导的研究报告指出,使用者想要反映身份的声音,但缺乏可操作的指定方式。高技术系统能支持部分文化相关词汇和方言发音,但在形态句法和语用变异方面支持有限,且常需大量手工编程。

论文还点名中大西洋性别 expansive 语音语料库,英文为 Mid-Atlantic Gender Expansive Speech corpus,缩写为 MAGES。它是少数可用于训练性别 expansive 合成语音的功能性数据集之一,但缺乏方言多样性。对该地区之外的使用者,它往往不够用。

第二条线的另 1 分支是非二元 SGD 使用者的语音性别肯定。已有研究开始关注合成语音是否反映参与者性别认同,并揭示现有系统在支持性别 expansive 身份表达上的局限。但论文明确指出这些工作的边界。它们主要回答声音是否反映性别身份,没有系统考察更广泛的身份表达、技术约束,以及使用者对声音的能动性与权力体验。

第 3 条是权力、能动性与主权的概念路线。能动性英文为 agency,指有意图地行动并在社会世界产生差异的能力。权力英文为 power,指在社会关系中即使遭遇抵抗仍实现自己意志的机会。主权英文为 sovereignty,源自原住民思想,强调对自身行动与参与条件的公认权威。论文进一步引入关系主权,即有权决定何时独立、何时互依,并定义使用技术的目标与条件。由此提出声音主权,即被承认的权威去定义、控制和施行符合自身身份与意图的声音。

本研究到底要回答什么问题?

论文提出的问题不是哪个合成模型得分更高,而是性别 expansive 的 SGD 使用者如何体验对自己声音的权力。具体可拆成 3 个可复述的子问题。第一,SGD 如何被整合进日常生活,包括身体距离、使用频率、认知情绪负荷与社会互动条件。第二,使用 SGD 表达身份时发生了什么,包括一般身份、性别身份与方言地域身份 3 个层面。第三,权力与能动性如何横切前两者,即使用者在技术限制与社会期待下能否按自己的条件定义声音并被等待。

这个问题值得做,因为目标人群处于双重边缘的交叉点,同时长期缺席相关研究。论文引用观点指出辅助沟通使用者经常被排除在相关研究之外,并引用使用者原话强调以平等伙伴参与才能让研究更有意义。因此作者把本研究定位为参与式行动研究第一阶段的需求评估。

研究用开放式方式让社群自己说出最需要什么,为后续不预设议题的研究铺路。需要提前划清边界,本研究不比较不同语音合成架构的音质,不训练新模型,不做听者评分实验。它报告的是 3 名使用者的日常亲历体验,并用主题分析整理成可检查的主题与子主题。

后文讨论部分会把这些需求映射到多种语音合成架构在技术上已可行的控制能力,但那属于可能性对照,不是本研究的系统实验。读者不应把技术可行读成已经部署验证。

方法全景:从一个人的一天到三个主题经历了哪几步?

沿一个样本走完全流程有助于复述。假设 1 名参与者在第一周打开在线表单,先填写性别认同与设备使用情况,再回答 8 个开放式问题。问题覆盖从起床到入睡的使用轨迹、困难情境、时段差异、是否提前准备或排练、是否限制身份表达及实例、希望如何改进、当前声音多符合身份、想如何定制声音。

然后参与者被要求带着这些问题在日常生活中反思一周。一周后收到除人口学问题外的同样问题,可以补充新的体会。所有文字回答进入归纳主题分析,研究者从半结构化但理论知情的问题出发自下而上提炼主题。再在主题下划分适用时的子主题,并在子主题下区分促进因素与阻碍因素。

最终形成三大主题:日常整合、身份表达,以及横切前两者的权力与能动性。图 1 用条形数量展示各子主题的引文数,其中权力主题既有独立引文,也有与另两主题共享的引文。理解共享计数很关键,否则会误把交叉归属当成重复样本。

这个全景里有 3 个方法选择值得记住。第一,选开放式问卷而非实验室任务,理由是让社群自己决定什么是最重要的需求。第二,设一周反思间隔,理由是让参与者在真实日常中捕捉使用时刻。第三,用归纳主题分析而非预设编码框,理由是目标是发现而非验证假设。

但作者也承认主要主题深受问卷问题本身影响,读者复述时不应把主题当作与问题无关的自然涌现。要判断证据强度,可以核对招募来源、年龄门槛、问卷形式、轮次间隔与补偿是否交代清楚。

组件是什么:参与者、问卷与分析各自负责什么?

参与者组件负责提供亲历证据。原文报告从曾同意为研究目的被联系的邮件列表中招募 3 名成年人,并支付小额参与补偿。性别信息通过多选分类题加开放式补充收集,选项包括男性、女性、非二元、性别酷儿与性别流体。设备使用信息包括设备类型与使用频率。

论文以表格形式报告 3 人的具体组合,例如有人每天使用带多个应用的平板,有人多数日子使用仅用于辅助沟通的平板,有人每天使用专用沟通平板。细节说明样本内部即存在设备生态差异,复述时不应把 3 人合并为同一种使用方式。

问卷组件负责引出可分析的叙述。初始问卷先问性别与设备使用,再呈现 8 个开放式问题。第二轮去掉人口学问题,保留同样的八问以便补充。这种设计把身体使用、情境条件与身份评价放在同一份材料里,为后文横切主题留下连接点。

语音生成设备 × 具身: 语音生成设备指把符号、图片或键盘输入转为合成语音的高技术辅助沟通系统,分工是把使用者意图变成可听话语;具身指因贴身高频使用而把设备体验为身体延伸,分工是解释设备卡顿为何被感受为自我受限;二者搭配是因为只有把设备看作身体,才能理解响应与可靠性为何是主体条件,组合意义在于把技术改进直接对应为恢复行动能力。

能动性 × 权力: 能动性指有意图地撰写并发出符合自身意图信息的能力,分工是描述能否把想法说出去;权力指即使遭遇他人阻力仍实现自己意志的机会,分工是描述被催促或不被等待时能否坚持说完;二者搭配是因为只看操作会漏掉社会压制,组合意义在于把等待、语速期待和安全感纳入语音技术评价条件。

分析组件负责把叙述转为主题。作者使用归纳主题分析方法,对半结构化且理论知情的问题回答进行编码。操作上先得大主题,再在适用处分子主题,再在子主题下分促进因素与阻碍因素。需要提醒初学者,归纳不等于无理论视角,问题本身已带有技术整合、身份与权力的理论关切。

下表把招募、补偿、问卷轮次与数据形态按环节整理成一行一环节,便于对照检查设计是否透明完整。

环节对象与内容规模与补偿时间与形式数据形态
招募非二元 SGD 使用者邮件列表3 名成年人同意被联系者中招募名单来源明确
补偿参与研究的时间成本20 USD一次性参与补偿金额明确可核对
第一轮性别设备加开放问题8 个开放问题在线匿名填写文字叙述
间隔日常反思与补充观察1 周反思期带着问题生活生活情境补充
第二轮除人口学外同题再答同 8 问减人口学在线匿名填写追加与修正

从这张设计一览可以看到,透明之处在于人数、轮次、间隔、匿名表单与补偿都可核对,适合作为深度需求评估来复述。边界在于没有设备日志、没有对话者视角、没有纵向追踪,主题计数只反映这 3 人在这些问题下的表达密度,不能推广为人群的需求排序。

有无模型训练:本研究训练了什么,没有训练什么?

本研究没有训练任何神经网络模型,也没有微调、冻结或更新任何语音合成参数。因此不存在梯度路径、损失函数、优化器步骤或早停等需要报告的训练细节。无训练不意味着结果确定,因为开放式回答的编码依赖研究者判断。

同一材料换编码者可能得到不同的子主题切分。真实发生的计算与构造过程是质性构造过程。第一步是材料构造,两轮在线表单文字回答按参与者与问题归档。表格编码环节曾使用人工智能工具辅助,文本润色也用了人工智能工具,但作者声明所有辅助内容都经人工审阅、核实与修改。

第二步是分析构造,研究者阅读全部回答,进行开放编码,再聚类为日常整合、身份表达、权力与能动性三大主题,并在适用处分子主题与促进阻碍维度。第三步是计数呈现,统计落入各子主题的引文数并用条形图展示。

参与式行动研究 × 需求评估: 参与式行动研究指把受影响社群作为平等伙伴纳入招募、收集、分析与传播全过程的立场,分工是保证问题由社群定义;需求评估指其第一阶段开放式摸清社群最关切问题的步骤,分工是为后续设计提供方向而不预设答案;二者搭配是因为本研究明确不替社群决定优先事项,组合意义在于把 3 人深度回答转化为后续协同设计的合法起点而非代表性结论。

缺项需要点名,本研究未报告编码者人数、编码一致性检验、编码手册版本或饱和度判断标准,也未公开编码过程文档。复述时应说数据处理止于人工主题分析与计数可视化,不存在可复跑的训练脚本。对于想复现的人,可重放的是招募文案、8 个问题、两轮间隔与分析方法引用,而不是模型超参数。

实验条件如何交代:数据、划分、指标与成本是什么?

这是一项质性调查,没有数据集划分、基线模型、自动指标或硬件预算。按实验条件逐项交代,数据是 3 名参与者在两轮问卷中留下的开放式文字回答,问题清单在方法节完整列出八问。采样是有目的抽样而非随机抽样,来源是特定邮件列表。

条件是成年且认同为非二元并使用语音生成设备。聚合对象是引文条数按主题与子主题的归类计数,不是按人平均的分数,也没有做统计显著性检验。指标方向不适用准确率越高越好这类判断,阅读方向是看哪些诉求被反复表达。

协议细节值得复述,匿名通过在线表单完成,第一轮含人口学与八问,第二轮去掉人口学保留八问,间隔一周用于反思。补偿为小额固定金额,分析方法为归纳主题分析,主题受问卷问题影响,子主题下再分促进因素与阻碍因素。这些条件共同决定证据适用范围。

适合回答这 3 人在这些问题下如何体验权力,适合提炼设计假设,不适合估计人群比例或比较设备优劣。成本与资源同样按原文交代,参与者时间成本通过小额补偿覆盖,研究者侧未报告工时或计算开销,因为不涉及模型训练与推理部署。论文致谢说明资助来自实时上下文感知语音假体项目,但这不改变本研究本身无系统构建的性质。

发现了什么:三个主题各自报告了哪些促进与阻碍?

先看日常整合主题,下分子主题为身体整合、认知情绪整合与社会整合。身体整合的促进证据是设备常在身边,例如平板放在身上或附近随时沟通,设备用背带佩戴全天按需使用,躺在床上配合支架更容易使用。阻碍是环境物理条件,例如太吵或潮湿的地方难以使用。

认知情绪整合的促进证据包括晚上精力低时更常用设备,提前写好脚本在认知上很重要,带着设备会感到安心。阻碍包括极度疲劳让使用更难,不提前准备就会慢,回答问题时挣扎,以及因被迫发声的创伤而即使需要也难以使用设备。社会整合的促进是与伴侣朋友或理解辅助沟通的人在一起更容易,阻碍是对方不等待、催促、与家人互动更难、不理解或不接受辅助沟通。

再看身份表达主题,下分一般身份、性别身份与方言地域身份。一般身份的促进是设备让表达成为可能,甚至优于口语声音,阻碍是为保证可懂度牺牲身份,例如所用声音不总是最合适、选择基于可懂度而非身份。性别身份的促进是想要更多性别中立与酷儿声音、更多性别选项、让人无法立即判为男或女的声音。阻碍是技术限制,例如曾因软件不支持调音高而被迫用更不合适的声音。

方言地域身份目前多为想象中的促进,例如想要特定地区口音、更匹配所在地的声音、性别中立的地区英语,说明需求明确但供给缺席。权力与能动性是横切主题,促进是把定制声音当作夺回所有权,例如这是我的声音我想要权力、想要故意制造恐怖谷效果。阻碍包括技术上移动太慢、社会上对方不等待与催促、以及感到不安全时难以使用。

身份对齐 × 可懂度: 身份对齐指合成语音在性别、地域等方面让使用者感到像自己,分工是承载自我呈现;可懂度指在噪声或陌生听者面前被听清的程度,分工是保证信息传递;二者搭配是因为现有语音库往往不能两全,组合意义在于揭示参与者被迫用身份换清晰的妥协机制,这正是后续语音调色板需要同时解决的矛盾。

要比较各子主题的促进与阻碍机制,可以把原文引文例按维度整理,下表把 5 个维度的典型说法集中呈现,便于先看机制再读图。

主题维度子主题促进因素原文例阻碍因素原文例证据形态
日常整合身体与环境设备随身按需使用太吵太湿难以使用使用轨迹叙述
日常整合认知情绪提前脚本降低负荷疲劳与创伤阻碍使用状态与策略叙述
日常整合社会互动理解者面前更容易不等待与催促使更难互动条件叙述
身份表达性别与方言想要中立酷儿与口音为可懂度牺牲身份选声妥协叙述
权力主权横切两主题我的声音我想要权力不安全时难以施行意志所有权与安全叙述

从上表可以看到,促进与阻碍并置后,技术条件与社会条件同等重要,复述时可逐格回查原文引文。具体代价是同一引文可能同时计入两个主题,跨行比较数量会重复计算,因此只能比较质性机制,不能排名。未胜出或负结果是方言需求明确但供给缺席,性别中立声音想要但现有调音高功能曾不可用。

该条形图横轴为引文计数,纵轴为 9 个子主题,颜色区分三大主题,绿色包含独立与共享两种计数,需要先确认图例再比较长度。

看图路径: 1. 先看横轴计数与纵轴九个子主题标签,再对照底部图例确认蓝黄绿三色的主题归属;2. 比较绿色最下方两条共享条带的长度,确认权力主题主要以交叉形式出现;3. 对比黄色中方言条带最短,确认地域口音诉求明确但证据较少;4. 注意蓝色三条长度接近,确认身体、社会与认知情绪整合被相近频次提及

原论文 Figure 1:Bar graph showing the number of quotes in each theme (SGD Integration = blue, Identity Expression…

论文图 1。原论文 Figure 1:“Bar graph showing the number of quotes in each theme (SGD Integration = blue, Identity Expression = yellow, Power and Agency = green) broken down by subtheme; Power and Agency,…”。

蓝色 3 条分别对应身体、社会与认知情绪整合,说明日常整合的三方面被均衡提及。黄色 3 条为一般身份、性别身份与方言地域,说明性别与一般身份诉求并重,方言证据较少但方向集中。绿色 3 条为独立引文与两种共享计数,可见权力主题很少孤立出现,几乎总是附着在具体使用与身份情境上。这支持论文把权力作为横切主题的处理,也提醒读者不能把绿色条带加总为独立样本量。

哪些对照与反证防止把发现读成因果?

论文没有消融实验,但有多处可当作反证来读。第一组反证是可懂度与身份的取舍。参与者明确说基于可懂度而非身份选声,这说明即使提供更多声音选项,若默认排序仍偏向清晰标准,使用者仍可能被迫放弃身份对齐。教学上可以这样理解,增加选项不等于增加主权。

选择界面与默认值同样是权力机制。此处为解释性转述,原文直接报告了该妥协,未做因果检验。第二组反证是社会条件对技术效果的调节。同样一台设备,在理解的人面前更容易,在催促的人面前更难。这支持关系主权的解释,即等待本身就是技术条件。

若只优化合成速度而不训练对话伙伴等待,权力缺口可能依然存在。论文在未来工作里明确建议协同探索互动规范,例如训练对话者等待,以及设计能可视化提示正在组句的界面。第三组反证是技术可行与设计到位的差距。

讨论部分列出多种架构的互补控制形式,包括自然语言提示、零样本风格、零样本编辑、方言克隆、时长与情感解耦,以及说话人插值探索连续音色空间。原文认为这些能力映射到本研究识别的需求,包括超越二元的声音、地域口音、定制灵活性与对话轮流。但论文紧接着指出这些能力尚未在辅具语境中实现以身份为中心的设计。

控制常依赖刻板或性别化描述,方言层与音色未必解耦,评测仍聚焦可懂度与相似度而非拥有感、身份对齐或感知能动性。外加延迟、隐私、许可与知情同意等部署问题未成熟。尤其当设备引入大语言模型参与生成或补全话语时,设备越是参与说什么,保障使用者的著述权就越关键。这些都应读作待验证的设计假设,而非已证明的改进效果。

边界在哪里:哪些结论不能从三人样本推出?

第一个边界是样本量与代表性。论文明确这是对 3 名非二元使用者的深入调查,定性方法带来更丰富的数据,适合研究小众且研究不足的社群。但不能推出人群比例、设备优劣排序或跨地区口音需求的分布。

参与者内部已呈现异质性,包括不同性别认同表述与不同设备组合,复述时应保留这种异质性,不把 3 人平均成一个典型用户。第二个边界是方法依赖。作者承认主要主题深受问卷问题本身影响,主题计数反映的是在这些问题下的表达密度。

主题计数不是需求重要性的客观度量。两轮问卷之间的一周反思有助于补充,但没有对话者访谈、设备日志或长期观察来三角验证,社会整合部分的结论尤其依赖使用者单方叙述。第 3 个边界是技术讨论的性质。

论文对新一代语音合成能力的映射属于可行性对照,原文用词是显示互补控制形式并映射到需求,但同时指出在辅具部署中控制机制、评测指标、延迟隐私许可等仍不成熟。因此不能把技术可行读成部署就绪,也不能承诺换模型就能改善误判率、延迟或成本,因为这些量根本未被测量。缺失证据不是技术错误,但相关性不是因果,总体趋势不等于每组每步都成立。

若要复现需求评估:先做什么,需要补哪项验证?

复现的第一步是重做招募与知情同意。从曾同意被联系的名单中邀请成年非二元使用者,说明研究目的为开放式需求评估,明确补偿金额与匿名方式,并说明两轮填写与一周反思的要求。不要预设最需要解决的是音色。

而应原样使用 8 个问题,覆盖 1 天轨迹、困难情境、时段差异、是否提前准备、身份限制实例、改进建议、当前符合度与定制想法。第二步是重做分析流程。按归纳主题分析步骤阅读全部回答,先开放编码再聚类。

保留大主题、子主题与促进阻碍的区分,并单独标记横切主题的共享归属。建议在复现时补上原文缺失的过程记录,包括编码者人数、编码手册版本、一致性检查方式与饱和度判断,以便他人检查。若使用人工智能辅助表格编码或文本润色,应如原文披露那样说明用途,并保留人工审阅修改记录。

第三步是补验证而非扩写结论。若想把需求转为设计,应继续完整的参与式行动研究,邀请使用者进入团队参与招募、收集、分析与传播。具体可做协同设计会原型化反映性别 expansive 身份与地域语言特征的声音,协同探索等待规范与组句提示界面。

并把评测从可懂度相似度扩展到拥有感、身份对齐与感知能动性。何时值得尝试新语音合成能力,当使用者明确想要连续音色空间而非固定男女二选一、当需要地域口音与性别表达解耦、当需要随时切换多声音时,可小范围试用自然语言提示或说话人插值。但必须同步解决延迟、隐私、许可与著述权问题,否则不应进入日常部署。

收束:这篇论文给语音研究留下了什么可带走的判断?

把全文压缩成可复述的三句话。第一,设备对这 3 名使用者而言已是身体的一部分,日常整合的顺畅与否直接决定能否行动,而社会等待与环境条件与设备性能同等重要。第二,身份表达的瓶颈不只是缺中性音色,还包括为可懂度被迫放弃身份、基础定制曾不可用、地域口音几乎缺席。

使用者想要的是能随时切换、能性别怪异、能匹配所在地的声音调色板。第三,权力主题横切前两者,使用者用定制夺回所有权,用被催促与不安全感描述权力受限,论文据此提出声音主权作为设计目标。对初学者的实践含义是分层的。若做语音合成,不要只报可懂度与相似度。

至少同时记录使用者是否感到声音像自己、能否按自己条件切换、对话者是否等待。若做辅具部署,不要把增加音色数量当作完成身份对齐,还要检查描述词是否刻板、方言与音色是否解耦、延迟与隐私是否可接受。若做质性研究,不要把 3 人主题计数读成人群排序。

而应读成可检验的设计假设,包括更快更可靠的响应、更多超越二元的声音、更多方言选项,以及让等待可见的交互设计。最后回到论文结尾的意象。作者引用现象学描述,指出设备没电会让具身关系突然中断,设备从让人说话的工具变成需要被照顾的他者。

论文把这个意象翻转为对研究者的要求,人类同样需要权力,做相关研究与开发的人员,应当把权力让渡给辅助沟通社群,尤其是其中最边缘的成员。这与方法定位一致,需求评估的终点是让社群定义下一步,技术可行只是起点,是否实现声音主权要由使用者说了算。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总