开放收集为何仍数不出酷儿声音:六个语音数据集审计与四组实践张力
论文审计六个英语语音技术数据集,发现可测量的酷儿占比仅 0–1.4% 而不足以做稳健差异度量,并以两个酷儿社群语音库为对照,提出规模化与包容、效率与参与、开放与自主、静态类别与流动身份四组张力,且代价是现有众包与开放流程难以覆盖小而易受污名群体。
论文审计六个英语语音技术数据集,发现可测量的酷儿占比仅 0–1.4% 而不足以做稳健差异度量,并以两个酷儿社群语音库为对照,提出规模化与包容、效率与参与、开放与自主、静态类别与流动身份四组张力,且代价是现有众包与开放流程难以覆盖小而易受污名群体。
本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。
该研究把二语节奏评估做成流利度和韵律分数回归,用一维卷积直接从语音幅度包络及其一阶导数学生节奏特征,最强证据是包络导数模型在低流利度组误差显著低于时长模型,代价是韵律维度仍受语调混杂与低分样本稀少限制。
CycleSpeech 以结构化声音档案为共享可验证目标,先联合监督微调再用 CycleGRPO 交替优化合成与理解,在中英文指令匹配上相对基座提升 4.50 和 10.06 个百分点,代价是需要 20,046 条对齐语料与多步采样奖励计算。
该研究用说话人去标识任务同时检验验证抵抗、软生物属性、检索重识别、嵌入结构和可懂度五个维度,显示没有系统在全部维度占优且最保护隐私的系统可懂度损失最大。
论文用 10 名双语政客各 20 句卢森堡语加 20 句法语共 400 句和 41 个魅力相关声学韵律特征,以混合效应模型分离说话人与语言方差,发现说话人中位解释一半以上方差而语言中位仅占约 0.5%,语言差异集中在法语更高的 shimmer 与句末基频和卢森堡语更强的中频谱能量,但合成魅力指数无语言主效应。
该研究以 10 名卢森堡政治人物各 20 句卢森堡语加 20 句法语共 400 句自发政治话语为对象,用 C/V 分段与成对变异等时长节律指标加配对 t 检验与方差分解,报告显示元音时长与语速主要随语言重组而辅音时序保留说话人特征,且未发现语言与性别交互。
针对开放回答口语缺少准确度、流利度、韵律逐句标注的问题,OpenEnded 用 1000 条三人标注测试集加 6109 条训练与 2673 条开发伪标签支撑评估,并以冻结骨干加三头评分的 VoxPA 为更强基线,但伪标签偏向中间分且低分常与无语音绑定。
针对单看基频会把重音归因给音高的问题,该文选择在平滑后的基频线上同时编码瞬时强度与局部音节速率,并在意大利诗歌朗读上展示联合线索如何区分延续类边界,代价是颜色只表相对快慢且跨录音比较仍需归一化。
论文针对日常录音下声音亲缘验证线索稀疏且跨库泛化难的问题,选择卷积局部编码加变换器长程聚合与注意力池化的两阶段度量学习路线,在自建普通话非受控库 ARKIN 上报告 CONVTRAP-TN 优于三元组基线,但从 KAN-AV 跨库到 ARKIN 时性能大幅下降且少量微调难以恢复。
该文要解决超声舌成像中音频同步与头动记录分散、布线复杂的问题,选择无线 OptiTrack 六自由度头姿态加触发与时间戳统一采集的轻量方案,直接报告了设备布置与对齐检查流程,但完整的几何运动校正仍留待未来验证。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对连续语音韵律短语标注耗时问题,论文提出依赖完整主流美式英语 ToBI 训练的加速分组标注法 Rapid-ToBI,报告双人三分类一致性 κ=.87 而 Wavelet 在中间短语处漏检 78.5%,代价是仍需受训标注员且仅在约十分钟奥巴马讲话上验证。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究以非裔美国英语使用者产出的多义短语 you good 及单义对照句为材料,用 Praat 标 F0 峰位置与 OpenFace 加 findgest 标眉毛运动,检验句类与多义性对峰位、眉毛活动频率、抬眉分布与声手峰时序的影响,最强证据是句类显著决定 F0 峰落在第二词与眉峰相对更早,而疑问句并未带来更多眉毛活动或抬眉。
该研究用三音节形容词、名词、动词在对比焦点、窄焦点及两种焦点后条件下的对照发音实验,显示焦点使第二、三音节元音的基频、时长和能量一致抬高,而所谓词末重音与倒数第二重音的音节间差异并不稳定,仅频谱倾斜等个别指标支持重音解释。
该研究以陈述句的词末重音为基线,比较撒奇莱雅与法兰澳阿美语的疑问词首与祈使句动后小品的高音位置,提出高音重联而非重音移位的统一解释,代价是仅依赖八位发音人的声学描写而未做统计检验与感知验证。
本研究以半自发科姆语语料检验词干首位置是否伴随超发音式的元音分化,发现三个共有元音在重音位置共振峰更分散且时长略长,但声调未建模与词界混淆仍是主要代价与限制。
该试点研究让 4 名学俄约半年的法语母语者朗读 40 个最小对立词,用时长、基频、强度和共振峰检验四个假设,报告显示重音实现强烈依赖音节位置且强度被当作位置标记误用,代价是样本仅 4 人且朗读任务受西里尔字母熟悉度干扰。
该研究用话语补全任务比较 77 名西班牙加泰地区俄语遗产儿童与单语俄语和加泰西语双语对照组在特殊疑问句核配置上的分布,发现遗产儿童以 72% 的目标俄语型保持与社会语言的区别,但默认升降型显著少用并出现句末附加重音的非目标型。