谁来定义酷儿语音数据:从众包采集到共同设计的策展转向
本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。
本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。
针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。
针对说话数据训练的模型在唱歌时出现节奏漂移和表情受限的问题,论文用三阶段过滤构建 29500 余段野外唱歌头数据,并在 Hallo 等架构上验证了唇同步与节奏对齐的提升,但高强度筛选只保留约 6.9% 原料且依赖人工打分融合。
该研究针对可公开复现的大规模音乐与文本配对缺失问题,选择以互联网档案馆中声明为知识共享许可的音频为源、轻量音频语言模型初标加分类标签与档案元数据聚合精修为方法,最强证据是 1500 段抽样下与 JamendoMaxCaps 相当的参考无关分数与正确性完整性约 4.2 分以上的人评,主要代价是长时体裁欠采样与语言流畅性仍落后于人工标注。
该研究把朗读维基百科的语音按小节配上大模型规划加规则渲染的合成幻灯片,在英德荷三语上只用音频测出最佳平均微观词错率 10.23% 与字错率 6.48%,而全量幻灯片文本或图片的零样本提示因大段复制与插入错误而失效。
针对历史转写会传播实体错误并丢失发音与说话人信息的问题,该研究用场景可控的数据管线构造多模态对话历史并做上下文监督微调,最强证据是微调后语音加文本上下文在两个模型上取得最高的总体实体召回,但代价是需要合成语音过滤与条件匹配的微调,且无上下文基线与无关历史的鲁棒性仍有限。
针对波斯语缺少大规模高保真语音数据的问题,PersianVox 用声学轮次感知的韵律切分与 CTC/RNN-T 双自动语音识别一致过滤从网络音频构造语料,最强证据是 SCOREQ 在 564 句人工平均意见分上皮尔逊相关达 0.6658 优于 DNSMOS 且修复后 SCOREQ 均值从 3.04 升至 4.03,代价是从 6179.66 小时原料仅保留 …
该工作从社区采样标注中挖掘出 9.2 万条标注并揭示按边随机切分会使 54% 测试音轨泄漏,提出基于连通分量切分并修剪巨型分量得到 11.4 万/0.6 万/1 万音轨的 WhoSampled130k,代价是丢弃 23% 节点并保留有界泄漏风险。
Neyshekar 针对波斯语正式与非正式语体和命名实体覆盖不足,构建 99.02 小时朗读语料并以等时长对照证明两架构词错误率下降,但混合增益不稳定且说话人广度仍有限。
该文要解决超声舌成像中音频同步与头动记录分散、布线复杂的问题,选择无线 OptiTrack 六自由度头姿态加触发与时间戳统一采集的轻量方案,直接报告了设备布置与对齐检查流程,但完整的几何运动校正仍留待未来验证。
CVSS-X 把同一批英语真人录音经机器翻译转写为二十八种目标语言文本再用多语合成配音,构造每语言约二十四万对的英到多语并行语音,同管线复测显示其合成可懂度可用但自然度低于只合成英语的 CVSS,代价是受制于翻译质量与众包录音瑕疵。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
论文面对 Barlow 异构、过程性、软件依赖的原生数字遗产,提出以对象/事件框架加可扩展分类把过程翻译为可互操作元数据,证据是多 TB 硬盘遗产的原型编目与 Sibelius/MIDI/DOC/PDF 关联难题,代价是形式化必然不完备而需参与式持续修订。
针对管乐谱到音频缺少可控可复现数据的问题,论文用 311 首四部圣咏的 MEI 编码加规则表情模型加物理建模合成构建对齐的多轨数据,最强证据是 86 小时隔离音轨与 640000 种组合的完全对齐标注,代价是合成音色不及真实录音且不追求数据驱动最优音质。
该文把 CFPR 扩展为八类口音评测基准并做 87 人听辨实验,再用冻结的 MMS-LID-256 训练八分类器,报告在 CFPR 上整体准确率 40.98% 而人类多数投票为 70.4%,代价是中部与东部分类互相混淆且增强后大类反而下降。
DuplexDrama 针对全双工对话训练数据稀缺问题,用四阶段管线同时合成人设场景、三种全双工行为、表情语音与剧本对齐的声音事件,最强证据是相同语音加背景仅带来 UTMOSv2 与 NISQA 的可控下降,主要代价是全双工轮次占比仅 3.8% 且剧本合理性依赖 LLM 判断。
该文以独奏班多钮琴加现场电子与机器学习为对象,提出边缘声、姿态残留与被舍弃声三组声音痕迹作为行动线索,报告微弱气声与机械噪声比主导音高更稳定可辨,最强证据来自两场实验室式演出中的持续调校,代价是放弃通用识别精度与可迁移的定量评估。
该工作把网球赛后发布会视频加工成带说话人角色、转写和词级对齐的自发情感语音语料,并用预训练声学与文本模型做维度回归、离散分类和文本情感三组基准,显示胜者效价与优势感更高、败者悲伤主导更集中,但两组文本多呈积极且 arousal 差异小。