先压住佩戴者自己的声音,再找对话对象:CHiME-9 ECHI 三阶段提取解读
针对可穿戴多通道录音中佩戴者自干扰过强与注册音频失配问题,论文用佩戴者抑制加目标提取加后处理三阶段流水线,在开发集上多数客观指标超过官方基线,在测试集上以可懂度下降为代价换取目标语音质量与总体质量提升。
针对可穿戴多通道录音中佩戴者自干扰过强与注册音频失配问题,论文用佩戴者抑制加目标提取加后处理三阶段流水线,在开发集上多数客观指标超过官方基线,在测试集上以可懂度下降为代价换取目标语音质量与总体质量提升。
本研究以半自发科姆语语料检验词干首位置是否伴随超发音式的元音分化,发现三个共有元音在重音位置共振峰更分散且时长略长,但声调未建模与词界混淆仍是主要代价与限制。
该研究用话语补全任务比较 77 名西班牙加泰地区俄语遗产儿童与单语俄语和加泰西语双语对照组在特殊疑问句核配置上的分布,发现遗产儿童以 72% 的目标俄语型保持与社会语言的区别,但默认升降型显著少用并出现句末附加重音的非目标型。
该研究用实时共振峰扰动范式检验目标元音/E/在/p/、/b/、/m/语境和高低掩蔽噪声下的听觉运动适应,发现被试总体发生补偿性适应但高噪声下/p/适应最大而低噪声下辅音效应消失且邻近元音出现整体扩张,代价是内部传导与外部扰动的不一致无法被完全掩蔽且低噪声下扰动失败率更高。
针对从零训练的解码器语音合成的内容幻觉问题,论文把只作用于优选样本的轻量 CTC 对齐项折进直接偏好优化,在 Seed-TTS 英文集上把严重幻觉率从 4.4% 降到约 0.6%,代价是需要切到 eager 注意力读图且过强加权会转入自信但错位的过锐区。
针对 MOCHA-TIMIT 文件名与内容不一致且缺乏统一音素与韵律标注的问题,作者用 Whisper 校对加人工质检加英式英语 MFA 强制对齐生成 8 层标注,在 msak0 和 fsew0 共 920 句人工标注上达到约 80.4%-80.5% 音素分类正确率与 14.0-15.9 毫秒边界平均误差,但 19.5% 残余混淆仍集中在元音长短、双元音与连 …
该研究用地图任务比较 5 名轻中度阿尔茨海默病女性与 5 名健康老年女性的意大利语元音共振峰,发现 F1 与 F3 存在组间差异并呈轻微元音空间扩张趋势,但样本仅 10 人且 FCR 差异不显著,不能作为确诊依据。
该研究用视觉世界眼动范式检验英语真诚与反讽韵律的实时加工时间进程,发现韵律类型主效应不显著,而基频升高预测更多看向真诚目标、基频与谐噪比升高预测更少看向反讽目标,但初始注视偏置与刺激问题使交互式与模块式之争仍无定论。
该研究在 VoxCeleb2 上系统改变 ResNet 的深度、宽度和残差块分布并用机器级传感器实测训练能耗与碳排放,最强证据是 ResNet-419-D 相对 ResNet-200-D 仅把平均 EER 从 3.44% 降到 3.35% 却耗电约 4 倍达 895.67 kWh,而中等规模的 ResNet-50-D 及其向中间层集中块的变体以约 50 …
该研究用窄焦点语境下的四种语序×语调组合做合适度评级,检验韵律能否独立标记动词后窄焦点以及窄焦点语序是否必须配典型语调,最强证据是典型窄焦点得分最高但三类错配仍可接受且与基线无显著差异,代价是丰富词汇语境可能掩盖了线索在信息不足时的真实权重。
针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。
针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。
针对清醒脑肿瘤手术中电刺激引起的短暂构音障碍难以实时听辨的问题,论文提出录音去噪加 Whisper 切分加 MFCC 加 GRU 的二分类方法,在计数与 DO80 任务上报告约 90% 以上验证精度,但合并任务出现过拟合且异常样本仍偏少。
该研究用电磁发音仪比较词首与词中音节的辅音手势,显示元音音长效应出现早并溢出到相邻辅音而重音效应出现晚并延伸到后一音节,由此在不依赖固定音步域的条件下形成逆时关系,但代价是词首辅音几乎不受调制且长词第三音节的解析仍依赖音系假设。
该研究用实时磁共振测量塞茨瓦纳语短语末尾四个发音手势的时长、位移与峰值速度,检验单阶段边界减速与双阶段重音加边界协调两种解释,最强证据是时长出现两次拉长而位移与速度只渐进增大,代价是位移趋势统计不稳且结论依赖八位被试的特定材料。
该研究让 20 名未学过法语的普通话母语者用拼音自由转写法语 18 个 CV 塞音并做拟合度评分,显示法语浊塞音被稳定同化为普通话不送气塞音,而法语清塞音是否被听成送气取决于嗓音起始时间长短,代价是中间嗓音起始时间段出现大变异且元音与发音部位会系统改变判断。
该研究用荷兰语预测性句尾词汇判断任务检验节拍手势是否加速词汇通达,最强证据是噪声下真词反应时加快约 122 毫秒和 124 毫秒并使正确率提升约 4 个百分点,代价是手势与词重音是否对齐始终未产生可靠的交互作用。
该研究以 20 名女性发音人的 73 词两遍朗读与四项声学指标追踪高低调域对立,显示低调域用气嗓音实现但青年组差异更小且维持时间更短,而仙居话的弱化速度慢于北部吴语,代价是只覆盖第三调类与女性样本且未报告基频主导程度的直接验证。
该研究用同一批句子在字面与反讽语境下诱发法语朗读并测量语速、基频与强度,报告两组均未出现稳定显著的反讽标记,个体策略差异大于诊断组间差异,代价是仅 10 人小样本与强语境消除了对韵律的依赖。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读