把二次方的强制对齐压进终端设备:原地计算与可解释剪枝
针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。
针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。
该研究把时间戳与说话人归属做成对给定转录本的单遍占位填充,用双向大模型同时输出全部标签,在相同训练数据下比同类自回归模型更准且标注快一到两个数量级,但流水线总速度仍受前置语音识别限制。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对发音评估既要认准音素又要定准边界的问题,该工作把每个音素展开为有序子音素状态并用最优时间传输做稠密单调训练,在朗读、自发与二语语音上改善切分并保持可比识别,主代价是更细帧率与更长拓扑会推高识别错误并需要权衡诊断增益。
针对 MOCHA-TIMIT 文件名与内容不一致且缺乏统一音素与韵律标注的问题,作者用 Whisper 校对加人工质检加英式英语 MFA 强制对齐生成 8 层标注,在 msak0 和 fsew0 共 920 句人工标注上达到约 80.4%-80.5% 音素分类正确率与 14.0-15.9 毫秒边界平均误差,但 19.5% 残余混淆仍集中在元音长短、双元音与连 …
该研究在法兰西岛 2018-2025 年读词孤立词任务中检验性别对摩擦性增音的影响,基于 434 条以/i/结尾的录音和逐条有无标注,发现录音层面的混合模型显示男性录音显著更多,而人均比例模型不显著,代价是仅 22 人且未做声学参数测量。
针对 CTC 对时间边界不敏感导致词结束时间常被拖到下一词起点的问题,该文在 CTC 之外只在词起点、词终点和静音等关键帧上加掩码交叉熵约束,用 Jamendo 上词起点平均绝对误差 0.213 秒、词终点 0.332 秒的对照显示全静音掩码改善终点、起点掩码决定起点,代价是起终点最优解来自两种掩码的组合而非单一模型。
本研究以五名熟练编码者的 2148 个 CV 键为对象,用线性混合模型检验词类、句内位置与朗读任务对辅音和元音时长的影响,发现说话人差异主导时长而常规语言学因素解释力不足,代价是模型仅解释约三成方差且编码语速整体慢于自然口语。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对车内发动机与路噪导致 Silero VAD 误检多、人工标注难的问题,SylVAD 用韩语音节级 MFA 自动构造标签并以噪声加权损失微调,在实车日志上把非语音段误检数从 3243 降到 1475,F1 从 0.9372 提升到 0.9556,代价是依赖文本与对齐分数过滤且推理结构不变。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对多语长语音中逐帧搜索易累积系统性偏移的问题,该文把强制对齐改成在文本中插入时间槽并分类预测离散时间索引,报告在伪标签与人工标注上平均累积偏移大幅下降,代价是模型更大且实时因子略升、人工验证仅覆盖中文。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
该文针对越南语开源语音文本对质量杂、格式不一、缺词级时间戳的问题,提出七步聚合清洗与对齐流水线,用约 502.67 小时高质量数据把微调后模型正字法词错误率降到 12.46%,代价是严格过滤丢掉约 38% 采样数据且仍偏向北部口音。
增量文本流式语音合成需要在线知道说到原文何处,X2-NativeCursor 用原生语音令牌加局部匹配做可修正估计再输出单调光标,在 80 毫秒前视下中文平均绝对误差 0.151 字,对比在线波形基线 320 毫秒前视下 1.253 字,代价是每个主干需单独训练观察器且对未见音色敏感。