论文解读

把二次方的强制对齐压进终端设备:原地计算与可解释剪枝

针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。

 · 更新于 2026-09-24 · 约 19 分钟 · 9476 字 阅读 →
论文解读

给定时转录本后一次标全词时间戳与说话人:非自回归标注为何更快更准

该研究把时间戳与说话人归属做成对给定转录本的单遍占位填充,用双向大模型同时输出全部标签,在相同训练数据下比同类自回归模型更准且标注快一到两个数量级,但流水线总速度仍受前置语音识别限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9939 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

在识别与切分之间加状态:用有序子音素与最优传输恢复帧级证据

针对发音评估既要认准音素又要定准边界的问题,该工作把每个音素展开为有序子音素状态并用最优时间传输做稠密单调训练,在朗读、自发与二语语音上改善切分并保持可比识别,主代价是更细帧率与更长拓扑会推高识别错误并需要权衡诊断增益。

 · 更新于 2026-09-24 · 约 23 分钟 · 11333 字 阅读 →
论文解读

文件名对不上内容、全员标注缺失:把 MOCHA-TIMIT 九个说话人重新对齐

针对 MOCHA-TIMIT 文件名与内容不一致且缺乏统一音素与韵律标注的问题,作者用 Whisper 校对加人工质检加英式英语 MFA 强制对齐生成 8 层标注,在 msak0 和 fsew0 共 920 句人工标注上达到约 80.4%-80.5% 音素分类正确率与 14.0-15.9 毫秒边界平均误差,但 19.5% 残余混淆仍集中在元音长短、双元音与连 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9942 字 阅读 →
论文解读

读词末尾多出来的摩擦音:法兰西岛 /i/ 尾语料中性别效应偏向男性一侧

该研究在法兰西岛 2018-2025 年读词孤立词任务中检验性别对摩擦性增音的影响,基于 434 条以/i/结尾的录音和逐条有无标注,发现录音层面的混合模型显示男性录音显著更多,而人均比例模型不显著,代价是仅 22 人且未做声学参数测量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8914 字 阅读 →
论文解读

只在关键帧上加监督:用不同掩码拆开词起点与词终点的对齐误差

针对 CTC 对时间边界不敏感导致词结束时间常被拖到下一词起点的问题,该文在 CTC 之外只在词起点、词终点和静音等关键帧上加掩码交叉熵约束,用 Jamendo 上词起点平均绝对误差 0.213 秒、词终点 0.332 秒的对照显示全静音掩码改善终点、起点掩码决定起点,代价是起终点最优解来自两种掩码的组合而非单一模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9026 字 阅读 →
论文解读

打码说话为何变慢:法语补码口语中音段时长与手动键结构的协同

本研究以五名熟练编码者的 2148 个 CV 键为对象,用线性混合模型检验词类、句内位置与朗读任务对辅音和元音时长的影响,发现说话人差异主导时长而常规语言学因素解释力不足,代价是模型仅解释约三成方差且编码语速整体慢于自然口语。

 · 更新于 2026-09-24 · 约 21 分钟 · 10394 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

车里噪音太多判不准语音:用音节级对齐重造训练标签的 SylVAD

针对车内发动机与路噪导致 Silero VAD 误检多、人工标注难的问题,SylVAD 用韩语音节级 MFA 自动构造标签并以噪声加权损失微调,在实车日志上把非语音段误检数从 3243 降到 1475,F1 从 0.9372 提升到 0.9556,代价是依赖文本与对齐分数过滤且推理结构不变。

 · 更新于 2026-09-24 · 约 16 分钟 · 7642 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把对齐改成填空:一次填完长语音时间戳的槽位方案

针对多语长语音中逐帧搜索易累积系统性偏移的问题,该文把强制对齐改成在文本中插入时间槽并分类预测离散时间索引,报告在伪标签与人工标注上平均累积偏移大幅下降,代价是模型更大且实时因子略升、人工验证仅覆盖中文。

 · 更新于 2026-09-24 · 约 19 分钟 · 9165 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

越南语识别缺的不是模型,而是可复用的清洗与对齐流水线

该文针对越南语开源语音文本对质量杂、格式不一、缺词级时间戳的问题,提出七步聚合清洗与对齐流水线,用约 502.67 小时高质量数据把微调后模型正字法词错误率降到 12.46%,代价是严格过滤丢掉约 38% 采样数据且仍偏向北部口音。

 · 更新于 2026-09-24 · 约 19 分钟 · 9235 字 阅读 →
论文解读

先出声再等文本:用原生语音令牌在波形之前跟踪读到哪

增量文本流式语音合成需要在线知道说到原文何处,X2-NativeCursor 用原生语音令牌加局部匹配做可修正估计再输出单调光标,在 80 毫秒前视下中文平均绝对误差 0.151 字,对比在线波形基线 320 毫秒前视下 1.253 字,代价是每个主干需单独训练观察器且对未见音色敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9189 字 阅读 →