ICASSP 2026 语音/音频论文详细分析
共分析 898 篇 ICASSP 2026 论文
共分析 898 篇 ICASSP 2026 论文
共分析 133 篇 ICLR 2026 论文
针对日语音形多对多导致正字法监督折叠词位读音的问题,论文把目标细化为 span 绑定的 ruby 序列并用 Qwen3-ASR 加 mora 级 CTC 联合训练,在五项基准上以加权 Kana CER 3.75% 改善读音直读而字形转写未退化,但自发语音与罕见词形仍是主要瓶颈。
共分析 62 篇语音/AI 论文
针对序列级塔布拉鼓点转录标注稀缺问题,该工作用教师模型生成伪标签、S-CEM 估计每个鼓点可信度、CMW-ATC 在不确定片段上按马尔可夫转移加权候选序列,在三组评测上把序列错误率降到 18.3、33.3 和 12.7,但仍需序列级标注和固定转移矩阵。
共分析 26 篇语音/AI 论文
该文用 16 层 Conformer 编码器加 CTC 解决英文短语音转写,在仅公开数据与三阶段训练下以 470M 参数进入 OpenASR 速度精度前沿,代价是依赖大幅降采样与 16K 子词建模。
共分析 36 篇语音/AI 论文
针对语音大模型强化学习只看文本词错率而放任语言先验补词的问题,该研究在训练期叠加冻结字符级 CTC 声学裁判做组内奖励,用一次贪心解码在 AMI 远场会议上把插入错误降低 22.3% 至 28.3%,代价是少量删除错误上升且只验证了单个 7B 策略与 0.3B 裁判组合。
论文把受约束加性 U-Net 等价为临界采样完全重构滤波器组,再用全速率残差路由把学习目标转为任务相关的取舍,在 TIMIT 上以相同识别器把测试音素错误率从 28.60±2.09% 降到 25.76±0.41%,代价是保留双路全分辨率表示带来的过完备冗余。
共分析 59 篇语音/AI 论文
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
针对发音评估既要认准音素又要定准边界的问题,该工作把每个音素展开为有序子音素状态并用最优时间传输做稠密单调训练,在朗读、自发与二语语音上改善切分并保持可比识别,主代价是更细帧率与更长拓扑会推高识别错误并需要权衡诊断增益。
共分析 19 篇语音/AI 论文
针对从零训练的解码器语音合成的内容幻觉问题,论文把只作用于优选样本的轻量 CTC 对齐项折进直接偏好优化,在 Seed-TTS 英文集上把严重幻觉率从 4.4% 降到约 0.6%,代价是需要切到 eager 注意力读图且过强加权会转入自信但错位的过锐区。
针对 CTC 对时间边界不敏感导致词结束时间常被拖到下一词起点的问题,该文在 CTC 之外只在词起点、词终点和静音等关键帧上加掩码交叉熵约束,用 Jamendo 上词起点平均绝对误差 0.213 秒、词终点 0.332 秒的对照显示全静音掩码改善终点、起点掩码决定起点,代价是起终点最优解来自两种掩码的组合而非单一模型。
共分析 27 篇语音/AI 论文
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该文研究无帧级肌电-音频对齐时如何从口面肌电合成语音,选择把肌电协方差功率映射到冻结 HuBERT 离散单元再用现成声码器发声,最强证据是 H 线性预测肌电功率达 r=0.85 且 vec(E) 加音素引导解码显著降低单元错误率,代价是词错误率仍在 50% 以上且仅单例 ALS 验证。
针对口音导致词错率上升且推理时无可靠口音标签的问题,论文在 FastConformer 中插入序列级混合专家并为每个专家配独立 CTC 头、用两阶段路由从口音感知过渡到无标签推理,最强证据是在 MCV-ACCENT 上有预训练条件下大小模型同时降低已见和未见口音词错率,代价是训练早期仍需口音标签并增加混合专家参数与训练开销。