论文解读

无声时肌肉还在说话:用通道协方差把肌电直接译成音素

该文只用静默构音肌电与文本转写、用对称正定矩阵表示通道间相关再接门控循环网络与联结时序分类损失做音素级序列转换,在大词表单被试上报告音素错误率 48.47% 与词错误率 73.53%,代价是仍需双向整句解码且主要证据来自单名健康被试。

 · 更新于 2026-09-24 · 约 19 分钟 · 9104 字 阅读 →
论文解读

跨天解码为何会塌:ALIGN 用对抗对齐剥离会话线索

针对颅内语音神经假体跨会话漂移,ALIGN 用多源对抗会话不变学习加中间层对齐与时间拉伸增强,在 T12 与 T15 上相对基线降低音素错误率与词错误率,但远期大间隔与伪标签自训练仍是主要边界。

 · 更新于 2026-09-24 · 约 23 分钟 · 11050 字 阅读 →
每日研究速递

uai-2026 论文深度解读

共收录 1 篇 uai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 3 分钟 · 1181 字 阅读 →
论文解读

冻结表征上分离对比损失与正确配对的语义精炼

在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。

 · 更新于 2026-09-24 · 约 23 分钟 · 11277 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 93 分钟 · 46170 字 阅读 →
论文解读

Contextual Biasing for Streaming ASR via CTC-based Word Spotting

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7082 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-19

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 128 分钟 · 63905 字 阅读 →
论文解读

Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5713 字 阅读 →
论文解读

UMA-SPLIT: Unimodal Aggregation for Both English and Mandarin Non-Autoregressive Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3808 字 阅读 →