Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR
📄 Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR 标签:#语音识别 #模型压缩 #领域适应 #低资源 #多语言 8.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 🔥 8.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #模型压缩 | #领域适应 #低资源 | arxiv 👥 作者与机构 第一作者:Sanjid Hasan(Khulna University of Engineering & Technology, Department of Computer Science and Engineering (CSE)) 通讯作者:未说明 作者列表:Sanjid Hasan(Khulna University of Engineering & Technology, Department of Computer Science and Engineering (CSE))、Md. Abdur Rahman(Khulna University of Engineering & Technology, Department of Computer Science and Engineering (CSE)) 💡 毒舌点评 论文对轻量级模型在形态丰富语言上失败的根本原因(tokenizer fertility)诊断精准,提出的“transplantation”管线工程价值突出,为同类问题提供了可复用的“外科手术”范本。然而,实验部分过于依赖单数据集(Lipi-Ghor)的端到端验证,缺乏关键的组件消融研究(例如,只做词表替换但不做两阶段恢复的效果如何),使得方法各部分的贡献边界模糊,说服力略有折扣。 ...