Linguistic Distance Segregates Latent Representations in Automatic Speech Recognition Systems
📄 口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开 英文题目:Linguistic Distance Segregates Latent Representations in Automatic Speech Recognition Systems 一句话:论文用语言学距离把 L1/L2 的二分偏差变成可回归的连续变量,并在 6 个数据集与 4 种架构上证明:距离越大词错率越高,且深层声学表征会按母语把说话人系统性地隔离而非归一化。 标签:#语音识别 #语音大模型 #多语言 #鲁棒性 #可解释性 评分:6.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Ting-Hui Cheng:Department of Applied Mathematics and Computer Science Line Katrine Harder Clemmensen:Technical University of Denmark Sneha Das:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语言学距离(Linguistic Distance,LD)这一经典二语习得变量系统引入英语自动语音识别(Automatic Speech Recognition,ASR)偏差分析,并用 Tweedie 混合效应模型与层级表征距离关联了误差与潜空间隔离,问题意识清晰。短板是 LD 度量依赖单一网站复合分数且缺乏语言学效度论证,统计报告多处缺失效应量与校正细节,t-SNE 可视化与相关性分析难以支撑因果性结论,整体更像相关性观测报告而非机制解释。 ...