Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders
📄 Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders #语音合成 #自监督学习 7.7/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.7/10 | 前25% | #语音合成 | #自监督学习 | arxiv 👥 作者与机构 作者: Nikita Koriagin, Georgii Aparin, Nikita Balagansky, Daniil Gavrilov 机构: T-Tech (Koriagin, Balagansky, Gavrilov), AI Foundation and Algorithm Lab (Aparin) 💡 毒舌点评 这篇工作方向不错,把可解释性工具搬到多模态TTS场景,但执行上有点“半成品”。最大的问题是“自己评自己”——用Gemini标,再用Gemini评,这分数的可信度得打个大折扣。实验只盯着一个0.5B的小模型,结论能不能推广到主流的大参数TTS系统里,完全是个问号。引导实验看起来数字亮眼,但全是自动指标,没几个人类评估,怎么知道生成的“笑声”是自然的还是机械的鬼畜?另外,方法虽然适配了新场景,但核心SAE和auto-interp都是前人的工作,谈不上有多大突破。总的来说,是个有用的探索,但离让人信服的结论还差得远。 ...