Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
📄 别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读 英文题目:Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation 一句话:论文把 TTS 友好文本生成定义为偏好对齐问题,用仅 40 个权重的可解释特征线性奖励 FaRM 替代数十亿参数黑盒奖励模型,在仅 10 个样本时仍保持稳定,并在启发式、TTS→ASR 往返与人工听感三重验证下取得最均衡的友好度与有用性权衡,代价是输出偏长且目前仅验证英语双域单引擎。 标签:#语音合成 | #强化学习 | #语音交互 | #大语言模型 | #数据集 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Thibaut Thonet:机构信息未在 arXiv HTML 中可靠披露 Jos Rozen:机构信息未在 arXiv HTML 中可靠披露 Laurent Besacier:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把语音合成(Text-to-Speech,TTS)友好文本生成显式定义为可度量的偏好对齐问题,并用可解释特征线性奖励替代黑盒奖励模型,在仅 10 个样本的低数据 regime 下仍能维持稳定提升,工程链路完整且验证了廉价启发式与昂贵链路及人工听感的一致性。短板是数据集均为合成或半合成且仅覆盖英语咖啡点单与菜谱两域,启发式权重与 TTS→ASR 链路均高度依赖单一引擎与正则设计,输出偏长问题仅做单点权重干预,外推到真实多引擎、多语言部署的可信度不足。 ...