Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
📄 Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards #音频问答 #强化学习 #音频大模型 #推理 #数据增强 🔥 8.5/10 | 前25% | #音频问答 | #强化学习 | #音频大模型 #推理 学术质量 6.5/7 | 选题价值 1.5/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:Jiajun Fan (伊利诺伊大学厄巴纳-香槟分校 Siebel计算机与数据科学学院;实习于亚马逊) 通讯作者:未明确说明(论文提供了多位作者的邮箱,但未明确指定通讯作者) 作者列表: Jiajun Fan (伊利诺伊大学厄巴纳-香槟分校;亚马逊) Roger Ren (亚马逊) Jingyuan Li (亚马逊) Rahul Pandey (亚马逊) Prashanth Gurunath Shivakumar (亚马逊) Ivan Bulyko (亚马逊) Ankur Gandhe (亚马逊) Ge Liu (伊利诺伊大学厄巴纳-香槟分校) Yile Gu (亚马逊) 💡 毒舌点评 本文最大的亮点在于精准诊断并命名了“测试时反向扩展”这一音频大模型推理的顽疾,并为此开出了“过程奖励”这剂对症良药,将强化学习的应用从粗放的结果监督提升到了精细的思维过程雕琢。然而,其方法的计算开销(需要多次采样)和奖励函数设计的复杂性,使其对资源有限的团队并不友好,且最终性能天花板仍受制于基础音频感知器的短板,这提醒我们“会思考”之前,得先“听清楚”。 ...