LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
📄 LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues #语音交互 #语音大模型 #基准测试 #内容审核 #多模态模型 8.1/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #语音交互 | #语音大模型 | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 通讯作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 作者列表:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering)、Shinji Watanabe(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 这篇论文为语音安全评估贡献了一个设计精良的受控基准,最可贵之处在于清晰揭示了“增加音频不一定更安全”这一反直觉结论,并系统解构了模态、转录源和提示策略间的复杂交互。然而,所有对话均基于合成语音,真实的嘈杂环境、口音、自然副语言信息和多轮累积危害的缺失,使得当前结论能否直接迁移到实际部署中仍存较大疑问,而作者在这方面过于乐观的决策流程图可能会误导急于落地的从业者。 ...