Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection
📄 别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听 英文题目:Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection 一句话:针对伪造语音在未见攻击与信道上泛化差的问题,论文把检测重做为问答任务,通过微调音频编码器配合冻结的指令大模型,并用 openSMILE 的 88 维声学特征文本化来弥合模态鸿沟,在 In-the-Wild 与 MLAAD 上取得显著域外提升,代价是约 1500 token 的提示开销与尚未开源的复现成本。 标签:#语音伪造检测 #多模态模型 #大语言模型 #参数高效微调 #鲁棒性 评分:6.4/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yassine El Kheir:机构信息未在 arXiv HTML 中可靠披露 Xin Wang:机构信息未在 arXiv HTML 中可靠披露 Wanqing Ge:机构信息未在 arXiv HTML 中可靠披露 Tim Polzehl:机构信息未在 arXiv HTML 中可靠披露 Sebastian Moeller:机构信息未在 arXiv HTML 中可靠披露 Junichi Yamagishi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 openSMILE eGeMAPSv2 88维特征的文本序列化显式锚定大语言模型(Large Language Model, LLM)语义空间,解决了音频大模型(Audio Large Language Model, ALLM)中连续音频嵌入与文本推理的模态鸿沟,并在 In-the-Wild 与 MLAAD 上把冻结 LLM 的泛化瓶颈撕开一道口子。短板则是正文与表格数值多处自相矛盾、1500 token 的提示开销被轻描淡写为可忽略,且未提供代码仓库与权重链接,可验证性与统计严谨性均有明显欠缺。 ...