BFCL Audio: An Audio Function Calling Evaluation for Large Language Models

📄 BFCL Audio: An Audio Function Calling Evaluation for Large Language Models #基准测试 #语音交互 #多模态模型 #模型比较 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | #语音交互 | #多模态模型 | #基准测试 #模型比较 | arxiv 👥 作者与机构 第一作者:Huanzhi Mao(University of California, Berkeley) 通讯作者:Huanzhi Mao(University of California, Berkeley) 作者列表:Huanzhi Mao(University of California, Berkeley)、Aditya Ghai(University of California, Berkeley)、Imra Dawoodani(University of California, Berkeley)、Tony A Ginart(Salesforce AI Research)、Shishir G Patil(University of California, Berkeley)、John Emmons(Salesforce AI Research)、Joseph E. Gonzalez(University of California, Berkeley) 💡 毒舌点评 首次系统评估音频function calling,其可控合成管道和无需LLM裁判的自动评分机制,为语音Agent的鲁棒性问题提供了清晰的归因分析。但工作本质上仍是现有BFCL基准向语音模态的延伸,且完全依赖合成数据,在真实场景的生态效度和结论的泛化性上存在硬伤。 ...

2026-07-04 · 更新于 2026-08-14 · 3 min · 623 words

CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction

📄 CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction #音乐生成 #基准测试 #数据集 #参数高效微调 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.3/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 ✅ 6.4/10 | 前50% | #音乐生成 | #参数高效微调 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Yinghao Ma (Queen Mary University of London) 和 Haiwen Xia (Peking University) 为同等贡献 通讯作者:Yinghao Ma (yinghao.ma@qmul.ac.uk), Emmanouil Benetos (emmanouil.benetos@qmul.ac.uk) 作者列表:Yinghao Ma (Queen Mary University of London), Haiwen Xia (Peking University), Hewei Gao (Technical University of Munich; Technical University of Denmark), Weixiong Chen (Queen Mary University of London), Yuxin Ye (Beijing University of Post and Telecommunications), Yuchen Yang (Soochow University), Sungkyun Chang (Queen Mary University of London), Mingshuo Ding (Peking University), Yizhi Li (University of Manchester), Ruibin Yuan (Hong Kong University of Science and Technology), Simon Dixon (Queen Mary University of London), Emmanouil Benetos (Queen Mary University of London) 💡 毒舌点评 论文构建了一套相对完整的音乐RM评估体系,数据规模可观,基准设计用心。但方法本质上是双塔+Transformer融合范式的领域迁移,创新性有限;代码、模型和数据集均只给出一纸声明而无具体链接,开源态度令人失望;对单一预训练编码器的强绑定使得RM的上限被锁死,歌词与跨模态理解能力仍是硬伤。 ...

2026-07-04 · 更新于 2026-08-14 · 2 min · 373 words

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

📄 E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs #音视频问答 #基准测试 #多模态模型 #强化学习 6.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.5/1 | 影响 0.4/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ✅ 6.9/10 | 前50% | #音视频问答 | #强化学习 | #基准测试 #多模态模型 | arxiv 👥 作者与机构 第一作者:Xianjie Liu(阿里巴巴淘宝天猫集团阿里妈妈技术部,实习期间完成此项工作) 通讯作者:Yiman Hu(阿里巴巴淘宝天猫集团阿里妈妈技术部, 项目负责人)、Liang Wu(阿里巴巴淘宝天猫集团阿里妈妈技术部)、Jian Xu(阿里巴巴淘宝天猫集团阿里妈妈技术部)、Bo Zheng(阿里巴巴淘宝天猫集团阿里妈妈技术部) 作者列表: Xianjie Liu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Yiman Hu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Liang Wu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Ping Hu(Vin University,未说明具体学院/实验室) Yixiong Zou(华中科技大学,未说明具体学院/实验室) Jian Xu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Bo Zheng(阿里巴巴淘宝天猫集团阿里妈妈技术部) 💡 毒舌点评 这篇论文精准切入了一个被顶会圈子长期忽视、却蕴藏巨大商业价值的领域——电商短视频理解。其提出的多模态密度评估框架是整个工作的点睛之笔,为“这任务为什么难”提供了量化的、有说服力的证据。然而,如果说方法部分展现的是专业团队的水准,那么论文呈现的排版质量则近乎草稿级别:严重的文本渲染错乱和表格乱码问题,贯穿全文,这不仅严重损害了专业形象,也让人怀疑作者对细节的态度。更关键的是,对于音频领域的读者而言,本文对语音信号的处理极其“粗暴”——将丰富的人类语言表达(韵律、情感、强调)简化为一串被计数的词汇,这与现代语音/副语言分析的前沿水平存在显著断层。 ...

2026-07-04 · 更新于 2026-08-14 · 3 min · 587 words

FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content

📄 FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content #可解释性 #基准测试 #多模态模型 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.1/10 | 前50% | #可解释性 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Yifeng Gao(复旦大学) 通讯作者:Xingjun Ma(复旦大学) 作者列表:Yifeng Gao(复旦大学)、Yifan Ding(复旦大学,阿里巴巴集团)、Li Wang(复旦大学)、Feida Huang(复旦大学)、Ye Sun(复旦大学)、Yixu Wang(复旦大学)、Xin Wang(复旦大学)、Yutao Wu(迪肯大学)、Hanxun Huang(墨尔本大学)、Yunhao Feng(复旦大学,阿里巴巴集团)、Yingshui Tan(阿里巴巴集团)、Xingjun Ma(复旦大学)、Yu-Gang Jiang(复旦大学) 💡 毒舌点评 论文将一个极具野心的“媒体真伪”与“内容虚实”交叉评估理念推向了全模态,构建了一个高保真的混合欺骗场景,其问题定义令人眼前一亮。然而,在解决方案上却显得有点“虎头蛇尾”。核心的OmniCheck框架将检测重任押注于一个基于Qwen2.5-Omni-3B的LoRA微调小模型,这好比用精巧的锁扣去守护一扇纸糊的门。诚然,模型小、跑得快,但与它要评估的那些动辄上百亿参数的前沿大模型相比,其检测能力的理论上限令人存疑,且全文对数据、代码与模型的开源情况讳莫如深,对于一篇以Benchmark为核心贡献的论文而言,这无疑是一个显著的减分项。 ...

2026-07-04 · 更新于 2026-08-14 · 2 min · 230 words

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

📄 LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues #语音交互 #语音大模型 #基准测试 #内容审核 #多模态模型 8.1/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #语音交互 | #语音大模型 | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 通讯作者:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering) 作者列表:Amir Ivry(Technion–Israel Institute of Technology, Electrical and Computer Engineering)、Shinji Watanabe(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 这篇论文为语音安全评估贡献了一个设计精良的受控基准,最可贵之处在于清晰揭示了“增加音频不一定更安全”这一反直觉结论,并系统解构了模态、转录源和提示策略间的复杂交互。然而,所有对话均基于合成语音,真实的嘈杂环境、口音、自然副语言信息和多轮累积危害的缺失,使得当前结论能否直接迁移到实际部署中仍存较大疑问,而作者在这方面过于乐观的决策流程图可能会误导急于落地的从业者。 ...

2026-07-04 · 更新于 2026-08-14 · 4 min · 753 words

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

📄 MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio #音频理解 #医疗音频 #基准测试 #数据集 #多模态模型 6.4/10 | 创新 0.8/2 | 严谨 0.8/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | #音频理解 | #多模态模型 | #医疗音频 #基准测试 | arxiv 👥 作者与机构 第一作者:Harshit Rajgarhia(Centific Global Solutions Inc.) 通讯作者:Harshit Rajgarhia(Centific Global Solutions Inc.) 作者列表:Harshit Rajgarhia(Centific Global Solutions Inc.)、Shuubham Ojha(Centific Global Solutions Inc., University of Maryland, College Park)、Asif Shaik(Centific Global Solutions Inc.)、Akhil Pothanapalli(Centific Global Solutions Inc.)、Rachuri Lokesh(Centific Global Solutions Inc.)、Abhishek Mukherji(Centific Global Solutions Inc.)、Prasanna Desikan(Centific Global Solutions Inc.) 💡 毒舌点评 这篇论文构建了一个规模可观(46k QA对)且设计精巧的医学音频推理基准,通过对13个前沿模型的系统评测,清晰暴露了当前多模态大模型在医学音频上的显著短板,尤其是言语理解与生理声理解的严重偏科。然而,数据完全依赖合成生成和API调用,使整个基准的价值高度绑定于特定商业模型(Gemini和ElevenLabs)的生成能力,缺乏对“真实”临床音频分布差距的严格验证;且没有开源代码、模型或完整的生成流水线,连自身宣称的“scalable”理念都无法让社区复制,工程诚意严重不足。 ...

2026-07-04 · 更新于 2026-08-14 · 2 min · 306 words

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

📄 PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios #音视频问答 #基准测试 #多模态模型 #流式处理 #数据集 7.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.3/10 | 前50% | #音视频问答 | #多模态模型 | #基准测试 #流式处理 | arxiv 👥 作者与机构 第一作者:Xudong Lu(香港中文大学 MMLab) 通讯作者:Rui Liu(华为研究,liu.rui2@huawei.com)、Hongsheng Li(香港中文大学 MMLab,hsli@ee.cuhk.edu.hk) 作者列表:Xudong Lu(香港中文大学 MMLab)、Huankang Guan(华为研究)、Yang Bo(华为研究)、Jinpeng Chen(华为研究)、Xintong Guo(华为研究)、Shuhan Li(华为研究)、Fang Liu(香港城市大学)、Peiwen Sun(香港中文大学 MMLab)、Xueying Li(上海交通大学)、Wei Zhang(上海交通大学)、Xue Yang(上海交通大学)、Rui Liu(华为研究)、Hongsheng Li(香港中文大学 MMLab) 💡 毒舌点评 这篇论文发现了一个真实且普遍的“模型太猴急”问题,用精心设计的流式基准把主流 MLLM 都打回了原形,Forward 任务的惨淡分数极具说服力。但作为 benchmark 论文,它过度依赖 Gemini 3 Pro 做数据生成和 Qwen3-235B 做评估,一旦这两个闭源/强模型更新,基准的稳定性和公平性就很微妙;而且在多模态流式领域,作者把“音频”当成了加分项来宣传,结果消融实验却显示开音频反而让 Forward 性能更差,这个自曝其短的结论让人既敬佩又哭笑不得。 ...

2026-07-04 · 更新于 2026-08-14 · 4 min · 836 words

SAM Audio: Segment Anything in Audio

📄 SAM Audio: Segment Anything in Audio #音频分离 #流匹配 #多模态模型 #基准测试 #音视频 9.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.4/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 🔥 9.2/10 | 前10% | #音频分离 | #流匹配 | #多模态模型 #基准测试 | arxiv 👥 作者与机构 第一作者:Bowen Shi(Meta SuperIntelligence Labs) 通讯作者:Bowen Shi(Meta SuperIntelligence Labs)、Andros Tjandra(Meta SuperIntelligence Labs) 作者列表:Bowen Shi、Andros Tjandra、John Hoffman、Helin Wang、Yi-Chiao Wu、Luya Gao、Julius Richter、Matthew Le、Apoorv Vyas、Sanyuan Chen、Christoph Feichtenhofer、Piotr Dollár、Wei-Ning Hsu、Ann Lee(均来自 Meta SuperIntelligence Labs) 💡 毒舌点评 SAM AUDIO以统一架构首次整合文本、视觉和时间跨度提示,在通用音频分离任务上取得了令人瞩目的SOTA,其精心设计的伪标签数据流水线和大规模评测体系颇具工程借鉴价值。然而,视觉提示的实际表现远逊于文本提示,且整个系统严重依赖大规模预训练和高性能硬件,在实时性或低资源场景下的适用性仍存疑。 ...

2026-07-04 · 更新于 2026-08-14 · 4 min · 651 words

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard

📄 Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard #音频理解 #SFT #基准测试 #内容审核 #数据集 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.3/10 | 前25% | #音频理解 | #SFT | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Yudong Yang(清华大学) 通讯作者:Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 作者列表:Yudong Yang(清华大学)、Xuezhen Zhang(清华大学)、Zhifeng Han(清华大学)、Siyin Wang(清华大学)、Jimin Zhuang(清华大学)、Zengrui Jin(清华大学)、Jing Shao(上海人工智能实验室)、Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 💡 毒舌点评 本文亮点在于首次系统性地将语音-非语音音频的语义和语境组合引入多模态LLM安全红队评测,攻击方式真实且具有现实威胁性,提出的SALMONN-Guard联合模态守卫设计也展现了防御此类攻击的可行性。然而,攻击构造仍依赖人工预设的声学参数与对话脚本,缺乏自适应的攻击策略优化,使得benchmark的攻击上限不明确;防御仅使用SFT,未与对抗训练等更强基线对比,说服力不足;MSD评估将“理解错误”也计入攻击成功,该设定存在争议,可能高估了实际威胁。 ...

2026-07-04 · 更新于 2026-08-14 · 4 min · 738 words

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

📄 T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation #基准测试 #多模态模型 #音视频生成 7.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.7/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.9/10 | 前25% | #音视频生成 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang(并列一作,均标注为南京大学) 通讯作者:Jiaheng Liu(南京大学) 其他作者:Yuanxing Zhang(快手科技 Kling Team)、Jiahao Wang(南京大学)、Jialu Chen(快手科技 Kling Team)、Miao Deng(南京大学)、Chenxi Liao(南京大学)、Yize Zhang(南京大学)、Yubin Guo(南京大学)、Zhaoxiang Zhang(中国科学院自动化研究所) 💡 毒舌点评 这篇论文在 T2AV 评估领域迈出了扎实的一步:500条高复杂度prompt配合同一框架下的双层级评估,确实暴露了SOTA模型在“音频真实感”和“长时叙述”上的系统性瓶颈,诊断价值明确。但MLLM-as-a-Judge的可靠性验证仅覆盖50个样本且音频Realism一致性较弱(L1高达1.420),若不能规模化解决judge bias,这套框架的权威性就只能停留在“参考级”而非“标准级”。 ...

2026-07-04 · 更新于 2026-08-14 · 4 min · 663 words