不只听清说什么:SCENEBench 考大型音频语言模型的背景声、运动、混语与喉头发声
SCENEBench 用合成叠加与受控变换构造背景声理解、噪声定位、跨语转写和发声特征四项任务,在五款大音频语言模型上报告自由回答与选择题准确率及本地延迟,发现模型偏向前景文字而系统性漏掉背景与运动线索。
SCENEBench 用合成叠加与受控变换构造背景声理解、噪声定位、跨语转写和发声特征四项任务,在五款大音频语言模型上报告自由回答与选择题准确率及本地延迟,发现模型偏向前景文字而系统性漏掉背景与运动线索。
针对 11 种东南亚语言语音理解评测缺失问题,论文构建 97,194 样本与 597 小时音频的 9 任务基准并统一双语提示与归一化,最强证据是时间定位与情感识别全面偏低且缅甸语等低资源提示落后英文可达 41 个百分点,代价是长音频覆盖过度与拒答等边界行为仍需专门处理。
TTA-Bench 针对文本到音频生成提出覆盖准确性、效率、泛化、鲁棒性、公平性、偏见与毒性的七维评测,用 2999 条提示与 118314 条人工标注比较十个主流模型,发现 Tango 2 在准确与泛化上领先但毒性率最高,而效率与公平性上各模型分化明显。
论文以 7 语种 668.8 小时配对语料构造说话人、生成方法和真实源三重隔离的跨域评测,报告同域准确率常达 100% 而跨域大幅跌落甚至近随机,最强的 wav2vec 2.0 与 Whisper+MLP 也只在部分语言保持可用,代价是生成方法随语言不同且需持续更新。
论文把多说话人对话中的手术式伪造注入形式化为时序定位问题,用冻结二分类器加滑窗与迟滞解码器实现零样本定位,在 180 段构造对话上以强骨干达到时序交并比 0.90 左右,但边界位移约 3.5 秒且短时域外生成器注入仍接近全漏检。
AdoDAS 在不分发未成年人原始音视频的前提下提供 6000 人四会话的匿名化表征与文本,要求在隐藏测试集上完成 D/A/S 二分类筛查与 21 项 DASS-21 序数预测,音视频基线均值 F1 为 0.4604、均值 QWK 为 0.2675,最优提交分别达到 0.5921 和 0.2776,但提升主要来自时序多模态与跨会话建模而非原始编码器规模。
CutCraft 把多镜头音画生成从感知连贯拉回到可核验的剪辑执行,用 295 条结构化提示与分层混合评估在 13 个主流模型上检验镜头结构、转场与蒙太奇的指令遵从,并以规划-分镜合成-后期合成的智能体基线揭示离散剪辑控制可提升而高阶蒙太奇仍难的代价边界。
为解决全模态大模型在图文声三路互斥时把模态偏置与证据形式偏置混为一谈的问题,Tri-PvP 以 8000 样本的四条件匹配反事实与五模型对照揭示视觉主导且视听在感知与命题上不对称,并以早期线性可分与对比解码仅部分缓解且引入文本残余为代价验证偏置的表征根源。
AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。
针对文生音视频评估重视频轻音频的问题,PRISM-Bench 以语音/音乐/音效与 On-screen/Off-screen 交叉分层与四维度 35 条细粒度标准组织 900 条人工校验样本,并用盲式并排、以真值为锚的 MLLM-as-a-Judge 两阶段打分实现超过 70% 的人类一致性,揭示前沿闭源模型在可感保真度上已超真值但在可见声源同步与精细声音控 …
针对播客式多轮对话中声称分散与 ASR 噪声的核查难题,TRILOGUE 以源文章可追溯的英俄哈三语对话与配对音频构建受控基准,显示仅看声称的验证最难、加入源证据后大幅回升,而哈萨克语的识别与合成瓶颈仍是主要代价。
针对歌唱音频的专家式指导反馈问题,VocalCoachBench 用同曲可控对比与异曲多样场景的双子集和原子主张拆分来构造可复现评估,12 个音频语言模型的实测显示成对排序可行但细粒度 Top-3 识别与严格诊断命中率仍低于多数类基线且严格命中低于 7%。