总词错率相同,切换处却不同:英语-约鲁巴语码切换转写的边界失效
该研究在 2000 句共享英语-约鲁巴语码切换集上对比 6 个专用语音识别系统与 5 个音频语言模型,报告 Parakeet 与 Kimi-Audio 总词错率几乎相同但后者在切换边界显著更好,代价是约鲁巴语词错误普遍超过 97% 且生成式模型存在提示依赖的过度生成。
该研究在 2000 句共享英语-约鲁巴语码切换集上对比 6 个专用语音识别系统与 5 个音频语言模型,报告 Parakeet 与 Kimi-Audio 总词错率几乎相同但后者在切换边界显著更好,代价是约鲁巴语词错误普遍超过 97% 且生成式模型存在提示依赖的过度生成。
BoYaEval 用 3175 张原貌古谱图像把考题分成认符号、译指法、推旋律三层,报告显示 21 个主流多模态大模型在基础识别尚可但在旋律推理仅约 27% 到 30%,而把示例从零增至多示例也不能打通跨谱式推理瓶颈。
论文用固定文字、只改声音的合成对照测音频语言模型能否把可听症状用于分诊,最强证据是高风险声音配安心文字时多数模型仍跟文字走,而代价是大量平局与无效输出且声学敏感度随疾病和模型剧烈波动。
针对长语音与对话生成的评测缺口,该工作构建 1101 样本、17 场景的 SwanBench-Speech 并提出 7 个解耦指标,用人类一致性验证支撑其发现的混响一致性与表现力层次短板,但高表现力场景与多说话人声场统一仍代价明显。
该挑战用阻尼 Kirchhoff-Love 板仿真器生成全部脉冲响应,要求从波形倒推 6 个物理量或数千个模态三元组,结果是任务 A 可用大样本网络或大量正演搜索做到机器精度而任务 B 连模态增益都难以逐个恢复且频域复评会改变排名。
论文把多通道回放检测定义为按声学环境逐个学习的域增量问题,用 ReMASC 全部 24 种顺序对比朴素微调、EWC、GPM 与任务专用波束形成器,最强证据是 TSB 显著降低平均错误率但未减少遗忘,而最后出现的环境主导最终性能。
针对纯文本盈利预测依赖商业数据的问题,该研究构造 2688 场带逐词转录、全程音频和幻灯片的多模态基准并评测 26 个模型,最强证据是高准确率多为类别不平衡造成的假象而多模态增益有限,代价是长文本截断、采样幻灯片与类别严重偏斜。
论文用真实法语对话构造 CALLFC-FDB 与 MEDIA-FDB 并复用 FDB v1.0 四类任务,显示基于语音活动的计时指标跨语言基本稳定,而用户打断评分等内容指标在语言失配时明显下降,人-人对话则说明一味优化指标会损失自然度。
针对全双工语音智能体多轮一致性缺乏可复现评测的问题,该文用合成语音自动考官加分阶段语义目标与快慢两种节奏做流式多轮交互,并以轮换流畅度、多轮指令遵循和任务专属三维打分报告了三系统随时间下滑且修正与实体跟踪最难的证据,代价是仅覆盖英语四类任务并依赖转写加模型打分。
论文提出只用声纹推断八类隐私属性的 HearSay 基准,用 22,064 段真实音频证明模型在性别上平均达到 92.89% 准确率且几乎不拒绝,而思维链推理在强模型上进一步放大泄露,轻量提示防御难以根治生理属性泄露。
针对神经音频编解码器重合成的印度语伪造语音检测难泛化问题,论文构建多语言多编解码器基准并提出双阶段双曲对齐的检测框架,在域内与跨库迁移上报告更低等错误率,但以双编码器与大语言模型解码器开销为代价。
针对单轨音乐问答无法考察跨轨比较的问题,该研究用四阶段流水线构造每对三问的比较问答集,并用统一评测显示句子级比较解释是当前模型的主要瓶颈,而其代价是严格过滤后保留高精度子集与依赖文本中间表示。
论文针对以人为中心的长视频多模态理解,构建约 1001 个视频与 4781 个问答的 LongInsightBench,用六类事件内与事件间任务测出 Gemini3-Pro 总体 80.04% 领先而跨事件因果仍偏低,并以模态替换对照揭示融合 deficit,代价是依赖专有模型与约 250 GPU 小时加 700 美元 API 成本。
论文针对多人对话音视频生成中身份漂移与轮转混乱难以被感知质量指标发现的问题,构建覆盖四层九维度的失败诊断问答基准,用 12 个全模态模型的诊断得分与三类生成器的人评成功率显示交互层是主要瓶颈,但诊断高度依赖音频输入与提示对齐条件。
针对多轮全双工评测中轮边界模糊与上下文不一致问题,论文用切轮加逐轮固定历史组织会话特征、对话质量、指令遵循与安全四个维度评测,报告显示随轮数与特征叠加成功率下滑且端到端模型语义保持更难,而高延迟级联方案则因回答不完整付出代价。
该研究针对完整乐谱的多级理解问题,选择 ABC 文本与 PDF 图像双模态生成问答评测,最强证据是文本问答约 49.44% 而视觉问答仅约 24.22%,代价是跨级全对的严格成功率迅速归零且微调仍难维持高层一致性。
针对阿拉伯语语音指令数据稀缺与评测缺失问题,Nuha-Speech 用约 150 万条统一问答式语料对 Qwen-Omni 系列做两阶段 LoRA 微调,并在七任务评测中报告语义与副语言能力的全面提升,但合成数据占比与评测合成偏置仍是主要代价与限制。
针对全模态理解可绕过模态与跨模态多跳推理路径失衡的问题,OMHBench 用表格三元组加三跳规则与六路模态置换构造 6144 题并报告专有模型仍对语音在后路径大幅掉点而高级提示无一致增益。
OEA 用冻结多模态大模型加 LoRA 统一编码文本与音频,在文本到音频上与 M2D-CLAP 接近,在文本到文本与硬负例排除上明显占优,代价是更大的显存与离线音频编码开销。
论文把同时含文本、音频、图像或视频的问答做成 1375 组优选对,用桥接加人工核验构造基准,报告榜单分数与下游 Best-of-N 表现为同分布 0.94、异分布 0.72 相关,但原生全模态模型仍弱于桥接后的双模态大模型。