多人对话视频看似逼真却接不上话:MTAVG-Bench 如何逐层诊断结构性失败
论文针对多人对话音视频生成中身份漂移与轮转混乱难以被感知质量指标发现的问题,构建覆盖四层九维度的失败诊断问答基准,用 12 个全模态模型的诊断得分与三类生成器的人评成功率显示交互层是主要瓶颈,但诊断高度依赖音频输入与提示对齐条件。
论文针对多人对话音视频生成中身份漂移与轮转混乱难以被感知质量指标发现的问题,构建覆盖四层九维度的失败诊断问答基准,用 12 个全模态模型的诊断得分与三类生成器的人评成功率显示交互层是主要瓶颈,但诊断高度依赖音频输入与提示对齐条件。
针对多轮全双工评测中轮边界模糊与上下文不一致问题,论文用切轮加逐轮固定历史组织会话特征、对话质量、指令遵循与安全四个维度评测,报告显示随轮数与特征叠加成功率下滑且端到端模型语义保持更难,而高延迟级联方案则因回答不完整付出代价。
论文研究语音大模型能否用音频加文本示范现学未见濒危语言,报告多模态示范降低困惑度且跨语言微调接近目标语言微调,并提出用声学模型产生候选再由语音大模型重排来改善词错误率,但直接生成转写仍很弱且重排带来显存与耗时开销。
该综述把多模态遗忘按实例级与概念级切分并按干预阶段组织方法,以遗忘强度与效用保留的权衡为主线,报告了身份隐私内容与安全基准的规模与评估维度,并指出跨模态泄漏与对抗再激活是主要代价。
论文用配对文本图像音频乘法题证明感知近乎完美但计算随算术负载 C 急剧失效,并用强制续写损失探针与 LoRA 正交性揭示模型偏好分配式分解而强加单一启发式反而破坏原有路由。
Muse 针对长歌曲不可复现问题,用 116489 首授权合成歌曲与全局加分段风格标注训练单阶段自回归模型,在小参数下取得可比的歌词对齐与风格相似度,并以多轮分段生成实现细粒度风格控制。
论文以音乐演出问答为对象,论证连续重叠音画与多尺度时间推理需要专门的输入处理与空间-时间结构,其证据是带时空设计的方法在三套基准上系统性领先,而代价是更复杂的分段选择与跨模态对齐及对音乐先验建模不足。
该研究针对完整乐谱的多级理解问题,选择 ABC 文本与 PDF 图像双模态生成问答评测,最强证据是文本问答约 49.44% 而视觉问答仅约 24.22%,代价是跨级全对的严格成功率迅速归零且微调仍难维持高层一致性。
该文只用静默构音肌电与文本转写、用对称正定矩阵表示通道间相关再接门控循环网络与联结时序分类损失做音素级序列转换,在大词表单被试上报告音素错误率 48.47% 与词错误率 73.53%,代价是仍需双向整句解码且主要证据来自单名健康被试。
针对全模态理解可绕过模态与跨模态多跳推理路径失衡的问题,OMHBench 用表格三元组加三跳规则与六路模态置换构造 6144 题并报告专有模型仍对语音在后路径大幅掉点而高级提示无一致增益。
OEA 用冻结多模态大模型加 LoRA 统一编码文本与音频,在文本到音频上与 M2D-CLAP 接近,在文本到文本与硬负例排除上明显占优,代价是更大的显存与离线音频编码开销。
论文把同时含文本、音频、图像或视频的问答做成 1375 组优选对,用桥接加人工核验构造基准,报告榜单分数与下游 Best-of-N 表现为同分布 0.94、异分布 0.72 相关,但原生全模态模型仍弱于桥接后的双模态大模型。
论文追问在人类语音上训练的情感理解能否直接用于合成语音,通过跨数据集、跨判别式与生成式模型、跨 TTS 与 S2S 合成的系统评测,显示人类与合成之间存在约 38 个百分点的识别差距,且主要代价来自语音 token 预测阶段的表示偏移与生成式模型的文本主导偏置。
论文指出全局离散符号困惑度把长程语义波动平均进声学判断,提出窗口化与局部化加归一化以及基于真实续写的人评与嵌入裁判评估,并在 SALMon 上以相关性提升与 84.1% 人类差距闭合为证据,代价是依赖转折时刻标注与裁判选择。
针对附和预测中缺视频、模态时间不对齐和只盯触发点的问题,论文用多层跨模态对齐加两阶段课程学习,在韩语 KC-Dialog 上宏 F1 达到 58.53,代价是视频推理耗时从 18.868 毫秒增至 20.083 毫秒。
该文针对语音进语音出对话只用单轮语义奖励的问题,用四路独立偏好数据加单 DPO 目标联合训练,在保持轮次与块级解码兼容的同时,以语义与声学指标的联合提升为证据,代价是情感与可懂度之间出现轻微竞争。
论文把可回答性做成输入属性,用语义-声学掩蔽构造配对问答并以不可补偿的 EAR 分数同时考核答题与修复,报告显示多模型答题强但修复弱,而掩蔽加宽能提升修复检出。
论文把无指令下的主动帮助定义为视觉加音频加角色文本到动作序列的映射,用 19963 条 122 场景数据和四指标评测显示只有同时理解两模态才能给出正确帮助,而缺任一模态或替换任一模态都会使总体得分大幅下降。
针对长程语音角色扮演中崩人设难定位的问题,论文提出把文本路由与音频路由投影到共享情感空间做分路由、按轮次诊断的 PED 框架,并在端到端与级联两种 3B 量级系统上揭示出可分性受限、文本向中性集中、双路由弱耦合等可复述的诊断信号。
针对 10 分钟到 540 分钟音频中说话内容、说话人、情感与声音事件交织推理难的问题,PlanRAG-Audio 先把音频离线转成时间对齐的结构化库,再按问题规划检索并只取相关片段生成答案,以检索把推理代价与原始长度解耦,代价是受上游感知精度约束并需承担离线预处理开销。