📄 Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

标签:#音视频理解 #强化学习 #音频质量评估 #大语言模型 #音频理解

6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #强化学习 | #音频质量评估 #大语言模型 | arxiv

👥 作者与机构

  • 第一作者:Yijie Qian(Zhejiang University, Hangzhou, China)
  • 通讯作者:Yong Liu(Zhejiang University, Hangzhou, China)和 Shujun Wang(The Hong Kong Polytechnic University, Hong Kong, China)
  • 作者列表:Yijie Qian(Zhejiang University)、Juncheng Wang(未说明)、Chao Xu(Zhejiang University)、Huihan Wang(Zhejiang University)、Yuxiang Feng(Zhejiang University)、Yang Liu(Zhejiang University)、Baigui Sun(IROOTECH TECHNOLOGY)、Yong Liu(Zhejiang University)、Shujun Wang(The Hong Kong Polytechnic University)

💡 毒舌点评

本文精准地切中了音视频生成评估中的一个核心痛点:传统指标在面对结构性、语义性错误时的失效,并提出了一个从数据集、模型架构到训练范式的系统化解决方案。其核心贡献在于将人类偏好这一主观、相对的判断,通过巧妙的工程设计转化为一个客观、可部署的参考无关评估器,工程完整性和对现有评估范式局限性的批判都相当到位。然而,论文在技术细节的披露上存在明显瑕疵,特别是ℝ-GRPO算法的推导和关键设计动机解释不足,让人怀疑其是精心设计还是过度工程化;同时,评估指标本身(如SyncBench)的泛化性和在更广泛生成任务中的有效性尚未得到充分验证。

📌 核心摘要

这篇论文旨在解决音频-视觉生成模型(作为世界模拟器)评估中的关键瓶颈:缺乏能理解跨模态间复杂物理因果关系的同步性指标。传统指标基于“结构正确”的假设,仅能处理简单的时移,无法应对生成内容中常见的结构性幻觉、关系不对称等复杂失败模式。作者提出一个三阶段框架来解决“人类相对偏好”与“自动化绝对评分”之间的方法论悖论:1)构建SynthSync数据集,包含来自10个SOTA模型的真实生成失败案例及人类偏好排序;2)设计连续Omni-LLM评估器,将一个Omni-LLM的离散语言头替换为连续投影头,通过Bradley-Terry-Luce目标和课程学习,将相对排名映射为绝对分数;3)提出ℝ-GRPO强化学习框架,将确定性分数输出重参数化为高斯策略,通过列表式奖励优化全局拓扑一致性。实验表明,该评估器在SynthSync基准上实现了SOTA的人类偏好对齐(如NDCG 0.9435, Pair-ACC 72.38%)。论文利用该评估器建立了SyncBench基准,并展示了其作为测试时奖励模型(Best-of-N选择)的有效性。实际意义在于为新兴的“世界模拟器”提供了一个物理因果性评估的标准工具。主要局限性包括算法推导细节不足、评估器的泛化范围有待验证,以及开源状态不明确。

为具体说明现有生成模型中的音视频同步问题,下图展示了典型的失配案例及本文方法的解决思路。

Figure 1: Upper row: Two Veo-3.1 \\[18\\]-generated audio-video samples with evident mismatches between visual events and audio, showcasing structural hallucinations where the synthesized impact sounds (e.g., the golf strike) exhibit semantic a

上图案例直观呈现了如“视觉事件有声无对应音频”等结构性幻觉;完整框架图见下文“方法概述和架构”章节。

主要实验结果表格:

MethodNDCGMRRKendallPair-ACC
Q-Align0.91630.67910.292764.08
Q-Insight0.91530.65590.327365.78
VQ-Insight0.92480.71220.387565.85
Ours w/o ℝ-GRPO0.93530.73160.451571.07
Ours0.94350.76740.489972.38

🔗 开源详情

  • 代码:论文中未提及代码仓库链接,但论文中提供了项目主页 https://chenhaoqcdyq.github.io/BeyondTimeShifts,代码可能托管于此。
  • 模型权重:论文中未提及已开源的模型权重或具体获取链接。模型基于 Qwen2.5-Omni-3B 修改。
  • 数据集:论文构建了名为 SynthSync 的数据集。数据集来源为 VGGSoundFoleyBench 的测试集。论文描述了详细的数据收集和标注流程,但未提供直接下载链接或开源协议。
  • Demo:论文中未提及在线演示链接。
  • 复现材料:论文附录(0.A.5 Training Details)提供了详细的复现信息,包括:
    • 基础模型:Qwen2.5-Omni-3B
    • 输入标准化:5秒,140x140,12 FPS
    • 训练超参数:AdamW优化器,学习率 1e-6,权重衰减 5e-2,梯度裁剪 1.0,训练100个epoch。
    • ℝ-GRPO参数:列表大小 K=6,采样数 N=12,高斯探索方差 σ=2.5,PPO裁剪系数 ε=0.2,KL惩罚系数 β=1e-3
    • 硬件与训练策略:使用6个GPU,采用混合精度分布式训练。
    • 代码片段:附录0.A.7提供了ℝ-GRPO训练的伪代码。
  • 论文中引用的开源项目:
    • Qwen2.5 Omni (Qwen2.5-Omni-3B/7B): 论文引用为 [74],具体链接未提供。
    • Qwen3 (Qwen-3 30BA3B): 论文引用为 [75],具体链接未提供。
    • Gemini-2.5/3 flash: 论文引用为 [19][20],具体链接未提供。
    • AV-Align: 论文引用为 [76],具体链接未提供。
    • DeSync: 论文引用为 [28],具体链接未提供。
    • JavisScore: 论文引用为 [39],具体链接未提供。
    • RALI: 论文引用为 [81],具体链接未提供。
    • Q-Align: 论文引用为 [70],具体链接未提供。
    • Q-Insight: 论文引用为 [36],具体链接未提供。
    • VQ-Insight: 论文引用为 [79],具体链接未提供。
    • SynthSync数据集来源:
      • VGGSound: 论文引用为 [7],具体链接未提供。
      • FoleyBench: 论文引用为 [12],具体链接未提供。
    • 用于生成SynthSync数据的V2A模型(见论文Table 1):
      • AudioX: 论文引用为 [57],具体链接未提供。
      • FoleyCrafter: 论文引用为 [80],具体链接未提供。
      • CAFA: 论文引用为 [1],具体链接未提供。
      • FoleyControl: 论文引用为 [52],具体链接未提供。
      • HunYuanFoley: 论文引用为 [6],具体链接未提供。
      • LoVA: 论文引用为 [9],具体链接未提供。
      • MelQCD: 论文引用为 [66],具体链接未提供。
      • MMAudio: 论文引用为 [8],具体链接未提供。
      • Selva: 论文引用为 [33],具体链接未提供。
      • VTA-LDM: 论文引用为 [26],具体链接未提供。

🏗️ 方法概述和架构

本文提出一个完整的音频-视觉同步性评估框架,旨在解决生成内容中跨模态因果关系评估的难题。整个方法是一个端到端的可训练评估器,其核心流程是:输入一对视频v和生成音频a,经过一个改进的Omni-LLM,输出一个表示同步质量的连续标量分数s。

为直观展示所提评估框架的整体流程,下图从数据构建、模型架构到训练策略进行了系统呈现。

Figure 2: Overview of our framework for audio-video synchronization evaluation. Upper left: We construct SynthSync by applying kk video-to-audio (V2A) generators to each real-world video and collecting human pairwise annotations of which ge

图中清晰展示了SynthSync数据集的生成、评分Omni-LLM的架构(连续投影头),以及用于优化的Bradley-Terry-Luce目标和ℝ-GRPO强化学习流程。

1. 整体流程概述: 该方法是一个三阶段的训练流程。首先,构建一个包含真实生成失败案例及人类相对偏好的数据集(SynthSync)。然后,对一个预训练的Omni-LLM进行架构改造和监督微调(SFT),使其能够输出连续分数。最后,采用一种新颖的强化学习算法(ℝ-GRPO)进行后训练,以优化模型对全局排序结构的把握能力。最终得到的模型是一个参考无关的评分器。

2. 主要组件/模块详解:

  • SynthSync数据集构建: 该模块旨在提供高质量的训练信号。它选择真实的视频片段(来自VGGSound和FoleyBench),并使用10个不同的视频转音频(V2A)模型为每个视频生成多个候选音频。通过专家成对比较标注,为每个视频的多个候选音频建立全局偏好排序。这模拟了生成模型中复杂的、非线性的失败模式(如语义幻觉、时序弥散、因果缺失),并提供了可操作的偏序关系作为监督信号。
  • 连续Omni-LLM评估器(Stage I): 这是模型的主体架构。
    • 功能: 将预训练的Omni-LLM从文本生成模型改造为连续评分模型。
    • 实现: 以Qwen2.5-Omni-3B为骨干,在输入序列中插入一个特殊的[SCORE]推理令牌。模型正常处理视频和音频的多模态输入,最后提取对应[SCORE]令牌的隐状态 h_score。用一个连续投影头(一个MLP网络 MLP_φ)将其映射为一个标量分数 s,完全绕开了文本解码过程。
    • 训练目标: 使用Bradley-Terry-Luce(BTL)损失进行监督微调。对于每个视频锚点的任意一对偏好的音频(a_i 优于 a_j),损失函数为 \(-\log \sigma(f_\theta(v, a_i) - f_\theta(v, a_j))\)。通过优化所有成对比较,模型隐式地学习到一个全局一致的分数空间。
    • 课程学习: 为稳定训练,采用动态课程策略。初始阶段只对排名差距大的音频对(如第1名 vs 第9名)进行训练,随着训练进行,逐步引入排名接近的音频对(如第5名 vs 第6名),让模型逐步学习细粒度的区分能力。
  • ℝ-GRPO框架(Stage II): 这是提升模型全局排序能力的核心。
    • 功能: 解决SFT阶段仅优化局部成对比较可能带来的“度量短视”问题,即模型可能满足所有两两约束但整体排序扭曲。
    • 核心思想: 将确定性的分数输出 s 重参数化为高斯策略的中心 μ_θ,即 \(s \sim \mathcal{N}(\mu_\theta, \sigma^2)\)。这样,模型输出就不再是一个固定值,而是一个分布,为基于策略梯度的强化学习提供了探索的可能。
    • 实现流程: 对于一个视频及其K个候选音频,模型输出K个基础分数 \(\{\hat{s}_1, ..., \hat{s}_K\}\)。在每次训练迭代中,对每个基础分数进行N次高斯扰动采样,得到N组“列表式”分数向量 \(\{\hat{s}^{(1)}, ..., \hat{s}^{(N)}\}\)。将这N组分数分别与该视频对应的真实偏好排序进行比较,计算一个综合的排序奖励 \(r\)(融合了NDCG, Kendall’s \(\tau\), Spearman’s \(\rho\), Top-1准确率, 成对一致性和MRR)。
    • 优化: 使用GRPO算法进行策略优化。计算每个样本N次采样的奖励的均值和标准差,得到优势估计 \(A^{(n)} = \frac{r^{(n)} - \bar{r}}{\text{std} + \epsilon}\)。然后,通过一个带有PPO裁剪和KL散度惩罚的代理目标来更新模型参数 \(\theta\),约束更新幅度,防止偏离太远。

3. 组件间的数据流与交互: 原始视频和多个生成音频作为输入。在Stage I,数据流是 (v, a_i), (v, a_j) 成对输入,经Omni-LLM编码和连续头投影得到两个分数,计算BTL损失。在Stage II,数据流是 (v, {a_1, ..., a_K}) 列表式输入,模型并行输出K个基础分数,每个分数被扰动N次形成采样组,每组与真实排序共同计算奖励,然后聚合优势并更新策略。

4. 关键设计选择及动机:

  • 连续投影头 vs 文本生成: 选择直接输出连续分数而非生成文字(如“好/坏”),是为了避免语言量化带来的信息损失和词表偏差,更精确地匹配人类感知的连续性。
  • BTL损失 vs MSE回归: 放弃对绝对分数的回归(MSE),是因为人类偏好是相对的,且同步性质量没有绝对的数值标准。BTL损失仅需优化相对顺序,更符合数据本质,并能通过共享的评分函数 \(f_\theta\) 推导出跨锚点的全局一致分数。
  • ℝ-GRPO vs 普通PPO: 标准PPO需要一个价值网络来估计优势,而本问题的奖励是稀疏的(基于整个列表的排序),训练一个准确的价值网络很困难。GRPO通过组内相对奖励来标准化优势,避免了价值网络的训练,更适合当前场景。
  • 高斯扰动采样: 将确定性输出扰动为分布,是为了满足策略梯度方法对随机策略的要求,从而能够利用RL优化整体排序目标。

图1

💡 核心创新点

  1. 解决评估方法论悖论: 论文明确指出并系统解决了音视频同步评估中“人类相对判断”与“自动化绝对评分”之间的核心矛盾。通过构建偏序数据集(SynthSync)、设计连续映射函数(BTL目标)和强化学习对齐全局结构(ℝ-GRPO),将主观、相对的偏好知识蒸馏成客观、可部署的评估器。这是对评估范式的重要推进。
  2. 构建首个面向生成失败的真实数据集(SynthSync): 摒弃了传统的人工时移构造方法,通过多个SOTA V2A模型生成多样化的真实失败案例(幻觉、不对称、时序弥散),并通过成对标注建立排序。这比构造数据更能反映现代生成模型的实际评估需求。
  3. 设计专用连续Omni-LLM评估架构: 通过将Omni-LLM的语言输出头替换为连续投影头,并引入[SCORE]令牌,将其改造为一个端到端的回归模型。这继承了大型多模态模型对结构正确性的先验知识,并通过BTL损失进行适配,避免了文本解码的离散性和随机性。
  4. 提出ℝ-GRPO强化学习框架: 创造性地将连续评分器的输出重参数化为高斯策略,从而能够应用策略梯度方法来优化列表式排名奖励。这解决了仅靠SFT优化局部对无法保证全局排序一致性的问题,使模型能更好地内化因果结构的拓扑。

📊 实验结果

论文在自建的SynthSync基准上进行了全面评估,评估指标包括NDCG、MRR、Kendall’s τ、Spearman‘s ρ、Top-1准确率、Bottom-1准确率和成对准确率。

主要对比结果: 与多种基线相比,包括即用型Omni-LLM(Qwen, Gemini)、非LLM同步指标(AV-Align, DeSync, JavisScore, RALI)和已训练的Omni-LLM评估器(Q-Align, Q-Insight, VQ-Insight),本文方法(Ours)在所有累积增益和排名相关性指标上均达到最优。例如,NDCG达到0.9435,Kendall‘s τ达到0.4899,Pair-ACC达到72.38%。相对于不加ℝ-GRPO的版本(Ours w/o ℝ-GRPO),强化学习带来了稳定的提升(如Pair-ACC从71.07%提升至72.38%)。

主要对比结果表格 (Table 2):

MethodNDCGMRRKendallSpearmanTop-1 Acc.Bottom-1 Acc.Pair Acc.
Off-the-shelf Omni-LLM
QWen-2.5 3B (baseline)0.85310.5314-0.0059-0.013528.2010.0051.02
QWen-2.5 7B0.87180.49110.07160.092124.6021.8057.09
QWen-3 30BA3B0.88310.53590.16670.199128.8032.2061.39
Gemini-2.5 flash0.86930.32640.08840.12296.6022.6061.43
Gemini-3 flash0.92250.72350.35360.400153.2047.8063.20
non-LLM Methods
AV-Align0.87350.46700.10530.132721.0030.6055.44
DeSync0.88300.61600.13550.158741.4015.6061.16
JavisScore0.92840.67470.42680.504147.4050.8069.36
RALI0.89670.56260.23410.286433.0037.8062.79
Trained Omni-LLM
Q-Align0.91630.67910.29270.363347.8032.8064.08
Q-Insight0.91530.65590.32730.391046.2043.4065.78
VQ-Insight0.92480.71220.38750.478152.8062.8065.85
Ours w/o ℝ-GRPO0.93530.73160.45150.536655.8053.8071.07
Ours0.94350.76740.48990.583761.4055.0072.38

作为奖励模型(Best-of-N)的结果 (Table 3): 本文评估器作为奖励信号进行测试时缩放,在LTX-2生成模型上选出的样本,在其他独立评估器上获得的平均分数最高,证明了其奖励信号的泛化性和有效性。

BoN RewardAV-AlignJavisScoreDeSyncRALIOur Metric
Random0.06980.07141.08240.37440.8820
+AV-Align0.21160.07101.05700.36943.2385
+ JavisScore0.07250.16331.02800.39011.7417
+DeSync0.05360.07560.16300.37560.4403
+RALI0.07260.08451.08800.45961.7561
+ Ours0.14390.09341.03360.39595.0589

消融实验:

  1. 评分表示策略 (Table 4): 对比了标量回归、文本生成(交叉熵/kl散度)和本文的标量排名(BTL)。结果显示,标量排名在所有排名和决策指标上均大幅领先,证实了连续排名优化的优越性。

    Score-RepresentationNDCGKendallPair-ACCTop-1 ACC
    Scalar Regression0.88430.162858.8419.41
    Score as Text-CE0.88170.114156.1927.03
    Score as Text-KL0.87870.132456.9422.44
    Scalar Ranking0.93530.451571.0755.80
  2. 核心组件 (Table 5): 逐步添加SynthSync数据、偏好微调(PFT)和强化学习(RL),NDCG从基线0.8531提升至0.9435,Pair-ACC从51.02%提升至72.38%,表明每个阶段都有显著贡献。

    SynthSyncPFTRLNDCGPair ACC (%)
    ×××0.853151.02
    ××0.9224 (+8.1%)66.60 (+30.5%)
    ×0.9353 (+9.6%)71.16 (+39.5%)
    0.9435 (+10.6%)72.38 (+41.9%)
  3. 奖励函数 (Table 6): 对比了成对奖励、列表奖励和双奖励(本文采用的组合策略)。仅用列表奖励会损害局部排序(Kendall‘s τ下降5.5%),而双奖励取得了最佳平衡,MRR和Kendall‘s τ分别比基线提升4.9%和8.5%。

    RewardNDCGMRRKendallPair ACC (%)
    PFT-baseline0.93530.73160.451571.16
    Pair Reward0.9396 (+0.5%)0.7584 (+3.7%)0.4700 (+4.1%)71.70 (+0.8%)
    List Reward0.9339 (-0.2%)0.7371 (+0.8%)0.4267 (-5.5%)70.34 (-1.2%)
    Dual Rewards0.9435 (+0.9%)0.7674 (+4.9%)0.4899 (+8.5%)72.38 (+1.7%)
  4. 探索方差(σ)(Table 7): 研究了高斯策略中的方差参数。σ=2.5时综合性能最佳(Pair-ACC 72.38%),过小(σ=2.0)探索不足,过大(σ=10.0)噪声扰动过强。

    σNDCGKendallPair ACC
    2.00.93660.462571.56
    2.50.94350.489972.38
    10.00.94050.476871.70

应用验证:

  1. SyncBench基准: 使用本文评估器对6个SOTA闭源/开源AV-Gen模型(如Sora-2, Veo-3.1)进行排名,结果与人类感知一致,而传统指标(如AV-Align, JavisScore)排名则存在很大波动和矛盾。论文未给出具体排名数值表。
  2. 作为奖励模型(Best-of-N): 结果已在上文Table 3中展示,证明了其奖励信号的泛化性和有效性。

🔬 细节详述

  • 训练数据: SynthSync数据集,包含2267个视频锚点,来自VGGSound(1016)和FoleyBench(1251)。通过10个V2A模型生成候选音频。使用20人专家团进行成对标注,每个视频有C(10,2)*3=135对比较,总计约306K标注。数据划分为训练集1767个视频,测试集500个视频。
  • 损失函数: Stage I使用BTL损失。Stage II使用ℝ-GRPO代理损失,包含裁剪的策略梯度项和KL散度正则项(权重β=0.001)。
  • 训练策略: 基于Qwen2.5-Omni-3B初始化。Stage I:使用AdamW优化器,学习率1e-6,训练100个epoch,批大小6(K=6个候选)。Stage II:从Stage I的检查点继续,学习率1e-6,AdamW优化器,PPO裁剪系数ε=0.2,每个样本生成12个高斯扰动轨迹(N=12, σ=2.5),训练100个epoch。
  • 关键超参数: 视频输入:5秒,140x140分辨率,12 FPS。ℝ-GRPO中的列表大小K=6。奖励权重:(λ_ndcg=0.25, λ_τ=0.2, λ_ρ=0.2, λ_top1=0.15, λ_pair=0.1, λ_mrr=0.1)。
  • 训练硬件: 使用6个GPU进行混合精度分布式训练,采用内存高效的分片策略。
  • 推理细节: 单次前向传播,无自回归解码。输入视频-音频对,提取[SCORE]令牌隐状态,经投影头得到分数。在单张RTX 4090上,延迟约0.23秒/对,显存占用10G。

⚖️ 评分理由

  • 创新性 (1.2/2):系统解决了评估中的方法论悖论,构建了首个面向生成失败的真实数据集(SynthSync)并提出了一套完整的连续评估框架。但其核心 ℝ-GRPO 框架是对现有 GRPO 算法的适配和组合,部分设计被批评为工程技巧而非理论突破。

  • 技术严谨性 (1.0/1.5):BTL损失和GRPO的应用合理。但 ℝ-GRPO 中将确定性输出重参数化为高斯策略、高斯扰动与列表优化的具体联系、以及复合奖励线性加权的理论依据阐述不足,动机不充分,依赖工程直觉。

  • 实验充分性 (1.0/1.5):包含详尽的消融研究(评分表示、组件、奖励函数、超参数)和下游应用验证(SyncBench排名、BoN奖励)。但所有实验均在单一自建基准 SynthSync 上进行,缺乏在其他独立评估基准上的泛化验证。

  • 清晰度 (0.8/1):论文整体结构清晰,问题引出明确。但 ℝ-GRPO 部分引入了较多新术语(如“连续潜在策略”),公式推导存在跳跃,增加了理解门槛。

  • 影响力 (0.5/1.5):为新兴的“世界模拟器”提供了物理因果性评估的标准化工具(SyncBench),对音视频生成评估领域有推动。但评估目标局限于“跨模态同步”,对更广泛的音频/语音研究(如语音、音乐)的直接相关性和核心实用价值有限。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):附录中提供了非常详细的训练配置(硬件、优化器、学习率等)、算法伪代码和数据处理流程。这些对于理解方法论是充分的,但核心产物(模型、完整数据)的开源状态不明确,影响完整复现。

  • 工程/实践价值 (1.2/1.5):构建了从数据(SynthSync)到模型(连续Omni-LLM)再到优化(ℝ-GRPO)的完整评估器开发流水线。推理设计考虑效率(单次前向传播),并验证了作为下游奖励模型(Best-of-N)的有效性,具备实际工程部署潜力。

🚨 局限与问题

论文明确承认的局限:

  1. 在结论中指出,评估目标局限于“跨模态同步”,这是音视频因果一致性的一个代理指标,不能代表生成内容的所有方面。
  2. 提及当前评估主要基于物理事件的同步,对于更抽象的语义一致性或风格一致性尚未探索。

审稿人发现的潜在问题:

  1. 算法设计的动机不充分: ℝ-GRPO框架中的高斯扰动采样(公式3)是连接确定性输出与策略梯度优化的关键一步。论文将此描述为“将配置组投影到连续域”,但其数学必要性、最优性以及与其他探索策略(如添加熵正则化)的对比缺乏深入讨论。这使得该设计看起来更像是一种工程技巧而非理论必然。
  2. 评估基准的单一性: 所有实验均在SynthSync上进行。SynthSync基于特定的10个V2A模型和2个视频源构建,其标注、模型失败模式可能具有特定的分布。评估器在该基准上表现优异,但能否泛化到由其他生成模型(特别是未来的新模型)产生的、更广泛或不同风格的失败案例,是一个重要问题。
  3. 奖励函数的设计: ℝ-GRPO中使用的复合排名奖励是六个指标的线性加权和。这种权重的设置(0.25,0.2等)是启发式的,缺乏理论依据或自动化调整机制。不同指标可能在不同重要性或不同样本上存在冲突,简单的线性融合可能不是最优解。
  4. 标注噪声与偏好一致性: 尽管采用了多组标注和赢率聚合,但人类对复杂跨模态同步的偏好标注可能存在显著的主观性和不一致性。论文未提供标注者间一致性(IAA)的统计指标,数据质量对最终模型性能的影响未知。

← 返回 2026-07-13 语音/音乐/音频论文速递