英文题目:Omni2Sound: Towards Unified Video-Text-to-Audio Generation
会议身份:
conference:cvpr:2026:conference-paper-id:Dai_Omni2Sound_Towards_Unified_Video-Text-to-Audio_Generation_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#基准测试 #数据集 #扩散模型 #多模态学习 #视频到声音生成
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告
👥 作者与机构
- Yusheng Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Zehua Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxuan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Qiuhong Ke:机构信息未能从会议 PDF 纯文本可靠映射
- Jianfei Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Jun Zhu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
统一视频文本到音频生成以视频帧与文本描述为输入,输出高保真且时间同步的音频,难点在于音频固有歧义引发视文语义冲突,以及跨任务零和竞争与模态偏置导致的同步与保真折中。为此先以多智能体管线构建SoundAtlas数据集,将视觉压缩为文本约束并经分级标注与CLAP及视听验证过滤,输出高对齐三元组作为语义桥梁。接着以大规模文本到音频预训练建立生成先验,再将先验模型与SoundAtlas三元组一起送入交错多任务训练,以低频回放协同优化视频到音频与联合生成。最后将收敛后模型送入解耦鲁棒训练,以离屏增强校正文本偏置与视频偏置而不破坏已学优化。与MMAudio与AudioX简单混合异构数据不同,该链条把联合数据当作对齐特征空间的桥梁并把鲁棒增强推迟到收敛后,实际意义在于缓解资源争用并保留双模态保真。在VGGSound-Omni基准下,Omni2Sound的FAD指标为1.01,低于MMAudio的FAD指标1.63。该结论适用边界受限于8秒至10秒短片段与YouTube域,长时序与强离屏影视泛化尚未验证,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 演示资源:https://omni2sound.github.io — 链接可访问(HTTP 200)
- 第三方资源:https://openai.com/ — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,什么信息必须保留?
这篇论文研究的输入输出很明确。输入是视频与文本的任意组合,输出是与之对应的音频波形。3 种任务共享同一个生成目标:文本到音频生成只给文字描述,要求语义保真;视频到音频生成只给画面,要求时间同步与声画对齐;联合视频文本到音频生成同时给画面与文字,要求既同步又服从文字。
对研究生而言,关键是理解两种条件的分工不同。文字擅长讲清楚是什么声音、有哪些事件与顺序,但没有逐帧的时间信号;视频擅长提供动作时刻、击打点与场景节奏,但画面本身有歧义,同一个爆裂声可能是网球击球也可能是远处烟花。输出必须保留的信息因此有两类,一是语义内容,即文本中提到的声源是否在音频中出现且不编造画面暗示但实际不存在的声音;二是时间结构,即起止时刻、重复次数与包络是否与视频动作对得上。
论文的演示页当前可用,地址为官方展示页,第三方链接本次未能确认可达之外,方法复述只依赖正文证据。后续所有设计都围绕如何在缺一模态时仍能工作,以及双模态同时存在时不互相干扰展开。
同输入同目标的路线各解决了什么,还缺什么?
按同输入、同目标、同监督来对照,路线差异才看得清楚。纯文本到音频路线用大规模文本音频对训练,语义泛化强但缺乏稠密时间控制;纯视频到音频路线用视频音频对训练,同步好但在复杂场景下推理弱,容易生成意外的音乐或语音。联合视频文本到音频路线试图兼得,但多数系统依赖双模态同时输入,在缺模态时性能急剧下降,且把视频与音频直接配对再用纯音频标注模型补文字,导致视觉内容与文字描述频繁不一致。
统一模型路线已有尝试,早期代表把文本音频对只当作视频到音频的增强而非平等任务,或靠暴力扩大数据规模但增益不成比例,更没有系统研究文本到音频与视频到音频之间的零和权衡,以及联合任务内部对某一模态的偏置。
自动标注路线同样分两类,纯音频标注受音频歧义与早期音频语言模型幻觉影响大,视觉增强标注多采用先分离再融合,即单模态模型各写文本线索再由大语言模型合并,损失集中在有损的文本中间表示上,单模态幻觉会被累积放大。论文的判断是,缺的不是更大的主干,而是一份视觉音频文本三者紧对齐的高质量三元组,以及把跨任务竞争与任务内偏置分开处理的训练安排。
为什么音频歧义与视觉偏置会变成训练不稳定?
论文把数据问题归为两类机制,初学者可以沿着一个样本走一遍。假设一段夜空视频配一段砰砰声,纯音频标注模型只能听到爆裂声,无法知道是网球还是烟花,于是写下远处烟花,而画面实际是网球场,这就是音频固有歧义导致的视频与文本语义冲突。另一类是原生多模态大模型直接看原始视频加音频,看到画面里有 1 男 1 女就写成男人先说女人回应,而实际只有女性说了谢谢,这就是视觉模态偏置导致的幻觉。
当前两类错误的三元组大量进入联合训练,模型在一个批次里同时收到互相矛盾的视频与文本条件,优化方向来回拉扯,表现为收敛不稳定与保真下降。论文还指出第二类问题,即统一框架内的竞争。跨任务竞争指提高文本到音频采样比会改善文本任务但损害视频任务;任务内竞争指联合任务中偏文本则同步差,偏视频则画外音不服从文本。理解这两层竞争是读懂后文 3 阶段设计的钥匙。
下面这张图把上述两类标注失败并排展示,左侧是输入信号,右侧是模型输出的文字,中间箭头标出冲突类型。
看图路径: 1. 先看上方面板中网球击球声被音频大模型描述为远处烟花的语义冲突箭头;2. 再看下面板中只有女性说话却被多模态大模型幻觉为男女对话的偏置;3. 对照左右两侧输入波形与文字标注,确认冲突来自音频歧义与视觉暗示
论文图 1。原论文 Figure 1:“Challenges in scaling high-quality audio captions.”。
上方面板对应第一类失败,波形标注为连续的砰砰声,模型却输出远处烟花,箭头明确标为语义冲突,说明仅从音频无法消歧时文本会与视频打架。下面板对应第二类失败,波形只有一句感谢且括号注明只有女性说话,模型却输出男女对话,箭头标为幻觉,斜向箭头还表示视频信号越过音频直接干扰了描述。两块面板的背景色与机器人图标区分了音频大模型与多模态大模型,初学者应把颜色仅当作条件分组,不引申为性能排序。
统一框架如何让三种任务共用一个主干?
方法全景可以概括为数据加模型加训练加评测四件套。数据侧用智能体流水线构造 SoundAtlas,提供语义丰富且带时间细节的高对齐三元组;模型侧用标准扩散变换器主干加解耦的双分支条件注入,支持灵活缺省任一模态;训练侧用 3 阶段渐进调度,先建文本生成先验,再用高质量联合数据做桥实现多任务交错,最后解耦地做鲁棒增强;评测侧构造 VGGSound-Omni,覆盖三任务与画外音挑战轨道。
沿一个样本走完流程有助于建立整体感。以联合任务为例,输入是一段 8 秒视频与一句描述烟花先噼啪后连续爆响的文字,文本经文本编码器得到语义向量,视频经视觉编码器得到全局语义特征并按每秒 8 帧采样,经同步编码器得到稠密时间特征,两路分别注入主干,主干在潜空间去噪音频自编码器的隐变量,最终解码为 16 千赫采样的波形。若缺文本,则语义分支只保留视觉部分;若缺视频,则时间分支与视觉语义部分省略,模型退化为纯文本或纯视频生成。
下图展示了这种双分支与三任务的组织方式,上方是统一输出,下方是条件编码,右侧是任务切换示意。
看图路径: 1. 先沿底部编码器向上看全局语义分支与稠密时间分支的两条注入路径;2. 再看右侧文本到音频与视频到音频及联合任务的三个输出分支;3. 确认缺省模态时对应分支可直接省略而不需填充的灵活设计
论文图 3。原论文 Figure 3:“Overview of our unified VT2A framework, which integrates global semantics and temporal alignment, support- ing flexible T2A, V2A, and VT2A generation.”。
图中左侧灰色框区分了经交叉注意力注入的全局语义分支与经自适应层归一化注入的稠密时间分支,下方蓝色与绿色条分别对应文本编码器、视觉编码器与同步编码器,且均标为可选,意味着单模态生成时可直接省略而不需填充约束。右侧纵向标注了跨任务竞争与任务内竞争,3 个橙色块分别对应文本到音频、视频到音频与联合任务,箭头表示它们共享同一主干但在训练与推理时面临不同的竞争维度。读图时不要把右侧箭头理解为数据流向,它表达的是任务关系。
语义分支与时间分支各自算什么,如何汇合?
主干采用标准扩散变换器,条件注入解耦为两条路径,这是可复述的核心。全局语义分支回答是什么,将文本嵌入与视觉特征沿时间维拼接后经交叉注意力层注入;稠密时间分支回答何时,用同步编码器提取逐帧视觉时间特征后经自适应层归一化全局注入。论文明确沿用了已有同步编码器与音频自编码器设计,未报告对这些编码器是否冻结或微调的具体缺项,复现时应先按冻结特征提取器实现,再核对附录。组合的理由在于两种信号的数学作用不同,语义适合做键值检索式的条件,而同步适合做逐层的尺度与偏置调制,混在一起会互相干扰。
全局语义分支 × 稠密时间分支: 全局语义分支用交叉注意力注入文本与视觉的全局语义向量,回答是什么声音,稠密时间分支用自适应层归一化注入同步特征,回答何时发生与如何包络,搭配理由是语义需要可缺省的模态拼接而同步需要全序列的逐层调制,组合后模型可在缺一模态时仍保持另 1 分支正常工作。
再看任务关系,统一的难点不在主干容量,而在异构条件的优化冲突。
视频到音频生成 × 文本到音频生成: 视频到音频生成负责从画面运动与时间结构推断何时发声与节奏对齐,文本到音频生成负责从语言描述推断发什么声与语义保真,二者特征空间异构而直接联合训练会争抢容量,组合意义在于用同时含视频与文本的高对齐三元组把两者对齐到同一声学目标,使一方成为另一方的约束而非噪声。
最后把竞争分层,才能理解为何训练要分 3 段。
跨任务竞争 × 任务内竞争: 跨任务竞争指视频到音频与文本到音频在联合训练中的零和权衡,提高一方采样比会损害另一方,任务内竞争指联合视频文本到音频生成中对某一模态的偏置,导致同步差或画外音不服从文本,前者靠高质量三元组做桥与分阶段采样解决,后者靠解耦的鲁棒增强解决,二者分属不同训练阶段不能混为一谈。
标注流水线如何同时压成本与压幻觉?
SoundAtlas 流水线的 4 个步骤按依赖顺序展开。第一步是视听一致性分流,用图文绑定模型的对齐分数把原始视频分为高、中、低三档,高一致走视听增强路径,中一致走纯音频路径以防视觉干扰,低一致的噪声直接丢弃。第二步是视觉到语言压缩,对走增强路径的样本,用视频理解模型只看无声视频生成文本语境,再把该文本与原始音频一起交给标注智能体,既把昂贵的视频输入换成便宜的文本加音频,又只给语义约束而不给原始画面,从而减轻跨模态幻觉。
第 3 步是初级高级智能体交接,便宜模型先写全部样本,触发复杂场景、命中高频幻觉短语或低于差异化图文音频对齐阈值的样本才升级给强模型,且强模型的推理输出限制长度以控成本。第 4 步是后过滤与验证,先用文本音频对齐模型过滤低分样本,再对增强路径样本做视听文本合理性检查,只有同时通过才入库。
视觉到语言压缩 × 初级高级智能体交接: 视觉到语言压缩把原始视频先转写为文本语境再与音频一起标注,负责切断原生多模态模型的视觉偏置与高昂视频输入成本,初级高级智能体交接让便宜模型先写全部样本再把复杂或低对齐样本升级给强模型,负责在保证质量下把成本降下来,二者搭配使大规模高对齐标注在预算内可行。
鲁棒阶段的两种增强同样需要成对理解。
文本丢弃 × 画外音合成: 文本丢弃随机删去提示词中的词元,迫使模型更多依赖视觉流以纠正文本偏置与同步不良,画外音合成构造画面中不存在对应声源但文本要求生成的样本,迫使模型服从文本以纠正视频偏置,二者互补地在鲁棒训练阶段平衡双模态依赖,分别对应同步与保真两个失败模式。
三阶段训练每一步解决什么,先后为何不能颠倒?
训练安排是论文的第二个关键动作。第一阶段是大规模文本到音频预训练,在未做质量过滤的大语料上学习去噪先验,目标是让模型先具备 robust 的生成能力,从而在后阶段只需极低比例的文本数据回放即可避免灾难性遗忘,减少资源争抢。第二阶段是多任务交错训练,每一步从分类分布中只采样 1 个任务,再从该任务数据集抽一个纯单任务小批量做梯度更新,避免批内多任务损失混合带来的不稳定。
此时高质量联合数据作为语义桥,对齐文本与视频的异构特征空间,把零和竞争转为协同。第 3 阶段是解耦的鲁棒训练,在前 2 阶段收敛后才引入文本丢弃与画外音合成,前者制造文本歧义迫使关注视觉以加强同步,后者构造画面缺失但文本要求的样本以提高文本保真。论文报告若把第 3 阶段的增强提前并入第二阶段,生成质量指标会回退而同步保持,说明脆弱的多任务优化经不起提前扰动,必须解耦。
下图左侧深蓝色面板展示了数据构造的 4 步流水线,右侧红色面板展示了同一烟花样本下 4 种标注的优劣对比。
看图路径: 1. 先从左到右走完数据收集分流到视觉压缩再到两级智能体再到后过滤的主路径;2. 再比较右侧同一烟花音频下四种标注的模糊与幻觉与歧义标签;3. 确认低一致样本走纯音频路径而高一致样本才走视听增强路径
论文图 2。原论文 Figure 2:“Data Construction Pipeline of SoundAtlas (Left). Comparison against SOTA baselines and human annotations (Right) .”。
左侧从上到下可依次看到数据收集与分流、视觉压缩、2 级智能体交接、后过滤与入库 4 个编号框,分流框下标出低中高三档的阈值区间与丢弃、纯音频、增强 3 条去向,压缩框标出视频标注器型号,交接框标出初级与高级模型型号与复杂样本升级箭头。右侧自上而下为模糊、幻觉、歧义与语义时间丰富的 4 条标注,最后一句明确写出先噼啪后连续爆响的时间顺序,初学者应重点对比时间词与声源词的有无,而不是记忆英文原文。
数据划分、评测条件与指标方向如何核对?
复现必须先核对实验条件。预训练语料包含多个音频与音乐数据集的训练集,全部切为 10 秒片段并重采样到 16 千赫;统一训练使用 SoundAtlas 与经质量分过滤的文本音频子集;评测在 VGGSound-Omni、第三方评测集与音频标注测试集上进行,且论文声明评测集与训练数据严格不相交。VGGSound-Omni 分两轨,主轨覆盖 1 万 4 千以上视频的人验真值,先由智能体生成再用大模型核对模态标签并人工修正被标错的标签。
挑战轨含 1 千以上画外音条目,一部分来自低视听对应但排除背景人声的自然事件,另一部分由背景音乐混合合成。客观评测统一用标准工具包在 8 秒片段上计算,分布匹配用弗雷歇距离与散度,值越小越好;音频质量用美学分与起始分数,值越大越好;语义对齐用图文音频对比分数与图文绑定分数,值越大越好;时间对齐用去同步分数,值越小越好。
主观评测从声学保真、语义一致与时间同步 3 维打分。硬件预算与显著性检验在正文中未详细报告,这是复现时需补记的缺项。
主结果在什么公平条件下测了什么,谁未胜出?
主结果要回答 3 个问题:测什么、与谁比、条件是否一致。论文在 VGGSound-Omni 上同时测文本到音频、视频到音频与联合三任务,对比统一模型与专用模型,所有基线均用官方权重与同一评测工具包重测,输入视频与文本条件相同,指标方向按上节核对。为验证不依赖自家标注风格,还在同一视频下换用第三方视频语言模型的标注做泛化测试。报告显示统一模型在三任务上总体最优,尤其在分布距离与对齐指标上领先。
换标注风格后性能略降但仍超过基线,支持其对未见过的措辞有一定鲁棒性。在第三方评测集上,受训练域与专业视频的域差距影响,个别指标落后于数据量大两个数量级的专用模型,但在统一与专用基线中仍总体占优;在纯文本测试集上分布与语义指标最优,质量指标保持可比。未胜出项同样重要,第三方集上的个别质量与同步指标并非全胜,且主观评测细节只在附录给出,说明优势是有条件的。
下表是画外音轨道上的目标对照,比较第二阶段后与完整 3 阶段模型的生成质量与文本保真,公平条件是同一主干与同一评测集,指标方向为距离越小越好、对齐与偏好率越大越好。
| Method | FAD↓ | KL↓ | LA-CLAP↑ Win Rate↑ |
|---|---|---|---|
| S1 →S2 | 0.97 | 1.46 | 0.31 |
| S1 →S2 →S3 | 0.85 | 1.39 | 0.32 |
表后解释需要同时讲收益与代价。完整 3 阶段模型在该轨道上把分布距离与散度同时压低,对齐分数与主观偏好率同步提高,说明画外音合成确实纠正了视频偏置,使模型在画面无声源时仍服从文本。但代价是该增益集中在挑战轨道与同步指标,若只看常规主轨的平均值,提升幅度会被稀释;且表中未列出同步分数与基线专用模型的完整对比,复现时应补测以防以偏概全。
桥数据与渐进调度哪一个更关键,有何反证?
消融按两个问题组织。第一问是高质量联合数据是否为必需的桥。仅联合训练视频与文本两任务时,提高文本采样比会改善文本距离但损害视频距离,呈现零和权衡;加入高对齐的联合三元组后,三任务指标同时达到最优,且文本采样比可降至 0.1 仍保持文本性能;作为反证,若联合任务存在但标注来自纯音频生成的普通质量版本,对齐不良仍无法解决竞争,性能远差于高对齐版本。
这支持桥的质量而非联合任务的形式才是关键。第二问是 3 阶段是否必须渐进。只做第二阶段而不做第一阶段预训练,生成质量明显差;做了第一阶段再做第二阶段,质量大幅提升但同步仍弱;把第 3 阶段增强提前并入第二阶段,同步保持但生成距离回退。
只有完整的第一到第二再到第三链条同时实现高质量与跨模态一致。这支持先验、协同、鲁棒 3 步的顺序不可颠倒。 下面两张表分别整理可直接复现的构造阈值与训练采样条件,数值与单位均来自正文连续原句,裸值不擅自添单位。
| 环节 | 参数 | 取值 | 适用条件 | 作用 |
|---|---|---|---|---|
| 一致性分流 | 对齐分数阈值下限 | 0.20 | 低于则丢弃 | 区分噪声 |
| 一致性分流 | 对齐分数阈值上限 | 0.30 | 高于则增强 | 区分可用视觉 |
| 质量过滤 | 文本音频对齐阈值 | 0.35 | 通用音频 | 标记升级 |
| 质量过滤 | 文本音频对齐阈值 | 0.15 | 音乐 | 标记升级 |
| 成本控制 | 推理输出上限 | 128 tokens | 高级智能体 | 控成本 |
表后解释要讲清收益与边界。高低阈值把视觉从主输入降为可选约束,中档走纯音频路径避免了干扰,差异化对齐阈值照顾了音乐的特殊性,长度上限把强模型的开销封顶。
代价是阈值本身依赖特定对齐模型的分数分布,换模型或换域需重调;未报告阈值敏感性与过滤丢弃率,复现时应记录各路径的样本占比。
| 阶段 | 条件 | 取值 | 输入规格 | 说明 |
|---|---|---|---|---|
| 语义编码 | 视觉采样 | 8 fps | 文本加视觉拼接 | 经交叉注意力注入 |
| 预处理 | 音频切分 | 10-second clips | 重采样 16 kHz | 保持一致 |
| 第二阶段 | 文本采样比 | 0.1 | 高质量桥数据下 | 防遗忘下限 |
| 全流程 | 总步数 | 1.2M steps | 三基线对齐 | 公平对比 |
表后解释同样保留反例。低文本采样比成立的前提是有高对齐桥数据,否则普通质量数据下同样比例仍会竞争。
总步数对齐保证了渐进与混合基线的比较公平,但未报告每阶段步数分配与学习率调度,复现时需以附录为准并做小规模敏感性测试。
规模与覆盖如何核对,什么还没测?
除核心消融,还需核对论文特有的数据规模与评测覆盖。SoundAtlas 的规模、主轨视频数与挑战轨条目数决定了训练与评测的体量,质量维度声明则决定了指标解读。下表把这四项放在一起,便于 1 次核对体量与维度,避免把分布距离的改善误读为人工偏好的改善。
| 对象 | 规模 | 覆盖 | 质量维度 | 用途 |
|---|---|---|---|---|
| SoundAtlas | 470k pairs | 音频视频数据集增强 | 语义时间丰富 | 统一训练 |
| 主评测轨 | 14,000+ videos | 全量人验真值 | 高保真 | 三任务主结果 |
| 挑战轨 | 1,000+ items | 自然加合成画外音 | 文本保真 | 鲁棒验证 |
| 客观指标 | 四 critical dimensions | 分布质量对齐同步 | 多指标 | 防单指标偏置 |
表后补充未评测边界。论文未测量推理延迟、显存占用与输出帧率,也未报告多次随机种子的方差,因此不能从质量领先推定部署更便宜或更稳定;音乐与语音的长时结构在 8 秒与 10 秒片段上验证充分,更长时长的可控性仍待验证。
复现时应固定随机种子并记录单卡推理耗时,与质量指标分开报告。
哪些结论是直接报告,哪些只是可能?
区分证据强度有助于避免过度推广。直接报告的是在给定工具包与重测条件下的指标领先、换标注风格后仍超过基线的泛化,以及高质量桥数据与渐进调度各自的消融增益,这些有数字与基线支撑。有限解释的是把竞争转为协同的机制描述,它得到消融支持但未给出特征空间对齐的直接测量,应表述为数据支持而非证明。因果之外的推测包括更大规模或更强主干必然带来同等增益,以及阈值与采样比在其他域的最优性,这些属于可能与待验证。
缺失证据不是技术错误,但复现时要补上:编码器冻结与否、优化器与学习率、每阶段步数、过滤丢弃率、人工评测的样本量与一致性、统计显著性与硬件预算。若这些缺项不补,仅凭平均指标无法判断方差与成本。此外,不同指标的差值不能混放比较,百分点与相对百分比不同,自动指标不能替代人工判断,表头或算术若出现冲突应明确标注而不自行调和。
何时值得尝试,复现先做什么?
当任务需要一个模型同时承接纯文本、纯视频与双模态 3 种调用,且存在画外音或缺模态的实际场景时,这套方案值得尝试;若只有单一模态且数据已充足,专用模型的性价比可能更高。复现建议按学习依赖排序。先复现数据分流与过滤阈值,记录高中低三档占比与丢弃率,抽查视听增强路径是否引入视觉幻觉;再实现双分支主干,先用冻结的文本、视觉与同步编码器跑通单模态与双模态前向,确认缺模态可省略而不报错。
然后按 3 阶段顺序训练,先做文本预训练建立先验,再以低文本比例做多任务交错,最后才加入文本丢弃与画外音合成,每阶段保存检查点以便回退。评测时固定 8 秒窗口与同一工具包,分布、质量、对齐、同步 4 维同时报告,并单独列出画外音轨道。关键超参数与信息条件包括对齐阈值、文本音频阈值、推理长度上限、视觉采样率、音频切分与采样率、采样比与总步数,缺一即不可比。
代码与权重以官方页为准,当前演示页可用,是否开源权重需以该页实际可达为准,不做推定。
一句话收束:拿走了什么,留下了什么?
拿走的是可操作的流程:把视觉压缩为文本约束以抑幻觉,用便宜模型全量标注加贵模型升级难例以控成本,用高对齐三元组做桥把跨任务零和转为协同,用解耦的鲁棒增强分别纠正文本偏置与视频偏置。留下的是待补的验证:编码器与优化细节、阈值敏感性、长时生成、延迟成本与统计方差。对刚入门的研究生,最值得复述的不是指标数字本身,而是先沿一个样本走完输入到表示到组件到目标到输出,再用公平条件与反证组织实验,这种核对习惯比任何单点最优更能迁移到下一个音频生成课题。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
另有 8 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



