英文题目:Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

标签:#音视频生成 | #文献综述方法 | #音视频 | #视频到声音生成

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Abhinav Sharma:机构信息未在 arXiv HTML 中可靠披露
  • Sai Karthik Navuluru:机构信息未在 arXiv HTML 中可靠披露
  • Wang Wei:机构信息未在 arXiv HTML 中可靠披露
  • Daksh Dangi:机构信息未在 arXiv HTML 中可靠披露
  • Xiangbo Gao:机构信息未在 arXiv HTML 中可靠披露
  • Li Li:机构信息未在 arXiv HTML 中可靠披露
  • Bo Ni:机构信息未在 arXiv HTML 中可靠披露
  • Vardhan Dongre:机构信息未在 arXiv HTML 中可靠披露
  • Junda Wu:机构信息未在 arXiv HTML 中可靠披露
  • Xiyang Hu:机构信息未在 arXiv HTML 中可靠披露
  • Jiuxiang Gu:机构信息未在 arXiv HTML 中可靠披露
  • Seunghyun Yoon:机构信息未在 arXiv HTML 中可靠披露
  • Tong Yu:机构信息未在 arXiv HTML 中可靠披露
  • Chien Van Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Mohamed Elmoghany:机构信息未在 arXiv HTML 中可靠披露
  • Nedim Lipka:机构信息未在 arXiv HTML 中可靠披露
  • Hoda Eldardiry:机构信息未在 arXiv HTML 中可靠披露
  • Hongjie Chen:机构信息未在 arXiv HTML 中可靠披露
  • Tyler Derr:机构信息未在 arXiv HTML 中可靠披露
  • Thien Huu Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Zhengzhong Tu:机构信息未在 arXiv HTML 中可靠披露
  • Nesreen K. Ahmed:机构信息未在 arXiv HTML 中可靠披露
  • Franck Dernoncourt:机构信息未在 arXiv HTML 中可靠披露
  • Ryan A. Rossi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理音视频联合建模中的跨模态一致性问题,输入涵盖文本、图像、语音、视频或已有音视频对,输出为同步的视频音频对、单模态补全或双流联合编辑结果,难点在于时间对齐与语义对应需同时成立且编辑还需保持未改区域不变。方法链分三步推进,首先以统一形式化将三类任务定义为联合分布及其条件分布上的采样问题,其次沿生成策略、音频表示、视频表示、对齐施加阶段与预训练复用五轴对约29种联合方法分类,最后按输出类型展开联合编辑、联合生成与跨模态生成的文献综述与数据集指标梳理。与已有综述的关键机制差异在于用对齐分数 S 将架构、目标与采样耦合统一解释,并揭示离散token联合建模等空格。原文未提供可核对的关键定量结果。结论仅适用于已公开文献至2026年中的映射,闭源商业系统与快速演进的预印本细节不在其外推范围内。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,先把核对口径固定下来

本文解读的对象是 1 篇综述论文,不是提出单一新模型。输入是原文正文与附录给出的定义、分类与方法描述,目标是让研究生能复述 3 个问题如何形式化、五轴分类如何划分方法、以及编辑分类与评测如何组织。必须保留的信息包括符号含义、3 个问题的输入输出映射、音频与视频表示的原文构造、以及原文明确标注的空缺与未验证之处。输出是一份可核对的技术解读,凡涉及数字与实现细节只讲原文实际写出的内容,教学用的举例会明确标为例子。

初学者常把视频生成加音频生成理解为两个独立任务拼在一起。原文的起点恰好相反:人把门关闭的画面与撞击声感知为同一个事件,几帧的偏移就会被读成错误。因此综述把跨模态一致作为组织原则,要求在时间上把声学事件定位到其视觉成因所在的帧,在语义上让可见声源与可听声源一致。两个单流各自高质量但互相不对齐,在原文的判定标准下仍是失败样本。这个标准贯穿联合生成、跨模态生成与联合编辑 3 类任务。

为避免把比喻当证明,这里把感知统一对应到可操作的检查:同一片段的帧索引与音频采样索引指向同一物理时间,共享时长记为陶;编码器把视频与音频映射到隐表示或共享表示空间;对齐分数衡量自然片段是否高于错配或时移片段。后续所有架构与损失的选择,都是为了在保持单流质量的同时提高这个分数。

已有综述讲了什么,本文把边界划在哪里

原文明确把范围限定为至少一个输出是视频或音频、且另一模态出现在流程中的方法。纯单模态生成,以及没有生成或编辑成分的视听理解、检索与表示学习,被排除在外,仅作背景引用。例子:纯文本到视频无声模型不在范围内,纯音频分类也不在范围内。

与最接近的重叠综述相比,原文指出并发的视听基础模型综述既不处理编辑,也不采用以输出一致性为组织装置的写法。本文的增量有三点:把联合生成、跨模态生成与联合编辑写成同一分布上的 3 个问题;沿 5 个设计轴比较方法;首次系统整理联合视听编辑,映射为 9 类 28 种编辑类型。相关工作的对照应按同输入、同目标、同监督来做,不把类别差异直接当同条件胜负。

例如视频到音频与音频到视频输入输出互换,不能直接比较优劣;联合生成同时输出双流,与只输出单流的跨模态方法在任务难度与评测重点上也不同。

三个问题到底在求什么分布

记视频为多帧 3 通道数组,音频为采样序列,片段为二元组,条件可为空、可为文本、图像、语音或音乐。生成输出记为带帽符号,编辑输出记为带撇符号。问题一是联合视听生成:给定条件学习同时输出双流的分布,要求忠实于条件、单流质量高、且双流对齐分数高。关键是否定条件独立分解:如果模型写成给定条件后视频与音频独立相乘且无进一步耦合,一般无法把对齐提高到条件本身已决定的水平之上,必须在架构中引入共享参数或跨模态注意力,或在目标中加入奖励对应的项。

问题二是跨模态生成:给定一端生成另一端,使二者对应。视频到音频学习给定视频生成音频,音频到视频学习给定音频生成视频。例子:同样是脚步声主题,联合的文本到视听模型是同时合成踩碎石的画面与声音,跨模态的视频到音频模型是给定无声行走视频,只合成踩地瞬间与触地帧对齐的声音。问题三是联合视听编辑:给定原片段与编辑指令,采样修改后的双流,要求落实编辑、把变化传播到另一模态以保持对齐、并保留未指定区域。例子:把说话人声音改为童声,既要改音频,又要让唇动与新音频一致,同时不改背景与身份。编辑因此比生成多出传播与保真两项约束。

方法全景:按输出分组,再按五轴比较

原文先按输出分组:联合生成输出双流,跨模态生成恰好输出 1 流,联合编辑输出修改后的双流。每组内部输入可自由变化,例如联合生成可接受空条件、文本、图像、语音或音乐。接着用五轴作互补分类:生成策略刻画双流如何相对产生;音频表示与视频表示分别固定各自的生成空间;对齐施加阶段说明对应压力加在架构、训练目标还是采样过程。

预训练复用说明权重的来源。因为各轴约束元组的不同分量,一个方法在每轴都要作选择,但选择并不完全独立,例如纯推理期引导策略必然依赖两个冻结单模态模型,从而蕴含双预训练复用。

下表提出全景比较的第一个问题:在相同输出分组下,哪些设计是主流、哪些格子是空的,公平条件是都按原文表一的计数口径统计,指标方向是出现频次越高越主流,空缺不代表失败而代表未尝试。

分组主流做法原文计数空缺格教学含义
联合生成输出双流连续隐音频加扩散或流匹配二十八除以二十九波形与离散音频空缺先学连续隐耦合再谈离散化
联合编辑9 类 28 种9 类 28 种叙事与修复多为空方法集中在同步与内容
跨模态视频到音频最发达视频到音频最发达音频到视频少1 对多方向更难
对齐交叉注意力为主交叉注意力为主推理期引导为例外同步已迁入模型内部
复用从零训练仍常见从零训练仍常见离散格只能从零训练复用即继承表示

上表的主要收益是把文献密度可视化:连续隐表示与交叉注意力占据主流,离散 token 联合生成与波形直接生成在联合模型中空缺。代价是主流不等于在所有容差下都够用,语义 grounding 仍被报告为弱项。未胜出项是推理期引导类方法,原文明确说它们如今是例外,这本身说明同步已从后处理迁移为内置设计,但也意味着灵活性与保真度的权衡仍未解决。

表示与耦合:一个样本如何走完输入到输出

沿一个文本到视听样本走一遍:文本条件进入模型,视频编码器与音频编码器把各自信号映射为隐序列,生成模型在该耦合空间中去噪或自回归采样,再经视频解码器与音频解码器回到像素与波形。表示的选择固定了耦合空间,参数分解决定依赖由谁携带,采样过程决定如何抽出隐对。先有这条主路径,再谈公式才有落点。

联合生成 × 跨模态生成: 联合生成负责从条件同时产生视频与音频两个流,跨模态生成负责以其中一个已观测流为条件只产生另一个流,二者搭配的理由是前者检验模型能否学到模态间依赖,后者检验给定一端时能否把对应关系落实到时间与语义上,组合意义在于用同一对应分数同时约束两种输出形态。

音频侧的主流是连续隐变量。编码器把波形映射为压缩长度远小于采样点数的隐矩阵,解码器近似重建波形,变分形式对后验加正则。原文给出如下构造:

\[z_{a}=\phi_{a}(a)\in\mathbb{R}^{T_{z}\times d},\qquad\psi_{a}(z_{a})\approx a,\]

该式符号为音频编码器、解码器、压缩后长度与通道宽,计算目标是获得可扩散的紧凑序列,原文明确的实现是重建损失加变分正则。离散 token 路线则用量化码本把每帧隐向量替换为最近码字,并用直通梯度训练,实用音频编解码器常做残差级联与滑动平均更新,但原文报告联合方法中无人用该路线生成音频。

连续隐变量 × 梅尔频谱图: 连续隐变量分工是以神经音频自编码器把波形压缩为可扩散的紧凑序列以降低序列长度,梅尔频谱图分工是把音频变成类图像的时频阵列以复用图像生成工具,二者搭配的理由是都需解决音频采样远密于视频帧率的速率失配,组合意义在于决定耦合空间是共享隐序列还是图像式谱图加声码器。

梅尔频谱图路线把短时傅里叶幅度经梅尔滤波器组取对数,得到频带数乘谱帧数的类图像数组,可直接套用图像生成工具,但需另配声码器从谱图恢复波形。原文给出如下构造:

\[m\;=\;\log\big(M\,\lvert\mathrm{STFT}(a)\rvert^{2}\big)\in\mathbb{R}^{F\times T_{m}},\]

视频侧构造镜像音频,只是把对象换成视频。3 维自编码器把时空联合压缩,得到时间步长、空间步长与通道宽决定的隐张量,单主干在其中建模整段。原文给出如下构造:

\[z_{v}=\phi_{v}(v)\in\mathbb{R}^{\,T_{v}/s_{t}\,\times\,H/s_{s}\,\times\,W/s_{s}\,\times\,d_{v}},\]

2 维加时序路线是每帧独立压缩再用时序模块建模运动,离散 token 与像素路线在联合模型中分别空缺或仅有 1 例。像素直建模保留全保真但序列极长,仅早期低分辨率可行。

双塔结构 × 交叉注意力: 双塔结构分工是让视频塔与音频塔各自保留模态归纳偏置并行去噪,交叉注意力分工是只通过跨模态参数传递对齐信息,二者搭配的理由是既复用单模态主干又把依赖集中到可学习的连接上,组合意义在于以架构位置施加对应压力而非仅靠损失或采样后修正。

生成策略上,单塔把拼接后的视听序列送入同一网络,每层都见双流;双塔用两套模态塔并行,仅经跨模态参数交换;级联写成先视频后音频或反之的因子分解并顺序采样;统 1 token 要求双流先离散化再序列化为单序列;引导式冻结两个单模态模型,仅在采样器中加对齐梯度。原文指出统 1 token 格在联合模型中空缺,最接近的统一模型仍在连续隐上共享去噪器。

共享位置编码 × 显式先验: 共享位置编码分工是在位置层把同一物理时刻的视听 token 强制对应,显式先验分工是另行估计时空同步信号再注入生成器,二者搭配的理由是前者不增加语义判断而保证帧级时钟一致,后者把何时发声与何处发声解耦出来,组合意义在于从时钟与事件两层共同收紧同步容差。

对齐放在哪里:架构、目标还是采样器

对齐不是单一技巧,而是压力施加的阶段。架构侧可用交叉注意力让双流互看,或用共享位置与旋转编码把同一物理时刻的 token 拉到同一时钟。训练侧可用对比预训练先学对应再生成,或加同步模块与按步自适应表示对齐。推理侧可用判别器或外部对齐模型引导采样,不更新生成器权重。原文的判断是交叉注意力仍是主导,共享时序编码用于帧级对应,而纯推理期对齐已成例外。

语义对齐是较弱的全局性质:来源身份一致但时间可松。实践中用对比视听嵌入度量,或经语言中转:先给视频写 caption 再由 caption 生成音频,语义链显式可控,但会损失直接视觉条件保留的时间精度。唇同步是最严的特例,容差约 1 帧,人对音素到视素错配极敏感,因此谈话头、语音到视频与配音都围绕它组织,并配有面部感知调制与未来音素前视等设计。音乐对齐则是节奏性的,要求运动峰与节拍重合,舞蹈视频是最受约束的实例。长序列一致性是另 1 维问题:小误差随步累积为漂移,需流式因果分块加双向教师蒸馏,或直接延长生成窗口,但评测 horizon 仍远短于应用假设的分钟级。

训练目标与权重来源:冻结什么,更新什么

原文覆盖的方法多以扩散与流匹配为主干,训练目标除单流重建或去噪损失外,常加对比对齐、联合真假判别与偏好同步等对应目标。形式上方法由编码器、参数、目标与采样过程四元组刻画,五轴分别约束其中不同分量。仅按证据说明冻结与更新:引导式冻结双单模态模型只学采样引导;双预训练复用冻结两主干只学连接;单预训练复用通常复用视频主干再叠加音频分支。

从零训练则在配对视听数据上随机初始化全学。原文未报告具体梯度路径与重置时机时,不从模型名推定实现,只记为缺项。

去噪训练的原文实现是沿噪声时刻表加噪后训练网络预测噪声或速度,条件经交叉注意力、自适应归一化、拼接或无分类器引导注入。原文给出如下目标:

\[\mathcal{L}\;=\;\mathbb{E}_{z_{a},\,u,\,\epsilon}\,\big\lVert\epsilon-\epsilon_{\theta}(z_{u},u,c)\big\rVert_{2}^{2},\]

该式符号为隐音频、扩散步与高斯噪声,计算目标是最小化预测噪声的均方误差,采样时从纯噪声去噪到隐再解码为波形。无训练的综述本身不训练任何模型,本节的训练指被综述方法的训练,综述的真实计算是文献整理、分类与计数,不存在把无训练等同于确定性求解的问题。

下表提出第二个比较问题:在相同表示与对齐统计下,权重来源如何影响数据与算力成本,公平条件是按原文对从零、单预训练、双预训练的划分计数。

权重来源代表做法原文计数与含义成本含义适用条件
从零训练配对数据全学12 种从零训练数据算力乘性增长有大规模配对与算力时
单预训练复用复用视频主干单预训练复用只补另一模态视频强而音频弱时
双预训练复用冻结双主干学连接双预训练复用只学耦合缺配对但有强单模态时
推理期引导冻结加对齐引导推理期引导为例外无联合训练要灵活性可牺牲保真时
继承表示复用即定表示复用即定表示离散格难复用选复用先接受其隐空间

该表显示复用是控制成本的主杠杆,但复用无例外地继承连续隐扩散表示,离散 token 格只能从零训练或耦合 token 单模态生成器,而后者尚无覆盖方法。代价是复用缓解数据需求却锁定表示,限制了向离散统一序列的探索。

数据与评测协议:用什么测,测什么性质

生成数据集被定义为视频音频与可选条件的配对集合,条件多为同时描述双流的 caption,跨模态时可为空。编辑数据集则需四元组:原双流、编辑指令与目标双流。原文强调 caption 质量与规模决定模型能学到多少对应关系,近期集合强调描述视听关系而非单流。基准则固定提示集与评测协议,近期任务型基准在多粒度上测文本到视听,物理基准测视觉事件与其声音是否符合物理常识。编辑尚无共享基准,各方法自建或挪用数据,且均未提供上述四元组监督,这是结果不可比的直接原因。

下表提出第 3 个比较问题:在相同任务映射下,视频表示与对齐机制的主流选择是什么,公平条件是同按原文表一的计数,指标方向是频次。

比较维度主流选项原文计数非主流或空缺选择含义
音频表示连续隐二十八除以二十九波形空缺先保证可训练长度
权重从零训练常见12 种从零训练部分闭源未标文档完整度影响分类
语义对比嵌入或语言中转对比嵌入或语言中转时间精度有代价显式可控换直接精度

表后解释:3 维隐与交叉注意力的组合构成当前联合模型的最常见骨架,收益是实现直接且与扩散主干兼容,代价是表示必须同时服务双模态,且长时漂移与物理合理性仍未被该组合解决。未胜出项包括判别器引导与分类器引导,它们保留了灵活性但在时间精度上让位于内置同步。未评测边界是分钟级长视频与叙事级跨镜头编辑,现有协议多为短片段同步。

评测指标按 4 组组织:单流质量、条件一致、跨模态对齐、编辑的忠实与保持。视觉用分布距离与多样性,音频用分布距离与分类语义,条件用图文与声文一致,对齐用对比语义、 onset 与节拍距离、唇同步置信与距离。编辑必须成对报告忠实与保持,只报一端会误导。人评仍是参照标准,自动指标以与人判的一致性为验证。

主结果:哪里强,哪里被报告为弱

原文是综述,不报告单一新模型的主结果数字,其结果是文献级统计与基准揭示的差距。强处是视频到音频: onset 需落在视觉接触的精确帧,围绕对比预训练、流匹配加速与同步模块、固定生成器加控制器的 3 条路线已相当发达,控制正从文本转向点击与掩码等指令。弱处是语义 grounding:近期基准报告视听美学强而语义可靠性弱;物理常识基准显示同步却物理错误的片段仍多,例如声音与材质或力度不匹配。音频到视频结构性更难,因一轨可配多视频,专用尝试孤立,多为联合分布或双向链接顺带支持。

忠实度 × 保持度: 忠实度分工是检查编辑指令是否在双流中落实,保持度分工是检查未指定区域的内容是否未被改动,二者搭配的理由是编辑同时受传播要求与保真要求约束,组合意义在于只报一端会误导,必须成对报告才能判断联合编辑是否成立。

下表提出第四个比较问题:在相同对齐要求下,不同任务的主导对应形式与评测重点是否一致,公平条件是都按原文任务表的对应列划分。

任务给定与生成主导对应评测重点原文判断
无条件联合空到双流语义加时间分布与对齐最直接暴露依赖
文本到视听文本到双流语义加时间提示保真加同步方法最多
视频到音频视频到音频时间起点同步容差最发达
音频到视频音频到视频时间多样性下对齐专用尝试少
联合编辑原双流加指令到新双流保持加传播忠实加保持无共享基准

该表的主要收益是把任务难度与评测焦点对齐:单流质量指标必要但不充分,高分仍可完全忽略另 1 流;只有对齐指标能区分联合与跨模态问题。代价是现有对齐指标对对应的人判跟踪不如质量指标成熟,唇同步除外。反例是美学高分但语义不可靠的样本,这正是原文强调不能只看单流指标的原因。

对照与反证:拿掉耦合会发生什么,空缺说明什么

原文未提供统一消融数字,但给出结构性反证:如果联合分布写成条件独立相乘且无耦合,一般无法把对齐提高到条件已决定的水平之上,这是判定耦合是否必要的逻辑对照。表示层面的对照是速率失配:音频远密于视频,必须在隐速率上对齐才能逐帧耦合,否则跨注意力与共享时钟无从附着。复用层面的对照是继承关系:凡复用一或两个预训练主干,必继承其表示,且被复用主干无例外是连续隐扩散模型,因此离散格只能从零训练,这是成本讨论的依据。

空缺本身是证据:无联合方法用编解码 token 生成音频,无联合方法用离散视频 token,波形直建模亦空缺;统 1 token 格空缺而最接近者在连续隐上共享去噪器。这些空缺不是随机缺失,而是有结构原因:序列长度、表示兼容与数据成本共同作用。音频到视频与语音到视频在肖像之外 1 对多极强,也近乎未触及。叙事级的剪接、重排与摘要,以及场景与声学耦合类编辑,同样无专用方法,说明当前编辑仍在镜头内,而专业剪辑恰在跨镜头处。

边界与未验证之处:哪些结论不能推广

第一,分类只覆盖有文档的文献,完全闭源的商业系统被排除在设计轴之外,部分文档系统仅在已披露轴上打标。因此分类是文档文献的地图,不能当作当前最强系统的排名,读者不应把空缺解读为技术不可行。第二,覆盖止于年中,预印与技术报告细节可能变化,空格可能迅速被填补。第三,五轴互补而非互斥,论文表述模糊时归类需判断,原表记录作者解读,权威仍是原文。

第四,评测上对应的人判跟踪缺失,现有基准 horizon 远短于应用假设,编辑结果因无共享四元组数据而不可比。相关性不等于因果,未测量误判率、延迟与成本时,不承诺这些量得到改善。训练资源、推理开销、输出帧率与实际延迟需分别讨论,总体趋势不等于每组每步成立。

复现先做什么:从可运行的最小闭环开始

先固定符号与问题:用同一时长对齐帧与采样索引,区分生成帽符号与编辑撇符号,区分生成编码器与评测用对比编码器。接着选一条可运行路线:若要联合生成,优先复现连续隐音频加 3 维视频隐的双塔交叉注意力基线,因其在原文计数中最密,代码开放度相对高;若要视频到音频,优先复现对比预训练加隐扩散或流匹配路线,并用 onset 精度检查同步容差;若要编辑,先实现文本引导的单例适配或冻结双流的增量去噪,再成对检查忠实与保持。

核对清单包括数据集、划分、采样、指标聚合与统计方法,以及硬件预算。数值相同不是同一指标的证据,百分点与相对百分比不同,不同指标差值不放入模型列,自动指标不替代人评。原文表头或算术冲突时应标注冲突,不编造划分来圆一致。代码可用性以原文核验为准:部分仓库为占位、无代码或仅样本数据集,归为不可运行;部分闭源仅 API 可用。

复现时保留关键超参与信息条件,区分代码开源、权重下载与系统可运行三件事。还需补的验证是长时一致性、物理合理性与编辑四元组基准,缺失这些就不应声称分钟级或叙事级能力。

何时值得尝试这种耦合,何时先做单流

当任务的失败判据包含跨流不一致时,值得尝试联合或跨模态耦合,例如配音、拟音、谈话头与声画同生的内容创作;当失败只由单流质量决定时,先做单流更划算。选择双塔加交叉注意力适合要复用强单模态主干且配对数据有限的情形,选择单塔共享主干适合要最直接捕获依赖且能承担表示折中的情形,选择级联适合一端已可高质量生成而另一端可条件生成的情形,选择推理期引导适合无联合训练预算但接受保真损失的情形。长时与叙事需求当前多无专用解,应先缩小 horizon 并显式测漂移,再谈分钟级。

对初学者的特有误解是把高单流分当作视听成功,或把搜索最优当作可部署收益。应坚持三问:与谁比、条件是否一致、指标方向与聚合对象是什么。只有在对齐指标与人判同时改善、且保持度未塌时,才算联合编辑成立。伦理上同步的说脸生成降低伪造门槛, provenance、水印与检测须双流一起做,这是能力本身附带的要求。

📎 论文与评分元数据

排名:前25% | 文档类型:综述 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-30 语音/音乐/音频论文速递