英文题目:AudioStory: Generating Long-Form Narrative Audio with Large Language Models

会议身份:conference:cvpr:2026:conference-paper-id:Guo_AudioStory_Generating_Long-Form_Narrative_Audio_with_Large_Language_Models_CVPR_2026_paper

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #扩散模型 #大语言模型 #长音频处理 #音频生成

评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Yuxin Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Teng Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuying Ge:机构信息未能从会议 PDF 纯文本可靠映射
  • Shijie Ma:机构信息未能从会议 PDF 纯文本可靠映射
  • Yixiao Ge:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei Zou:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

AudioStory面向多模态指令输入的长叙事音频生成,输出为多段时序连贯的音频序列,需同时解决跨事件主题一致性与复杂指令组合推理难题。为此框架先由大语言模型做故事线推理并分解事件数量与时间戳,再对每个事件交错生成字幕与桥接查询,随后经交叉注意力融合语义与残差查询并连同时长条件送入扩散变换器逐段合成。与经预定义文本空间桥接大语言模型与扩散器的做法不同,该工作解耦出文本语义对齐与声学细节补偿两路查询并做三阶段端到端联合训练。在长音频生成任务下,AudioStory的Instruct得分为4.1,高于LLM+TangoFlux的Instruct得分3.5。该提升源于单音频生成预训练带来的高质量短片段合成能力与交错推理提供的上下文引导,使长序列更好地匹配参考长度并减少遗漏发声实体。该结论适用边界受限于自然声与卡通声两类域内验证,对重叠声、语音对白与音乐长结构的泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/TencentARC/AudioStory — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么长音频?

这篇论文研究的输入是多模态叙事指令,可能是纯文本的一段故事要求,也可能是音频加文本的续写要求,还可能是视频加文本的配音要求。目标输出不是 10 秒左右的单个音效,而是一段数十秒甚至上 100 秒的长音频序列,由多个按时间排列的音频片段组成。举例来说,指令要求表现汤姆逼近杰瑞、杰瑞逃进鼠洞、汤姆等待、杰瑞从电源盖后探头,模型需要给出每个事件的发生区间、情绪与音效,再把波形连成完整故事。

必须保留的关键信息是事件数量、每段起止时间、每段字幕内容和整体风格一致性。本文默认从原文独立写作,只依据论文正文证据与官方原图像素,不引入外部评价。代码仓库当前可用,地址为论文首页给出的开源链接,本文不复述仓库内未经论文证实的内容。后续各节按学习依赖展开,先讲任务与路线,再讲全景与组件,然后讲训练与数据,最后讲实验与复现边界。

已有路线在短音频上能做什么,不能做什么?

第一条路线是文本到音频生成,代表做法包括先把文本编码再用潜在扩散或流匹配去噪合成波形。论文提到这类模型在短片段上已经能做到较高保真,但通常只接受描述性字幕,难以处理包含多个事件、时间先后和强度变化的复合指令,也被限制在较短时长。第二条路线是任意到任意的多模态大语言模型,目标是接受任意模态并输出任意模态,已有工作展示了轻量对齐与离散建模的可能性。

论文指出这类工作多集中在语音或单段声音与音乐,对超出基础字幕的复杂人类指令理解不足,且音频生成多为单段短音频。两类路线对照的输入、目标和运行阶段不同,因此不能把短音频上的分数直接当成长叙事能力的胜负。本文把教学例子明确标为例子,不把类别差异当成同条件比较。

长叙事音频难在哪里,论文如何定义任务?

论文把叙事音频生成定义为给定多模态指令,生成结构化且时间连贯的长音频序列。难点被归纳为两点。第一是时间连贯,需要在较长时长上保持主题、音效与情绪基调的一致,场景切换不能跳变。第二是组合推理,需要把高层叙事拆成逻辑有序的事件,例如先是脚步溅水声、再是雷声、再是汽车打滑与关门声,并安排各自的时机与互动。现有短音频系统缺乏显式建模跨片段依赖的机制,也难以让音频事件跟随演进的叙事结构。

为此论文建立首个叙事音频基准 AudioStory-10K,包含自然声与动画声两域,配有叙事提示与链式推理步骤,用来量化指令遵循、一致性与生成质量。本文只讲论文实际研究的该任务,不扩展到语音合成或通用音乐生成的无源结论。

AudioStory 整体如何从指令走到长音频?

AudioStory 采用统一的理解与生成框架。先由大语言模型分析指令并做故事线推理,推断事件数量、每段起止时间与应包含的声音内容,再进入交错推理生成,逐事件轮流产出字幕、时长与桥接查询,最后由基于扩散变换器的音频生成器逐段合成波形并拼接。大语言模型推理器擅长规划与分解,扩散音频生成器擅长波形建模,二者通过解耦桥接查询衔接,避免只用纯文本传递丢失音色与氛围细节。沿一个汤姆与杰瑞样本走一遍,输入是总时长 31.6 秒的文字要求,表示是故事梗概加 4 段事件结构,组件是推理器与 4 个扩散调用,目标是每段字幕与时长对齐,输出是拼接后的长频谱。

以下导读帮助建立分段规划到逐段合成的主路径,重点看左侧指令如何进入底部推理器,中部如何拆出带时间戳的事件,右侧如何由多个扩散器汇成完整长音频,视频配音作为扩展应用放在同一框架下理解。

看图路径: 1. 先从左侧三类指令框沿箭头看到底部多模态推理器;2. 再看中部故事线概括与事件分解如何给出时间戳;3. 比较右侧四个扩散器下方三类小方块的图例分工;4. 确认顶部长频谱由四个短事件频谱拼接而成的汇合关系

原论文 Figure 1:AudioStory effectively follows multimodal instructions, decomposing them into a sequence of…

论文图 1。原论文 Figure 1:“AudioStory effectively follows multimodal instructions, decomposing them into a sequence of coherent audio segments that capture scene transitions, affective tone, and precise…”。

该图显示左侧 3 类指令都指向底部多模态推理器,中部明确区分故事线概括与事件分解,右侧 4 个事件各自经过扩散器后向上拼接为长频谱,下方图例区分字幕令牌、语义令牌与残差令牌。这支持后文的理解:规划与合成是分离但衔接的两步,长时一致性来自统一的推理链而非单次长波形采样。

大语言模型推理器 × 扩散音频生成器: 大语言模型推理器负责理解多模态指令并输出故事线与分段时间戳,大语言模型推理器之后的扩散音频生成器负责把每段条件变成波形,分工搭配的原因是前者擅长组合推理而不擅长波形建模、后者相反,组合后新增的作用是端到端联合优化理解与合成,减少模块分离带来的特征鸿沟。

需要强调的是,故事线推理与交错生成是先后关系,前者给出全局事件数与时间框架,后者逐段落实字幕与桥接条件,时长预测准确与桥接语义丰富是保证段内语义与跨段一致的前提。

每一段的语义与声学信息如何分工传递?

组件层面的关键是解耦桥接机制。论文把大语言模型与扩散模型之间的通道拆成两组查询。语义令牌编码面向文本的高层语义,用来自文本编码器的目标做均方误差对齐;残差令牌补充语义令牌缺失的低层细节,通过生成监督间接学到互补信息。两者经多头交叉注意力融合成桥接表示,再与时长信息一起作为扩散模型的条件。

生成器采用流匹配做生成建模,从噪声音频出发在条件约束下学习速度场。先沿一样本走完输入到输出,输入是某事件字幕,表示是语义令牌加残差令牌,组件是交叉注意力融合与扩散变换器,目标是重建符合字幕且衔接上下文的波形,输出是该事件的短音频片段。

以下导读聚焦令牌类型与损失位置,重点看推理字幕之后如何分出两类令牌,右侧生成器如何把融合条件与噪声及 duration 结合,底部 3 阶段如何逐步放开联合训练。

看图路径: 1. 先沿面板 a 中多模态指令到推理再到字幕与两类令牌的主路径;2. 再看面板 b 中语义与残差令牌经交叉注意力汇合的位置;3. 对照面板 c 三个阶段下方标注的联合训练范围变化

原论文 Figure 2:Overview of AudioStory with three core components: (a) The LLM processes the instruction input,…

论文图 2。原论文 Figure 2:“Overview of AudioStory with three core components: (a) The LLM processes the instruction input, decomposes the long audio into structured sub-tasks, and sequentially generates a…”。

该图面板 a 显示语言令牌用下一词预测监督,语义令牌用对齐损失监督,残差令牌与语义令牌共同进入生成分支接受流损失;面板 b 显示融合发生在交叉注意力处;面板 c 显示 3 阶段从单音频生成走向统一理解与长音频统一生成。这种安排的理由是文本特征语义密度高、易被语言模型回归,而音频特征时序复杂,直接强监督反而损害性能,因此残差部分采用弱监督。

交错推理生成 × 分而治之: 交错推理生成负责按时间顺序轮流产出每一段的文字说明与生成条件,分而治之负责把复杂长指令先拆成多个短音频子任务再逐个攻克,二者搭配的原因是长音频无法 1 次对齐所有事件与时间戳,组合后新增的作用是让规划链与音频事件一一对应、可追溯时长与情绪。

语义令牌 × 残差令牌: 语义令牌负责承载面向文本的高层音频语义并接受文本特征监督,残差令牌负责补充音色节奏氛围等低层声学细节与跨事件关联,二者搭配的原因是纯文本桥接丢失细节而纯音频特征又难被语言模型理解,组合后经交叉注意力融合成统一桥接条件输入扩散模型。

论文报告的支持性结论是,去掉显式推理会导致漏事件并降低指令遵循,去掉交错字幕则大幅损害音频质量;文本特征适合监督语义令牌,残差令牌更适合由扩散损失捕获互补信息。

三阶段渐进训练先后练什么、冻结什么?

训练遵循从单到多、从生成到统一的范式。第一阶段做单音频生成,又分预热与整体两步,预热只更新语言模型的低秩适配与语义投影,用均方误差学会语义令牌,整体再放开投影、注意力融合层与扩散模型,回归桥接查询并学习流生成。第二阶段引入音频理解数据,做单音频统一生成与理解,冻结音频编码器,其余可学习部件与第一阶段整体相同,目标同时包含对齐、文本与流损失。

第 3 阶段扩展到长音频统一生成与理解,引入交错推理生成与高质量多音频数据,模型按指令推断事件数并逐段生成字幕与两类令牌,同时保留音频问答与指令数据。论文明确给出部分超参数与数据配比,缺失的是优化器类型、学习率调度与具体冻结梯度路径的逐层说明,本文不从模型名称推定这些实现。

单音频生成 × 长音频统一生成: 单音频生成负责先学会由一句字幕回归桥接查询并合成高质量短片段,长音频统一生成负责在理解数据辅助下学会事件数估计与多段交错输出,二者按先单后长搭配的原因是直接学长序列会同时面对推理与声学两重困难,组合后新增的作用是把短片段能力迁移为有时长约束的多段连贯叙事。

理解先行还是生成先行的顺序实验显示,先生成后理解的渐进顺序取得更好的综合表现,直接混合或逆序会损害生成或理解,论文将其解释为两任务存在协同但也有内在冲突,需要结构化渐进而非 1 次联合。下表整理各阶段的学习条件,便于复现时对照数据与可调参数。

训练配置与数据配比的原文依据是什么?

本节承担方法职责中的可重放细节核对。论文明确主干选择与初始化来源,音频编码器在续写任务中使用,投影结构与 3 阶段学习率、轮数、批量与数据配比均有原文句子支撑。损失权重也给出具体数值。未报告的是优化器、调度、梯度裁剪与重置时机,本文指出具体缺项而不猜测。教学上先沿一样本走完输入到目标,输入是字幕或多模态指令,表示是语义与残差查询,组件是语言模型、融合层与扩散模型,目标是对齐加文本加流损失,输出是短片段或长序列。组合机制的安排理由是先让语言模型学会文本侧回归,再放开生成侧联合,最后引入长序列推理,避免同时优化多重困难。

以下比较问题是各阶段的学习率与数据条件是否可重放,公平条件是同一初始化与同一可调模块集合,指标方向是配置越完整越可复现。

阶段学习率轮数批量数据配比模型
第一阶段2e-450 轮,32 批量单音频生成语言模型扩散器
第二阶段1e-410 轮理解生成 2:1冻结编码器
第 3 个阶段分层学习率,权重 1,0.2,0.4长序列长音频加理解全量联合

该表的主要收益是给出可直接对照的训练起点,代价是第 3 阶段分层学习率的具体数值未完全披露,且硬件与收敛曲线缺失,未评测边界包括不同规模主干下的稳定性,复现时应补记这些开销。

数据从哪来、如何划分、用什么基线与指标?

训练数据包括理解数据、单音频生成数据与多音频生成数据。理解数据整合多个音频字幕库并转成问答格式,论文报告总量为百万级音频问答对;单音频生成数据合并多个字幕库得到数十万音频字幕对;多音频数据即自建 AudioStory-10K。评估分短音频与长音频两套。

短音频生成在音频字幕测试集上用距离类与对齐分数,短音频理解在音频字幕与问答集上用字幕与问答指标。长音频评估覆盖指令遵循、一致性与生成质量,用自动评估器打分并辅以人类主观评测。基线分纯文本到音频模型与基于大语言模型的统一模型,长音频基线还包括直接用最长时长生成、用大语言模型先写分段字幕再逐段合成、用真值字幕合成的上限设置。

比较公平性取决于是否使用同一指令、同一参考时长与同一评估器,本文在结果节中结合这些条件解读。

以下比较问题是两域数据是否覆盖真实环境与风格化音乐音效,公平条件是同一筛选标准下保留有视觉 grounded 的连续事件,指标方向是数量与多样性越高越有利于长叙事训练。

域来源视频数量音频特点举例划分
自然声环境录音集合4,723 条雨声动物脚步交谈85% 训练,15% 测试
动画声卡通剧集集合5,332 条,157 集管弦乐 slapstick 碰撞85% 训练,15% 测试

该表的主要收益是说明基准同时包含日常声景与风格化表现,后者与自然录音差异明显,有助于检验情绪与场景切换;代价是两域标注流水线依赖视频解析与大模型生成指令,链式推理质量受上游解析误差影响,未评测边界包括重叠音段与多生成器协作,论文将其列为未来工作。

评估协议与人类验证如何对应自动指标?

本节承担评估条件的 2 次核对,避免把自动指标当成人评。长音频用自动评估器在指令遵循、一致性与生成质量三方面打分,短音频用距离与对齐分数,理解用字幕与问答分数。人类验证采用匿名用户研究,参与者数量、每人指令数与总评分数均有原文报告,并计算人类与自动评估的相关系数以验证评估可靠性。聚合对象是长音频测试集与抽样的人类评测子集,统计方法为相关系数,百分点与相对百分比含义不同,本文不混用。

不同指标的差值不放入模型列下比较,纵轴是原始分数还是改变量需按原文判断,不能把曲线向下直接写成变差。总体趋势不等于每样本成立,单样本时长准确不能推广全程。缺失的是显著性检验与方差报告,本文明确标注该局限。

长音频主结果在什么条件下支持什么判断?

长音频要测的是复杂多事件场景下的指令遵循、长时生成质量与一致性。与谁比包括直接长生成的纯模型、语言模型写分段字幕再调生成模型的拼接做法、统一多模态模型,以及真值字幕上限。条件一致性方面,拼接类基线逐段独立生成再拼接,天然缺乏跨段上下文,而 AudioStory 用统一推理链给出时间与情绪线索,因此在一致性比较中需注意时长差异带来的偏差。

论文报告 AudioStory 在指令遵循与对齐分数上领先语言模型辅助的基线,并在生成质量距离指标上优于基线,一致性与连贯性也达到较高分数。以下导读先看指令如何被拆成 4 个首尾相接的区间,再核对每段故事细节与音效描述是否对应字幕中的时间戳。

看图路径: 1. 先读顶部指令框中的总时长与咀嚼检查棉花糖的任务要求;2. 再核对中部生成推理给出的四个时间区间是否首尾相接;3. 观察底部每段字幕后附带的时间戳标记与事件内容的对应

原论文 Figure 3:Qualitative case of long-form audio generation.

论文图 3。原论文 Figure 3:“Qualitative case of long-form audio generation.”。

该图所示案例总时长 38.5 秒,生成推理给出 0.0 至 9.8 秒咀嚼、9.8 至 12.8 秒检查包装、12.8 至 25.5 秒轻触棉花糖、25.5 至 38.5 秒唇部动作 4 个区间,底部字幕分别描述湿润咀嚼声、清脆摩擦声、柔和敲击声与轻微张嘴声,时间戳首尾衔接。这表明模型能按叙事逻辑推断时长并逐段落实声音要素,但该图是单样本定性展示,不能推广为全测试集的时长准确率。

以下比较问题是在同指令下谁更少漏事件且更连贯,公平条件是同一评估器与同一参考时长范围,指标方向是指令遵循与对齐越高越好、距离越低越好。

对比维度AudioStory 报告值对照对象差距说明规模
指令对齐提升17.85%语言模型辅助基线较少漏发声实体长音频测试集
一致连贯得分4.0,3.7纯短音频模型长叙事下仍保持连贯长音频测试集
人类评测规模30 人,50 条,150 分多个可运行策略主观与自动评估相关150 条长音频

该表的主要收益是 AudioStory 在需要分解多事件的场景下指令遵循更完整,一致性得分在生成更长更丰富叙事的同时仍可比;具体代价是长音频距离指标仍受参考长度匹配影响,且一致性只有在指令遵循较强时才有意义,短输出靠高一致低遵循不能视为有效基线。未胜出项是真值字幕上限在部分保真指标上仍具优势,说明规划准确不完全等于波形保真。

去掉推理、换桥接特征、冻结扩散器会发生什么?

消融按问题组织。第一问是交错推理是否有用,比较跳过指令分析与不显式生成每段字幕的变体,论文报告去掉推理导致漏事件并降低指令遵循,去掉交错则模型虽能推断事件内容却缺乏生成桥接查询的上下文指引,音频质量大幅下降,因此显式字幕对生成质量至关重要。

第二问是何种特征适合做桥接,比较音频编码器特征与文本特征监督语义令牌,以及对残差令牌施加显式或弱监督,结论是文本特征更高效,音频特征语义密度低且时序复杂,强监督反而损害性能,残差信息更适合由扩散损失弱监督捕获。第三问是端到端联合训练的关键,去掉残差令牌后直接用扩散损失更新语言模型会损害性能,残差令牌缓解了两侧关注信息类型的冲突;完全冻结扩散器退化明显,全量更新最好,其中多模态分支比单模态分支更值得放开。

以下比较问题是哪种训练顺序能兼顾生成与理解,公平条件是同一数据配比与可调模块,指标方向是生成距离越低越好、理解分数越高越好。

训练顺序生成表现理解表现关键操作结论
理解优先较差中等先学问答再学桥接不利于生成
生成优先再理解较好较好先桥接再联合综合最优
无渐进混合差差直接联合存在冲突

该表为定性整理,不替代原文数值消融表;其主要收益是指出先单后长、先生成后理解的结构化渐进优于直接混合,代价是需要 3 阶段调度与不同学习率,论文未报告优化器与调度细节,复现时需补验证。负结果是逆序与交错训练都会损害至少一端,说明两任务协同需要特定顺序而非任意联合。

哪些结论尚未验证、哪些条件不可推广?

论文直接报告的是在自建基准与所选评估器下的相对优势,有限解释包括残差缓解冲突、文本监督更高效、渐进顺序带来协同,这些解释得到消融支持但仍是特定数据与模型规模下的观察。未验证推测包括推广到语音统一建模、多生成器处理重叠音段、更复杂多模态长指令的效果,论文将其明确列为未来工作,应表述为可能与待验证。缺失证据不是技术错误,但未测量误判率、延迟、推理开销与输出帧率时,不能承诺这些量得到改善。

总体趋势不等于每组每步都成立,例如长音频平均一致性高不代表每个长样本都不漂移。相关性不等于因果,自动评估与人类评估高度相关支持评估可靠性,但不能证明自动分数本身无偏。本文区分报告、支持与推测 3 种语气,避免把单案例的时长准确当成全集能力。

要复现应先准备什么、按什么顺序检查?

何时值得尝试是当任务需要数十秒以上、多事件有序且有时长与情绪约束的叙事音频,而非单句音效合成。复现先做三件事。第一是按论文准备 3 类数据,单音频字幕对用于第一阶段,音频问答用于第二阶段,自建或复刻的多音频叙事数据用于第 3 个阶段,注意训练测试划分为大部分训练加小部分测试,不要自行编造划分口径。

第二是按论文搭建模型,主干为指令语言模型加扩散变换器,音频续写时加入音频编码器,投影用两层非线性结构,桥接用交叉注意力融合,超参数保留原文学习率、轮数、批量与损失权重。第三是按阶段检查,先验证单片段保真,再验证理解与生成联合,最后验证长序列的事件数、时间戳与拼接连贯。代码当前可用提供实现起点,但权重下载与系统可运行状态需以本次可达性为准,本文只确认链接在资源状态中标为可用。

训练资源与硬件预算在原文中未充分交代,复现时需自行记录耗时与显存,补做延迟与成本验证。

学完这篇应带走什么做法、记住什么边界?

应带走的做法是长叙事先规划后合成,规划要显式输出事件数、时间戳、情绪与字幕,合成要为每段提供语义与残差两路条件并与时长一起输入扩散模型,训练要按单生成、单统一、长统一的顺序渐进放开。应记住的边界是所有优势结论都绑定自建基准、所选基线与评估器,真值字幕上限与短模型在特定保真维度仍有竞争力;残差与顺序的解释在当前规模下成立,换主干或换数据需重新验证。

复现时优先复刻数据划分与 3 阶段检查,再补延迟、显存与显著性等缺项验证。未来可探索的方向是纳入语音的统一听觉建模与多生成器协作处理重叠段,但这些在本文证据中属于待验证,不作为已证效果复述。论文特有的误解是把拼接基线的高一致当成强基线,实际上低遵循下的高一致没有意义;另一个误解是把文本桥接当成最优,实际上细节需要残差通路补充。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 5 页

区域 1 · 查看论文原页

另有 12 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 cvpr-2026 论文汇总