英文题目:AniTales: End-to-End Multimodal Story Generation Through Natural Language Prompting (Student Abstract)

会议身份:conference:aaai:2026:conference-paper-id:42181

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#LoRA #模型融合 #用户研究 #音视频生成 #文本到语音

评分:5.0/10 | 创新 1.1/2 | 技术严谨 0.9/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:后50% | 文档类型:系统技术报告

👥 作者与机构

  • Mrigendra Agrawal:机构信息未能从会议 PDF 纯文本可靠映射
  • Yunze Xiao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作输入自然语言提示,输出可游玩的分支视觉小说,包含对白、角色立绘、背景、配音与音乐,难点在于跨场景角色外观一致与多模态情感对齐。故事生成模块以大语言模型输出含说话人标识、背景提示与每句情感标签的结构化剧本并经独立审核器过滤,其情感标签与说话人信息直接进入美术与语音环节。角色美术先用FLUX.1 dev叠加风格低秩适配生成初版肖像,经用户确认后再用FLUX.1 Kontext上下文编辑衍生中性、愤怒、开心等多表情立绘,保持同一角色身份。语音合成调用MiniMax Speech 02以情感标签指导韵律生成台词音频并缓存复用,场景组装与分支引擎按标签同步文本框、立绘、背景与音频并以对话历史延续分支。与既往分段生成或需大量人工干预的方案相比,该链条以情感标签为跨模态黏合剂实现全自动装配,减少作者资产制作负担。在普通用户与专家分别创建十场景故事并试玩的评测设置下,普通用户组的视觉一致性得分为4.2 ± 0.78,低于专家组的4.8 ± 0.44。该结论适用边界受限于短篇试玩与小样本主观评分,长篇连贯性与跨风格泛化尚未验证,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 演示资源:https://anitales.chat — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,哪些信息必须保留?

这篇解读的输入是学生摘要全文与两张官方原图像素,目标是让刚进入语音与音乐与音频领域的研究生能够核对方法并复述实验。必须保留的信息包括系统模块划分、模型名称与调用关系、用户研究的被试数量与任务量、评价指标的量程与均值标准差,以及作者明确指出的短板。输出是一条从自然语言提示到可玩视觉小说的完整链路说明,不做超出原文的性能推断。

视觉小说在这里指一种在屏幕上呈现的互动故事形式,角色立绘放置在背景之上,对话显示在文本框中,同时配有背景音乐与配音。AniTales 的输入是一段自然语言提示,外加用户对风格与声音与安全级别的选择,输出是包含多场景、多角色、多句对白、可分支、可游玩的视觉小说工程,工程可以导出为结构化数据或视频。学习这篇论文时要先建立多模态对齐的直觉,文本故事、人物形象、声音表达必须在同一情绪时刻保持一致,否则就会出现台词愤怒但立绘微笑或配音平淡的割裂感。

视觉小说 × 分支交互: 视觉小说负责把角色立绘叠加在背景之上并在文本框中推进对话与配音,分支交互负责在任意场景插入选项并以后续对话历史为条件延续剧情,二者搭配的原因是视觉小说需要可玩的选择结构而不只是线性播放,组合后作者一句话输入即可得到可点击继续与可导出为视频的完整作品。

论文把这种割裂感归纳为已有工具的 4 个断点,分别是流程分散需要手工制作素材、跨场景角色不一致、视觉与声音没有绑定到情绪时刻、分支连续性不足。AniTales 的教学价值在于它没有提出新的生成模型,而是用一个以情绪标签为中枢的工程管线把大语言模型、扩散模型与语音合成组织起来。对于音频方向的新生,重点不是背诵模型参数,而是理解情绪标签如何从文本侧产生,又如何约束声音侧的韵律选择,这正是语音合成中文本理解与表达控制的典型接口。

已有路线在一致性上卡在了哪里?

原文用较长篇幅梳理了从文本到图像序列的研究路线。早期工作构建数据集把文本转换为图像序列,代表是视觉故事讲述。随后基于生成对抗网络的顺序条件模型尝试逐场景生成故事,但保持角色一致性被证明很困难。更近的工作把预训练文本到图像变换器适配到故事续写,支持更长故事与用户增量输入,但角色仍然不够稳定。

另一条路线是带多角色的互动故事可视化,这类系统支持图像与对话与选项,但需要大量用户输入来维持一致。更大自动化程度的系统减少了手工,但跨场景角色身份仍然会断裂。还有一类研究专门解决单图或跨场景的角色身份一致,例如基于互信息与低秩适配的方法、无训练一致文本到图像生成、特定角色保持方法,但原文指出这些工作聚焦单张图像生成而不是完整互动体验。上下文感知生成图像的叙事类系统也被提及,但同样没有解决跨场景一致。

AniTales 与上述工作的对照维度是同输入与同目标与同运行阶段。它的输入是自然语言提示加少量角色设定,目标是端到端可玩的多幕视觉小说,运行阶段覆盖故事结构、美术资产、语音与分支组装。原文的判断是已有方法要么解决单图一致,要么需要重度人工,只有完整管线加用户研究才能验证端到端体验。这种对照不能读成同条件胜负,因为原文没有在同一数据集上重跑上述基线,也没有报告自动图像一致性指标,对比停留在功能定位层面。

一个样本如何从一句话走完输入到输出?

假设用户想做一个语言学习小故事,提示是山脚下问路去山顶,包含距离表达练习。系统先让用户填写故事描述,再创建角色姓名与背景故事与声音类型,接着设置全局风格与故事长度与安全级别,然后生成角色肖像并允许重复抽取,最后 1 次性生成完整游戏的表情立绘与配音与对话。这个例子是教学用例,人物数量与台词内容均为示意,不代表原文实验中的具体故事。

下面这张生成示例图展示了最终呈现形态,阅读时先把它当作输出端检验标准,再回头理解管线为何需要情绪标签与说话人标识。请沿着立绘、背景、文本框 3 层结构观察该样本的多模态叠放方式,确认文字教学内容是否落在对话框层而不是背景层。

看图路径: 1. 先看左侧角色立绘与右侧户外背景的叠放关系;2. 再看底部半透明对话框的说话内容与继续提示;3. 最后把立绘风格与背景风格是否统一作为一致性检查

原论文 Figure 1:AniTales generation example

论文图 1。原论文 Figure 1:“AniTales generation example”。

从像素可见,画面左侧是黑发红衣的动漫风格少女立绘,右侧与远景是蓝天绿树山坡构成的户外背景,底部是深色半透明对话框,框内蓝色英文文本涉及距离远近表达与步行 5 分钟等教学句,并出现底部中间的点击继续提示。该图显示的正是引言定义的视觉小说三要素叠加,立绘覆盖背景,对话框覆盖下部画面。对音频新生而言,这张图的教学点是声音不可见但必须与可见层同步,当对话框显示问路练习句时,语音合成应读出同一句话并匹配当前说话人与情绪,场景组装引擎的作用就是保证这种 3 路同步不錯位。

端到端管线由哪五步串联?

原文把系统描述为模块化管线,协调多个模型产出连贯的多模态故事。按正文与流程图的对应关系,可以复述为故事生成、角色肖像生成、语音合成、场景组装、分支与导出 5 个功能块,外加贯穿全程的内容审核。流程图则从用户操作角度给出 5 个步骤,先写故事描述,再创建角色,再做可选设置,再生成可重复抽取的肖像,最后生成完整游戏。两种划分并不矛盾,前者是模型视角,后者是交互视角。

下面的流程图是理解全系统的总览,阅读时重点看用户在哪些步骤介入,以及机器自动完成哪些资产。请先从上到下跟踪主箭头,再对照后文组件说明把每个步骤映射到具体模型,避免把交互步骤误当成模型结构。

看图路径: 1. 从上到下依次读出五个步骤的标题与小字说明;2. 注意步骤二到步骤四中用户选择在何处介入;3. 确认箭头是单向串行,判断分支生成发生在最后一步

原论文 Figure 2:AniTales end to end pipeline

论文图 2。原论文 Figure 2:“AniTales end to end pipeline”。

从收到的像素可见,该图是纵向五框流程图,依次为故事描述、角色创建并附姓名与背景故事与声音类型、设置可选并附全局风格与故事长度与安全级别、生成角色肖像并注明用户可重复抽取、完整游戏生成并附表情立绘与配音与对话,框间由向下箭头连接。这一结构说明用户控制集中在前 4 步,最后一步是批量资产生成。对于复述者而言,关键是记住第 4 步的人工确认点,用户接受肖像之后才生成表情变体,这是保持角色身份稳定的工程选择,也是后文肖像模块的输入前提。

故事生成模块如何产出机器可执行的剧本?

故事生成模块处理用户提示,调用大语言模型并返回结构化数据。这里的大语言模型指能够按指令生成文本的通用模型,原文点名的是 Gemini 与 OpenRouter 渠道模型。结构化数据指固定字段的机器可读格式,原文明确为包含说话人标识、对话、背景提示词,以及每句对白的情绪标签的 JSON 对象。用户还可以选择风格、声音与安全级别,另有一路独立的大语言模型调用作为审核员,只有合规内容才会继续。

结构化 JSON 剧本 × 情绪标签: 结构化 JSON 剧本负责统一记录说话人标识、对话文本与背景提示词,情绪标签负责为每一句对白标注高兴或生气等状态,二者搭配的原因是下游立绘选择与语音合成需要同一个机器可读的情绪依据,组合后场景组装引擎才能按同一标签同步文本、音频与表情立绘。

沿着样本走一遍,输入是问路教学提示与角色设定,模型输出的 JSON 中每一轮对话都带有说话人与情绪字段,例如问路者提问标注为困惑,引导者回答标注为耐心。背景提示词同时生成,用于后续背景图绘制。审核调用发生在生成之前或之后,原文表述为审核提示与输出,不合规则阻止流程。这个设计的实质是把自由文本先收敛为带情绪的执行脚本,后续图像与语音都不再直接理解原始提示,只执行脚本字段,从而减少跨模态误解。

该模块的未报告细节需要明确指出,原文没有给出提示模板、解码参数、JSON 纠错策略,也没有说明审核员的判定标准与拦截率。复述时不能从模型名称推定具体版本或参数规模,也不能假设输出必然合法,实际复现必须补做格式校验与失败重试逻辑。

\[General Users (n=10) Experts (n=5)\]

上面这个标记对应原文证据中的分组表头写法,含义是普通用户组 10 人与专家组 5 人,它不是数学公式,只是提醒读者后文所有数字都按这两个样本量分组聚合。把它放在这里是为了先固定分组,再读具体组件与实验数字,避免把两组合并平均。

角色肖像与表情立绘如何分两步保持身份?

角色肖像生成分为初始肖像与表情变体 2 个阶段。初始阶段使用 FLUX.1 dev 加风格低秩适配从文本生成肖像,这里的扩散模型指通过逐步去噪从文本生成图像的模型,风格低秩适配指在冻结主模型的同时用小参数模块控制画风。用户可以预览并接受或重复抽取,只有接受的肖像才会进入第二阶段。第二阶段用 FLUX.1 Kontext 渲染同一角色的特定表情,例如中性、愤怒、高兴,提示中要求保持同一角色。

FLUX.1 dev × FLUX.1 Kontext: FLUX.1 dev 加风格 LoRA 负责从文本首次生成角色初始肖像,FLUX.1 Kontext 负责在用户接受肖像后渲染同一角色的不同表情立绘,二者搭配的原因是先固定身份再变换表情比每幕重新生成更容易保持跨场景一致,组合后中性与愤怒与高兴等立绘共享同一身份特征。

这种两步法的搭配理由是身份锚定与表情解耦,先用可人工筛选的肖像固定脸部与服装特征,再以该肖像为参照生成表情,避免每幕独立采样导致换脸。对于音频新生,可以类比为说话人注册与风格转换,先注册目标音色,再转换情绪韵律,而不是每句重新选择说话人。原文没有报告肖像分辨率、采样步数、引导系数,也没有给出身份相似度的自动度量,跨场景一致的证据主要来自后文用户主观评分,因此不能把该方法读成已证明像素级身份不变。

复述时要强调用户确认是管线的一部分,不是可有可无的界面装饰。如果去掉人工接受环节,初始肖像的不确定性会直接传导到所有表情立绘。原文允许重复抽取,说明系统用交互换取一致性,这也是端到端自动与人工把关之间的折中。

语音合成与场景组装如何被同一标签驱动?

语音合成管线使用 MiniMax Speech 02 渲染对话,这里的文本到语音指把文字转换为波形的合成系统。关键是该模块直接受 JSON 剧本中的情绪标签指导,使声音韵律跟随情绪上下文,音频文件会存储以便复用。场景组装引擎负责把交互场景组装起来,利用 JSON 中的说话人与情绪标签同步文本、音频与正确的角色立绘。分支与导出模块在任意场景插入分支点,续写以对话历史为条件,工程可导出为 JSON 或视频。

MiniMax Speech 02 × 韵律: MiniMax Speech 02 负责把对话文本渲染为语音文件并缓存复用,韵律指语速与语调随情绪上下文的变化,二者搭配的原因是剧本中的情绪标签需要直接指导语音合成的表达方式,组合后同一角色在愤怒与高兴台词下得到不同的声音表现而不是平板朗读。

沿样本继续走,同一句问路回答的情绪标签同时决定两件事,一是选择耐心表情的立绘,二是选择更平缓友好的语音韵律。说话人标识则决定立绘位置与音色选择,避免张三的台词配李四的声音。这种单标签双驱动是全文对音频读者最重要的机制,它把文本理解的结果显式存为标签,再把标签当作声音控制信号,而不是让语音模型自行猜测情绪。

原文未报告语音采样率、音色库大小、情绪可控的具体参数,也没有给出韵律客观评测。音频文件复用说明相同文本与情绪组合不会重复合成,这对控制成本有意义,但原文没有量化延迟或费用。复述时只能说标签指导合成,不能说已实现细粒度情感强度连续控制。

本研究训练了什么,没有训练什么?

本研究没有训练阶段,没有报告任何梯度更新、损失函数、训练数据、优化器或冻结策略。所有提到的模型都是直接调用的既有模型,大语言模型负责剧本与审核,扩散模型负责肖像与表情,语音合成模型负责配音。系统的研究工作量集中在管线构造、提示组织、JSON 契约设计、交互流程与用户评估,而不是模型权重更新。

真实计算过程可以复述为检索与推理与缓存的组合,用户输入与选项进入大语言模型得到结构化剧本,剧本字段进入图像与语音模型得到资产,资产按说话人与情绪索引存入工程并在播放时按场景调用。分支续写是在已有对话历史条件下再次调用大语言模型,没有暴露搜索宽度或候选重排细节。把无训练等同于确定性求解是误解,即使参数冻结,语言模型采样、扩散采样与用户重复抽取都会引入随机性,同一提示多次运行可能得到不同故事与形象。

缺项需要逐条点名,原文没有说明各模型版本快照、调用温度、失败重试、内容审核阈值,也没有说明风格低秩适配的训练来源与适用范围。复现者不能从模型名称反推实现,必须把模型调用当作外部依赖加以版本锁定,否则今天复跑的结果与论文试用时的结果不可比。

用户研究测了什么,条件是否一致?

原文报告了两项互补研究,一项是普通用户研究,一项是专家研究。普通用户通过问卷平台招募 10 名熟悉角色扮演服务的被试,要求是游戏活跃玩家且都完成过至少一部视觉小说,年龄以 18 到 34 岁为主,性别男女各半。专家组 5 人包括开发者、视觉小说读者与画师。两组使用同一问卷,每位参与者创建一到两个十幕故事,设计 2 到 3 个角色,游玩结果后完成评分与开放反馈。

评价维度包括逻辑一致性、角色与对话匹配、声音适配、视觉一致性、推荐意愿、总体愉悦度与系统可用性量表。前四项与愉悦度采用 5 分制,推荐意愿采用 10 分制,可用量表采用 100 分制,分数越高越好。两组任务量与问卷相同,支持组间对照,但样本量很小且普通用户经过游戏经验筛选,结论外推到新手或儿童教育场景需要谨慎。伦理方面,问卷平台被试按每小时补偿,专家自愿参加,另有独立大语言模型调用负责筛查提示与输出。

关于演示链接的可达性,本次收到的资源状态为暂时不可达,因此不能写该链接当前可用或已公开,只能写本次未能确认可达。复现者应以论文文本与本地搭建为准,不依赖在线演示。

主结果支持什么判断,代价在哪里?

比较问题是同一任务下普通用户与专家是否都认可叙事连贯与视觉稳定,公平条件是两组完成相同十幕创作与游玩流程并填写同一问卷,指标方向均为越高越好。下表整理核心四项与任务背景,阅读时先看组间差异,再看组内短板,不要只记高分。

条件指标普通用户组专家组任务背景
十幕故事创作逻辑一致性 1 到 5 分4.43.4每人 1 到 2 个故事
十幕故事创作声音适配 1 到 5 分3.63.6语音合成环节
十幕故事创作视觉一致性 1 到 5 分4.24.8肖像加表情立绘
十幕故事创作系统可用性 0 到 100 分8481同一问卷

上表显示普通用户在可用性与叙事连贯上评价较高,专家在视觉一致性上给出最高分但在逻辑上更为严格,声音适配是两组唯一低于 4 分的维度。结合原文,普通用户继续使用意愿平均 82 分,推荐意愿普通用户 8.2 分而专家 6.4 分,总体愉悦度普通用户 4.3 分而专家 3.8 分。这种分化支持的判断是管线在易用性与视觉稳定上达到可用水平,但故事逻辑与声音表现仍有明显改进空间。代价是小样本主观评分无法证明跨场景像素级一致,也无法证明语音情绪控制达到自然对话水平。

系统可用性量表 × 逻辑一致性: 系统可用性量表负责评价操作流程是否易学易用,逻辑一致性负责评价十幕故事在情节上是否连贯,二者搭配的原因是好用的生成器仍可能产出混乱故事,组合后普通用户的高可用性评分与专家更严格的逻辑评分形成对照,避免把易用性误读为叙事质量。

未胜出项必须明确指出,声音适配在两组同为最低,专家对逻辑一致性的标准差较大说明评价分歧明显,推荐意愿的专家均值与方差也显示并非所有专家都愿意推广。复述时要区分直接报告与有限解释,数字是报告, promising 等总体展望只是有限解释,不能读成已验证的大规模结论。

去掉哪个环节会怎样,失败条件是什么?

原文没有消融实验,没有逐模块去掉情绪标签或表情变体后的对照,也没有不同语音模型或不同扩散模型的横向比较。因此不能补写拿掉情绪标签后必然怎样,只能从机制上指出缺失环节的风险点,并把原文明确的失败信号当作反证。

比较问题是如果只看可用性高分是否会掩盖短板,证据是声音适配与专家逻辑评分明显低于其他维度。公平条件是同一批故事与同一问卷,指标方向越高越好。下表把可用性与内容质量对照呈现,避免把易用当成全优。

条件指标普通用户组专家组对照意义
同一十幕任务系统可用性 0 到 100 分8481流程易用
同一十幕任务总体愉悦度 1 到 5 分4.33.8整体体验
同一十幕任务逻辑一致性 1 到 5 分4.43.4专家更严格
同一十幕任务声音适配 1 到 5 分3.63.6两组共同短板
同一十幕任务推荐意愿 1 到 10 分8.26.4推广意愿分化

表后解释需要同时给出收益与代价,收益是普通用户在多项指标上超过 4 分且可用性达到 84 分,说明从提示到可玩作品的链路已经跑通。代价是声音环节没有随情绪标签达到同样水准,专家对长情节逻辑的容忍度更低,推荐意愿分化也说明系统更适合快速原型与教育定制场景,而不是直接替代专业美术与配音。未评测边界包括更长篇幅、移动端性能、多轮分支深度、审核拦截率,这些在原文未来工作中才被列为方向。

哪些结论不能从这篇摘要推出?

样本量是首要限制,10 名普通用户加 5 名专家只能算试点研究,标准差普遍接近或超过 0.7,专家推荐意愿标准差更大,均值差异很可能受个别被试影响。被试经过游戏与视觉小说经验筛选,对新手、低龄学习者或非英语语境的适用性待验证。任务限定为十幕与 2 到 3 个角色,更长故事的连贯性正是作者列出的未来工作,不能把十幕结论推广到长篇。

测量方式也是限制,全部核心指标都是主观评分,没有角色身份相似度、唇音同步误差、语音自然度客观分,也没有延迟、成本、帧率等部署指标。视觉一致性高分不能等同于扩散模型输出确定,声音适配低分也不能直接定位是音色库问题还是韵律控制问题,因为原文没有做模块级归因。相关性不等于因果,情绪标签与高一致性评分同时出现,不能证明就是标签带来的提升,要证明需要去掉标签的对照实验,而该实验缺失。

还有三处不能承诺,原文没有测量误判率与审核效果,不能承诺安全机制充分。没有报告推理开销与音频文件体积,不能承诺实时生成。没有公开代码与权重版本,不能承诺开箱可复现。阅读时遇到总体趋势向好的表述,要逐项核对是普通用户成立还是专家也成立,是每组都成立还是仅单组高分。

复现先做什么,需要锁定哪些条件?

复现的第一步是锁定外部模型快照与调用参数,包括大语言模型的具体版本与温度、扩散模型与风格适配的权重来源、语音合成的声音标识与情绪控制方式,并记录审核模型与安全级别设置。原文只给出模型家族名称,复现者必须自行补齐版本号,否则同一提示会得到不同剧本与形象。第二步是实现 JSON 契约校验,字段至少包括说话人、对白、背景提示词与每句情绪标签,非法 JSON 要重试或人工修正,并记录重试率。

第三步是固定创作任务以对齐原文条件,每位测试者创建一到两个十幕故事并设计 2 到 3 个角色,游玩后再填同一量程问卷。被试筛选要记录游戏频率、视觉小说经验、年龄与性别分布,因为原文普通用户全部有视觉小说经验且多数每周玩游戏,换成新手可能显著拉低可用性分。第 4 步是分离记录主观分与客观日志,主观分保留均值与标准差与量程,客观日志记录生成失败率、重复抽取次数、语音复用率与端到端耗时,这样才能判断高分是以多少人工筛选为代价换来的。

信息条件方面,代码开源、权重下载与系统可运行是三件不同的事,原文只给出演示链接且本次未能确认可达,不能当作代码已公开。复现应从最小可运行管线起步,先跑通单场景文本加单立绘加单句配音的同步,再扩展到十幕与分支,避免一开始就搭建完整导出与视频渲染。

何时值得尝试这个思路,还需补哪项验证?

当目标是快速把教学或语言练习内容做成可玩小故事,且能接受人工筛选肖像与有限配音质量时,这个以情绪标签为中枢的思路值得尝试。它的可操作部分是统一剧本字段与资产索引,用同一标签同时选表情与控制韵律,减少跨模态错位。当目标是长篇连载、高质量配音或严格角色设定时,则需要更强的一致性约束与专业美术介入,不能指望现有管线直接达标。

还需补的验证至少有三项,一是去掉情绪标签或随机替换标签的对照,检验标签是否真在驱动视听一致。二是扩散侧的身份相似度客观评测,检验高分是身份稳定还是被试宽容。三是语音侧的自然度与情绪可辨度测试,区分音色选择与韵律控制各自的贡献。只有补齐这些,才能把试点高分转化为可部署收益。

对音频新生的收束建议是,把这篇论文读成接口设计课,文本理解输出什么字段,声音合成消费什么字段,场景组装在播放时刻如何按字段对齐。记住普通用户可用性 84 分与视觉一致性专家组 4.8 分是直接报告, promising 只是有限解释,声音 3.6 分是明确短板。下 1 次读同类多模态故事论文时,先找情绪或风格标签的定义与消费位置,再找用户任务量与量程,最后找未胜出项,复述就不会被营销式判断带偏。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总