英文题目:Automatic generation of audio comic from manga images

会议身份:conference:interspeech:2026:conference-paper-id:koshino26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#众包评测 #多模态模型 #语音 #文本到语音

评分:5.4/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:后50% | 文档类型:系统技术报告

👥 作者与机构

  • Sota Koshino:机构信息未能从会议 PDF 纯文本可靠映射
  • Shotaro Ueji:机构信息未能从会议 PDF 纯文本可靠映射
  • Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
  • Tomohiko Nakamura:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为日语漫画页面图像,输出为按阅读顺序播放的多角色表演语音,难点在于版面解析、阅读排序、说话人归属与夸张表演风格的连贯合成。系统分三段串行:先检测版块(panel)、文本区、人物脸并做文本识别,再做角色识别、阅读排序、说话人关联与情感预测,生成可扩展标记语言(Extensible Markup Language,XML)脚本;最后用提示语音合成逐句生成并拼接。情感控制由视觉语言模型(Vision-Language Model,VLM)综合当前句文本、上下文、角色脸图与所在版块图预测8类情感,拼成固定模板风格提示送入微调后的ParlerTTS。该设计的实质是以符号化脚本与自然语言提示解耦图像理解与语音生成,允许人工修正脚本形成半自动模式。在Manga109子集与40页众包评测下,自动流水线与人工校正加合成整体印象平均意见分(Mean Opinion Score,MOS)均为约2.5分,真人表演约为4.0分,表明前端自动化已接近人工脚本水平,瓶颈在合成表现力与音质。结论仅适用于短页日漫,未验证长篇一致性、跨风格与跨语言外推,原文未披露训练推理成本与延迟。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

有声漫画要解决什么阅读问题?

有声漫画在这里指以漫画为原作、再配上按剧情表演的语音的派生作品。输入是一页漫画图像,输出是按内容与顺序合成的多段语音。初学者容易把它理解成给图片加背景音乐或单人朗读,原文要保留的关键信息恰好相反:谁在说话、每句话按什么顺序出现、用什么情感说,都必须从图像中恢复出来,否则语音与画面会对不上。

论文把动机写成两条线。一条是体验与可及性,给角色加上富有表现力的声音可以带来更沉浸的阅读,也能用听觉呈现帮助视觉障碍读者。另一条是成本,如果完全靠人工找声优逐句表演,大量漫画标题难以改编,因此作者提出先做一个领航性的半自动与自动系统,把从图像到语音的整条链路跑通。

在进入方法之前,先沿图 1 的例子走一遍输入到输出。左侧是一页日文漫画,包含多个分格和竖排气泡。右侧把同一页拆成按顺序排列的语音片段,每个片段上方标出说话人姓名与头像,下方保留对应气泡截图,中间用不同深浅的波形表示不同说话人。这段对应关系说明系统必须同时做三件事:找到气泡文字并认出来,排好阅读顺序并确定说话人,再为每个说话人合成声音。

看图路径: 1. 先看左侧漫画页与右侧语音波形的对应箭头,确认输入是一页图像而输出是多段语音;2. 再看右侧人物头像上方标注的 Mitsune 与 Keitaro,确认同一人物对应同一种波形颜色;3. 最后看下方小气泡截图与波形的上下对齐,确认每段语音都保留了原文气泡来源

原论文 Figure 1:Our concept. Generating an audio comic from manga image.

论文图 1。原论文 Figure 1:“Our concept. Generating an audio comic from manga image.”。

图 1 的教学价值在于把评价标准具体化。好的结果不是声音好听就行,而是人物、气泡、顺序、声音四者对齐。后续原文把检测理解错误与合成质量分开评价,正是因为任何一处错位都会破坏这种对齐。例如把一句话安给错误角色,即使语音自然,观众听到的剧情也是错的。理解这一点后,再看管线中为什么要单独设置排序、识别与情感估计,就不会觉得是多余步骤。

这条路线与哪些已有工作相邻?

按同输入、同目标、同监督来定位,这篇工作处于漫画理解与语音合成的交叉点。漫画侧已有工作包括面向漫画的分格与目标检测、基于漫画 109 标注的检测方法,以及从分格到篇章转写的角色命名转写。语音侧已有工作包括用自然语言描述控制高保真语音合成的提示语音合成方法。原文引用的检测理解基座与语音基座正是落在左右两端。

与纯漫画转写路线相比,本文的输入同样是漫画页图像,但目标多走了一步:不止输出谁说了什么的文本,还要输出按顺序表演出来的声音。因此文本顺序错误率与字符错误率在这里不是终点指标,它们会继续向下游传播为听感错误。与纯语音合成路线相比,本文的输入不是干净的人工剧本,而是从图像估计出来的带噪声剧本,因此必须讨论自动剧本与人工校正剧本的差距。

与数据集工作的关系也需要讲清。原文同时依赖漫画 109 及其标注作为检测理解的真值来源,并依赖作者团队的漫画声音数据集作为语音训练与真人对照。也就是说,图像侧的监督来自已有漫画标注,语音侧的监督来自与漫画图像对齐的真人表演语音。这种双数据源结构决定了后续实验必须分成客观理解评价与主观听感评价两部分,不能用一侧指标代替另一侧。

输入输出与必须保留的信息是什么?

把任务写成可复述的形式:给定一页漫画图像,系统先检测分格、文本区与人物区,对文本区做识别,再估计文本区的阅读顺序,通过人脸比对识别角色并把每句话关联到说话人,输出一个按阅读顺序排列的剧本文件,每条记录包含文本、说话人与顺序。随后对每条记录合成语音,并按顺序播放得到有声漫画。

必须保留的信息有 4 类。第一是文本内容,认错字会直接改变台词。第二是顺序,日漫通常从右到左从上到下,排错会改变因果与对话轮次。第三是说话人归属,说错人会改变剧情理解。第四是说话风格,原文用角色名加情感类别来控制,情感判错会使语气与画面表情不一致。

一个教学例子可以帮助区分这些信息。假设某页有两个气泡,右边是追问,左边是回答。如果只做识别不做排序,合成器可能先播回答再播追问,听众会觉得逻辑颠倒。如果排序对了但说话人关联错了,追问与回答的声音会互换,听众会误解人物关系。这就是原文把排序、识别、说话人关联拆成独立客观指标的原因,它们对应不同的失败模式。

三段管线如何从页图像走到合成语音?

系统全景可以分成检测、理解与合成 3 段。检测段负责找到分格、文本与人物。理解段负责识别文本、估计顺序、识别角色并关联说话人,产物是剧本可扩展标记语言文件。合成段负责把每条文本加风格提示送入提示语音合成模型,得到逐句语音。图 2 把这条主路径与情感提示分支画在了一起。

读图时先抓住中间产物。检测与理解的结果不是直接送波形,而是先写成包含多条文本与提示的剧本文件。这个设计的好处是允许人工介入:半自动条件就是用人校正过的剧本替换自动剧本,再走同样的合成器,从而分离理解错误与合成错误。

看图路径: 1. 沿顶部 1 检测、2 理解、3 合成的箭头走一遍主路径,确认中间产物是剧本可扩展标记语言文件;2. 观察下方文本行、上下文、分格图与脸图汇入视觉语言模型的分支,确认情感提示的输入来源;3. 对比检测框颜色与理解阶段绿色顺序线的变化,确认排序是在检测之后单独完成的步骤

原论文 Figure 2:Overview of the system architecture.

论文图 2。原论文 Figure 2:“Overview of the system architecture.”。

图 2 还显示了一条向下的分支。检测得到的台词文本、上下文台词、分格图与脸图被一起送给视觉语言模型,用于估计情感并生成提示,再回填到剧本文件中。也就是说,剧本文件既承载结构信息,也承载风格信息。合成器在训练与推理阶段都使用这种文本加提示的输入形式。理解这张图后,后续组件节可以逐个展开每个框的计算来源与已验证对照。

检测与理解组件各自完成什么计算?

检测部分在推理前需要先存好每个角色的姓名与脸图对,作为比对用的参考。给定输入页图像,系统检测分格、文本区与人物区,并对文本区做识别。然后估计阅读顺序,把检测到的人脸与准备好的参考脸图及姓名比对以识别角色,再把每句话与其说话人关联。最终每张图像产生一个剧本文件,描述每条台词的文本、说话人与阅读顺序。

理解部分的关键是情感提示的构造。视觉语言模型对每句话从文本、周围台词、人物脸图与对应分格图中预测 8 个类别之一:平静、中性、高兴、惊讶、生气、害怕、悲伤或厌恶。最终提示固定写成角色名加情感的英文句子形式,含义是某角色的声音带有某种情感且非常清晰。白话说,模型先看图与上下文判断这句话该用什么情绪说,再把判断结果翻译成合成器能读懂的一句话。

说话人关联 × 提示语音合成: 说话人关联负责把每一句台词对应到具体角色名和阅读顺序,提示语音合成负责把该句文本合成为对应角色的声音,二者搭配的理由是前者提供谁在何时说什么的结构化剧本,后者需要这种结构才能逐句选择音色与情感,组合后新增的作用是把版面理解结果直接变成可播放的多角色语音序列。

视觉语言模型 × 情感提示: 视觉语言模型负责综合台词文本、上下文、人物脸图和分格图来判断情感类别,情感提示负责把角色名和情感类别写成一句英文描述送给语音模型,二者搭配的理由是语音模型只接受文本提示而不能直接读图,组合后新增的作用是用可控的类别词把图像与上下文的理解压缩成合成器能执行的风格指令。

文本顺序估计 × 文本识别: 文本顺序估计负责决定多个气泡按日漫从右到左从上到下的朗读先后,文本识别负责把每个气泡图像转写成字符序列,二者搭配的理由是只认字不排序会读错剧情先后,只排序不认字则没有可合成的内容,组合后新增的作用是形成按剧情顺序排列的台词串,保证合成语音的播放顺序符合原作阅读顺序。

角色识别 × 说话人识别: 角色识别负责把检测到的人脸与事先准备的姓名与脸图对进行比对以确定图中是谁,说话人识别负责把每一句台词与对应的角色框关联起来,二者搭配的理由是知道图中有谁还不够,还要知道这句话是谁说的,组合后新增的作用是为每条台词同时给出文本、说话人名和顺序,使后续合成能为同一角色保持一致的声音设定。

4 个组合机制放在一起看,管线的依赖顺序是先有位置与文字,再有顺序与人物,最后才有风格。风格估计需要用到前面的产物作为输入,因此前面的错误会向后传播。例如文本识别错了,情感判断用的文本上下文也会变差。原文没有给出每个组件内部阈值与匹配算法的细节,复述时应明确这是缺项,不从模型名称推定实现。

哪些模型被训练,哪些只是被调用?

本研究没有报告从零训练检测器与视觉语言模型的梯度细节,应明确说明没有这些训练阶段。检测理解侧准备了两个版本做对照:第一版用已有漫画转写与文本识别工具组合,第二版用更新的组合。原文只说明用了哪几个外部工具,没有说明是否冻结或微调,也没有给出学习率、轮数或损失,因此不能从名称推定它们在本研究中被重新训练。

真正明确发生训练的是语音侧。原文使用提示语音合成模型,并为日语做了微调,训练数据是包含约 9 小时真人表演语音的漫画声音数据集,且带有丰富的标注例如真值台词等。白话说,合成器事先听过与漫画对齐的真人演绎,学会按文本加风格提示来模仿有声漫画风格的说话方式。原文未报告语音微调的优化器、步数与冻结范围,这也是具体缺项。

推理时的计算过程是确定的调用链:自动剧本或人工剧本逐条进入合成器,每条由文本与风格提示共同控制,输出逐句波形再按剧本顺序拼接。视觉语言模型在推理时被调用来估计情感并生成提示。原文没有说明采样温度或解码策略,因此不能把系统输出说成确定性求解,只能说在给定剧本与提示下调用模型生成语音。

客观与主观评价各在什么条件下进行?

实验分成客观理解评价与主观听感评价两套协议,条件并不相同,需要分开核对。客观评价比较第一版与第二版检测理解管线,测试集来自漫画 109 与漫画声音数据的真值标注,规模约为 700 页、覆盖 8 个不同类型漫画标题。指标覆盖分格检测、文本检测、人物检测、角色识别、文本排序、文本识别与说话人识别七项,方向是误差越小越好。

主观评价比较 3 种语音条件:第二版自动管线加合成、人工标注剧本加合成、漫画声音数据中的真人表演。测试集是每个标题选 5 页未见过的页面且包含主要角色,共 40 页。通过众包招募 150 名听众,按五点量表评价作为有声漫画的整体印象。每名参与者评价 7 个分格,共得到 21 个语音样本。问题原文是询问整体印象是什么。

比较公平性时要注意两点。第一,客观评价的 700 页与主观评价的 40 页不是同一划分,前者用于选出更好的理解管线,后者用于评价端到端听感。第二,人工加合成条件使用人工校正过的剧本再走同样的合成器,因此它与自动管线的差距可归因于理解错误,而它与真人演绎的差距主要反映合成器本身的差距。这种设计使得反证成为可能。

下表把可核对的规模与版本条件整理成有叙事闭环的一张表,阅读时先确认版本对照是否公平,再确认数据规模与语音训练量是否足以支撑结论。表前提出的问题是:两个版本在相同测试集上比什么,主观评价在多大样本上听什么。

评价分支系统版本与输入数据来源测试规模语音训练与人力规模
客观理解对比v1 与 v2 检测理解管线Manga109 与 MangaVox 真值标注约 700 页共 8 个标题v1 用 Magiv2 加 Yomitoku,v2 用 Magiv3 加 MangaOCR
主观听感对比v2 加合成对比人工加合成对比真人未见过页面与 MangaVox 真人语音40 页,每标题 5 页150 人,每人评 7 格共 21 样本
语音模型训练ParlerTTS 日语微调MangaVox 约 9 小时真人表演语音含真值台词等丰富标注视觉语言模型用 GPT-5.2

表后需要解释代价与边界。客观集规模较大但只测理解不测听感,主观集能测听感但只有 40 页且每人只听部分分格,个体差异可能很大。语音训练只有约 9 小时,对多角色多情感的有声漫画风格来说数据量有限,这为后续真人与合成之间仍有差距埋下伏笔。原文还声明用生成式人工智能做了校对,但这不改变实验条件。

第二版管线在客观指标上改进了哪里?

客观结果的读图顺序是先看纵轴是误差还是准确率,再看柱高升降方向。图 3 中分格检测、文本检测、人物检测、角色识别、说话人识别用一减召回或一减准确率表示,文本排序用排序错误率,文本识别用字符错误率,因此柱越矮越好。每个子图左侧为第一版,右侧为第二版。

看图路径: 1. 先按第一行四个图像任务再看第二行三个文本任务的顺序逐个子图阅读纵轴含义;2. 对比每个子图内左侧 v1 与右侧 v2 柱高,确认 v2 在文本顺序与文本识别上下降更明显;3. 观察角色识别与说话人识别两组柱高差异较小且误差棒重叠,确认这两处是相对弱项

原论文 Figure 3:Objective evaluation results of the proposed system.

论文图 4。原论文 Figure 3:“Objective evaluation results of the proposed system.”。

从可见柱高看,第二版在所有任务上都优于第一版,改进在文本相关任务上尤其大,文本顺序估计与文本识别的柱高下降最为明显。这支持作者采用第二版作为最终系统的选择。需要同时指出的未胜出项是角色识别与说话人识别的改进幅度相对小,且两版误差棒有重叠,说明人物相关关联仍是弱项。像素不能精确读出具体数值,复述时不应硬写小数,只能讲方向与相对幅度。

把客观结果放回管线依赖中理解:排序与识别变好了,意味着剧本中的顺序与文字更可靠,下游合成听到的剧本噪声更小。但角色与说话人关联仍有较大误差,意味着即使文字全对,仍可能把句子安给错误角色。这解释了为什么还需要主观评价来检验错误是否可被人耳察觉,以及人工校正剧本能带来多少增益。

自动剧本与人工剧本的听感差距有多大?

主观评价要回答的核心反证是:如果把理解错误全部用人工校正掉,听感能提高多少。如果提高很大,说明瓶颈在理解;如果几乎不提高,说明瓶颈在合成。原文用人工加合成作为半自动对照,正好承担这个角色。

看图路径: 1. 先确认横轴三个条件为自动管线、人工校正加合成与真人演绎,纵轴为平均意见分;2. 对比左侧两根柱高度接近而右侧真人柱明显更高,确认自动与半自动差距小而与真人差距大;3. 观察每根柱上的误差线长度,确认主观打分个体差异较大

原论文 Figure 4:Subjective evaluation results of three conditions.

论文图 3。原论文 Figure 4:“Subjective evaluation results of three conditions.”。

从可见柱形看,真人演绎约为 4.0 分,而自动管线加合成与人工加合成都在 2.5 分左右,两者听感接近,真人与合成条件之间仍有明显差距。原文的判断是自动检测理解管线对有声漫画生成是有效的,因为自动与半自动相当,同时进一步改进合成有望提升整体质量。复述时应保留限定:有效是指理解部分已不是主观差距的主要来源,而不是说系统已达到真人水平。

下表把主观协议与关键数字整理成第二张有叙事闭环的表,阅读时先确认 3 个条件是否走同一合成器与同一量表,再看数字支持什么判断。表前提出的问题是:在相同听题与量表下,自动、半自动与真人各得多少分,差距指向哪个模块。

语音条件剧本来源与合成器评价量表与样本参与者与任务量整体印象关键数字
v2 加合成v2 自动剧本加提示语音合成五点量表问整体印象150 人每人 7 格约 2.5 分左右
人工加合成人工校正剧本加同款合成五点量表问整体印象150 人每人 7 格共 21 样本约 2.5 分左右
真人演绎MangaVox 真人表演语音五点量表问整体印象同样 40 页未见页面约 4.0 分左右

表后要讲清代价与限制。自动与人工相当是一个积极信号,但它也意味着即使剧本全对,合成器仍与真人有约 1.5 分的差距。误差线较长说明不同听众与不同页面差异大,平均值不能推广到每一页都成立。原文未报告误判率、延迟或成本,也未做统计显著性说明,因此不能承诺理解模块改进了延迟或降低了全部生产成本。

哪些边界没有被测到?

首先是人物链路的边界。客观图中角色识别与说话人识别的改进较小,说明在人物外观变化大、遮挡多或一格多人说话时,系统仍可能认错人与分错台词。主观评价每人只听 7 格,难以覆盖长对话与跨页人物一致性,实际部署中同一角色跨页声音是否一致仍待验证。

其次是风格控制的边界。情感只有 8 个类别,提示也只有一句固定英文模板。真实漫画中的语气是连续变化的,还受关系、场景与剧情铺垫影响。用单一类别词加清晰度描述可能不足以表达讽刺、忍耐或由悲转怒等复杂表演。原文把更好提示设计与角色声音合成作为未来工作,正好对应这一缺口。

第三是资源与可运行性的边界。原文没有给出训练资源、推理开销、输出时长与实际延迟,也没有说明代码、模型或数据当前是否可公开。资源状态证据显示未发现可验证的公开资源,因此复述时不得声称代码或权重已公开。缺少这些信息时,不应推断系统已可低成本实时部署。

要复现这条管线先做什么?

复现的第一步是准备参考与真值。按原文交代,在推理前为每个角色存好姓名与脸图对,用于比对。客观复现需要漫画 109 及其标注与漫画声音数据的对应标注,主观复现需要按每标题 5 页未见过且包含主要角色的方式选出 40 页,并招募足够听众按五点量表评价整体印象。

第二步是搭通两个版本的可运行对照。第一版用漫画转写加文本识别组合,第二版用更新的组合,语音侧用提示语音合成模型并在约 9 小时漫画声音数据上做日语微调,视觉语言模型用于估计 8 类情感并生成固定英文提示。复现时应记录检测阈值、匹配方法、语音微调超参数与解码设置,因为原文未报告这些细节,缺项需要自己补实验日志。

第三步是先跑客观七项指标确认选第二版,再跑 3 种语音条件的主观对比。关键核对点是剧本文件是否包含文本、说话人与顺序,提示是否同时包含角色名与情感,以及合成是否逐句按顺序拼接。何时值得尝试这条路线:如果已有漫画标注与少量对齐语音,且能接受先用人工校正剧本做半自动生产,这条先理解后合成的路线是合适的。如果目标是完全还原真人演绎,还需补上更大规模语音训练与更细的风格建模验证。

这篇工作留下了什么可带走的判断?

把全文压缩成可复述的方法:页图像进入检测得到位置,进入理解得到顺序、文字、人物与情感提示,写入剧本文件,再由提示语音合成逐句生成并按序拼接。证据最强的一段是第二版在文本排序与识别上明显优于第一版,以及自动剧本加合成在主观上与人工校正剧本加合成接近。主要代价是合成与真人仍有明显差距,人物关联仍是相对弱项。

对初学者而言,最容易误解的是把平均意见分当成全部真相。约 2.5 分与约 4.0 分的差距指向合成器,而自动与人工相当指向理解管线已可用,但这只在 40 页与 150 人的条件下成立,且误差线显示个体差异大。另一个误解是把自动指标的全面优胜当成每页都优胜,总体趋势不等于每组每步都成立。

后续验证应补三项:更大样本与跨页一致性的主观评价,更细粒度的情感与说话人控制对照,以及训练与推理成本的实际测量。只有补上这些,才能判断这条路线在更多漫画标题与真实生产流程中是否成立。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总