英文题目:MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.1543

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #语音识别 #音频问答 #语音翻译

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Yexing Du:机构信息未能从会议 PDF 纯文本可靠映射
  • Kaiyuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Bihe Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Youcheng Pan:机构信息未能从会议 PDF 纯文本可靠映射
  • Bo Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Liangyu Huo:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiyuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jian Xie:机构信息未能从会议 PDF 纯文本可靠映射
  • Daojing He:机构信息未能从会议 PDF 纯文本可靠映射
  • Yang Xiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Ming Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Bing Qin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该语料输入为带情感的普通话文言朗读,输出覆盖转写、英译、情感描述、开放问答与选择式理解推理,难点在于生僻字与通假字发音、文言歧义、跨朝代跨文体差异与文学情感建模。构建第一步从网络获取公有领域作品与拼音并清洗切分为三十秒内文本片段,为录制提供对齐单元。第二步由二十八名母语志愿者按情感指南录制为人声平行音频,直接形成二万二千条共一百一十九小时语音。第三步以完整篇章为上下文调用DeepSeek-V3.2生成译文与问答,再经三模型交叉过滤并对验证集与测试集人工核验后进入六任务评测。相对已有古典文本基准的关键差异在于坚持人声平行语料、五体裁十一时期三十七类覆盖与统一评测,并引入情感保真度与跨模态一致性指标以刻画情感与模态差距。在MCGA测试集下,Qwen3-Omni-30B-A3B-Instruct的ECF分数为58.4,高于Gemini-3-Flash的54.0。该结论适用边界受限于朗读式普通话古典文本,无法外推至方言吟诵与噪声场景,微调Qwen2.5-Omni-7B使用四块A100硬件训练三轮的配置亦限制复现成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,为什么值得做成语料?

这篇解读的输入是论文正文与官方原图,目标是让刚进入语音与语言交叉方向的研究生能够核对关键做法并复述完整链路,必须保留的信息包括语料规模与构成、6 个语音任务的定义、两项新指标的计算方式、10 个模型的比较条件以及微调配置,输出是 1 篇按学习依赖展开的技术说明。研究的问题是古典汉语文学长期缺少高质量平行语音数据,已有文本基准能考查字词理解,但无法考查听、译、情感与推理是否能在声音通道下成立。

作者把输入定义为真人朗读古典作品的音频,输出则按任务不同分为转写文本、英译文本、情感描述文本、开放答案与选择题选项。语料层面覆盖赋、诗、文、词、曲 5 种体裁与 11 个历史时期,形成 37 种时期体裁组合,共 4497 篇作品与 22000 条过滤后录音,总时长 119 小时。单条音频最长 30 秒,最短 3.5 秒,平均 19.5 秒。录音者是 28 名 18 到 40 岁的母语者,其中男性 13 人女性 15 人,一半是中文专业背景。每段文本至少由 1 男 1 女分别朗读,同一作品的片段交给同一人,以保持风格连续。

录音要求用符合文本情感的语气朗读,可看拼音,保持环境安静。这种设计把文学多样性与说话人多样性同时装进一个可评测的语音集合,后续所有任务都从这个集合派生。 导读下面这张体裁时间轴图时,请先建立朝代与体裁高峰的对应感,再进入任务定义,否则容易把不同文体的难度差异误读为模型差异。

看图路径: 1. 先沿中间竖轴自上而下辨认汉唐宋元明朝代节点;2. 再对照左右两侧赋诗文词曲五种体裁的代表篇目与英译;3. 最后观察各体裁高峰期在时间轴上的错峰分布

原论文 Figure 1:Timeline of the Golden Age for Classical Chinese Literary Genres: Fu (Rhapsody), Shi (Poetry),…

论文图 1。原论文 Figure 1:“Timeline of the Golden Age for Classical Chinese Literary Genres: Fu (Rhapsody), Shi (Poetry), Wen (Prose), Ci (Lyric), and Qu (Song).”。

这张图把赋、诗、文、词、曲放在汉唐宋元明的时间轴上,左侧给出静夜思等诗与念奴娇等词的原文与英译,右侧给出凤求凰与爱莲说等篇目的对照。可以看到诗在唐达到高峰,词在宋达到高峰,曲在元出现,这种错峰解释了后文统计中唐诗与宋词样本最多,也预示了赋的用典密度与曲的晚出稀少会带来不同的识别与理解难度。初学者应把该图当作采样偏差的背景,而不是模型结构的说明。

已有中文文化评测走了多远,还缺哪一块声音?

同输入同目标的文本评测已经不少。论文列出的对照包括侧重古文语言理解的大规模基准,侧重更广文化语境的评测,以及侧重深层文化认知与经典诗文理解的基准。这些工作的输入是文本,目标是考查字词、句法、常识与推理,监督来自人工编写或模型生成的问答,运行阶段是纯文本推理。它们证明了文本大模型在古典文学上已有可观积累,但都没有提供与文本逐段对齐的朗读音频。

同为多模态但不同模态的对照包括美食文化图文问答、图像隐含意义理解、甲骨文 decipher、诗画生成与多模态古典基准。这些工作把图像引入文化评测,考查视觉与文本的联合理解,输入是图文对,目标各不相同。论文指出其中很少包含古典文学的平行语音,因此听觉通道的转写、翻译与情感仍是空白。MCGA 的定位不是替代这些文本或图文基准,而是补上语音加文本的平行层,并用同一批文本同时支撑语音任务与文本任务,以便计算跨模态一致性。

学习时应把类别差异当作条件差异,不把文本基准的高分直接当作语音任务也应高分的依据。

要解决的具体问题是什么,难在哪里?

具体问题是为多模态大模型提供一个可训练可评测的古典文学语音基准,要求同一段朗读能同时考查听准、译雅、情感准、问答准与推理稳。难点有 3 层。第一层是语言层,古典汉语存在生僻字、通假字、语气词与密集用典,发音与现代汉语不完全对应,自动语音识别容易在赋等体裁上出错。第二层是情感层,朗读要求带感情,但情感描述需要同时说出是谁在读、整体基调是什么、每句如何拆解,开放生成式评价本身就难,且容易出现幻觉。

第 3 层是知识层,理解六朝覆灭原因与讽刺南宋这类问题需要把文本线索与朝代知识结合,语音输入又多了一层听觉噪声,模型可能听对了但答错,也可能没听对却蒙对。论文用 6 个语音任务把难度分层,用 4 个文本任务作为上界参照,再用两个新指标把情感质量与模态差距量化,这就是问题形式化的完整思路。

六个语音任务加四个文本任务如何组织成一张考卷?

方法全景可以沿着陈亮念奴娇登多景楼这一个样本走完全程。输入是一段青年男声朗读,内容为危楼还望等四句。表示层是音频波形与对应文本加拼音。组件层按任务分叉。自动语音识别要求把中文语音转写为文本,输出即四句原文。

语音到文本翻译要求把中文语音译为英文,输出为高塔远望等英译。语音情感描述要求用中文按固定格式输出,第一行写声音画像,第二行写全文基调,随后每行用原文竖线情感分析逐句拆解。口语问答是开放式事实问答,例如这首词作者是谁,答案为陈亮。语音理解是选择题,例如作者认为六朝覆灭原因是门户私计,选项包括危楼、天、争雄与门户私计,答案为 D。语音推理是需要外部知识的选择题,例如借六朝讽刺哪个朝代,答案为南宋。

平行文本任务则把同一问题换成文本输入,包括机器翻译、问答、语言理解与语言推理,用于计算跨模态一致性。 要理解任务分工,先看下图如何把同一首词同时变成 6 种考法,再回头对照指标方向。

看图路径: 1. 先看左右两栏六个语音任务的指令与输出格式差异;2. 再聚焦中间陈亮词的原文英译对照与波形位置;3. 最后比较开放问答与选择题在答案形态上的不同

原论文 Figure 2:Examples from the MCGA Corpus.

论文图 2。原论文 Figure 2:“Examples from the MCGA Corpus. The corpus covers six core speech tasks (ASR, S2TT, SEC, SQA, SU, SR).”。

该图中央是山水楼阁插画与波形,左右两栏分别列出 6 个任务的指令与示例输出。可以看到左侧三项是生成式任务,右侧三项是问答与选择,中央文本英译对照是所有任务共享的真值来源。初学者应注意验证集与测试集的 6 个任务并非完全平行,因为部分问答对在过滤中被移除,所以跨任务比较时要回到各自划分,不能假设同一条音频在 6 个任务中都有标注。

两个新指标各自分工是什么,如何计算?

组合机制需要先分清两个新术语。白话说,情感描述保真度是给情感作文打分的方法,英文为 Emotion Caption Fidelity,缩写为 ECF。跨模态一致性是衡量同一模型听与读是否一致的方法,英文为 Cross-Modal Consistency,缩写为 CMC。前者管生成质量,后者管模态差距。

自动语音识别 × 语音情感描述: 自动语音识别负责把声音逐字转写为原文,解决听得准的问题,语音情感描述则要在转写基础上进一步判断说话人特征与逐句情感意境,解决听得懂感情的问题,二者搭配是因为同一段朗读既是字面载体又是情感载体,组合后才能从字准走向情准。

语音理解 × 语音推理: 语音理解负责从语音中直接选择与文本内容对应的答案,依赖语音内信息即可作答,语音推理则要求结合外部历史知识进行跨句或跨朝代推断,二者搭配的原因是前者检验听觉 grounding,后者检验知识调用,组合后才能区分是没听清还是不会推理。

情感描述保真度 × 跨模态一致性: 情感描述保真度负责评价情感描述文本的质量,分人物、全局、逐句 3 层打分,跨模态一致性负责比较同一问题在语音输入与文本输入下的得分比值,前者管单模态下情感写得好不好,后者管双模态下答案稳不稳定,搭配后才能同时看到生成质量与模态差距。

口语问答 × 文本问答: 口语问答以语音为输入要求开放式回答作者篇名等事实,文本问答以对应文本为输入回答同样问题,前者多了语音识别与听觉理解的误差链,后者可视为文本上界,二者搭配计算比值,才能量化听觉通道带来的损失而不是笼统说模型不行。

翻译美感 × 神经机器翻译评价: 神经机器翻译评价侧重语义等价与自动相似度,翻译美感则进一步要求形之美、意之美、音之美,分别看形式、含义与韵律,前者保证译得对,后者保证译得雅,二者在古典诗词翻译中搭配,才能解释为何自动分尚可但人工美感仍不足。

ECF 分为三部分。人物识别记为 ECF-P,范围 0 到 2,从 2 分起扣,每错一个年龄或性别属性扣 1 分。全局情感基调记为 ECF-G,范围 0 到 3,看描述的丰富与准确,若情感类别或语境判错则记 0 分。逐句情感保真记为 ECF-F,范围 0 到 5,逐句检查转写与分析,每处情感错误扣 1 分,出现幻觉或无关内容记 0 分。三者相加得到 100 分制前的原始分,论文在展示时归一化到 100 分尺度,用大模型打分实现。

CMC 的符号与输入如下。分子是语音任务得分,分母是对应文本任务得分,3 组分别为口语问答对文本问答、语音理解对语言理解、语音推理对语言推理。计算目标是 3 组比值的平均再乘 100,得到百分比,越高表示语音表现越接近文本上界。原文明确用该比值量化听觉与文本推理的对齐程度。

\[CMC = 1\]

该公式的实现是直接取同一套问题的语音分除以文本分,不做额外加权。初学者不要把 CMC 当作绝对能力分,它是相对保持率,文本分低时即使 CMC 高,绝对语音分也可能不高。

语料是如何从文本变成可训练音频的,没有神经网络训练吗?

本节的训练一词指语料构造与后续微调验证两个过程,语料本身的搭建不训练声学模型,而是做数据采集、生成与质检。文本收集阶段从网络获取已进入公有领域的古典文本与拼音,作者去世超过 150 年,清洗后切分为适合 30 秒内读完的片段。文本任务构造阶段用大模型为每段音频文本生成翻译、情感描述、问答、理解与推理问答,生成时可看到完整文学上下文。文本校验阶段用 3 个大模型做三重验证,未通过的问答对被过滤,测试集与验证集再经人工核验。

音频采集阶段由 28 名志愿者通过专用网站录音,指南要求情感匹配、可看拼音、环境安静、单条 30 秒内、每条至少 1 男 1 女朗读、同一作品交给同一人。音频质检分 2 级,先用两类语音识别模型做双阶段识别,误差大的退回重录,再由 6 名质检志愿者对验证集与测试集打分,去除发音错误或带噪样本。所有录音与质检志愿者均签署劳动与授权协议并获得报酬,最终条目匿名化。 理解这条双路流水线时,可对照下图看文本流与语音流在哪里分开、在哪里汇合。

看图路径: 1. 先沿左侧卷轴到真人录音再到质检的下半路径看语音流;2. 再沿上半路径看大模型生成问答再经模型校验的文本流;3. 最后看右侧成品卷轴如何把音频与六类标注汇合

原论文 Figure 3:MCGA Corpus Construction.

论文图 3。原论文 Figure 3:“MCGA Corpus Construction. Initially com- prising only metadata such as titles, authors, and texts, the MCGA corpus is expanded through human record- ing, LLM generation, and…”。

该图左侧是标题作者文本朝代体裁元数据,向上走是大模型生成再经模型校验的文本标注流,向下走是真人录音再经模型校验与人工重录的语音流,两路在右侧汇合成包含转写、翻译、情感、问答、理解、推理与音频的成品条目。初学者复述时应强调过滤导致各任务样本量不同,以及验证测试集经过人工确认而训练集一致性用识别误差间接验证。

评测了哪些模型,在什么条件下比较才公平?

实验条件按论文交代展开。基线包括 2 个闭源多模态大模型与 8 个开源模型,开源系列涵盖 Qwen 系列、Voxtral 系列、Phi-4 多模态指令版、MiDashengLM 与 Step-Audio-2-mini。所有开源模型用同一推理框架部署,通过接口请求推理,温度设为 0,以减少采样随机性。指标方向为自动语音识别用字错率越低越好,语音翻译与情感描述用大模型打分越高越好,其中翻译还报告神经评价与形意音 3 维美感分,口语问答用 F1 越高越好,语音理解与语音推理用准确率越高越好。为直观比较,翻译与情感的原始分归一化到 100 分。

总分是六项之和,其中语音识别项按 100 减字错率计入。翻译与情感打分调用 deepseek-chat 接口,文本规范化遵循已有语音评测做法。 微调验证用 Qwen2.5-Omni-7B,在 4 张 A100 上用低秩适配训练 3 轮,优化器为 AdamW,学习率 1 乘 10 的负 4 次方,单设备批量 8,梯度累积 4,低秩维度 8,缩放系数 32。框架与推理工具的链接在论文中给出,资源状态显示两个第三方链接当前可用,一个评价工具链接当前可用,初学者可据此确认环境可达性。 看统计图时先确认划分与体裁分布,再谈模型好坏,否则会把样本不均误读为能力差异。

看图路径: 1. 先看左侧环形图中文诗赋词曲各扇区与朝代细分的占比;2. 再看中间朝代体裁交叉表确认唐诗宋词的数量高峰;3. 最后看右侧训练验证测试划分与时长字符统计

原论文 Figure 5:Corpus Statistics. It comprises 22,000 filtered human-recorded speech samples (totaling 119…

论文图 5。原论文 Figure 5:“Corpus Statistics. It comprises 22,000 filtered human-recorded speech samples (totaling 119 hours) and supports 6 downstream tasks.”。

该图左侧环形图显示诗文赋词曲五大扇区再按先秦汉魏晋南北朝隋唐五代宋元明清细分,中间表给出各朝代体裁计数,右侧表给出各任务训练验证测试划分与字符时长统计。可以看到唐诗数量最多,宋词次之,曲因元代短暂而最少。自动语音识别各划分各 1000 条,其余任务因过滤后训练量不同,例如翻译训练 15161 条,情感训练 19347 条,理解与推理训练约 17600 条。音频平均字符 54.7,平均时长 19.5 秒。复现时必须按任务各自划分取数,不能假设 6 个任务的训练集完全平行。

主结果测了什么,谁在什么任务上领先,代价是什么?

主结果要回答的比较问题是,在相同测试集与相同指标下,10 个模型在 6 个语音任务上的绝对表现如何,公平条件是同一 MCGA 测试集与固定温度推理,指标方向如上节所述。下面整理表用原文连续句覆盖关键数字,单位保留原文写法,体裁与任务名称保留原文。

条件指标基线本方法比较对象
119 小时真人录音测试集情感复杂任务分低于 60 分58.4 分最优 Qwen3-Omni 对比阈值
10 模型对比参评模型数2 个闭源8 个开源共 10 个代表性多模态大模型
微调验证训练配置3 轮学习率 1 乘 10 负 4 次方4 卡 A100 批量 8 累积 4

该表说明语料规模与评测广度是结果的前提,最强模型在情感任务上仍未突破 60 分,微调配置是后续提升的起点。表后解释主要收益与代价。

最优开源模型在语音识别、情感描述、口语问答与语音理解上领先,闭源模型在英译美感与中文推理上保持优势,总体开源已接近闭源。但情感与开放问答仍是短板,情感任务需要人物全局逐句 3 层都对,开放问答存在幻觉,选择题有选项提示所以分数更高。代价是翻译美感评价依赖大模型打分,原始 1 到 5 分很少给满分,归一化后仍受评价模型偏好影响,不能当作人工审美。 未胜出项需要就近说明。

GPT-4o-mini-Audio 在情感任务上显著偏低,论文解释为安全策略常拒绝人物与情感分析。Phi-4 与 Voxtral-Mini 在翻译与情感上偏低,说明通用多模态能力不自动迁移到古典文学。任何单项领先都不能推广为全面领先,例如翻译领先的模型不一定情感领先。

体裁、朝代与模态切换会如何改变结论?

论文特有的细节之一是按体裁拆分字错率。比较问题是同一模型在诗辞赋文曲上的听写难度是否一致,公平条件是每种体裁各 200 条共 1000 条测试样本,指标为字错率越低越好。下面整理表用原文可核对的体裁趋势与质量检查结论,数字单位保留原文。

条件指标基线本方法比较对象
分体裁 1000 条测试字错率趋势词最低赋最高诗曲文居中
训练验证测试一致性字错率差距0.1 差距高一致性Qwen3-Omni 验证
录音者构成人数年龄28 人 18 到 40 岁13 男 15 女一半中文专业

表后解释机制。

词的字错率最低,赋 consistently 最难,论文归因于赋的辞藻华丽、用典频繁与语气词密度高。训练验证测试集的字错率差距仅 0.1,支持数据一致性较好,残余误差多来自生僻字与通假字。跨朝代体裁雷达显示最优模型在多数格点上包络最大,但在曲等稀少类别上波动更大,说明样本量与语言年代都会影响泛化。 另一特有细节是开放式与选择题的差距。

同一模型在语音理解与推理上可达 80 分以上,但在开放口语问答上跌至 40 到 50 分区间,说明有选项时推理能力尚可,无选项时事实幻觉严重。跨模态一致性最高的是 Step-Audio-2-mini,表明其语音保持率最好,但其绝对分并非每项第一,因此保持率高不等于绝对能力最强。初学者应区分绝对分与比值,不能用一致性替代能力排名。

哪些边界没有被评测,什么结论还不能下?

论文明确报告的局限有两项。第一,受版权约束,未能纳入与文本音频精确对齐的真实世界图像样本,因此图文声 3 模态对齐仍缺一块。第二,曲体裁晚出且元代短暂,存世作品有限,导致语料中曲的代表性偏低,相关结论的统计力度弱于诗与词。此外,验证或测试集的 6 个任务并非平行,跨任务雷达图的面积比较只能看趋势,不能做严格的逐条配对检验。情感与翻译的大模型打分存在评价模型偏好,未测量误判率、延迟与推理成本,因此不能承诺这些量得到改善。

总体趋势不等于每组每步都成立,例如平均时长 19.5 秒不代表长音频同样稳定。缺失证据不是技术错误,相关性不是因果,初学者在引用时应使用报告显示表达直接结果,用支持表达有限解释,用可能待验证表达推测。

要复现先做什么,需要哪些超参数与信息条件?

复现先做三件事。第一,按任务各自划分取数,自动语音识别与口语问答各有 20000 训练 1000 验证 1000 测试,翻译情感理解推理训练量因过滤而更少,不要混用划分。第二,固定推理条件,开源模型用论文所用推理框架部署,温度设为 0,通过接口请求,翻译与情感调用同一评价接口并归一化到 100 分,语音识别先做文本规范化再算字错率。第三,微调时复用低秩配置,维度 8,缩放 32,训练 3 轮,4 卡,优化器 AdamW,学习率 1 乘 10 负 4 次方,单设备批量 8,梯度累积 4。

关键信息条件包括拼音可看、30 秒切分、每条至少 1 男 1 女朗读、同一作品同一人朗读,这些决定了语音风格的一致性。代码框架与推理工具链接当前可用,语料本身的公开状态应以论文开源声明与实际仓库可达为准,本次只确认第三方工具可达,不对语料下载做超出证据的承诺。还需补的验证包括人工美感复核、长音频稳定性、不同口音与录音设备的泛化,以及评价接口更换后的分数稳定性。

何时值得尝试 MCGA,核心判断是什么?

当研究目标是让模型听懂古典汉语而不仅是读懂时,值得尝试 MCGA。它的价值在于同一批文本同时提供朗读音频与 6 类语音标注,还提供文本上界以计算模态差距,微调已显示出实质增益,说明数据质量足以驱动学习。适用条件是接受曲类偏少、无对齐图像、评价部分依赖大模型打分的现实,并在论文划分下报告字错率、美感分、情感保真度、F1、准确率与跨模态一致性。核心判断是听准已接近可用,听懂情感与开放事实问答仍是瓶颈,选择题高分不应掩盖幻觉问题。

后续工作应补足稀少体裁、引入可控图像对齐、建立更稳定的人工情感评价,并在报告绝对分的同时报告保持率,才能完整回答声音通道到底损失了多少古典理解能力。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总