📄 十六种乡音一张卷:ChinaVoices 如何让方言识别与转写同场可比
英文题目:Summary of the ChinaVoices Challenge 2026: Data, Tasks, Baseline, and Methods
一句话:ChinaVoices 为 16 类中文方言建立辨识与识别共享音频的统一评测,用三级说话人无关划分与隐藏集复核给出可比起点,头部受限系统达到 83.19% 辨识准确率与 11.08% 转写字错率,代价是数据组合不受控而难以分离数据与方法增益。
标签:#语音识别 | #参数高效微调 | #低资源 | #基准测试
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Yujie Liao:机构信息未在 arXiv HTML 中可靠披露
- Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
- Shuiyuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Liumeng Xue:School of Intelligence Science and Technology, Nanjing University
- Hexin Liu:Nanyang Technological University
- Xian Shi:Independent Researcher
- Jie Hu:Beijing Huiting Technology Co., Ltd.
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
💬 毒舌点评
亮点在于为长期各自为战的中文方言评测提供了统一的16方言双任务平台与隐藏集复核流程,分析扎实且对工业界有直接参考价值。短板在于科学增量有限,基线偏弱且未控制训练资源变量,导致排行榜更多反映工程堆料而非可归因的方法突破。
📌 核心摘要
本文要解决中文多方言处理缺乏统一可复现评测平台的问题,覆盖16类方言的方言辨识与方言语音识别双任务。挑战设计采用参考集加公开评测集加隐藏评测集的三级说话人无关划分,配以受限数据赛道与开放数据赛道,并以Qwen3-ASR-1.7B为统一生成式基线同时输出方言标签与转写文本。与已有分散语料评测相比,新意在于统一任务定义与宏平均指标、强制单主模型处理全方言、以及对头部系统做合规复现与隐藏集独立验证。最能支撑结论的头部结果是受限赛道最佳系统达到83.19%宏平均准确率与11.08%宏平均字错率,相对基线提升显著且头部顺序在隐藏集上保持稳定。实际意义是为低资源方言建模提供了可对比的起点与困难方言清单。主要局限是资源组合不受控、基线竞争力不足、难以分离数据增益与方法增益。
🔗 开源与复现资源
- 代码: https://github.com/ASLP-lab/ChinaVoices-Challenge
- 模型权重: 论文中未提及
- 数据集: 论文中未提及独立下载链接,参考集与公开评测集音频与清单经官网与仓库发布,隐藏评测集未发布
- Demo: 论文中未提及
- 复现材料: 数据清单,训练配置,复现脚本位于 https://github.com/ASLP-lab/ChinaVoices-Challenge 。完整挑战信息发布于 https://aslp-lab.github.io/ChinaVoices-Challenge/
- 论文中引用的开源项目: 提及 ms-swift,LoRA,Qwen3-ASR-1.7B,FireRedASR2-AED,SeedVC,未给出上述项目链接
- 资源可达性验证:code=temporarily_unreachable;reproduction=temporarily_unreachable;reproduction=available(HTTP 200)
🧭 深度解读
普通话很顺,一到老家话就翻车:难的到底是什么
想象你做了一个会议转写助手,在北京办公室里对着标准普通话几乎零失误。可一旦参会者换成潮汕、客家或闽南口音,屏幕上立刻冒出满屏错字。
连这人说的是哪里的方言都猜不准,这种翻车每天都在真实会议室上演。对刚入门的同学,先把两个动作分开。
方言辨识像是认口音,听一句话判断它属于十六选一中的哪一类。它只输出标签,不输出内容。
方言语音识别像是做听写,不管哪种口音都要把内容逐字写对。它输出的是汉字序列,错一个字就算误差。
一个反直觉的事实是,认出口音不等于能听写,后文吴语与南京话会反复敲打这一点。更麻烦的是过去各自为战,不同论文用不同的方言清单与测试集。
数字之间无法直接比较,工业界想选型无从下手。学术界想追踪进展,也缺一张统一的考卷。
前人把路铺到了哪里,这张卷子又站在哪一站
辨识这条线早期靠瓶颈特征与深度声学模型学区分性表示。白话说就是先把声音压成紧凑向量再分类,看重口音细节。
近年转向借用预训练语音编码器的中间层表示、方言嵌入与多层特征融合。原因是中间层保留更多口音细节,顶层反而更偏语义。
识别这条线则靠语料与模型双轮驱动,普通话有 AISHELL 系列与 WenetSpeech 打底。方言侧有 KeSpeech 与 WenetSpeech 系列等资源,分别覆盖客家、粤语与吴语等类别。
模型侧则有 FireRedASR2 与 Qwen3-ASR 等新起点,再加上混合专家与参数高效微调等适配手段。但论文直言,这些进展拼不出可比性。
方言清单不一、训练资源不一、评测集不一,直接比较几乎不可能。ChinaVoices 的位置不是再提一个更大模型,而是做平台型工作。
同一段音频,两道考题:任务与赛道如何咬合
挑战把两道题钉在同一段音频上,16 个官方标签贯穿全文。其中包括粤语、闽南、客家与潮汕等类别,覆盖南北主要方言群。
其中 shan1xi 指山西、shan3xi 指陕西,这是初学者最易混淆的 1 对。记住数字区分即可,1 是山西,3 是陕西。
每道题各开两条赛道,于是形成四榜。受限赛道只允许参考集加批准公开语料与公开预训练模型。
它决定官方名次,强调可追溯与可复现。开放赛道还允许合法自采与内部数据,只供参考看上限。
多方言辨识 × 多方言语音识别: 多方言辨识负责回答这句话是 16 种方言中的哪一种,只输出 1 个类别标签,考验的是口音身份线索的区分度;多方言语音识别负责把这句话的内容一字不差写出来,考验的是词汇与发音知识的覆盖度。二者要搭配,是因为同一段潮汕话音频既携带身份信息也携带语义信息,共享评测音频才能看出身份线索显著是否等于可转写,组合后多解决了一个单任务看不到的问题:吴语易辨识却难转写、南京话难辨识却易转写这类分化。
两赛道都要求离线单主模型处理全部 16 类。不许为每种方言各训一个来作弊,这是统一建模能力的硬约束。
赛道的另一重咬合在计分规则,公开评测集决定公开榜单。但官方名次还要过合规审查与隐藏集验证。
三级数据、统一基线与宏平均:平台的全景图
把平台想象成一条流水线,音频输入,先经统一评测脚本做文本归一化与编辑对齐。再输出宏平均指标,最后叠加系统报告审查与隐藏集复测来确认成绩。
数据层总规模约 320 小时,按每方言参考集约 3 小时组织。公开集约 7 小时,隐藏集约 10 小时,三者说话人严格不重叠。
每条语音都有人工产生并质检的转写,保证真值可靠。参考集发布音频标签与转写,可用作训练。
公开与隐藏集仅发布或完全不发布音频,并明确禁止拿它们做训练与伪标签。受限赛道另有许可清单,允许组合但要求来源可追溯。
宏平均准确率 × 宏平均字错率: 宏平均准确率负责给 16 个方言每类先算 1 次辨识对错率再平均,宏平均字错率负责给每类先算 1 次替换删除插入总和除以总字数再平均。二者要搭配,是因为挑战刻意平等对待低资源方言,若用微平均,大方言的样本量会淹没客家话与潮汕话的困难,组合后多解决的是公平性问题:让瓶颈方言的失败无法被头部方言的高分稀释。
只是不强制同一混合,这为后文的归因困难埋下伏笔。统一口径让不同队伍终于站在同一条起跑线上。
赛道划分与统一基线:公平和上限如何兼顾
基线选用 Qwen3-ASR-1.7B 经 ms-swift 微调,走统一条件生成路线。音频编码器提声学表征并冻结,语言模型侧以低秩自适应适配。
它先生成方言标签再经分隔符生成转写,1 次解码同时支撑双任务。这种设计让单个检查点同时产出辨识标签与识别文本。
目标形如先写标签再接分隔符再写文本,解码标签部分用于辨识。分隔符后文本用于识别,分工清晰且易于评测。
基线在公开集上达到 53.62% 准确率与 18.10% 字错率。它成为后文所有提升幅度的共同起点,绝对值并不强。
受限数据赛道 × 开放数据赛道: 受限数据赛道负责在许可清单内约束可用语料与预训练模型并决定官方名次,追求可追溯与可复现;开放数据赛道负责允许合法自采与内部数据去探索性能上限,只供参考。二者要搭配,是因为只有限制会看不到天花板,只开放又分不清是数据堆料还是方法突破,组合后多解决的是归因问题,尽管本次结果显示开放并未一致带来提升,反而暴露了数据组合不受控的局限。
适合做参照系,而非性能天花板。受限与开放的对照让上限探索与公平竞争得以并存。
指标拆解上:辨识的准确率在平均什么
辨识侧先对第 k 类算单类准确率,分子是该类判对的条数。分母是该类总条数,再乘以 100 分之 100,这是最局部的正确率。
\[\mathrm{ACC}_{k}=\frac{C_{k}}{N_{k}}\times 100\%.\]官方成绩不是把所有句子混在一起算总对错。而是把 16 类的准确率再平均 1 次,这就是宏平均。
\[\mathrm{ACC}_{\mathrm{macro}}=\frac{1}{K}\sum_{k=1}^{K}\mathrm{ACC}_{k},\qquad K=16.\]每种方言权重相等,低资源小方言不会被大方言淹没。这种平均方式直接决定了备赛策略,想刷总分,必须啃下硬骨头。
音频编码器 × 低秩自适应: 音频编码器负责把波形变成声学表征并在基线中保持冻结,守住通用语音知识不被小方言集带偏;低秩自适应负责只在语言模型侧加少量可训练低秩矩阵去学习方言标签与转写文本的生成偏好。二者要搭配,是因为全量微调 1.7B 模型既贵又易过拟合,冻结声学侧加适配语言侧能以小代价实现统一双任务,组合后多解决的是低资源下统一双任务的成本问题,1 次解码先吐标签再经分隔符吐文本。
后文瓶颈集中的结论,正是从这个公式里长出来的。冻结声学侧加适配语言侧也与低资源目标相互呼应。
指标拆解下:识别的字错率在数什么
识别侧对第 k 类先数真值总字数,再数最优编辑对齐后的替换数。删除与插入数也一并计入,三者相加除以总字数。
替换是听错字,删除是漏字,插入是多吐字。理解三者的分工,才能读懂后文的误差构成。
\[\mathrm{CER}_{k}=\frac{S_{k}+D_{k}+I_{k}}{M_{k}}\times 100\%.\]同样地,官方字错率也是 16 类先各算再平均。越低越好,官方脚本统一文本归一化与对齐。
\[\mathrm{CER}_{\mathrm{macro}}=\frac{1}{K}\sum_{k=1}^{K}\mathrm{CER}_{k},\qquad K=16.\]标点与数字处理不再各说各话,跨队比较才有意义。理解这个公式才能看懂替换与删除的分化都藏在哪里。
基线与头部系统到底怎么训,哪些细节论文没给
基线的训练策略写得相对完整,经 ms-swift 做有监督微调。它冻结编码器与对齐器,仅更新语言模型侧低秩自适应。
1 次生成同时监督标签与转写文本,训练合并批准公开语料与参考集内部分割。但学习率、热身与批量大小等关键超参数,论文均未说明。
低秩的秩与层数配置同样缺失,复现时只能自行摸索。头部辨识呈现 3 条分岔,scy919 用双编码器抽互补中间层特征。
再喂给后端分类器,强调表征互补。Optima 用多层特征并联合字符级 CTC 与方言族辅助分类,再做多层融合。
zenava.ai 则用低秩自适应大模型,把辨识写成生成式类别编码。头部识别则集体押注同一基座,再在流水线拉开差距。
数据划分、评测协议与复核:这张卷子怎么防作弊
理解实验先看 3 级划分,参考集、公开集、隐藏集三者说话人严格不重叠。这防止模型靠记住嗓音投机,是低资源评测的生命线。
否则辨识很容易退化成说话人识别,参考集可训,公开与隐藏集禁训禁伪标签。违规即失合规资格,规则写得非常明确。
评测协议上,两任务共享同一评测音频。分别用宏平均准确率与宏平均字错率衡量,公开榜由公开集决定。
受限榜决定官方名次,开放榜仅供参考。下表根据论文正文整理数据构成与赛道规则,统一了时长与用途口径。
| 数据集赛道 | 每方言时长 | 公开内容 | 可否用于训练 | 指标与用途 |
|---|---|---|---|---|
| Reference | 约 3 小时 | 音频标签转写 | 可 | 训练验证 |
| Open Eval | 约 7 小时 | 仅音频 | 否 | 公开榜 |
| Hidden Eval | 约 10 小时 | 不发布 | 否 | 复核前三 |
| Restricted | 许可清单组合 | 需公开来源 | 清单内可组合 | 决定名次 |
| Open | 更广合法数据 | 需披露过程 | 允许自采 | 仅供参考 |
该表的净收益是把分散在正文的时长与权限收拢到一处。初学者可一眼看清哪份数据能碰,哪份碰了即违规。
一个失败项是受限赛道不强制同一混合,两队都合规却用了不同语料。因此该表不能支持数据量与成绩的因果结论,只能支持合规性判断。
隐藏集仅复核头部且两集未经难度校准,所以也不能从公开与隐藏的分差推断整体泛化。这些边界决定了后文只能谈头部稳定性。
头部提升有多大,隐藏集是否还站得住
先看辨识榜要回答的问题,相对统一基线头部提升多少。统一条件是十六方言宏平均,辨识越高越好,基线为单检查点成绩。
基线 53.62% 并不强,但口径统一,适合衡量净提升。隐藏集排序是否稳定,则要看未公开集上的独立复测。
| Track | Rank | Team | Open Eval. ACC (%) | Hidden Eval. ACC (%) |
|---|---|---|---|---|
| Restricted-data | 1 | scy919 | 83.19 | 79.75 |
| Restricted-data | 2 | Optima | 78.47 | 73.08 |
| Restricted-data | 3 | zenava.ai | 73.42 | 69.54 |
| Restricted-data | – | Unified baseline | 53.62 | – |
受限辨识榜 8 个合规系统全部超过基线,最优相对基线提升 29.57 个百分点。但首尾极差仍达 27.07 个百分点,头部呈明显梯度。
开放最优为 80.65%,反而低于受限最优,说明堆数据并未自动获胜。再看识别榜要回答的问题,头部是否更集中,开放数据是否一致带来增益。
| Track | Rank | Team | Open Eval. CER (%) | Hidden Eval. CER (%) |
|---|---|---|---|---|
| Restricted-data | 1 | TeleASR | 11.08 | 10.70 |
| Restricted-data | 2 | Mlslabs | 11.22 | 11.18 |
| Restricted-data | 3 | Kyoto-Tsinghua Team | 11.75 | 11.68 |
| Restricted-data | – | Unified baseline | 18.10 | – |
受限识别榜 11 个合规系统中 9 个超过基线,最优降到 11.08%。相对错误下降 38.80%,前三极差仅 0.67 个百分点。
整体比辨识头部更集中,隐藏集上两任务前三排序均不变。但两集未经难度校准,仅能证明头部稳定。
替换错误 × 删除错误: 替换错误负责记录把一个字听成另一个字的混淆,删除错误负责记录把该有的字漏掉的缺失。二者要搭配,是因为只看总字错率会掩盖不同系统的犯错风格,TeleASR 替换率高于 Mlslabs 却靠更低删除率反超的案例正说明此点,组合后多解决的是诊断问题:困难方言的高字错率主要由替换累积驱动,而吴语与客家话上删除率的系统差异则指向对短句与发音覆盖的不同处理。
不能比较两任务整体泛化,这正是论文反复强调的证据边界。毫厘之间的差距也不宜直接解读为方法突破。
哪些方言最难,辨识侧的瓶颈在哪里
这组比较要回答,困难方言是否集中在少数类别。统一条件是受限前三在公开集上的单方言准确率,均值来自未舍入分数。
基线不再是主角,主角是三强之间的共性与分歧。均值低代表共性困难,分歧大代表系统特异性。
| Challenge label | scy919 | Optima | zenava.ai | Mean ACC |
|---|---|---|---|---|
| cantonese | 97.10 | 99.98 | 98.77 | 98.62 |
| dongbei | 99.39 | 99.69 | 99.35 | 99.48 |
| chaoshan | 68.53 | 72.44 | 60.30 | 67.09 |
| kejia | 61.90 | 23.57 | 44.27 | 43.25 |
| nanjing | 86.17 | 70.68 | 44.40 | 67.08 |
| wuyu | 91.68 | 84.83 | 86.19 | 87.57 |
东北话与粤语均值接近满分,客家话均值仅 43.25%。潮汕与南京也在 67% 附近,瓶颈集中在少数类别。
这正是宏平均设计想要暴露的问题,三系统在闽南与客家上分歧显著。说明难类别仍有互补空间,低均值与大分歧要分开解读。
要看清混淆从哪里来,此处必须看混淆矩阵图。重点不是对角线的正确率,而是被遮蔽对角后剩下的非对角深色格。
看图路径: 1. 先确认横轴为预测方言、纵轴为真实方言,对角线已被遮蔽,只读非对角深色格;2. 再找到颜色最深的三格:闽南语到潮汕话、客家话到潮汕话与客家话到南昌话;3. 接着对比对称位置数字差异,判断混淆是否单向更严重;4. 最后观察长沙到武汉、南京到安徽等离散亮点的数值与颜色

论文图 1。原论文 Figure 1::“Mean row-normalized confusion matrix (%) of the official top-three multi-dialect identification systems.”。
图中横轴为预测方言、纵轴为真实方言,对角已遮蔽。右侧色条从 0 到 25% 的蓝色深浅让流向一目了然,仅标注不低于 5.00% 的格子。图中可见 minnan 行 chaoshan 列为 19.90,kejia 行 chaoshan 列为 16.93,kejia 行 nanchang 列为 19.73,changsha 行 wuhan 列为 18.55,nanjing 行 anhui 列为 14.86,均呈现明显不对称,支持加强类别边界建模的判断。
转写侧的困难分布与误差构成:替换为何是主敌
转写侧要回答,哪些方言最难转写。统一条件同样是受限前三公开集均值,榜单用宏平均。此处三分量用微平均,口径差异需留意。
不可直接把三分量相减去凑宏平均,两种平均的分母完全不同。先看方言级字错率,再看误差构成。
| Challenge label | TeleASR | Mlslabs | Kyoto-Tsinghua Team | Mean CER |
|---|---|---|---|---|
| cantonese | 7.60 | 7.09 | 6.89 | 7.19 |
| dongbei | 5.70 | 4.92 | 5.10 | 5.24 |
| chaoshan | 18.39 | 23.99 | 23.28 | 21.89 |
| kejia | 26.98 | 29.28 | 36.77 | 31.01 |
| nanjing | 7.67 | 7.35 | 7.05 | 7.36 |
| wuyu | 14.48 | 21.08 | 16.55 | 17.37 |
客家话均值高达 31.01%,潮汕 21.89%,吴语 17.37%。而东北与南京均在 7% 以下,客家双难、潮汕次难。
但吴语高辨识配高误差、南京低辨识配低误差,构成鲜明反例。十六方言两任务难度呈强负关联,但为不同系统均值间的描述性关联。
| System | Substitution | Deletion | Insertion | Micro-averaged CER |
|---|---|---|---|---|
| TeleASR | 9.74 | 0.81 | 0.61 | 11.17 |
| Mlslabs | 9.38 | 1.29 | 0.63 | 11.30 |
| Kyoto-Tsinghua Team | 9.79 | 1.41 | 0.62 | 11.82 |
替换占全部编辑错误的 82.80% 到 87.30%,是绝对主力。插入率仅 0.61% 到 0.63% 且三队几乎相同,不是名次差异来源。
删除率分化更大,TeleASR 以 0.81% 最低。尽管其替换率高于 Mlslabs,仍靠更少漏字领先。
这说明相近总字错率可来自不同误差组合,困难方言高字错率主要由替换累积驱动。该表不能证明某种增强单独有效,只能支持联合优化的判断。
基座与流水线:同一起点为何跑出不同终点
基座比较要回答,强基座是否直接锁定名次。统一条件是受限榜公开集字错率,比较同基座内的极差与方言级最优点分布。
用 FireRedASR2-AED 的五系统集中在 11.08% 到 13.92%。中位 11.75%,前六中占五席,起点优势非常明显。
但同基座首尾仍差 2.84 个百分点,且前三的方言级最优点分散。TeleASR 与 Mlslabs 等分别在 5 个、7 个与 4 个方言上最优。
这说明训练流水线对不同方言影响不同,归一化与采样改变了方言偏好。用 Qwen3-ASR 的系统分布在 13.48% 到 16.36%,同样内部变异显著。
辨识侧冻结双编码器、深度多目标适配与低秩自适应均有高排名代表。未见规模与名次的单调关系,论文结论谨慎而克制。
这张卷子的边界:什么还不能下结论
作者自己承认的局限很坦率,同队跨赛道表现混合。当前结果无法分离更广训练资源的独立增益,这是原文明示的边界。
未来需扩展真实场景覆盖、细化转写规范与统一报告口径。并提供更全面的方言级统计,这意味着开放赛道 7.42% 的数字。
更适合看作可达上限,而非外部数据的平均收益。审稿视角的问题更值得品味,受限赛道只控许可清单。
而不强制同一混合,榜单差异可能主要来自数据覆盖而非方法。论文也未做显著性检验与难度校准,头部 0.13 个百分点的差距是否显著尚不能判断。
初学者引用时要留有余地,不可把微小差距说成方法突破。基线只微调语言模型侧而冻结声学侧,竞争力可能被低估。
想复现与参赛:去哪里找什么,缺什么要自己补
可复现性上,论文给出了基线骨架。Qwen3-ASR-1.7B 经 ms-swift 微调,冻结编码器加低秩自适应。
评测脚本统一归一化与对齐,数据清单已发布。完整信息在官网,复现材料称在代码仓库。
但学习率批量优化器轮数与低秩秩数层数 1 概未说明,头部模型配置同样缺失。硬件数量时长也未公开,照抄必定卡在超参数上。
这是工程复现最常见的断点,需要自行网格搜索补齐。资源可达性方面,论文未发布核心代码权重或独立数据下载链接。
参考集与公开集音频与清单经官网与仓库发布,隐藏集不发布。实操建议是先跑通官方评测脚本与基线单检查点的 53.62% 与 18.10%。
再在受限清单内做小混合实验,并记录来源。做难方言过采样时同步记录三分量,避免只盯总字错率。
一句话收束:统一考卷的价值与下一张卷子该考什么
回到开篇的会议室,有了 ChinaVoices,选型者终于可以在同一张卷子上比较认口音与做听写。知道客家与潮汕是双难瓶颈,知道吴语与南京话是分化预警。
知道替换是主敌而删除决定了毫厘之间的名次,这种困难清单与误差构成。比榜首数字更耐用,可直接指导采样与对齐优化。
但这张卷子的科学增量有限,基线偏弱且资源变量未控。榜单更多映照工程水位而非可归因突破,这是毒舌点评一针见血之处。
对刚进入方向的你,最好的使用方式是把它当起点。用它校准多层特征融合,检验难负例构造与辅助对齐是否真降低了困难方言的替换率。
而不是只在公开榜刷零点几个点,下一张卷子该考什么,论文已点题。更真实的场景噪声、更细的转写规范与更统一的报告口径,若再加上固定混合的对照赛道。
中文方言处理才能从可比走向可解释,这正是平台型工作最值得期待的下一步。
📎 论文与评分元数据
标签:#语音识别 | #参数高效微调 | #低资源 | #基准测试
6.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
✅ 6.9/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音识别 | #LoRA | #参数高效微调 | #低资源 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.2/2):统一 16 方言双任务共享音频与宏平均指标,强制单主模型处理全方言,三级划分加受限与开放双赛道加隐藏集复核构成可比竞赛范式,组合具有系统级新意但无单一模型突破。
技术严谨性 (1.2/1.5):辨识与识别公式明确定义 ACC macro 与 CER macro 及文本归一化对齐,未发现明显推导错误且指标表述清楚,三集合说话人不重叠与禁用评测数据构造逻辑自洽。
实验充分性 (1.0/1.5):受限辨识 8 系统与识别 11 系统对比基线提升显著且隐藏集前 3 顺序稳定,方言级难度与误差构成分析充分,但缺显著性检验与难度校准,隐藏分仅前 3 且开放样本少,数据组合不受控削弱归因。
清晰度 (0.8/1):16 标签统一命名 shan1xi 指山西与 shan3xi 指陕西,任务指标与赛道规则分层清晰,表格保留口径与升降方向说明完整,整体易于核对但方言级表格信息密度较高。
影响力 (1.2/1.5):为长期分散的中文方言处理提供 16 方言统一可复现评测起点与困难方言清单,头部达到 83.19% 准确率与 11.08% 字错率并揭示身份线索不等于可转写性,对低资源方言建模有直接指导价值。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):基线给出 Qwen3-ASR-1.7B 经 ms-swift 微调与冻结编码器加 LoRA 适配流程及评测脚本口径,数据清单已发布,但学习率与批量大小与优化器与轮数等关键细节未说明。
工程/实践价值 (1.2/1.5):约 320 小时参考集加公开评测集加隐藏评测集流水线完整,统一评测脚本输出宏平均指标并经报告审查加隐藏集复测确认成绩,形成可直接复用的基准工程产物。