英文题目:Vietnamese Automatic Speech Recognition: A Revisit
会议身份:
conference:eacl:2026:conference-paper-id:2026.findings-eacl.345
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集 #数据集构建 #语音识别 #强制对齐
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Thi Vu:机构信息未能从会议 PDF 纯文本可靠映射
- Linh The Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Dat Quoc Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
越南语自动语音识别输入为多口音、自发与朗读混杂音频,输出为带标点、大小写和词级时间戳的规范文本,难点在于开源语料转写错误多、格式不统一且缺乏对齐信息。该流水线先采集重采样与清洗,再对无转写音频用双模型互校验补齐转写、对有转写音频用单模型重解码过滤,随后用微调模型恢复标点大小写并经归一化一致性检查保留无改词样本。数字转口语文本后送入WhisperX框架与越南语微调wav2vec2对齐生成音节级时间戳,最后按映射合并回数字形式并合并时间区间。与直接合并原始语料或依赖推理后处理标点的做法不同,该链路把格式恢复与对齐内建于数据端,避免了识别输出数字与对齐所需口语形式之间的失配。在PhoASR测试集下,PhoASR-whisper-small-469h的O-WER为12.46%,低于PhoWhisper-small的33.90%。其结论适用边界限于越南语新闻、访谈、医疗和朗读域,中部口音与VLSP2020子集失败条件更明显,跨语言与远场噪声外推尚未验证。训练成本受限于硬件为4块NVIDIA A100 40GB上40轮微调,3100小时版本因资源受限仅训练15轮。
🔗 开源与复现资源
- 第三方资源:https://github.com/binhvq/news-corpus — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/m3hrdadfi/soxan — 链接可访问(HTTP 200)
- 第三方资源:https://sourceforge.net/projects/sox/ — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/openai/whisper-small — 暂时无法访问
- 第三方资源:https://vlsp.org.vn/vlsp2020/eval/asr — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/facebook/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么
这篇解读的输入是越南语自动语音识别的 1 篇会议论文全文,目标是让刚进入语音领域的研究生能复述方法并核对实验条件。必须保留的信息包括数据来源构成、7 步流水线的具体动作、过滤阈值、训练配置、评价指标定义和关键数字,输出是一套按学习依赖展开的中文技术说明。
自动语音识别的任务是把连续语音波形转成文字,初学者可以把输入理解为按 16 kHz 采样的振幅序列,输出理解为带标点大小写和词级起止时间的词序列。论文研究的问题不是提出新的声学模型结构,而是开源数据又多又杂时如何聚合成可训练的高质量监督数据。白话说就是先把各家数据洗干净对齐,再拿去微调已有的大模型。
阅读时要抓住一条主线,先沿一个音频样本走完输入、表示、组件、目标和输出,再看批量构造和对照实验。表示指模型内部对语音帧和文本词的向量编码,组件指转写、过滤、恢复标点、数字展开和对齐等处理模块,目标指词错误率和时间戳准确率,输出指可直接用的带时间文本。后续各节按任务与路线、方法全景、组件计算、构造训练、实验条件、结果反证和复现收束展开,教学例子会明确标为例子,不引入原文没有的数值。
越南语已有数据走了哪两条路线,各自卡在哪里
已有越南语数据大致分朗读语音和自发语音两条路线。朗读语音指志愿者在安静环境照着稿子念,例如通用语音众包中的越南语子集、15 小时的读书语料和开放朗读数据集,优点是录音干净、文本准确,缺点是说话方式单一、韵律变化少、规模小,众包越南语验证部分不足 5 小时,难以支撑真实场景。
自发语音指从播客、视频、访谈、医疗对话和广播新闻中收集的自然说话,例如上 1000 小时的社交语音、访谈名人语音、广播新闻多方言数据、医疗子集和大规模通用语料,优点是便宜可扩展、更接近真实用法,缺点是转写多由已有识别模型自动生成再加人工抽查,质量参差,采样率从 8 kHz 到 48 kHz 不等,预处理记录不清,难以直接合并训练。
两条路线还有 3 个共性短板。第一是普遍缺少标点、大小写和词级时间戳,训练需要细粒度对齐的字幕或编辑模型时只能事后补。第二是事后对齐工具常要求数字写成单词,例如 45 要写成英文例子的四十五形式,而识别系统输出往往是数字,造成输入输出格式错位。第三是标点恢复模型只看文本不听音频,无法利用停顿和语调放标点。论文的流水线正是为同时解决清洗、格式统一和时间对齐而设计。
为什么规模上去后,高质量监督数据才成为瓶颈
论文开篇的判断是,在大规模弱监督或自监督预训练之后,跨领域鲁棒性已有提升,但再往特定语言和任务适配时,只加规模收益会趋平,此时高质量监督数据才决定下一步。初学者可以这样理解,预训练给了通用耳朵,微调才教它听懂越南语 3 种主要口音和书写规范。
具体困难有 3 层。数据层是 11 个来源异构,时长、文本长度、领域和语音类型都不同,原始音频总时长三千多小时,直接混用会引入噪声。标注层是部分数据无文本,部分文本错误率高,医疗子集尽管声称人工核验,事后过滤仍只保留约 1/4,说明错误不少。特征层是缺标点大小写和时间戳,导致输出不可直接用,且数字的书面数字形式与口语单词形式需要在对齐前后各转 1 次。
因此论文把问题定义为设计一条通用、可复用的聚合预处理流水线,输入是多样且可能带噪的开源音频文本对,输出是干净、均衡、带词级时间戳的数据集,并用越南语做出 500 小时示例和 3100 小时扩展版,再验证微调效果。
七步流水线如何从杂乱音频走到带时间的干净文本
先从整体看 7 步的安排逻辑。前 3 步做减法,收集采样清洗、补转写、过滤低质文本,目的是去掉不可用的样本。中间两步做格式统一,恢复标点大小写、把数字展开成口语词,目的是让文本既可读又能被对齐模型接受。最后两步做时间落地,先对齐出音节级时间再把多词数字合并回数字形式并合并时间段,目的是产出训练可用的时间标签。
举一个论文图中的英文例子帮助理解,例子仅为教学示意。输入是一段英文录音,初始文本是全小写无标点的 were you born in 1970 in ha noi。经过标点恢复变成首字母大写带问号的形式,再把 1970 展开成 nineteen seventy 这类口语词,接着对齐模型给出每个词的起止秒数,最后把口语数字合并回 1970 并取首词起点到末词终点作为整体时间。越南语实际处理流程相同,只是语言换成越南语。
下图就是该流水线的示意图,方框按 1 到 7 编号并用箭头连接,上方配有文本形态变化和保留丢弃标记,值得对照正文逐步走一遍。
看图路径: 1. 先从左下第 1 步方框沿箭头向右再向下绕行,数清 1 到 7 共七个方框的主路径;2. 观察第 2 步上方两条转写示例与第 3 步上方的叉勾标记,确认保留与丢弃的含义;3. 对比第 4 步上方首字母大写带问号的文本与第 2 步全小写无标点文本的差别;4. 找到第 5 步到第 6 步再到第 7 步的回绕箭头,理解数字先展开成词再合并回数字的设计

论文图 1。原论文 Figure 1:“Overview of our pipeline for building a high-quality ASR dataset from multiple sources.”。
图中可见左侧从带喇叭的数据库图标进入第 1 步收集采样清洗,然后向右进入第 2 步生成转写和第 3 步过滤,叉号表示丢弃空或低质样本,勾号表示保留。第 4 步恢复标点大小写后向下折返到第 5 步数字展开,再向左到第 6 步对齐时间戳,最后到第 7 步转回数字形式。底部示例显示带秒级区间的词序列,以及数字合并后时间段变长的处理。这个走向说明流水线不是单向堆模型,而是围绕对齐模型对输入格式的苛刻要求,前后各加 1 次数字形态转换。
前三步如何做采样、补转写和过滤
第 1 步收集采样清洗包含 3 个动作。收集 11 个许可允许研究使用的数据集,覆盖朗读、自发、医疗、新闻和访谈。采样时为防止特定说话人或方言主导,对有名人说话人信息的数据每人最多取 10 分钟,对按频道收集的数据每频道最多取 30 分钟,对缺说话人信息的数据训练省份分类器按预测省份每省最多取 50 分钟。清洗时去掉超过 30 秒的样本和含非标准标点与特殊字符的文本,只保留逗号句号问号感叹号和字母,把音量归一并重采样到 16 kHz。这一步后得到 809 小时数据。
第 2 步处理无文本音频,主要是名人访谈数据。用两个越南语先进识别模型独立预测文本,再互相比对计算词错误率,只保留两者差异低于 5% 的样本。这里的词错误率是把一个模型输出当参考、另一个当预测,差异小说明音频清晰且模型一致性高。
第 3 步处理已有文本数据,用一个大模型再预测 1 次并与原配文本比对,词错误率超过 5% 就丢弃,有人工标注的可直接保留不改。这个阈值很严,效果是采样数据的约 62% 被保留,医疗数据仅保留约 26%,而朗读数据保留超 90%。严格过滤的代价是数据量大幅缩水,但换来测试集人工抽查平均词错误率从 2.73% 降到 0.23%。
词错误率 × 正字法词错误率: 词错误率负责统计预测文本相对参考文本的替换、删除和插入总数占比,衡量词汇本身对错;正字法词错误率在此基础上保留大小写和标点直接计算,衡量输出是否即拿即用。二者搭配的原因是越南语现有数据常缺标点和大小写,只看归一化指标会掩盖格式缺陷,组合后既能看懂词对错,又能看出后处理工作量。
理解这组指标对读懂后文很关键。归一化词错误率先把大小写转小写并去掉标点再算,反映词汇本身对错。正字法词错误率用原始文本直接算,反映格式是否 1 次到位。论文同时报告两者,才能区分词汇错误和标点大小写错误。
标点恢复和数字展开为何必须连在一起
第 4 步恢复标点和大小写的做法是微调音节级序列到序列模型。训练文本取自越南语新闻语料主体内容,选 500 万不含特殊字符的样本,按 85% 转小写去标点、5% 只去标点、5% 只转小写、5% 保持原样构造输入输出对,微调 20 轮。推理时用模型预测带格式文本,再把输入和输出都转小写去标点后比对,只有完全一致才保留,确保模型没有增删改词,只是加格式。
第 5 步把数字转成口语词,用预训练文本规范化模型得到数字到词的映射并替换。例如 30 转成 thirty 的英文示意,越南语同理转成对应读法。这一步纯粹为满足对齐模型只接受口语词的要求,属于中间形态,不是要给用户看的最终形式。
两步的顺序和校验都很重要。如果先展开数字再恢复标点,标点模型可能破坏数字映射。如果恢复标点时允许改词,后续对齐的时间就会对错词。因此论文用归一化后完全一致作为保留条件,把格式模型的自由度锁死。
标点恢复 × 数字展开: 标点恢复负责用神经网络模型补回大小写和逗号句号问号感叹号,只改格式不增删词;数字展开负责把 45 这类数字转成四十五这类口语文字形式,以满足对齐模型只接受标准书面口语词的要求。二者搭配的原因是顺序不能反,先恢复可读格式再展开数字,才能既保留用户想要的数字写法,又让对齐模型读懂输入,随后第 7 步再把口语数字合并回数字并合并时间段。
这组搭配解释了为何流水线要在对齐前后各做 1 次数字转换。前面展开是为对齐可读,后面合并是为用户可用,中间的映射表是连接两者的钥匙,第 7 步取首词起点和末词终点作为数字整体时间就是靠这张表实现的。
对齐如何产出词级时间并转回数字形式
第 6 步用对齐框架加越南语微调的语音表示模型生成词级时间戳。原理分两段,先由大识别模型给出准确文本,再由带连接时序分类头的对齐模型输出每帧在字符或音素上的概率分布,给定文本后在概率矩阵中找到最可能的峰序列,把每词首尾帧时间合并为词级起止。这种方法不需要发音词典,适配多语言,但计算量大且要求文本为口语词形式。
为兼容耳语模型,时间值被量化到 20 毫秒间隔,例如 0.00 秒、0.02 秒直到 30.00 秒,作为文本时间标记参与训练。这样时间预测变成词表预测,模型输出既有词又有时间标记。
第 7 步利用第 5 步的数字到词映射反向替换,把口语词转回数字。若一个数字对应多个词和多个时间段,就取第一个词的起点和最后一个词的终点作为整体时间。这样最终文本保留用户习惯的数字写法,同时每个数字仍有连续时间段,可直接用于字幕和检索。
强制对齐 × 词级时间戳: 强制对齐负责在已知音频和文本对应关系的前提下,推算每个音节或词在时间轴上的起止位置;词级时间戳是它的输出结果,供字幕生成和音频编辑直接调用。二者搭配的原因是越南语开源数据普遍没有时间信息,事后单独对齐成本高且要求数字必须写成单词形式,流水线把对齐内嵌为第 6 步,才能 1 次产出可训练的带时间数据。
这组关系说明时间信息不是附带产物,而是训练目标的一部分。后文实验用精确率召回率调和的 F1 和交并比评价时间准确性,只有对齐质量可靠,带时间训练才有意义。
数据集如何划分,模型如何微调
构造层面最终得到 502.67 小时高质量数据,训练集 468.60 小时,验证集 18.70 小时,测试集 15.37 小时。另有 3100 小时扩展训练集,做法是对 3171 小时原始训练数据只做初步清洗加标点恢复,再把其中与高质量训练集重合文件的文本替换成带时间的高质量版本,几乎保留全部原始训练时长。口音分布上北部最多,南部其次,中部最少,中部训练可用仅 64.34 小时,后文按此取均衡子集。
模型训练层面微调两个公开预训练模型。耳语小模型用峰值学习率 1.25 乘 10 的负 5 次方、优化器为权重解耦的自适应矩估计加线性调度,语音表示大模型用峰值学习率 1 乘 10 的负 4 次方加连接时序分类损失,并加时域频域掩码增强。所有实验在 4 块 40 吉显存图形处理器上运行,单设备批量 4 加 4 步梯度累积得到全局批量 64,常规训练 40 轮并用前 5000 步预热,3100 小时版本因资源限制只训 15 轮。最佳检查点按验证集归一化词错误率最低选取,再在测试集报告。
预训练模型 × 微调: 预训练模型负责提供在大规模弱监督或自监督语料上学到的通用声学和语言表示,例如耳语模型和语音表示模型;微调负责在本文构造的越南语高质量数据上继续更新参数,使其适应越南语发音、词汇和格式。二者搭配的原因是只靠大规模预训练在特定语言上会遇到平台期,必须用干净的监督数据做领域适配,论文用 469 小时和 3100 小时两档数据验证了质量加规模的叠加作用。
这组搭配点出论文的训练逻辑。预训练解决通用听觉,微调解决越南语适配,数据质量决定适配上限,数据规模决定长尾覆盖,论文用 469 小时高质量版和 3100 小时混合版分别验证这两层。
用什么指标和对照来测文本与时间
文本准确率用词错误率,含正字法和归一化两个变体,前者严格保留大小写标点,后者先转小写去标点,方向都是越低越好。时间准确率用 F1 和平均交并比,F1 统计词内容一致且时间重叠在允许容差内的真阳性,交并比统计匹配词时间段的重叠程度,方向都是越高越好。
对照条件保持一致。口音影响实验用耳语小模型微调 40 轮,比较 64 小时单口音子集与 192 小时三口音合并集。时间戳比例实验在 100 小时子集上比较 0%、25%、50%、75% 和 100% 带时间数据的效果。模型对比实验在 469 小时训练集上比较耳语小模型带 50% 时间戳训练与语音表示模型只训文本,以及外部大模型基线。扩展实验再用 3100 小时训 15 轮看规模增益。
测试集采用精修后的 15.37 小时版本,人工抽查显示其平均词错误率仅 0.23%,远低于原始测试集的 2.73%,因此后文数字都基于更干净的参考文本,这一点在复现时必须对齐,否则数字不可比。
从三千小时到五百小时,数据量和质量如何变化
要回答过滤是否值得,先看各阶段时长变化。原始总量大但杂,采样后均衡性提高,严格过滤后质量提升。下表把关键阶段的总量放在一起比较,比较对象是同一批数据的不同处理阶段,单位见表头。
| 范围 | 含义 | 原始总量(小时) | 采样后(小时) | 精修后(小时) | 备注 |
|---|---|---|---|---|---|
| 全量 | 音频时长 | 3342.38 | 809.07 | 502.67 | 62% 保留 |
| 训练 | 可用训练时长 | 3171 | 809.07 | 468.60 | 3100.52 扩展 |
表中全量原始总量为 3342.38 小时含 3171 小时可划分训练数据,初步处理后剩 809.07 小时,最终高质量为 502.67 小时,采样到精修保留约 62%。训练集占 468.60 小时,扩展版把最小处理后的全量与高质量替换合并做到 3100.52 小时。表后需要强调代价与反例,医疗子集仅保留约 26% 说明原标注噪声大,而朗读数据保留超 90% 说明录制规范本身就是质量。保留比例高不等于质量高,医疗数据丢得多恰恰暴露了原流程中人工核验仍漏掉大量错误。未胜出项是中部口音总量最少,后续只能按 64.34 小时对齐做均衡实验,天然限制了中部建模的数据上限。
该表的数字与单位均来自原文连续句,采样后到精修的 62% 为原文直接计算,扩展集的 3100.52 小时为最小处理加高质量替换的结果。复现时应先复刻 30 秒截断、特殊字符过滤和 16 kHz 重采样,再核对各阶段时长是否落在同一量级。
高质量小数据能否打赢更大但更噪的数据
核心比较是可运行策略之间的文本与时间得分,指标方向为词错误率越低越好,F1 和交并比越高越好。下表集中比较预训练基线、外部大模型、语音表示微调和本文两档微调,条件是同一精修测试集,训练轮数在表后说明。
| 条件 | 指标 | 预训练基线 | 外部大模型 | 本方法 469 小时 | 本方法 3100 小时 |
|---|---|---|---|---|---|
| 文本格式 | 正字法词错误率 | 70.16% | 33.90% | 12.46% | 11.70% |
| 时间定位 | 时间 F1 分数 | 未报告 | 未报告 | 76.40% | 83.68% |
表前已说明比较问题与公平条件,表后解释主要收益与具体代价。收益是 469 小时高质量微调把正字法词错误率从预训练的 70.16% 降到 12.46%,归一化从 64.07% 降到 8.69%,且以不到外部 844 小时一半的数据在两个指标上都超过外部小模型,说明清洗加格式恢复比单纯堆量更有效。3100 小时进一步把正字法降到 11.70%,时间 F1 从 76.40% 升到 83.68%,证明质量打底后加规模仍有增益。代价是时间戳多任务会拖累文本,100 小时上 0% 时间比例文本最好而 100% 时间比例对齐最好,50% 为折中,本文 469 小时采用 50% 时间比例。
未胜出项是外部大模型在归一化上曾以 6.89% 领先,靠的是 25000 小时内部数据,但其正字法高达 32.43%,说明缺标点大小写时输出不可直接用。边界是 VLSP2020 子集对所有模型最难,语音表示模型的正字法达 51.15% 而归一化为 14.10%,差距拉大正好暴露其大小写标点弱。
这些数字支持的判断是质量优先、规模次之,待验证的是更大规模是否在所有口音上都稳定增益,论文未测量延迟与推理成本,不承诺实时性改善。
口音和时间戳比例分别带来什么 trade-off
口音实验控制每种口音 64 小时,合并为 192 小时,微调耳语小模型 40 轮。报告显示合并集整体最优,单口音模型在匹配口音上好、跨口音上差,中部口音对北部和南部模型最难,提示中部在语音和词汇上分歧更大。支持的判断是训练口音多样性有助于泛化,限制是中部总量本身最少,均衡实验只能做到小规模,推广到大时长仍待验证。
时间戳比例实验在 100 小时子集上微调 40 轮,0% 时间比例正字法 19.21% 和归一化 15.79% 最好,但时间 F1 仅 75.83%,100% 时间比例 F1 到 80.61% 和交并比到 57.21% 最好,但文本变差,50% 在两者间平衡。这是对齐步骤的有效消融,时间比例越高对齐越好,文本越可能受损,说明带时间输出是多任务权衡而非免费午餐。
组件层面的对应关系也很清晰。过滤清洗对应词汇准确率提升,469 小时以更少数据超过 844 小时外部数据,归一化词错误率 8.69% 对 8.97%。标点恢复对应格式提升,正字法从外部的 33.90% 降到 12.46%。对齐步骤对应时间能力,时间比例从 0% 到 100% 单调提升 F1 和交并比。复现时应固定模型和轮数,只改口音组合或时间比例,否则无法归因。
过滤本身可能引入什么偏差
论文明确承认过滤可能引入偏差。只保留能被工具链干净处理的样本,会偏向工具表现好的声学环境、说话风格或口音,最终数据高质量但不一定代表真实语音全貌。这是严格阈值 5% 和归一化完全一致等规则的必然副作用,干净与多样之间存在张力。
第二个局限是口音不均衡。北部 286.17 小时,南部 146.47 小时,中部仅 70.03 小时,测试集同样北部最多。尽管合并训练有助于泛化,中部最难且数据最少的问题没有被根本解决,实际部署到中部口音为主的场景时仍需额外验证。
第 3 个局限是成本与评估边界。时间对齐依赖大模型,计算密集,论文未报告训练时长、推理延迟和误判率,也未在全部外部集上测时间指标。3100 小时只训 15 轮是资源约束下的折中,最优轮数和批量之外的超参数敏感性未展开。因此不能把总体趋势理解为每组每步都成立,也不能承诺延迟下降。
要复现应先做什么,需要哪些信息条件
复现先做数据复刻。按表 1 的 11 个来源下载许可允许研究使用的数据,执行去长音频、去特殊字符、音量归一和 16 kHz 重采样,用省份分类或说话人上限做均衡采样,目标先复现 809.07 小时中间态。再用双模型互比和单模型比对原文本的两条 5% 阈值过滤,核对是否得到约 502.67 小时和约 62% 保留率,医疗子集是否显著更低。
再做格式与时间复刻。用新闻语料 500 万子集按 4 种变换比例微调音节级模型做标点恢复,并用归一化完全一致做保留。用文本规范化模型做数字展开,再用对齐框架加越南语语音表示模型产出词级时间并量化到 20 ms,最后按映射表合并回数字。关键超参数包括耳语小模型峰值学习率 1.25×10−5、语音表示模型 1×10−4、全局批量 64、预热 5000 步、40 轮与 3100 小时版 15 轮,选点按验证集归一化词错误率最低。
信息条件方面,论文给出流水线步骤和阈值,但未开源完整权重与全部清洗脚本细节,复现时缺失项应明确记录为缺项,不从模型名推定实现。若本次未能确认某些外部模型页面可达,就写本次未能确认可达,不猜测链接状态。评估必须用精修测试集并同时报告正字法和归一化词错误率,否则格式收益会被掩盖。
何时值得尝试这条流水线,还需补哪项验证
当手头有多源、格式不一、缺时间的低资源语言数据,且已有可用的大识别模型和对齐模型时,这条流水线值得尝试。它的适用条件是能接受丢数据换质量,并有新闻等规范文本可训标点恢复模型,有数字规范化工具可做展开合并。预期收益是输出即带标点大小写和时间,可省掉事后对齐与格式后处理。
不值得盲目照搬的情况是目标场景口音与过滤后分布差异大,或对延迟和成本敏感但论文未给测量时。此时更稳妥的是保留高质量子集做适配,再混入最小处理的大数据做覆盖,正如 3100 小时扩展版的做法,用高质量替换重合文件来兼顾精度与多样性。
还需补的验证有三项。一是跨口音和跨领域的细粒度误差分析,特别是中部口音和 VLSP2020 难例的错误类型。二是时间容差、交并比计算细节和人工听感的一致性,避免自动时间指标替代人工评价。三是训练与推理开销、输出帧率与实际延迟的测量,才能判断带时间输出是否可部署。补齐这些后,才能把质量优先的结论从越南语推广到其他语言。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses