英文题目:HiKE: Hierarchical Evaluation Framework for Korean-English Code-Switching Speech Recognition

会议身份:conference:eacl:2026:conference-paper-id:2026.findings-eacl.33

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #多语言 #语音 #语音识别

评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Gio Paik:机构信息未能从会议 PDF 纯文本可靠映射
  • Yongbeom Kim:机构信息未能从会议 PDF 纯文本可靠映射
  • Soungmin Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Sangmin Ahn:机构信息未能从会议 PDF 纯文本可靠映射
  • Chan Woo Kim:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

韩英码切换语音识别以混合话语音频为输入并输出韩英混排转写,难点在于韩英类型距离大且句内词与短语切换密集不规则,强单语模型难以在切换点准确转语言。该基准先人工撰写575条跨8主题种子脚本,再以单样本提示用CLAUDE-3.5-SONNET每条克隆1条并经作者全部人工复核纠错,输出脚本集进入录音环节。随后13名双语者在安静环境用个人设备经网页工具各录50到100条,剔除29条偏离样本后保留1121条约2.2小时录音进入标注环节。接着按句子级优先于短语级优先于词级规则完成三级分层标注,并对外来语标注后在评价时接受韩英两种写法以降低测量噪声。与拼接单语或合成句级切换数据相比,其关键机制差异在于提供自然发音的真实切换与切换点误差度量,使词典替换能力与语序重排能力可被分离考察,具有真实评价意义。在HiKE基准下,经自然句内码切换数据微调的WHISPER-MEDIUM的Mixed Error Rate错误率为9.0,低于微调前基线的31.3。该结论适用边界限于朗读式短句与安静录音,尚未验证自发对话、噪声远场与多说话人场景的外推。实验硬件为单块NVIDIA RTX 6000 Ada GPU评测与单块A100 GPU微调约1轮,推理开销与训练成本原文未量化分析。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/ThetaOne-AI/HiKE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:为何单语测得准不等于混说能用?

本文输入是韩英双语者在日常对话中一句话内混用两种语言的录音,目标是逐字转写出韩文与英文混排的文本。论文要解决的学习依赖是:当前多语自动语音识别在 LibriSpeech 等单语基准上已低于 5% 错误率,但用户实际会说一半韩语一半英语,模型在训练时几乎没见过这种切换,单语能力未必能迁移。作者因此提出 HiKE 评测框架,当前可用,代码已公开在https://github.com/ThetaOne-AI/HiKE,包含 1121 句高质量自然混说录音,约 2.2 小时,覆盖软件工程、语言教育等 8 个主题。

必须保留的关键信息是:每句都带词级、短语级、句子级 3 级标签和借词标签,评测用混合错误率与兴趣点错误率双指标。对研究生而言,复述方法是:先理解切换粒度,再看指标如何只盯切换点,最后看 10 模型评测与微调对照。本文输出是一套可核对的构造与实验流程说明,不做超出原文的效果承诺。

相关路线有何不同:流式 CTC、编解码器与大模型为何都缺混说数据?

早期语音识别多用基于连接时序分类的流式结构,对短音频帧做预测,优点是延迟低,缺点是缺少整句上下文。随后转向 Transformer 编解码器非流式结构,利用整段音频上下文提升准确率与鲁棒性,Whisper 与 Seamless-M4T 属于此路线。最新路线是直接调用预训练大语言模型做音频理解,准确率高且可扩展问答翻译,但需要巨大算力,如 Gemma-3N、Audio-Flamingo-3、GPT-4o-Transcribe。

另一条路线是代码切换语音数据集,普通话英语因说话人多已有少量公开基准,但韩英这类类型距离远的组合极度稀缺,韩国 AI-Hub 虽有政府资助韩英混说集,但仅限韩国国民使用,全球无法获取。为补数据,前人试过拼接单语语音造混说,或用语音合成模型生成混说,前者会出现说话人性别与环境在句中突变且只能做句级,后者音质差且缺少真实声学多样性。

HiKE 的定位是第一个全球可访问的非合成韩英混说评测集,区别在于全部为真人自然朗读并带分级标注,用于评测而非仅用于训练。

要测什么问题:切换发生在词、短语还是句子边界?

论文把问题定义为:给定一句内含韩英切换的语音,模型能否在正确语言、正确位置输出正确文字。以往只分句内与句间,即切换在句内还是句子之间,粒度太粗。HiKE 改为 3 级:句子级指一句韩语完整句加一句英语完整句,切换只在标点边界,最可预测;词级指嵌入单个词,主要考双语词库;短语级指嵌入连续两个以上异语词,会引入语序变化等不规则语法,对韩英这种语序差异大的语言对最难。

举例说明:英语主句中插入韩语사랑해属于词级,韩语句中插入 getUserInfo function 属于短语级,前半韩语句加后半英语句属于句子级。例子仅为教学示意,不代表数据集中原句。评测难点还包括借词,如버스与 bus 发音几乎相同,若标准答案只允许一种写法,写出另一种也会被判错,带来测量噪声。论文因此把问题拆成整体转写与切换点转写两个测量目标,分别对应后文两个指标。

方法全景:一条样本如何走完标注与评分?

拿一句话为例,先确定它的主语言与异语言,再做字符到语言的映射,按句号、感叹号、问号切分,依次检查是否有整段异语言、有无连续两个异语言词、有无孤立单个异语言词,按句子优先于短语优先于词的顺序定级,最后在评分时对借词放宽为两种写法都算对。这条路径把输入音频、文本标注、指标计算串起来:录音保证自然声学,定级保证难度分层,借词处理保证公平。

代码切换 × 自动语音识别: 代码切换负责定义在一句话内何处发生韩语与英语的交替,自动语音识别负责把整段音频转写为对应文字,二者搭配的理由是混说同时考验声学切分与双语词库,组合意义是用切换点位置把整体转写误差拆成可定位的切换能力问题。

以下导读帮助初学者建立 3 级切换的直观印象,请先看三行例句的切换点标记与底色跨度,再对应到后文自动判定规则中的整段、连续、孤立 3 种条件,注意句子级跨度最大但位置最规则。

看图路径: 1. 先看三行例句中红色倒三角标出的切换点位置;2. 再对比蓝色单个词、橙色连续短语、绿色整句三种底色跨度;3. 最后看每句下方英文翻译,确认切换前后语义仍然完整

原论文 Figure 1:Code-Switching Examples by CS-Level

论文图 1。原论文 Figure 1:“Code-Switching Examples by CS-Level”。

图 1 展示了 3 个层级的实例:第一行英语句中嵌入韩语单个词,第二行韩语句中嵌入英语函数名短语,第三行前半韩语后半英语,红色倒三角标出语言转换点,底色区分词、短语、句子 3 级。每行下方配英文翻译,说明切换不破坏语义完整性。该图支持后文判断:词级考词汇,短语级考语法,句子级考边界检测,难度预期为短语与词高于句子。

组件一:三级标签如何自动判定而不靠主观?

3 级判定的计算对象是原始文本、主语言与异语言。先做预处理与映射,把特殊字符去掉,把每个字符映射为主语言或异语言,再按标点切成片段。然后在每个片段内独立检测 3 种信号:是否整段都是异语言,是否含有连续两个异语言单元,是否含有孤立异语言单元。最后按优先级输出句子、短语、词、无切换。符号含义是:RawText 为原始转写,Lmain 为作者标注的主语言,Lother 为另一语言,CleanText 为去特殊字符后文本,Seq 为语言标签序列。计算目标是给出唯一层级,避免一句同时满足多级时的歧义,原文明确用句子优先的实现来保证一致性。

\[CleanText ←RemoveSpecialChars(RawText) Seq ←Map characters to {Lmain\]

上式对应预处理与映射步骤,代码实现为去掉特殊字符后逐字映射,输入是原始文本与主异语言声明,输出是可切分的语言序列,为后继检测提供统一表示。

\[has_sentence ←true\]

上式对应句子级信号的置位条件,一旦某片段整体为异语言即标记存在句子级切换,类似逻辑同样适用于短语与词级信号,只是连续性条件不同。

混合错误率 × 兴趣点错误率: 混合错误率负责评估整句转写质量,对韩语按字、对英语按词计算,兴趣点错误率负责只评估发生语言切换的词位,二者搭配的理由是整体分会被非切换区稀释,组合意义是同时看到模型是整句都差还是恰好倒在切换瞬间。

该组件的新增作用是把以往二分类细化为三分类,使后续可以按层级报告混合错误率与兴趣点错误率,定位模型在哪种切换上失效。

组件二:借词与双指标如何减少误罚?

借词指从外语引入并按本国语音与正字法改造的词,论文例子是韩语버스与英语 bus,发音几乎相同,在混说语境可互换。若标准答案限定为韩文或罗马字母之一,模型输出另一种完全合理的写法也会被计错。做法是作者逐一标注数据集中所有借词,评测时韩英两种版本都视为正确答案。论文报告该后处理平均降低 4.9% 的混合错误率与 7.9% 的兴趣点错误率,这里的降低指测量噪声的减少,不是模型能力提升,复述时不要混淆。指标方面,混合错误率对韩语按字、对英语按词计算整句误差,沿用普通话英语混说评测惯例;兴趣点错误率只计算切换点所在词的误差,官方实现沿用 PIER 代码。

词级代码切换 × 短语级代码切换: 词级代码切换负责考验单个词的嵌入与双语词库,短语级代码切换负责考验连续多词带来的语序与句法变化,二者搭配的理由是韩英类型距离远时连续英文会打乱韩语语序,组合意义是区分词汇记忆失败与语法结构失败。

借词 × 后处理: 借词负责标出韩英发音几乎相同、可互换书写的词,后处理负责在评分时把韩文与罗马字母两种写法都判对,二者搭配的理由是严格单写会把正确转写误判为错误,组合意义是去掉约 4.9%MER 与 7.9%PIER 的测量噪声。

两组搭配共同解决公平性:层级区分难度来源,借词放宽消除正字法歧义,双指标分别回答整句行不行与切换瞬间行不行。若缺借词标注,词级误差会被系统性高估。

数据如何构造:从 575 句种子到 1121 句录音做了什么动作?

HiKE 本身是评测集构造,没有训练神经网络的阶段,其构造流程承担方法职责。第一步写脚本与克隆:作者先手工写 575 句种子脚本,覆盖 8 个主题,每句用作单样本示例,提示 Claude-3-5-Sonnet 仿写原主题与切换结构,每原句只克隆一句以控制相似度,所有生成脚本再经作者人工审校。第二步录音:招募 13 名韩英双语者,每人录 50 到 100 句,在安静环境用个人笔记本或手机通过网页界面录制,初始得到 1150 条录音,人工剔除 29 条偏离脚本样本,剩余 1121 句。第三步标注:按上述规则定 3 级,得到词 457 句、短语 607 句、句子 57 句,另做借词标注。微调实验的数据属于另一环节:自然句内数据取自 AI-Hub,合成句间数据由 FLEURS 与 Common Voice 单语拼接而成,用于训练 Whisper-Medium。

自然句内数据 × 拼接合成句间数据: 自然句内数据负责提供真实词级与短语级混说,拼接合成句间数据负责把单语韩语与英语录音首尾相接造出句级混说,二者搭配的理由是前者稀缺昂贵、后者易得可扩展,组合意义是检验只用廉价拼接数据能否唤醒模型的切换能力。

以下导读说明录音工具如何保证朗读与脚本一致,请注意界面同时显示韩英说明与待读脚本,录音者可试听重录,这是剔除偏离样本前的第一道质量门。

看图路径: 1. 先看界面中央显示的待朗读混说脚本区;2. 再看底部重录与提交两个按钮对应的自查流程;3. 最后结合深色网页界面确认这是个人设备安静环境录制

原论文 Figure 3:Screenshot of Recording Tool

论文图 3。原论文 Figure 3:“Screenshot of Recording Tool”。

图 3 为网页录制界面截图,深色背景上显示韩英双语操作指引与待朗读的混说脚本,下方有重录与提交按钮。可见设计允许录音者提交前回放检查,必要时重录,这解释了为何最终仅剔除 29 条:多数偏差已在提交前自我纠正。该界面不支持推断录音设备型号与声学参数,原文只说明为个人设备安静环境。

实验条件:测谁、在哪测、超参数是什么?

评测对象为 10 个多语语音识别模型,覆盖 CTC、Transformer 编解码器、大语言模型 3 类架构,参数从 38M 的 Whisper-Tiny 到 8B 以上的 Gemma-3N 与 Audio-Flamingo-3,以及参数未公开的 GPT-4o-Transcribe。评测集为 HiKE 全部 1121 句,按 3 级分别报告混合错误率与兴趣点错误率,单语对照在 FLEURS 上测韩语字错率与英语词错率。硬件与软件条件为:除特别说明,评测在单张 NVIDIA RTX 6000 Ada 上单次运行,PyTorch 2.8.0 与 Transformers 4.56.2。微调对象为 Whisper-Medium,3 种条件:只用自然句内数据、只用拼接合成句间数据、两者都用,均在单张 A100 上约微调 1 个轮次,批量 16,余弦退火调度,10% 预热,峰值学习率 1e-5。复现时需注意:原文未报告多次运行方差与统计显著性,单次运行结果不宜夸大微小差距;AI-Hub 自然数据受访问限制,全球复现合成条件更容易。

主结果:单语很强为何混说误差扩大数倍?

要回答的问题是:多语模型在混说上是否保持单语水平,比较条件是同一模型在 FLEURS 单语与 HiKE 混说上的误差,指标越低越好。论文报告所有模型在混说上都出现严重下降,混合错误率相对单语扩大 3 到 13 倍,即使最大模型混说误差仍为单语 5 倍以上,说明只靠增大规模不足以实用。Whisper 系列呈现规模趋势:Tiny 与 Base 几乎无混说能力,随规模增大逐渐显现。架构差异上,CTC 的 SenseVoice-Small 整体混合错误率优于同量级 Whisper-Small,但在切换点兴趣点错误率仍高,说明整体转写稳不等于切换瞬间准。

大模型方面,参数超 Whisper-Large 5 倍的 Gemma-3N 与 Audio-Flamingo-3 的混合错误率与兴趣点错误率均超 54,未达竞争水平,仅 GPT-4o-Transcribe 超过 Whisper-Large,且呈现相反层级趋势:多数非大模型模型句子级最好、词级最差,而 GPT-4o-Transcribe 词级最好、句子级最差,作者推测与其文本训练数据中词级混说丰富有关,该解释为待验证推测。

看图路径: 1. 先区分语音转写、指令跟随失败、幻觉三个面板标题;2. 再看第一面板中英文被写成韩语音译的具体词;3. 最后看第三面板中同一韩语片段被重复生成的长尾

原论文 Figure 2:CS-ASR Fail Cases

论文图 2。原论文 Figure 2:“CS-ASR Fail Cases”。

图 2 展示 3 类失败:语音转写指非借词被用另一语言文字按发音写出,如英文被写成韩语音译;指令跟随失败指 Whisper 等多任务模型在混说下不做逐字转写而做翻译或问答,Audio-Flamingo-3 尤甚;幻觉指编解码与大模型生成音频中不存在的重复冗余。像素可见第一面板上下对照的英文与韩语音译,第三面板同一韩语片段的连续重复。解释是训练中单语多、混说极少,导致转写、跟随指令、抑制幻觉的泛化在切换处集中失效。

以下比较聚焦可运行模型的整体误差与单语对照,公平条件是同一解码与借词放宽评分,指标方向为越低越好,重点看规模与大模型路线的反差。

模型参数量整体混合错误率整体兴趣点错误率单语韩语
WHISPER-TINY38M93.678.911.9
WHISPER-LARGE1.5B26.136.03.2
GPT-4O-TRANSCRIBEN/A21.828.82.5

上表显示最大收益来自 GPT-4o-Transcribe,其整体混合错误率 21.8 与兴趣点错误率 28.8 为三者最优,但代价是模型细节未公开且句子级反而弱于词级;未胜出项 WHISPER-TINY 整体混合错误率达 93.6,说明小模型几乎不可用。负结果是 8B 级开源大模型并未随参数获胜,提示在混说上堆文本参数不等于堆语音切换能力,复现时应优先核对解码提示与语言标识设置。

微调对照:自然句内与拼接合成各带来什么增益与代价?

要回答的问题是:微调能否唤醒切换能力,以及廉价拼接数据是否够用。对照为同一 Whisper-Medium 基线,基线词/短语/句整体混合错误率分别为 39.1、27.9、16.8,整体为 31.3,兴趣点整体为 41.3;3 种微调条件保持优化器与轮次一致,指标越低越好。论文报告只用自然句内数据整体混合错误率降到 9.0,提升 22.3 个百分点,兴趣点降到 19.5;只用合成句间数据整体混合错误率降到 22.1,提升 9.2 个百分点,兴趣点降到 34.5,提升 6.8 个百分点以上。

两者都用整体为 20.4。分层看,自然数据在词与短语上优势明显,合成数据仅在句子级混合错误率与兴趣点上反超,这符合合成只含句级拼接的构造。代价是自然数据微调后单语韩语从 3.4 升到 6.0、英语从 4.6 升到 5.2,出现轻微单语退化;合成数据单语退化较小,韩语 3.7、英语 5.1。

微调条件整体混合错误率整体兴趣点错误率句子级混合错误率单语韩语
基线 WHISPER-MEDIUM31.341.316.83.4
自然句内数据9.019.57.46.0
合成句间数据22.134.55.83.7

上表主要收益是自然句内微调整体最优,但具体代价是单语韩语误差上升 2.6 个百分点;反例是合成数据整体不如自然数据,却在句子级以 5.8 优于 7.4,说明合成的适用边界限于句间切换。未评测边界是更大规模合成与更精细拼接技术,原文明确这是未来工作,不能把当前合成劣势推广为合成路线无用。

有何限制:哪些结论不能推广?

论文明确两项限制。第一,同时支持韩英的模型稀缺,可比架构少,尤其大模型中仅 GPT-4o-Transcribe 有意义的混说性能,无法可靠归纳大模型的共性。第二,高质量混说数据稀缺使微调只能小规模进行,未能充分检验扩大合成数据的效果。由此,未验证的推测包括:GPT-4o 层级反转归因于训练文本分布,大模型文本量大即能做好语音切换。相关性不等于因果,缺少训练数据成分的直接证据。

缺失的测量包括:误判率分解、延迟、推理成本、多次运行方差,原文未测量这些量,不能承诺微调同时改善延迟或成本。总体趋势不等于每句都成立,句子级样本仅 57 句,占比小,句子级最优结论的统计稳定性弱,复述时应点明样本量不均。

复现先做什么:代码、权重与评分如何对齐?

先确认资源状态:HiKE 代码当前可用,地址为上述 GitHub,评估代码按 Apache 2.0 发布,兴趣点错误率沿用官方实现,许可证同为 Apache 2.0。第一步跑通评测:用 HiKE1121 句与借词表,按韩语按字、英语按词计算混合错误率,对借词两种写法取优,再计算切换点兴趣点错误率,核对借词放宽带来约 4.9% 与 7.9% 的变化量级。

第二步对齐基线:先复现 Whisper-Medium 3 级基线,再做单轮微调,批量 16、峰值学习率 1e-5、10% 预热、余弦退火,区分代码开源、权重下载与系统可运行:有代码不等于有权重,有权重不等于解码提示与语言标识已对齐,大模型尤其需检查是否误触发翻译模式。第三步补验证:报告按主题与层级的分项误差,补充多次运行波动,记录单语 FLEURS 对照以观察遗忘。若无法获取 AI-Hub 自然数据,可先用 FLEURS 加 Common Voice 拼接复现合成条件,验证句子级改善是否可重复。

何时值得尝试:给刚入门者的收束判断

当你的应用面向韩英混说用户,且已发现单语模型在实测中把英文写成韩语音译、在切换处答非所问或重复生成时,值得用 HiKE 做分层体检:先看整体混合错误率是否远高于单语,再看兴趣点错误率定位是否为切换瞬间,最后按词、短语、句子拆分难度。若词与短语差而句子尚可,优先补自然句内数据微调;若只能拿到单语数据,可先用拼接合成验证句子级改善,但不要期待它解决句内语法紊乱。论文特有的误解澄清:借词双写算对不是放水,而是去除正字法歧义。

拼接数据有效不等于拼接即真实混说,它仍有说话人与环境突变问题;大参数不自动等于强混说,文本能力需经语音切换数据激活。收束时记住中心矛盾:单语规模化带来的流利转写,在类型距离远的密集切换点会集中失效,而分级标注与切换点指标正是为了让这种失效可定位、可复现、可改进。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eacl-2026 论文汇总