英文题目:Low-Resource Medical ASR for Rich Transcription in Latvian
会议身份:
conference:interspeech:2026:conference-paper-id:znotins26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#医疗音频 #SFT #低资源 #语音识别
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Arturs Znotins:机构信息未能从会议 PDF 纯文本可靠映射
- Normunds Gruzitis:机构信息未能从会议 PDF 纯文本可靠映射
- Andris Rozentals:机构信息未能从会议 PDF 纯文本可靠映射
- Maris Golubovskis:机构信息未能从会议 PDF 纯文本可靠映射
- Mikelis Gulbis:机构信息未能从会议 PDF 纯文本可靠映射
- Roberts Dargis:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向拉脱维亚语医疗口述的任务以自发口述音频为输入,直接输出可归档的富格式报告,实际难点在于口音与领域术语密集、数字缩写代码与大小写标点规范严格、口述含标点命令与口误自我纠正。且遗留逐字稿与人工终稿并不逐字对应,通用模型在该领域词错率急剧恶化而在域内仅有约五十小时人工转写可用。方法链分三步:先用大语言模型将遗留逐字稿与人工终稿对齐为逐字到格式化的平行对并经校验与强制对齐得到句级时间戳,该平行对进入下一步作为端到端与文本格式化训练的监督。再对Whisper等基础模型做两阶段微调,先迁移通用拉脱维亚语能力再适配医疗富格式输出;最后用微调模型转写未标注音频并经大语言模型校正过滤得到伪标签音频扩充训练,并以微调文本格式化模型完成逐字转写到格式化报告的两阶段转写。与传统规则式逆文本规范化相比,该路线以数据驱动的端到端学习与大语言模型后编辑替代手工文法维护,并以伪标签复用遗留数据降低人工标注负担。在医疗测试集下,加入伪标签数据的微调Whisper-large-v3模型的WER为10.6%,低于未加伪标签时模型的WER 11.1%。该结论适用边界受限于放射病理与出院小结类口述报告,在对话急诊噪声及跨机构口音上尚未验证,训练硬件为单块A100 80GB图形处理器而推理开销尚未披露。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
本文解读的输入是会议论文正文证据与本次收到的官方原图像素,不引入其他解读或外部知识。目标是让刚进入语音与音频方向的研究生能复述方法、复核实验条件、理解结论边界。必须保留的信息包括任务定义、数据规模与划分、两条技术路线的训练动作、评价指标的计算口径、关键对照的数字与条件,以及作者明确承认的局限。输出按学习依赖展开,先讲医疗富格式转写的特殊性,再讲相关路线,然后走完样本级流程、训练构造、实验设置、结果与反证,最后给出复现清单。
拉脱维亚语是母语者约 150 万的低资源语言,通用领域有数百小时开源或学术许可语料,但医疗领域只有几十小时受限数据。论文报告通用模型在通用内容上词错误率 3 至 13%,到医疗报告场景退化到 12 至 46%。这意味着只做通用识别不够,临床可用的输出还必须带标点、大小写、缩写、符号、数值日期区间、计量单位和领域记号。传统做法是逐字识别加标点恢复与逆文本规范化,但规则系统需要大量工程维护,对小语种市场不可持续。因此论文把问题定为在严格只有 50 小时人工转写医疗口述的条件下,能否用基础模型加数据整理做出可用的富格式转写。
已有路线解决了什么,还缺哪一块?
高资源语言的临床文档已长期使用语音识别,从放射科到医患对话,目标是减少书写时间。低资源语言的差距主要在两处,一是领域声学与术语不匹配,二是格式化质量不达标。早期拉脱维亚语、爱沙尼亚语医疗系统采用混合架构,即声学模型加领域语言模型加发音词典加基于规则的格式化后处理,性能高度依赖人工建资源和改写文法,论文提到拉脱维亚放射科混合系统词错误率约 20 至 30%,随模态和录音条件变化。
近期路线转向端到端基础模型的有监督微调,例如法语放射科的 Whisper 微调、波兰医疗语音数据集建设、多语言编码器解码器医疗模型,共同点是用相对小的领域数据适配预训练模型。另一条线是用大语言模型做识别后处理,包括纠错、跨语言鲁棒性、多假设融合、只改低置信片段以减少语义漂移,以及用伪标注和人机协同扩大数据。
拉脱维亚语前期工作先建放射科语音文本资源做声学与语言模型适配,再做半监督适配和 Whisper 微调,通用识别明显进步,但医疗富格式仍缺系统比较。本文的缺口正是同数据、同评测下比较端到端直接生成格式文本与逐字识别加大模型格式化,并补上把遗留逐字稿转成富格式监督数据的整理方法。
富格式转写到底难在哪里?
论文把富格式转写定义为直接可归档的结构化报告,而不仅是听清每个词。难点来自 4 个叠加,一是词汇识别本身,二是逆文本规范化,例如数字缩写怎么写,三是口述标点命令要正确执行,四是领域记号如编码、范围、罗马与阿拉伯数字混用。口语还带有不流畅、假启动、自我纠正和口述指令,最终文档又可能包含转写后补充,导致音频与最终文档不是逐字对应。
举一个教学例子帮助理解,例子不是论文数据。假设医生口述说出数字加逗号加小数,逐字稿可能保留读法,富格式报告则要写成带小数点的数值加单位。如果对齐只看词,标点差异会引起错位,多种写法都可接受时标准词错误率会失真。这就是论文要引入标点错误率、标点命令错误率、数字错误率和医学概念错误率的原因。低资源放大的困难是术语高度专门化,药物拉丁名与拉脱维亚名并存,发音相近但语法形态不同,边界错误会改变语义,而可用的领域语音只有 50 小时,无法靠堆数据 brute force 解决。
两条路线全景:端到端与两阶段如何分工?
论文设置两条可运行路线。路线一是端到端,对 Whisper、Canary、Gemma-3n 等基础模型做微调,使其从音频直接输出带格式的报告。路线二是 2 个阶段,先把 Wav2Vec2-BERT 和 Whisper 微调为逐字转写模型,再用纯文本大模型做格式化与有限纠错,格式化模型选用 Gemma-3 的 1B、4B 和 12B 版本。两条路线共用同一领域数据集 LVMED,保证比较的数据基础一致。
为解决格式化监督数据不足,论文引入大模型驱动的数据整理,把遗留逐字稿转成逐字与格式化配对。具体做法是把人工逐字稿与人工最终文档作为输入对,用 Gemini 3 Pro 恢复术语、编码记号、标点和大小写,输出用类似方括号竖线的成对标注保留格式化与逐字形的对应,支持确定性转换与对齐。另用 75 小时合作方录音做伪标注,先用最强语音模型生成逐字假设,再用大模型结合人工编辑报告做纠错与格式化,词错误率高于 15% 的录音被丢弃。最终训练既有 50 小时人工整理数据,又有 75 小时大模型纠正的伪标注数据。
评价采用基于编辑距离的模糊词级对齐,数字日期内部带标点的编码视为单个词,替换代价按相对编辑距离加权,只允许词与词、标点与标点之间替换。词错误率在格式化文本上计算并忽略标点大小写,逐字词错误率在逐字标注上计算,另有字符错误率、标点错误率、标点命令错误率、数字错误率和医学概念错误率。这种多指标设计是为了把听错、写错格式和写错关键实体分开考核。
样本走一遍:从一段口述到两种输出
沿一个样本走完流程有助于固定概念。输入是一段医疗口述音频,例如放射科计算机断层报告的口述。表示阶段先做切分与对齐,文本格式化数据集对应最长 30 秒的音频段,句子级时间戳用基于连接时序分类的强制对齐器补充。组件阶段分两路,端到端路直接把音频送入微调后的 Whisper,输出即格式化报告;2 阶段路先把音频送入微调后的逐字模型得到逐字稿,再把逐字稿送入微调后的 Gemma 文本模型得到格式化报告。
目标阶段用成对标注约束,要求格式化与逐字形可互相推导,自动校验发现不一致则带差异提示重试大模型最多 5 次,少数需人工复核。输出阶段还要加 4 类医学实体标注,即解剖、病情、药物和操作,用于计算医学概念错误率。
逐字转写 × 富格式转写: 逐字转写负责把听到的声音按口语原样写下来,保留口述标点命令、重复和迟疑;富格式转写负责把逐字稿变成可直接归档的报告,完成标点恢复、大小写、缩写、数字与单位的规范化。二者搭配的原因是医疗报告既要求听得准又要求写得规范,组合意义在于把声学识别与文本规范解耦,便于分别用语音数据和文本数据优化。
这种样本级走法的意义是明确监督来源,格式化文本不是凭空生成,而是由人工逐字稿与人工最终文档共同约束的大模型整理结果,伪标注部分则由语音假设加大模型纠正加词错误率过滤共同约束。理解这一点才能理解后文为什么要做 2 阶段训练、为什么要过滤高错误伪标注,以及为什么评价必须分层。
端到端与两阶段各自改了什么?
端到端侧的改动集中在语音基础模型的领域适配。论文选用 Whisper、Canary-1B-v2、Wav2Vec2-BERT 和 Gemma-3n,其中 Wav2Vec2-BERT 被描述为扩展自 Wav2Vec2 与 XLS-R 并在更大规模多语言语料预训练,Gemma-3n 是少有的原生支持音频、且分词器对拉脱维亚语覆盖尚可的开源多模态大模型。Whisper 默认生成配置被修改,移除非特殊抑制词以允许生成更多标点符号,这是为了富格式输出能合法产生标点。训练采用 2 阶段策略,先在通用拉脱维亚语标注数据上训练 10,000 步,再在 LVMED 上适配 51,000 步,大多数模型第一阶段用半精度、批量 32、学习率 2 乘 10 的负 5 次方,领域适配时减半。
端到端微调 × 2 阶段流水线: 端到端微调让语音基础模型直接从音频输出带格式的报告,省去中间文本接口;2 阶段流水线先用语音模型输出逐字稿,再用文本大模型做格式化与有限纠错。前者分工集中、部署链路短,后者把声学与语言规范分开训练。搭配比较的意义是检验在只有 50 小时领域语音时,哪种分工对数据更省、错误更可控。
2 阶段侧的改动集中在文本格式化模型。逐字语音模型沿用与格式化语音模型相同的微调设置,文本模型在约 30,000 个逐字与格式化转写对上全量微调,批量 16、学习率 1 乘 10 的负 5 次方。为增强对识别噪声的鲁棒性,训练数据中混入语音模型生成的假设,只保留词错误率低于 10% 的样本,让格式化模型见过真实识别噪声并做有限纠错。论文报告混入误差更大的样本会导致幻觉增加、效果退化,因此阈值是经过验证的选择,不是随意截断。
数据整理与伪标注如何保证不改走原意?
数据整理的核心风险是大模型幻觉改写医学事实。论文的控制手段包括提示词迭代优化与约 50 个少样本示例、输出与原始逐字稿的自动一致性校验、带差异的重试循环,以及实体标注后的验证环,确保不引入非预期改动。成对标注把缩写数字标点命令和中断词的两种写法显式对齐,例如论文给出带方括号的数字读法与写法对应、立方厘米缩写对应和药物实体标签示例,使转换可确定性执行,也便于分别评测每个替换。
伪标注 × 大模型纠错: 伪标注指用已有较强语音模型给无人工逐字稿的 75 小时合作方录音先生成假设文本;大模型纠错指结合人工编辑过的报告对这些假设做术语、符号、大小写和标点的修正。伪标注提供规模,大模型纠错提供质量门控,二者搭配才能把无标注音频变成可训练的监督信号,新增作用是扩大领域覆盖而不成比例增加人工听写负担。
伪标注的控制更严格,因为源假设本身可能有错。流程是先用最强语音模型生成逐字稿,再用大模型结合人工编辑报告同时纠正识别错与格式,最后计算语音稿与纠正后标注之间的词错误率并丢弃高于 15% 的录音。文本格式化训练用的含噪配对则用更严的 10% 阈值。这种双阈值设计对应不同用途,75 小时伪标注用于语音模型训练可容忍稍多噪声,30 秒级文本配对用于教格式化模型则必须更干净。
词错误率 × 医学概念错误率: 词错误率统计格式化文本上忽略标点和大小写后的词级替换删除插入,反映总体听写水平;医学概念错误率只在解剖、病情、药物和操作 4 类实体词上统计,反映临床关键信息的保真度。二者搭配的原因是通用词错得少不等于药名剂量写对,组合意义是同时考核可读性与临床可用性,避免被通用词的正确掩盖关键术语错误。
训练分几步走,参数与数据如何组织?
语音模型训练分两步,先通用后领域。通用数据用拉脱维亚语 Common Voice 19.0 的 200 多小时与 LATE-Media 近 70 小时,领域数据用 LVMED 训练集。论文比较了只用领域数据与先通用后领域的差异,发现跳过通用阶段直接在 LVMED 上微调 Whisper 效果更差,支持在领域数据有限时通用阶段有帮助。大多数模型用单块 80 GB 显存的 A100 训练,半精度为主,Gemma-3n 用脑浮点 16 与 5 乘 10 的负 5 次方初始学习率,Wav2Vec2-BERT 第一阶段学习率同样为 5 乘 10 的负 5 次方。文本格式化模型单独全量微调,不与语音模型联合反传梯度,2 阶段之间没有端到端梯度路径。
数据规模实验按 1/8、1/4、1/2 与全量切分训练集,分别训练不同尺寸的 Whisper 与 Wav2Vec2-BERT,并搭配不同尺寸的 Gemma 格式化模型,观察端到端与 2 阶段随数据量的趋势。伪标注实验把 75 小时数据与通用数据一起用于第一阶段再加领域数据,记为通用加伪标注加领域条件的 Whisper-large-v3。论文未报告优化器类型、学习率衰减 schedule、早停与随机种子等细节,这些是复现时需要补记的缺项,不能从模型名推定实现。
数据划分、基线与指标方向如何保证可比?
LVMED 数据集由 35 小时放射科语料扩展到组织病理、出院小结与外科,共 50 小时医疗口述,含遗留逐字稿与人工最终文档。划分与领域覆盖需要先看清,否则跨模态比较会失真。下表整理训练、测试与开发集的报告数、时长与主要报告类型,数字来自论文表格原行。
比较问题是同领域数据下端到端与 2 阶段谁更可用,公平条件是共用 LVMED 划分并对比通用基线,指标方向是各类错误率越低越好。
| 划分 | 报告数 | 时长小时 | 计算机断层数 | 组织病理数 |
|---|---|---|---|---|
| 训练集 | 1190 | 42.7 | 421 | 282 |
| 测试集 | 160 | 5.0 | 54 | 40 |
| 开发集 | 40 | 1.6 | 13 | 11 |
上表显示训练约 42.7 小时、测试 5 小时、开发 1.6 小时,另有带口音语音约 5 小时、0.7 小时与 0.1 小时,报告类型覆盖计算机断层、组织病理、计算机 X 线、乳腺、磁共振与其他。实体统计上训练集解剖 19123、病情 13116、药物 1388、操作 6932,测试与开发集按比例减少。这种分布说明药物实体最稀疏,药物错误率天然方差更大,解读时不能只看平均值。
基线包括未微调的 Canary、Whisper-medium、Whisper-large-v3 与拉脱维亚语 LATE 模型,均为支持富文本的通用模型。主指标是格式化词错误率,辅助指标包括逐字词错误率、字符错误率、标点错误率、标点命令错误率、数字错误率与分实体医学概念错误率。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开,复现应按论文文字与超参数重做。
主结果:领域适配带来多大改进,谁最好?
要回答的主问题是领域适配是否必要,以及端到端与 2 阶段在同数据下是否可比。公平条件是都在 LVMED 测试集上按同一模糊对齐计算格式化指标,基线为未适配的通用模型。指标方向均为越低越好。下表聚焦论文直接报告的最强配置,保留原文数值与单位写法。
| 条件 | 指标 | 通用基线 | 端到端最强 | 2 阶段最强 |
|---|---|---|---|---|
| 训练数据 | 领域加伪标注小时 | 0 | 75 | 50 加文本对 |
| 模型 | 主模型 | whisper-large-v3 | ft-whisper-large-v3 | ft-whisper-large-v3 加 gemma3-12b |
上表的主要收益是领域适配把词错误率从通用 Whisper-large-v3 的 68.6% 降到端到端微调的 11.1%,再加 75 小时伪标注进一步降到 10.6%,约为 6 倍以上改进。2 阶段最强为微调 Whisper-large-v3 逐字模型加微调 Gemma3-12b 格式化,达到 11.2% 词错误率,与端到端接近,且标点命令错误率 2.1% 为全场最好。论文同时报告端到端在标点与领域指标上全面改进,Canary 与 Gemma-3n 微调后也明显好于基线,但 Whisper 系端到端最好。
代价与反例必须同时说明。只用领域数据不用通用数据的 Whisper-large-v3 为 11.9%,差于先通用后领域的 11.1%,说明通用阶段不可省。只用通用数据训练的逐字模型加文本格式化在测试集上词错误率高达 42.5%,说明没有领域语音时光靠文本格式化救不回来。药物实体错误率在最强模型仍有 12% 左右,高于解剖与病情,反映稀疏术语仍是短板。
数据量与模型尺寸如何改变结论?
这一节回答数据规模消融问题,即在 1/8 到全量训练数据下,端到端直接生成格式文本与不同尺寸文本格式化模型搭配的逐字路线如何变化。公平条件是同一语音基座、同一划分、同一词错误率口径,指标越低越好。论文用多面板曲线展示 Whisper 不同尺寸与 Wav2Vec2-BERT 随数据量的变化,图注为跨训练数据规模与模型尺寸的词错误率。
看图路径: 1. 先确认横轴是训练数据比例 1/8 到全量,纵轴是词错误率,数值越低越好;2. 再对比红色小参数格式化模型与蓝绿色大参数格式化模型的高度差;3. 观察 whisper-small 面板中黑色端到端线在全量时的大幅下降是否孤立;4. 观察 wav2vec2-bert 面板中三条线随数据增加是否都单调下降
论文图 1。原论文 Figure 1:“WER across training data scales and model sizes.”。
上图可见的核心趋势是数据增加时所有路线总体下降,但起点与斜率不同。在小数据端,基于大模型格式化的 2 阶段线通常低于端到端线,支持文本先验在数据不足时更有帮助;到全量数据时两者收敛到相近水平。在 whisper-small 面板中,端到端线在 1/8 到 1/2 下降平缓后在全量出现较陡下降,需要结合具体数值谨慎解读,不能把单点陡降推广为普遍规律。
在 wav2vec2-bert 面板中,小参数格式化线起点明显更高,随数据增加下降更快,而大参数格式化线全程更低更平,说明格式化模型容量在小数据时更关键。像素不能精确辨别的中间步数值不硬读,结论以论文正文的总体趋势为准,即 2 阶段在少数据时占优、足数据时两者竞争,未胜出项是最小文本模型在小数据下的高错误,这正是容量不足的代价。
还剩哪些错误,哪些话不能说?
论文对最优模型 100 个错误片段做人工分析,发现最多的是句子切分与逗号放置的风格差异,在大小写一致时多不影响语义,不应全算错误。其次是术语不一致,包括拉脱维亚语与拉丁语药名变体,以及复杂术语的语音误识偶发大语义漂移。还有词边界与形态错误,多词合并、复合词拆分、发音相近但语法形式错误,以及数字区间字母数字编码的拆分错误、罗马与阿拉伯数字混用、小序数词的口语与数字形式交替。许多错误源于自发口述的不流畅,总体残留错误更多来自格式决策、术语变体与口述特性,而非普通词汇替换。
局限部分明确指出端到端与大模型后处理都有幻觉风险,在临床语境可能误识剂量或药名。本工作依赖已有验证报告做整理,若无验证报告而完全用大模型生成或校对标注,需要更多人工核验才能保证医疗准确性。自动标注的一致性仍是挑战。未测量的量不能承诺,论文未报告延迟、实时率、推理成本与误判率,因此不能说系统更快更便宜,只能说在给定单卡训练与离线评测条件下错误率下降。相关性不等于因果,通用数据有帮助是观察到的对照差异,不是证明所有通用数据都有效。
要复现先做什么,需要补哪些验证?
复现先做三件事。第一是重建数据口径,按论文把遗留逐字稿简化为只保留缩写数字标点命令与中断词的两种写法,用方括号竖线成对表示,确定性转换逻辑先用脚本验证往返一致,再跑大模型整理。第二是重建训练顺序,先通用拉脱维亚语数据 10,000 步再领域 51,000 步,语音批量 32、首阶段学习率 2 乘 10 的负 5 次方、领域减半,文本格式化批量 16、学习率 1 乘 10 的负 5 次方,Whisper 生成配置允许更多标点,单卡 80 GB 显存。
第三是重建评价,用模糊词级对齐,数字日期编码视为单 token,替换代价按相对编辑距离加权,分别计算格式化词错误率、逐字词错误率、字符错误率、标点与标点命令错误率、数字错误率与分实体医学概念错误率。下表把关键超参数集中为可执行清单。
| 阶段 | 批量 | 学习率 | 步数与过滤 |
|---|---|---|---|
| 文本格式化 | 16 | 1×10−5 | 约 30000 对 |
| 伪标注过滤 | 不适用 | 不适用 | 语音 15% 文本 10% |
上表后需要强调缺项与验证。论文未给出优化器、衰减策略、早停、种子与解码束宽,复现时应固定并记录。伪标注阈值 15% 与 10% 是论文验证过的选择,更换阈值需重做消融。实体标注用同一大模型自动加标签,复现时应抽样人工核查药物与操作两类稀疏实体。资源方面本次无可用链接,不应假设数据代码可下载,应按自有合规录音重走流程。还需补的验证包括跨医院口音与设备的泛化、标点风格一致性的人评、以及剂量数字的专项误识率,这些决定临床可用性。
何时值得尝试这套做法?
当领域语音只有几十小时、但有遗留逐字稿与部分人工终稿时,这套做法值得尝试。优先做大模型驱动的成对整理,把终稿知识蒸馏为可校验的格式化监督,再用最强语音模型加大模型纠正扩出伪标注并严格过滤。模型选择上,若数据极少可先用 2 阶段加大参数文本模型保格式,若数据达到全量则端到端与 2 阶段都可考虑,决策依据应是标点命令与药物实体的专项错误,而不仅是总词错误率。
不值得盲目照搬的情况包括无验证报告却完全信任大模型改写、把通用词错误率下降等同于剂量药名安全、以及把离线错误率改进承诺为在线延迟与成本改进。教学上应记住的核心判断是,富格式医疗转写是听准加写规范的联合任务,论文的贡献是用可复述的整理与过滤动作让小数据可用,而不是证明大模型可以替代临床校验。后续工作应补上前瞻性人评、跨模态泛化与高风险实体的专项评测,才能从论文数字走向可部署系统。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
