英文题目:The Impact of Informal Persian Speech on Low-Resource ASR and Speech Translation
会议身份:
conference:interspeech:2026:conference-paper-id:alizadeh26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据集 #SFT #低资源 #语音识别 #语音翻译
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Hadi Alizadeh:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Asgari:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Sadegh Mehrabikia:机构信息未能从会议 PDF 纯文本可靠映射
- Amir Koohnavard:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
波斯语语音识别(Automatic Speech Recognition,ASR)与语音翻译(Speech Translation,ST)的输入是含混响、音乐与背景噪声的影视口语音频,输出为波斯语转写与英语译文,难点在于口语缩读与非标准词汇和正式体转写失配导致声文对齐噪声,如正式体/mi: xO:hæm/对应口语/mi:xOm/。本文构建口语平行语料Toorintan-Persian Informal Dataset(T-PID)并配套波斯语文本规范器(Normalizer),先经两阶段影视片段筛选切分与人工口语一致转写得到音频优先对齐文本,再用机器翻译生成英文并过滤与抽检校正,最后微调Whisper与Wav2Vec2-BERT做识别级联微调后NLLB-200做翻译。与仅用正式朗读语料训练的基线相比,该链条以忠实口语转写缓解声文失配,以音频优先采集适配基于连接时序分类(Connectionist Temporal Classification,CTC)的帧级建模。在T-PID测试集4.59小时2845条划分上,微调后Wav2Vec2-BERT取得29.09%词错率(Word Error Rate,WER)与级联25.30 BLEU,显著优于未微调基线。结论限于影视口语域与级联式翻译,未验证端到端翻译与跨方言外推。原文未披露训练、推理或部署成本,数据集以CC BY-NC 4.0在Hugging Face发布。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么波斯语的日常口语会难倒识别系统?
这篇论文研究的是低资源条件下的波斯语自动语音识别和语音翻译。输入是真实录制的波斯语语音,目标是输出准确的波斯语转写,并进一步输出英语译文。初学者首先要理解,语音识别不只是听清声音,还要把声音与文本标签对齐。如果标签写的是正式书面语,而人实际说的是口语缩读,模型就会学到错误的对应关系。论文举了一个具体例子,正式说法 mi: xO:hæm 对应口语 mi:xOm,日常生活中后者更常见。
若训练数据长期只给正式文本,模型在真实对话中就会频繁出错。更麻烦的是,现有波斯语料大多来自朗读、新闻或访谈,缺少自发的非正式对话。因此论文的目标很明确:补一块口语优先、转写与发音同语体、还带有英语译文的平行语料,并验证它能否同时改善识别和翻译。需要保留的关键信息是语料规模约 36.77 小时、22443 句、男女大致均衡,以及后续微调使用的模型家族和评测指标方向。
已有波斯语和多语语料各解决了什么,还缺什么?
论文先梳理了波斯语单语语料。法尔斯达特语料提供音素均衡的朗读句,但规模小且年代早。迪普迈恩库规模较大,包含波斯语和英语录音,但主要服务于说话人验证和正式场景下的识别。阿尔曼视听语料约 220 小时、1760 名说话人,支持唇读和视听识别,但多为访谈式录制,影视剧等野外内容因机位变化、多人重叠和背景噪声而可用比例不足 10%。论文用一张对照表说明这些语料都不是自发口语,也没有平行译文。
接着看多语语料。弗勒尔斯覆盖 102 种语言,是朗读式语音。通用语音通过众包收集朗读,提示文本来自公有领域。共话语音翻译第二版基于通用语音的校验片段,再请专业译者提供译文。论文指出,这些资源虽然包含波斯语,但本质仍是照着文本念,括号里的内容也会照念,不能反映方言变化、缩减发音和非标准词汇。
所以缺口不是没有波斯语音,而是没有非正式口语加高质量转写加英语译文的三元组。这正是后续自建语料的直接动机。
失配具体发生在哪里,为什么必须同语体转写?
把问题拆成 3 步。第一步是声学到文本的映射。模型需要从每 1 帧语音特征预测对应字符或词。若音频是口语缩读而标签是正式完整形式,同一段声音会被迫对齐到更长或不同的字符序列,相当于人为加入标签噪声。第二步是训练动态。
噪声标签会抬高错误率,使收敛不稳定,尤其在数据量本来就少的低资源语言中影响更大。第 3 步是评测与部署。实验室用正式朗读集评测分数好看,但部署到影视对话、日常聊天时遇到缩读、习语和背景混响,错误会集中爆发。论文的判断是,必须保证所说语体与所写语体一致。做法就是听到什么口语就写什么口语,并用标点保留自然语流,而不是把口语翻译成书面语后再训练。
这个原则贯穿了后续的采集、转写规范和文本清洗。教学上可以这样记:先解决标签是否忠实于声音,再谈模型结构是否先进。
论文用一条什么路线同时改善识别与翻译?
论文没有提出全新网络结构,而是走数据加适配路线。全景可以分成 4 段。第一段是构建托林坦波斯语非正式数据集,简称 T-PID,从伊朗影视节目中挑选有大量公开音频的说话人,截取单人无重叠片段,再由熟悉波斯语口语的标注员按实际发音转写。第二段是生成英语译文,先对比多个机器翻译系统在口语子集上的流畅度和语境准确性,选中恰特 GPT-4o 迷你版翻译全部转写,再做过滤和抽检。
第三段是针对性文本规范,处理括号、非波斯语词和前后不一致的写法,并发布一个通用波斯语规范器。第 4 段是微调与评测,把惠斯珀小模型、惠斯珀中模型和 Wav2Vec2-BERT 放在 T-PID 上做识别微调,把无语言被落下 200 模型放在 T-PID 文本上做翻译微调,再用级联方式评测语音到英语的端到端效果。沿一个样本走一遍就是:一段约 6 秒的影视对白音频进入,先得到口语一致的波斯语转写,再得到英语译文,两个环节都可用 T-PID 的平行真值监督。
识别端如何保证听到什么就写什么?
识别端包含 3 个可操作环节。第一个是片段选择。10 名标注员先定位说话人在影视中的出场,只保留单人出现且无重叠语音的区间,精确记录起止时间。允许保留背景噪声、混响和音乐,因为目标就是野外条件。第二个是转写。
15 名标注员按统一指南听写,要求标点反映口语语气,不把口语改写为正式体。3 人质检组全程监督。第 3 个是与音频对不上的清洗。例如有人照念括号内文本,有人不念,论文按是否实际发声决定保留文本还是连括号一起删;遇到非波斯语词则手工替换为波斯语对应词。
前后粘连的词缀则保持原样不做统一。白话说,自动语音识别就是把声音变成文字的模块,词错误率就是数错了多少词,越低越好。论文反复强调,口语优先的采集使语音文本对齐更紧,这对显式建模帧与字符对齐的联结时序分类结构尤其重要。
自动语音识别 × 语音翻译: 自动语音识别负责把波斯语音频转写为与实际发音一致的波斯语文本,语音翻译在此基础上再把该文本译为英语;二者搭配的理由是级联管线中识别错误会直接传给翻译,因此论文先用口语一致的转写保证声学文本对齐,再用同一批平行文本微调翻译模型,组合意义是同时降低识别端的幻觉和翻译端的领域失配。
翻译端和规范器各自解决什么问题?
翻译端和规范器是两个不同分工。翻译端的输入是波斯语转写,输出是英语译文。论文先用机器翻译批量生成,再做两层质量控制。一层是过滤掉时长过短或语义太少、不值得翻译的片段。另一层是对习语、文化指代和谚语做定向随机抽查和修正,并从 22443 句中随机抽 400 句做系统抽检,报告修改对应的词错误率为 4%,据此认为只需小幅后编辑,不必全部重标。
白话说,BLEU 是看机器译文与参考译文有多像的分数,越高越好。规范器的输入是原始转写文本,输出是格式统一、可直接训练和评测的文本。它处理括号、语言混杂等在不同语料中规则不同的细节。论文指出,惠斯珀原文附录建议删括号内短语,但这不适用于通用语音等朗读集,因此在不同评测集上采用不同括号处理,并在 T-PID 实验中把修正纳入流程。规范器已随论文发布,便于复现相同的清洗。
词错误率 × BLEU: 词错误率分工是衡量识别转写与参考文本之间的词语差异,数值越低越好,BLEU 分工是衡量机器译文与参考译文的 n 元组重合程度,数值越高越好;二者搭配的理由是论文采用先识别后翻译的级联结构,必须分别回答听得准不准和译得像不像,组合意义是能区分增益来自识别端还是翻译端。
举一个例子走完音频到译文的全链路
用一个教学例子帮助复述,注意这只是例子,不代表论文中的真实语句。假设输入是一段 5 秒的影视对白,背景有轻微音乐,说话人用口语快速说出一句日常表达。第一步表示,音频被切成单个波形文件,对应一条波斯语口语转写和一条英语译文。第二步组件,识别模型从波形提取声学特征,输出波斯语口语文本,要求与缩读发音一致,而不是输出正式改写。第 3 步目标,翻译模型把该口语文本译为英语,要求保留习语含义。
第四步输出,系统同时给出波斯语转写和英语译文,可分别用词错误率和 BLEU 打分。如果识别把口语缩读听成正式词,翻译就会基于错误输入继续错下去,这就是级联误差传递。论文选择级联而不是端到端直译,正是为了能分别定位识别端和翻译端的增益。例子讲完后,回到论文事实:真实数据平均每句波斯语约 68.05 字符、14.24 词,英语约 92.10 字符、17.93 词,英语更长符合翻译膨胀的自然现象。
语料是如何从 58 小时筛到 36.77 小时的?
这一节承担方法中的构造职责,论文本身没有训练新声学结构,训练主要指数据构建和后续微调的数据准备。采集分 2 个阶段。第一阶段是选人和定时,10 人团队找影视说话人并标注单人片段起止时间。第二阶段是切音频和转写,按时间戳切出独立片段,随机分给 15 名标注员听写,3 人质检。接着是翻译与质控。
机器翻译选型后批量翻译,再过滤低质片段,对复杂语言现象定向检查。论文报告最初收集约 58 小时,经过系统剪枝和质控后保留 36.77 小时可用音频,共 22443 句。性别分布为男声 11244 句、女声 11199 句,时长分别为约 19.06 小时和 17.72 小时,比例均衡。最终格式很直接:每个波形文件配一条波斯语转写和一条英语译文,可直接用于识别、机器翻译和语音翻译 3 类任务。
下面先看时长分布图,再解释它对训练的意义。该图是本次收到的官方像素,应按像素描述为准。
看图路径: 1. 先看饼图各扇区的时长区间标签与百分比,确认 4-6 秒与 2-4 秒是占比最大的两块;2. 再看小于 2 秒或大于 20 秒的极小扇区,确认长尾极短与极长样本很少;3. 最后结合平均 5.90 秒的报告,判断该分布适合短句高效训练
论文图 1。原论文 Figure 1:“Distribution of Utterance Durations.”。
从像素看,这是一张饼图,扇区按时长区间划分。最大两块是 4-6 秒占 33.5% 和 2-4 秒占 25.7%,其次是 6-8 秒占 17.6%、10-20 秒占 12.6%、8-10 秒占 10.4%,小于 2 秒或大于 20 秒仅占 0.2%。结合正文报告的平均 5.90 秒,可以判断语料以短句为主,长尾很少。这种分布有利于批量训练和高效处理,也意味着模型主要学到的是短时口语轮次,对超长独白的覆盖有限。
正式语体 × 非正式语体: 正式语体指新闻播报和朗读文本中规范完整的波斯语写法,非正式语体指日常对话中缩减发音和口语词汇;二者搭配的理由是波斯语中同一意思在两种语体下发音和拼写明显不同,若音频是口语而转写是正式体会造成对齐噪声,组合意义是论文坚持口语怎么说就怎么写,使声学信号与文本标签严格同语体。
划分、基线、指标和清洗条件是否可比?
实验按划分、基线、指标和清洗四项交代。划分上,训练集 29.52 小时,验证集 2.66 小时,测试集 4.59 小时,训练说话人 1012 名,验证 334 名,测试 831 名。指标上,识别用词错误率,越低越好,翻译用 BLEU,越高越好。基线包括未微调的惠斯珀小模型和中模型,以及在 T-PID 上微调后的惠斯珀小模型、中模型和 Wav2Vec2-BERT,翻译端对比无语言被落下 200 的基础版与微调版。论文还引用惠斯珀原文报告的端到端分数作为参照。
清洗条件需要特别注意:不同数据集的括号处理不同,弗勒尔斯只去括号保留文本,共话语音翻译第二版则连括号带内容一起删,T-PID 按是否实际发声决定去留。比较时必须在同一清洗下进行,否则词错误率和 BLEU 的差值不可比。困惑度用波斯语 GPT-2 计算,声学条件用语音混响调制能量比衡量。
下面先看字符数分布图,再解释它对评测的提示。该图是本次收到的官方像素。
看图路径: 1. 先对照右上角图例,确认蓝色为波斯语、橙色为英语的字符数分布;2. 再沿横轴字符数从左向右看峰位,确认英语峰整体右移说明译文更长;3. 最后看 200 字符以上的右尾,确认英语长尾明显厚于波斯语
论文图 2。原论文 Figure 2:“Histogram of Persian and English Transcripts by Character Count.”。
从像素看,横轴是字符数,纵轴是频数,蓝色为波斯语,橙色为英语。两组分布都呈右偏,峰值集中在 40-70 字符附近,英语峰略向右移,200 字符以上的右尾英语明显更厚。这与正文报告的平均字符数一致,说明英语译文系统性更长。复现时应注意,长尾样本会拉高翻译难度,评测 BLEU 时不宜只看平均值,还应关注长句表现。
下表提出一个可核对问题:在相同划分下,各子集的时长、句数与说话人数是否满足训练充分、验证调参、测试可信的分工,表中数字直接来自正文连续原句。
| 划分 | 语音时长 | 男声语句数 | 女声语句数 | 说话人数 |
|---|---|---|---|---|
| 训练集 | 29.52 hours | 9507 | 9465 | 1012 |
| 验证集 | 2.66 hours | 311 | 315 | 334 |
| 测试集 | 4.59 hours | 1426 | 1419 | 831 |
表后解释如下。训练集时长和句数最多,说话人过千,能覆盖较多口语变化。验证集仅 2.66 小时,适合调参但不适合做细粒度对比。测试集 4.59 小时、2845 句、831 名说话人,说话人多样性较好,报告的跨域泛化有一定可信度。代价是验证集较小,超参数选择可能不稳定。未胜出或未评测的边界是,论文没有报告按性别或按噪声等级切分的分数,因此不能断言男女声或强噪声下同样均衡。
非正式数据微调后识别错得更少了吗?
识别主结果显示,微调带来明确改善,但不同模型的起点和终点不同。未微调的惠斯珀基线在 T-PID 测试集上词错误率极高,论文解释为幻觉效应,即模型在自发、多样声学条件下生成无关文本。微调后,惠斯珀小模型和中模型在 T-PID 上大幅下降,说明领域适配减少了幻觉。表现最好的是基于联结时序分类的 Wav2Vec2-BERT 微调版,它在 3 个测试集上都取得最低词错误率。
论文报告的具体数字为,微调后惠斯珀小模型在通用语音、弗勒尔斯和 T-PID 上的词错误率分别为 45.57、38.35 和 37.48,惠斯珀中模型分别为 43.96、35.03 和 36.25,Wav2Vec2-BERT 微调版分别为 30.45、16.48 和 29.09。需要强调的是,论文说明没有可用的波斯语 Wav2Vec2-BERT 基础检查点,按官方指南必须先适配目标语言再评测,因此只报告微调结果,没有该模型的未微调基线。总体判断是,在非正式口语上微调不仅改善域内表现,还能泛化到相对正式的朗读集。限制是,绝对错误率仍不低,尤其惠斯珀在通用语音上仍在 40% 以上,说明低资源口语识别远未解决。
微调 × 文本规范化: 文本规范化分工是把括号、非波斯语词等与音频不一致的符号统一处理,减少评测时的虚假错误,微调分工是在 T-PID 音频和文本上继续更新已有语音与翻译模型的参数以适应口语分布;二者搭配的理由是若不先清洗标签,微调会学到错误的对齐,组合意义是先保证标签可学,再让模型真正适应非正式分布。
增益来自识别端还是翻译端,文本难度如何佐证?
这一节把级联翻译拆开看,并用文本和声学复杂度做佐证。级联管线固定为识别输出直接送入翻译,识别端用 3 组微调后的语音模型,翻译端对比基础版与微调版无语言被落下 200。结果是,无论识别端用哪一个,翻译端微调都带来提升。在弗勒尔斯上,惠斯珀小模型管线从 5.62 升到 13.78,中模型从 5.61 升到 14.42,Wav2Vec2-BERT 从 8.60 升到 21.41。在共话语音翻译第二版上,3 组分别从 14.02 升到 16.54、从 14.10 升到 16.77、从 16.63 升到 20.69。
在 T-PID 测试集上,Wav2Vec2-BERT 管线从 11.96 升到 25.30,为全表最高。论文还引用惠斯珀原文端到端分数作为参照,中模型在两集上为 15.0 和 15.5,小模型为 5.8 和 4.9。
下表聚焦上述可运行的级联组合,比较问题是:在同一识别输出下,仅把翻译模型从基础版换成 T-PID 微调版,BLEU 是否一致提升,表中数字来自正文连续原句。
| 测试集 | 识别模型 | 基线 BLEU | 微调后 BLEU | 翻译模型变化 |
|---|---|---|---|---|
| FLEURS | Whisper-small | 5.62 | 13.78 | NLLB-200 基础版换微调版 |
| FLEURS | Whisper-medium | 5.61 | 14.42 | NLLB-200 基础版换微调版 |
| FLEURS | Wav2Vec2-BERT | 8.60 | 21.41 | NLLB-200 基础版换微调版 |
| CoVoST2 | Whisper-small | 14.02 | 16.54 | NLLB-200 基础版换微调版 |
| CoVoST2 | Whisper-medium | 14.10 | 16.77 | NLLB-200 基础版换微调版 |
| CoVoST2 | Wav2Vec2-BERT | 16.63 | 20.69 | NLLB-200 基础版换微调版 |
| T-PID | Wav2Vec2-BERT | 11.96 | 25.30 | NLLB-200 基础版换微调版 |
表后解释如下。主要收益是翻译端微调在 3 个测试集上全部正向,尤其 T-PID 上翻倍,说明平行口语文本对翻译适配很关键。具体代价是,最大 BLEU 仍依赖最好的识别前端,Wav2Vec2-BERT 始终领先,说明识别误差仍是天花板。未胜出的边界是,论文没有给出只微调识别、不微调翻译的完整对照,也没有端到端直译模型的可比分数,因此不能说级联一定优于端到端。
文本与声学佐证显示,T-PID 困惑度为 557.53,高于通用语音的 265.89 和弗勒尔斯的 114.09,说明语言更多样更难预测。语音混响调制能量比上,T-PID 为 6.992,通用语音为 6.898,弗勒尔斯为 6.533,前两者接近。论文的解释是,T-PID 采用先有音频再精确转写的音频优先方式,对齐更紧,这可能帮助了显式对齐的联结时序分类模型。表述上应记为支持而非证明,因果待验证。
困惑度 × 语音混响调制能量比: 困惑度分工是用波斯语 GPT-2 衡量文本可预测性,越高说明语言更多样更难预测,语音混响调制能量比分工是从声学侧衡量录音混响与清晰条件;二者搭配的理由是论文要解释为何基线在 T-PID 上更差,需要同时看文本难度和声学条件,组合意义是把语言复杂性与录音条件分开,避免把高错误率简单归为噪音大。
哪些结论还不能下,哪些细节可能影响复现?
首先是数据来源的局限。音频来自影视节目,虽然说话人和场景多样,但仍是表演性对白,不能等同于完全自然的日常对话。片段允许背景噪声和混响,但没有按噪声等级分层报告,因此不能推断强噪声下的表现。其次是翻译质量的局限。英语译文由机器批量生成,仅做 400 句随机抽检和习语定向检查,修改对应的词错误率为 4%。
这支持小幅修正即可用的判断,但不等于人工级平行语料,习语和谚语的残留错误可能影响 BLEU 的绝对解释。第三是文本规范的不完全统一。词缀粘连问题明确未规范,非波斯语词靠手工替换,不同数据集的括号规则也不同。若复现时用另一套清洗,词错误率和 BLEU 会直接变化。第四是模型报告的不对称。
Wav2Vec2-BERT 没有波斯语基础检查点,只能看微调后分数,无法计算该模型自身的微调增量。最后是成本缺项。论文没有报告训练时长、硬件、推理延迟和解码参数,因此不能承诺延迟或成本得到改善。总体趋势不等于每组都成立,引用时应限定条件。
要复述和复现这项工作,先做什么?
复述时先按依赖顺序讲:任务失配例子、T-PID 三元组格式、2 阶段采集与质检、机器翻译加抽检、括号与语言混杂清洗、识别与翻译分别微调、级联评测与双指标。复现时第一步是拿到划分。训练、验证和测试的时长与句数已在上表给出,可按 29.52 小时、2.66 小时和 4.59 小时核对切分是否一致,并检查说话人是否跨集泄漏,论文报告说话人数分别为 1012、334 和 831,但未明确是否互斥,这是需要补验证的一项。第二步是统一文本清洗。
必须复刻论文的括号规则和非波斯语替换,否则分数不可比,并记录所用规范器版本。第 3 步是固定评测。识别用词错误率,翻译用 BLEU,翻译端对比基础版与微调版无语言被落下 200,识别端至少跑通惠斯珀小模型和中模型的微调前后对照。关于可用性,论文正文写数据集与工具已在抱脸平台公开,但本次没有收到来源绑定且完成安全验证的资源,因此不能写当前可用或已公开,只能说原文给出一个抱脸链接,复现前需自行确认该链接当前是否可达。
许可证在致谢部分写为知识共享署名非商业性 4.0 版本,引用时应遵守。
何时值得尝试这条口语优先路线?
当目标语言存在明显的正式与非正式分化,且现有语料以朗读和新闻为主时,这条路线值得尝试。做法是优先保证转写与发音同语体,再做小规模但对齐精确的平行语料,最后分别适配识别和翻译。论文的证据支持,在 36.77 小时量级上,微调可以在域内和跨域同时带来改善,Wav2Vec2-BERT 的联结时序分类结构在该对齐更紧的数据上表现最好。
但这不意味着数据越多越好或任何口语都有用,论文的增益建立在单人无重叠切分、3 人质检、过滤低质片段和定向修正习语等具体动作上。若复现时跳过这些动作,噪声标签可能抵消口语数据的优势。还需补的验证包括:按噪声、性别和句长分层报告,按说话人是否见过来划分泛化,以及补上训练与推理开销。记住核心判断:先让标签忠实于声音,再让模型适应口语分布。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

