不改伪标签,在参数空间里纠正伪标签:Pseudo2Real 的跨口音修正向量
针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。
针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。
针对十种非洲低资源语言的转写任务,PUMA 用冻结的 wav2vec 2.0 特征加可训练的通用语言投影与语言令牌和 CTC 训练,在同时训练平均词错误率 0.314 上报告优于 MMS 的 0.419 和 Whisper-large 的 0.339,代价是零样本下仍落后于 7B 量级系统且阿拉伯语等难语言更依赖语言令牌。
针对端到端转写丢失时间信息的问题,该研究用谱重力初始化加截止时间限制的期望最大化估计每帧共振峰并做语音切分,在爱尔兰语、特威语和沃提克语上以零样本方式取得高同质性和可比的归一化互信息,但对鼻音和滑音等过渡音仍存在过切分代价。
针对同时有内部听觉与外部转写建议时朴素融合反而变差的问题,论文用可学习的内部、外部、重写三种动作先裁决再生成,在七个语音识别集与多域音频问答上报告了可运行策略的改进,但重写类样本稀少仍是主要代价。
论文把新语言低资源表示学习定义为跨语言元学习,用多任务自适应预训练构造适应 эпизод并以一阶双层优化实现可扩展更新,在三语平均上用 1 小时无标注适应追平 6000 小时域内上限,但零样本起点变弱且外环仍依赖源语言音素标注。
针对多人重叠会议中内容、说话人与时间边界相互纠缠的问题,TagSpeech 用解耦的语义与说话人双流加交错数字时间锚统一解码,在 AMI 与 AliMeeting 上以只训练投影层的低成本取得 diarization 误差的明显下降,但重叠区外的时间边界精度仍不及专用级联系统。
针对多人对话中谁在何时说话与内容难以联合对齐的问题,TellWhisper 在语音编码器内用时间说话人旋转位置编码联合建模时间与说话人活动,并用双曲空间说话人日志估计帧级活动,在真实会议数据上取得内容加说话人加时间的一致改进,但支持说话人数限于 1 至 4 人且编码器与双曲分类器仍处在不同几何空间。
针对吴语语音数据极少、无公开基准和可用模型的问题,论文用约 8000 小时多维自动标注语料加人工基准与分阶段模型验证,在识别与理解任务上大幅降低误差并提升翻译与属性判断,但数据分布不均与自动标注噪声仍限制泛化。
针对非言语事件只知有无、不知在词何处的问题,论文以 21 类离散与连续事件的词级转写为目标,用位置感知的评测解耦词错与事件错,并以 1700+ 小时弱标注训练得到强基线,在保持词错误率基本稳定的代价下把宏平均 F1 做到 38.0%。
该文把音位识别错误转到 39 维区别特征空间做可复述诊断,报告跨 12 种语言替换错误中位距离 4 对随机基线 9、平均差约 2.8 且 PS 约 0.64,代价是只分析替换错误并依赖 soundvectors 特征与自举区间判断。
针对跨文化理解所需的野外视频多语转写问题,论文用易复用的 Whisper 与 WhisperX 流水线加字幕挖掘与重切分,报告七语平均约 30% 错误经数十至二百小时微调降至约 21.7%,代价是幻觉插入与字幕参考不完美及发布受限。
针对 Qwen3-ASR-0.6B 的 18 层音频编码器,X-AuT 用短预算行为探针选择可恢复层组合,再经表示对齐、跨尺度蒸馏与 LoRA 微调分两跳压到 14 层,单次运行显示 16 层宏平均误差从 5.61% 降到 5.27%,14 层为 5.75% 且音频塔参数减少 20.7%。
针对阿拉伯语标准语与多方言零样本识别落差,论文用解码器提示、编码器加解码器前缀和 CTC 代理引导 n-best 重选三种免训练上下文接入,在十个条件下取得 MSA 相对 22.29% 等词错率下降,代价是首遍解码、检索与合成带来的额外延迟与对辅助信号质量的依赖。
AfriVox 用 20 种非洲语言与 100 多种非洲英语口音同时考转写与到英语翻译,对比单模态识别翻译模型与多模态语音大模型,发现转写仍是单模态更准而翻译是多模态占优,且用约每语言 280 小时微调 Qwen2.5-Omni 可大幅降低三门尼日利亚语言的错误率,但代价是噪声与自发口语下全系模型仍明显退化。
论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。
该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。
该文把线性探测、logit lens 与激活干预搬到 Whisper 与 Qwen2-Audio 上,追踪声学与语义表征如何随层演化,最强证据是解码器残差流可达 93.4% 幻觉判别与交叉注意力单头干预抑制 78.1% 重复,代价是合成语境偏置集与小规模探测集限制了泛化结论。
针对 Whisper 类模型在噪声与口音下置信度不可靠的问题,论文用可学习解码器提示加温度采样产生候选并以 CLAP 音频文本相似度做奖励做单样本强化更新,在 LibriSpeech 加噪与 L2-Arctic 上把平均词错误率降到 28.64% 与 28.21%,代价是每次推理需多轮采样打分并在样本后恢复参数。
BuzzASR 用单语微调与分词器替换加文本多任务两条路线适配 102 种语言,在 77 种语言上超过 Whisper-large-v3 并在 27 种语言上达到开源最优,代价是逐语维护模型与域内评测带来的可比性限制。
该文把埃及阿拉伯语 CHILDES 的国际音标转写为全带符 CODA 正字法并加上引理与核心词性,得到约 2.6 万词例的语料,并在形态消歧与语音识别上给出基线,代价是语料规模小且 GPT-4o 初转写准确率低、需大量人工校对。