论文解读

不改伪标签,在参数空间里纠正伪标签:Pseudo2Real 的跨口音修正向量

针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。

 · 更新于 2026-09-25 · 约 19 分钟 · 9357 字 阅读 →
论文解读

不用每语一个适配器:PUMA 以共享投影加语言令牌做多语 ASR

针对十种非洲低资源语言的转写任务,PUMA 用冻结的 wav2vec 2.0 特征加可训练的通用语言投影与语言令牌和 CTC 训练,在同时训练平均词错误率 0.314 上报告优于 MMS 的 0.419 和 Whisper-large 的 0.339,代价是零样本下仍落后于 7B 量级系统且阿拉伯语等难语言更依赖语言令牌。

 · 更新于 2026-09-25 · 约 18 分钟 · 8773 字 阅读 →
论文解读

先看清频谱能量再迭代:谱重力共振峰估计如何换取带时间的音素切分

针对端到端转写丢失时间信息的问题,该研究用谱重力初始化加截止时间限制的期望最大化估计每帧共振峰并做语音切分,在爱尔兰语、特威语和沃提克语上以零样本方式取得高同质性和可比的归一化互信息,但对鼻音和滑音等过渡音仍存在过切分代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10080 字 阅读 →
论文解读

不急着融合:用显式动作先决定信谁再转写

针对同时有内部听觉与外部转写建议时朴素融合反而变差的问题,论文用可学习的内部、外部、重写三种动作先裁决再生成,在七个语音识别集与多域音频问答上报告了可运行策略的改进,但重写类样本稀少仍是主要代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8586 字 阅读 →
论文解读

只给一小时新语言音频:把快速适应做成内外环分工的语音表示学习

论文把新语言低资源表示学习定义为跨语言元学习,用多任务自适应预训练构造适应 эпизод并以一阶双层优化实现可扩展更新,在三语平均上用 1 小时无标注适应追平 6000 小时域内上限,但零样本起点变弱且外环仍依赖源语言音素标注。

 · 更新于 2026-09-25 · 约 21 分钟 · 10261 字 阅读 →
论文解读

谁在何时说了什么:用双流解耦与数字时间锚做联合识别与 diarization

针对多人重叠会议中内容、说话人与时间边界相互纠缠的问题,TagSpeech 用解耦的语义与说话人双流加交错数字时间锚统一解码,在 AMI 与 AliMeeting 上以只训练投影层的低成本取得 diarization 误差的明显下降,但重叠区外的时间边界精度仍不及专用级联系统。

 · 更新于 2026-09-25 · 约 20 分钟 · 9666 字 阅读 →
论文解读

把谁和何时放进编码器:TellWhisper 的时间说话人联合建模

针对多人对话中谁在何时说话与内容难以联合对齐的问题,TellWhisper 在语音编码器内用时间说话人旋转位置编码联合建模时间与说话人活动,并用双曲空间说话人日志估计帧级活动,在真实会议数据上取得内容加说话人加时间的一致改进,但支持说话人数限于 1 至 4 人且编码器与双曲分类器仍处在不同几何空间。

 · 更新于 2026-09-25 · 约 18 分钟 · 8841 字 阅读 →
论文解读

吴语没有数据就没有模型:用八千小时多维标注把理解与生成一起补齐

针对吴语语音数据极少、无公开基准和可用模型的问题,论文用约 8000 小时多维自动标注语料加人工基准与分阶段模型验证,在识别与理解任务上大幅降低误差并提升翻译与属性判断,但数据分布不均与自动标注噪声仍限制泛化。

 · 更新于 2026-09-25 · 约 19 分钟 · 9033 字 阅读 →
论文解读

词级定位而非句级知道:WESR 把笑声哭声放回词的位置

针对非言语事件只知有无、不知在词何处的问题,论文以 21 类离散与连续事件的词级转写为目标,用位置感知的评测解耦词错与事件错,并以 1700+ 小时弱标注训练得到强基线,在保持词错误率基本稳定的代价下把宏平均 F1 做到 38.0%。

 · 更新于 2026-09-25 · 约 21 分钟 · 10205 字 阅读 →
论文解读

出错时才见结构:神经语音模型的音位混淆是局部且不对称的

该文把音位识别错误转到 39 维区别特征空间做可复述诊断,报告跨 12 种语言替换错误中位距离 4 对随机基线 9、平均差约 2.8 且 PS 约 0.64,代价是只分析替换错误并依赖 soundvectors 特征与自举区间判断。

 · 更新于 2026-09-25 · 约 19 分钟 · 9069 字 阅读 →
论文解读

野外视频多语转写为何开箱约三成错误:Whisper 与 WhisperX 的可复用流水线

针对跨文化理解所需的野外视频多语转写问题,论文用易复用的 Whisper 与 WhisperX 流水线加字幕挖掘与重切分,报告七语平均约 30% 错误经数十至二百小时微调降至约 21.7%,代价是幻觉插入与字幕参考不完美及发布受限。

 · 更新于 2026-09-25 · 约 16 分钟 · 7941 字 阅读 →
论文解读

剪层扰动解码接口后如何恢复:X-AuT 的渐进压缩与跨尺度蒸馏

针对 Qwen3-ASR-0.6B 的 18 层音频编码器,X-AuT 用短预算行为探针选择可恢复层组合,再经表示对齐、跨尺度蒸馏与 LoRA 微调分两跳压到 14 层,单次运行显示 16 层宏平均误差从 5.61% 降到 5.27%,14 层为 5.75% 且音频塔参数减少 20.7%。

 · 更新于 2026-09-25 · 约 8 分钟 · 3529 字 阅读 →
论文解读

不更新参数如何让阿拉伯方言识别变准:提示、前缀与代理重排的三条推理时通路

针对阿拉伯语标准语与多方言零样本识别落差,论文用解码器提示、编码器加解码器前缀和 CTC 代理引导 n-best 重选三种免训练上下文接入,在十个条件下取得 MSA 相对 22.29% 等词错率下降,代价是首遍解码、检索与合成带来的额外延迟与对辅助信号质量的依赖。

 · 更新于 2026-09-25 · 约 22 分钟 · 10589 字 阅读 →
论文解读

宣称支持不等于可用:AfriVox 测出非洲语言与口音下的转写崩塌与翻译分化

AfriVox 用 20 种非洲语言与 100 多种非洲英语口音同时考转写与到英语翻译,对比单模态识别翻译模型与多模态语音大模型,发现转写仍是单模态更准而翻译是多模态占优,且用约每语言 280 小时微调 Qwen2.5-Omni 可大幅降低三门尼日利亚语言的错误率,但代价是噪声与自发口语下全系模型仍明显退化。

 · 更新于 2026-09-25 · 约 19 分钟 · 9024 字 阅读 →
论文解读

背景噪声也能操纵语音大模型:从数字优化到空中播放的定向与非定向攻击

论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。

 · 更新于 2026-09-25 · 约 21 分钟 · 10264 字 阅读 →
论文解读

把混叠的音频表示拆开:AudioSAE 用稀疏自编码器解剖 Whisper 与 HuBERT

该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。

 · 更新于 2026-09-25 · 约 21 分钟 · 10239 字 阅读 →
论文解读

编码器也懂语义:语音识别内部何时偏向语境而非声音

该文把线性探测、logit lens 与激活干预搬到 Whisper 与 Qwen2-Audio 上,追踪声学与语义表征如何随层演化,最强证据是解码器残差流可达 93.4% 幻觉判别与交叉注意力单头干预抑制 78.1% 重复,代价是合成语境偏置集与小规模探测集限制了泛化结论。

 · 更新于 2026-09-25 · 约 18 分钟 · 8540 字 阅读 →
论文解读

不用真值也能改口音和噪声错误:以音频文本对齐奖励做测试时强化适应

针对 Whisper 类模型在噪声与口音下置信度不可靠的问题,论文用可学习解码器提示加温度采样产生候选并以 CLAP 音频文本相似度做奖励做单样本强化更新,在 LibriSpeech 加噪与 L2-Arctic 上把平均词错误率降到 28.64% 与 28.21%,代价是每次推理需多轮采样打分并在样本后恢复参数。

 · 更新于 2026-09-25 · 约 18 分钟 · 8818 字 阅读 →
论文解读

以单语微调对抗多语诅咒:BuzzASR 的百语种适配路线

BuzzASR 用单语微调与分词器替换加文本多任务两条路线适配 102 种语言,在 77 种语言上超过 Whisper-large-v3 并在 27 种语言上达到开源最优,代价是逐语维护模型与域内评测带来的可比性限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9283 字 阅读 →
论文解读

把只有发音的埃及儿童对话变成可计算的带符正字法:ARABABYTALK-EGY 如何标注与设基准

该文把埃及阿拉伯语 CHILDES 的国际音标转写为全带符 CODA 正字法并加上引理与核心词性,得到约 2.6 万词例的语料,并在形态消歧与语音识别上给出基线,代价是语料规模小且 GPT-4o 初转写准确率低、需大量人工校对。

 · 更新于 2026-09-25 · 约 17 分钟 · 8252 字 阅读 →