论文解读

打乱顺序仍能听对:语音模型依赖局部特征与冗余线索

针对音频对抗样本跨模型迁移弱的问题,论文先用时间打乱与可解释性热图证明三类语音模型依赖局部时序与冗余特征,再提出可叠加的时间打乱梯度增强框架,在九个模型上取得更强的迁移效果,但粒度错配与权重过大会带来波动与额外开销。

 · 更新于 2026-09-25 · 约 16 分钟 · 7967 字 阅读 →
论文解读

越南语识别缺的不是模型,而是可复用的清洗与对齐流水线

该文针对越南语开源语音文本对质量杂、格式不一、缺词级时间戳的问题,提出七步聚合清洗与对齐流水线,用约 502.67 小时高质量数据把微调后模型正字法词错误率降到 12.46%,代价是严格过滤丢掉约 38% 采样数据且仍偏向北部口音。

 · 更新于 2026-09-25 · 约 19 分钟 · 9235 字 阅读 →
论文解读

用投票与多维标注把粤语长音频做成可训练语料

针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8914 字 阅读 →
论文解读

在词元空间同时回答谁在说、说了什么、何时说:WhisperDiari 的联合建模

针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9303 字 阅读 →
论文解读

从注视到聆听:LipCoder 把 AI 编程装进语音闭环

LipCoder 针对视障程序员在可视编辑器与 AI 补全中被迫逐行听屏的断裂,用语音输入与听觉输出统一导航理解修改验证,在 5 名视障被试的探索性对照中可用性数值向好但校正后均不显著,且强依赖识别与大模型可靠性。

 · 更新于 2026-09-25 · 约 18 分钟 · 9013 字 阅读 →
论文解读

从逐字转写到可直接归档:Qwen-Audio-3.0-ASR 如何把指令、上下文与热词塞进同一遍解码

针对方言、动态实体、口语不流利和长上下文的生产转写问题,该报告用混合专家大语言模型解码器统一控制语言、热词、历史与润色,并在中英文与多语基准及工业集上给出可核对的误差率与延迟对照,其代价是依赖大规模数据管线与指令组合训练。

 · 更新于 2026-09-25 · 约 26 分钟 · 12726 字 阅读 →
论文解读

流式识别不是等多久,而是每个字该等多久:X2Streaming-ASR 的位置相关提交

针对单遍硬提交流式中文识别,X2Streaming-ASR 用监听与解码交替的等待或提交决策加三阶段训练,在五个测试集上报告平均字符提交延迟为 27 毫秒到 84 毫秒,并在 AISHELL-1 和 AISHELL-3 上取得参评流式系统中最优字符错误率,代价是部分测试集离线能力上限弱于基线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8680 字 阅读 →
论文解读

混语口述史里英文指标最好的一档,为何恰恰丢掉了非英语片段

该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。

 · 更新于 2026-09-25 · 约 14 分钟 · 6766 字 阅读 →
论文解读

GhostWord:把后门藏进单词时间轴里,防御为何越洗越伤干净转写

GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。

 · 更新于 2026-09-25 · 约 20 分钟 · 9612 字 阅读 →
论文解读

无语音却有文本:用门控低秩投影在解码器表示层抑制 Whisper 幻觉

针对 Whisper 在无语音输入上生成流畅幻觉文本的问题,论文用无语音校准集估计解码器幻觉子空间并在推理时做低秩投影以提升无语音概率,门控版本在保留语音识别的同时把非语音幻觉率大幅降低。

 · 更新于 2026-09-25 · 约 19 分钟 · 9291 字 阅读 →
论文解读

终端一两层决定是否接地:对 ASR 幻觉必要条件的因果定位

论文把幻觉拆为接地失效的必要条件与流畅编造的充分条件,用跳层因果干预定位到编码器最后 1-2 块为接地可恢复边界,并以有效秩压缩、透镜可读性与字形探针收敛作几何与可读性佐证,但干预本身只产生乱码或重复而非流畅幻觉。

 · 更新于 2026-09-25 · 约 24 分钟 · 11668 字 阅读 →
论文解读

只抄最后一层表示:预量化潜变量蒸馏压缩流式音频前端

该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。

 · 更新于 2026-09-25 · 约 20 分钟 · 9661 字 阅读 →
论文解读

既要一字不差又要好看易读:双形式语音识别如何决定数字该不该变

针对中文语音识别中口语忠实转写与书面可读转写难以兼顾的问题,论文用成对监督加提示词选形式训练一个共享模型,并以数字关键词加权的序列优化和分开考核必须改与禁止改的协议证明其在必须规范化上达到 4.64% I-CER 与 94.85% 关键词 F1、在禁止改上达到 95.18% 保留率,而无数字控制集上未引入虚假数字。

 · 更新于 2026-09-25 · 约 10 分钟 · 4935 字 阅读 →
论文解读

严重程度拉开差距时仍要可用:用严重程度混合微调 Whisper-small 并在 Jetson 上实测

针对唇腭裂语音随严重程度差异大的识别难题,论文用不同严重程度组合微调 Whisper-small 并在 Jetson 上实测,NOMIMOSE 把合并词错误率从 62.46% 降到 22.72%,NOMIMO 把合并音素错误率降到 18.44%,CLP-only 拿到最接近零的公平性得分 -22.85,而微调模型保持 0.167-0.171 实时系数和约 …

 · 更新于 2026-09-25 · 约 18 分钟 · 8602 字 阅读 →
论文解读

热启动之后再听一次:用隐状态夹角找出语义词并只在那里纠错

论文在 LoRA 适配的 ASR-LLM 中复用基座 LLM,以对应层隐状态的余弦相似度和范数比定位需语义纠错的词;单遍混合解码的平均实体错误率为 18.38%,有效搜索宽度约为贪心的 1.4 倍,双遍精修则把波束基线的 18.29% 降到 17.69%,但其总计算成本与墙钟时间未量化。

 · 更新于 2026-09-25 · 约 16 分钟 · 7795 字 阅读 →
论文解读

十六种方言同一套音频:辨别与转写为何难同步提升

该挑战用同一批十六类方言音频同时考辨别与转写,统一基线仅 53.62% 辨别准确率与 18.10% 转写错误率,最强受限系统做到 83.19% 与 11.08%,而困难方言与混淆方向显示两任务相关但不可互相替代。

 · 更新于 2026-09-25 · 约 20 分钟 · 9576 字 阅读 →
论文解读

从听见一个词到认出一个词:LibriBrain100 如何把词分类与跨人泛化变成可比的竞赛

论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。

 · 更新于 2026-09-25 · 约 20 分钟 · 9708 字 阅读 →
论文解读

百分之百的正确,也可能只说出了百分之五:语音脑机接口需要一把共同的尺子

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11347 字 阅读 →
论文解读

别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正

语音识别 | 7.6/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10921 字 阅读 →
论文解读

一个人、一套配方、七种适配器:重度构音障碍识别该押注哪种微调

语音识别 | 5.9/10

 · 更新于 2026-09-25 · 约 22 分钟 · 11018 字 阅读 →