论文解读

流式识别不是等多久,而是每个字该等多久:X2Streaming-ASR 的位置相关提交

针对单遍硬提交流式中文识别,X2Streaming-ASR 用监听与解码交替的等待或提交决策加三阶段训练,在五个测试集上报告平均字符提交延迟为 27 毫秒到 84 毫秒,并在 AISHELL-1 和 AISHELL-3 上取得参评流式系统中最优字符错误率,代价是部分测试集离线能力上限弱于基线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8680 字 阅读 →
论文解读

终点相同不等于负担相同:语音客服审计为何要先过验证门

该文把语音客服审计对象定为固定服务事实下的完整服务事件,用七道验证门和六类指标区分最终结果与过程负担,并以全合成退款实例说明方法,全程不报告真系统比较结果。

 · 更新于 2026-09-25 · 约 17 分钟 · 8354 字 阅读 →
论文解读

混语口述史里英文指标最好的一档,为何恰恰丢掉了非英语片段

该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。

 · 更新于 2026-09-25 · 约 14 分钟 · 6766 字 阅读 →
论文解读

线性拼接已够好时,注意力还能补什么:BioSync 的宽深融合与合成验证

BioSync 用多头自注意力建模模态间交互并并联线性拼接分支,在两个合成队列上以认知队列 AUC 0.928 和代谢队列准确率 0.764 为最强证据,代价是干净数据优势微弱且临床推断仍待真实队列验证。

 · 更新于 2026-09-25 · 约 17 分钟 · 8124 字 阅读 →
论文解读

不用先转文字:音素瓶颈加单调对齐如何把尝试发声的脑信号直接变成可懂语音

针对尝试发声下无对齐声学目标且数据只有约 5 小时伪语音的问题,Brain2Speech-Net 用可微音素瓶颈加深度隐马尔可夫模型对齐到预训练语音合成隐空间做单遍合成,闭集语音词错率做到 0.068 并以约 0.5 实时因子运行,代价是开集词错率升至 0.472 且仍依赖合成伪语音目标。

 · 更新于 2026-09-25 · 约 18 分钟 · 8960 字 阅读 →
论文解读

不用时间刻度做修复:判别表示如何指示流匹配的剩余路程

论文针对修复任务中全局时间 t 无法刻画样本相关退化程度的问题,提出以冻结判别编码器表示替代时间条件来驱动流匹配速度场,在语音增强上报告了可复核的提升,并以额外编码器开销和自适应推理换取计算节省。

 · 更新于 2026-09-25 · 约 21 分钟 · 10282 字 阅读 →
论文解读

无相位也能低延迟重建语音:EffVOC 把窗长钉在 20 毫秒

EffVOC 用因果卷积加 LSTM 的上采样声码器从幅度谱或 Mel 系数直接重建宽带与全频带波形,在 20 毫秒算法延迟下宽带 MOS 达到 4.17 与 4.15、全频带达到 4.14 与 4.11,代价是更高帧率带来的计算量与对短窗高重叠的依赖。

 · 更新于 2026-09-25 · 约 17 分钟 · 8255 字 阅读 →
论文解读

GhostWord:把后门藏进单词时间轴里,防御为何越洗越伤干净转写

GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。

 · 更新于 2026-09-25 · 约 20 分钟 · 9612 字 阅读 →
论文解读

用可学习的分组有理激活替换固定激活:KanAdapter 在语音基座模型上的并行瓶颈适配

针对全量微调语音自监督基座模型代价高、MLP 适配器表达受限的问题,KanAdapter 以并行瓶颈中的 GR-KAN 可学习有理激活替换固定激活,在说话人验证、情感识别与伪造检测上以减少 94.7% 至 97.5% 可训练参数接近全量微调,并在两阶段持续学习上相对全量微调降低 83.6% 错误率。

 · 更新于 2026-09-25 · 约 21 分钟 · 10098 字 阅读 →
论文解读

语音不只是文字的喇叭:温暖介导伤害为何必须同时审听觉与文本

在同一模型上以 7 轮 WHO 脚本对比音频与纯文本,音频在诱发轮出现更短更快更低更轻且不更温暖的韵律漂移,文本转录审计会漏检而高风险自伤脚本的模态差异最集中。

 · 更新于 2026-09-25 · 约 20 分钟 · 9684 字 阅读 →
论文解读

把伦巴德效应拆成三层:说话人、音素与帧如何各管一摊

针对正常到伦巴德语音转换中风格与说话人、内容纠缠的问题,ProLombard 用对齐说话人编码、音素级去风格与再注入、VQ 中值下采样三层结构建模,在中英文数据上提升了可懂度和伦巴德相似度,代价是推理仍需目标噪声等级且与真实伦巴德仍有差距。

 · 更新于 2026-09-25 · 约 24 分钟 · 11554 字 阅读 →
论文解读

压缩导向的语音编码为何不适合直接做自回归建模:ARDDS 的正则与异构降采样重对齐

针对现有神经语音编码器只优化重建而忽略自回归可预测性的结构错配,论文提出在编码器训练中加入下一 token 预测的自回归正则并对语义层做更强的异构降采样,在保持重建质量的同时使 token 分布更接近文本的 Zipf 规律并显著提升 SpeechLM 在推理、识别与合成任务上的可学习性。

 · 更新于 2026-09-25 · 约 22 分钟 · 10695 字 阅读 →
论文解读

终端一两层决定是否接地:对 ASR 幻觉必要条件的因果定位

论文把幻觉拆为接地失效的必要条件与流畅编造的充分条件,用跳层因果干预定位到编码器最后 1-2 块为接地可恢复边界,并以有效秩压缩、透镜可读性与字形探针收敛作几何与可读性佐证,但干预本身只产生乱码或重复而非流畅幻觉。

 · 更新于 2026-09-25 · 约 24 分钟 · 11668 字 阅读 →
论文解读

不训练也能听懂说话:冻结视觉语言模型的外挂语音路由何时够用

论文用冻结视觉语言模型加 Whisper 转写路由构造免训练语音中心全模态理解,在 56 个基准和 21 种语言的配对比较中语音任务可比原生全模态训练而保留视觉推理能力,代价是增加串行语音识别延迟且无法处理音乐与环境声等非语音线索。

 · 更新于 2026-09-25 · 约 19 分钟 · 9198 字 阅读 →
论文解读

把级联状态机装进大模型:TurnFSM 如何串行做提交与拒绝

TurnFSM 把语义 VAD 与 utterance 级拒绝写成先提交后接受或拒绝的有限状态转移并用一阶依赖实现流式预测,在内部语义 VAD 上报告成功率 82.41% 与成功延迟 80.9 ms,在拒绝上报告 FAR 3.35% 与 FRR 16.04%,代价是仍需两阶段对齐与大模型推理开销。

 · 更新于 2026-09-25 · 约 19 分钟 · 9518 字 阅读 →
论文解读

保留高维 XLS-R 特征时单层 KAN 能否以更少参数替代复杂后端

📄 保留高维 XLS-R 特征时单层 KAN 能否以更少参数替代复杂后端 会议论文 ID:conference:icassp:2026:icassp-arnumber:11460320

 · 更新于 2026-09-25 · 约 18 分钟 · 8894 字 阅读 →
论文解读

Triage Knowledge Distillation for Speaker Verification

说话人验证 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4613 字 阅读 →