论文解读

真实多人对话考验语音自监督表示:CSPB 用单通道与多通道同测内容与说话人

CSPB 针对噪声混响与重叠语音的真实多人对话,用冻结上游加轻量下游的统一协议在四套数据上考识别日志与增强分离,报告显示多样数据加增强预训练的模型更稳健而波束形成与原生多通道带来一致增益,代价是原生多通道预训练数据远少且基准仍以编码器结构为主。

 · 更新于 2026-09-25 · 约 18 分钟 · 8710 字 阅读 →
论文解读

口音表征记住说话人:先测泄漏再做去说话人化

该研究陈述针对带口音语音识别中口音表征混入说话人身份的问题,提出用宽松划分对比与探针等方法度量纠缠,再以梯度反转去说话人化加有界条件适配在冻结 Whisper 上缓解,但全文是研究计划而非已验证结果,未报告词错误率数字与公平性收益。

 · 更新于 2026-09-25 · 约 19 分钟 · 9114 字 阅读 →
论文解读

语义不够声学来凑行不通:用理解型词元做输入、声学词元做输出的统一建模

针对文本大模型向语音统一理解与生成迁移时模态鸿沟大、单一种词元难以兼顾语义与声学的问题,该文提出理解驱动分词器与双词元建模并用约 4500 小时数据验证,理解与生成可相互促进,但细粒度声学保留与翻译类任务仍有代价与边界。

 · 更新于 2026-09-25 · 约 17 分钟 · 8046 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 75 分钟 · 37568 字 阅读 →
论文解读

听到更多却用更少:为对话语音检索并精选一条最相关的历史

针对对话语音中固定取前几句会引入无关冗余、取全量历史又成本过高的问题,论文提出多模态检索加精选方法 MARS,只取一条声学或语义最相关的历史来辅助当前句识别,并在 1.5K 小时训练下报告了优于 179K 小时顶级系统的混合错误率,代价是依赖微调 Whisper 建库与两遍解码的额外检索计算。

 · 更新于 2026-09-25 · 约 21 分钟 · 10079 字 阅读 →
论文解读

单语很强、混着说就错:HiKE 用三级切换与借词标注拆解韩英代码切换识别

针对韩英混说识别缺乏公开非合成评测的问题,HiKE 以 1121 句自然录音加词/短语/句子三级与借词标注做细粒度评测,报告 10 个多语模型单语转混说时 MER 扩大 3 到 13 倍,而拼接单语合成的句级数据微调也能带来 6.8% 以上改善,但自然句内数据仍更优。

 · 更新于 2026-09-25 · 约 16 分钟 · 7799 字 阅读 →
论文解读

把关键词藏起来还能无损找回来:IO-RAE 的可逆混淆

针对语音被人和自动语音识别系统窃听关键词的问题,论文用大语言模型选替换词加累积信号攻击做局部混淆、再用可逆信息隐藏嵌入扰动,在 LibriSpeech 上报告目标误导率 96.5% 与恢复音频 PESQ 4.45,代价是强扰动与可逆嵌入的存储开销和对齐依赖。

 · 更新于 2026-09-25 · 约 19 分钟 · 9092 字 阅读 →
论文解读

按语系共享连接器:多语言语音大模型何时该合练、何时该单练

该文研究冻结语音编码器加冻结大语言模型、只训练轻量连接器的多语言识别中按单语言还是按语系组织训练数据的问题,在近四十种语言上报告家族级连接器多数更低更稳但在内部差异大的语系会失效,并以通用连接器对照说明增益来自亲缘性而非单纯数据量。

 · 更新于 2026-09-25 · 约 18 分钟 · 8590 字 阅读 →
论文解读

错误稀疏下只改该改的片段:韩语咨询对话的检测门控纠错

针对无法使用音频、只能做纯文本后编辑且错误稀疏的韩语咨询对话,论文用真实呼叫数据构建 DasanCallDial 并提出先检测后纠错的 DCSC,主证据是 pkoT5 版本把平衡词错误率指标值从 14.67 降到 13.30,把错误句词错误率指标值从 29.35 降到 26.27,代价是检测门仍会漏检且纠错器对部分已送入错误保持保守。

 · 更新于 2026-09-25 · 约 20 分钟 · 10017 字 阅读 →
论文解读

噪声下不只纠错,而是让编码器和解码器都向干净表征对齐

针对 Whisper 在噪声下出现流畅但错误转写的幻觉问题,论文用自适应层注意力融合编码器分块表征再用多目标蒸馏对齐干净教师,印地语 -10 dB 等低信噪比下同时降低词错误率并提升语义分,同时增加约 0.98% 参数和约 8% 推理延迟。

 · 更新于 2026-09-25 · 约 17 分钟 · 8440 字 阅读 →
论文解读

让大语言模型直接听出谁在何时说话:联合转写与切分的原生 diarisation 方案

该提案要把语音感知大语言模型从只做转写扩展到原生联合完成自动语音识别与说话人切分,做法是冻结大语言模型主干、分两阶段训练音频编码器与适配器并加入上下文提示,证据是所列开源切分数据的时长与语言分布以及词错率与切分错率的明确定义,代价是切分标注数据少且尚未给出可运行系统的定量主结果。

 · 更新于 2026-09-25 · 约 19 分钟 · 9173 字 阅读 →
论文解读

冻住一半时域滤波器:Orukeet 用拟合 Gabor 核约束多语识别器

Orukeet 把 Parakeet 编码器中拟合误差最小的 12,288 个时域卷积核替换为解析 Gabor 函数并冻结,再训练其余参数,在 FLEURS 混合词错率上从 11.01% 降到 9.85%,代价是希腊语等少数划分明显变差且最终调优依赖 LibriSpeech test-other。

 · 更新于 2026-09-25 · 约 18 分钟 · 8850 字 阅读 →
论文解读

松标注学出松边界:因果一致性伪标签为何收得过紧

针对松标注训练导致边界过松、而因果-反因果伪标签又收得过紧并增加漏检的问题,论文用保边界去停顿填充、预热上下文和非因果感知协同训练来缓解,并在 AMI 与 AliMeeting 上把与理想紧标签上限的 DER 差距缩小约四到六成,代价是虚警与漏检之间仍需权衡。

 · 更新于 2026-09-25 · 约 19 分钟 · 9379 字 阅读 →
论文解读

小模型微调为何压过大模型提示:印地语后纠错的规模与领域证据

论文把印地语后纠错做成高重叠文本编辑,对比微调的 mT5、ByT5 与提示或微调的大模型,发现小模型纠错后词错误率更低,而零样本大模型呈先升后降的 n 形曲线,代价是跨域仍会退化并需要混合多源假设来缓解。

 · 更新于 2026-09-25 · 约 16 分钟 · 7657 字 阅读 →
论文解读

流式多说话人识别要在单实例省内存与多实例保重叠之间选边

该文用同一组流式识别与流式说话人日志模型派生出级联、掩码输入、词级串行输出和日志条件四种架构,对比多说话人准确率、单说话人退化、内存占用与训练代价,并以排列不变动态时间规整解决短片段训练标签对齐问题,其中日志条件精度最好但需要微调与多实例代价。

 · 更新于 2026-09-25 · 约 24 分钟 · 11655 字 阅读 →
论文解读

按语义密度生成:SEAM 用编解码对齐弥合语音与文本的粒度差

针对语音按时长定速、文本按语义变长造成的分布失配,SEAM 用冻结编码器加可训练交叉注意力解码器做变速率对齐并分三阶段训练加首词引导,在仅用 LibriSpeech960 小时训练时取得 2.6%/5.2% 与跨域 TED-LIUM-v2 上 4.7% 词错率,代价是两段自回归带来的推理延迟。

 · 更新于 2026-09-25 · 约 16 分钟 · 7975 字 阅读 →
论文解读

词与笑声同序列解码:面向双语非言语声的源自适应数据整理

针对中英双语带标签转写任务,论文用词汇重映射让 Whisper-medium 统一生成词与 16 类非言语声标签,并用公开语料增强过滤加影视挖掘把最终分从 33.32 提到 53.61,代价是英文纯文本词错率上升且细粒度类别仍偏弱。

 · 更新于 2026-09-25 · 约 17 分钟 · 8423 字 阅读 →
论文解读

把“谁何时说了什么”一次生成:SpeakerLM 如何统一日志与识别并兼容注册条件

针对级联式说话人日志与识别中误差传递与重叠语音难处理的问题,SpeakerLM 用音频编码器加投影器接入大语言模型的端到端多模态方案,在约 7638.95 小时数据下主指标超越最强级联基线,但小数据与仿真失配时仍明显落后。

 · 更新于 2026-09-25 · 约 18 分钟 · 8705 字 阅读 →
论文解读

先剪掉噪声再识别:语音感知的长上下文剪枝与融合

针对会议幻灯 OCR 等长而 noisy 的上下文导致识别偏置词困难的问题,论文用两阶段剪枝加语音驱动池化先筛关键词再做识别,在 SlideSpeech 上报告 WER 7.71% 并在 LibriSpeech 上报告 WER 1.12%,代价是两阶段流水线与池化压缩带来的实现复杂度。

 · 更新于 2026-09-25 · 约 21 分钟 · 10216 字 阅读 →
论文解读

口吃语音先转文字再修语义:STEAMROLLER 为何用多智能体绕开直接语音转换

针对口吃语音直接转流利语音难、转写引入语义失真和实时延迟三难,STEAMROLLER 用转写加多智能体文本修复加音色克隆合成的三段管线,在 FluencyBank 上把词错误率平均降约 10 个百分点并保持语义,代价是约 3.8 秒分段延迟和零样本克隆音色相似度偏低。

 · 更新于 2026-09-25 · 约 20 分钟 · 10004 字 阅读 →