论文解读

在只允许二维卷积的神经形态芯片上做音视融合:NAVIR 的分解与受限解码

针对工业噪声下纯音频识别崩溃的问题,NAVIR 用逐帧空间编码加时序卷积的分解结构适配 BrainChip AKD1000,在 GRID 噪声测试下量化融合模型取得未见说话人 14.0% 与重叠说话人 3.3% 词错率,代价是未见说话人纯唇读仍高达 35.3% 且音视模型在片上吞吐下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8497 字 阅读 →
论文解读

幻灯片能帮耳朵认词吗:用合成讲稿重测多语言语音识别

该研究把朗读维基百科的语音按小节配上大模型规划加规则渲染的合成幻灯片,在英德荷三语上只用音频测出最佳平均微观词错率 10.23% 与字错率 6.48%,而全量幻灯片文本或图片的零样本提示因大段复制与插入错误而失效。

 · 更新于 2026-09-24 · 约 15 分钟 · 7363 字 阅读 →
论文解读

重叠对话先听清谁再分清哪一桌:长时视听目标说话人识别加语义聚类

针对同一录音中多组高度重叠对话的转写与分组问题,该工作用视觉门控的目标说话人长时解码做转写、用大模型话题相似度做分组,在开发集上报告约 33.7% 词错误率和 0.97 聚类 F1,但长时视觉缺失填充与模拟数据域失配仍是主要代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7990 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

重叠语音下先看眼神再听声音:互视聚类与双模型输出融合的 MCoRec 系统

针对多人同时交谈且严重重叠的 MCoRec 任务,该工作用互视分数加语音重叠分数做会话聚类,并用 CTC/attention 与 Whisper 双模型输出融合做识别,在评测集上聚类 F1 达到 0.910,词错误率降到 48.67%,联合误差降到 0.289,代价是依赖几何假设、边界框与抽帧处理。

 · 更新于 2026-09-24 · 约 18 分钟 · 9005 字 阅读 →
论文解读

不重建波形也能帮识别:在中间表示上练目标说话人提取

针对多人同时交谈的重叠语音识别问题,该工作在 AV-HuBERT 识别主路径之外并联一个在 FBank 特征层面重建目标与干扰的 AV-TSE 辅助任务,并在 MCoRec 开发集上把词错误率从 49.90% 降到 49.55%,代价是需要仿真混合数据提供干净特征监督且推理时不使用提取分支。

 · 更新于 2026-09-24 · 约 16 分钟 · 7630 字 阅读 →
论文解读

不先卷识别率:以对话聚类带动联合误差下降的 AUVIS 系统

针对 360 度远场多说话人重叠对话的音视频识别与说话人归属问题,AUVIS 在官方基线五阶段流水线上保留基线检测与跟踪、只做切分与聚类参数解耦和网格优化,用开发集上聚类 F1 到 0.906 的 14.8% 相对提升带动联合误差 17.09% 相对下降,而识别字错误率仅相对下降 0.9% 到 0.4943。

 · 更新于 2026-09-24 · 约 15 分钟 · 7103 字 阅读 →
论文解读

重叠越密越要看嘴型:NJU-AALAB 用数据清洗与模板混合加持视听识别

针对多人同时说话造成的严重重叠与多会话分组难题,该工作保留基线说话人检测不变,主攻视听语音识别的数据清洗与模板化混合仿真并用大语言模型做会话聚类,开发集最好结果为词错误率 42.81% 与聚类分数 97.77%,代价是强单说话人骨干仍易误转干扰人且文本纠错收益有限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9320 字 阅读 →
论文解读

先消近讲串扰再做视听提取:用增强近讲语音做伪标签弥合仿真与真实鸡尾酒会差距

针对多人多会话同时进行的真实鸡尾酒会转写与会话聚类问题,论文采用先用 CTRnet 消除近讲串扰再用其输出做伪标签微调 AV-TFGridNet 视听目标说话人提取的两阶段路线,在开发集上用 AV-HuBERT 转写达到 33.78% 联合错误率,代价是仍依赖说话人活动时间戳弱监督与未做提取后 ASR 适配时约 48% 说话人词错误率。

 · 更新于 2026-09-24 · 约 18 分钟 · 8626 字 阅读 →
论文解读

八人四会话强重叠下先用视觉定界再抽取转写的级联路线

针对室内社交中最多八人四会话并行且重叠率超 90% 的问题,采用每人视觉流做说话人检测分段、音频视觉目标语音抽取去干扰、音频视觉识别转写再做大模型会话聚类的级联路线,最强可复现证据是原始开发集上提交三的 32.03/16.02 到 31.39/15.70 与聚类满分,代价是多前端多后端融合与大模型多次投票的系统复杂度。

 · 更新于 2026-09-24 · 约 20 分钟 · 9719 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

视频会议为何让视听语音识别崩溃:传输失真与过度表达的双重漂移

论文把视频会议中的识别崩溃拆成传输失真与人类过度表达两条链路,用 MLD-VC 配对数据与声学分布证据定位到语音增强导致的第一二共振峰上移,并以跨平台微调平均降低 17.5% 字符错误率为收益验证该机制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10075 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

鸡尾酒会里看口型说话:AV-Dialog 如何同时听清、看准接话时机

AV-Dialog 针对多人干扰下跟丢目标说话人与抢话时机错乱问题,用声学码加唇部视觉做流式理解与轮次预测,在干扰下把轮次预测准确率从 54% 提升到 79%,代价是双模型并行与视觉前视带来的额外延迟与显存开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9965 字 阅读 →
论文解读

补上时间细节:让多模态大模型重新看清唇动的前后变化

针对多模态大模型做音视频语音识别时视觉时间建模粗糙且深层解码逐渐丢失时序的问题,论文用编码端时间感知注意力和解码端分层时间 token 堆叠来补时间信息,在 LRS2 与 LRS3 上把纯视觉识别词错率做到更低,代价是只在英语离线句子级条件下验证且增加了投影与注意力模块的开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8351 字 阅读 →
论文解读

双假设迟融合:在语言空间里让听觉与视觉各自举证再裁决

针对噪声下单流纠错被音频质量卡住的问题,论文用独立 ASR 与 VSR 双路 N-best 假设加可靠性提示词做语言空间组合,在 LRS2 上把基线相对误差降低约一半,代价是依赖上下游识别头质量并增加大模型串行纠错开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9036 字 阅读 →
论文解读

先看再听:用两段式推理链约束幻灯片辅助转写

针对全模态模型易复述可见幻灯片文字而忽略语音的问题,论文提出先在思考块中识别幻灯片文字再在回答块中引用锚定转写,并用四项奖励做组相对策略优化,在实体密集基准上改善实体识别,同时带来思考块的额外推理开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8645 字 阅读 →
论文解读

广播满分不等于学会唇读:六条件复测下的视觉泛化断层

该文用统一预处理把六种说话条件接入三种主流架构复测,显示纯视觉在域外全面崩溃、音视融合仅在 Lombard 夸张口型下稳定增益,而发音人清晰度与 90 度侧脸的影响远大于小角度偏移与加数据量。

 · 更新于 2026-09-24 · 约 17 分钟 · 8033 字 阅读 →
论文解读

从播报式评测转向双人对话:Candor-LR 如何暴露音频退化并放大视觉补偿

针对播报式基准低估真实对话难度的问题,该工作把 1656 段双人视频会议转成 713.5 hours 训练加 60.1 hours 测试的视听识别基准,报告显示纯音频错误率从 LRS3 的 0.74–1.95% 升至 16.83–24.32%,而混合训练可把对话测试集视听错误率压到 9.83% 与干净条件下 8.48%,代价是必须自备原数据许可并复刻多步清洗 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9639 字 阅读 →
论文解读

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

音视频语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7037 字 阅读 →