论文解读

不另加音频塔:共享主干如何统一文本图像视频音频检索

论文把文本图像视频音频放进同一个共享主干做任意到任意检索,用四阶段对比训练与同源采样和蒸馏优化,在 MMEB-v3 等基准上取得领先,但多条件文本与记忆检索仍有短板且低维压缩在细粒度任务上损失更大。

 · 约 19 分钟 · 9289 字 阅读 →
论文解读

听到不等于能定位:把不可靠的音频监督放在辅助通道的开放词汇音视定位

针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10058 字 阅读 →
论文解读

伪标签不可靠时,如何用左右可靠笔触给不确定片段加权

针对序列级塔布拉鼓点转录标注稀缺问题,该工作用教师模型生成伪标签、S-CEM 估计每个鼓点可信度、CMW-ATC 在不确定片段上按马尔可夫转移加权候选序列,在三组评测上把序列错误率降到 18.3、33.3 和 12.7,但仍需序列级标注和固定转移矩阵。

 · 更新于 2026-09-24 · 约 19 分钟 · 9066 字 阅读 →
论文解读

用非流式大模型的注意力路径重排流式训练序列:对齐、logit 与隐状态三路蒸馏

针对交错式流式语音识别大模型中外部强制对齐与模型自身对齐不一致的问题,该文用冻结非流式教师的文本音频注意力经置信度回退和单调搜索构造学生训练序列,并叠加 logit 与隐状态蒸馏,以聚合错误率从 9.35% 降至 7.80% 为最强证据,代价是相同蒸馏配置下闪烁高于强制对齐对照。

 · 更新于 2026-09-24 · 约 8 分钟 · 3670 字 阅读 →
论文解读

把帧率压到八分之一:TurboCTC 如何用块内降采样换速度

该文用 16 层 Conformer 编码器加 CTC 解决英文短语音转写,在仅公开数据与三阶段训练下以 470M 参数进入 OpenASR 速度精度前沿,代价是依赖大幅降采样与 16K 子词建模。

 · 更新于 2026-09-24 · 约 17 分钟 · 8333 字 阅读 →
论文解读

总体偏好裹挟维度打分:直播语音评测如何把四个韵律维度拆开判

针对直播带货语音合成中流畅度、语调、情感和直播感需要分维度评价的问题,论文先把 Gemini 的成对判断蒸馏为开源的 Live-ProsodyJudge,再用去掉总体结论、按维度掩码与分段归因的 Decoupled 版本解决维度塌缩,十次平衡顺序采样的 LPJ 在四个主测试集点准确率高于单次 Gemini 调用,而 D-LPJ 的混合维度一致率达到 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9797 字 阅读 →
论文解读

两个老师教一个流式编码器:在保住健康语音的同时听懂电子喉

针对电子喉语音与健康语音域失配且大模型难流式部署的问题,论文用冻结自监督模型的离散音素目标加电子喉微调识别模型的瓶颈特征做三阶段渐进蒸馏,最好的 Mel-Conformer 把电子喉词错误率从最强零样本基线的 39.3% 降到 21.2%,代价是仍需平行语料做对齐且只用识别探测验证,ONNX 单核实时率为 0.30。

 · 更新于 2026-09-24 · 约 21 分钟 · 10171 字 阅读 →
论文解读

不录音也能装上读音开关:用模型自己的声音教它读重音

针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。

 · 更新于 2026-09-24 · 约 15 分钟 · 7184 字 阅读 →
论文解读

不追求波形像,只追求定位准:面向 SELD 任务的神经 FOA 编码

针对不规则麦克风阵列难以得到可用 FOA 的问题,该文用常规编码加信号相关残差构成四通道接口,并用理论 FOA 教师做帧级置换不变蒸馏来优化事件与定位信息,代价是信号级重建误差反而变大。

 · 更新于 2026-09-24 · 约 21 分钟 · 10347 字 阅读 →
论文解读

先想明白再开口:用数据清洗、蒸馏与偏好对齐修好上下文语音合成

针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9249 字 阅读 →
论文解读

秒级对齐加软标签:AVNet 如何让声音与画面在缺模态时仍能互补

针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。

 · 更新于 2026-09-24 · 约 18 分钟 · 8553 字 阅读 →
论文解读

打开语音输出反而答错:用更强的纯文本策略把交错生成拉回来

论文发现相同语音输入下交错语音文本生成的内部文本准确率大幅低于纯文本回答,提出联合输出在策略蒸馏用冻结的语音到文本策略监督学生自己的联合轨迹,在 Step-Audio-2-mini 上把输出模式差距从 42.87 降到 16.26 个百分点而语音到文本基本不变,代价是仍残留十余点差距且口语答案增益小于内部文本增益。

 · 更新于 2026-09-24 · 约 19 分钟 · 9447 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

用无标注空管语音改造 Whisper 编码器:BEARD 为何要把自监督放在中间层并用蒸馏拴住解码器

针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。

 · 更新于 2026-09-24 · 约 18 分钟 · 8619 字 阅读 →
论文解读

大模型造数据、小模型干活:库尔德语低资源语音识别的节俭路线

针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
论文解读

小块流式缺未来信息时,用过去帧蒸馏出的语义向量增强当前帧

针对流式语音识别只能用过去和很小当前块导致词错误率上升的问题,SENS-ASR 用过去帧经上下文模块蒸馏句子嵌入教师得到的语义向量拼接增强每帧表示,在 160 毫秒小块上报告了词错误率下降,但大块和全上下文增益消失且需额外训练教师与上下文模块。

 · 更新于 2026-09-24 · 约 15 分钟 · 7077 字 阅读 →
论文解读

绕开姿态瓶颈:用音频直驱三维高斯粒子的全身说话人

针对单图全身会话化身中音频到姿态再到渲染的误差累积与口手细节丢失问题,论文用音频直接调制三维高斯粒子变形场并蒸馏大视频扩散先验,消融显示轨迹对齐与分数蒸馏分别控制同步与平滑,但自建评测与合成监督带来泛化边界。

 · 更新于 2026-09-24 · 约 18 分钟 · 8866 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

先跟教师学一千小时再用真值纠错:两阶段和弦识别为何能超过教师

针对和弦标注稀缺与分布不平衡问题,该工作先用预训练 BTC 教师在 1000 多小时无标注音频上生成伪标签训练学生,再用少量真值标签加选择性知识蒸馏做数据增量持续训练,最强 BTC 学生在七个 mir_eval 指标上超过教师与监督基线,代价是依赖教师质量并需保存完整软目标带来额外显存开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8243 字 阅读 →