不另加音频塔:共享主干如何统一文本图像视频音频检索
论文把文本图像视频音频放进同一个共享主干做任意到任意检索,用四阶段对比训练与同源采样和蒸馏优化,在 MMEB-v3 等基准上取得领先,但多条件文本与记忆检索仍有短板且低维压缩在细粒度任务上损失更大。
论文把文本图像视频音频放进同一个共享主干做任意到任意检索,用四阶段对比训练与同源采样和蒸馏优化,在 MMEB-v3 等基准上取得领先,但多条件文本与记忆检索仍有短板且低维压缩在细粒度任务上损失更大。
针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。
针对序列级塔布拉鼓点转录标注稀缺问题,该工作用教师模型生成伪标签、S-CEM 估计每个鼓点可信度、CMW-ATC 在不确定片段上按马尔可夫转移加权候选序列,在三组评测上把序列错误率降到 18.3、33.3 和 12.7,但仍需序列级标注和固定转移矩阵。
针对交错式流式语音识别大模型中外部强制对齐与模型自身对齐不一致的问题,该文用冻结非流式教师的文本音频注意力经置信度回退和单调搜索构造学生训练序列,并叠加 logit 与隐状态蒸馏,以聚合错误率从 9.35% 降至 7.80% 为最强证据,代价是相同蒸馏配置下闪烁高于强制对齐对照。
该文用 16 层 Conformer 编码器加 CTC 解决英文短语音转写,在仅公开数据与三阶段训练下以 470M 参数进入 OpenASR 速度精度前沿,代价是依赖大幅降采样与 16K 子词建模。
针对直播带货语音合成中流畅度、语调、情感和直播感需要分维度评价的问题,论文先把 Gemini 的成对判断蒸馏为开源的 Live-ProsodyJudge,再用去掉总体结论、按维度掩码与分段归因的 Decoupled 版本解决维度塌缩,十次平衡顺序采样的 LPJ 在四个主测试集点准确率高于单次 Gemini 调用,而 D-LPJ 的混合维度一致率达到 …
针对电子喉语音与健康语音域失配且大模型难流式部署的问题,论文用冻结自监督模型的离散音素目标加电子喉微调识别模型的瓶颈特征做三阶段渐进蒸馏,最好的 Mel-Conformer 把电子喉词错误率从最强零样本基线的 39.3% 降到 21.2%,代价是仍需平行语料做对齐且只用识别探测验证,ONNX 单核实时率为 0.30。
针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。
针对不规则麦克风阵列难以得到可用 FOA 的问题,该文用常规编码加信号相关残差构成四通道接口,并用理论 FOA 教师做帧级置换不变蒸馏来优化事件与定位信息,代价是信号级重建误差反而变大。
针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。
针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。
论文发现相同语音输入下交错语音文本生成的内部文本准确率大幅低于纯文本回答,提出联合输出在策略蒸馏用冻结的语音到文本策略监督学生自己的联合轨迹,在 Step-Audio-2-mini 上把输出模式差距从 42.87 降到 16.26 个百分点而语音到文本基本不变,代价是仍残留十余点差距且口语答案增益小于内部文本增益。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。
针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。
针对流式语音识别只能用过去和很小当前块导致词错误率上升的问题,SENS-ASR 用过去帧经上下文模块蒸馏句子嵌入教师得到的语义向量拼接增强每帧表示,在 160 毫秒小块上报告了词错误率下降,但大块和全上下文增益消失且需额外训练教师与上下文模块。
针对单图全身会话化身中音频到姿态再到渲染的误差累积与口手细节丢失问题,论文用音频直接调制三维高斯粒子变形场并蒸馏大视频扩散先验,消融显示轨迹对齐与分数蒸馏分别控制同步与平滑,但自建评测与合成监督带来泛化边界。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对和弦标注稀缺与分布不平衡问题,该工作先用预训练 BTC 教师在 1000 多小时无标注音频上生成伪标签训练学生,再用少量真值标签加选择性知识蒸馏做数据增量持续训练,最强 BTC 学生在七个 mir_eval 指标上超过教师与监督基线,代价是依赖教师质量并需保存完整软目标带来额外显存开销。