门控只在新模态上打开:在冻结嵌入模型里加音频与热成像而不改动旧输出
该文把瓶颈适配器装进冻结解码器每一层并用输入成分做二进制门控,使旧模态走原计算图实现逐位不变,同时用对照实验显示音频检索提升与热成像包的可组合性,代价是新增模态的文本混排输入属于新行为且双门同开不在保证内。
该文把瓶颈适配器装进冻结解码器每一层并用输入成分做二进制门控,使旧模态走原计算图实现逐位不变,同时用对照实验显示音频检索提升与热成像包的可组合性,代价是新增模态的文本混排输入属于新行为且双门同开不在保证内。
论文把文本图像视频音频放进同一个共享主干做任意到任意检索,用四阶段对比训练与同源采样和蒸馏优化,在 MMEB-v3 等基准上取得领先,但多条件文本与记忆检索仍有短板且低维压缩在细粒度任务上损失更大。
针对低资源下语音文本对齐需要大编码器和大量平行数据的问题,该文把词级对齐建模为异构图上的链路预测,用 GraphSAGE 消息传递把固定文本表示传给语音节点,在 TIMIT 和 Yemba 上以轻量图训练达到可比 SAMU-XLSR 的富集与检索效果,代价是跨模态检索仍受初始声学质量制约且句子级与下游任务未验证。
该文把合成语音归属从闭集分类改写为音频对自然语言描述的跨模态检索,用冻结双编码器加小投影头在 MLAAD v9 上实现未见模型 58.4% 模型级 MRR,代价是闭集精度低于专用分类器且通用架构易混淆。
针对只检内容而忽略说话人的不足,论文用文本查内容加参考语音定说话人的混合查询,构建 VoiceTrace-Bench 并训练统一音频语言模型的两阶段检索重排框架,在语义基准和混合基准上报告了可复现的召回与排序提升,但重排带来额外推理开销且多说话人仍明显更难。
针对音频时刻检索中提议级置信度缺少全局竞争的问题,该文用半马尔可夫条件随机场对全部分割归一化并以片段边缘后验排序,在 CASTELLA 上报告 41.15% R1@0.7 和 34.68% mAP,代价是需做前向后向推理与非极大值抑制并保留双分支联合训练。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
音频时刻检索要求在数分钟录音中按自由文本返回起止时间,基线用 MS-CLAP 加 QD-DETR 在开发测试集上 Recall1@0.7 为 13.56%,前三名以更强特征与检测网络加分数校准或多分辨率集成达到 48.59%,代价是更复杂的特征组合与后处理。
BioVITA 针对图像与分类文本已对齐但音频缺位的问题,用 130 万音频与 230 万图像的两阶段对比学习把音频接入 BioCLIP 2,并在六方向检索上报告平均 Top-1 为 71.7% 的结果,代价是科层级检索与哺乳类音频仍明显更难且项目页链接当前不可用。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对单嵌入把声源与空间混在一起的问题,DISSE 在同一主干上接声源头与空间头并用弱配对监督对比学习,在保持在任务检索的同时把偏离任务检索压到接近零,但代价是依赖合成房间脉冲与因子标签且只冻结编码器训练投影头。
针对文本、视觉、音频三模态组合查询检索问题,OmniRet 用共享媒体重采样器压缩长媒体 token 序列提高效率、用注意力切片 Wasserstein 池化保留细粒度分布信息,在约 600 万对 30 个数据集训练下组合检索和音视频任务提升明显,而单向量压缩与有限主干仍是主要代价与边界。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对给定目标音色从预设库中找回最接近 DX7 预设的问题,论文用 SLAP 式音频参数联合嵌入加仿真调制信号流的 DX7-GNN 编码器,在未见拓扑上以 52.2% R@1 超过 Transformer 与 Highway 基线,代价是依赖算子交换增强与单音高单力度渲染条件。
FXplorer 针对离散预设难以覆盖连续音色变化的问题,用离线随机采样加 CLAP 与 AFx-Rep 双嵌入降维构建可试听二维地图,2 秒干声生成 100 个变体在 CPU 上约 36.95 秒,代价是无用户对照评估且跨效果链插值仍需手动重选端点。
该综述以 60 个创意应用为对象,用中心性与交互性双轴揭示 Freesound 已成为基础设施但内容检索与相似检索仍被低估,代价是探索模式收敛于文本搜索。
论文用两阶段合成字幕数据引擎和覆盖八到十组跨模态对的对比学习训练 PEAV,在零样本声音音乐语音视频检索分类上取得最强证据,但代价是 92M 加 32M 数据与大音频编码器和长视频推理成本。
针对影视非语音非音乐音效在检索与程序化生成之间频繁切换的问题,QuAP 用混合检索加六个程序化模型加规则助手统一工作流,主证据是 16 人用户评估与 MUSHRA 在六类中五类显著改善和 FSD50K 上 MobileNetV3 检索占优,代价是 Rocket 与 Jet 等类别仍不够逼真且仅支持六类。
针对 CLIP 视频文本检索丢弃音轨且 AST 类编码器不理解语音的问题,SAVE 用 Whisper 转写加 CLIP 文本编码的语音分支与 ImageBind 软监督的 soft-ALBEF 先对齐再融合,在五个基准上超过 AVIGATE 等基线,代价是依赖 ASR 可用性与离线三分支特征抽取。