谁说了什么:把内容与说话人一起检回来的混合语音检索
针对只检内容而忽略说话人的不足,论文用文本查内容加参考语音定说话人的混合查询,构建 VoiceTrace-Bench 并训练统一音频语言模型的两阶段检索重排框架,在语义基准和混合基准上报告了可复现的召回与排序提升,但重排带来额外推理开销且多说话人仍明显更难。
针对只检内容而忽略说话人的不足,论文用文本查内容加参考语音定说话人的混合查询,构建 VoiceTrace-Bench 并训练统一音频语言模型的两阶段检索重排框架,在语义基准和混合基准上报告了可复现的召回与排序提升,但重排带来额外推理开销且多说话人仍明显更难。
论文把在干净视频会议数据上训练的预测性轮次模型放到高重叠鸡尾酒会数据上检验,发现多模态加权 F1 从干净域掉到新域约三分之一,微调能提升多模态约三成但伴随原域遗忘,而纯音频分支几乎无法适应。
针对大音频语言模型时间定位不准的问题,论文冻结大模型只取查询语义表示并外挂帧级定位模型,在多个接地基准上提高严格阈下召回与平均交并比,并在推理阶段把定位结果作为外部时间证据回填给大模型。
针对一分钟语义和音位流畅性任务中整段平均会抹掉检索动态的问题,CCMAN 用词级多模态序列加双向跨模态注意与迁移学习建模时间不稳定性,在 843 人语料上语义二分类宏 F1 达到 0.81 而多分类仅 0.59,代价是三分类区分 MCI 与痴呆仍不显著且依赖 ASR 时间戳质量。
该文在约 400 小时面对面双人对话上把注视、头部、身体手部与面部动作单元接入语音活动投影模型,最优结构以交叉注意力加三帧差分与早期门控把语音活动投影损失从 2.166 降到 2.100,面部动作单元是最强的单一视觉组但全量组合仍最好,代价是需要多模态特征提取与更大的推理开销且划分不是按会话对隔离。
针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。
论文在匹配数据与匹配生成设置下比较纯语音、语音文本与纯文本模型,显示内部文本流大幅降低生成困惑度但说话人相似度和预测质量偏向纯语音模型,且联合模型能逼近大得多数据规模纯语音模型的语义水平。
针对音频时刻检索中提议级置信度缺少全局竞争的问题,该文用半马尔可夫条件随机场对全部分割归一化并以片段边缘后验排序,在 CASTELLA 上报告 41.15% R1@0.7 和 34.68% mAP,代价是需做前向后向推理与非极大值抑制并保留双分支联合训练。
针对逐轮改歌时单轮编辑器记不住上文的问题,AURA 用多模态大模型把完整对话蒸馏成 9 个概念令牌并以帧对齐方式注入冻结的 MusicGen,在 Slakh 与 MoisesDB 上以 0.78 对 0.37 的 SSIM 和 +11.32 dB 的 SI-SDR 改善保持性,代价是抽取类任务仍弱于专用分离模型。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
StepAudio 3 Realtime 针对实时语音交互中深度推理与低延迟的矛盾,用听-说-想-做循环组织感知、双工话轮管理、边说边想与异步工具调用,在 MMSU 90.6、全双工 98.9 等报告结果上保持领先,但多轮约束保持与零售工具任务仍有明显短板。
针对同一录音中多组高度重叠对话的转写与分组问题,该工作用视觉门控的目标说话人长时解码做转写、用大模型话题相似度做分组,在开发集上报告约 33.7% 词错误率和 0.97 聚类 F1,但长时视觉缺失填充与模拟数据域失配仍是主要代价。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对多人同时交谈且严重重叠的 MCoRec 任务,该工作用互视分数加语音重叠分数做会话聚类,并用 CTC/attention 与 Whisper 双模型输出融合做识别,在评测集上聚类 F1 达到 0.910,词错误率降到 48.67%,联合误差降到 0.289,代价是依赖几何假设、边界框与抽帧处理。
针对光学动捕只记大位移而漏掉 popping 式收缩与紧张的问题,KinoGroove 用预录动捕加肌电在 XR 里异步作曲,以 27 相机加 41 点骨架与上半身多通道肌电为证据,代价是设备昂贵且暂无用户评估。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。
音频时刻检索要求在数分钟录音中按自由文本返回起止时间,基线用 MS-CLAP 加 QD-DETR 在开发测试集上 Recall1@0.7 为 13.56%,前三名以更强特征与检测网络加分数校准或多分辨率集成达到 48.59%,代价是更复杂的特征组合与后处理。
论文追问手势在新乐器与机器共创中如何被数据化与操控,提出以拉美赛博格主义重嵌社会语境,并以抗议分析、 telematic 拼贴与生态工作坊三例显示情境化方法的收益,其代价是缺乏可比指标与可复用系统评估。
该项目要解决多人视频对话中语言、非语言、视觉与时间线索难以统一建模的问题,选择先定义多维度交际行为再建模其关系并生成电影剧本式描述,以虚构与真实语料上的泛化为证据方向,代价是本文仅提出路线而未报告可验证的模型与定量结果。