在又听又看的长视频里找准谁在响、何时响、在哪里:R-AVST 与 AVST-Zero
针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。
针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。
论文要解决开放课程多模态教育知识图谱难自动构建的问题,用抽取-验证-整合-增强管线加跨模态对齐构造覆盖生物物理化学的 SciMKG,最强证据是概念抽取 F1 达到 0.803 并有多模态对齐的人评与自动评测支撑,代价是依赖前沿大模型推理与多轮校验的开销。
针对长录音中说话人、韵律、情感与场景需联合标注的问题,论文用全开源的前端加先验加三智能体加有界复核流程组织标注,并在 8.87 小时九类中文主基准上以时间线与固定时间线两套条件报告了可复述的误差与消融代价。
针对中文唇读辅以手编码的视频到语音任务,UniCUE 用姿态感知的识别通路提供细粒度视觉语义并经适配器条件化潜在扩散语音生成,在统一听障语料上报告了识别与生成的词错率下降,但训练只用健听者数据且推理开销未量化。
针对音频语言模型只靠粗粒度标题难以刻画力度、 timing 与声部进行的问题,该研究用对齐后的谱面加演奏 MIDI 构造文本表示 MuNo-SP 并自动生成长时间听觉分析与问答,在 MuSP-Bench 联合理解与人工偏好上报告了高于 ABC 与 MIDI 文本基线的准确率,代价是表示更长且仍限于古典钢琴与 MIDI 可表达的属性。
论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。
针对视频配乐中视频细节刻画不全与转场对拍不准的问题,VeM 用分层视频解析作指挥家组织多模态条件,以故事板引导交叉注意力和转场节拍对齐适配器生成波形音乐,在 TB-Match 上报告了语义与节奏指标的提升,但强转场对拍假设与评测阈值限制了其适用边界。
该文针对越南语开源语音文本对质量杂、格式不一、缺词级时间戳的问题,提出七步聚合清洗与对齐流水线,用约 502.67 小时高质量数据把微调后模型正字法词错误率降到 12.46%,代价是严格过滤丢掉约 38% 采样数据且仍偏向北部口音。
针对视频语言数据只写画面而把音乐当弱关联的问题,VMChill 以预告片为源做场景切分与视听分路标注,并在视频理解、视频生成与音乐生成上报告可复述的对照结果,其代价是自动合并标注仍需人工修正且分布偏向影视娱乐类预告片。
针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。
该研究在统一的以大语言模型为中心的语音语言模型框架下比较耦合与解耦语音分词器并引入多词元预测与说话人感知建模,最强证据是 12 倍压缩下词错误率从 6.07 降到 3.01 且合成成功率保持 100%,代价是主观质量指标 UTMOS 随压缩略有下降且高压缩更依赖说话人嵌入。
针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。
论文以 7 语种 668.8 小时配对语料构造说话人、生成方法和真实源三重隔离的跨域评测,报告同域准确率常达 100% 而跨域大幅跌落甚至近随机,最强的 wav2vec 2.0 与 Whisper+MLP 也只在部分语言保持可用,代价是生成方法随语言不同且需持续更新。
针对泰米尔电话语音在每次停顿判断是否说完的问题,论文用 116 通双通道电话切出 18485 个边界并以音频大模型重标,再把 Smart Turn v3 微调为 8.7 MB 与 21 MB 两个纯音频模型,在 30 通未见来电的 4168 条上把准确率从 70.30% 提到 86.13%,代价是生产端 VAD 与流式切窗再扣约 2.60 点且部分边界根本不 …
AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。
针对先说话后做动作的级联需要两次推理且无法联合优化的问题,Motion-Omni 让动作直接从产生语音的隐状态生成,并在 422856 对教师伪标签与 SwDA-500 对照下以 RTF=0.78 达到与同音频教师级联接近的动作质量,代价是动作质量仍受教师分布约束。
针对多人运动导致声学特征叠加与互反射延迟混叠的问题,SoundMHPE 用多尺度 STFT 编码器与每帧每人独立查询的时序解码器在 6 小时 AMP 数据集上实现多人 3D 姿态估计,并在 MPJPE 等指标上优于声学与 WiFi 基线,代价是需在受控室内采集与同步动捕数据。
论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。
声源定位 | 6.4/10
音频检索 | 7.2/10