论文解读

在又听又看的长视频里找准谁在响、何时响、在哪里:R-AVST 与 AVST-Zero

针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8572 字 阅读 →
论文解读

从公开课到四模态知识图:SciMKG 如何抽概念又对齐图文音视频

论文要解决开放课程多模态教育知识图谱难自动构建的问题,用抽取-验证-整合-增强管线加跨模态对齐构造覆盖生物物理化学的 SciMKG,最强证据是概念抽取 F1 达到 0.803 并有多模态对齐的人评与自动评测支撑,代价是依赖前沿大模型推理与多轮校验的开销。

 · 更新于 2026-09-25 · 约 16 分钟 · 7824 字 阅读 →
论文解读

长录音多维标注如何不推倒重来:以字段级复核做局部修复

针对长录音中说话人、韵律、情感与场景需联合标注的问题,论文用全开源的前端加先验加三智能体加有界复核流程组织标注,并在 8.87 小时九类中文主基准上以时间线与固定时间线两套条件报告了可复述的误差与消融代价。

 · 更新于 2026-09-25 · 约 22 分钟 · 10523 字 阅读 →
论文解读

不用中间文本转写:以识别语义直接约束唇手到语音的统一生成

针对中文唇读辅以手编码的视频到语音任务,UniCUE 用姿态感知的识别通路提供细粒度视觉语义并经适配器条件化潜在扩散语音生成,在统一听障语料上报告了识别与生成的词错率下降,但训练只用健听者数据且推理开销未量化。

 · 更新于 2026-09-25 · 约 20 分钟 · 9918 字 阅读 →
论文解读

把谱面与演奏对齐成文本:MuNo-SP 如何让模型听见弹了什么与怎么弹

针对音频语言模型只靠粗粒度标题难以刻画力度、 timing 与声部进行的问题,该研究用对齐后的谱面加演奏 MIDI 构造文本表示 MuNo-SP 并自动生成长时间听觉分析与问答,在 MuSP-Bench 联合理解与人工偏好上报告了高于 ABC 与 MIDI 文本基线的准确率,代价是表示更长且仍限于古典钢琴与 MIDI 可表达的属性。

 · 更新于 2026-09-25 · 约 21 分钟 · 10070 字 阅读 →
论文解读

发音纠错不能只给分数:让音频语言模型说出错在哪、怎么练

论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。

 · 更新于 2026-09-25 · 约 18 分钟 · 8778 字 阅读 →
论文解读

视频回声成乐:以分层解析同时约束语义、时间与转场对拍

针对视频配乐中视频细节刻画不全与转场对拍不准的问题,VeM 用分层视频解析作指挥家组织多模态条件,以故事板引导交叉注意力和转场节拍对齐适配器生成波形音乐,在 TB-Match 上报告了语义与节奏指标的提升,但强转场对拍假设与评测阈值限制了其适用边界。

 · 更新于 2026-09-25 · 约 19 分钟 · 9446 字 阅读 →
论文解读

越南语识别缺的不是模型,而是可复用的清洗与对齐流水线

该文针对越南语开源语音文本对质量杂、格式不一、缺词级时间戳的问题,提出七步聚合清洗与对齐流水线,用约 502.67 小时高质量数据把微调后模型正字法词错误率降到 12.46%,代价是严格过滤丢掉约 38% 采样数据且仍偏向北部口音。

 · 更新于 2026-09-25 · 约 19 分钟 · 9235 字 阅读 →
论文解读

预告片里画面与配乐为何总能卡点:VMChill 把细粒度视听协同做成可训练数据

针对视频语言数据只写画面而把音乐当弱关联的问题,VMChill 以预告片为源做场景切分与视听分路标注,并在视频理解、视频生成与音乐生成上报告可复述的对照结果,其代价是自动合并标注仍需人工修正且分布偏向影视娱乐类预告片。

 · 更新于 2026-09-25 · 约 19 分钟 · 9028 字 阅读 →
论文解读

用投票与多维标注把粤语长音频做成可训练语料

针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8914 字 阅读 →
论文解读

解耦分词与多词元预测为何能同时改善语音对齐与合成质量

该研究在统一的以大语言模型为中心的语音语言模型框架下比较耦合与解耦语音分词器并引入多词元预测与说话人感知建模,最强证据是 12 倍压缩下词错误率从 6.07 降到 3.01 且合成成功率保持 100%,代价是主观质量指标 UTMOS 随压缩略有下降且高压缩更依赖说话人嵌入。

 · 更新于 2026-09-25 · 约 22 分钟 · 10835 字 阅读 →
论文解读

在词元空间同时回答谁在说、说了什么、何时说:WhisperDiari 的联合建模

针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9303 字 阅读 →
论文解读

同域满分、跨域随机:XMAD-Bench 逼出音频伪造检测的泛化缺口

论文以 7 语种 668.8 小时配对语料构造说话人、生成方法和真实源三重隔离的跨域评测,报告同域准确率常达 100% 而跨域大幅跌落甚至近随机,最强的 wav2vec 2.0 与 Whisper+MLP 也只在部分语言保持可用,代价是生成方法随语言不同且需持续更新。

 · 更新于 2026-09-25 · 约 18 分钟 · 8590 字 阅读 →
论文解读

停顿不等于结束:泰米尔电话语音的语义轮次终点如何被验证与复现

针对泰米尔电话语音在每次停顿判断是否说完的问题,论文用 116 通双通道电话切出 18485 个边界并以音频大模型重标,再把 Smart Turn v3 微调为 8.7 MB 与 21 MB 两个纯音频模型,在 30 通未见来电的 4168 条上把准确率从 70.30% 提到 86.13%,代价是生产端 VAD 与流式切窗再扣约 2.60 点且部分边界根本不 …

 · 更新于 2026-09-25 · 约 18 分钟 · 8617 字 阅读 →
论文解读

AVENUE:当提示只改一个模态时,模型能否守住另一个模态

AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。

 · 更新于 2026-09-25 · 约 23 分钟 · 11214 字 阅读 →
论文解读

边说话边动:把全身动作做成对话模型的原生输出

针对先说话后做动作的级联需要两次推理且无法联合优化的问题,Motion-Omni 让动作直接从产生语音的隐状态生成,并在 422856 对教师伪标签与 SwDA-500 对照下以 RTF=0.78 达到与同音频教师级联接近的动作质量,代价是动作质量仍受教师分布约束。

 · 更新于 2026-09-25 · 约 19 分钟 · 9430 字 阅读 →
论文解读

多人声场叠加下如何用声音同时还原三维姿态:SoundMHPE 的多尺度与时序解耦

针对多人运动导致声学特征叠加与互反射延迟混叠的问题,SoundMHPE 用多尺度 STFT 编码器与每帧每人独立查询的时序解码器在 6 小时 AMP 数据集上实现多人 3D 姿态估计,并在 MPJPE 等指标上优于声学与 WiFi 基线,代价是需在受控室内采集与同步动捕数据。

 · 更新于 2026-09-25 · 约 23 分钟 · 11142 字 阅读 →
论文解读

从听见一个词到认出一个词:LibriBrain100 如何把词分类与跨人泛化变成可比的竞赛

论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。

 · 更新于 2026-09-25 · 约 20 分钟 · 9708 字 阅读 →
论文解读

同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上

声源定位 | 6.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11176 字 阅读 →
论文解读

一条声音,二十四种说法:SonicCaps 把听觉歧义变成检索的养分

音频检索 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10292 字 阅读 →