论文解读

多模态指令导航:用语言、图像和声音共同消除目标歧义

针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。

 · 更新于 2026-09-25 · 约 20 分钟 · 9630 字 阅读 →
论文解读

从文本标签到波形边界:NVV-Locator 如何把非言语发声钉在时间轴上

针对转录标签缺少声学起止时间的问题,该研究用统一 26 类分类体系加四阶段自动时间戳管线构造大规模监督,并用非自回归槽填充模型联合预测词边界与事件边界,在 NVV-TimeBench 上报告 Micro F1 71.0% 与 Macro mMAE 59.6 ms,但短促低能量类别仍明显更难。

 · 更新于 2026-09-25 · 约 21 分钟 · 10138 字 阅读 →
论文解读

在又听又看的长视频里找准谁在响、何时响、在哪里:R-AVST 与 AVST-Zero

针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8572 字 阅读 →
论文解读

科学语音助手为何听懂却答不严:识别感知推理发音四段断链诊断

S3-Bench 用 1980 条科学语音问答与 213 段多轮对话把一次问答拆为识别感知推理发音四段测量,发现前三段正向耦合而生成与上游负耦合,严格事实性与听众适配仍是主要代价。

 · 更新于 2026-09-25 · 约 16 分钟 · 7925 字 阅读 →
论文解读

不只听清说什么:SCENEBench 考大型音频语言模型的背景声、运动、混语与喉头发声

SCENEBench 用合成叠加与受控变换构造背景声理解、噪声定位、跨语转写和发声特征四项任务,在五款大音频语言模型上报告自由回答与选择题准确率及本地延迟,发现模型偏向前景文字而系统性漏掉背景与运动线索。

 · 更新于 2026-09-25 · 约 17 分钟 · 8064 字 阅读 →
论文解读

东南亚语音评测为何难做:长音频定位与低资源提示的双重缺口

针对 11 种东南亚语言语音理解评测缺失问题,论文构建 97,194 样本与 597 小时音频的 9 任务基准并统一双语提示与归一化,最强证据是时间定位与情感识别全面偏低且缅甸语等低资源提示落后英文可达 41 个百分点,代价是长音频覆盖过度与拒答等边界行为仍需专门处理。

 · 更新于 2026-09-25 · 约 20 分钟 · 9551 字 阅读 →
论文解读

长录音多维标注如何不推倒重来:以字段级复核做局部修复

针对长录音中说话人、韵律、情感与场景需联合标注的问题,论文用全开源的前端加先验加三智能体加有界复核流程组织标注,并在 8.87 小时九类中文主基准上以时间线与固定时间线两套条件报告了可复述的误差与消融代价。

 · 更新于 2026-09-25 · 约 22 分钟 · 10523 字 阅读 →
论文解读

先想清楚指谁再分割:把指代表达理解显式拆成想、定位、分割三步

针对有声视频中按自然语言指代表达分割目标的问题,论文把任务拆成用多模态大模型先推理出目标描述再调用冻结检测与分割模型的智能体流程,在标准与推理增强基准上报告了对最强基线的提升,但阈值与细粒度描述的取舍仍有条件限制。

 · 更新于 2026-09-25 · 约 20 分钟 · 9525 字 阅读 →
论文解读

不只测好听:TTA-Bench 把准确、可靠与责任放在同一张考卷上

TTA-Bench 针对文本到音频生成提出覆盖准确性、效率、泛化、鲁棒性、公平性、偏见与毒性的七维评测,用 2999 条提示与 118314 条人工标注比较十个主流模型,发现 Tango 2 在准确与泛化上领先但毒性率最高,而效率与公平性上各模型分化明显。

 · 更新于 2026-09-25 · 约 19 分钟 · 9218 字 阅读 →
论文解读

用投票与多维标注把粤语长音频做成可训练语料

针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8914 字 阅读 →
论文解读

眼睛看到不等于耳朵听到:用音频专属参考把多模态推理拉回声音证据

针对视觉存在但音频缺失的不对称输入,论文用 AV-ConfuseBench 暴露视觉主导误判,并用 RL-CoMM 的两阶段强化协作把 Qwen2.5-Omni-3B 的问答与幻觉指标提升 10 到 30 个百分点,代价是只在有限样本上做在线策略优化并依赖外部音频推理与嵌入裁判。

 · 更新于 2026-09-25 · 约 19 分钟 · 9458 字 阅读 →
论文解读

从看得连贯到剪得准确:CutCraft 如何把多镜头音画的剪辑执行变成可核验的度量

CutCraft 把多镜头音画生成从感知连贯拉回到可核验的剪辑执行,用 295 条结构化提示与分层混合评估在 13 个主流模型上检验镜头结构、转场与蒙太奇的指令遵从,并以规划-分镜合成-后期合成的智能体基线揭示离散剪辑控制可提升而高阶蒙太奇仍难的代价边界。

 · 更新于 2026-09-25 · 约 27 分钟 · 13248 字 阅读 →
论文解读

打断时模型以为说了什么与用户实际听到什么不一致:用已播放语音回灌来锚定进度

论文把全双工中的打断恢复问题定义为锚定中断,提出把已播放的模型语音回灌到语音输入通路的三通道自监听架构,并在同源构造的 AnchorSpeech 上用播放边界判定正确性,报告三通道模型达到 73.0% 锚定准确率且停止与响应延迟基本不变,同时在通用全双工指标上出现轮次管理与锚定的权衡。

 · 更新于 2026-09-25 · 约 24 分钟 · 11696 字 阅读 →
论文解读

AVENUE:当提示只改一个模态时,模型能否守住另一个模态

AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。

 · 更新于 2026-09-25 · 约 23 分钟 · 11214 字 阅读 →
论文解读

边说话边动:把全身动作做成对话模型的原生输出

针对先说话后做动作的级联需要两次推理且无法联合优化的问题,Motion-Omni 让动作直接从产生语音的隐状态生成,并在 422856 对教师伪标签与 SwDA-500 对照下以 RTF=0.78 达到与同音频教师级联接近的动作质量,代价是动作质量仍受教师分布约束。

 · 更新于 2026-09-25 · 约 19 分钟 · 9430 字 阅读 →
论文解读

PRISM-Bench:用音频类型与声源可见性交叉诊断文生音视频的接地能力

针对文生音视频评估重视频轻音频的问题,PRISM-Bench 以语音/音乐/音效与 On-screen/Off-screen 交叉分层与四维度 35 条细粒度标准组织 900 条人工校验样本,并用盲式并排、以真值为锚的 MLLM-as-a-Judge 两阶段打分实现超过 70% 的人类一致性,揭示前沿闭源模型在可感保真度上已超真值但在可见声源同步与精细声音控 …

 · 更新于 2026-09-25 · 约 19 分钟 · 9227 字 阅读 →
论文解读

声调与词义打架时,语音情感识别为何崩溃:TWIN-SER 基准与 DAS 解耦融合

论文针对语调情感与字面语义冲突时主流语音情感识别显著退化的问题,提出解耦声学与语义双通路并做高能量筛选与查询融合的 DAS 框架,在 378 条高冲突 TWIN-SER 上取得 59.38% 加权准确率的最好结果,代价是零样本通用集上不及大预训练模型且小样本恐惧与厌恶类仍难分。

 · 更新于 2026-09-25 · 约 20 分钟 · 9838 字 阅读 →
论文解读

轮到谁说话,标签说了算:因果监督如何拆掉流式端点的假权衡

论文把回合结束判断搬进识别器,用语义完整加已观测静音的因果标注训练小 LoRA,在部署一致回放上以 0.97 边界召回、0.39 s 中位延迟、每语音分钟 0.3 次误触发超越全部静音超时,代价是统一多任务后精度回落与离线词错率小幅上升。

 · 更新于 2026-09-25 · 约 18 分钟 · 8771 字 阅读 →
论文解读

听见的对话如何被核查:TRILOGUE 把多轮声称钉回源文章与配对音频

针对播客式多轮对话中声称分散与 ASR 噪声的核查难题,TRILOGUE 以源文章可追溯的英俄哈三语对话与配对音频构建受控基准,显示仅看声称的验证最难、加入源证据后大幅回升,而哈萨克语的识别与合成瓶颈仍是主要代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10512 字 阅读 →
论文解读

从描述到可改的反馈:VocalCoachBench 为何把声乐指导拆成结构化判定与主张级评估

针对歌唱音频的专家式指导反馈问题,VocalCoachBench 用同曲可控对比与异曲多样场景的双子集和原子主张拆分来构造可复现评估,12 个音频语言模型的实测显示成对排序可行但细粒度 Top-3 识别与严格诊断命中率仍低于多数类基线且严格命中低于 7%。

 · 更新于 2026-09-25 · 约 20 分钟 · 9800 字 阅读 →