论文解读

先压缩时间再做全局融合:MambaVoice 的轻量视听歌声分离

针对多人演唱与密集伴奏下的目标歌声分离,MambaVoice 用对数分频音频编码加面部动作门控做条件,再以先 Mamba 后 Transformer 的混合主干建模,报告在 Acappella 未见未闻测试上以 16.2M 参数取得 14.18 dB SDR,并在 URSing 跨域与推理耗时上给出对照,代价是强干扰下仍略低于 VoViT 基线且主观评测样本 …

 · 约 18 分钟 · 8736 字 阅读 →
论文解读

只拼模态不够:用静态属性与动态事件补上物理监督

针对通用多模态只学语义对齐而缺物理量监督的问题,OmniFysics-Nano-V2 用静态属性 grounding 与动态视听事件对齐的双分支数据加两阶段 GRPO,在 21 项中 17 项领先同类全模态模型,代价是依赖商用大模型标注与多阶段训练流程。

 · 约 22 分钟 · 10584 字 阅读 →
论文解读

当时间轴变成可以斜切的体:Passing 如何把单段车窗录像走成无尽旅程

Passing 把一段多摩单轨车窗连续录像堆成时空体并沿非线性截面重采样出无尽画面,再用去掉视觉语义分支、只留时间对齐与车内环境声语义锚定的 SpecMaskFoley 实时生成同步声,代价是最终展览声景没有可复算的客观正确性指标,只能靠现场稳定性和艺术协商来收敛。

 · 约 20 分钟 · 9829 字 阅读 →
论文解读

舞者姿态能给希腊传统音乐打标签补上音频听不到的那部分吗

该文在 Lyra 舞蹈子集上用音频、视频、骨架三模态做 28 标签自动打标,报告最强三模态门控融合宏 ROC-AUC 为 0.864,超过最强音频单模态 0.821,但骨架单模态仅 0.586 且约半数片段缺有效姿态。

 · 约 21 分钟 · 10380 字 阅读 →
论文解读

从全脸到嘴部:ROAM-ASD 用联合自注意力应对开放世界的说话人检测

针对野外遮挡噪声下说话人易误判问题,ROAM-ASD 联合音频、全脸与嘴部三流并用联合自注意力加模态丢弃融合,在五个基准上取得 98.8%、87.9% 等 mAP,代价是需要人脸跟踪与嘴部关键点定位。

 · 约 20 分钟 · 9534 字 阅读 →
论文解读

删掉画面还要删掉声音:文本与已编辑视频如何共同指定要压制的声源

针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。

 · 约 17 分钟 · 8034 字 阅读 →
论文解读

共因不等于去捷径:音频视频生成中视觉捷径的阻断需要干预

论文在事件决定声音、外观只影响视频的结构因果模型下证明并验证共享隐变量仍学颜色等视觉捷径,而对 nuisance 做反事实不变干预才能恢复因果预测,代价是需要已知且可增强的 nuisance 并在分布内付出小额误差。

 · 更新于 2026-09-24 · 约 19 分钟 · 9081 字 阅读 →
论文解读

变换放在训练还是评估?DFD-Lab 用三组实验拆开跨数据集检测的排序与判决

DFD-Lab 把数据集适配、配对片段表示、检测器接口与实验配置分开,用 FakeAVCeleb 训练、过滤后的 Deepfake-Eval-2024 外部测试三类融合实现,最一致的证据是 JPEG50 训练增强把外部 AUROC 从 0.504、0.538、0.458 分别提升到 0.691、0.605、0.570,但三者准确率同时从 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9470 字 阅读 →
论文解读

快推理不等于能对话:AVTR-1 把双人音频、连续渲染与延迟调度做进同一系统

AVTR-1 用 153M 参数的双音频条件流匹配模型生成头部与表情动作,再用常开的渲染与调度循环把外部语音智能体的可变语音片段变成同步音视频,并用延迟分解与 R-DGG 验证了可交互性与说话人依赖,代价是仍依赖外部语音智能体与固定的窗口节拍。

 · 更新于 2026-09-24 · 约 18 分钟 · 8808 字 阅读 →
论文解读

唱歌头比说话头难在哪:Hi-Singers 用 170 小时野外数据补节奏与表情缺口

针对说话数据训练的模型在唱歌时出现节奏漂移和表情受限的问题,论文用三阶段过滤构建 29500 余段野外唱歌头数据,并在 Hallo 等架构上验证了唇同步与节奏对齐的提升,但高强度筛选只保留约 6.9% 原料且依赖人工打分融合。

 · 更新于 2026-09-24 · 约 18 分钟 · 8748 字 阅读 →
论文解读

听到不等于能定位:把不可靠的音频监督放在辅助通道的开放词汇音视定位

针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10058 字 阅读 →
论文解读

先看听者再说话:用回应前一秒表情规划下一句怎么说

针对对话语音只看文本历史会漏掉听者即时非言语线索的问题,用回应前 1 秒听者人脸时序做显式回应规划,在严格双人 MELD 协议上时序模型宏平均 F1 和 VAD 一致性略高于纯文本而准确率基本不变,合成阶段仅证明可端到端连通而未改善可懂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8603 字 阅读 →
论文解读

先判断有没有需求,再补全没说出口的那一半:ODU 把需求理解做成显式考题

论文把多模态交互中的用户需求理解定义为先判存在再补全意图的上下文推理任务,用 2078 个合成与真人实录场景和五维指标测 14 个原生模型,最强系统在需上下文的关键信息上仅恢复 44.7% 且误触发普遍超过 50%,而给定标准需求标注能显著改善下游回复。

 · 更新于 2026-09-24 · 约 20 分钟 · 9904 字 阅读 →
论文解读

不用转写也能对话:用合成音视频同时练理解、判分与强化

针对原生音视频直接对话缺数据、难评测的问题,该工作用多智能体合成对话同时做评测集与强化训练语料,报告在合成集从 0.465 到 0.652、在真人实拍集从 0.402 到 0.632 的提升,代价是回复变短且效率与风格奖励之间存在权衡。

 · 更新于 2026-09-24 · 约 22 分钟 · 10775 字 阅读 →
论文解读

能说出事件不等于能定住时间:AVTrace 如何拆解音画时间推理

AVTrace 把音画时间能力拆成七类可复算的定位与排序任务,用固定测试集显示现有全模态模型语义描述尚可但时间定位与同步判断偏弱,而针对 Gemma4-E4B 的时间后训练能在部分指标上提升但伴随外部任务的涨跌。

 · 更新于 2026-09-24 · 约 20 分钟 · 9866 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-20

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 3 分钟 · 1104 字 阅读 →
论文解读

先取证再打分:E-AVI 把面试录像变成可核查的证据池

针对自动视频面试只给分数而缺乏可检查依据的问题,E-AVI 选择先抽取带时间戳的结构化多模态证据再做维度条件打分,在 RecruitView 上把 MAE 从 0.641 降到 0.607、Spearman 从 0.440 提升到 0.541,代价是提取阶段仍是 83.3% 困难样本的瓶颈且推理依赖 15 秒级抽取开销。

 · 更新于 2026-09-24 · 约 21 分钟 · 10141 字 阅读 →
论文解读

矛盾本身就是信号:用差异建模识别犹豫与矛盾

针对跨通道矛盾定义的犹豫与矛盾识别问题,论文选择显式建模模态差异的 9 token Transformer 路线,在 BAH 标注测试集上报告 0.7408 Macro F1,代价是小数据下额外 token 带来的过拟合风险与多窗口训练成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
论文解读

先互相增强语义再记忆历史:CTAN 用循环一致与时间门控做声音导航

针对深度与双耳音频简单拼接会丢失几何语义关联的问题,CTAN 用双向重构交叉注意力做主动语义增强、用门控时间记忆桥接听觉死区,在 Replica 与 Matterport3D 未见环境中相对 SoundSpaces 基线提升了未听过声音下的成功率与路径效率,但消融显示各模块贡献与听觉死区恢复能力仍受场景规模与声音泛化条件限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8723 字 阅读 →
论文解读

把情感拆成方向与强度:瓶颈专家分治处理多模态情绪

该文把视频多模态情感分析拆为极性判别与强度回归,用极性与强度瓶颈专家分别压缩各模态信息再做跨模态路由融合,在四个中英文数据集与多种语言模型上报告了路由设置与专家分工证据,但未公开代码与完整训练预算。

 · 更新于 2026-09-24 · 约 8 分钟 · 3732 字 阅读 →