场景决定何为噪声:自动上下文去噪如何先判场景再去异物
该文把去噪目标改为随声场景变化的界内与界外事件,用先做声场景分类再做条件掩蔽去噪的两阶段网络,在六类场景配对数据上以可运行的 UNet 为基线对比,学习到的上下文取得最高 SI-SDR 但合成混合的统计失配仍是主要代价。
该文把去噪目标改为随声场景变化的界内与界外事件,用先做声场景分类再做条件掩蔽去噪的两阶段网络,在六类场景配对数据上以可运行的 UNet 为基线对比,学习到的上下文取得最高 SI-SDR 但合成混合的统计失配仍是主要代价。
论文以 6 至 32 个月婴儿视角的纵向音视频为唯一感官来源,构建视频话语、图像话语与多轮交错三种预训练数据并从零训练紧凑视觉语言模型,再以新发布临床工具为依据建成十任务基准,证据显示小模型可在部分认知任务上接近大模型但域外泛化与未见任务仍明显受限。
BioVITA 针对图像与分类文本已对齐但音频缺位的问题,用 130 万音频与 230 万图像的两阶段对比学习把音频接入 BioCLIP 2,并在六方向检索上报告平均 Top-1 为 71.7% 的结果,代价是科层级检索与哺乳类音频仍明显更难且项目页链接当前不可用。
论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。
该研究以 2001 至 2025 年 104 篇 NIME 论文为语料做归纳主题综述,发现创新集中于按键连续触感而布局仍被西方十二平均律钢琴形主导,并以跨文化多稳态与非西方乐理键盘为出路,但代价是分类依赖文本自述且未触及实物手感验证。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对弓弦乐器源-滤波器分离含混问题,DDSP-Violin 用亮度、弓位与残差约束谐波源,在合成数据上把体共振重建误差做小,而多尺度频谱重建质量基本不下降,代价是仍有局部共振细节误差与相位不定问题。
针对视频文本到音频中视觉压倒文本且缺少事件级可控定义的问题,论文提出事件中心分层控制任务、EchoFoley-6k 基准与免训练智能体 EchoVidia,最强证据是时间 0.72、音色 0.78、音量 0.75 可控性与人评指令遵循 3.80 同时领先基线,代价是依赖外部视频大模型与生成模块且需两速推理。
针对视觉听觉情绪线索稀疏且时间不同步导致隐式融合稀释与纠缠的问题,EmoThinker 用结构化 token 选择提纯面部与声音证据并用 CoET 数据集做分步推理,在 DFEW 等基准上报告了最高分,但背景丢弃与长尾类别仍带来代价与不稳定。
针对视频问答中被动看帧、忽视音频的问题,该工作用跨模态未来与过去摘要预测做监督微调,再用对比式强化学习约束双模态联合推理,在 16 帧与 64 帧条件下以 7B 与 8B 规模在四个音视频基准上达到与大闭源模型可比的水平,代价是两阶段推理延迟高于单阶段模型。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文指出波形误差是增益误差的带载波代理,易被次生效应淹没,用实测控制电压直接计算增益误差并训练灰盒模型后,直接监督在增益误差上明显优于波形代理,而波形指标对差异显著的模型给出相近分数,代价是需要同步采集控制电压并建设约 270 GB 的大规模数据集。
针对无声电影片段生成与画面帧级对齐的立体声拟音问题,FoleyDesigner 选择先分解为分层拟音脚本再用视觉轨迹条件扩散逐事件生成并做多智能体混音,最强证据是时空对齐表上 IoU 达 32.2 与 GCC 最低 48.79,代价是密集重叠并发事件仍会出现定位误差且依赖仿真数据与多阶段流水线。
针对视频生音频中多事件时间不可控与画面线索不足的问题,FoleyDirector 用 1 秒一段的结构化时间脚本加适配器做细粒度时间控制,在 DirectorBench 上把总体 F1 从 0.2451 提升到 0.4819,代价是需要逐段脚本标注与双路推理。
针对拟音数据缺乏动作与材质细粒度标注的问题,论文用两层人工分类体系组织 10000 段拟音并给出可复现基线,最强证据是大类准确率 0.82 而 73 类降至 0.64,代价是长尾分布与单标注者带来的细类混淆。
针对 FSD50K 存在背景干扰、重叠与稀疏标注的问题,该工作用扩散模型生成干净单源样本再构造受控混合来训练 BEATs 加 Bi-LSTM 判别器,在专家整理的 BSE 集上报告 95.51% 准确率与 98.58% 精确率,并据此筛选出 32,880 条的 FSD50K-Solo,代价是未验证对未见类别的泛化。
论文把视听空间推理定义为超越语义匹配的定位与关系判断,用 SoundSpaces 2.0 渲染的全景图加双耳音频构造 100 万问答对并训练连接视觉与空间音频编码器的大语言模型,在语义错位与多同类目标场景上报告了双耳相对单耳的定向优势,但分类精度仍远低于 Oracle 且依赖仿真场景。
该文用文本到图像与文本到音频模型构造 VGGSound 合成克隆并固定 ACL-SSL 做对比学习,验证同规模替代、合成图像配真实音频修正与 2 倍 3 倍混合扩展三类用法,最强混合配方相对纯真实基线提升约 8.62 cIoU、5.58 mIoU 与 12.16 IIoU,代价是合成音频弱于真实音频且纯合成需到 3 倍才稳定超越。
论文用 Mores 实测的 65 把吉他桥柔量与桥到空气辐射驱动几何精确非线性弦,在连续级做标量辅助变量二次化并以两次 Sherman-Morrison 秩一更新实现每步显式推进,以全品格约 6240 个音展示乐器相关共鸣,代价是琴体与辐射仍为线性模态且跨琴响度依赖两遍归一化。