论文解读

场景决定何为噪声:自动上下文去噪如何先判场景再去异物

该文把去噪目标改为随声场景变化的界内与界外事件,用先做声场景分类再做条件掩蔽去噪的两阶段网络,在六类场景配对数据上以可运行的 UNet 为基线对比,学习到的上下文取得最高 SI-SDR 但合成混合的统计失配仍是主要代价。

 · 更新于 2026-09-25 · 约 20 分钟 · 9951 字 阅读 →
论文解读

用婴儿两年的所见所闻,能否从零训练出会看会说的视觉基础模型

论文以 6 至 32 个月婴儿视角的纵向音视频为唯一感官来源,构建视频话语、图像话语与多轮交错三种预训练数据并从零训练紧凑视觉语言模型,再以新发布临床工具为依据建成十任务基准,证据显示小模型可在部分认知任务上接近大模型但域外泛化与未见任务仍明显受限。

 · 更新于 2026-09-25 · 约 21 分钟 · 10371 字 阅读 →
论文解读

把叫声、照片和学名对齐到同一空间:BioVITA 的三模态生物表征路线

BioVITA 针对图像与分类文本已对齐但音频缺位的问题,用 130 万音频与 230 万图像的两阶段对比学习把音频接入 BioCLIP 2,并在六方向检索上报告平均 Top-1 为 71.7% 的结果,代价是科层级检索与哺乳类音频仍明显更难且项目页链接当前不可用。

 · 更新于 2026-09-25 · 约 22 分钟 · 10701 字 阅读 →
论文解读

链式推理何时帮倒忙:语音理解与描述中的显式思维链、课程学习与槽填充对照

论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。

 · 更新于 2026-09-25 · 约 18 分钟 · 8810 字 阅读 →
论文解读

键盘为何难逃钢琴形:NIME 二十五年键盘界面的惯性与具体化

该研究以 2001 至 2025 年 104 篇 NIME 论文为语料做归纳主题综述,发现创新集中于按键连续触感而布局仍被西方十二平均律钢琴形主导,并以跨文化多稳态与非西方乐理键盘为出路,但代价是分类依赖文本自述且未触及实物手感验证。

 · 更新于 2026-09-25 · 约 22 分钟 · 10534 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 181 分钟 · 90282 字 阅读 →
论文解读

把琴体共振还给滤波器:DDSP-Violin 用弓弦先验约束谐波源

针对弓弦乐器源-滤波器分离含混问题,DDSP-Violin 用亮度、弓位与残差约束谐波源,在合成数据上把体共振重建误差做小,而多尺度频谱重建质量基本不下降,代价是仍有局部共振细节误差与相位不定问题。

 · 更新于 2026-09-25 · 约 20 分钟 · 9852 字 阅读 →
论文解读

从整轨配音到逐事件导演:EchoFoley 用符号事件表约束何时何物如何发声

针对视频文本到音频中视觉压倒文本且缺少事件级可控定义的问题,论文提出事件中心分层控制任务、EchoFoley-6k 基准与免训练智能体 EchoVidia,最强证据是时间 0.72、音色 0.78、音量 0.75 可控性与人评指令遵循 3.80 同时领先基线,代价是依赖外部视频大模型与生成模块且需两速推理。

 · 更新于 2026-09-25 · 约 17 分钟 · 8187 字 阅读 →
论文解读

稀疏线索与异步冲突下,如何让情绪分析先取证再推理

针对视觉听觉情绪线索稀疏且时间不同步导致隐式融合稀释与纠缠的问题,EmoThinker 用结构化 token 选择提纯面部与声音证据并用 CoET 数据集做分步推理,在 DFEW 等基准上报告了最高分,但背景丢弃与长尾类别仍带来代价与不稳定。

 · 更新于 2026-09-25 · 约 18 分钟 · 8838 字 阅读 →
论文解读

不暴力看全片:用跨模态预测逼模型补全听觉与视觉

针对视频问答中被动看帧、忽视音频的问题,该工作用跨模态未来与过去摘要预测做监督微调,再用对比式强化学习约束双模态联合推理,在 16 帧与 64 帧条件下以 7B 与 8B 规模在四个音视频基准上达到与大闭源模型可比的水平,代价是两阶段推理延迟高于单阶段模型。

 · 更新于 2026-09-25 · 约 19 分钟 · 9332 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

压缩器建模该对准增益轨迹:用控制电压直接评价与训练的新数据集

论文指出波形误差是增益误差的带载波代理,易被次生效应淹没,用实测控制电压直接计算增益误差并训练灰盒模型后,直接监督在增益误差上明显优于波形代理,而波形指标对差异显著的模型给出相近分数,代价是需要同步采集控制电压并建设约 270 GB 的大规模数据集。

 · 更新于 2026-09-25 · 约 19 分钟 · 9395 字 阅读 →
论文解读

把重叠声场拆开再对齐:FoleyDesigner 如何做时空可控的立体声拟音

针对无声电影片段生成与画面帧级对齐的立体声拟音问题,FoleyDesigner 选择先分解为分层拟音脚本再用视觉轨迹条件扩散逐事件生成并做多智能体混音,最强证据是时空对齐表上 IoU 达 32.2 与 GCC 最低 48.79,代价是密集重叠并发事件仍会出现定位误差且依赖仿真数据与多阶段流水线。

 · 更新于 2026-09-25 · 约 19 分钟 · 9299 字 阅读 →
论文解读

当画面给不出声音线索时,导演脚本如何逐秒指挥视频生音频

针对视频生音频中多事件时间不可控与画面线索不足的问题,FoleyDirector 用 1 秒一段的结构化时间脚本加适配器做细粒度时间控制,在 DirectorBench 上把总体 F1 从 0.2451 提升到 0.4819,代价是需要逐段脚本标注与双路推理。

 · 更新于 2026-09-25 · 约 20 分钟 · 9521 字 阅读 →
论文解读

FoleySet:用两层动作 taxonomy 把拟音从宽泛标签拉回制作现场

针对拟音数据缺乏动作与材质细粒度标注的问题,论文用两层人工分类体系组织 10000 段拟音并给出可复现基线,最强证据是大类准确率 0.82 而 73 类降至 0.64,代价是长尾分布与单标注者带来的细类混淆。

 · 更新于 2026-09-25 · 约 19 分钟 · 9179 字 阅读 →
论文解读

用生成干净样本教判别器:在 FSD50K 里自动挑出单源声音

针对 FSD50K 存在背景干扰、重叠与稀疏标注的问题,该工作用扩散模型生成干净单源样本再构造受控混合来训练 BEATs 加 Bi-LSTM 判别器,在专家整理的 BSE 集上报告 95.51% 准确率与 98.58% 精确率,并据此筛选出 32,880 条的 FSD50K-Solo,代价是未验证对未见类别的泛化。

 · 更新于 2026-09-25 · 约 19 分钟 · 9175 字 阅读 →
论文解读

只听见声音不够:当语义对不上时用双耳空间线索做视听推理

论文把视听空间推理定义为超越语义匹配的定位与关系判断,用 SoundSpaces 2.0 渲染的全景图加双耳音频构造 100 万问答对并训练连接视觉与空间音频编码器的大语言模型,在语义错位与多同类目标场景上报告了双耳相对单耳的定向优势,但分类精度仍远低于 Oracle 且依赖仿真场景。

 · 更新于 2026-09-25 · 约 19 分钟 · 9064 字 阅读 →
论文解读

合成数据能替代、修正再扩展声源定位训练吗

该文用文本到图像与文本到音频模型构造 VGGSound 合成克隆并固定 ACL-SSL 做对比学习,验证同规模替代、合成图像配真实音频修正与 2 倍 3 倍混合扩展三类用法,最强混合配方相对纯真实基线提升约 8.62 cIoU、5.58 mIoU 与 12.16 IIoU,代价是合成音频弱于真实音频且纯合成需到 3 倍才稳定超越。

 · 更新于 2026-09-25 · 约 18 分钟 · 8631 字 阅读 →
论文解读

实测琴体约束显式非线性弦:65 把古典吉他的可复算合成链

论文用 Mores 实测的 65 把吉他桥柔量与桥到空气辐射驱动几何精确非线性弦,在连续级做标量辅助变量二次化并以两次 Sherman-Morrison 秩一更新实现每步显式推进,以全品格约 6240 个音展示乐器相关共鸣,代价是琴体与辐射仍为线性模态且跨琴响度依赖两遍归一化。

 · 更新于 2026-09-25 · 约 18 分钟 · 8776 字 阅读 →