把重叠声场拆开再对齐:FoleyDesigner 如何做时空可控的立体声拟音
针对无声电影片段生成与画面帧级对齐的立体声拟音问题,FoleyDesigner 选择先分解为分层拟音脚本再用视觉轨迹条件扩散逐事件生成并做多智能体混音,最强证据是时空对齐表上 IoU 达 32.2 与 GCC 最低 48.79,代价是密集重叠并发事件仍会出现定位误差且依赖仿真数据与多阶段流水线。
针对无声电影片段生成与画面帧级对齐的立体声拟音问题,FoleyDesigner 选择先分解为分层拟音脚本再用视觉轨迹条件扩散逐事件生成并做多智能体混音,最强证据是时空对齐表上 IoU 达 32.2 与 GCC 最低 48.79,代价是密集重叠并发事件仍会出现定位误差且依赖仿真数据与多阶段流水线。
论文把视听空间推理定义为超越语义匹配的定位与关系判断,用 SoundSpaces 2.0 渲染的全景图加双耳音频构造 100 万问答对并训练连接视觉与空间音频编码器的大语言模型,在语义错位与多同类目标场景上报告了双耳相对单耳的定向优势,但分类精度仍远低于 Oracle 且依赖仿真场景。
论文要解决空间音频一次一建、难以公共复用的问题,用一套可搬运的扬声器与交互基建在亚特兰大地下城支撑 5 组学生作品,以 Since Everyone's a DJ 为案例验证多人手势协作演奏可行,但连续空间控制易被掩蔽且评价仍是小样本反思。
针对稀疏测量的声场重建问题,该工作用小波散射变换提取多尺度统计特征并以二值掩蔽只保留跨被试一致的系数,再与稀疏观测的数据保真项联合优化神经场,在 HUTUBS 仿真 HRTF 上以 7×7 观测重建全空间幅度时 MSNF 的 LSD 降到 5.34 并在 NCC 达到 87.79%,代价是每个 HRTF 需单独训练一个网络且只验证了幅度。
Orbis 要解决如何把人工细胞中 Min 波的反应扩散动力学变成可作曲的光声运动,方法是按设定化学配比合成人工细胞并用图像跟踪把波位置转为环形声光定位,已在展览系统中实现三条件与三序列的对应呈现,代价是当前依赖预录视频且复现需要专门生物实验条件。
针对立体声到 5.1 盲上混中环绕声缺乏可学习目标的问题,该工作用 CCD 加 ELAE 合成 PAEDB 主次对并训练 Mel-RoFormer 与 MLP 做氛围提取,最强证据是 VPA-Mel-RoFormer 主观总分 14.45 接近 VPA-ELAE 的 14.63,代价是客观重建分数偏低且训练目标受限于合成算法上限。
该文针对球形阵列测得的高阶 Ambisonics 空间房间脉冲响应,用 Herglotz 分析重建早期反射的方向与到达时间并显式仿真散射与空间混叠,用方向反馈延迟网络重建晚期混响的方向相关衰减,在 IRCAM Espro 厅 EM32 实测上以球面相关和能量衰减浮雕贴近测量,代价是保留单斜率指数衰减假设与阵列阶数限制。
论文提出 POLAR 框架,把扬声器滤波器、自由场传播与可微听觉损失连成端到端链路,用梯度下降复现了幅度声像、串扰消除与波束展宽甜点的已知解,并展示定位、不确定度与音染可加权折中,但多属性部分仍是模型自评、权重靠试错且未经正式听音验证。
该文以手势驱动的计算机音乐乐器为任务,用姿态追踪加监督映射加 RAVE 潜空间合成的串联链条研究关系性代理,报告了 66 维与 8 维输入、77 维合成控制加 12 对声像坐标的真实系统与第一人称演奏观察,代价是数据集一致性难维持与音色多样性受限。
针对无线声传感器网络中集中式传输原始麦克风信号开销大且难扩展的问题,论文提出传输平面波与边界元物理映射加低秩先验的隐坐标并做反向注水比特分配,仿真报告在相同估计误差下分配策略比均匀量化需要更少总速率,但低秩与高噪声会抬高误差下限。
针对听音者移动导致声传递函数变化时时域 FxLMS 加 RLS 在线建模计算重、重收敛慢的问题,论文提出频域极坐标 FxNLMS 加 NLMS 声路径跟踪与声对比度驱动变步长,在 10 扬声器仿真中把每帧计算量降低约 99.94% 并把移动后重收敛时间常数从 33.11 s 缩短到 3.71 s,代价是仍只在自由场白噪声仿真中验证且依赖多组 Sigmoid …
该工作用共享拓扑的配准耳网格研究几何驱动的个性化 HRTF 合成,对比 30 维 PCA 几何与全分辨率网格、潜空间与全信号回归以及单域与多域损失,显示多域复合损失把时域表示的 LSD 从约 15 dB 降到约 9.4 dB,但全几何增益依赖表示且波形一致性仍有限。
Rumbler 以两端装麦克风与扬声器的可伸缩弯扭管道构成混响反馈环,用 ChucK 滤波器与手势映射在谐波稳态与过渡噪声之间转向,代价是无输入时更不可预测且演出需冻结链路反复练习。
论文提出连续环境语义视听导航任务 SAVN-CE 与记忆增强模型 MAGNet,用自运动线索加情景记忆维持静音后目标推理,直接报告最高 12.1 个百分点成功率提升,代价是 128 线程加 4 卡约 14 天训练与干扰声下增益收窄。
论文把沉浸式混音中的对象移动形式化为音乐空间事件检测,用目标与背景双流加 Spec-TNT 与 TCN 和 CTGI 门控预测帧级移动概率,在 1000 个专业工程上报告 Frame-F1 为 0.7675 和 Event-IoU 为 0.6305,代价是仍有零星抖动且只预测何时动而不生成连续三维轨迹。
论文提出从单图生成可导航三维视觉加空间声场的新任务,并用免训练的全景重建加语义接地加高保真立体声编码链路实现,在 68 段实录上的方向误差降低 47% 等报告提升下仍保留运动声源等明确边界。
该研究用同一卷积神经网络比较幅度与相位四类时频特征的全部小组合,报告显示域内语音用 ILD 加 IPD 在 0 度仰角达 4.5 度误差,而跨内容泛化需通道相位谱加 ILD 与 IPD 并在域外以 8.4 度误差超过更大 Transformer,代价是特征通道增多与对纯音等结构贫乏信号仍失效。
该文以班加罗尔印度声音研究组织二十年实践为对象,提出把空间、工具、准入与治理当作作曲材料的方法,其证据是 32 通道空间音频实验室、工作坊谱系与衍生项目在约束与慢速生长中持续生成,代价是放弃可复制的通用模型与年度新颖性评价。
针对带同步音频的视频生成缺乏联合评测的问题,VABench 用文本到声画、图像到声画与立体声三类任务和专家加多模态大模型的十五维评估组织测试,报告显示端到端音视频模型在对齐与细粒度问答上占优而语义同步真实感难以兼得,且立体声空间分离均不可靠。
针对固定通道神经音频编解码器换通道数就要换结构的问题,VCNAC 用分流卷积加统一量化瓶颈实现单套参数原生支持 1 通道、2 通道和 6 通道,在 7.9 kbit/s 量级取得与更高码率基线可比的主客观重建质量,代价是依赖合成环绕声训练且中置与后置通道客观指标仍偏低。