不用黑盒记频谱:用运动、相位与气流三组物理量做边缘端重放检测
该研究把 1 秒多通道语音转为时延轨迹、双耳相位与低频气流三组可解释特征再用 XGBoost 判真伪,在 D3 六通道上报告等错误率 17.8%,代价是仍需多通道阵列且在空旷与车载等未见环境下误差明显上升。
该研究把 1 秒多通道语音转为时延轨迹、双耳相位与低频气流三组可解释特征再用 XGBoost 判真伪,在 D3 六通道上报告等错误率 17.8%,代价是仍需多通道阵列且在空旷与车载等未见环境下误差明显上升。
论文要解决环回频率调制带来持续基频偏移、使时变延迟函数随时间线性增长而无法装进环形缓冲的问题,选择用闭式解给出的解析相位和发声频率构造可回绕延迟并叠加整周期偏置,最强证据是回绕点相位连续且整周期偏置下波形不畸变,代价是必须预先知道发声频率且每隔 N 样本回绕一次。
该文把奇次泛音地形织进墙面尺度纺织品并用手持感应环读取,其证据是 44 磁体由 25 路复用驱动与 72 赫兹基频折叠方案,代价是静止无声且需身体走位学习路线。
针对稀疏测量的声场重建问题,该工作用小波散射变换提取多尺度统计特征并以二值掩蔽只保留跨被试一致的系数,再与稀疏观测的数据保真项联合优化神经场,在 HUTUBS 仿真 HRTF 上以 7×7 观测重建全空间幅度时 MSNF 的 LSD 降到 5.34 并在 NCC 达到 87.79%,代价是每个 HRTF 需单独训练一个网络且只验证了幅度。
论文用 Mores 实测的 65 把吉他桥柔量与桥到空气辐射驱动几何精确非线性弦,在连续级做标量辅助变量二次化并以两次 Sherman-Morrison 秩一更新实现每步显式推进,以全品格约 6240 个音展示乐器相关共鸣,代价是琴体与辐射仍为线性模态且跨琴响度依赖两遍归一化。
该研究把管弦乐引子与静息任务态脑电都转成时间序列做复发分析,用层流性、确定性、复发率和缺隙度刻画动力学组织,并提出局部密度相似性做音乐与脑电复发图的跨比较,最强证据是贝多芬引子与健康脑电的平均局部密度相似性下降最大而柴可夫斯基最小,代价是仅两例被试与首 60 秒音乐的探索性小样本。
该研究把芭蕾手臂姿态作为可学习控制面,用分类选古筝乐句区、回归做中间态插值,再经颗粒合成重塑纹理,证据是 60 fps 下每类约 300–480 个训练样本与 4–15 秒乐句构成的语料库,代价是系统偏好可识别姿态且依赖多软件链与作者式观察而非结构化评估。
针对夜晚户外太暗导致常规增强现实无法跟踪的问题,nocturneAR 用发光体的颜色闪烁序列传递编号来触发画面与声音,2026 年 2 月 11 日的夜间森林探索性展览显示参与者会放慢移动并靠听觉叠加声音,但系统在明亮环境下不稳定且未做定量评估。
nOdes 为社区合奏设计 24 个手持球体与 50 Hz 服务器集中控制环,用重力向量选十二音高类别并接入外部生成系统实证,以 10.6 微秒级发包抖动换来可热重载的映射迭代能力,代价是 20 球以上丢包陡增与近距离饱和干扰。
该文把线性链条件随机场中的硬维特比解码换成温度控制的软最大值近似得到可微模块 dCRF,并在双声部干扰下的音高类别估计中显示 Toeplitz 约束的 dCRF-T 接近双向长短期记忆网络精度但参数少得多,而全参数 dCRF 提升有限。
针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。
Orbis 要解决如何把人工细胞中 Min 波的反应扩散动力学变成可作曲的光声运动,方法是按设定化学配比合成人工细胞并用图像跟踪把波位置转为环形声光定位,已在展览系统中实现三条件与三序列的对应呈现,代价是当前依赖预录视频且复现需要专门生物实验条件。
针对从单条合成脉冲响应估计薄板六参数的逆问题,论文用 PyTorch 可微模态合成器加多尺度谱损失做推理时优化,以 500 次短探测加 1500 步精修的两阶段策略应对非凸,在 8 条响应上把平均归一化均方误差降到 4.29×10-3 量级,代价是平均每条约 13.42 分钟的优化时间。
该文针对球形阵列测得的高阶 Ambisonics 空间房间脉冲响应,用 Herglotz 分析重建早期反射的方向与到达时间并显式仿真散射与空间混叠,用方向反馈延迟网络重建晚期混响的方向相关衰减,在 IRCAM Espro 厅 EM32 实测上以球面相关和能量衰减浮雕贴近测量,代价是保留单斜率指数衰减假设与阵列阶数限制。
针对波数字滤波器实时仿真中面向对象抽象与冗余状态带来的开销,论文用描述语言加静态编译生成最小状态代码,在四类电路上以每样本周期数与指令数为证据逼近理论性能界,代价是拓扑必须在编译时固定并依赖热重载维持可修改性。
该研究用房间脉冲响应的自卷积夸张系统把场地声学变成可演奏的混响,在 7 场演出中以质性反馈和频谱分析显示可听声学特征更易引发对空间与人的觉察,代价是啸叫、浑浊与可懂度损失。
该文把耶胡拆成两根刚性弦、按压手指、弹性弓毛与模态琴桥来做有限差分声音合成,用锤击与激光测振标定弦与琴桥参数,在弓弦稳态速度拟合与 10 秒音频约 1.49 秒算完的实时性上给出证据,代价是手指参数靠经验选取且弓力弓速在演奏验证中未知。
针对发动机爆燃脉冲的时序本质,论文用可微脉冲串加卡普拉斯-斯特朗共振器重建声音,在三类发动机共 7.5 小时音频上把总验证损失平均降低 5.7%、谐波重建提升 21%,代价是共振器音色偶尔偏离目标且尚未在真实录音上验证。
论文把抗导数抗混叠首步的线性插值换成二三阶拉格朗日插值,并用切比雪夫多项式逼近非线性使矩形与三角核积分可闭式计算,在 3192 Hz 正弦加 tanh 与硬削波实验中显著提升信噪比,代价是每样本多次非线性求值与离散余弦变换开销。
该工作用共享拓扑的配准耳网格研究几何驱动的个性化 HRTF 合成,对比 30 维 PCA 几何与全分辨率网格、潜空间与全信号回归以及单域与多域损失,显示多域复合损失把时域表示的 LSD 从约 15 dB 降到约 9.4 dB,但全几何增益依赖表示且波形一致性仍有限。