英文题目:Deep Drawing: Performance Surface Sound Source Localization.

会议身份:conference:nime:2026:conference-paper-id:nime2026_166

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#CNN #Transformer #模型比较 #麦克风阵列 #声源定位

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Lennon Seiders:机构信息未能从会议 PDF 纯文本可靠映射
  • Julie Zhu:机构信息未能从会议 PDF 纯文本可靠映射
  • John Granzow:机构信息未能从会议 PDF 纯文本可靠映射
  • Alex Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Anusha Chinthamaduka:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理表演尺寸胶合板上绘图声源定位,输入为四路接触麦克风信号,输出为笔尖二维坐标,难点在于木材各向异性传播难以解析建模且板中声速快导致到达时差极小,使传统时延估计方法失效。系统先以192kHz多通道同步采集与顶视240fps视频标定构建音频位置对,将每视频帧长度音频转为频谱并对齐对应坐标进入下一步。接着对8帧约33ms短上下文频谱做逐通道归一化与可选高通滤波预处理,为模型提供去量纲的频谱输入。然后分别用从零训练的ResNet-50回归与带卷积前端的轻量Transformer预测坐标并实时可视化,形成可感知手势轨迹。与显式估计时延的经典方法相比,关键差异是直接从频谱幅度与相位模式学习材料相关传播映射,避免各向异性下的解析声速假设,因而在小数据集低延迟表演场景具有实用意义。在全部录制聚合评测条件下,ResNet50在高通1000条件下的L1误差指标为0.197,低于Transformer在同条件下的L1误差指标0.237。结论适用边界限于固定装配与同类圆珠笔摩擦声,换板朝向或重新安装后需重标定,外推到空气传麦克风阵列尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 演示资源:https://deepdrawing.github.io/ — 链接可访问(HTTP 200) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?要解决的表演定位问题是什么?

本文的输入是表演者在胶合板上用圆珠笔画画时产生的摩擦与敲击声,目标是在演出进行的同时实时估计笔尖在板面上的 2 维位置,并把位置变成可视化的轨迹。本文强调的输出不是精确的几何复原,而是感知上可信、延迟很低的手势痕迹,因为表演更在意连续的曲线形状是否跟得上手,而不是每个时刻的绝对坐标是否分毫不差。

为理解难度,可以把一个样本的旅程先走一遍:笔尖在某处摩擦木板,振动沿板体传到 4 个角上的接触式麦克风,系统截取约 33 毫秒的多通道音频并转成频谱,再由神经网络输出一个归一化坐标点。初学者先要建立白话概念:声源定位就是根据多路声音反推声源位置;到达时间差估计是经典声源定位做法,先量波形到达各麦克风的时间差,再按声速几何解算。

声源定位 × 到达时间差估计: 声源定位负责回答声音从板面哪里来,到达时间差估计是经典做法,分工是先测各麦克风波形延迟再几何反推位置;二者在此搭配不成立的原因是声音在胶合板中传播快且各向异性,时延极小又难解析建模,因此论文放弃显式时延,转而让模型直接从多通道频谱学习传播模式,组合意义是用数据驱动替代不可靠的解析延迟。

本文明确报告传统到达时间差方法在此不适用,理由有两条。第一,胶合板是各向异性材料,不同方向传播特性不同,难以解析建模。第二,板子只有 3 英尺见方而木传声速很快,通道间时延极小,难以可靠测量。因此作者转向基于学习的声源定位,让模型直接从数据学习复杂的传播模式,这也是全文方法选择的总依据。演示页面当前可用,地址为官方提供的演示链接,本文写作时资源状态显示可用。

与以往绘画发声和定位路线有何不同?

在新乐器领域,用绘画控制声音并不新鲜。论文列举了 Sketch-to-Sound、Sounding Brush、Illusio 和 JamSketch 等工作,它们的共同点是把画出的痕迹映射为合成参数,画的是控制器。Deep Drawing 的不同在于前景化绘画本身的声学副产品,也就是笔与木板摩擦的音色,并把它当作人与机器共同解释的空间。除了本项目前作,没有其他研究处理表演面上的声源定位,这一定位使本文更接近表演系统而非合成器映射。

在定位方法上,经典路线依赖显式时延估计,深度学习路线则常用频率与相位表示,直接学习传播与反射。论文引用残差网络在定位中的代表性工作,以及引入 Transformer 做概率性声事件定位的工作,说明两类骨干都有先例。但本文的运行阶段与目标不同:不是离线高精度重建,而是实时、低延迟、小数据、表演可部署。这一差异决定了后文用 8 帧上下文、从头训练、不做大模型预训练等选择,不能把通用声源定位榜单的胜负直接搬来当同条件比较。

为什么板面越大、材料越特殊,定位越难?

表演尺寸带来两个具体困难。第一是标定困难:演出装配每次都可能略有不同,麦克风按压力、板子朝向、环境支撑都会改变传递特性。如果模型记住了某 1 次装配的绝对映射,换 1 次装配就可能失效。第二是监督困难:需要把音频与笔尖位置逐帧对齐,而人手绘画速度快、压力变化大,视频追踪本身也有误差。

举一个教学用的例子:假设笔在板中央快速画圈,理想情况下 4 路信号应呈现对称的相对强弱变化;但如果板子旋转了 90 度再固定,同样的笔触对应的通道关系就变了。若模型只记住旋转前的通道编号,就会在旋转后系统性偏置。这正是论文在每次录音之间旋转木板的原因,要让人为引入装配变化,检验模型是否还能泛化。例子只是帮助理解旋转的动机,不代表原文给出该例子下的具体误差数值。

系统全景:从木板振动到屏幕轨迹经过哪几步?

系统的硬件全景很简单:3 英尺乘 3 英尺乘 14 英寸的 3 层胶合板作为传感面,四角顶部各贴一个 AKG C411 PP 接触式麦克风,用多通道声卡以 192 kHz 同步录音。选择接触式而非空气麦克风是为了隔离绘画的机械能量、减少环境噪声;选择高采样率是因为木传时延很小,需要更密的时间采样来保留细微差异。真值方面,笔顶装高对比标记,由头顶 GoPro Hero 13 Black 以 240 帧每秒追踪,再经标定映射把图像坐标转成板面坐标,并与音频按时间对齐。

下面的实拍图展示了该硬件与数据采集后的板面状态,有助于把文字描述落地为可复现的装配。

看图路径: 1. 先确认四角各有一个接触式麦克风及其固定胶带位置;2. 再观察板面密集的笔触痕迹覆盖范围是否到达边缘;3. 对照板面中央深色交叉标记与对角线的相对位置;4. 注意木纹与污渍等视觉干扰与定位任务无关

原论文 Figure 1:Plywood performance board with contact micro- phones.

论文图 1。原论文 Figure 1:“Plywood performance board with contact micro- phones.”。

从像素可见,这是一块浅色胶合板的俯视照片,板面布满密集的横竖与斜向笔触,说明采集覆盖了多种方向与位置;4 个角各有一个黑色小接触麦克风并用黑色胶带固定,与正文每角一个的描述一致;中央有深色交叉对角线标记,可作为观察板面坐标范围的参考。复现时应优先保证四角对称固定与同步录音,而不是纠结木纹或已有笔痕,因为定位依赖的是振动相对关系。预处理与模型将在后文展开,这里先记住主路径是 4 通道音频加视频坐标对齐成帧,再做频谱回归。

输入表示:每一视频帧对应什么样的频谱张量?

论文把每个视频帧长度的音频转成频谱表示,并给该帧打上对应时刻的笔尖坐标。模型输入不是单帧,而是一个上下文窗口,取连续 8 个频谱帧,用 256 点快速傅里叶变换实现,窗口总长约 33 毫秒。这个长度是延迟与信息量的折中:太短则看不到笔触运动,太长则实时可视化会滞后。

白话解释频谱图:把短音频按频率展开,横轴是时间或子段,纵轴是频率,亮度代表该频率能量。接触式麦克风负责提供干净的板传振动,频谱图负责提供可学习的时频结构。

接触式麦克风 × 频谱图: 接触式麦克风负责只拾取板体机械振动并抑制空气噪声,频谱图负责把每段短音频变成按频率展开的表示;二者搭配的理由是绘画摩擦声微弱但音色复杂,需要干净的板传信号再做时频分解,组合后模型看到的是 4 个角上振动的频率结构差异,从而有可能推断笔尖位置。

归一化做法是逐通道归一化,用同一录音内该通道所有帧、子段、频率点的最大绝对幅度去除。这一步的意图是消除整体响度差异,让模型关注相对谱形。残差网络把时间上下文、麦克风通道、子段维度压平成一个空间轴,频率点作为另一轴,构成单通道伪图像;Transformer 则把每帧的多通道频谱当作序列中的一个 token,保留时间顺序。两种组织方式对应不同的归纳偏置,后文将分别讲清计算过程。

两个模型如何把频谱变成坐标?

残差网络分支把定位看作图像式回归。原文附录给出输入张量形状为 5 维,批量、8 帧上下文、4 通道、3 子段、频率点数量,整形为批量、1 通道、96 行、频率列的伪图像,其中 96 等于 8 乘 4 乘 3。骨干用从头训练的 ResNet-50,第一层 7 乘 7 卷积改为单通道输入,最后 1000 类分类层替换为丢弃率 0.1 加从 2048 维到 2 维的线性投影,直接输出归一化的横纵坐标。

残差网络 × 回归头: 残差网络负责从伪图像式频谱输入中提取深层空间-频率特征,回归头负责把 2048 维特征直接映射为归一化 2 维坐标;搭配原因是定位不需要分类网格而需要连续坐标,组合意义是把图像分类骨干改成单通道输入加丢弃加线性投影,用 L1 损失端到端学坐标。

Transformer 分支把每帧形状为 4 通道、3 子段、频率点的频谱送入轻量卷积切分器:第一层 1 乘 7 卷积沿频率卷并降采样,第二层 3 乘 5 混合子段与频率,第 3 层 3 乘 3 进一步提炼,每层后都有批归一化与 GELU 激活,再经自适应平均池化压成每帧一个向量并投影到 128 维。8 帧向量加可学习位置编码与丢弃后,送入 6 层、4 头、前馈 1024 维、预归一化与丢弃 0.1 的编码器堆栈,取最新 1 帧位置的表示经层归一化、128 到 64 线性加 GELU、再到 2 维线性的两层头输出坐标。

卷积切分器 × 自注意力编码器: 卷积切分器负责把每 1 帧的多通道频谱压缩成一个固定维度向量并保留频率与通道结构,自注意力编码器负责在 8 帧短序列上建模时间依赖;搭配原因是单帧信息不足而长窗会增加延迟,组合后模型用位置编码加 6 层编码器看到笔触的短期运动,再取最新 1 帧表示做回归。

需要提醒的是,原文未报告注意力权重可视化或逐层消融,因此不能从模型名称推定它一定利用了长程依赖;只能说结构上允许它在 8 帧内建模时间关系,实际效果以后文误差表为准。

监督信号、损失与优化如何组织?数据如何切分防泄漏?

监督来源很直接:视频追踪得到的笔尖像素坐标线性缩放到 0 到 1 区间作为真值,损失是预测坐标与真值坐标的平均绝对误差,也就是 L1 损失。优化器用 Adam,权重衰减为 1 乘 10 的负 4 次方,余弦退火学习率调度训练 20 轮,批量为 32;ResNet 学习率为 1 乘 10 的负 3 次方,Transformer 为更低的 1 乘 10 的负 4 次方。像素坐标原文写作 0 到 936 范围,训练时归一化处理。

为防止时间泄漏,每段录音按时间顺序切分,前 90% 训练,后 10% 验证,而不是随机打散。这保证验证手势在时间上靠后,不是训练样本的近邻重复。数据集共约 590000 个标注帧,对应 240 帧每秒下约 41 分钟,由 4 段各约 10 分钟的自由绘画录音组成,每段之间旋转木板以模拟演出装配不一致。 下图是数据集预处理格式的示意图,理解它才能复现输入张量。

看图路径: 1. 先沿底部时间箭头数出灰色虚线划分的帧边界;2. 再对比 Channel1 至 Channel4 同一时刻的颜色深浅差异;3. 观察每帧内部黑色虚线划分的子段结构;4. 确认顶部 Frame 标注对应一段视频帧长度的音频

原论文 Figure 2:Dataset preprocessing format.

论文图 2。原论文 Figure 2:“Dataset preprocessing format. Each video frame is labeled with a coordinate, and the corresponding audio is converted into spectra.”。

从像素可见,纵向有 Channel1 到 Channel44 个横条,每个横条内有黑色虚线划分的子段与灰色虚线划分的帧边界,底部黑色箭头表示时间向前,顶部标出一个 Frame 跨度覆盖若干子段。这与正文每视频帧音频转频谱、8 帧组成上下文的描述一致。复现时应先对齐视频帧与音频,再按通道堆叠子段与帧,注意保持通道顺序与高采样率同步。

高通滤波 × 逐通道归一化: 高通滤波负责切除低频嗡鸣与板体共振干扰,逐通道归一化负责把同一录音内每个通道除以其最大绝对幅度以消除整体响度差异;搭配原因是不同力度与装配会导致幅度漂移,组合意义是让模型被迫依赖通道间相对频谱形状而非绝对能量,从而在小数据下更稳定。

原文还评估了高通滤波的影响,截止频率取 0、1000、2000 赫兹三档,但滤波是实验对照而非训练必需步骤,具体效果见结果节。梯度路径、冻结与否方面,2 个模型都是从头训练,没有冻结预训练权重的安排;视频追踪器与声卡只是数据工具,不参与梯度更新。

实验测什么?条件是否一致?指标向哪边好?

实验要回答 3 个问题:两种结构谁更准,高通滤波是否有帮助,以及换装配后泛化如何。评估在每段 10 分钟录音上单独测试,再在全部数据上汇总,以便看到跨表演与标定误差的影响。指标是平均 L1 误差,定义为预测归一化坐标与真值之差的绝对值平均,越小越好。所有配置共享同一数据划分与同一坐标归一化,同一表内比较条件一致;但不同录音之间板 orientation 不同,因此跨录音的数字差异包含装配变化,不能只看平均值。

为支撑复现,先把数据规模、采样与优化等实验条件整理成第二张表。该表不是结果表,不能替代主结果表;它的作用是让读者核对数据集、模型优化与评估阶段的一致性。表中数字全部来自正文连续原句的逐字引用,单位保留原文写法,裸值不擅自添加百分号。

条件分组具体条目数值与单位说明适用范围
数据规模标注帧总数与时长590,000 帧,41 分钟,240 fps4 段自由绘画全部数据
数据采集同步采样率192 kHz多通道声卡4 通道
数据划分训练验证切分前 90% 训练,后 10% 验证按时间顺序每段录音
模型优化训练轮数与批量20 epochs,32 批量Adam 加余弦退火2 个模型
模型优化学习率与衰减1 × 10−3,1 × 10−4 衰减ResNet 与 Transformer 区分对应模型

该表说明实验预算很小:41 分钟、单机校园计算资源、20 轮即可训练完。复现时应先保证 192 kHz 同步与 240 fps 对齐,再谈模型调参;若采样率或帧率不一致,上下文时长与输入形状都会改变。高通滤波与主结果的对照见下一节,那里才是判断结构与滤波取舍的依据。

谁更准?主结果数字支持什么判断?

主结果比较的问题是:在相同高通设置下,ResNet50 与轻量 Transformer 的平均 L1 误差谁更低,以及误差在不同录音上是否稳定。公平条件是同一划分、同一归一化坐标、同一 L1 指标;指标方向是越小越好。下表直接选用原文结果表,保留模型、高通、4 个录音与汇总列,数值精度与裸值写法均未改动。

ModelHi-PassR0R1R2R3All
ResNet5000.0870.2960.0650.2490.191
Transformer00.1390.2970.1450.2500.228
Transformer20000.1350.2960.1260.2700.225

该表报告显示,未滤波时 ResNet50 汇总误差为 0.191,为全文最佳汇总;Transformer 在 2000 赫兹高通下汇总为 0.225,为该结构最佳,但仍高于 ResNet。分录音看,ResNet 在 R0 为 0.087、R2 为 0.065,明显低于 R1 约 0.296 与 R3 约 0.249;Transformer 同样在 R1 与 R3 上高,说明装配与演奏变化是主要方差来源。代价是 ResNet 参数远多于 Transformer 的约 2M 参数,轻量注意力在计算受限时仍是可行选项,但精度上未胜出。 下图给出一个模型输出示例,帮助把误差数字对应到轨迹形态。

看图路径: 1. 先找到右下手持蓝色笔帽对应的蓝色真值起点;2. 再沿蓝色平滑弧线追踪完整的笔触走向;3. 对比红色预测折线围绕蓝线的抖动幅度与偏离点;4. 观察四角麦克风与背景网格笔触以确认视场范围

原论文 Figure 3:Example model output. The blue trace is ground truth, red is the model’s prediction.

论文图 3。原论文 Figure 3:“Example model output. The blue trace is ground truth, red is the model’s prediction. For more media, see https://deepdrawing.github.io/.”。

从像素可见,背景是布满旧笔痕的木板,蓝色平滑弧线是从右下手部蓝色笔帽出发的真值,红色锯齿折线是模型预测,紧贴蓝线但高频抖动明显。这支持论文的判断:系统能跟住手势大趋势,适合表演可视化,但逐点坐标仍有噪声;不能把某一段跟得好推广为全程都好,也不能从单一样本读出具体误差数值。更多动态演示见官方演示页。

高通滤波是稳定的增益吗?失败条件在哪里?

消融要检验的是高通滤波是否带来一致增益。原文报告显示影响温和且不一致:ResNet 在 1000 赫兹时 R0 从 0.087 降到 0.081 略有改善,但汇总从 0.191 变为 0.197 并无整体增益;2000 赫兹汇总为 0.195,与未滤波相近。Transformer 在 R2 上从 0.145 降到 0.126 有小幅改善,但 R3 从 0.250 升到 0.270,汇总仅从 0.228 到 0.225,差异很小。

这支持一个有限解释:模型对低频内容相对鲁棒,高通只能在某些录音上轻微稳定性能,不能当作通用解决方案。未胜出项必须指出:Transformer 在所有汇总配置下都落后于 ResNet;R1 对 2 个模型都最难,R3 对 ResNet 最难,说明换 orientation 后的泛化仍是失败条件。原文未测量延迟、帧率与误检率,因此不能宣称滤波改善了实时性,只能谈精度侧的对照。

还有哪些边界没有测?什么结论不能下?

论文自身承认可靠定位远未解决, variance 跨录音表明学到的映射对板 orientation 与固定条件敏感。作者将其视为可接受的音乐实践,认为演出装配通常固定且训练过程短,可做面向特定 orientation 的标定。但这仍是待验证的实践假设,不是已证明的泛化结论;换场地、换笔、换压力、长时间漂移都没有系统评估。

数据质量是另一边界:标定与人为误差使录音与标注困难,高精度真值依赖视频追踪与图像到板面映射,任何标定偏差都会直接进入监督。目标定义也有局限:当前是逐点坐标回归,而表演更在意曲线形状;作者在未来工作提出预测手势形状而非 exact 位置,但该想法未在本论文实现与评估。缺失证据不是技术错误,只是复现与引用时必须保留的适用条件。

要复现这套表演系统,先做什么?

复现应按学习依赖排序。先搭硬件:3 英尺见方 3 层胶合板,四角顶部各贴一个接触式麦克风并保证对称压紧,用支持 192 kHz 的多通道声卡同步录音;笔顶加高对比标记,头顶固定 GoPro 以 240 帧每秒拍摄,并做图像到板面的标定映射。原文未给出标定板图案与映射误差,因此第一步验证应是检查视频坐标与板尺的对齐精度,再谈模型。

再搭数据管线:每次自由绘画约 10 分钟,共 4 段,每段之间旋转木板;每段按时间前 90% 训练、后 10% 验证;每视频帧音频转 256 点快速傅里叶变换频谱,8 帧组成约 33 毫秒上下文,逐通道除以该录音内最大绝对幅度。模型可先跑 ResNet50 单通道伪图像回归,优化用 Adam、权重衰减 1 乘 10 的负 4 次方、余弦退火 20 轮、批量 32、学习率 1 乘 10 的负 3 次方;资源受限再试 128 维、6 层 4 头的轻量 Transformer,学习率降到 1 乘 10 的负 4 次方。

评估必须分录音报告 L1 并看汇总,不能只报最佳单段。代码与权重方面,论文未声明开源仓库,只有演示页当前可用,因此应按自实现预期规划工作量。

何时值得尝试这种学出来的板面定位?

当表演需要把绘画摩擦声变成实时视觉轨迹,且装配可固定、数据只能采几十分钟时,这种小数据频谱回归值得尝试。它的价值在于绕开不可靠的木传时延解析,用多通道相对谱形直接学位置,延迟可控在数十毫秒量级。但若目标是跨场地、跨装配的精确几何复原,或需要严格的延迟与稳定性保证,本文证据尚不支持直接部署,还需补充多 orientation 标定、笔具泛化与延迟实测。

对研究生而言,可复述的方法链是:4 通道 192 kHz 同步加 240 fps 视频对齐成帧,转 256 点频谱并做逐通道归一化,8 帧上下文送入 ResNet 或卷积切分加 Transformer 编码器,以 L1 回归归一化坐标,按时间切分评估并分录音报告。记住最强对照是 ResNet 汇总 0.191 优于 Transformer 最佳 0.225,而最大限制是 R1 与 R3 的高误差。下一步验证应是固定装配下的重复性测试与形状级指标,再考虑笔式绘图仪自动采集以减少人力标定误差。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 14 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 nime-2026 论文汇总