英文题目:HRIR-Former: Grid-Free Time-Domain Reconstruction of Head-Related Impulse Responses with a Spatially Encoded Transformer
会议身份:
conference:interspeech:2026:conference-paper-id:xu26c_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#多任务学习 #Transformer #空间音频信号 #声场重建
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Shaoheng Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Chunyi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Jihui Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Amy Bastine:机构信息未能从会议 PDF 纯文本可靠映射
- Prasanga N. Samarasinghe:机构信息未能从会议 PDF 纯文本可靠映射
- Thushara D. Abhayapala:机构信息未能从会议 PDF 纯文本可靠映射
- Hongdong Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向每人仅少量实测头相关脉冲响应需补全任意未测方向双耳波形的空间上采样任务,难点在于稀疏不规则采样下的全局空间相关建模与相位定时保真,且固定网格与球谐插值在角度缺口较大时易退化。所提HRIR-Former先将观测行掩蔽投影为信号令牌并叠加正弦方向编码,再经Transformer编码器做跨方向自注意力补全,以实现任意目标方向的网格无关推断。接着由共享解码器映射回全长双耳波形并经掩蔽融合保留实测行,最后以Conv1D沿重排方向轴做局部时域精修以抑制邻域不连续。与频域幅度加最小相位加独立延时估计的已有管线不同,该方法直接在时域联合优化波形、复频谱与耳间线索,避免相位重建割裂。在SONICOM评测协议下,HRIR-Former的ITD-E指标为18.5 μs,低于Nbr基线的ITD-E指标274.2 μs。结论适用边界受限于自由场补偿后数据与客观波形线索指标,尚未验证混响、头动与主观定位外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么个性化双耳信号必须保留时间和相位?
双耳渲染的目标是重现声音到达左右耳的完整信号。听觉系统靠到达时刻差判断左右,靠强度差判断侧向,靠耳廓引起的细微频谱变化判断前后和高低。如果只给幅度谱而丢掉相位,就等于丢掉了波形何时开始的信息,定位会变得模糊。
论文研究的是空间上采样任务。对同一个听者,只在少数方向实测了双耳脉冲响应,就要预测其余大量未测方向的响应。输入是每人 M 个实测方向的左右耳波形,加上全部 M 加 N 个方向的坐标。输出是 N 个目标方向的左右耳波形,必须保留的信息是每个方向的波形起点、精细振荡和左右耳之间的相对关系。
白话说,头相关脉冲响应就是从某个方向放一个极短脉冲时左右耳分别录到的短波形。头相关传递函数就是它的频域版本。初学者容易把两者当成两种数据,其实是同一件事的时域和频域看法。
头相关脉冲响应 × 头相关传递函数: 头相关脉冲响应是时域短波形,负责保留波形起点时刻与相位细节,直接决定左右耳听到的波形形状;头相关传递函数是它在频域的对应表示,负责刻画幅度随频率的变化,更方便观察耳廓谐振。两者是同一物理过程的两种观察方式,论文选择在时域重建头相关脉冲响应并搭配复数频域损失做谱对齐,搭配理由是时域自然保留相位而不必做最小相位假设,频域损失补上幅度约束,组合后同时管住波形起点与频谱形状。
对刚入门的研究生,关键动作是先分清个性化与上采样两条路线。个性化是用人体测量或 3 维扫描预测某人的响应,上采样是不用人体参数、只用该人少数方向的实测波形去补全其余方向。论文只做后者,不需要耳廓扫描,但要求同一人的稀疏观测必须可靠。
资源状态方面,本次收到的证据中未发现来源绑定且完成验证的资源。因此不得声称代码模型或数据已公开,只能按论文描述的 SONICOM 数据和训练配置去复述方法。
频域幅度加最小相位路线为何会损失时间保真度?
经典做法是用基函数或球谐函数做插值。做法是把少数方向的响应表示成一组基的叠加,再按新方向的基权重合成。这种方法在密集采样时尚可,但在 30 到 40 度大间隔稀疏条件下会明显退化。球谐插值同样在稀疏时会失准。
另一大类是机器学习方法,但多数仍在固定方向网格上重建 793 个方向的幅度谱。相位则用最小相位近似加独立时延估计来恢复。最小相位假设把相位当成可由幅度推出的最小延迟成分,时延项再单独估计。这在频域建模困难时是权宜之计,但会损害真实的起始时间和精细相位。
近期同输入同目标的代表是检索增强神经场等方法。它们能在 3 到 100 个测量下重建 793 方向集合,优于球谐插值,但仍绑定固定网格,且主要重建幅度。时域直接建模的工作很少,扩散模型做法仍限定固定网格,时域分解叠加做法只限正中面。
因此论文的差异不是换一个更大的网络。而是在运行阶段就允许查询训练时没见过的任意连续方向,并且全程在时域输出波形,不强加最小相位假设。这是理解后续编码器和损失设计的对照基准。
输入的方向坐标和波形矩阵到底长什么样?
论文把问题写成矩阵映射。对一个受试者,共有 L 等于 M 加 N 个方向。每个方向坐标记为方位角俯仰角半径三元组,头部中心为全局原点。每个实测方向录到左右耳各 K 等于 256 点、采样率 48 千赫的波形。左右拼接成一行长度 2K 的向量,M 行堆成 M 乘 2K 的观测矩阵。
目标是在相同采样率和长度下估计 N 个目标方向的 N 乘 2K 矩阵。要求估计矩阵在弗罗贝尼乌斯范数下接近真值。训练时只在掩码为零的缺失方向算损失,已测行不参与重建监督。
下面这张示意图把稀疏的含义画得很直观。读图前先建立空间想象:球面包住人头,少数红点是已经花时间测到的方向,大量白点是要补的方向。模型要在 1 次前向中同时处理这两类点。
看图路径: 1. 先确认中间人头模型是以头为原点的球面声源布置;2. 再数红色实心点与白色空心点的数量对比理解稀疏含义;3. 最后核对右侧图例确认红色为已测位置白色为待估计位置
论文图 1。原论文 Figure 1:“Illustration of HRIR spatial up-sampling: estimating HRIRs at unmeasured target directions (white) from a sparse set of measured directions (red).”。
这张图左侧是一个被球面方向点包围的人头 3 维模型,右侧图例明确红色实心为已测位置、白色空心为未测位置。可见红点只有 10 个左右且分布稀疏,白点密布整个球面,直观说明 M 远小于 N 时的上采样难度。教学要点是不要把白点当成均匀网格编号,它们是连续球面上的任意坐标,后续正弦编码正是为了表达这种连续性。复述时要强调输入包含方向坐标和波形两部分,缺一不可,坐标告诉模型去哪里查,波形告诉模型该人的个性化特征是什么。
HRIR-Former 如何把稀疏观测变成任意方向查询?
整体流程可以沿一个受试者的 1 次前向走完。先把 M 加 N 个方向拼成统一集合,已测行放真实波形,未测行先填零,并配一个长度 L 的二值掩码指示谁是观测。每个方向的波形先被掩码清零再送入信号编码器,每个方向的坐标先做多频率正弦嵌入再投影。两者在隐空间相加形成一个令牌。
全部令牌送入多层 Transformer 编码器做全局自注意力,缺失方向不作为键参与,避免零向量污染。上下文特征经共享多层感知机解码器映射回长度 2K 的双耳波形,再经掩码融合把已测行换回真值。最后按方向重排并过轻量 1 维卷积做时域精修,同时从上下文特征分出双耳线索头预测时间差和强度差。
正弦方向编码 × 网格自由推理: 正弦方向编码把方位角俯仰角半径组成的 3 维坐标映射成多频率正弦余弦向量,负责给每个方向一个连续可微的位置签名;网格自由推理指训练与测试都不绑定固定方向表,负责把任意新方向当作查询输入。分工是编码表达方向的连续几何关系,注意力在这些位置之间传递信息,搭配理由是离散编号无法外推到未见角度而连续编码可按几何相似加权,组合后新增的作用是只用 3 到 100 个实测方向就能查询 793 个方向中的任意一个。
下图是全管线的俯视图,建议按箭头分 3 段阅读。左边是输入编码,中间是注意力与双头输出,右边是重排精修,这样就不会把辅助头和主解码器混为一谈。
看图路径: 1. 从左向右沿主箭头走完实测波形到解码波形的完整路径;2. 对比上支位置特征与信号特征在何处相加形成令牌;3. 观察解码器后按方向重排与一维卷积模块在输出前的位置
论文图 2。原论文 Figure 2:“Overview of the proposed HRIR-Former pipeline.”。
该图从左到右展示了双耳拼接输入经多层感知机编码,与位置编码相加后进入 Transformer 编码器得到上下文向量,再分别进入上支双耳线索头和下支波形解码器,解码波形经按方向重排和 1 维卷积精修后输出。图中用蓝色区分左耳波形、用橙色区分右耳波形,用斜线块表示未测行的零初始化,直观对应掩码补全的思想。关键是理解空间推理与时间重建被显式分开:注意力只管方向之间如何借信息,解码器和卷积只管波形如何画出来,辅助头只管双耳线索是否准确。
信号编码、几何编码和注意力各自负责什么计算?
信号分支的动作是对掩码后的波形做线性投影,把长度 512 的拼接波形压成维度 D 等于 256 的特征。投影前后配层归一化和激活,保证不同幅度的波形进入同一尺度。几何分支的动作是把原始 3 维坐标和 P 等于 6 组正弦余弦拼接后再投影到同一维度。两者相加得到令牌。
Transformer 编码器用 3 层 4 头自注意力,每层含残差和归一化。掩码保证缺失方向只做查询不做键值,这样稀疏布局下的全局相关仍能被捕获。白话说,双耳时间差是左右耳波形峰值错开多少微秒,双耳强度差是左右耳能量差多少分贝。前者差几十微秒就能改变定位,后者差 1 分贝就可能引起偏侧。
双耳时间差 × 双耳强度差: 双耳时间差管左右耳波形到达时刻之差,支撑水平定位,双耳强度差管左右耳能量随频率与方向的差异,支撑侧向感与清晰度。论文让主干重建完整波形,同时用两个辅助头从上下文特征直接预测这两个量,分工是主损失管整体波形误差,辅助损失把定位敏感的线索误差显式放大,搭配理由是稀疏输入下整体误差容易掩盖小的时延偏移,组合后模型在保波形的同时被迫保住可听的双耳线索。
解码器是共享的多层感知机,把每个上下文向量独立映射回 512 点波形,堆成原始预测矩阵。掩码融合按逐元素方式把已测行替换为观测矩阵对应行,未测行保留预测。随后按俯仰降序方位升序重排,再过核大小为 3 的 1 维卷积并与融合前做残差混合。
掩码补全 × 掩码融合: 掩码补全把未测方向当作待预测令牌,与实测方向一起送入编码器做联合推理,负责利用全局空间相关做估计;掩码融合在解码后用二值掩码把实测行原样换回,负责保证实测值不被改写。分工是前者做估计后者做保护,搭配理由是若不融合解码器会对已知方向也产生平滑误差,破坏可信观测,组合后新增的作用是训练只监督未测行,测试时已知方向保持精确而未知方向享受上下文推理。
这个重排加卷积的设计意图是让空间相邻方向的波形在时间上更连续。它能缓解因轻微头动等测量不一致带来的局部跳变,论文指出这有助于减少双耳渲染时的可闻咔哒声。复述时要注意 L 等于 M 加 N 的统一集合这个构造,它把变长的稀疏输入变成了定长集合推理问题。
模型参数不绑定方向数量,因此同一套权重可以处理不同稀疏度。这也是网格自由的另一层含义:不仅方向坐标连续,观测数量也可变。未报告的细节是注意力掩码的具体实现是加负无穷还是乘零加权,原文只说缺失方向不作为键贡献,复现时需自行选择等价实现并在日志中注明。
四个损失项如何组织监督与权重?
训练目标只监督缺失方向。时域重建损失是预测与真值波形差的平方和,复数频域损失是对左右耳分别做归一化离散傅里叶变换后算复数差的平方和。双耳线索损失是预测与真值时间差强度差的平均绝对误差,总损失是三者加权求和。
权重在训练时固定为时间差 0 点 05、强度差 0 点 05、频域 500。优化器用 AdamW,学习率 3 乘 10 负 4 次方,批量 8,500 轮,在英伟达 A100 上训练。数据用 SONICOM 自由场补偿后且未做最小相位滤波的脉冲响应,每条 256 点。
时域重建损失 × 复数频域损失: 时域重建损失计算缺失方向上预测波形与真值波形的均方误差,负责管起点时刻与高频细节;复数频域损失对左右耳分别做归一化离散傅里叶变换后再算复数差,负责管幅度和相位共同决定的谱对齐。分工是前者对波形逐点负责,后者对频率结构负责,搭配理由是纯时域损失容易陷入能量正确但频谱倾斜,组合后新增的作用是在不引入最小相位假设的前提下同时压住波形误差与频谱误差。
需要提醒的是频域权重 500 看起来很大,但这是因为时域误差与频域复数误差的数值尺度不同。不能直接理解为频域更重要,复现时应先保持原权重再做敏感性分析。辅助头只在训练时提供梯度,推理时主输出仍是波形,辅助预测可用于监测双耳线索质量。
原文未报告梯度是否在融合的已测行截断,也未报告是否对不同 M 混合训练还是分开训练 4 个模型。复现时应把这视为缺项,先按每个 M 独立训练的保守方式起步,再尝试混合训练做对照。
数据划分、基线条件和指标方向是什么?
实验用 SONICOM 库,200 多人每人 793 个方向,每条响应 48 千赫 256 点。划分沿用可比协议:前 180 人训练、后 20 人验证,排除表现异常的 P0079 号受试者。训练和评估都用未做最小相位处理的自由场补偿数据。
这与许多频域基线的做法不同,因此在对比幅度谱方法时要记住预处理并不一致。基线包括最近邻、基于检索的两种选择方法、神经场 CbC、神经滤波器 LoRA 和检索增强神经场 RANF,共 6 个。其中频域方法的数字直接引用已有报告,比较聚焦于共有的时间差和强度差误差。
指标共 4 个:时间差误差单位微秒,强度差误差单位分贝,归一化均方误差单位分贝,余弦距离无量纲范围 0 到 2。方向是数值越小越好,归一化均方误差负得越多表示波形误差越小,余弦距离 0 表示波形形状完全相同。聚合方式是对 N 个目标方向和所有受试者平均。
成本方面原文只报告训练轮数批量和显卡型号,未报告训练时长、参数量和单方向推理延迟。因此不能承诺实时性或效率改善,复现时需自行计时补测。是否跨库测试、是否加噪声鲁棒性测试,原文也未报告。
稀疏到只有 3 个测量时还能保住双耳线索吗?
比较的问题是:在相同稀疏度下,时域直接重建能否在双耳线索上追平或超过频域幅度路线。公平条件是同一 SONICOM 划分和同一 M 档,指标方向都是越小越好。下表整理了原文表 1 的关键数字,包含可运行的最强频域基线和最弱最近邻基线,避免只看平均而忽略边界。
| 稀疏条件 | 评价指标 | 最近邻基线 | RANF 基线 | 本方法 HRIR-Former |
|---|---|---|---|---|
| M 等于 3 稀疏 | 时间差误差 | 274.2 | 20.5 | 18.5 |
| M 等于 3 稀疏 | 强度差误差 | 7.6 | 1.2 | 1.14 |
| M 等于 5 稀疏 | 时间差误差 | 154.2 | 18.7 | 16.4 |
| M 等于 5 稀疏 | 强度差误差 | 4.8 | 1.2 | 1.10 |
| M 等于 19 较密 | 时间差误差 | 108.3 | 14.2 | 15.4 |
| M 等于 19 较密 | 强度差误差 | 3.0 | 1.0 | 0.95 |
| M 等于 100 较密 | 时间差误差 | 44.0 | 10.0 | 10.6 |
| M 等于 100 较密 | 强度差误差 | 1.4 | 0.8 | 0.70 |
上表显示本方法在全部四档稀疏度下强度差误差最低,在最稀疏的 3 和 5 测量下时间差也最好。在 19 和 100 测量下时间差略逊于最强基线但仍接近,具体代价是时间差优势随测量变密而减弱。M 等于 19 时本方法 15 点 4 对比基线 14 点 2,M 等于 100 时 10 点 6 对比 10 点 0,说明密集时频域检索方法的时间估计仍有竞争力。未胜出项必须点名:密集档的时间差不是最好,不能说全面超越,限制是基线数字引自已有报告而非本机重跑。
时域波形保真度随 M 单调改善,M 等于 19 时归一化均方误差负 8 点 24 分贝,M 等于 100 时负 10 点 20 分贝。但总体趋势不等于每个方向都变好,个别远离测点的方向仍可能误差较大。下图把 793 个方向的双耳波形堆成一张全景图,读图前先记住每列是 1 个方向、纵轴是时间,这样才能看懂条纹的含义。
看图路径: 1. 先确认横轴为 793 个方向索引纵轴为时间采样点的堆叠方式;2. 再对比左右两幅图的条纹走向与红蓝深浅是否一致;3. 最后查看左上角放大部分检查局部不连续是否被抹平
论文图 3。原论文 Figure 4:“Stacked binaural HRIRs for subject P0187 under M = 19 over 793 directions (each column: one direction; left/right ears concatenated along time).”。
该图左右并排显示真值与估计的堆叠波形,横轴为方向索引,纵轴为时间采样点,颜色表示幅度,正负用红蓝区分,右侧色条标出幅度范围正负 0 点 2。可见估计图完整复现了真值图的波纹走向和明暗分布,左上角放大部分显示局部跳变被平滑但主结构保留。解释是全局空间相关被 Transformer 抓住,而 1 维卷积进一步压住了局部不连续。待验证的是这种视觉接近是否等于听感无差异,原文未做听音实验,因此不能把图像相似直接当成感知透明。
拿掉正弦编码、辅助头和卷积各会付出什么代价?
消融的问题是:在 M 等于 5 条件下,哪个模块对波形误差和双耳误差贡献最大。公平条件是同数据同训练轮数,只改一处。下表整理原文消融数字,保留完整模型与 4 个变体,注意最小相位预处理是额外增加的一行对照。
| 模型变体 | 归一化均方误差 | 余弦距离 | 时间差误差 | 强度差误差 |
|---|---|---|---|---|
| 完整模型 | -7.35 | 0.210 | 16.4 | 1.10 |
| 去正弦编码 | -4.99 | 0.298 | 24.2 | 1.66 |
| 去 1 维卷积精修 | -6.04 | 0.257 | 20.8 | 1.28 |
| 加最小相位预处理 | -6.80 | 0.225 | 19.1 | 1.21 |
| 去频域损失后略差 | -7.10 | 0.217 | 17.3 | 1.14 |
表后解释要区分收益与代价。去掉正弦编码退化最大,四项指标全差,支持几何条件是网格自由的关键。去掉 1 维卷积四项也变差,支持局部连续性需要显式平滑。去掉双耳线索头时波形指标反而略好而时间差明显变差,说明辅助头的主要作用是保定位线索而非压波形误差,这是典型的多任务权衡。加最小相位预处理比默认差,报告显示本方法不需要该预处理,但这不证明最小相位在所有方法中无用,只是在本时域管线中多余。
下面单方向波形图给出一个可复述的实例。读图前先记住这是离最近测点 35 点 2 度的远端查询,最能考验外推,坐标为方位角 90 度俯仰 20 度半径 1 点 5 米。
看图路径: 1. 先确认横轴为采样点纵轴为幅度的左耳单通道波形;2. 再对比紫色实线与黄色虚线在主峰起点处的重合度;3. 最后观察主峰后拖尾振荡的极性与高度是否对齐
论文图 4。原论文 Figure 3:“Left-ear HRIR reconstruction for subject P0187 at (φ, θ, r) = (90◦, 20◦, 1.5 m) under M = 19: estimated HRIR (dashed) versus ground-truth HRIR (solid).”。
该图横轴为 0 到 256 采样点,纵轴为幅度,紫色实线为真值左耳波形,黄色虚线为估计波形,图例明确区分两者。可见主峰的起点、极性和高度基本重合,主峰后几十点的拖尾振荡也对齐,仅在个别尖峰处有轻微高度差。解释是即使角距离超过 35 度,模型仍能恢复起始时间和精细结构,这与全景图中全局条纹一致的结论互相支撑。限制是这只是 P0187 号受试者的 1 个方向示例,不能推广为全库最坏情况,复现时应随机抽多个远端方向统计误差分布。
哪些边界还没有被测量或证明?
论文直接报告的是客观误差下降,有限解释是时域建模和连续编码带来了改善。未验证的推测是听感一定更好,两者之间还缺主观实验 bridging。缺失的证据要逐项点名:没有主观听音实验,没有误判率或定位角误差。
没有推理延迟帧率和内存占用,没有跨数据库泛化测试,没有对头动噪声和测量标定误差的鲁棒性曲线。训练只在 SONICOM 内划分,前 180 训练后 20 验证,跨库到其他采集设备时个性化特征分布可能变化,效果待验证。
基线中频域方法的数字引自已有文献,若预处理或方向采样细节有差异,对比会有偏移。最小相位无用只在 M 等于 5 的消融中显示,未在 3、19、100 全档重复,不能推广为所有稀疏度都成立。
相关性不等于因果,例如卷积去掉后变差支持其有用。但不能排除是容量减少而非连续性本身的作用,需补参数量对齐的对照才能更严谨。总体趋势成立不代表每个方向都成立,远端方向仍需单独统计。
要复现需要准备什么数据和检查点?
先准备 SONICOM 自由场补偿后未做最小相位滤波的数据。每人 793 方向,每条 48 千赫 256 点,按前 180 训练后 20 验证划分并剔除 P0079。检查采样是否按俯仰降序方位升序重排,因为卷积前的重排依赖该顺序。顺序错了空间邻接就错了。
再按 M 等于 3、5、19、100 四档选取稀疏子集,记录随机种子以保证可比。模型按编码维度 256、3 层 4 头、核 3 卷积、损失权重 0 点 05、0 点 05、500 搭建,用 AdamW 学习率 3 乘 10 负 4 次方批量 8 训练 500 轮。
先跑通 M 等于 19 的单方向示例,核对 P0187 在方位角 90 度俯仰 20 度半径 1 点 5 米处的波形是否在起点对齐。再跑全 793 方向的堆叠图检查条纹是否连续,复现时要分别记录时间差强度差、归一化均方误差和余弦距离。
由于本次未确认代码权重可达,所有步骤都应视为按文字重写实现。任何超参数缺项都要在实验日志中标明假设,不要把默认选择当成原文已验证的结论。
何时值得尝试这种时域网格自由做法?
当你的任务是同一人只有极少实测方向却要渲染任意方向,且定位的起始时间不能错时,这种直接在时域做掩码补全的思路值得尝试。它用连续方向编码解决任意查询问题,用注意力解决稀疏借信息问题。用辅助双耳头把定位线索显式保住,用重排卷积解决局部连续问题,四者缺一都会在消融中付出代价。
如果你的数据已经是幅度谱且有可靠的时延估计管线,或者目标只是固定网格的幅度补全,那么换用本方法的收益可能有限。还需补的验证是听音实验、跨库泛化、延迟与参数量测量,以及最小相位在其他稀疏度下的重复对照。
记住关键信息条件:输入必须同时有波形和连续坐标,输出是完整波形而非幅度。监督只在未测方向计算,已测方向靠掩码融合保证精确。满足这些条件时,时域网格自由重建才可能同时保住波形形状与双耳线索。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



