英文题目:SPMuS-SS1.1: AI-AIDED ENF TIMESTAMPING IN MULTIMEDIA FORENSICS
会议身份:
conference:eusipco:2026:conference-paper-id:0000806
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#CNN #对比学习 #鲁棒性 #音频检索
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Barak, Raz:机构信息未能从会议 PDF 纯文本可靠映射
- Dabush, Lital:机构信息未能从会议 PDF 纯文本可靠映射
- Shlezinger, Nir:机构信息未能从会议 PDF 纯文本可靠映射
- Routtenberg, Tirza:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
电网频率时间戳任务以待查音频中提取的电网频率波动轨迹为输入,输出其在远长于查询的参考时间轴上的起始时刻,查询短于2分钟或信噪比低时波动易被噪声淹没且长参考带来大量误匹配而可靠性骤降。该方法先以短时傅里叶变换从查询音频提取前三谐波轨迹并从参考提取对应轨迹,得到变长多通道频率序列。接着以时域卷积网络编码器将变长轨迹映射为定长判别表征,并在隐空间以余弦相似度度量查询与候选参考段的对齐程度。然后以线性融合层将隐空间余弦分与原始三谐波相关分加权为最终得分,并按最大得分在参考轴上检索时间戳。相对仅用相关系数或归一化错位的传统匹配,其关键差异在于显式学习跨谐波时序结构并以物理相关线索兜底,因而在单谐波微弱或不一致时仍保持鲁棒并可跨电网泛化。在中国ENF-WHU训练、以色列ENF-Wavemark测试的跨电网评测下,本方法编码器加融合的准确率为85.63%,高于基线方法相关系数的准确率74.28%。该结论适用边界受限于音频载体与15秒容差判定,对视频载体、恶意剪辑对抗与多电网外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,哪些信息必须保留?
这篇解读的输入是论文正文给出的任务定义、2 阶段系统描述、训练与评估条件,不引入外部电网知识或其它解读的推断。目标是让刚进入语音与音频取证的研究生能复述方法并核对实验条件。必须保留的信息包括查询信号与参考时间轴的表示方式、相似度函数的作用、编码器输入谐波设置、对比损失构成、跨电网数据集划分、15 秒容差下的成功率定义以及短录音与低信噪比下的关键数字。
输出按学习依赖展开,先讲任务与已有路线,再讲方法全景与组件计算,然后讲数据构造与训练,最后讲实验条件、结果与复现要点。电网频率是指交流电网标称频率附近的缓慢波动,例如 50 赫兹附近的微小起伏。白话说,它是发电与用电瞬时不平衡留下的全局节奏,同一电网下不同设备录到的节奏形状一致。音频设备在录音时会无意拾取这种节奏,于是录音里藏了一条环境时间水印。
时间戳验证就是问这段录音是何时录的,做法是把从录音中提取的频率轨迹与电网长期记录的参考轨迹逐段比对,找到最相似的位置。论文把这个问题写成检索任务,查询轨迹长度为录音时长,参考轨迹远长于查询,对每个候选起点截取等长参考片段并计算相似度,取相似度最大的起点作为估计值。若估计起点与真实起点的绝对差在 15 秒以内则判为成功。这个 15 秒容差贯穿数据筛选、训练正负划分与最终评价,复述时不能丢。
已有路线为什么在短录音和噪声下会失效?
已有主流路线分为两步。第一步是电网频率提取,常用做法包括降采样、在标称频率谐波附近做带通滤波、估计瞬时频率,论文沿用短时傅里叶变换流程并提取前 3 个谐波。第二步是匹配,常用相似度是相关系数与归一化错位。白话说,相关系数看两条轨迹起伏方向是否一致,归一化错位看两条轨迹对齐后残差有多大。论文引用的前期经验证据指出,提取算法换哪一种对最终时间戳精度影响不大,真正影响精度的是相似度函数的选择。
当录音较长且信噪比较高时,相关类方法已经很准。当查询短于 120 秒或信噪比低时,短窗内可用的起伏细节太少,偶然相似的错位窗口也可能给出高相关,于是真对齐位置不再是全局最大值。异构无线采集会进一步加剧这个问题,不同传感路径引入的噪声与失真让原始轨迹比较更不稳定。另一类相关工作是用机器学习做篡改检测与频率估计,但本文不做篡改定位或频率估计本身,而是专门学习用于时间戳检索的相似度。
理解这一点很重要,否则容易把编码器误解为更好的频率提取器。编码器输入的已经是提取后的频率轨迹,它的作用是重写比较空间,而不是重写提取。
要解决的具体问题与输入输出如何形式化?
论文要设计的是相似度函数。输入是 1 对等长轨迹,查询轨迹来自待验证录音,参考片段来自参考时间轴上某个候选起点。输出是一个非负实数,表示两者时间对齐的可能性。推理时用该函数对所有候选起点打分并取最大值。举例说明时要明确这是教学例子而非论文数值。
假设有一段 90 秒的查询轨迹和 1 天长度的参考轨迹,系统把参考切成大量 90 秒候选窗,每个窗与查询算 1 次相似度,最终返回分数最高的窗的起点。若该起点与真实录制起点相差不超过 15 秒则记 1 次成功。难点在于候选窗数量随参考变长而增大,偶然高分的机会也增大,因此学习目标不仅要让对齐窗分数高,还要显式压低错位窗分数。这自然导向对比学习。论文把与真实起点差在容差内的参考窗记为正集,把差超出容差的记为负集。
训练时每个查询同时看到正窗与负窗,损失同时奖励正窗高分与负窗低分。设计时假设可以拿到带标签数据,即提取后的查询轨迹、对应参考轨迹与真实时间戳。评估时则换到另一个电网的数据集,检验学到的比较规则是否跨电网成立。
两阶段系统如何组织,样本走完一次经历什么?
系统分为训练系统与时间戳系统。训练系统负责构造对比样本并优化神经网络参数,时间戳系统负责在推理时用学到的相似度做检索。先沿一个样本走完流程。输入是一段查询录音及其真实时间戳。数据准备先把它切成多个重叠的不同长度片段,每个片段对应一个时间对齐的参考片段。
然后用短时傅里叶流程提取频率轨迹,查询侧保留前 3 个谐波,参考侧在较嘈杂的蜂窝采集条件下只用第二谐波中经验上最稳定的表示。接着做质量筛选,只有在 15 分钟参考窗内最高相关位置落在真值容差内的片段才保留,避免用损坏轨迹训练。随后为每个查询构造一个正例与多个负例,正例是正集里相似度最高的参考窗,负例包括按每个谐波挑选的软负例与硬负例。
编码阶段把查询与参考的多谐波轨迹分别送入同一时域卷积编码器得到固定维度向量,再算潜在余弦相似。同时算原始三谐波相关分数,最后由线性层把两类分数加权求和得到最终相似度。推理时不再构造正负集,而是对参考时间轴上所有候选起点打这个最终分数并取最大。
电网频率提取 × 时间戳匹配: 电网频率提取负责从录音中分离出随发电与用电不平衡而缓慢起伏的频率轨迹,时间戳匹配负责把这条查询轨迹放到很长的参考时间轴上逐窗比较并选出最相似的起点,二者搭配的原因是提取质量决定了可比信号的干净程度而匹配准则决定了能否在短窗和噪声下区分真对齐与偶然相似,组合意义在于本文冻结提取流程而专门学习更具判别力的相似度函数。
编码器输入是什么,怎样把变长轨迹变成定长表示?
编码器输入不是原始波形,而是提取后的谐波频率轨迹。查询侧把 50 赫兹、100 赫兹与 150 赫兹 3 个谐波堆成 3 个通道,形状可记为通道数乘以时间长度。论文特别说明查询录音相对干净且采集条件受控,因此用 3 个谐波增强稳健性,参考录音来自更嘈杂的蜂窝测量,因此只提取第二谐波中最可靠的表示。这种不对称设置是原文明确给出的实现细节,复述时要保留,不能统一成两侧都用三谐波。编码器本体基于时域卷积网络块。
白话说,它用多层 1 维卷积同时看邻近时刻的快速抖动与跨越更长窗口的缓慢趋势,空洞或堆叠结构让感受野覆盖不同时间尺度。无论输入时长如何变化,编码器最后都输出维度为固定值的潜在向量。原文未给出该维度具体数值、层数与核大小,因此不能补充。潜在向量之间的相似度用余弦相似计算,即先归一化方向再取内积,方向越一致分数越高。最终相似度公式把原始相关向量与潜在余弦分数线性组合。
原始部分权重是 3 维向量,对应 3 个谐波各自的相关分数,潜在部分权重是标量,再加一个偏置。这些权重与编码器参数一起训练。论文还指出融合机制可扩展到更多文献中的相似度项,但本文实验只验证了上述两类分数的组合,不能把可扩展说成已验证。
原始相关与潜在相似如何分工,融合层学什么?
原始相关直接比较提取轨迹的形状,优点是物理意义清晰且在长而干净录音下已经很强,缺点是短窗下区分力不足。潜在相似先把轨迹投影到任务适配的判别空间,优点是能利用跨谐波关系与时序动态,在单谐波弱或不一致时仍有判别力,缺点是在长录音下可能不如原始比较稳定。融合层学的就是两者之间的加权。它不是固定平均,而是在训练中根据对比目标学出每个谐波原始分数与潜在分数的相对重要性。论文的消融对比了两种运行策略。
一种是仅编码器,即只用潜在余弦相似打分。另一种是编码器加融合,即用线性层合并潜在分数与原始相关分数。结果显示仅编码器在短录音下明显超过基线但在长录音下会落后,加上融合后在所有长度上都超过基线。这支持了一个判断,融合保留了基线在可靠区间的优势,同时在基线失效区间引入学习表示的增益。需要强调的是,这种增益不是因为编码器改进了频率提取,而是因为比较空间更适合检索。
相关系数 × 学习相似度: 相关系数直接在原始频率轨迹上计算线性相关,分工是保留物理可解释的基线比较,学习相似度先把多谐波轨迹映射到紧凑潜在向量再算余弦相似,分工是捕捉跨谐波与时序动态结构,搭配理由是基线在长而干净录音下已经可靠而在短窗下判别力不足,组合后由线性层按需加权两者,新增作用是在短窗和低信噪比下维持区分度。
时域卷积编码器 × 线性融合层: 时域卷积编码器负责把变长多谐波输入映射为固定维度潜在表示并同时保留短时波动与长时趋势,线性融合层负责把原始三谐波相关分数与潜在余弦分数加权求和再加偏置,搭配理由是纯潜在分数在长录音下可能不如原始相关稳定,组合意义是让模型在原始匹配已可靠时不丢失基线优势,在原始匹配失效时依靠学习表示补足。
对比目标如何定义正负,两个损失各自惩罚什么?
训练目标要求对齐片段相似度高、错位片段相似度低。形式上,对起始于真实时刻的查询,正集是参考批中起点与真值差在容差内的片段,负集是差超出容差的片段。两个损失从不同角度实现这个要求。三元组损失取正集中的最低分数与负集中的最高分数,要求前者比后者至少高出边界值,否则产生惩罚。白话说,它盯住最容易犯错的 1 对,要求最弱的正例仍明显强于最强的负例。
概率型损失基于对比预测编码思想,把查询与所有正负参考的相似度除以温度系数后做归一化,要求正例的总概率最大。温度控制分布锐度,温度越小对最接近的竞争者越敏感。论文把两者加权求和,总权重均为一,边界取 0.5,温度取 0.07。优化器用学习率为千分之一的自适应矩估计,批量为一百二十八,训练 20 轮。论文描述每轮每个查询片段会接触到约 896 个不同参考片段,这是批量大小与每查询正负样本数的乘积效果。
原文未报告学习率衰减、早停、权重衰减与梯度裁剪等细节,这些缺项在复现时要明确标出,不能从优化器名称推定。
数据如何切分、筛选与成批,哪些步骤不可省略?
数据准备有 5 个环节。第一是分段,把每个查询录音切成多个重叠的不同时长片段并配对对应参考片段,目的是扩增训练集并让模型见过多种录音长度。第二是频率提取,用短时傅里叶流程按论文引用的管线提取前 3 个谐波,参数增量取 0.2。第三是片段过滤,用质量评估剔除弱或损坏轨迹。具体做法是在 15 分钟参考窗内算相关,若最高分位置不在真值容差内则丢弃该片段。
这一步保证训练只用可靠轨迹,但也意味着模型没有专门学习如何处理完全损坏的输入。第四是样本创建,每个查询生成一个正对、3 个软负例与 3 个硬负例。软负例是在以真实时刻为中心的 15 分钟窗内按每个谐波挑出的最高分错位窗,硬负例是在全部负集中按每个谐波挑出的最高分错位窗。这种难例挖掘让训练集中在最易混淆的错位位置。第五是按长度分组,把相同长度样本放在同一批,从而避免填充破坏时间结构。
填充看似只是工程细节,但对频率轨迹这类时序信号,补零会引入虚假跳变并污染卷积感受野,因此原文强调该策略对保持信号完整性很关键。
InfoNCE 损失 × 三元组损失: InfoNCE 损失把查询与一个正窗及多个负窗的相似度放进概率分布并要求正窗概率最大,分工是全局地拉开对齐与所有错位,三元组损失要求最难负例与最弱正例之间至少保持边界距离,分工是局部地保证最容易混淆的边界仍可分,搭配原因是仅用概率损失可能满足平均区分但边界仍紧,仅用边界损失可能忽略整体分布,组合后同时优化分布锐度与最坏边界。
跨电网评估如何保证公平,指标与噪声条件是什么?
评估采用跨电网协议。架构在约 20 小时来自中国电网的真实录音上训练,在 5 小时来自以色列电网的录音上测试。训练与测试来自不同电网与不同无线传感条件,因此成功不能靠记住特定电网纹理。比较对象是实际可运行的传统策略,即相关系数与归一化错位,另有仅编码器与编码器加融合两种可运行的学习策略。
论文还提到源代码仓库链接,但本次解读所依据的资源状态未完成可达验证,因此不把代码已公开或可直接运行作为事实陈述,复现应以正文描述为准。性能指标是成功率,即估计起点落在真值 15 秒容差内的测试样本占比,方向是越高越好。论文按目标时长画出成功率随录音长度的变化,并单独给出短于等于 2 分钟与全部长度的汇总。
低信噪比实验向查询录音注入加性高斯白噪声后再做频率提取,信噪比覆盖负二十到 +10 分贝,时间戳估计流程与其余实验一致。这种先加噪再提取的顺序很重要,它考验的是提取加匹配全链路的稳健性,而不只是在干净轨迹上加扰动。
ENF-WHU 训练集 × ENF-Wavemark 测试集: ENF-WHU 训练集提供约 20 小时来自中国电网的真实录音用于学习相似度参数,ENF-Wavemark 测试集提供 5 小时来自以色列电网的录音用于评估,分工是一个负责提供对齐与错位对比监督另一个负责检验未见电网与无线采集条件,搭配原因是同电网评估容易高估偶然相似的区分能力,组合成跨电网协议后才能检验表示学到的是时间对齐结构而非特定电网纹理。
主结果在短录音与全部长度上各提升多少?
比较问题是在相同跨电网测试与相同 15 秒容差下,学习相似度相对相关系数与归一化错位能否提高成功率。公平条件是各方法面对相同的查询与参考划分,指标方向是成功率越高越好。下表整理论文报告的汇总成功率,条件分为全部长度与短于等于 2 分钟,比较对象包括两个传统基线与两种学习策略,数值保留原文精度与百分号写法。该表显示学习方法在短录音下增益最大,在全部长度上仍保持领先但幅度收窄。表后需要结合机制解释收益与代价。
收益来自潜在表示对短窗判别力的补充,代价是系统仍依赖提取质量与容差判定,且长录音下原始相关已很强,学习部分的边际增益变小。未胜出项也要指出,在仅编码器设置下长录音表现会落后于基线,只有加入融合后才在全长度上反超,这说明纯潜在比较不能在所有区间替代原始比较。
| 条件 | 指标 | 相关系数基线 | 归一化错位基线 | 本方法编码器加融合 |
|---|---|---|---|---|
| 全部长度 | 成功率 | 74.28% | 77.63% | 85.63% |
| 短于等于 2 分钟 | 成功率 | 46.53% | 55.14% | 73.14% |
表后解释聚焦论文明确报告的提升幅度。配对融合的学习方法相对更强的传统基线,在全部长度上从 77.63% 提高到 85.63%,论文表述为约 8 个百分点的提升。在短于等于 2 分钟的子集上从 55.14% 提高到 73.14%,论文表述为约 18 个百分点的提升。这里是百分点差值而非相对百分比,不能写成相对提升 8% 或 18%。
短录音基线本身成功率较低,因此同样的判别力改进在短窗上表现为更大的绝对增益。论文还报告编码器单用在短窗下可达 74.04%,与融合版本在短窗下基本持平,但在长窗下需要融合才能稳定超过基线。这个反例说明融合的价值主要体现在保留长录音优势,而非进一步推高短录音峰值。
去掉融合会怎样,噪声加大后哪一段先失效?
要回答的第一个问题是融合层是否必要。比较条件相同,指标仍是成功率。论文的曲线描述指出,仅编码器的潜在匹配在短于 2 分钟时超过相关与错位基线,但在更长录音下会落后。加上线性融合后,方法在所有录音长度上都超过基线。因此消融支持融合必要,尤其在长录音区间。
若只看短录音汇总,编码器单用与融合版本差距很小,不能据此说融合无用,因为差异集中在长录音区间。第二个问题是低信噪比下的稳健性。下表按信噪比组织短录音结果,比较对象仍是实际可运行的 4 个策略,指标方向同样是越高越好。表前公平条件是各方法面对相同的加噪查询与相同的提取后流程,噪声在提取前注入。表中数值来自论文表格矩阵,复述时保留 1 位或 2 位小数原精度,不做四舍五入。
| 信噪比条件短于等于 2 分钟 | 相关系数 | 归一化错位 | 仅编码器 | 编码器加融合 |
|---|---|---|---|---|
| -20 dB | 4.24% | 7.97% | 8.23% | 9.38% |
| -10 dB | 18.12% | 21.47% | 28.28% | 28.28% |
| 0 dB | 38.56% | 44.99% | 59.00% | 59.00% |
| 10 dB | 46.02% | 54.37% | 71.59% | 71.85% |
表后解释先说趋势再说限制。在零分贝与 -10 分贝等传统方法快速恶化的区间,学习方法的成功率明显更高,例如零分贝下从约 45% 提高到约 59%。这支持学习表示与原始分数结合后在噪声下更稳健的判断。但在 -20 分贝极端噪声下所有方法成功率都跌到 10% 以下,学习方法虽仍最高但绝对值已无实用意义,说明方法不能突破提取完全失效的边界。
另一个未评测边界是真实无线干扰而非合成高斯噪声,论文的噪声实验只验证了加性高斯白噪声,不能推广到多径、丢包或设备非线性等异构传感失真。训练与部署成本方面,原文只给出优化器、批量与轮数,未报告训练时长、硬件型号、参数量与推理延迟,因此不能承诺延迟或成本改善。
哪些结论尚未验证,哪些数字不能直接推广?
论文直接报告的是跨电网成功率提升与低信噪比下的相对优势,有限解释是对比构造让表示强调对齐相关结构从而跨电网迁移,未验证推测是该思路可扩展到联合学习提取与去噪。表达上要区分这 3 层。缺失证据不是技术错误,但复述时要指出具体缺项。原文未给出编码器维度、层数、核大小、感受野、训练硬件与推理开销,未给出成功率的置信区间或统计显著性检验,未测量误判的时间误差分布,只用 15 秒内容差二值判定。
若把成功率推广到更严的容差,例如 5 秒或 1 秒,需要重新评估,原文没有提供这些阈值下的数字。数据方面,训练约 20 小时、测试约 5 小时,测试规模有限,且片段过滤剔除了弱轨迹,因此报告的成功率是有条件成功率,不能理解为对任意损坏录音的无条件成功率。噪声实验只覆盖合成高斯噪声,不能代表真实无线环境。资源方面,论文正文写了仓库地址,但本次未能确认可达,解读中不将其作为可运行依据,也不声称权重或数据已公开。
总体趋势不等于每组都成立,长录音下仅编码器落后就是明确反例。
复现应先做什么,需要保留哪些超参数与信息条件?
复现先做数据与评估对齐,再做模型。第一步是按论文准备两套数据,一套用于训练对比模型,另一套来自不同电网用于测试,记录标称频率、谐波选择与录音时长分布。查询侧提取前 3 个谐波,参考侧保留第二谐波中最稳定的表示,这个不对称设置必须原样保留。第二步实现短时傅里叶提取管线并固定增量参数为 0.2,然后实现 15 分钟窗内的质量筛选,只有最高相关落在真值容差内的片段才进入训练。第三步按长度分组组批,避免填充破坏时序结构。
第四步实现时域卷积编码器与线性融合层,损失用权重均为一的对比预测损失与三元组损失组合,边界 0.5,温度 0.07,优化器用学习率千分之一的自适应矩估计,批量一百二十八,训练 20 轮。推理时对参考时间轴逐窗打融合分数并取最大,用 15 秒容差计算成功率。还需补的验证包括更严容差下的表现、真实噪声而非合成噪声下的表现、多次随机种子的方差、以及编码器维度与融合权重的敏感性。
常见误解是把跨电网成功理解为模型记住了电网特征,实际上训练与测试电网不同,记住源电网纹理在目标电网上应表现为下降而非提升,因此提升更可能来自对齐结构的判别,但这仍是有限解释而非因果证明。
何时值得尝试这种学习相似度,何时不必?
当任务是短录音时间戳验证、已有相关基线在短窗下出现大量接近真值的竞争峰、且能拿到带时间戳的参考轨迹构造对比样本时,值得尝试这种先编码再融合的学习相似度。它的适用条件包括提取后仍有可用轨迹、评估容差明确、测试电网或采集条件与训练不完全相同。当录音普遍较长且干净、原始相关已接近可用要求时,边际收益可能较小,此时应先评估基线在目标容差下的成功率,再决定是否引入训练成本。
当输入轨迹已完全损坏或信噪比低到提取失效时,学习相似度也不能起死回生,应优先改善采集与提取。复述方法时记住一条主线,输入是多谐波频率轨迹,表示是时域卷积给出的定长向量,组件是余弦相似与原始相关的线性融合,目标是拉开对齐与错位,输出是参考轴上的最大分数位置。抓住这条主线就能在不借助外部资料的情况下完整复述论文的贡献与边界。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
区域 5 · 查看论文原页
区域 6 · 查看论文原页
另有 10 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses





