英文题目:FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset

会议身份:conference:dafx:2026:conference-paper-id:DAFx26_paper_55

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #环境声 #音频分类

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Sunshiyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Alexander Lerch:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

影视拟音需将人体动作与材质交互声与画面同步,输入为多样短录音片段,输出为动作与材质级别类别标签,难点在于类别定义分散且细粒度声音高度相似并易受录制条件干扰。作者先从七个商业拟音库提炼关键词并归纳为9大类73子类两级体系,再从Freesound检索候选音频并做人工筛选与格式归一化,随后由单标注者逐条赋予主类别与子类别及单发多发标记,最后按源录音隔离划分训练验证测试集并用冻结PaSST嵌入加线性分类验证。相比通用音频本体,该体系将散落的脚步与门玻璃等事件统一到拟音动作视角,因而更贴合检索与生成等制作流程。在FoleySet测试集下,9类主类别分类的准确率为0.82,高于73类子类别分类的准确率0.64。该结论适用边界受限于受控短片段分类,细粒度零召回类显示长尾与声学重叠下仍会失败。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

输入是达福斯会议论文正文与官方原图像素,目标是让刚进入语音音乐音频领域的研究生能核对并复述方法。必须保留的信息包括数据来源与许可、两层分类体系的构成、构造流水线的具体动作、划分防泄漏规则、基线特征与训练设置、主结果数字及其适用条件。输出是按学习依赖展开的中文技术解读,不做营销式判断,不引入证据之外的事实。

拟音在这里指影视后期中与画面动作同步复现的日常声音,白话说就是演员走路、衣服摩擦、拿放道具时观众期望听到的那些细节声。论文把拟音的工作定义限定为与人相关的动作声,包括人推动的材料交互声与人体自身发出的声音,例如玻璃碰撞、金属敲击、亲吻或鼾声,而把动物叫声等非人声源排除在本次数据集范围之外。这个限定很重要,后续所有类别设计与筛选都以它为边界。

研究要解决的矛盾是数据驱动的拟音分类检索生成已经起步,但缺少公开的、高质量的、按拟音实践组织的细粒度标注数据。已有通用音频集覆盖面大但标签围绕宽泛语义,拟音需要的动作材质与同步上下文区分度不够。因此论文选择新建数据集并配套分类基线,而不是只改进某个生成模型结构。读者可以把全文理解为 1 次数据集论文的完整动作:先定范围,再定分类体系,再按流程收集处理标注,最后用统一基线证明该数据集可学、可比、可复现。

已有数据集在输入目标监督上与拟音差在哪里?

要判断新数据集是否必要,需要把同输入同目标的资源放在同一维度比较。论文回顾的路线包括通用声音事件集、环境声集、城市声集、拟音合成挑战集,以及视频到音频评测与程序化合成等互补资源。通用集的优势是规模大、覆盖广,弱标签或机器辅助标签适合训练通用表示;专用集的优势是领域集中、人工标注更精,适合特定任务的精细区分。拟音的特殊性在于它不是按场景或物体大类组织,而是按人如何动、碰到什么材质、同步点在哪里组织。

通用本体把脚步、门、玻璃、手部、呼吸等拟音相关类分散在不同分支,检索与评测时难以形成统一的拟音任务。挑战集虽然直接面向拟音合成,但只有 7 类,无法支撑细粒度研究。下面的对照表保留原文的来源、时长、样本数与类别数写法,便于核对这种广覆盖与细精度的权衡。

Freesound2.82,00050
Freesound8.88,73210
Freesound108.051,197200
US8K / FSD50K / BBC SFX6.25,5507
AudioCaps111.240,0164
Synthetic8.36,00030
Freesound9.510,0009

上表显示的趋势是规模与粒度难以兼得。音频集规模可达数百万段,但拟音相关类被稀释;拟音挑战集任务集中,但类别过粗;合成或规划类数据集在模态与任务上与本工作不同。论文因此把定位放在中等规模、全人工标注、拟音专用两层体系,用可分发的知识共享零许可音频保证长期可用。

资源状态方面,论文引用的第三方来源本次可达,其中声音素材平台与英国广播公司音效库的状态码均为可用,挑战页面同样可用,但这只说明本次核对时链接可达,不代表数据集音频永久不丢失。理解这一点才能正确看待论文强调可分发波形文件的动机。

为什么通用分类体系装不下拟音的细差别?

问题可以沿一个样本走一遍。假设输入是一段 3 秒的走路脚步声,通用标签可能只给出脚步或室外行走,检索时能找到一堆脚步,但无法区分是单步、连续走还是跑,也无法区分地面材质与鞋的差异。拟音师真正要做的是根据画面选择动作与材质都对的声音,并放到准确的同步点上。如果标签只有粗类,模型学到的是脚步大类的平均特征,选出的声音可能节奏对但材质错。

论文指出通用声音分类体系的代表做法是把拟音相关概念分散放置,统一声音类别系统虽有拟音大类,但招牌式的击打、呼吸、亲吻、开关门等声音被放在其他主类下,覆盖不一致也不完备。于是研究问题被明确为需要一个可操作的、可复现的拟音专用分类体系,并按该体系组织足够数量的高质量片段。问题的输入是公开平台上的杂乱录音与用户标签,输出是统一采样、响度、时长与标注口径的数据集加基线。

约束包括只收可再分发的零许可波形、只收拟音定义内的人相关动作声、标注必须能区分动作与材质。评价标准不是生成多么好听,而是分类基线能否在统一划分与统一特征下给出可比的准确率与分数,并通过混淆矩阵暴露哪些细类真正难分。

全景:从商用库关键词到可发布数据集要走哪几步?

方法全景是一条单向流水线,先定分类体系,再按体系收数、清洗、处理、标注与发布。分类体系的输入是 7 个商用拟音库的类名、子类名、片段名与描述,做法是抽取常用词并统一拼写与同义词,得到三百多个候选词,再按拟音工作定义剔除无明确声音或动作指向的词,剩下约一百多个关键词,最后人工合并为 9 个大类 73 个子类。构造流水线的输入是平台检索到的候选片段,输出是重命名打乱后的训练验证测试划分与元数据表。

中间依次做人工初筛去坏文件、重采样与响度归一化并去前导静音、超长按静音点切分、人工细标大类子类与单发多发标记、保留清洗后的原始标签与描述。下面的导读帮助对照官方流程图理解主路径与分支关系。

流水线导读:从左向右只有一条主干,没有并行分支,每个方框代表 1 次对全部候选样本的批量操作,箭头代表样本池的缩小与规范化过程。

看图路径: 1. 沿左侧红色箭头从关键词检索向右追踪五个步骤的主路径;2. 确认人工筛选、音频处理与人工标注三块在流水线中的先后位置;3. 观察切分与发布阶段如何承接标注后的样本与元数据

原论文 Figure 1:Overview of the FoleySet construction pipeline.

论文图 1。原论文 Figure 1:“Overview of the FoleySet construction pipeline.”。

该图可见的 3 个中段方框从左到右依次是人工筛选、音频处理与标注,红色箭头表示样本只能向前流动。教学上要抓住两点:一是筛选发生在任何格式统一之前,避免把算力浪费在损坏或无关文件上;二是标注发生在切分之后,意味着长录音切出的多个短片段继承同一来源元数据,但类别仍需人工逐段确认。发布前的打乱重命名与按源划分是防止同一原始录音同时出现在训练与测试中的关键动作,这一点在复现时必须保留。

分类体系如何从关键词长成九大类七十三子类?

分类体系组件的输入是商用库中反复出现的制作词汇,输出是两层受控词表。论文先总结拟音的 4 个 recurring 特征:后期与画面同步制作、模仿人相关动作、聚焦身体与表面物体交互、补充观众期望的细节声。基于这些特征给出工作定义,再用商用库的分布校准实用性。具体操作是把 7 个商用库的元数据抽词、归一化、人工剔除,得到一百多个有效关键词,再合并为 73 个子类并归入 9 个大类。

大类包括脚步、人体、金属、材质交互、点击、液体、碎裂掉落、开合机构、衣物,目标数量分别为三千、 一千五、一千、一千、八百、八百、七百五十、六百、五百五十,合计 10000 段。这些目标数同时反映制作重要性与平台可获得性,并非均匀分布。

拟音 × 声音事件: 拟音分工是复现与画面同步的人体动作声,强调同步与制作意图;声音事件分工是描述声源发生了什么的通用标签。搭配理由是通用声音事件本体覆盖广但把拟音相关类打散,无法直接指导选音与同步。组合意义是用拟音定义收拢散落的声音事件类,形成面向动作与材质的 2 级体系。

该组件的难点在于边界判定。例如玻璃杯碰撞是人推动的材料交互,属于拟音;狗吠虽在挑战集中出现过,但按本次工作定义被排除。初学者容易把所有音效都当拟音,复述时应强调本次范围是人相关动作声。另一个要点是分类依据是动作加材质,而不只是物体名。

同为金属,硬币抖动、钥匙抖动、锁具开合的动作与听感不同,因此分属不同子类。这种按动作材质组织的方式正是通用本体所缺少的,也是后续细类混淆分析的起点。

音频处理与标注组件各自负责什么,为什么这样搭配?

音频处理组件负责把杂乱来源变成可比输入。动作包括重采样到 44.1 千赫,转为 16 位单声道,按广播响度标准归一化到负 23 响度单位,保证响度可比;在首个可听事件前保留 100 毫秒前导,去除多余静音;超过 5 秒的录音在 5 秒限制前的最后一个静音点切断,切出的每段继承原元数据。标注组件负责把可比输入变成可学监督。

动作包括按大类目标数人工逐段分配大类与子类标签,标注单发或多发事件密度,保留并轻清洗原始用户标签与文本描述。清洗包括转小写、去掉单字符与含数字的设备型标签、切分空格连接的标签串、合并单复数与词形变体并去重。2 个组件的搭配理由是先统一声学条件再做人工判断,避免响度时长差异干扰类别判断;先切分再标注则保证标注对象与最终发布片段一致。

大类 × 子类别: 大类分工是给出制作中常用的粗检索入口,如脚步、人体、金属;子类别分工是区分动作与材质细节,如走、跑、单步。搭配理由是粗类稳定可学而细类直接对应选音动作。组合意义是 9 类保证基线可比,73 类暴露细粒度声学重叠的真实难度。

单发 × 多发: 单发分工是标记片段只含 1 次声音事件,便于对齐与合成时截取;多发分工是标记片段含重复多次事件,保留节奏与密度信息。搭配理由是拟音高度依赖同步点,事件个数直接影响切分与检索。组合意义是在类别标签之外提供事件密度维度,支撑同步与生成任务的样本筛选。

沿一个样本走完:一段 96 千赫的长走路录音先被检索命中,人工初筛确认与拟音相关且无损坏,进入处理被降采样归一化并切成多段 5 秒内片段,每段再由同一标注者按走或跑等子类打标,并标记为多发,最后附上清洗后的原始标签与来源链接发布。这种单标注者做法保证口径一致,但也带来一致性未经独立验证的局限,需要在局限一节如实记录。

本研究训练了什么,冻结了什么,监督从哪里来?

本研究没有训练新的生成模型,也没有从零训练声学主干,训练动作只发生在基准分类器的线性探针阶段。真实计算过程是调用已有的补丁丢弃频谱变换器作为冻结特征提取器,使用听觉评测接口提供的预训练权重包。音频被重采样到 32 千赫,不足 5 秒补零到固定长度,主干输出时间维表示后平均为 768 维片段嵌入,再送入 9 类或 73 类线性分类器。

监督来源是人工标注的大类与子类标签,损失是类别加权交叉熵,权重按总样本除以类别数与该类样本数的乘积计算,优化器使用权重解耦的自适应优化器,用验证集准确率做早停,耐心为 10 轮,并以验证最优点在保留测试集上评估。原文未报告学习率、批量大小、训练轮数上限与硬件耗时等细节,这些属于缺项,复现时只能按接口默认或自行记录,不应从模型名称推定具体超参数。

冻结主干 × 线性探针: 冻结主干分工是复用已在音频集上预训练的声学表示,不更新其参数;线性探针分工是用一个线性层学习从表示到拟音类别的映射。搭配理由是先固定表示可以隔离数据集本身的可分性,不混入主干调优带来的增益。组合意义是得到可复现的下界基线,错误主要反映类别设计与数据分布而非调参。

类别加权交叉熵 × 早停: 类别加权交叉熵分工是按类别样本数倒数放大稀有类的损失,缓解长尾不平衡;早停分工是监视验证集准确率并在 10 轮无提升时停止,用验证最优点做测试评估。搭配理由是加权解决训练偏向多数类,早停防止在小类上过拟合。组合意义是在不平衡分布下仍给出公平且可复现的分类基线。

需要纠正的误解是冻结参数不等于系统输出确定。补零、切分、随机打乱与线性层初始化仍会引入不确定性,且论文只报告单次划分结果,未报告多次随机种子的方差。因此基线数字应理解为在固定划分与固定流程下的可复现参考,而不是该表示能力的上限或最优值。

数据规模划分采样指标如何保证可比?

实验条件的可比性建立在统一格式、按源划分与统一指标上。发布数据为 44.1 千赫 16 位单声道、最长 5 秒,共约 9.5 小时。划分是八千训练、一千验证、一千测试,比例为 80 比 10 比十,且同一原始录音切出的所有片段必须进入同一划分,用最接近总体子类分布的方式分配。指标同时报告整体准确率、宏平均与加权平均的精确率召回率与分数,测试集样本数为一千。特征提取统一重采样与补零,分类器统一加权损失与早停,避免因预处理不一致导致不可比。下面的导读先看分布形态,再用整理表核对规模与划分数字。

分布导读:九宫格条形图每个子图标题括号中是大类总量,条形右侧数字是子类数量,排序均为从多到少。重点是头部集中与尾部长尾同时存在。

看图路径: 1. 先读每个子图标题括号中的大类总量再读条形数值;2. 比较脚步类中走与单步跑的数量落差;3. 检查人体与金属等中部大类是否存在头部集中与尾部稀疏

原论文 Figure 2:Sub-category distribution within each major-category, sorted by clip count.

论文图 2。原论文 Figure 2:“Sub-category distribution within each major-category, sorted by clip count. The number of total clips per category is indicated in parentheses.”。

该图可见脚步大类总量三千,其中走高达两千多段,单步与跑合计不足 700 段;人体大类总量一千五,头部打嗝饮食咳嗽相对均衡,尾部摔倒吸鼻、心跳、吸管等均不足 40 段;衣物与开合机构等小大类内部同样头部集中。这种分布直接决定了后续基线必须用类别加权,否则多数类会主导训练。下表把规模时长划分与来源数放在同一行,便于复现时逐项核对,单位保留原文写法。

整理后的规模与划分核对表:比较问题是发布集到底有多大、切分是否防泄漏;公平条件是同一批来源不跨划分;指标方向是数量与时长越大覆盖越广,但不平衡度也需同时记录。

条件指标全量数值划分数值来源与时长
发布格式片段总数与规格10000 段,44.1 kHz,16 bit 单声道,最长 5 s训练 8000 段,验证 1000 段,测试 1000 段总时长约 9.5 小时,时长 0.3 s 到 5 s,均值 3.4 s,中值 4.3 s
来源控制原始录音数与平均切分5739 个原始录音,平均每源 1.7 段,4128 源仅一段同源片段进入同一划分,按子类分布最接近分配切分在 5 s 限制前最后一个静音点切断

表后解释:主要收益是划分防泄漏规则明确且分布尽量保持一致,复现时只要按来源标识分组就不会高估;具体代价是子类层面仍高度不平衡,均值一百多段而中值仅八十多段,16 个子类不足 50 段,41 个子类不足 100 段。未胜出项是尾部小类在测试集中支持数可能只有个位数,后续细类分数必然不稳定,这一点在结果中得到验证。

大类可分而细类骤降:基线测了什么,谁在什么条件下赢?

基线要回答两个问题:九大类是否可分,七十三子类是否可分。比较对象是同一冻结表示加同一线性探针流程下的 2 个任务,条件一致,区别只在输出类别数。指标方向是准确率与分数越高越好,宏平均对小类更敏感,加权平均更接近总体体验。测试集同为 1000 段。下面的导读先看大类混淆矩阵的对角优势,再用两张原表核对每类与总体数字。

大类混淆导读:行是真实标签,列是预测标签,行内归一化,对角线越深代表该类召回越高。

看图路径: 1. 先确认横轴为预测标签纵轴为真实标签再读对角线;2. 找出液体与脚步等深色对角格对应的高召回位置;3. 观察碎裂掉落行与材质交互列交叉处的非对角亮块

原论文 Figure 3:Confusion matrix on the major-category test set of Fo- leySet.

论文图 3。原论文 Figure 3:“Confusion matrix on the major-category test set of Fo- leySet.”。

该图可见液体对角最深,召回约 0.90,脚步、点击、金属、开合机构对角均较深;材质交互对角最浅约 0.63,并向衣物、碎裂掉落、金属分散;碎裂掉落主要误判为材质交互约 0.13;衣物与脚步、金属与开合机构之间存在近对称小混淆。这说明大类错误集中在声学相近的瞬态与摩擦家族,而非均匀随机。

大类每类结果对照:比较问题是哪些大类靠声学特征即可分清;公平条件是同一测试集与同一加权训练;指标方向是精确率召回率与分数越高越好。

ClassPRF1Sup
Brk/Drp0.780.750.7777
Click0.820.860.8479
Clothing0.560.850.6855
Footstep0.950.860.90296
Human0.870.800.83151
Liquid0.930.900.9279
Mat-Int0.660.630.65101
Metal0.780.870.82103
Op/Cl-Mech0.800.860.8359

上表的主要收益是脚步与液体分数分别达 0.90 与 0.92,显示独特声学签名易学;具体代价是材质交互与衣物分数仅 0.65 与 0.68,支持数分别为 101 与 55,表明类内变化大且样本少。未胜出项是材质交互,它是后续细类困难的预警。

总体结果对照:比较问题是类别数从 9 增至 73 时代价多大;公平条件是同一特征同一测试集;指标方向同上。

Acc0.820.64
Pmacro0.790.60
Rmacro0.820.59
F1macro0.800.56
Pw0.840.71
Rw0.820.64
F1w0.830.64

上表报告显示大类准确率 0.82、宏分数 0.80、加权分数 0.83,而子类准确率降至 0.64、宏分数 0.56、加权分数 0.64。这种下降支持细粒度拟音识别更难的判断,但限制是单次划分、无置信区间,且线性探针只是下界,不能推广为任何模型在该数据上的上限。

把子类错误当反证:哪些混淆是资源少,哪些是真的像?

把 73 类混淆矩阵当作消融与失败条件的替代,可以区分数据不足与声学重叠两种机制。测的是同一基线在细类上的错误是否聚集在亲缘类别内。条件与主结果一致,指标看召回与块内扩散。导读先定位大类色框,再比较框内与框外亮点。

细类混淆导读:全矩阵按大类分块,块内是亲缘子类的相互混淆,块外是跨大类混淆,颜色越深比例越高。

看图路径: 1. 先按彩色方框确认九个大类在细类矩阵中的块位置;2. 观察块内对角线深浅不一与块内混淆点的聚集;3. 追踪开合机构块中门抽屉窗类别之间的横向扩散

原论文 Figure 4:Confusion matrix on the sub-category test set of FoleySet.

论文图 4。原论文 Figure 4:“Confusion matrix on the sub-category test set of FoleySet.”。

该图可见多数错误聚集在块内而非全矩阵均匀分布。开合机构块中门开合、抽屉开合、窗开合互相混淆,窗开合召回接近零;碎裂掉落块中冰碎与纸撕等召回极低并向邻近碎裂类扩散;链条精确率虽高但召回低,说明只认出少数典型样本,其余被判给邻近金属类。这支持论文的解释:弱子类表现同时受学习资源少与声学重叠影响。

高分反例同样重要:放屁、心跳、马桶、白板书写分数达 1.00,接吻、敲击、气泡等也在 0.90 以上,说明独特机制声即使样本不多仍可分清,不能把所有小类失败都归因于数量少。未评测边界是单发多发维度未参与本次基线,时序同步质量也未度量,因此不能从分类分数推断生成或同步效果。

哪些结论站得住,哪些还只是可能?

站得住的是报告层面的事实:数据集规模、格式、划分规则、两层体系构成、基线流程与主数字,以及错误集中在亲缘类别的现象。有限解释是材质交互与衣物难分是因为声学不均匀且类内变化大,这一解释有混淆矩阵支持,但未量化类内方差,仍属支持而非证明。待验证的是把分类可分性直接推广到检索与生成的收益,论文未给出生成与检索实验,因此不能承诺这些任务同样改善。缺失证据不是技术错误,但复述时要用可能与待验证表达。

例如小类零召回可能源于测试支持只有 2 到 6 段,也可能源于与邻类确实相像,在没有更多样本与重复实验前不应断言因果。另一个局限是全部类别由单标注者按预定标准完成,口径一致但未经独立标注验证,一致率未知。分布长尾也是明确局限,尾部二十余类不足 50 段,训练与评估都不稳定。资源层面,论文声明数据集公开在存档平台,但本次解读只能确认论文给出的第三方链接可达,不能保证未来平台删帖或许可变更后长期稳定。

要复现应先做什么,需要准备什么信息条件?

复现先做三件事:按来源标识重建划分,按原文规格重建音频管线,按冻结主干加线性探针重建基线。信息条件包括原始片段标识与来源链接、清洗后的用户标签与描述、上传者与来源编号、大类子类与单发多发标记,以及训练验证测试指示。音频管线要严格执行 44.1 千赫 16 位单声道、负 23 响度单位归一化、首事件前 100 毫秒保留、超 5 秒在限制前最后一个静音点切分。基线要执行 32 千赫重采样、不足 5 秒补零、768 维嵌入平均、类别加权交叉熵与验证准确率早停。

划分时必须把同源切分片段放进同一子集,并尽量保持子类分布接近总体,否则会因泄漏高估。缺项是学习率批量大小等超参数与硬件预算未报告,复现时应固定并记录自己的选择,不应视为原文默认值。代码与权重方面,论文指向项目仓库与预训练权重包,前者承载关键词映射与全量子类结果,后者提供特征提取,复现者应区分代码开源、权重下载与端到端可运行三件不同的事。只有三者齐备且划分一致,才能声称复现了 0.82 与 0.64 这两个参考点。

何时值得尝试这个数据集,还需补哪项验证?

当任务输入是人动作声、目标需要区分动作材质、监督允许使用人工细标签、运行阶段包含选音检索或同步时,值得尝试该数据集。它的价值在于提供统一口径的九大类入口与七十三子类的细检索空间,并附带原始标签描述与事件密度标记,可支撑分类、文本检索、描述与标签分析等多种任务。当任务是通用环境声识别或动物声研究时则不合适,因为本次范围已明确排除非人声源,且分布向脚步与人体倾斜。

还需补的验证包括独立标注一致性、多次随机种子下的方差与置信区间、尾部小类的扩充采样,以及检索与生成任务上的端到端评估。只有补上这些,才能把当前分类基线从可复现的起点升级为对制作流程真正有指导意义的证据。初学者复述时应抓住一句话:用拟音实践的动作材质逻辑重组标签,用统一处理与防泄漏划分保证可比,用冻结表示的简单基线暴露细类真实难度。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 21 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 dafx-2026 论文汇总