TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios
📄 TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios #音频分类 #迁移学习 7.4/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.4/10 | 前50% | #音频分类 | #迁移学习 | arxiv 👥 作者与机构 第一作者:Hong Lyu(华南理工大学电子与信息工程学院) 通讯作者:未说明(论文中未标注通讯作者,仅列出多个邮箱) 作者列表:Hong Lyu(华南理工大学电子与信息工程学院)、Mingru Yang(华南理工大学电子与信息工程学院)、Qianhua He(华南理工大学电子与信息工程学院)、Yanxiong Li(华南理工大学电子与信息工程学院)、Jinxin Huang(华南理工大学电子与信息工程学院)、Zhengyu Pei(华南理工大学电子与信息工程学院) 💡 毒舌点评 论文搭建了一条完整的自动音频标注流水线,并在家庭场景分类上验证了实用价值,工程贡献扎实。但方法本质上是对现有检测模型与质量过滤工具的串联,创新高度有限。ECT/SCT阈值依赖耗时的人工听觉测试,缺乏自动化路径。实验设计避重就轻:仅用BEATs作为下游backbone,未与任何强伪标签基线或数据增强方法做严格对比;过滤消融仅停留在mini-batch客观统计,缺乏对标注噪声如何在模型训练中传播的深入讨论。整体属于一份扎实的工程报告,离顶会要求的学术创新尚有差距。 📌 核心摘要 要解决的问题:特定场景(如家庭环境)下带标注音频数据稀缺,现有通用数据集覆盖不足、专用数据集规模有限,难以支撑高质量的音频分类模型训练。 方法核心:提出TriA Pipeline,将原始音视频流平台音频通过标准化→音频活动检测(AAD)→音频事件检测(AED)→过滤四阶段自动转化为带事件标注的高质量训练数据,并构建了TriA数据集(超过2130小时、431类)。 ...