英文题目:Assessing the Energy and Carbon Emissions of Neural Speaker Verification Model in Training and Inference
会议身份:
conference:odyssey:2026:conference-paper-id:leguillier26_odyssey
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#CNN #模型比较 #高效推理 #说话人验证
评分:7.4/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Hugo Leguillier:机构信息未能从会议 PDF 纯文本可靠映射
- Driss Matrouf:机构信息未能从会议 PDF 纯文本可靠映射
- Guillaume Lechien:机构信息未能从会议 PDF 纯文本可靠映射
- Mickael Rouvier:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证(speaker verification, SV)需将变长语音映射为固定说话人嵌入(speaker embedding)并完成跨信道验证,难点是精度提升高度依赖主干容量而环境代价未被量化。本文以残差网络(Residual Network, ResNet)主干为对象构建三步评估链:首先在VoxCeleb2上按深度、宽度和阶段分布训练系列变体并经池化与全连接得到嵌入,其次用域内与域外评测得到等错误率(equal error rate, EER)与最小检测代价(minimum detection cost function, minDCF),最后经节点级传感同步记录训练与推理的能耗与碳足迹以刻画权衡。与仅报告精度的已有SV研究不同,该工作将结构缩放与实测千瓦时及二氧化碳当量直接挂钩,揭示容量集中于中间阶段更有效。在5个评测集平均指标上ResNet-419-D相对ResNet-200-D的平均EER仅从3.44%降至3.35%,而训练能耗从222.53 kWh激增至895.67 kWh,呈现明显收益递减。该结论限于单卡NVIDIA Tesla V100 32GB与法国低碳电网条件,未验证其它硬件、大规模自监督主干与超参数搜索总成本,且极深模型推理缺失全精度对照。训练成本最高达数百千瓦时,推理在CommonBench全量提取时为千瓦时量级,混合精度可降低约25%至35%能耗。
🔗 开源与复现资源
- 代码相关资源:https://github.com/kiwano-toolkit/kiwano — 链接可访问(HTTP 200)
- 第三方资源:https://www.electricitymaps.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要回答什么?
本文的输入是论文原文与本次收到的官方原图像素,目标是为刚进入语音领域的研究生讲清 1 篇关于说话人确认能耗的测量型论文做了什么、怎么做的、在什么条件下成立。必须保留的信息包括任务定义、3 种结构变化、训练与评测条件、能量与碳足迹的测量工具与单位、主要数字与适用边界,输出是 1 篇可核对、可复述方法的中文解读。
说话人确认的任务是判断两段语音是否来自同一说话人。系统先把每段语音变成固定维度的说话人向量,再比较两个向量的相似度并与门限比较。用白话说,就是把声音变成身份名片,再看两张名片像不像。英文称为 speaker verification,简称 SV。初学者容易把它与语音识别混淆,识别是听内容写文字,确认是比身份不关心说了什么。
近年来确认系统越来越依赖深层神经网络主干,层数从个位数增加到上 100 层。更深更宽通常带来更好的区分性,但训练与推理的用电、耗时、显存和费用也随之上升。在法国以外的电网中,同样的电量可能对应更高的排放,因此只看等错误率和最小检测代价已经不够,需要同时报告能耗与碳足迹。本文正是沿这条线,用同一训练流程系统比较 ResNet 的深度、宽度和阶段分布,找出精度增长放缓而能耗陡增的位置。
只看准确率的评价路线缺了什么?
可持续机器学习的相关工作主张评价不能只看准确率,还要报告训练大模型的财务成本与环境影响,并提高能量相关指标的透明度。后续工作进一步指出,碳足迹不仅取决于模型大小,还取决于硬件效率、数据中心设施、地理位置和随时间变化的电网碳强度。也就是说,同样的模型在不同机器、不同地区、不同时间运行,排放可以不同。
在语音处理中,这类显式分析相对较少。已有工作量化了端到端语音识别训练的能耗与碳足迹,发现很小的性能提升可能付出不成比例的环境代价;也有工作在口语理解中把性能与训练时间、用电量联系起来;大规模自监督预训练的研究显示预训练数据量增加会显著推高能耗;还有工作在推理侧比较了不同语音识别系统在多种图形处理器平台上的能耗。
本文作者表示,据其所知,目前还没有专门针对说话人确认、系统分析性能与能耗和碳足迹折中的已发表研究。本文的差异在于只做 ResNet 系说话人嵌入系统的受控比较,固定训练数据与流程,分别改变深度、宽度和阶段分布,并在域内与域外测试集上同时报告确认指标与实测环境指标,从而给出面向设计的选型建议。
要比较的三个结构维度是什么?
本文要回答的问题是,在说话人确认中,把 ResNet 做深、做宽或把残差块在不同阶段之间重新分配,精度与环境代价如何变化,是否存在值得停下来的中间点。深度指网络层数,本文覆盖从 18 层到 419 层的范围;宽度指每层卷积通道数,用乘子放大或缩小;阶段分布指在总深度固定时把块集中放在前、中、后不同阶段。
评价分两类。性能侧用等错误率和最小检测代价,域内在 VoxCeleb1 的 3 个子集上测,域外在 CommonBench 和 CN-Celeb 上测。环境侧用能耗和碳足迹,能耗以千瓦时为单位,碳足迹以二氧化碳当量千克为单位。关键是这两类指标要在同一训练与测量条件下对应起来,而不是用参数量或理论计算量代替实测。
一个教学例子可以帮助理解,但它不是论文数值:假设把某模型从 50 层加到 200 层,错误率只下降一点点,而训练用电变成几倍,这就是后文所说的收益递减。论文的实际数字以后文表格为准,例子只用来建立直觉,不能当作结论引用。
从一段语音到环境数字,全流程如何串起来?
沿一个样本走一遍有助于建立全景。输入是一段 3.5 秒左右的语音片段,先提取 80 维滤波器组特征,送入 ResNet 卷积主干得到帧级表示,再经池化层按时间聚合为固定维度表示,最后经全连接映射为 256 维说话人嵌入。训练时用说话人分类目标加附加角裕度损失学习区分性,训练结束后丢掉分类层,用隐层输出作为嵌入做确认。
环境测量是另一条并行路径。训练与推理作业运行在高性能计算节点上,计算能量与排放监测栈从节点级硬件传感器采集功耗,再折算为作业级用电与排放。中央处理器与内存侧用运行平均功率限制机制获得细粒度功率,节点级用基板管理控制器接口覆盖更多部件。碳足迹由实测电量乘以排放因子得到,实时因子来自法国输电网与 Electricity Maps 等来源,静态因子作为参考基准。
残差块 × 阶段分布: 残差块负责在每个阶段内做卷积变换并用 shortcut 保留梯度,使加深成为可能;阶段分布负责把固定总块数分配到 4 个阶段,决定容量放在浅层、中层还是深层,二者搭配的原因是同深度下算量和感受野随分配位置变化,组合意义是可以在不增加总层数时通过向中间阶段集中来改变精度与能耗的平衡。
这样,精度路径回答分得准不准,环境路径回答花了多少电和多少排放,两条路径在同一模型、同一作业上对齐,才能讨论折中。论文把结构变化限定为深度、宽度和阶段分布 3 类,其他训练要素尽量保持一致,这是后文比较公平性的基础。
ResNet 主干与嵌入提取各负责什么?
ResNet 主干由 4 个阶段组成,每个阶段包含若干残差块。每个块内是卷积、批归一化与非线性激活,另有一条 shortcut 把输入直接加到变换输出上。用白话说,主路负责学新的变换, shortcut 负责把原信息与梯度直接送过去,避免加深后梯度消失。这种残差学习机制使训练更深的网络成为可能,也是本文能把深度拉到 419 层的原因。
主干先输出帧级表示,但语音时长可变,后续打分需要定长向量,因此必须有聚合步骤。池化层把变长帧序列压缩为句级表示,全连接层再映射到有区分性的说话人嵌入空间。嵌入被期望保留说话人特性,同时对信道、噪声和音素内容等干扰相对稳健。实际确认时比较两个嵌入的相似度或送入后端分类器。
说话人嵌入 × 池化层: 说话人嵌入负责把一句变长语音压缩为固定维度的身份向量以便比对;池化层负责把帧级特征沿时间聚合为句级表示,解决时长可变与后端需要定长输入的矛盾,二者搭配是因为卷积主干只输出变长帧序列,必须经池化再经全连接映射才能得到可比的嵌入。
论文还在前两个阶段启用压缩激励模块,并固定 4 个阶段的特征图配置作为基线。理解这一点很重要,因为后文的宽度缩放正是整体放大或缩小这些特征图数,而阶段分布缩放是把块在 4 个阶段之间搬家,两者都会改变参数量与计算轮廓,但改变的方式不同。
训练如何组织,能耗与排放如何换算?
训练侧使用 Kiwano 工具包在 VoxCeleb2 上训练说话人嵌入提取器。按原文交代,批量为 512,随机裁剪 3.5 秒片段,数据增强遵循已有流程并使用 MUSAN、混响脉冲与 SpecAugment,输入为 80 维滤波器组,嵌入维度为 256,训练 42 个轮次,损失为附加角裕度损失,优化器为带动量随机梯度下降,动量 0.9,权重衰减为 0.0002。工具链当前可用,资源状态显示代码链接可达,这为复现提供了起点,但权重与完整运行脚本仍需按原文配置核对。
环境指标侧,能耗以千瓦时计,主要来自图形处理器与中央处理器负载,实际消耗还与利用率、访存和软件效率有关,因此直接测量比看硬件标称功率更准确。碳足迹以二氧化碳当量计,由电量乘以区域转换因子估计,转换因子来自生命周期分析与环境机构发布的数据。实验在法国进行,平均碳强度约为每千瓦时 50 克二氧化碳,明显低于原文提到的美国与中国的水平,这意味着同样的电量在高碳电网中会对应更高的排放数字。
能耗 × 碳足迹: 能耗负责度量计算过程实际消耗的电量,以千瓦时为单位,直接来自 GPU 与 CPU 等负载;碳足迹负责把电量按电网碳强度折算为二氧化碳当量,反映环境影响,二者搭配的原因是同电量在不同地区与时段对应不同排放,组合才能把硬件效率与电网结构分开讨论。
需要指出一个缺项:原文没有报告超参数搜索的重复次数与调参总开销,也没有给出每次运行的随机种子方差。复述时只能说单次训练作业的实测值,不能把单次值外推为包含调参在内的项目总排放。
数据、指标、硬件与比较条件是什么?
数据与协议按原文交代如下。训练集为 VoxCeleb2,域内测试为 VoxCeleb1-O、VoxCeleb1-E 和 VoxCeleb1-H 的清洗版本,域外测试为 CommonBench 和 CN-Celeb。平均等错误率与平均最小检测代价指在所有评测语料上计算的均值。最小检测代价的目标先验为 0.01,漏检与误检代价均为 1。指标方向是越小越好,能耗与排放也是越小越好,比较时必须同时看性能下降与环境上升。
硬件与测量条件为 Jean Zay 超算,统一使用 NVIDIA Tesla V100 32 GB,能耗与运行时间经计算能量与排放监测栈采集节点级测量并推导作业级功耗与排放。深度缩放记为 ResNet-X-D,宽度缩放记为 ResNet-50-Wx,阶段分布缩放记为 ResNet-50-D[a,b,c,d]。例如基线 4 个阶段特征图为 128、128、256、256,宽度 2 倍则对应加倍,宽度一半则对应减半;阶段分布如早期集中把多数块放在第一阶段。
等错误率 × 最小检测代价: 等错误率负责报告误接受与误拒绝相等时的错误水平,直观反映区分能力;最小检测代价负责在指定先验和代价下报告最优门限的加权代价,更贴近实际应用偏好,二者搭配的原因是单一门限点不能代表全工作点,组合使用可以同时看到区分能力与代价敏感性。
公平性方面,同一系列尽量共用残差块设计与训练流程,区别只在块数分配或通道数。但阶段分布变化也会改变参数量,原文明确指出参数量并非严格恒定,因此不能把阶段实验理解为纯位置效应,还包含参数量变化的影响。域外结果整体变差是预期现象,比较的重点是相对排序是否保持以及差距是否值得付出能耗。
加深与加宽后,精度涨了多少,能耗涨了多少?
先提出比较问题:在固定训练流程下,从浅到深、从窄到宽,平均精度是否单调变好,环境代价是否线性增长,拐点在哪里。公平条件是同训练集、同轮次、同测量栈与同卡,指标方向为等错误率、最小检测代价、千瓦时与二氧化碳当量越小越好。图与表要一起看,图看趋势形状,表看具体数值与代价。
下图是原文关于深度系列的性能与能量折中散点,横轴为准确率,纵轴为能耗。阅读时先确认坐标含义,再沿基线点看斜率变化,最后对比宽度与阶段点的相对位置。像素显示最右上点为 ResNet-419-D,能耗远高于其他点,而横轴精度只比 ResNet-200-D 略高。
看图路径: 1. 先看横轴为准确率、纵轴为能耗,确认右上为高精度高能耗、左下为低能耗低精度;2. 再沿橙色折线从 ResNet-18-D 经 ResNet-34-D 到 ResNet-101-D、ResNet-200-D、ResNet-419-D 观察斜率何处变陡;3. 对比紫色菱形的宽度缩放点与橙色方块的阶段集中点相对基线圆点的位置;4. 注意最右上 ResNet-419-D 圆点面积与纵轴高度,理解参数量与能耗同时放大的含义
论文图 1。原论文 Figure 1:“Performance–energy trade-offs for ResNet-X-D ar- chitectures.”。
该图显示一条先平缓后陡峭的折线,拐弯位置大约在 ResNet-101-D 与 ResNet-200-D 附近。浅模型到中型模型的精度提升较明显,超过该区域后曲线几乎垂直上升,说明继续加深主要增加能耗。阶段集中点多位于基线附近或略优位置,宽度 2 倍点能耗明显上移,而极窄点能耗最低但横轴精度明显左移。圆点面积暗示参数量差异,但判断仍应以纵轴千瓦时与横轴准确率为准。
混合精度推理 × 嵌入提取: 嵌入提取负责对测试语音前向计算得到说话人向量,其开销随模型大小与测试对数放大;混合精度推理负责把部分计算降为半精度以减少访存与能耗,二者搭配的原因是推理精度对数值精度相对不敏感,组合意义是在几乎不改变确认精度的情况下直接降低大规模评测与部署的能量与时间。
下表整理深度缩放的关键数字,聚焦平均指标与训练环境开销,便于核对拐点前后的代价差异。表头含义为模型条件、指标名与各模型取值,数值保留原文写法与精度。
| 条件 | 指标 | ResNet-18-D | ResNet-50-D | ResNet-200-D | ResNet-419-D |
|---|---|---|---|---|---|
| 平均性能与训练开销 | 平均等错误率 | 4.11% | 3.75% | 3.44% | 3.35% |
| 平均性能与训练开销 | 平均最小检测代价 | 0.273 | 0.245 | 0.224 | 0.218 |
| 平均性能与训练开销 | 参数量 | 9M | 17M | 61M | 133M |
| 平均性能与训练开销 | 训练能耗 | 63.05 kWh | 52 kWh | 222.5 kWh | 896 kWh |
| 平均性能与训练开销 | 训练碳足迹 | 0.790 kg | 0.98 kg | 3.091 kg | 13.7 kg |
表后解释需要同时给出收益与代价。从 ResNet-18-D 到 ResNet-419-D,平均等错误率从 4.11% 降到 3.35%,平均最小检测代价从 0.273 降到 0.218,但 ResNet-200-D 到 ResNet-419-D 仅从 3.44% 降到 3.35%,而能耗从 222.5 kWh 上升到约 896 kWh,约为 4 倍,碳足迹在低碳电网下仍达 13.7 千克。未胜出的反例是 ResNet-18-D 训练能耗反而高于 ResNet-34-D 与 ResNet-50-D,说明能耗不与参数量严格线性对应,浅模型也可能因收敛与利用率问题并不最省。宽度侧的反例是极宽模型参数量达 233M 量级但平均精度并未超过中型基线,却带来数百千瓦时的开销。
改变宽度与搬动残差块会发生什么?
本节按消融逻辑组织:固定深度只改变宽度,或固定总深度只改变阶段分布,观察域内与域外是否一致变化。比较问题是加宽是否在所有测试集上都有效,把块集中到不同阶段是否等价。公平条件仍是同训练与测量流程,指标方向同前。
宽度方面,加宽到 2 倍在 VoxCeleb1 与 CN-Celeb 上优于基线,但在 CommonBench 上更差,说明域内增益不一定泛化到域外。极宽到 4 倍的平均等错误率约为 3.77%,与基线 3.75% 相比没有优势,而能耗与排放大幅上升。窄模型中,宽度一半的平均等错误率约为 3.89%,与 ResNet-34-D 的 3.90% 相当,但参数量约为三分之一且用电更少,这是在资源受限时值得注意的替代。宽度 1/4 进一步省电,但平均等错误率恶化到 4.58%,代价超出可接受范围。
阶段分布方面,把块集中在第二与第三阶段的变体平均等错误率降到 3.65% 或 3.68%,优于基线的 3.75%,而把块推向第一或最后阶段则退化到 3.80% 与 3.91%。能耗侧,分布到中间或后段的变体约为 47 至 53 千瓦时,排放约为 0.7 至 0.8 千克,与基线接近或略低。也就是说,搬块带来的环境改善是小而一致的,不能期待数量级下降。
下表整理推理侧在完整 CommonBench 上的开销,比较对象是实际可运行的精度模式,而不是事后最优值。表头为条件、指标与不同精度下的取值,数值保留原文单位。
| 条件 | 指标 | ResNet-18 FP32 | ResNet-18 FP16 | ResNet-200 FP32 | ResNet-419 FP16 |
|---|---|---|---|---|---|
| CommonBench 推理 | 最小检测代价 | 0.372 | 0.372 | 0.329 | 0.330 |
| CommonBench 推理 | 能耗 | 1.94 kWh | 1.53 kWh | 8.51 kWh | 8.58 kWh |
| CommonBench 推理 | 碳足迹 | 0.0239 kg | 0.0184 kg | 0.1224 kg | 0.1116 kg |
| CommonBench 推理 | 节能幅度 | 基线 | 25–35% | 基线 | 受显存限制 |
表后解释要强调可部署收益与边界。混合精度下等错误率与最小检测代价与全精度基本相同,而平均节能约为 25 至 35%,推理时间也缩短,这是低成本优化。代价侧,即使单次推理只有几千瓦时,在 970 万试次规模上架构差异仍然显著,同精度下 ResNet-419 的排放约为 ResNet-18 的近 6 倍。未评测边界是 ResNet-419 因显存限制只用混合精度执行,表格中缺失其全精度行,不能跨精度直接比较全量排序。
哪些结论不能推广,哪些数字不能直接换算?
首先是地域与电网限制。训练在法国完成,碳强度按每千瓦时约 50 克计,原文同时给出美国与中国更高的参考值。报告显示的是在低碳电网下的排放,若把同样的千瓦时乘以高碳电网因子,千克数会成倍上升,但论文没有在其他电网实测,因此不能直接引用本文千克数作为全球部署的承诺值。
其次是测量口径限制。工具依赖节点级传感器与作业级推导,覆盖中央处理器、内存与节点功耗,但原文没有给出不确定度、重复方差与待机扣除细节。训练轮次固定为 42,调参与失败重试的开销未计入,推理只在 CommonBench 全量上报告,没有给出单句延迟与吞吐。总体趋势不等于每组都成立,例如 ResNet-18-D 的训练能耗高于 ResNet-34-D,说明小模型不一定更省。
最后是指标与任务限制。未测量误判率之外的公平性、鲁棒性与主观听感,不能把自动指标当成人评。阶段实验参数量不恒定,不能说成纯位置效应。极深与极宽模型的边际增益在域外几乎可以忽略,但在其他数据、其他损失或更大规模预训练下是否仍是同一拐点,仍是待验证问题,只能用可能或待验证来表述。
要复现这条折中曲线,先做什么?
复现的第一步是固定可运行基线。获取 Kiwano 工具包代码,当前资源状态显示链接可用,可以公开获取;按原文配置 VoxCeleb2 训练、80 维滤波器组、256 维嵌入、42 轮次、附加角裕度损失与随机梯度下降参数,先跑通 ResNet-34-D 与 ResNet-50-D,再扩展到 101 与 200 层。评测侧准备 VoxCeleb1-O、E、H 清洗版本与 CommonBench、CN-Celeb,用等错误率与最小检测代价报告,目标先验与代价按原文设置。
第二步是接通能量测量。原文使用计算能量与排放监测栈,依赖运行平均功率限制与基板管理控制器接口,需要在 Jean Zay 或同等可采集节点功耗的环境中运行,记录千瓦时并用实时排放因子折算为二氧化碳当量。Electricity Maps 当前可用,可作为碳强度来源之一,但本次解读只确认可达,不保证复现时的数值与法国输电网实时值一致,需要记录测量时段与因子版本。
第三步是做受控变量。深度系列只改变各阶段块数,宽度系列按乘子整体缩放特征图,阶段系列保持总深度约为 50 层并按数组重新分配。建议先验证两个关键对照:宽度一半是否接近 ResNet-34-D 精度但更省,以及阶段集中在中间是否优于集中在两端。若硬件不同,绝对千瓦时会有偏移,应优先复现相对排序与拐点形状,再报告本地电网下的排放换算。
何时值得尝试中型与中间集中结构?
综合全文,值得尝试的场景很明确。通用部署优先选择 ResNet-34-D 与 ResNet-50-D 这类平衡的中型结构,它们在域内与域外都保持有竞争力的精度,而训练能耗比极深模型低一个数量级。资源受限场景可以考虑宽度一半的窄变体,它用更少参数达到接近中型基线的精度,同时把用电与排放控制在更低水平。设计新结构时,优先把残差块分配给中间阶段,而不是最早或最晚阶段,这在原文中同时改善了精度与效率。
应该避免的路径同样清楚。除非边际增益确能证明其环境代价合理,否则不要盲目追逐 419 层或 4 倍宽度。极深模型的最后一段精度提升很小,能耗却成倍增长;极宽模型在域外甚至退化,环境代价却接近极深模型。推理侧若条件允许,应默认使用混合精度,它在保持性能的同时带来两到三成的节能。
回到最初的问题,声音丢给模型只是起点,真正的选型要在精度、能耗与碳足迹之间找到可接受的位置。本文的价值在于用同一流程的实测数字标出了拐点的大致范围,并指出中间阶段在说话人确认中的重要作用。后续若要补验证,应补充多次运行方差、调参总开销、其他电网与硬件下的换算,以及单句延迟与部署成本,才能把实验室曲线变成可落地的选型依据。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
