标签:#音高与旋律提取 | #模型压缩 | #数据增强 | #端侧运行 | #实时处理
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Venkat Suprabath Bitra:机构信息未在 arXiv HTML 中可靠披露
- Homayoon Beigi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
单音基音估计需从单帧可变Q变换幅度谱直接输出基频分箱,在边缘端同时受闪存、10 ms帧周期与室内噪声三重约束。方法链分三步衔接:先将269分箱四通道幅度视图送入10个频率轴扩张卷积块,每个宽卷积被拆为经秩M=9瓶颈的因子对,前因子B以5点扩张卷积降维输出瓶颈特征,后因子A以1点卷积升维回传,瓶颈内通道轴均方根归一化输出直接作为升维输入并叠加残差。接着在变换域按功率归一化加性混合噪声,每样本独立抽样幅度比覆盖从干净到设定下限的连续区间以构造训练分布,最后以离散分箱分类输出单帧基频。与半正交低秩时延神经网络的关键差异是瓶颈内保留归一化而不施加半正交约束,且全程无时序上下文可单帧推理,因而归一化已调节尺度时再加约束反而损失精度。将训练噪声下限从 \(+6.02\) dB 降至 \(-20.00\) dB,低秩模型在 \(-20\) dB 评测下原始音高准确率(Raw Pitch Accuracy,RPA50)从 2.44 提升至 22.41,代价是干净音频损失 0.35 点。在MDB留出集评测下,低秩模型的RPA50为99.07,高于FrCN基线的RPA50 98.98。其适用边界受限于仅在参考浊音帧上评测且未提供发声判决,-20 dB下最佳结果仍远未可用而前端变换延迟已超过模型本身,需前置声源分离而非仅调增强范围。自研 C 内核仅需 83 kB 磁盘占用且除 libc 与 libm 外无运行时依赖,原文未披露训练硬件与训练时长。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
边缘端音高估计要同时守住哪三条线?
论文研究的是单音高估计,也就是对每 1 帧判断当前发声的基频落在哪个频率格点上。输入是单帧变 Q 变换的幅度谱,目标是在参考标注为浊音的帧上输出一个音高格点,输出按是否落在真值 50 音分以内计分。边缘部署把这个问题收紧为 3 条线:权重文件要装进小闪存,1 帧必须在帧周期 10 ms 内算完,在房间噪声或伴奏干扰下精度不能崩塌。
对刚入门的读者,先固定信息条件:模型只看当前帧,不看前后帧;只估计基频,不做浊音检测;变换上限到 4790 Hz,覆盖钢琴最高音 C8,但远低于奈奎斯特频率,因为不需要重建完整谐波序列。4 路输入视图把绝对电平与相对形状同时交给模型:原始帧保留绝对尺度,对数压缩、可除和、可除均方根 3 路去掉尺度只留形状。
学习依赖上,先理解评价口径再看方法改进,否则会被数字误导。主指标 RPA50 是 50 音分内容差内的帧比例,方向是越高越好;RCA50 忽略八度错;MnE 与 MdE 是半音为单位的平均与中位绝对误差,方向是越低越好。所有指标只在参考标为浊音的帧上计算,并按帧加权平均,长文件权重更大。论文明确用 RPA50 做全部结论,因为 RPA10 的种子间标准差约大 14 倍,不适合分辨小结构差异。
与大模型和时序分解路线相比,本文的对照面是什么?
同输入同目标的一条路线是大模型。CREPE 与 PESTO 在干净音频工作站上很准,但参数与计算不是为边缘帧级实时设计的。本文不与它们在同硬件同噪声下逐项打表,而是把它们定位为不适用于本约束的参照,真正的可运行基线是作者前作的频率卷积网络 FrCN,参数 17787,沿频率轴做空洞卷积。
同监督同运行阶段的另一条路线是 TDNN-F 的半正交低秩分解。它把每层拆成经过窄瓶颈的两个因子,并对第一因子做半正交化。论文借的是拆成两因子的想法,不算把 TDNN-F 用于音高估计。关键差异有三处:分解沿频率轴而非时间轴,层宽 H=18 而非数百通道,瓶颈内已有沿通道轴的均方根归一化。几百通道下有用的机制在 18 通道下未必有用,这一点后文用 4 组合消融直接测量。
同运行阶段还有推理栈路线:OpenBLAS、ONNX Runtime 与 PyTorch。论文把它们当作同一主机上的可运行对照,而不是只比参数量。这一点决定了后文部署结论的写法:延迟必须指明运行时,闪存与常驻内存、冷启动也要并列报告。
为什么分组划分与噪声范围会改变结论?
论文要回答两个可复述的问题。第一,把 H 到 H 的频率卷积换成经秩 M 瓶颈的两步卷积,能否在精度不掉的前提下省参数并在编译内核上省时间。第二,训练时见过的噪声范围是否比结构更能决定强干扰下的表现,若是,最佳下限应放在哪里,干净集要付多少代价。
举一个教学例子帮助理解划分的影响,例子不带新数值:若同一首歌的两个片段分处训练与测试,模型可能记住录音特征而非音高映射,分数虚高。论文因此按 MDB 按歌曲、PTDB 按说话人、MIR-1K 按歌手分组划分,种子固定为 11,并指出这比前作的按轨划分更严,域内数字会低于已发表值且不可直接比较。另一个例子是噪声:若训练只见过轻噪声,测试遇到 -20 dB 时模型等于遇到分布外输入,结构再小也救不回来。
问题还包括必须保留的边界:浊音头不训练,所有精度都在参考浊音帧上计算;MDB 音频由原录音上估计的基频轮廓重合成,参考与信号不独立,域内接近 99 的 RPA50 测的是与该轮廓的一致性,PTDB 的喉头计信号与 MIR-1K 的独立人声通道才是更可靠的检验。
单帧从频谱到音高格点要经过哪几步?
沿一个样本走完全程。音频重采样到 16 kHz,跳长 160 样点对应 10 ms 帧周期与实时截止。单帧变 Q 变换从 A0 即 27.5 Hz 起,269 格、每八度 36 格,约 7.4 个八度到 4790 Hz。每格是 1/36 八度即 33.3 音分,50 音分容限约 1.5 格,因此选对格点即在容限内。四视图堆成 4 通道后送入 10 个相同宽度块的序列,核长全程为 5,只有空洞变化,第 i 块为空洞 2 的 max(0,i-1) 次方,从 1 长到 256。空洞 32 与 64 夹住对应 1 倍频程的 36,处于该深度的块可同时踩到基频与谐波。
每个块先做频率轴卷积加 SiLU 与归一化,再加 0.66 倍的残差。10 块之后接分类头输出音高格点的对数概率,取最大者为该帧估计。训练用 20 轮、学习率 10 的 -3 次方、第 15 轮减半,比较不在中间轮做,因为降学习率前 RPA10 会在轮间抖动 1 到 6 点。每个配置跑 3 个种子,比较按种子配对,用配对标准差而非非配对标准差,3 种变异即轮间、种子间、划分间要分别命名容限。
全景上,低秩改造只动块内卷积与归一化,不动输入表示与四视图;噪声改造只动训练时 beta 上限,不动噪声库与加噪流程。两处都固定其他条件以隔离效应,同一次训练用同一噪声库与同一流程,否则跨模型差异无法归因于结构。
全秩基线块的计算顺序为什么不能错?
基线块操作在 H=18 通道上,沿格点轴做核长 5 的空洞 1 维卷积。符号上,x 为块输入,W 为全秩卷积核,sigma 为 SiLU 激活,BN 为批归一化,输出 y 为归一激活后加 0.66 倍残差。计算目标是对每个频点输出 18 通道的新表示,供下一块继续在更大空洞下组合谐波关系。
\[\mathbf{y}=\mathrm{BN}\big(\sigma(\mathbf{W}*\mathbf{x})\big)+0.66\,\mathbf{x}\]原文强调顺序是先激活后归一化,若按推理常见做法把归一化折进卷积,算的是另一个函数,实现时曾因此出错。白话说,批归一化指按批与空间位置统计归一,全秩指 W 把全部 H 通道映射到全部 H 通道。模型把 L=10 个这样的块串起来,只有空洞指数变化,这是频率轴空洞设计的全部含义。
频率卷积网络 × 空洞卷积: 频率卷积网络负责沿频率轴处理单帧变 Q 频谱,不用时间上下文即可逐帧输出;空洞卷积负责在该轴上拉开感受野,让同一层 taps 同时落在基频与谐波位置。二者搭配的原因是音高线索分布在对数频率的不同八度处,组合后新增的作用是只用 10 层、核长 5、空洞 1 到 256 的堆叠就覆盖约 7.4 个八度。
复述时要保留三处冻结细节:H=18、核长 5、残差 0.66 继承自已发表模型;归一化在激活之后;推理折叠会改函数因此核对必须以未折叠的 PyTorch 输出为准,后文 271893 帧逐帧选同一格点的门控即为此而设。
秩 9 瓶颈如何拆掉三分之一参数?
改造块把单个 W 拆成 B 与 A 两步。先对输入 x 做沿通道轴的均方根归一化得 u,再用核长 5、同空洞的 B 把 H 通道压到 M 通道并在瓶颈内再做 1 次同类归一化得 z,最后用核长 1 的 A 把 M 通道升回 H 通道,经 SiLU 后加 0.66 倍残差得 y。B 无偏置,归一化在每个格点按通道轴计算并学习每通道单增益。M=9 为实验选出的内部最优点,M=H/2 与 TDNN-F 启发式数值重合被记为巧合。
参数从 17787 降到 11397,减少 35.9%,每帧乘加减少 39.5%。秩扫描显示 M=6 为 8.1k 参数、M=9 为 11.4k、M=12 为 14.7k,精度先升后略降,因此被去掉的不是无用宽度,否则应随 M 单调上升。半正交约束只固定第一因子的缩放而不决定秩,形状本身已把秩封顶在 M,论文选择瓶颈归一化而不用该约束,4 组合测量支撑该选择。
低秩分解 × 瓶颈秩: 低秩分解负责把 H 到 H 的全秩卷积拆成 H 到 M 再 M 到 H 的两步卷积,瓶颈秩 M 负责限定中间通道数从而封顶参数量与乘加量。二者搭配的原因是原卷积在 H=18 时仍有冗余,组合后新增的作用是以 M=9 这一内部最优点保留精度,同时把参数减少 35.9%。
均方根归一化 × 半正交约束: 均方根归一化负责在每个频点沿通道轴做归一并学习单通道增益,半正交约束负责把第一因子的奇异值固定为 1 以固定缩放。二者搭配被检验后发现调的是同一个量:瓶颈内的缩放,组合后同时施加反而在有归一化时使 RPA50 下降 0.169 点,因此论文只保留归一化而不用半正交约束。
初学者易误以为分解必然省时,论文后文证明这取决于运行时,此处只记算术量下降而不承诺延迟下降。
噪声范围增强如何设定最差信噪比?
训练不重算变换,而在变换域加噪。记 C 为干净幅度帧,Cn 为噪声幅度帧,P 为帧总功率。先按功率比把噪声缩放到与干净同尺度,再乘幅度比 beta 相加,beta 每样本从 0 到 beta 最大值的均匀分布中抽取。计算目标是让 1 次训练覆盖一段信噪比,最差可抽到的信噪比即训练噪声下限,等于 -20 乘以 beta 最大值的常用对数。5 个设置对应下限 +6.02、0.00、-6.02、-12.04、-20.00 dB。
\[\mathbf{C}^{\prime}=\mathbf{C}+\beta\sqrt{P_{\mathbf{C}}/P_{\mathbf{C}_{n}}}\;\mathbf{C}_{n},\qquad\beta\sim\mathcal{U}(0,\beta_{\max})\]符号上,C 撇为增强帧,beta 为幅度比,beta 最大值单独设定下限。因为 beta 逐样本抽取而非固定单值,单轮即覆盖一个范围。同一噪声库与同一流程用于本报告所有训练,库由 CHiME-Home 家用录音加 MIR-1K 伴奏通道组成,后者提供音乐干扰这 1 对音高模型更难的情形。
噪声范围增强 × 训练噪声下限: 噪声范围增强负责在变换域按幅度比 beta 把噪声帧加到干净帧,每样本从均匀分布抽取 beta 从而 1 次训练覆盖一段信噪比;训练噪声下限负责由 beta 最大值决定训练中能抽到的最差信噪比。二者搭配的原因是单点噪声训练不能代表部署时的干扰分布,组合后新增的作用是用下限位置直接设定模型在强干扰下的行为,最优点在部署最差条件之下约一档而非越低越好。
监督来源上,浊音损失权重为零,精度只在参考浊音帧上计算,部署所需的浊音判决本文不提供。优化在 20 轮内完成,第 15 轮学习率减半,比较只在终点做。半监督、残差重参数化等方向在第 6 节记为无增益的负结果,复现时不必重复投入。
数据、划分与统计口径如何固定公平条件?
数据覆盖 3 类信号。MDB-stem-synth 为 230 个单音轨干、约 15.6 小时,来自 85 首 MedleyDB 歌曲,94% 与他轨同歌,参考因重合成而与音频不独立。PTDB-TUG 为 20 人英语朗读,参考来自同步喉头计信号,与麦克风信号独立。MIR-1K 为 19 位业余歌手的 1000 段中文流行演唱,只用人声通道,其中 1 位贡献 132 段。噪声库如前所述固定。
划分按组不按文件,种子 11。指标为主 RPA50,辅 RCA50、MnE、MdE,单位分别为百分比与半音。聚合按帧加权,长文件权重大。统计上区分轮间、种子间、划分间 3 层容限,结构比较按种子配对并报告配对 t 值。硬件预算上,帧周期 10 ms 为全部计时的实时截止。
四 CPU 计时前锁频并在循环中采样时钟,两块树莓派报告无热节流;每构建必须先对存储帧复现 PyTorch 输出到相对误差 10 的 -4 次方才允许报时,每设备各自过正确性门控,共 128 格通过。
本节承担的公平条件是:结构比较固定输入表示、四视图与噪声库;跨库比较为 MDB 训练后零适配直测;量化比较固定同一权重只变位宽;延迟比较固定批量 1、单线程、空闲机。
省掉三分之一参数后精度与跨库表现如何?
比较问题是:在同库训练同库验证且分组更严的条件下,低秩模型是否在任一库上变差,跨库不重训时是否更脆弱。公平条件是同输入、同划分种子、同 3 种子平均,指标方向为 RPA50 越高越好。
| Set | Model | Par. | RPA50 | RCA50 | MnE | MdE |
|---|---|---|---|---|---|---|
| MDB | FrCN | 17.8k | 98.98 | 99.15 | 0.078 | 0.019 |
| MDB | Low-rank | 11.4k | 99.07 | 99.22 | 0.071 | 0.019 |
| PTDB | FrCN | 17.8k | 88.76 | 91.48 | 0.649 | 0.082 |
| PTDB | Low-rank | 11.4k | 88.62 | 91.45 | 0.663 | 0.084 |
| MIR-1K | FrCN | 17.8k | 95.23 | 95.37 | 0.263 | 0.085 |
| MIR-1K | Low-rank | 11.4k | 95.25 | 95.38 | 0.273 | 0.086 |
表后解释要同时给出收益与代价。收益是参数少 35.9% 而精度不掉:MDB 上低秩 99.07 对基线 98.98,高 0.09 点,种子标准差仅 0.010,配对 t 达 18.8,真实但可忽略;PTDB 差 -0.13 点,种子标准差 0.234,配对 t 为 -0.50 且 3 种子符号不一致,不可区分;MIR-1K 差 +0.02 点,t 为 0.37,不可区分。跨库上,MDB 训练的模型直测 MIR-1K 与 PTDB,基线掉 6.0 与 13.6 点,低秩掉 6.0 与 13.7 点,2 模型差 +0.06 与 +0.01 点,均小于任一模型的种子标准差。PTDB 绝对值约 88.7 低于两音乐库,论文报告这是朗读语音在此任务上的语料属性,且按文件划分会虚高约 1.4 点,因此按说话人划分是保守选择。
即时执行延迟 × 编译内核延迟: 即时执行延迟负责反映 PyTorch 逐算子分发开销,在 H=18 这种小宽度下主导耗时;编译内核延迟负责反映真实算术量与访存效率。二者搭配比较的原因是同一组权重在两种运行时下排序相反,组合后新增的判断是小模型的速度结论必须指明运行时,分解结构在前者慢 45% 而在后者快 15%。
未胜出项是精度本身:分解不带来实质增益,选型依据要交给运行成本,即闪存更小且在编译内核的每台 CPU 上更快,见部署表。
训练噪声下限为何比结构重要两个数量级?
比较问题是:把训练下限在 5 个档之间移动时,干净与 10、0、-6、-12、-20 dB 六列如何变化,最佳下限是否越低越好。公平条件是同噪声库、同流程、同 MDB 分组划分、3 种子平均,RPA50 越高越好。下表整理原文连续句中的关键格点,完整矩阵见原文第 5 个表,复述时保留原文双写前的数值含义。
| 训练下限 | 评估条件 | 基线 RPA50 | 低秩 RPA50 | 可运行含义 |
|---|---|---|---|---|
| +6.02 dB | -6 dB | 22.50 | 25.44 | 已发表增强设置,强干扰接近偶然 |
| -6.02 dB | -6 dB | 50.85 | 52.13 | 下限下移一档带来约 26.7 点增益 |
| +6.02 dB | -20 dB | 1.93 | 2.44 | 最轻噪声训练在最重测试下失效 |
| -20.00 dB | -20 dB | 20.48 | 22.41 | 匹配下限把该格从 2.44 提到 22.41 |
| +6.02 dB 到 -20 dB | 干净 | 98.98 到 97.98 | 99.07 到 98.72 | 低秩干净代价 0.35 点 |
表后解释先给量级对比:低秩在 -6 dB 处从 25.44 到 52.13 的增益为 26.7 点,而全文最大结构效应为 0.09 点,相差约两个数量级。规律是单调且最佳格在评估信噪比处或其下一档,例如 -6 dB 评估的最佳下限为 -12.04 dB,-20 dB 评估的最佳为 -20.00 dB,因此应设在部署最差条件之下约一档而非尽量低。代价是干净集小幅下降,低秩从 99.07 到 98.72。反例是 -20 dB 即使匹配也仅 22.41,并在 10 dB 处付出约十点,说明该增强改善但未解决极重噪声,需要源分离前端。低秩在多数深格略优于基线,如下限 -6.02 dB、评估 -12 dB 时 19.50 对 14.62,论文只报告现象而不定机制,复述时用支持而非证明的措辞。
秩与归一化约束的消融支持什么取舍?
比较问题是:瓶颈秩是否存在内部最优,半正交约束与瓶颈归一化是否可叠加。条件为 MDB 分组留出集、3 种子 RPA50,方向越高越好。原文第 4 表报告 4 组合与秩扫描:有归一化无约束的提议为 99.07,加约束降到 98.90,配对差 -0.169,t 为 -5.03;无归一化时加约束差 -0.034,t 为 -0.50,不可区分。秩扫描为 M=6 时 98.83,M=9 时 99.07,M=12 时 99.04,未分解基线 98.98。
解释是两机制调同一缩放量而不叠加,且归一化单独更好,约束被省略是测过之后的主动选择而非为省事。秩的内部最优把分解与剪宽区分开:若只是无用宽度,最优应在最大 M 处。M=H/2 恰好命中最优被记为巧合,因该启发式来自数百通道层。未胜出项包括残差 0.66 的 4 种重参数化,设为 1.0 反而差 0.05 点,为种子标准差 3.5 倍;半监督在匹配标签暴露量后增益消失,教训是按标签呈现次数而非轮数对齐。
量化作为第二消融放在下表,条件为 MDB 留出集、3 种子平均,RPA50 越高越好,尺寸越小越好。
| 位宽与策略 | 基线尺寸与 RPA50 | 低秩尺寸与 RPA50 | 代价 |
|---|---|---|---|
| 16 位与 8 位 | 35.6 到 18.6 kB,98.977 到 98.980 | 23.3 到 12.6 kB,99.071 到 99.072 | 变化至多 0.003 点,视为免费 |
| 4 位 | 10.1 kB,97.619,掉 1.358 点 | 7.3 kB,98.796,掉 0.275 点 | 低秩约 5 倍更耐 4 位 |
| 归一化保留与否 | 差异至多 0.15 点 | 差异可忽略 | 首层精确的预期未被支持 |
表后补充可重复性代价:4 位使种子标准差从基线 0.010 涨到 1.040、低秩从 0.004 涨到 0.273,不仅降均值还降稳定性。8 位减半文件而无可测损失,应为默认发货宽度。整数运算另见部署,存储用 8 位、运算仍用浮点。
延迟反转与自研内核的每一步增益来自哪里?
比较问题是:同一权重在即时执行与编译内核下谁更快,自研内核相对朴素循环、OpenBLAS、ONNX Runtime 与 PyTorch 快多少。条件为单帧、批量 1、单线程、空闲机,延迟越低越好。下表整理原文连续句中的同主机对比,完整逐格见原文第 7 与第 8 个表。
| 运行时与模型 | 基线延迟 | 低秩延迟 | 排序含义 |
|---|---|---|---|
| PyTorch 即时 | 535 微秒 | 777 微秒 | 低秩慢 45%,乘加少 39.5% 仍更慢 |
| 朴素 C | 175.1 微秒 | 125.0 微秒 | 反映算术量,低秩开始反超 |
| 自研寄存器分块 | 68.0 微秒 | 58.0 微秒 | 低秩快 15%,随秩单调 |
| 相对加速 | 7.9 倍于 PyTorch,2.2 倍于 ONNX | 13.4 倍于 PyTorch,3.8 倍于 ONNX | 框架对宽卷积更友好,幅度分模型报告 |
表后解释机制与代价。即时执行慢的原因是分发而非算术:H=18 时单算子只产 18 乘 269 个数值,分解把每块算子数约翻倍,M 在 6 到 12 间乘加差 1 倍而即时延迟只变 4% 且方向不对。编译后延迟随秩单调为 52.1、58.0、75.9 微秒,与乘加预测一致。去掉瓶颈内归一化在即时下省 16.5%、编译下只省 4.2%,即时测量夸大约 4 倍。内核三处增益为跳过窗外抽头、尾部用整向量面板重叠覆盖以消灭标量余量、输出通道与格点面板的寄存器分块,其中 MR 与 NR 按机实测而非公式推导,开发机上 MR=9 与 NR=1 最快,三款 ARM 取 MR=9 与 NR=2。
正确性门控为每构建先复现存储帧到相对误差 10 的 -4 次方,再在 271893 帧上比对,最大对数差基线 1.030 乘 10 的 -4 次方、低秩 1.783 乘 10 的 -4 次方,同格点率均为 100.0%。ONNX 的 8 位路径慢于其浮点 6.3 倍、慢于自研 24.3 倍,说明量化本身不等于加速。整数运算核虽在 99.978% 帧上与 PyTorch 同决策,但在四 CPU 上慢 2.1 到 3.1 倍,因五抽头空洞归约对不上 4 路整数点积,而浮点用满向量宽。
哪些边界会限制把数字直接搬到产品?
第一,浊音未解决。所有训练把浊音损失权重零,每项精度只在参考浊音帧上计算,部署需要的有声无声判决本文不提供,复现时不能把 RPA50 当作全帧系统精度。第二,域内天花板。MDB 音频由原录音估计的轮廓重合成,参考按构造描述信号,接近 99 的域内数测的是一致性,PTDB 喉头计参考与 MIR-1K 独立人声才是更可靠的检验,跨库掉 6 到 13 点已显示域移代价。第三,前端更大。
自家变 Q 实现在同工作站上流式约 98 微秒、孤立帧约 137 微秒,已超过模型本身的 58 到 68 微秒,模型数字不构成完整流水线预算,下一个优化应在前端。第四,深噪声未解决。-20 dB 最佳仅 22.41,且在 10 dB 处付出约十点,须配源分离或其他前端。第五,统计口径。结论依赖 3 种子配对比较与分组划分,RPA10 轮间抖动大,中间轮比较会测到学习率调度而非模型差异。
这些限制不是技术错误,而是未测量与未建模的部分。相关性也不等于因果,例如瓶颈在噪声下更稳的观察未隔离机制,只能报告而不解释。整数在标量浮点单片机上是否反超尚未测量,论文明确留白。
要复现精度与速度应先固定什么再测什么?
先固定信息条件与划分。音频 16 kHz、跳长 160、变 Q 从 27.5 Hz 起 269 格每八度 36 格、四视图堆叠、块数 10、核长 5、空洞 1 到 256、H=18、M=9、残差 0.66、先激活后归一化。划分按歌曲、说话人、歌手分组,种子 11。训练 20 轮、学习率 10 的 -3 次方、第 15 轮减半,只比终点,3 种子配对比较。噪声库固定为 CHiME-Home 加 MIR-1K 伴奏,变换域按功率归一后加 beta 均匀抽取,先扫训练下限再动结构,建议把下限放在部署最差之下约一档。
精度复现先跑干净域内三库与 MDB 训练跨库两目标,核对 RPA50、RCA50、MnE、MdE 的单位与聚合为帧加权。秩扫 M=6、9、12 与 4 组合约束消融用于验证内部最优与冗余判断。量化先发 8 位,4 位预期基线掉约 1.3 点、低秩掉约 0.3 点且种子方差放大。
速度复现先锁频并采样时钟,批量 1 单线程。先在 PyTorch 即时下复现反转,再用自研 C 核复现 58 与 68 微秒量级,并过两道门控:构建级相对误差 10 的 -4 次方,帧级 271893 帧同格点率。部署成本并列记录闪存、常驻内存与冷启动:自研核 83 kB、约 2 到 2.4 MB 常驻、零初始化,ONNX 约 65 MB 安装与 67 MB 常驻加 14 ms 冷启动,CPU 版 PyTorch 约 686 MB 与 226 MB 加 0.5 s。四 CPU 上核对自研快于 OpenBLAS1.28 到 1.85 倍,低秩快于基线 8% 到 15%,实时占用以 10 ms 计,8 位低秩在工作站 0.6%、Pi 5 为 4.2%、Orin NX 为 4.4%、Pi 4 为 12.3%,权重文件 13.3 kB。资源状态上,本次未发现来源绑定且完成 HTTPS 验证的资源,不得声称代码模型数据已公开,复现应按论文文字重写流程而非寻找链接。
何时值得尝试这套做法,还需补哪项验证?
当约束同时包括小闪存、10 ms 帧级截止与房间噪声时值得尝试。先调噪声范围再改结构:按部署最差向下约一档设定训练下限,并接受干净集约 0.3 点的代价。若闪存允许 8 位存储,直接发货 8 位,不必保留浮点归一化,精度无可测损失且速度与浮点持平。若在即时框架下评估小宽度结构,必须换编译内核再下速度结论,否则符号可能写反。
还需补的验证按缺项点名:浊音检测器与全帧系统精度,前端流式变 Q 在目标板上的端到端预算,-20 dB 下结合源分离的增益,标量浮点单片机上的整数与浮点对比。常见误解有三处需要纠正:M=H/2 命中最优是巧合而非预测,半正交约束被去掉是因为与瓶颈归一化调同一量而非实现省略,MDB 域内高分含重合成一致性而非绝对音高精度。记住这三处,就能把本文的减参、调噪与自研核三件事复述为可执行的方法而不只是数字。
📎 论文与评分元数据
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses