英文题目:Benchmarking Integrated GPU Acceleration of Real-Time Neural Audio Inference on Snapdragon

会议身份:conference:dafx:2026:conference-paper-id:DAFx26_paper_18

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#基准设计 #高效推理 #实时处理 #音频生成

评分:7.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Avery Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Gautham Srinivasan:机构信息未能从会议 PDF 纯文本可靠映射
  • Akito van Troyer:机构信息未能从会议 PDF 纯文本可靠映射
  • Victor Zappi:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文任务是在集成GPU回调约束下做流式神经音频推理,输入为相位斜坡、吉他干声、梅尔频谱与基频或待变换音色,输出为连续合成或处理音频,难点在于每块64到1024采样在48kHz下仅1.3到21.3毫秒预算且单次超时即欠载。方法链先将振荡器、循环放大器、空洞卷积放大器、二维深度可分离声码器与卷积自编码器五类模型统一导出为ONNX并转为高通DLC,其输出直接作为后端输入。接着自研AudioReach引擎以固定缓冲触发单次推理调用并逐回调度量耗时与欠载,其调用记录进入对比分析。最后在RB3 Gen2开发板上对比最优CPU引擎与QNN CPU与QNN GPU,统一内存架构下的实测结果决定何时加速有效。与离散GPU上只报大缓冲吞吐倍率的已有做法相比,关键机制差异在于把原生并行度与每调用开销置于真实回调约束下联合度量,实际意义是揭示靠增大缓冲虚增利用率的虚假收益。在AutoGuitarAmp任务评测下,QNN GPU的每样本推理时间指标为167.59 µs,高于RTNeural的每样本推理时间指标0.43 µs。结论适用边界是769参数振荡器与1861参数循环放大器仍由CPU主导,NAM类一维卷积仅大块追平,大模型需足够原生并行度否则受限。硬件上实测使用8核Kryo670与Adreno643统一内存板卡,小块下每调用延迟开销主导,推理开销随块尺寸显著变化。

🔗 开源与复现资源

🧭 深度解读

输入是什么?为什么交互音频不能只看平均速度?

本文输入是已经训练好的神经音频模型和一条连续的音频流,目标是在高通骁龙片上系统上按时算出每个输出块。必须保留的信息包括硬件型号与频率、推理引擎与后端、批或块大小、每样本推理时间的均值与标准差、采样周期阈值和欠载计数。本文输出不是离线渲染多快,而是在真实音频回调里每次调用是否赶得上期限。

初学者容易把机器学习常用的实时因子当成可用性证明。白话说,实时因子是算完一段长音频用的总时间除以这段音频本身的时长,小于 1 只说明平均算得比播放快。回调期限是另一回事:在 48 千赫兹下,每 64 到 1024 个采样就要在 1.3 到 21.3 毫秒内交出结果,任何 1 次超时都会产生可闻断裂。论文明确指出,大批量下实时因子很好看的模型,可能因为单次调用开销、内存搬运和图形处理器启动延迟,在 5 毫秒期限前仍然失败。

因此学习依赖的第一步是换指标。论文用每次推理调用的墙钟时间除以样本数得到每样本推理时间,再与采样周期约 20.83 微秒对比。这只是必要条件,因为格式转换、数据搬运和调度不确定性还会吃掉一部分预算,所以作者同时统计欠载,也就是推理时间超过缓冲周期的回调次数。后面所有快慢判断都要同时看均值、抖动和欠载,不能只看平均。

已有路线把加速做到了哪里?缺的那块是什么?

已有路线可以分成 3 条。第一条是高吞吐声码器与合成路线,在独立英伟达显卡上用大缓冲报出几十到上 10000 倍实时,常用张量加速库做层融合与低精度优化。这条路线解决的是离线或批量渲染,不解决每次小缓冲都按时返回。第二条是面向资源受限设备的中央处理器部署路线,包括轻量循环与线性预测声码器、专用推理引擎和嵌入式音频平台移植,目标是单核手机中央处理器上实时。

第 3 条是图形处理器音频原语与多实例并行路线,测量过内核启动与搬运开销,也有人把上 100 个吉他放大器实例打包到 100 到 200 微秒执行窗里并行,但那是靠聚合多路独立流换吞吐,不是加速单个模型的单路延迟。

本文的缺口正在这里。集成显卡存在于几乎每台骁龙设备,从嵌入式开发板到手机和笔记本,且与中央处理器共享统一内存,不需要独立显存拷贝。作者认为它支持标准浮点运算,可通过厂商软件开发包直接访问,是比量化神经网络加速器更自然的候选。但此前没有已发表工作用高通推理栈的图形处理器后端做流式音频逐回调推理,相关讨论只停留在离散显卡基元层面。

教学例子:可以把离散显卡类比为货运火车,1 次拉很长很划算,但为送一小包货专门发一列车就不划算;集成显卡更像面包车,省了长途转运,但每次发车仍有固定成本。对应到真实组件,发车成本就是内核分发开销,货物量就是块内可并行计算量。

到底要回答哪个可检验的问题?

论文把大问题拆成 3 个可检验的小问题。第一,在相同模型和相同音频引擎下,优化过的中央处理器推理与集成图形处理器推理谁的每样本时间更低。第二,批大小或块大小从最小实时缓冲增大到一千以上时,图形处理器利用率如何随可用并行度变化。第三,模型尺寸与结构如何决定是否适合上显卡,特别是循环、空洞 1 维卷积、2 维深度可分离卷积和编解码结构之间的差异。

实时因子 × 回调期限: 实时因子分工是统计长音频总耗时与音频时长的比值,回答离线能否算完;回调期限分工是每个音频块必须在下一块到来前算完,回答交互能否不卡顿。二者搭配的理由是前者小于 1 不保证后者每次达标,因为单次调用开销和调度抖动会被平均掉。组合意义是本文放弃只报实时因子,改用每样本推理时间对比采样周期,并辅以欠载计数来判定真实可用性。

为回答这些问题,作者固定了比较口径。每个测试是 10 秒音频运行重复 5 次,把每样本推理时间拼接后算均值与标准差,保证小块也有上百万数据点,大块仍有一千多次调用,使预热瞬态影响可忽略。实时可行性先看均值是否低于采样周期,再看欠载数是否为零。温度也被监控,确认没有触发降频,测到的是持续性能而非过热后的降速。

五个模型与三条推理路径如何构成全景?

方法全景是一张对照表:5 个模型覆盖合成与处理、逐样本与分块、稠密与循环与卷积与编解码,参数从 769 到约 6,000,000,跨越 3 个数量级。3 条推理路径是每模型最优中央处理器、高通推理栈中央处理器后端、高通推理栈图形处理器后端。最优中央处理器按模型挑选:小前馈与循环用实时神经网络库,波网变体用专用特征推理库,大 2 维卷积与大自编码器用通用运行时,因为后两者的层类型需要从零重写才能进专用库。

逐样本模型 × 分块模型: 逐样本模型分工是每个时间步只产生一个采样点,状态必须串行推进;分块模型分工是 1 次前向并行处理几十到上 1000 个采样点,卷积可在块内展开。搭配理由是图形处理器只能加速可并行的工作,前者只能并行层内计算,后者还能并行时间维度。组合意义是本文用两种机制分别检验批维度并行与块维度并行,解释为何循环放大器完全不适合上显卡。

走一个样本的完整路径有助于建立概念。以吉他放大器建模为例,输入是单声道音频文件的一个采样点,经过长短期记忆单元更新隐藏状态,再经稠密层输出一个采样点。逐样本路径下前后样本必须串行,图形处理器只能加速单个时间步内部的矩阵运算。分块路径则不同,以波网放大器为例,1 次读入 64 到 1024 个采样,经空洞因果 1 维卷积栈并行输出一块,块内时间维度天然可并行。声码器核心更进一步,在时频表示上做 2 维卷积,并行维度更大。

引擎、格式与音频链路各自负责什么?

先解释术语。白话说,推理引擎是把模型算子翻译成硬件指令并管理内存的运行时;英文是 inference engine,后文简称引擎。音频引擎是打开播放流、注册回调、做格式转换并记录耗时的宿主程序。模型表示这里有 3 级:训练用的浮点模型、交换用的开放神经网络交换格式、高通设备用的深度学习容器格式。同一份容器在运行时可分别指向中央处理器或图形处理器后端,这是本文能做公平对照的关键。

统一内存 × 内核启动开销: 统一内存分工是中央处理器与集成图形处理器共享同一物理内存,省去独立显卡的主机与设备间拷贝;内核启动开销分工是每次调用图形处理器都要付出图调度与分发的固定成本。搭配理由是省掉拷贝只移除了成本的一项,固定分发成本依然存在。组合意义是小模型计算量太小,分发成本主导总时间,只有模型足够大或块足够大才能摊薄该成本。

组合机制紧接着分工。开放神经网络交换格式负责跨框架表达,高通转换工具负责把同一份图编译为设备后端可执行的容器,薄封装的 C 接口负责在音频回调里触发 1 次推理并计时。音频链路用高通音频可达框架经板载数字信号处理器直达硬件编解码器,该通路独立运行,不占用推理用的中央处理器与图形处理器资源。回调线程绑到最快的 2.7 吉赫兹大核并跑满频率,输出复制到双声道播放。

转换为容器后必须验证保真。作者确认浮点模型与交换格式输出在浮点精度内数值一致,非正式听音确认 4 个引擎间无可闻差异。声码器只测神经核心,谐波先验、短时傅里叶变换与逆变换、 learned 分析合成滤波器放在核心之外,因为这些确定性数字信号处理更适合原生库,纳入图形处理器路径会不公平地惩罚显卡。

本研究训练了什么?其余模型如何处理?

本研究不是提出新训练算法的论文,没有统一的训练损失与优化器对照,必须按模型逐一交代。原文明确说明 4 个模型是此前已发表架构的预训练或重训版本,只有神经振荡器是为本基准从零设计的最简全功能结构:单隐层前馈网络,隐层 256,输入相位映射到单采样输出,共 769 参数,用于逼近正弦函数。

其余模型的构造过程按证据还原。吉他放大器循环网络沿用已发表的长短期记忆结构,隐层 20 加稠密输出,共 1861 参数。波网放大器是标准 13,802 参数的前馈波网变体。轻量声码器把跳长加倍到 480、子带傅里叶尺寸加到 240 以适配 48 千赫兹,把反射填充换成因果零填充后从零重训,参数约 500,000,只测其中 8 个卷积 NeXt 风格块构成的神经核心。自编码器压缩比 128 比 1,流式需要 47 个缓存张量约 320 千字节状态,有效块必须是 128 的倍数,训练采样率 44.1 千赫兹但为横向可比仍跑在 48 千赫兹,作者声明合成质量影响超出本文范围。

缺项必须指出。原文未报告各模型的训练轮数、学习率、梯度路径与参数冻结细节,也未给出重训声码器与自编码器的收敛曲线,因此不能从模型名称推定具体实现,也不能把无新训练等同于确定性求解。本节的真实计算是导出与转换:所有模型先导出为交换格式再转为设备容器,同一容器供两种后端加载。

在什么硬件与缓冲条件下测量?

硬件是高通 RB3 第二代开发板,芯片为 QCS6490。中央处理器是 8 核三簇结构:1 个 2.7 吉赫兹大核、3 个 2.4 吉赫兹金核、4 个 1.9 吉赫兹小核。图形处理器是频率 812 兆赫兹的 Adreno 643,内存是 8 吉字节共享统一内存。系统是基于 Yocto 的开放嵌入式高通 Linux,非抢占标准内核。软件版本明确给出推理栈 2.42、通用运行时 1.22.0,专用库为写作时最新可用版本,代码用智能多媒体产品软件开发包交叉编译。

协议细节决定可复述性。播放流固定 48 千赫兹,回调里记录推理调用墙钟时间与板载温度。逐样本模型在最优中央处理器下缓冲固定 256 样本,其余配置缓冲等于批或块大小,保证每次回调恰好触发 1 次推理。最小支持缓冲 64 样本。批大小对逐样本模型测试 1、64、128、256、512、1024,其中 1 用于隔离单次调用开销。

分块模型按架构约束取值,声码器取 480、960、1440,自编码器取 128、256、512、1024。作者说明模型与代码当前已公开,开发板音频引擎仓库与模型仓库链接当前可用,第三方运行时与音频软件开发包链接当前可用。

多大、多并行才值得上显卡?

先看最简前馈振荡器的趋势,它是理解开销摊薄的起点。导读如下:该图横轴是批大小从 1 到 1024,纵轴是每样本微秒数,红色虚线是采样周期阈值,三色分别对应最优中央处理器、高通中央处理器与高通图形处理器,柱顶标注均值与标准差。

看图路径: 1. 先看横轴六组批大小与纵轴每样本微秒数,确认红色虚线为采样周期;2. 对比蓝色最优中央处理器柱与绿色图形处理器柱随批增大如何下降;3. 观察批大小为 1 时绿色柱远高于阈值,批 1024 时才落到阈值下;4. 注意黄色与绿色柱顶标注的均值加减标准差数值变化趋势

原论文 Figure 1:Mean per-sample inference time for Neural Oscillator, across inference engines and QNN batch sizes.

论文图 1。原论文 Figure 1:“Mean per-sample inference time for Neural Oscillator, across inference engines and QNN batch sizes. The dashed line indicates the sample period (1/48,000 ≈20.83 μs).”。

该图显示专用中央处理器以 0.2 微秒量级遥遥领先,图形处理器在批为 1 时高达 126.1 微秒,远超实时阈值,证实单次调用开销淹没了微小计算。随着批增大,两条高通曲线都大幅下降,图形处理器降到 1.6 微秒,中央处理器降到 2.0 微秒,除批为 1 的图形处理器外都低于阈值。但结论仍是这种规模选专用中央处理器,不值得引入图形处理器链路。

借用并行度 × 原生并行度: 原生并行度分工指模型结构本身提供的数据并行,例如 2 维深度可分离卷积在时频面上的并行;借用并行度分工指靠增大音频缓冲换来更多可并行样本,分摊单次调用开销。搭配理由是两者都能降低平均每样本时间,但后者直接增加交互延迟。组合意义是本文警告不能用大缓冲掩盖结构不适合,设计时应优先提供原生并行。

循环放大器是反例的极端。批处理在此不可行,3 条路径都只能批为 1。均值显示专用中央处理器 0.43 微秒,高通中央处理器 19.06 微秒,图形处理器 167.59 微秒且标准差 31.87 微秒。因为时间步不可并行,显卡没有任何摊薄机会,开销完全暴露。

波网放大器首次出现转折。专用特征库稳定在 6.3 微秒左右且与块大小无关,两条高通路径在块 64 时都约 53 微秒,随块增大显卡降到块 1024 的 6.1 微秒,降幅 88%,基本追平最优中央处理器,高通中央处理器降到 11.7 微秒仍慢约 1 倍。这说明空洞 1 维卷积的并行刚好触及该芯片显卡可行的下界,且需要最大块。

声码器核心是正向甜点。导读如下:该图 3 组块为 480、960、1440,纵轴同样是每样本微秒数,红色虚线仍是阈值,欠载数只在达到实时处标注。

看图路径: 1. 先确认三组块大小 480、960、1440 与三类引擎图例颜色;2. 对比每组内绿色图形处理器柱是否始终低于红色阈值线;3. 查看蓝色与黄色柱顶欠载计数标注出现在哪几组;4. 观察绿色柱从 6 微秒量级继续随块增大而下降的幅度

原论文 Figure 2:Mean per-sample inference time for MS-Wavehax (neu- ral core) across inference engines and block…

论文图 2。原论文 Figure 2:“Mean per-sample inference time for MS-Wavehax (neu- ral core) across inference engines and block sizes. Underruns shown for real-time performance only.”。

解释是显卡从最小块的 6.1 微秒一路降到 2.9 微秒,始终舒适地低于阈值,而通用中央处理器从 26.7 微秒降到 12.2 微秒仍在 960 和 1440 出现欠载,高通中央处理器从 57.3 微秒降到 24.1 微秒从未达标。2 维深度可分离卷积与显卡计算结构匹配,还为块周围的谐波先验与变换留出余量,这是中央处理器给不了的。

自编码器则展示均值之外的可靠性。导读如下:该图 4 组块 128 到 1024,纵轴量程更大,蓝色通用中央处理器与绿色显卡都在 512 跨过阈值,分别降到 1024 的 7.9 与 10.7 微秒。

看图路径: 1. 先看横轴 128 到 1024 四组块大小与纵轴高达 300 微秒的量程;2. 对比蓝色中央处理器与绿色图形处理器在 512 和 1024 处谁低于阈值;3. 找出蓝色柱底部标注的 38 和 25 欠载数与绿色柱零欠载的差异;4. 观察黄色中央处理器柱始终远高于阈值线的整体位置

原论文 Figure 4:Mean per-sample inference time for BRAVE across in- ference engines and block sizes.

论文图 4。原论文 Figure 4:“Mean per-sample inference time for BRAVE across in- ference engines and block sizes. Underruns shown for real-time performance only.”。

解释的关键在欠载:通用中央处理器在 512 有 38 次、1024 有 25 次欠载,均值低但尖峰会冲破回调期限;显卡在 1024 零欠载,是唯一可靠实时的后端。高通中央处理器从 197.5 降到 42.2 微秒,从未接近实时。作者把原因归于显卡在初始化时预编译图并预分配内存,执行是确定性内核序列,隔离了中央处理器的分配器与线程调度不确定性。

下面两张表把核心数字固定下来。第一张是循环模型的原表复刻,用于确认小循环在单样本下显卡最差,表前问题是:在不可并行的条件下 3 条路径差距有多大,公平条件是同为批 1,指标越小越好。

EngineBatch SizeMean (µs)Std (µs)
Best CPU (RTNeural)10.430.16
QNN CPU119.060.75
QNN GPU1167.5931.87

该表显示专用中央处理器比高通中央处理器快约 44 倍,比显卡快数百倍,且显卡抖动最大。这支持小循环坚持专用中央处理器的判断,代价是通用栈的单次调用开销在此暴露无遗,未胜出项正是两条高通路径。

第二张是声码器核心的三引擎对比,用于确认原生并行的价值,表前问题是:在 3 种块大小下谁能稳定低于阈值,公平条件是同一神经核心与同一音频引擎,指标每样本微秒越小越好。

条件指标通用运行时中央处理器高通中央处理器高通图形处理器
块 480每样本推理时间26.7 µs57.3 µs6.1 µs
块 1440每样本推理时间12.2 µs24.1 µs2.9 µs

该表显示只有显卡在两档都低于阈值,且从小块到大块降幅约 52%。主要收益是最小块即达标,无需借大缓冲;具体代价是中央处理器即使均值下降仍伴随欠载,反例是高通中央处理器始终未达标,未评测边界是核心外围的变换与滤波器未计入。

第三张是自编码器的跨块对比,用于说明大 1 维结构需要大块且要看欠载,表前问题是:参数最大时均值下降是否等于可用,公平条件是同块同后端,指标越小越好但需结合欠载。

条件指标通用运行时中央处理器高通中央处理器高通图形处理器
块 128每样本推理时间56.6 µs197.5 µs70.9 µs
块 1024每样本推理时间7.9 µs42.2 µs10.7 µs

该表显示通用中央处理器均值在 1024 反而略优于显卡,但结合欠载才完整:前者在 512 和 1024 仍有数十次欠载,后者在 1024 零欠载。收益是两者都随块增大下降约 85%,代价是必须推到 512 以上才跨阈值,交互延迟已显著增加,未胜出项是高通中央处理器全程不可用。

哪些失败条件与运行期变异必须先查?

失败条件首先是批为 1 的小模型与不可分批的循环。振荡器在批 1 时显卡 126.1 微秒,循环在批 1 时显卡 167.59 微秒,都远超 20.83 微秒阈值。这不是实现失误,而是可并行计算量太小,固定分发成本主导。消融的含义是把块做小就是去掉摊薄,显卡立刻回到不可用。

第二个条件是运行期模式跳变。导读如下:该图是波网放大器在块 256 显卡后端的 5 段连续 10 秒运行,横轴是推理序号,纵轴是每样本微秒数,绿色虚线是总均值 16.40 微秒,浅绿带是正负 1 倍标准差 3.10 微秒,深蓝横线是每段均值。

看图路径: 1. 先看横轴推理序号被分成五段连续运行,每段约 1900 次推理;2. 对比深蓝横线标注的每段均值在 13 微秒档与 19 微秒档之间跳变;3. 确认绿色虚线总均值 16.40 微秒与浅绿带正负 1 倍标准差范围;4. 注意段内散点抖动很小,差异主要来自段间整体平移

原论文 Figure 5:NAM’s per-inference timing (QNN GPU, block size 256) across five consecutive 10-second runs.

论文图 5。原论文 Figure 5:“NAM’s per-inference timing (QNN GPU, block size 256) across five consecutive 10-second runs.”。

解释是 5 段聚成两档:两段约 12.5 到 13.1 微秒,3 段约 18.7 到 19.0 微秒,段内抖动很小,总标准差几乎完全来自段间跳变,档间差约 45%。中央处理器从未观察到该现象,推测是初始化时内核编译策略、缓存配置或内存布局 1 次性决定并持续整轮。作者尝试改性能档与缓存选项未能消除。报告显示这是有限解释,支持初始化状态影响,待验证的是如何稳定触发快档。

第 3 个条件是均值达标但欠载仍在。自编码器通用中央处理器在 1024 均值 7.9 微秒却有 25 次欠载,声码器通用中央处理器在 960 和 1440 同样有欠载。这支持通用引擎存在动态分配等非实时安全操作,导致偶发尖峰冲破期限。显卡因预编译与预分配更可预测,即使均值相近也可能是更稳的选择。

结论的边界与迁移风险在哪里?

边界先说硬件。测试芯片是骁龙家族中端,旗舰手机与笔记本的单核中央处理器约快 1 倍,图形处理器峰值算力高数倍,但单次分发固定成本未必同比例缩小。论文报告的推断是:更强芯片上显卡优势阈值可能移向更大更复杂的模型,为追平显卡所需的缓冲会更大,借用并行会把延迟推到音乐交互不可接受的 10 毫秒以上。只有原生并行充足的结构才可能在更强显卡上扩大优势。

边界再说测量。温度显示最热中央处理器传感器平均约 81 摄氏度,低于被动降频阈值,测试期间无降频,移动消费设备因皮肤温度限制可能更早降频。采样率方面自编码器训练于 44.1 千赫兹但测于 48 千赫兹,作者声明质量影响超出范围,因此不能把该模型的可用性结论外推为音质结论。声码器只测神经核心,外围级留给原生数字信号处理库,完整链路成本未在本表内。

未验证的推测必须标明。跨骁龙型号的比例关系是可能而待验证,神经网络加速器需整数量化,其对音频质量的影响作者明确留待未来工作。总体趋势不等于每组都成立,例如显卡模式跳变说明平均柱状图低估了最优初始化的能力,也高估了稳定性。

要复现这套基准,先做什么、用什么版本?

先做环境与亲和性设置。按原文用 RB3 第二代开发板与高通 Linux,交叉编译音频引擎与推理库,回调线程绑到最快大核并锁 2.7 吉赫兹,播放流 48 千赫兹,最小缓冲 64 样本。软件版本锁定推理栈 2.42 与通用运行时 1.22.0,专用库取写作时最新版本并记录提交号,避免版本漂移改变调用开销。

再做模型与格式链。获取预训练模型与笔记本,导出交换格式并转深度学习容器,校验浮点模型与交换格式输出在精度内一致,做非正式听音确认引擎间无差异。逐样本模型测批 1 到 1024,分块模型按约束取值并保证每次回调恰好 1 次推理。每个配置跑 10 秒重复 5 次,拼接每样本时间再算均值与标准差,同时记录欠载与板载温度。

还需补的验证是初始化稳定性。同一显卡配置至少重复 5 轮并画出分段均值,检查是否存在双模跳变;若存在,固定随机种子、缓存与性能档后重测,并报告快慢档各自均值而非只报混合均值。自编码器必须同时报告欠载,否则均值会误导。代码与模型链接当前可用,可直接下载工程与模型目录复跑。

何时值得尝试显卡?给研究生的行动清单

何时值得尝试可以按 3 条判断。第一,模型有足够原生并行且计算量能摊薄单次开销,例如 2 维深度可分离卷积为主的中等规模核心,本文显示最小块即领先且有余量。第二,分块 1 维卷积在最大可接受延迟内能追平最优中央处理器,且需要零欠载的稳定性,本文显示波网在 1024 追平、自编码器在 1024 靠零欠载胜出。第三,小前馈与循环仍不值得,专用中央处理器快一个数量级以上且链路更简单。

常见误解需要纠正。误解一是实时因子小于 1 等于能上台,实际上必须再过每回调期限与欠载两关。误解二是缓冲越大越好,实际上那是借用并行,会直接增加动作到声音的延迟,音乐交互超过 10 毫秒已成问题。误解三是参数越大越适合显卡,实际上结构决定并行,6,000,000 参数的 1 维自编码器反而不如 500,000 参数的 2 维声码器核心。

行动清单收束全文。先用最优中央处理器建基线并记录欠载,再切同一容器的显卡后端扫块大小,优先看最小实时块而非最大块;若必须靠大块才达标,应回头改结构增加原生并行。报告时同时给出均值、标准差与欠载,并说明是否观察到跨轮模式跳变。未来工作可沿初始化参数、显卡利用率剖析与量化加速器音质影响展开,但每一步都要回到原文的测量口径核对。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 dafx-2026 论文汇总