英文题目:Shifting Time Scales: Supporting Live Gesture-Controlled Generative Music with Speculative Execution.

会议身份:conference:nime:2026:conference-paper-id:nime2026_153

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#RNN #实时处理 #音乐 #音乐生成

评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Jason Smith:机构信息未能从会议 PDF 纯文本可靠映射
  • Bryan Pardo:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理摄像头手势到音乐音频的实时映射,输入为手形与运动轨迹视频,输出为文本提示驱动的生成音频,难点在于手势完成识别再加扩散生成带来超过200 ms的感知延迟而无法对齐微观演奏时间尺度。系统先以MediaPipe与手形分类加运动分类将视频降为低维手部位置表征,该表征进入在线学习的长短期记忆网络以预测手部落点分布并按似然排序。排序后的多个候选落点分别映射为4乘4网格对应的乐器文本提示,再送入Stable Audio Open Small预生成对应音频,使生成提前于手势完成开始。播放阶段输出最高似然候选音频,若后续观测证伪则立即切换至次优音频实现回滚,从而把等待转化为命中零等待与失配快速纠正。与直接加速生成器不同,该推测执行把投机点前移至输入识别侧并以多候选覆盖不确定性,其实质是将宏观提示模型的可用性平移至微观控制。在25分钟连续交互评测下,Top-16全集预生成的感知延迟指标为77 ms,低于无预测基线的感知延迟指标213 ms。该结论适用边界受限于4乘4离散乐器网格与2秒至3秒的受限手势,开放词汇与连续表情控制尚未验证。推理开销上原文报告手部识别平均延迟为25.4 ms且Stable Audio Open Small在消费级图形处理器上延迟为187 ms,测试硬件为2022款Apple M2笔记本电脑。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文输入是现场表演中连续的手部动作,目标是让扩散式生成音乐跟得上手势,而不是等手势做完再慢慢出声。读者读完应当能复述三件事:系统把什么信号变成什么提示,投机执行在哪个时间点提前做了什么,以及感知延迟和错误率是如何测的。论文把交互按作曲家柯蒂斯·罗兹的时间尺度划分,从超宏观的选模型、宏观的一首歌长度、中观的 1 到 2 秒调整,一直到微观的 1 到 100 毫秒的瞬时反应。

传统乐器在微观层要求物理输入到声音输出只有 0 到 20 毫秒,演奏者对延迟变化非常敏感。已有的实时生成路线分两头:一头是变分自编码器家族如 RAVE,直接操作声音的隐表示,延迟贴近可感知边界,但不能接受乐器名、节奏类型这类语义条件;另一头是扩散模型与语言模型,能理解文本语义,但提示加生成动辄数秒,只能停在宏观或中观。

论文要做的是不改生成模型内部速度,而是把手势识别提前,用预测到的未来手势先启动生成,把宏观可用的模型位移到微观可用。

微观时间尺度 × 宏观时间尺度: 微观时间尺度指 1 到 100 ms 的瞬时演奏反应层,要求动作与声音几乎同步;宏观时间尺度指整首曲子长度的决策层,可以容忍数秒的文本提示与生成。论文的目标就是把原本只能在宏观或中观使用的扩散与语言模型,通过提前预测手势位移到微观层使用。

为此作者搭建了名为手势词汇的原型系统。摄像头前的手被实时检测为骨架,系统在手势进行中就输出落点概率分布并按可能性顺序预生成音频,手势结束时直接播放最可能的那一路,猜错再切换。理解全文要抓住一个具体动作链:手开始移动,系统不断更新落点猜测,每路猜测对应一个乐器名文本提示,扩散模型据此生成声音,播放时刻与手势结束时刻的差值就是感知延迟。负的感知延迟意味着声音备好在手势完成之前,这正是投机执行要制造的效果。

已有路线在同一任务上卡在哪里?

在手势控制乐器方向,早期有戴传感手套映射合成参数的双手系统,以及把手套数据映射到共振峰语音合成器的手势说话系统,后来有可交互机器学习的 Wekinator,让演奏者自己示范动作与声音的对应。这条路线擅长连续微观控制,但声音多来自参数合成,不是开放语义的生成模型。在手势识别方向,大语言模型可以把手势转成有意义的文字标签,但论文引用的零样本手势理解原型每个手势需要 227 秒,远超宏观尺度。

能实时的视觉预训练模型又只能认少数固定手势,如手语数字。也就是说,语义理解与实时反应难以兼得。在音频生成方向,掩码词元建模加速了语言模型式生成,但需要完整音频提示;稳定音频开放小模型与 Magenta 实时模型把实时因子做到小于一,即 1 秒音频用不到 1 秒生成,但论文指出要零感知延迟伴随输入播放,音频必须在输入结束前就生成好,光是实时因子小于一还不够。

在投机执行方向,它原本用于大语言模型快速生成文本与语音,做法是加速生成过程本身;论文的不同在于把它用在输入端的手势识别上,让生成提前开始,因此理论上可以与任何加速生成内部的方法叠加。相关工作的对照点是同输入、同目标、同运行阶段:同样用手势在演出时控制声音,同样要求声音与动作同步,同样在消费级设备上跑。论文没有把类别差异当胜负,而是说明延迟瓶颈从生成内部转移到了输入等待。

为什么等手势做完再生成就跟不上指挥?

论文把问题定义为感知延迟过大。系统实际延迟等于完成手势加识别出手势再加生成音频的时间,而用户感受到的只是手势结束到声音开始的间隔。一个典型控制手势要 2 到 3 秒才做完,如果能在开始后 200 到 300 毫秒内认出意图,生成就能提前近 2 秒开始,控制时机就从宏观掉到微观。

作者在笔记本上实测手部识别加手形分类平均二十多毫秒,再加上稳定音频开放小模型在消费级显卡上报告的一百八十多毫秒,基线合计两百一十多毫秒,超过了微观尺度上限。实验目标就是把手势完成与音频播放之间约 213 毫秒的滞后压向零秒。做法不是把扩散模型变快,而是预测手势落点,提前把文本提示送进去。

下面这张时间示意图把两种流程画在同一轴上,值得对照阅读,它解释了何为感知延迟以及提前生成如何缩短它。

看图路径: 1. 先找到横轴时间方向,从手势开始 1 到手势结束 2 再到两种音频开始;2. 对比不带投机执行的上方长蓝条与带投机执行的下方短蓝条长度;3. 确认红色微观尺度带 1 到 100 ms 覆盖了哪一段音频开始位置;4. 看右侧手形从 1 到 2 的运动箭头与左侧时间轴的对应关系

原论文 Figure 1:An example of the “shift” in temporal relation between input gesture and output audio that…

论文图 1。原论文 Figure 1:“An example of the “shift” in temporal relation between input gesture and output audio that speculative execution (Spec-Ex) can provide.”。

上图左侧是手势开始,中间虚线是手势结束零毫秒,红色带是微观尺度 1 到 100 毫秒。上方从手势结束后才开始的音频生成条对应长蓝条感知延迟,下方在手势结束前就开始的生成条对应短蓝条。右侧手形从淡到深表示从位置一运动到位置二。关键是音频开始带投机执行被拉进了红色带内,而不带投机执行的音频开始落在很右侧。这说明论文的位移不是压缩生成条本身,而是把生成条整体左移。

感知延迟 × 实际延迟: 感知延迟指手势完成时刻到声音开始播放的时间差,是用户能感受到的错位;实际延迟指识别加生成等机器耗时之和。论文把投机执行放在感知延迟上做文章:不加速模型本身,而是让生成提前开始,使感知延迟可以为负,实际延迟仍存在。

系统让一个手势走完经历了哪些步骤?

先沿一个样本走完全程。用户在摄像头前做手势,程序用 OpenCV 持续取帧,用 MediaPipe 检测人体与手部骨架。用户先用键盘给手势起名字并定义音乐含义,例如圆形动作对应快速音符,并录制约 10 秒的示例。手形分类用两层隐藏层的线性网络,动作分类用基于长短期记忆的网络,输出降为 4 维:手形类别值、动作类别值和手部 2 维坐标。这个 4 维表示一方面用于提示音频生成模型,另一方面送给投机预测器猜未来落点。

音频生成用基于变换器的扩散模型稳定音频开放小模型,文本提示就是预测落点对应的乐器名。抓取分类、模型训练与音频生成放在不同线程,避免训练时卡住画面与声音。

下面这张使用期流程图把上述主路径画成方框与箭头,读时先走主路再看反馈。

看图路径: 1. 沿输入动作到手势识别模型再到三类标签最后到音频生成模型的箭头走一遍;2. 确认手形标签、动作标签和二维坐标三路输出在哪里汇合进音频模型;3. 找到下方用户自定义标签回注到识别模型的反馈箭头

原论文 Figure 3:A use-time workflow of Gesture Vocabulary.

论文图 3。原论文 Figure 3:“A use-time workflow of Gesture Vocabulary.”。

图中左侧输入动作进入手势识别模型,分出 3 路手形标签、动作标签和 2 维坐标,再汇入音频生成模型输出声音。下方用户自定义标签回注到识别模型,表示手形与动作是用户可增补的。它的教学价值在于明确监督来源:对应关系不是预置死的,而是用户录制示例后手动重训约 30 秒得到,且重训在独立线程,不中断演出。

投机执行的具体动作如另一张图所示,先为每个预测备好声音,结束时按距离选路。

看图路径: 1. 先定位右下当前位置手形与真实运动指向左侧的实线箭头;2. 再看三条指向不同预测落点的虚线与各自对应的音频输出框;3. 比较预测落点与真实落点之间的距离,理解最终为何选输出 A

原论文 Figure 4:Depiction of Gesture Vocabulary’s speculative execution process.

论文图 4。原论文 Figure 4:“Depiction of Gesture Vocabulary’s speculative execution process.”。

图中右下是当前位置手形,实线箭头是真实运动指向左侧,3 条虚线是预测运动分别指向不同落点,每个落点上方都备好一路音频输出。最终输出的是与真实落点最近的预测对应的那一路。这个机制借自游戏回滚联机码:保存紧凑内部状态并模拟未来,显示最新状态,预测与实际不符就切换显示。这里的切换对象是音频流,论文报告猜错后约 77 毫秒内可切换,这正是把最坏情况也留在微观尺度内的关键。

回滚 × 受限生成: 回滚指先播放最可能预测对应的音频,77 ms 内若发现猜错就切换到更接近真实落点的那一路;受限生成指把落点限制在 4 乘 4 共 16 个格子并只预生成 16 路乐器音色。受限让回滚可行,因为只有选项足够少,笔记本才能在手势结束前备齐全部可能,否则猜再准也备不起。

预测器和基线各自算什么,如何比较?

预测部分有两个可运行策略。主策略是写在 PyTorch 中的长短期记忆循环网络,初始未训练,随演出用在线机器学习逐渐适应用户,允许演出中加入新手势。输入是降维后的连续动作,输出是手在未来某时刻落点的概率分布。原型把输出约束在 4 乘 4 网格,代表手势结束时手在屏幕的区域。对比基线是线性样条,假设手沿当前轨迹直线延续,分别做长样条延续 3.4 秒与短样条延续 220 毫秒,前者模拟模型早期预测,后者模拟临结束前的预测。

长短期记忆预测的是手势开始后约 3.6 秒的位置,实验以应用平均每秒 20 帧折算,即开始后约 70 帧处。系统把每 30 帧片段当作新手势起点,持续记录并更新网络。

手势识别 × 投机执行: 手势识别负责把摄像头画面变成手形、动作和屏幕坐标等控制信号;投机执行负责在手势未完成时先猜落点并预生成对应音频。二者搭配的理由是识别必须等手势走完,而生成又很耗时,提前猜就可以把两段串行等待变成并行准备,猜错时再切换已备好的另一路音频。

为说明学习型预测是否真有增益,论文还引入随机选择作为参照:从 16 个格子中随机选若干路备播,看同样备多路时错误率差多少。评价时每个手势完成都播放一路音频,对比预测落点与真实落点是否一致来记错,并记录手势完成与播放开始的时间差为感知延迟。若音频在手势完成前备好,感知延迟为负。约束生成把文本提示限制为 16 个乐器名,由预测落点查表得到,表格按行列列出小号、钢琴、贝斯、吉他、弦乐、萨克斯、竖琴、长号、单簧管、木琴、小提琴、大号、长笛、打击乐、双簧管、电子等选项。约束的理由是硬件 1 次备不齐手形加动作加位置的全部组合,只能先验证位置 1 维。

长短期记忆网络 × 线性样条外推: 长短期记忆网络是论文在线适应的预测器,从历史轨迹中学习用户落点习惯并输出概率分布;线性样条外推是假设手沿直线继续运动的朴素基线。把二者放在一起,是为了检验学习到的预测是否真比直线外推更准,而不是只看绝对错误率下降。

哪些模型训练了,哪些只是调用,参数如何更新?

本节按证据交代训练与非训练的边界,避免把调用当训练。需要用户训练的是手势分类部分:用户录制手形与动作示例后手动触发重训,重训约 30 秒,在独立线程进行。论文未报告该分类器的优化器、学习率、轮数与损失曲线,只说明重训不阻塞抓取与播放。

投机用的长短期记忆网络初始未训练,在演出中用新到的数据在线更新,每个手势完成时的预测与实际数据都回流训练,论文将其描述为逐渐适应用户,但未给出梯度路径是否截断、每步更新几次、是否重置状态等细节,这部分属于缺项,不能从模型名推定实现。线性样条没有训练,只是用科学计算库的插值函数按当前轨迹外推。音频生成用的稳定音频开放小模型与姿态估计用的 MediaPipe 都是调用公开已有模型,本研究未重训它们。

手形与动作分类的初始权重来自公开手势识别仓库,同样只是调用起点加用户增量。整个流程的监督来源是用户自定义标签与手部落点位置,前者决定提示文本,后者决定预测是否算对。复现时应把训练理解为两段:离线由用户提供示例的分类器重训,以及在线随数据流逐步更新的预测器适应,二者都缺少超参数报告,只能按原文的录制时长与分段规则复刻流程。

测什么,和谁比,在什么条件下测?

实验回答两个问题:投机执行把感知延迟压了多少,每路预测的错误率是多少。基线是没有投机的最小生成延迟,即识别加生成串行等待。对照包括长短期记忆的前 16 路累积预测、长短两条线性样条,以及随机选择。指标方向很明确:感知延迟越小越好,负值表示提前备好;错误率越小越好,定义为预生成音频对应的落点与真实落点不一致的比例。

实验在一台笔记本上连续演奏 25 分钟,系统每 30 帧开启一段新手势预测,落点预测 horizon 约 3.6 秒。硬件条件按原文交代为二零二二款苹果 M2 笔记本测手部识别,消费级显卡测音频生成延迟。受限条件是落点只有十六格,音频提示只有 16 个乐器名,因此 1 次备齐全部是可行的,这让最坏情况也有上界。需要保留的关键超参数与信息条件是 30 帧分段、约 70 帧后落点、平均 20 帧每秒、长样条 3.4 秒与短样条 220 毫秒。

比较的公平性在于所有策略面对同一手势流与同一生成模型,区别只在预测何时给出、备几路。

下表把基线延迟的构成摆出来,读表时注意单位都在同一格,表头不另加单位。表前的问题是:不做投机时延迟由哪两段组成,合计是否已超微观上限。

组成测试条件延迟数值时间尺度判断来源说明
手部识别加手形分类2022 款苹果 M2 笔记本25.4 ms接近影响演奏评价的阈值含 MediaPipe 检测
稳定音频开放小模型生成消费级显卡报告值187 ms单独已超微观上限文本转音频
两段串行合计基线手势完成后才开始生成212.4 ms超过 1 到 100 ms 微观带感知延迟约 213 ms

上表显示基线主要来自生成段,识别段虽小但已不容忽视。两段相加约 213 毫秒,正是投机执行要消去的滞后。表中第三行把合计与感知延迟等同,是因为无投机时声音一生成就播,没有提前量。这个基线是后文所有负延迟的起点,复现时应先复测这两段在自己机器上的值,再谈提前了多少。

提前发声换来了多少准确率,又付了什么代价?

主结果是提前量与错误率的权衡。长短期记忆从首选到前 15 路平均都能在手势完成前备好声音,前 16 路备齐时平均感知延迟 77 毫秒,落在微观带内。论文报告前 15 路正确提前备好的比例达 97%,而随机选 15 路的错误率仍有 6.25%,说明学习型预测在同样备多路时明显更准。长短期记忆除首选外全面优于长样条,并在手势结束前 2 秒左右超过短样条,对应第六路约 33% 错误率。

短样条本身错误率约 34%,长样条约 55%,首选单猜错误率高达 66%。也就是说,单猜提前最多但最不可靠,多备几路才能把错误率压下来。图注与正文对前 15 路提前量有一处数字冲突:表格写 -26 毫秒,图注写 -27 毫秒,此处保留两种写法并以此提醒复现时以毫秒级误差看待,不要当成实质差异。

下面这张权衡曲线把每路累积预测的延迟与错误率画在一起,是全文最值得细读的证据。

看图路径: 1. 先确认横轴是感知延迟毫秒数,纵轴是错误率百分比;2. 沿灰色 Top-1 到 Top-16 曲线看延迟增大时错误率如何下降;3. 对比同一横向位置的蓝色随机选择叉号与灰色预测圆点的垂直差距;4. 找到右侧手势结束 0 秒虚线与微观尺度粉色带及橙色无投机执行点

原论文 Figure 5:Error rate and average perceived latency for each Top-N prediction after 25 minutes of…

论文图 5。原论文 Figure 5:“Error rate and average perceived latency for each Top-N prediction after 25 minutes of performance with Gesture Vocabulary.”。

图中横轴是感知延迟毫秒,纵轴是错误率百分比,灰色圆点连成的曲线是长短期记忆前一到前 16 路,蓝色叉号是随机选 1 到 15 路,橙色点是长短样条与无投机。越靠左表示备得越早,越靠下表示越准。可见灰色曲线整体在蓝色带下方,即同样提前量下学习预测更准;曲线右端前 16 路落到零秒附近且错误为零,但代价是备齐全部 16 路。短样条孤立在右侧高错误区,说明临近结束的直线外推并不准。读图不要把曲线向下直接当成全程性能变好,它只是备的路数增加带来的累积命中提升。

下表把核心可运行策略的数字收拢为五列,表前的问题是:在同样能运行的条件下,谁提前且谁更准,随机基线差多少。

策略感知延迟错误率正确提前完成比例对照说明
长短期记忆首选-3.1 s66 %备好但多猜错最早但最不可靠
长短期记忆前 15 路-27 ms2.6%97%平均仍在手势完成前
长短期记忆备齐 16 路77 ms0%微观带内兜底猜错 77 ms 内回滚
随机选 15 路213 ms lag 对应6.25%远低于学习预测同备多路仍更差
无投机基线213 ms0%无提前量串行等待

上表的主要收益是前 15 路以负延迟换来 97% 的正确提前,代价是必须并行生成多路音频,笔记本靠 16 路受限才扛住。未胜出项是长样条与短样条,它们的提前量看似可观但错误率高,没有进入最优权衡。无投机错误为零只是因为不猜,但延迟最大,不能当成可部署的同步方案。表格中随机 15 路的延迟沿用基线滞后语境,其错误率来自组合概率,说明多备本身就有增益,但学习预测增益更大。

拿掉学习或减少备路会发生什么?

论文没有做传统意义的模块消融,但用 3 组对照起到了类似作用。第一组是把学习型预测换成直线外推:长样条提前 3.2 秒但错误率约 55%,短样条提前约 110 毫秒但错误率约 34%,都差于对应提前量的学习预测,支持学习确有增益的判断。第二组是把学习预测换成随机选择:随机一路错误率高达 90% 以上,随路数增加下降,但同样路数下始终高于学习曲线,蓝色虚线带与灰色曲线的垂直差距就是增益。

第 3 组是改变备的路数:从首选一路到前 15 路,感知延迟从负三点 1 秒收窄到负二十多毫秒,错误率从 66% 降到 2.6%,说明备得越多越准但越晚,存在明确的提前与准确 trade-off。论文还提到若缩短 3.6 秒预测窗可能提高精度,但未实测,属于待验证推测,不能当结论。失败条件也很清楚:若手势空间放大到手形加动作加位置全组合,笔记本 1 次备不齐,备齐 16 路才有兜底的前提就不成立。

离散格子与离散乐器映射还丢掉了速度与轨迹的连续表现力,这是为可测性付出的简化。

哪些结论出不了这个十六格原型?

直接报告的是受限十六格内的延迟与错误率,有限解释是投机执行能把宏观可用的扩散模型位移到微观使用,未验证的是开放手势与开放语义下同样成立。原型只预测落点位置,不预测手形与动作的语义变化,文本提示也只有 16 个乐器名,真实演出需要的速度、力度与轨迹连续性都没有进入评价。在线适应的细节缺失使因果难定:25 分钟内错误率下降可能来自用户逐渐迎合网格,也可能来自模型真学到了习惯,两者未分离。

硬件预算只报告了识别与生成的两个延迟点,没有报告并行生成 16 路时的显存、功耗与帧率,也没有做听感评价,自动命中率不能当成音乐质量。回滚切换本身是否有可闻断裂、切换阈值如何设,原文只给 77 毫秒量级,未给听觉实验。伦理与数据方面,系统只存用户实时录制的手势数值文本,不存图像,且调用的都是公开姿态与音频模型,这部分是明确的。总体趋势不等于每步都成立:平均负延迟不代表每个手势都提前,首选的高错误率提醒单猜不可用。

要复现先搭什么,先测什么,还缺什么?

复现先搭三线程骨架:摄像头抓取与分类线程、手动触发的分类器重训线程、音频生成与投机播放线程。手部检测用公开 MediaPipe,文档当前可用;手形与动作初始分类用公开手势识别仓库,当前可用;科学计算插值用公开科学计算库,当前可用;长短期记忆用公开深度学习框架文档,当前可用。

音频生成用的稳定音频开放小模型链接本次未能确认可达,不要写成已公开可用,先用本地已下载权重或可运行的同类扩散模型替代,并在记录中注明替换。用户自定义标签流程要照做:键盘定义手势含义,录制约 10 秒示例,手动重训约 30 秒,确认重训时帧率与音频不受影响。再按 30 帧分段、平均 20 帧每秒、预测未来约 70 帧即 3.6 秒、长样条 3.4 秒与短样条 220 毫秒搭建预测与基线。

先测无投机基线在自己机器上的识别延迟与生成延迟,确认合计是否超微观带,再测前一到前 16 路的感知延迟与错误率,画出与原文图五同轴的曲线。还需补的验证是开放手势集下的表现、并行多路的资源开销、回滚切换的可闻性,以及用户适应与模型适应的分离实验。何时值得尝试:演出动作空间能压缩到十几类、设备能并行备多路、能容忍猜错切换时,投机执行值得一试;若动作完全开放或设备 1 次只能生成一路,则不要期待同样的微观同步。

一句话收束:它改变了什么,没有改变什么?

它改变的是时间关系:把生成从手势结束后搬到手势进行中,用多备加回滚把平均感知延迟做到负值或微观带内;它没有改变的是生成本身的速度与音乐质量,扩散模型依然耗时,命中落点也不等于好听。记住 3 个可复述的动作:把手势降为手形加动作加坐标的 4 维表示,用在线长短期记忆输出落点分布并按序预生成 16 路乐器音频,结束时播放最近一路并在猜错时快速切换。带着基线两百多毫秒、首选错误率高、多路才可靠这组数字去读,论文的位移主张才是可核对的,而不是一句更实时的口号。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 4 页

区域 2 · 查看论文原页

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 nime-2026 论文汇总