英文题目:DYNAMIC FRAME LENGTH FOR SPEECH SPECTRAL MAGNITUDE FEATURES

会议身份:conference:eusipco:2026:conference-paper-id:0000441

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#时频分析 #语音学与音系 #语音 #音频分类

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Fang, Guolin:机构信息未能从会议 PDF 纯文本可靠映射
  • Brookes, Mike:机构信息未能从会议 PDF 纯文本可靠映射
  • Juvela, Lauri:机构信息未能从会议 PDF 纯文本可靠映射
  • Gudnason, Jon:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究处理固定帧长与浊音基频周期失配导致的频谱失真问题,输入为16 kHz语音波形,输出为固定时频网格上的对数幅度谱特征,用于音素分类。首先基于声门闭合时刻确定动态帧边界并以偏移参数控制帧相对声门事件的位置,使每帧对齐单个基音周期,随后对每帧直接计算傅里叶系数而不加窗或补零,接着经自然邻居插值(Natural-Neighbor Interpolation)重采样到统一时频网格,最后经加1取对数与Z分数归一化(Z-Score Normalization)送入分类器。与固定帧加汉宁窗(Hann Window)的传统短时傅里叶变换(Short-Time Fourier Transform,STFT)相比,关键差异在于以生理周期对齐替代固定切分,从源头避免非整数周期截断伪影。在TIMIT数据集38类音素加静音任务上,动态帧在6 ms表观支撑双倍分辨率下取得47.3%测试准确率,高于24 ms固定帧基线的46.8%。该结论限于无上下文的轻量多层感知机(Multilayer Perceptron,MLP)静态分类,未验证结合上下文建模或完整语音识别及跨语料泛化。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要解决的语音特征问题从哪里来?

这篇解读的输入是论文原文提供的摘要、引言、方法、评估与结论文字,不引入外部代码或数据假设。目标读者是刚进入语音、音乐、音频方向的研究生,目标是能复述出动态帧长谱幅度特征的完整做法,并在相同条件下复现比较。必须保留的关键信息包括帧界如何确定、傅里叶系数如何计算、如何重采样到固定网格、TIMIT 划分与分类器配置,以及主结果数字与适用边界。输出是一套可核对的步骤说明,而不是对效果的笼统赞美。

语音特征提取的常规动作是把连续语音切成等长短帧,加窗、补零后做离散傅里叶变换,取幅度谱再经过梅尔滤波或倒谱处理。工具箱把 20 到 30 毫秒固定帧当作默认选择,因为它对多数音素折中了时间平稳性与频率分辨率。初学者容易把这一步当成纯工程切分,但它隐含了一个信号假设:DFT 把帧内信号看作以帧长为周期的无限周期延拓。如果浊音的真实周期是基音周期,而帧长不是它的整数倍,延拓就会在边界处制造人为不连续,能量泄漏到邻近频点。

论文图 1 用元音例子直观展示了这个问题:25 毫秒固定帧截断了非整数个周期,其对数幅度谱出现毛刺,而单基音周期的谱更干净。这就是全文的起点。

已有路线如何处理基音与频谱的关系?

理解新方法之前,先把相关路线按输入、目标和运行阶段分开。经典 STFT 加梅尔倒谱路线输入是固定帧波形,目标是紧凑且平移鲁棒的包络特征,运行在识别前端,优点是简单统一,缺点是对浊音周期失配敏感。声门闭合时刻检测路线输入也是波形,目标是定位每次声带闭合的最显著不连续点,常用 YAGA 等多候选动态规划方法,运行在基音同步分析之前。

声码器路线如 STRAIGHT 和 WORLD 输入是浊音波形加基音轮廓,目标是分解激励与滤波器包络以获得平滑谱包络,运行在合成与转换中,它们已经使用基音自适应帧长,但更多服务于包络估计而非判别式音素分类。近期从波形直接学习滤波器组的方法输入是原始波形或对数幅度谱,目标是在噪声下学出类似梅尔的滤波器,运行在神经网络前端。

本文的位置是把生理动机的 GCI 定界与现代特征学习接口结合起来:前端仍输出幅度谱矩阵,后端仍可用标准分类器,但帧界不再等间隔。它与 STRAIGHT、WORLD 共享基音自适应的思想,区别是评估任务是音素分类而非合成质量;它与 GCI 检测共享同一事件定义,区别是把 GCI 从分析对象变成切分工具;它与学习滤波器组共享兼容神经网络的动机,区别是不在网络内部学习滤波器,而是先保证谱估计本身对齐周期。

固定帧错在哪里:非整数周期带来什么失真?

沿着一个浊元音样本走一遍就能看清矛盾。输入是一段准周期波形,基音周期约几毫秒。固定帧以 25 毫秒为窗取一段,窗内包含例如 3.7 个周期。表示阶段对这段做 DFT,DFT 只认识帧长这一种周期,于是把 0.7 个多余片段强行拼接到开头,形成边界跳变。组件层面加窗可以压低边界权重,但不能消除周期失配带来的采样偏移:DFT 系数相当于在以帧长为周期的无限延拓信号的连续频谱上采样,而不是在以基音为周期的真实谐波位置上采样。

目标是得到稳定反映声道形状的幅度谱,输出却混入了帧内 GCI 个数和位置随机变化带来的抖动。相邻两固定帧即使属于同一元音,也会因为截断相位不同而谱形起伏,下游模型必须额外学习这种人为变化。

固定帧 × 动态帧: 固定帧负责以等间隔、等时长切分信号并直接做 DFT,便于批量处理但会截断非整数个基音周期;动态帧负责让帧界跟随声门闭合时刻,使每帧恰好覆盖一个基音周期从而满足傅里叶周期性假设;二者搭配的原因是前者是基线与兼容网格,后者是更符合发声机理的采样方式,组合意义在于用重采样把不规则动态谱映射回固定网格,兼顾物理对齐与下游模型输入规整。

教学例子仅为帮助理解,不代表论文数值:假设基音周期为 8 毫秒,固定帧取 25 毫秒,则每帧多出 1 毫秒尾巴,该尾巴在下 1 帧开头位置不同,导致谐波幅度估计上下浮动。动态帧的做法是让每帧恰好从一个 GCI 附近到下一个 GCI 附近,帧长随基音变化,从而消除这种多余尾巴。论文要回答的正是这种对齐是否同时带来帧内更稳定、任务上更可分的效果。

方法全景:从波形到固定网格特征经过哪几步?

把一句话方法展开为可执行流水线。第一步是确定帧界:浊音段用 GCI 检测得到每个周期的起止样本,清音与静音段用两侧可靠浊音段的基音轮廓线性插值补齐帧界。第二步是计算傅里叶系数:对每帧长度为 Ni 的原始波形片段直接做 Ni 点 DFT,不加窗、不补零,得到随 i 变化的频点数与频点位置。第三步是时频重采样:把所有帧的幅度值看作散落在时间和频率平面上的观测点,用自然邻域 2 维线性插值映射到等间隔时间索引与固定频点数 K 的网格上,得到表观帧长为 T、频点数为 K 的规整谱图。第四步是归一化与分类:对幅度加 1 取对数,再按训练集做 Z 分数归一化,送入轻量多层感知机做静态音素分类。

这个顺序不能颠倒:必须先有 GCI 才能定 Ni,必须先有 Ni 点谱才能谈插值,必须先有固定网格才能批量训练。论文的新贡献按原文是三点:在音素分类语境下评估该做法,提出允许相同表观分辨率与时间支撑的重采样方案,以及改进清音段帧长确定方式。后续各节按此依赖逐一讲清每个组件的输入、计算与参数。

帧界如何定:GCI、偏移量与清音插值怎么做?

先讲白话再给术语。声门闭合时刻就是声带 1 次振动中突然闭合的瞬间,在波形上表现为最陡的不连续,英文为 glottal closure instants,缩写为 GCI。基音周期就是相邻 2 次闭合之间的样本数,记为 Ni。论文用 YAGA 算法估计 GCI,并说明换用另一种方法对傅里叶系数影响很小,因此 GCI 模块可视为可替换的前端。

具体操作是记第 i 个 GCI 样本索引为 ni,则 Ni 等于 ni 减去 ni 减 1。帧 i 的起始样本 oi 等于 ni 减去向下取整后的 rho 乘 Ni,其中设计参数 rho 在 0 到 1 之间,论文定性选择 0.3。选择 0.3 的原文理由是让帧界通常落在声门开启前的低能量区,此时截断影响最小,计算傅里叶系数更有利。帧 i 的结束样本是下 1 帧起始减 1,因此浊音段每帧恰含一个 GCI 且位置一致,这是降低帧间抖动的关键。

声门闭合时刻 × 基音周期: 声门闭合时刻负责标定每 1 次声带 abrupt 闭合造成的不连续点,是周期中最显著且能量低谷附近的事件;基音周期负责给出相邻两个该时刻之差 Ni,作为该帧的真实时长;搭配的原因是只知道周期长度不够定位截断相位,而 GCI 给出相位锚点,组合后才能按式(1) 偏移量 rho 把帧界放在开相前低能量区,减少截断泄漏。

清音与静音没有周期可循,论文没有为它们设计发音特征驱动的动态界,而是用插值维持连续性。做法是先找可靠浊音帧,要求与相邻 2 帧时长相差在正负 10% 以内且相关大于 0.6,再在两个可靠浊音帧之间的空隙里插入额外帧界,使基音轮廓线性变化。这一步的含义是清音段帧长是推测的过渡值,不是测量值,复现时必须保留这一区分,不能把清音帧当成同样精确的周期观测。

谱系数与重采样:变长谱如何变成规整输入?

傅里叶系数阶段的输入是每帧长度为 Ni 的波形片段 si(m),输出是 Ni 个复系数 Si(k)。论文明确不加窗、不补零,理由是帧界已选在低能量区,矩形窗的 abrupt 截断效应已被缓解,而传统汉宁窗加补零是为压制固定帧边界跳变而设。后果是每帧频点间隔为采样率除以 Ni,Ni 随基音变化,因此频点位置与数量都不固定。左图示意的 7 帧时频铺砌正是这种情况:长帧时间支撑大、频率分辨率高,短帧反之,黑方块位于每块中心。

幅度谱 × 时频重采样: 幅度谱负责保留每帧各频率分量的能量分布,是音素分类的直接输入;时频重采样负责用自然邻域插值把时长可变、频点位置可变的|Si(k)|搬到固定时间步长 N 与固定频点数 K 的网格|S 帽|上;搭配的原因是动态分帧必然破坏矩阵规整性,组合意义是让不同基音长度的观测具有相同表观时间支撑与频率分辨率,从而可以公平比较并送入同一 MLP。

重采样阶段的输入是全部散点幅度|Si(k)|及其时频坐标,输出是固定网格| S 帽|。时间索引对应固定帧长 N 样本,频率索引范围 0 到 K 减 1,K 取 N 除 2 加 1 为标称分辨率,取 N 加 1 为 2 倍标称分辨率。实现用基于 Delaunay 三角剖分的自然邻域方法做 2 维线性插值,每个输出点是附近输入点的加权和。右图示意插值后黑方块落在均匀网格上,覆盖在原始铺砌之上。初学者要记住表观二字的含义:T 与 K 是插值后的名义支撑与密度,不是某次 DFT 的真实长度,真实物理分辨率仍受基音限制。

有无神经网络训练:本研究真正优化了什么?

本节必须先澄清训练一词的两种含义。谱估计本身没有训练参数:GCI 检测用现成 YAGA,帧界公式只有固定的 rho 等于 0.3,清音插值用固定的相似度与相关阈值,DFT 与自然邻域插值都是确定性计算,不存在梯度更新。因此动态分帧不是可微前端,没有报告学习率或反向传播路径,不能把无训练等同于输出完全确定,因为 GCI 估计误差与插值权重仍会随数据变化。

真正的可训练部分是评估用的轻量多层感知机,英文为 multilayer perceptron,缩写为 MLP。它由两个隐层加 GeLU 激活与丢弃层组成,后接映射到音素类别的线性输出层,用交叉熵损失与 Adam 优化器训练,学习率为千分之一,权重衰减为万分之一,其余为默认参数。论文对每种特征表示做按说话人分组的五折交叉验证,每折保留最佳验证检查点,并在隐层尺寸、丢弃率、学习率、权重衰减与批量大小上做网格搜索,最终多数特征选择 512 乘 128 隐层、丢弃 0.1、批量 1024、训练 30 轮。为保证公平,所有动态与固定特征共用同一架构与搜索协议,区别只在输入谱矩阵。最终模型在合并训练与验证集后重训,再在保留测试集上报告 1 次准确率。

实验条件:数据、划分、网格与基线是否一致?

实验按测什么、与谁比、条件是否一致来组织。数据集用 TIMIT,采样率 16 千赫,音素折叠为 38 类加静音类,去掉方言 SA 句子,按 NIST 推荐划分为 462 人训练池与 168 人测试集,避免说话人与文本重叠。交叉验证的折按说话人分组,避免同一说话人同时出现在训练与验证中,这是防止泄漏的关键。输入归一化统一为幅度加 1 取对数再做 Z 分数归一化,统计量来自训练集。

特征网格覆盖表观时长 3、6、12、24、48、96 毫秒,对应样本数 N 为 48、96、192、384、768、1534,平均基音周期接近 6 毫秒对应 N 等于 96,传统 20 到 30 毫秒对应 N 等于 384 附近。基线是同一时间帧上的固定帧傅里叶系数,加汉宁窗,仅在 2 倍分辨率时补零,其余网格与归一化完全一致,因此比较的是分帧与窗函数策略,不是分类器容量。频率分辨率对比固定 T 改变 K,K 取 l 乘 N 除 4 加 1,其中 l 从 2 到 8。

下表提出第一个核对问题:在相同标称网格下,动态与固定特征的时间支撑如何对应?公平条件是同一 N 与 K 定义,指标方向是后续分类准确率越高越好,表中数字直接来自原文连续句,单位保留毫秒原样。

表观时长 T对应样本数 N时间支撑含义网格类型覆盖依据
6 ms96接近平均基音周期固定网格原文集合
12 ms1922 倍平均周期固定网格原文集合
24 ms384传统固定帧长度固定网格原文集合

上表的主要收益是让读者不混淆真实 Ni 与标称 N:前者每帧可变,后者是插值目标。代价是插值必然带来过采样或欠采样,例如以平均周期 2 倍分辨率采样时,约 3.1% 长周期存在欠采样,其余为过采样。未胜出项在后文结果中可见,长表观支撑并不单调更优,这与非平稳性有关。

主结果:动态帧在什么支撑下超过固定帧?

先看帧间可变性这个机理解释量。度量 V 帽定义为相邻 2 帧幅度谱差的能量除以首帧能量再取 10 倍对数,分贝越低说明同一音素内越稳定,只在 2 帧同属指定音素类型时平均,且结果只报告标称分辨率情形。上图按原文描述显示:固定帧在 12 毫秒附近最低,过短则因每帧内 GCI 个数与位置不规则抖动而升高,过长则因信号非平稳而升高;动态帧因每帧恰含一个位置一致的 GCI 且经重采样,短表观支撑下单调下降,长支撑下虽因非平稳回升但仍比固定帧好约 4 分贝。元音、双元音与浊辅音趋势定性相似,清音辅音整体可变性最高,这是预期内的反例,因为清音帧界本就是插值推测。

帧间可变性 × 音素分类准确率: 帧间可变性负责度量相邻 2 帧幅度谱差异能量相对首帧能量的分贝值,越低说明同一音素内谱越稳定;音素分类准确率负责度量静态特征区分 38 类音素加静音的能力;搭配的原因是前者是机理解释量,后者是任务效果量,组合意义在于先验证动态帧确实降低了因 GCI 在固定帧内位置抖动带来的人为抖动,再看这种稳定是否转化为分类收益,避免只看准确率无法定位来源。

再看音素分类这个任务量。下表提出核心比较问题:在各自最优表观支撑下,动态帧能否以更短观测达到不低于传统长帧的准确率?公平条件是同一 MLP 协议与同一归一化,指标方向是准确率越高越好。

帧类型表观时间支撑频率分辨率测试准确率比较对象
动态帧6 ms2 倍标称分辨率47.3%本方法最优
固定帧24 ms标称或 2 倍分辨率46.8%基线最优
动态帧12 ms2 倍标称分辨率47.3%本方法并列

表中关键数字的原文依据是摘要句,动态以 1/4 帧长维持更高准确率是论文强调的要点。表后解释必须同时讲收益与代价:收益是 6 毫秒与 12 毫秒动态特征在 2 倍标称分辨率下并列最高 47.3%,比 24 毫秒固定基线高 0.5 个百分点,且在更高帧率下保持准确率,为上下文建模提供更密集观测;代价是该比较是静态单帧分类,未加入上下文信息,不能直接推广为连续语音识别词错率下降,且动态最优依赖 2 倍过采样与 GCI 质量。未胜出项是 48 毫秒与 96 毫秒长支撑两类方法都明显下降,说明一味增大时间支撑并无收益。

分辨率与支撑如何折中:超过基音极限还有用吗?

本节按原文表二的思路组织消融问题:固定时间支撑,改变频点数 K,观察准确率是否继续上升。测试的 3 个支撑是 N 等于 96、144、192,对应约 6、9、12 毫秒,K 取从 2N 除 4 加 1 到 8N 除 4 加 1 共七档。6 毫秒接近平均基音长度,此时从标称分辨率提高到 2 倍标称分辨率有小幅增益,超过后基本持平,原文指出仅约 3.1% 周期长于 12 毫秒会被欠采样,其余都是过采样,因此继续加密频点只是插值更密,没有新增物理信息。9 毫秒支撑略有提升,超过后 12 毫秒反而下降,这与语音产生理论吻合:基音设定了有效平稳时长上限,更大支撑带来更高名义频率分辨率,但混入更多非平稳变化。

表观帧长 × 频率分辨率: 表观帧长负责标称重采样后网格的时间步长 T,对应采样点数 N,决定 1 次观测覆盖多长时间;频率分辨率负责标称每帧频点数 K,决定频域采样密度;搭配的原因是时频不确定性使二者互相制约,组合意义在于论文固定 T 而改变 K 来检验超过基音自然极限后增加频点是否还有收益,从而找到 6 ms 附近与 2 倍标称分辨率的折中点。

对初学者的操作含义是不要把 K 当成免费精度。复现时应先固定 T 在 6 毫秒附近扫描 K,找到拐点后再扫描 T,而不是同时放大两者。若把 N 推到 768 或 1536 对应的 48 与 96 毫秒,分类准确率会大幅回落到 44% 与 41% 附近,动态仍优于固定但绝对值已无竞争力。这组负结果支持论文判断:有用信息集中在基音自然屏障之内,超出后时频权衡不再有利。

边界与未验证点:哪些结论不能直接推广?

区分 3 类表述有助于避免误读。论文直接报告的是 TIMIT 静态音素分类准确率与帧间可变性分贝差,支持的是动态帧在该任务与该度量下更稳定、更可分。有限解释是短支撑高帧率有望利于上下文建模与语音识别,用词是显示潜力与可以预期,属于基于趋势的推断。未验证推测包括相位谱特征、跨时间上下文建模、声调语言基音单独建模等,原文明确列为未来研究,只能用可能或待验证表达。

缺失证据不是技术错误,但必须点名:未测量解码延迟、实时因子、GCI 检测失败率、噪声与跨语种泛化,也未报告训练与推理的硬件预算与耗时,因此不能承诺延迟或成本改善。相关性不等于因果:帧间可变性低与准确率高同时出现,但论文没有证明前者必然导致后者。总体趋势不等于每组都成立:动态平均更优,但清音段改善有限,长支撑下两类方法都变差。复现时若 GCI 在儿童高基音或电话窄带下质量下降,动态优势可能缩小,这正是需要补做的验证。

复现先做什么:参数、划分与检查点如何固定?

复现按学习依赖排序,先保证数据与划分一致,再固定前端,最后固定分类器。数据动作是获取 TIMIT,按原文去掉 SA 句,用 462 人训练与 168 人测试划分,音素映射到 38 类加静音,交叉验证按说话人分组五折,这是可比性的前提。前端动作是运行 YAGA 得到 GCI,用 rho 等于 0.3 按帧起始公式切分浊音帧,用可靠帧的时长正负 10% 与相关大于 0.6 筛选锚点,再线性插值补齐清音帧界;每帧做 Ni 点 DFT 不加窗不补零,再用自然邻域插值到目标 N 与 K 网格;幅度加 1 取对数后用训练集均值方差做 Z 分数归一化。

分类器动作是用两隐层 MLP 加 GeLU 与丢弃,Adam 学习率千分之一、权重衰减万分之一,网格搜索隐层、丢弃、批量与轮数,多数特征的最优点在 512 乘 128、丢弃 0.1、批量 1024、30 轮附近,选验证最优后合并训练验证重训再测测试集。

下表核对复现中最易混的协议项,公平条件是动态与固定共用同一行配置,指标方向是避免泄漏与保证可运行。

环节关键设置取值或规则适用范围备注
数据划分说话人分组五折交叉验证全部特征避免重叠
前端锚点可靠浊音判定时长正负 10% 且相关大于 0.6插值依据原文阈值
帧定位偏移参数rho 等于 0.3浊音帧低能量截断
优化器学习率与衰减千分之一与万分之一MLP 训练网格搜索
重训策略合并后重训训练加验证合并最终测试单次报告

表后解释是代价与检查方法:严格按说话人分组会使每折数据量减少且方差增大,但能避免同一人同时出现在训练与验证中导致的高估;合并重训能用满数据但失去验证早停的独立性,复现时应记录每折最佳轮数以备核查。若缺少某项超参数原文未报告,应在记录中标明缺项而不猜测,例如自然邻域的具体三角剖分实现细节与随机种子在原文中未给出,需固定自己版本并报告。

何时值得尝试:给新生的行动清单是什么?

回到中心矛盾:固定帧为了工程统一而牺牲周期对齐,动态帧为了物理对齐而牺牲网格规整,重采样是二者的桥。当你的任务依赖浊音谐波结构且可用 GCI,例如元音分析、基音同步特征研究或高帧率音素建模,动态帧值得尝试;当你的数据清音占比极高、GCI 不可靠或实时预算只允许固定 STFT 时,优先保留固定基线。论文特有的误解有三:把表观帧长当成真实 DFT 长度,把 2 倍频点当成 2 倍物理分辨率,把静态分类增益当成语音识别增益,纠正方法是记住插值不创造信息、基音限制有效平稳时长、上下文建模仍待验证。

行动清单按顺序是先复现 6 毫秒 2 倍分辨率与 24 毫秒固定基线的 0.5 个百分点差距,再复现短支撑单调性与长支撑回落,最后补做噪声、跨库与 GCI 替换实验。资源状态方面,本次未发现来源绑定且完成 HTTPS 验证的资源,不得声称代码、模型或数据已公开,复现需自行实现切分、DFT 与插值。总体上,这是一项前端对齐改进,不是端到端胜利,它用更符合傅里叶级数假设的观测换来更稳定的谱与更密集的观测点,是否转化为识别系统收益,还需在带上下文的模型中继续检验。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 2 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 2 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 2 页

区域 3 · 查看论文原页

原文数学表达区域 4,PDF 第 2 页

区域 4 · 查看论文原页

原文数学表达区域 5,PDF 第 3 页

区域 5 · 查看论文原页

另有 15 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eusipco-2026 论文汇总