英文题目:What Affects the Performance of Fake Audio Detection? Analyzing Factors in a Continual Learning Setting

标签:#音频深度伪造检测 | #持续学习 | #语音 | #模型比较

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

👥 作者与机构

  • Yixuan Xiao:机构信息未在 arXiv HTML 中可靠披露
  • Ngoc Thang Vu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

伪造音频检测输入为待判语音波形或声学特征,输出为真伪二分类结果,现实难点在于文本转语音与语音转换技术持续演进导致测试分布不断漂移。作者构建持续学习框架,先在ASVSpoof 2019 LA上训练基座检测模型,再按任务序列依次适配,每个新任务仅含单一已知架构与已知训练数据的攻击者及已知多样性的真音频,前序任务模型作为下一任务起点并叠加防遗忘约束。该工作对比轻量到重量级的Light CNN、ResNet与wav2vec2AASIST三种检测模型及直接微调、单类分类、随机回放与不遗忘学习四种训练策略,以分离模型容量与策略效应。与以往把整库视为任务并混合多种攻击因素的做法不同,该设计将攻击者训练数据、攻击者架构、任务顺序和说话人多样性解耦为可独立操纵变量。在包含19个攻击者任务的持续学习评测设置下,相同训练数据不同架构子集条件的平均错误率在不超过2个任务后接近零错误率,低于不同训练数据相同架构子集条件下在T6处仍偏高的平均错误率。趋势上任务顺序与说话人多样性对不同模型策略影响不一致,随机回放整体更稳健,而不遗忘学习在小模型上对顺序敏感、单类方法在大模型与高多样性下不稳定。结论适用边界受限于仅验证英语有声书域与上述模型策略组合,尚未验证重放攻击、跨信道与多语场景的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

真实风险是什么,为什么静态数据集不够用?

这篇论文研究的是伪造音频检测,也就是判断一段语音是人真实说出来的,还是由文本转语音或声音转换系统合成的。输入是一段待测音频,输出是真或伪的二分类判决,初学者可以把它理解为语音版的打假器。作者的起点是现实动态性:合成器更新很快,今天防住的攻击者,明天换一个模型或换一批训练语料就可能失效。传统的比赛和论文大多在固定数据集上比高低,模型 1 次训练好就不再更新,这与部署后不断遇到新合成器的情况不一致。

于是作者把问题放进持续学习框架:模型先在一个初始任务上得到基础能力,然后按顺序遇到一系列新任务,每个任务对应一个具体攻击者加一批真实语音,模型要在学新任务的同时尽量不忘旧任务,还要对没见过的攻击者有一定泛化。需要保留的关键信息是,论文不是提出一个新的合成器,而是分析哪些因素会左右这种序列学习的效果,代码当前可用,地址是官方仓库的分支。

伪造音频检测 × 持续学习: 伪造音频检测负责判断一段音频是真实录制还是语音合成或声音转换生成,持续学习负责让同一个检测模型按任务序列不断更新而不丢掉旧任务能力,二者搭配的原因是合成技术不断出新,单次训练的静态模型会被新攻击者绕过,组合后新增作用是把评估从单数据集准确率变成跨时间任务序列上的保持与泛化能力。

按一个样本走一遍流程有助于建立依赖:一段测试音频先被转成模型输入表示,再经检测网络得到嵌入或分数,最后与阈值比较输出真伪判决。在持续学习中,这个判决器的参数会被后续任务反复修改,因此前 1 个任务留下的痕迹会影响后 1 个任务的起点。后续所有关于攻击者、顺序和说话人的讨论,都是在问这种序列修改到底被什么主导。

前人把一个任务定义得太大,为什么难以归因?

与持续学习伪造检测相关的前人工作主要有 3 条路线。第一条是在分类损失上再加无遗忘正则和真实样本对齐损失,希望同时保住旧任务和收紧真实特征空间,评估时把语音合成与逻辑接入任务和物理接入重放任务分开看,本文聚焦更贴近现实的逻辑接入一侧。第二条是按数据类型修改梯度方向,例如要求真实语音的梯度与历史方向保持一致,实验时把整个语音伪造数据集或野外数据集当作 1 个任务。

第 3 条是只报告学完所有任务后的总体性能,并用少数几种合成架构构造任务。作者指出的问题是,当 1 个任务里混了多种攻击类型、多种说话人和未知来源的训练数据时,性能变好后无法定位是哪一个因素起作用。类别差异也不能当成同条件胜负,例如把架构多样性直接等同于难度,而不控制攻击者训练数据是否相同。

本文的对照策略是把任务定义收紧到单个攻击者:架构已知、训练数据已知、真实语音多样性已知,然后用多个检测模型和多种训练策略重复验证,以便把因素拆开。

三个研究问题各自要拆开什么混杂?

论文提出 3 个研究问题。第一个问题问攻击者的哪一面影响更大,是它的训练数据还是它的网络架构。背后的怀疑是,不同架构如果在同一批语料上训练,生成的伪造音频可能共享同一批数据痕迹,检测模型只要抓住这些痕迹就能跨架构泛化,那么只增加架构种类并不能真正提高数据集难度。第二个问题问任务顺序是否对不同模型和策略有相同影响。持续学习领域早就知道顺序重要,但在伪造检测里讨论较少。

第 3 个问题问说话人多样性是否对不同模型和策略有相同影响。过去有工作假设真实语音分布比伪造语音更一致,因此围绕真实语音设计损失或保护真实性能,但当说话人从几个人扩大到上 1000 人、口音和风格差异变大时,这个假设是否还成立需要检验。

攻击者训练数据 × 攻击者架构: 攻击者训练数据指合成模型训练时学到的目标语音库特性,攻击者架构指合成模型的结构类型如声码器与声学模型组合,前者分工决定伪造音频中残留的数据集痕迹,后者分工决定生成机制引入的结构痕迹,二者搭配研究的原因是现有数据集只强调架构多样而忽略训练数据重叠,组合意义是判断只换架构是否足以构成有挑战性的持续学习任务序列。

教学上可以举一个例子而不编造效果:假设两个合成器结构不同但都只学过同一位朗读者的录音,那么它们都可能留下同一录音环境的混响或同一说话节奏,检测器可能靠环境而非合成机制本身来判伪,这就是例子要提示的混杂,论文正是用受控分组来验证这类直觉。

整体实验链条如何从基础模型走到十九个任务?

方法全景是一条序列适应的链条。起点是用语音伪造竞赛的逻辑接入数据训练一个基础检测模型,然后让这个基础模型依次适应 19 个新任务。每个新任务包含某一个攻击者生成的伪造音频和一批真实音频,训练与测试按比例划分。检测模型有 3 种,训练策略有 4 种,组合起来观察平均等错误率随任务推进的变化。等错误率是论文的主要指标,数值越低越好,它表示误接受伪造与误拒绝真实达到平衡时的错误水平。

作者特意选择容量从小到大的模型,把容量当作泛化能力的代理,以便看结论是否随模型变大而改变。训练策略则覆盖能存旧数据和不能存旧数据两种现实约束。整个链条不追求 1 次比出最高分,而是通过打乱顺序、固定一组因素再看另一组因素,来实现可复述的对照。

三种检测模型各自吃什么输入,做什么计算?

3 种检测模型的输入与计算各不相同。轻量卷积网络吃的是线性频率倒谱系数及其 1 阶 2 阶差分,网络有 9 层卷积并配合最大特征图操作,该操作在多个特征图之间取逐元素最大值,用来抑制激活神经元数量,可以理解为一种特征筛选。残差网络吃的也是同类倒谱差分特征,但用残差连接缓解深层网络的梯度消失,使更深的训练成为可能。

wav2vec2AASIST 吃的是原始波形,先用自监督预训练的语音表示提取器得到特征,再送入图神经网络,用注意力机制同时建模时间与频谱维度的伪影。初学者可以这样记:前两者依赖手工声学特征加卷积,后者依赖大规模预训练表示加图注意力。论文报告的倾向是后者在跨任务上更稳,并推测自监督特征比简单声学特征更鲁棒,但这属于有限解释而非严格因果证明。

轻量卷积网络 × wav2vec2AASIST: 轻量卷积网络指用少量卷积层加最大特征图筛选的声学特征模型,分工是以小容量快速拟合当前任务的局部伪造痕迹,wav2vec2AASIST 指先用自监督预训练提取原始波形表示再用图注意力建模时频伪影的模型,分工是提供更通用的语音表示,二者搭配的理由是作者把模型容量当作泛化能力的代理变量,组合意义是检验同一任务顺序和训练策略在不同容量下是否一致。

沿一个样本走完:一段波形要么先转成倒谱差分再进卷积得到真伪分数,要么直接进预训练编码器再进图网络得到分数,分数与阈值比较即输出,持续学习阶段正是不断用新任务数据调整这条路径上的参数。

单类别方法与无遗忘正则的约束有何不同?

这一节聚焦两个容易混淆的约束。单类别 Softmax 不是普通的二分类,它在嵌入空间学一个锚向量,用余弦相似度衡量音频嵌入与锚的接近程度,训练目标是把真实音频拉近锚并用较小间隔约束,把伪造音频推远并用较大间隔约束。它的监督来源仍然是真伪标签,但损失形态偏向只把真实类收紧。无遗忘学习则是在二分类损失之外再加一项分布保持损失,用散度衡量当前模型与缓存旧模型在输出概率上的差异,要求学新任务时不要让输出行为漂移太远。

两者的梯度路径不同:前者主要重塑嵌入几何,后者主要牵引输出分布。论文未报告锚向量维度、间隔具体数值和正则权重的完整超参数表,这是复现时需要补看代码的具体缺项,不能从方法名推定实现细节。

随机回放 × 无遗忘学习: 随机回放分工是保留一个固定大小的旧样本缓冲并在每个任务后均匀补充新旧样本,用真实旧数据约束更新方向,无遗忘学习分工是在没有旧数据时用缓存旧模型的输出分布约束新模型,让新旧输出保持相近,二者搭配的原因是对应现实中能存数据与因隐私不能存数据两种条件,组合意义是区分性能提升到底来自数据记忆还是来自输出正则。

单类别 Softmax × 真实音频紧致假设: 单类别 Softmax 分工是学习一个嵌入空间中的锚向量,把真实音频拉近锚向量并把伪造音频推远,真实音频紧致假设分工是提供该损失的前提即真实语音比花样繁多的伪造语音更相似,二者搭配的理由是想用对真实类的紧约束获得对未知伪造的泛化,组合意义是一旦说话人多样性升高或大模型编码了更丰富的真实细节,该紧致前提就会被挑战并导致不稳定。

理解这对组合后再看后文的反常现象就不意外:收紧真实类的前提在说话人变多时会变弱,而牵引旧输出的做法在任务切换剧烈时会把旧捷径带到新任务。

四种训练策略如何更新参数,能否存旧数据?

训练部分有 4 种可运行策略。直接微调是基线,每个新任务到来时直接在新数据上继续训练,不保留旧样本也不加额外约束,实现最简单但最容易遗忘。随机回放是能存数据的方案,它维护一个固定大小的缓冲,每学完 1 个任务就减少旧样本并随机加入新样本,保证缓冲中各任务样本尽量均匀,训练时同时用新数据和缓冲旧数据更新。

无遗忘学习是不能存数据的方案之一,它保留一个旧模型副本做教师,用当前模型在新数据上的输出去逼近旧模型的输出,损失是二分类损失加散度约束。单类别 Softmax 是另一种不能存数据的思路,靠上述锚向量损失提高对新任务的泛化。论文明确了是否存数据的划分,但没有给出学习率、轮数、缓冲总大小和旧模型更新时机的完整数值,复现时必须以开源代码为准。需要强调的是,没有哪种策略被承诺能同时降低延迟或推理开销,论文只讨论检测错误率的变化。

十九个任务如何构造,真实语音如何控制多样性?

数据集构造是本文可复述的核心动作。基础模型用竞赛逻辑接入数据训练。持续学习任务用多语言多攻击者数据集的英文子集构造伪造部分,用其中美国英语子集或朗读书语料构造真实部分。选择该数据集的理由是它同时给出了攻击者架构和训练数据信息,且存在同数据不同架构和同类架构不同数据的情况,便于控制变量。每个攻击者提供 1000 条伪造,真实部分总量固定并均匀分到 19 个任务,每个任务内部再按 8 比 2 划分训练与测试。

下表把原表 19 个任务的对应关系完整保留,原表只有三列,因此先用原表呈现任务身份,再用后文整理表交代样本量与说话人规模,避免为凑宽度而给原表加列。 表前比较问题是:要回答训练数据与架构谁更重要,必须先确认每个任务的攻击者身份是否可控,公平条件是单任务单攻击者且身份已知,指标方向是后续序列上的等错误率越低越好。

Task IDTraining DataArchitecture
T1Nonegriffin_lim
T2Blizzard2013capacitron-t2-c50
T3Blizzard2013capacitron-t2-c150_v2
T4Samtacotron-DDC
T5JennyJenny
T6EK1tacotron2
T7LJSpeechfast_pitch
T8LJSpeechoverflow
T9LJSpeechglow-tts
T10LJSpeechvits–neon
T11LJSpeechneural_hmm
T12LJSpeechspeedy-speech
T13LJSpeechtacotron2-DCA
T14LJSpeechtacotron2-DDC
T15LJSpeechtacotron2-DDC_ph
T16LJSpeechvits
T17sunobark
T18multi-datasettortoise-v2
T19facebook-mmstts-eng

表后解释是:该表的主要价值是提供分组依据,例如多个基于朗读书语料的任务可组成同数据组,多个基于序列到序列结构的任务可组成同架构组,代价是原表本身不含性能数字,不能直接读出哪个攻击者更难,必须结合序列实验结果一起看,未胜出项是相位重建方法没有训练数据概念,需单独处理。

任务顺序与说话人分组如何形成对照条件?

在任务身份固定后,论文用顺序与真实来源制造对照。随机顺序把 19 个任务打乱,用于排除顺序偏差并研究攻击者因素,论文给出了从朗读任务到播客多数据任务的具体链条。按数据集排序则把训练数据相近的任务排在一起,使相邻任务分布过渡更平滑,而不同数据之间的切换更剧烈,用于检验顺序敏感性。

说话人多样性对照是把真实语音分别取自少说话人集合与多说话人朗读书集合,前者只有 3 位说话人,后者有上 1000 位说话人且平均每个任务超过 100 人,但声学领域同属有声书以减少领域混杂。下表整理样本量与划分等可运行细节,数字与单位均来自原文连续句,裸数值不擅自加百分号,千分位与精度保持原文。

表前比较问题是:在模型与策略相同的情况下,不同真实来源是否改变结论,公平条件是伪造部分与任务顺序保持一致而只换真实来源,指标仍是等错误率越低越好。

任务集合攻击者数量每攻击者伪造数真实音频总量说话人规模与划分
多攻击者序列任务191,00046,2943 位说话人,训练测试按 80/20 划分
高多样性真实替换版191,00046,2942,339 位说话人,平均每任务超过 100 位说话人

表后解释是:该表说明两组实验的数据量对齐,差异只在说话人多样性,主要收益是能把多样性效应与数据量效应分开,反例是即使总量相同,朗读书与原真实集在录制条件上仍可能有细微差别,因此不能把所有差异都归因于说话人数,未评测边界包括设备、口音与背景噪声等现实变量。

攻击者训练数据与架构谁的影响更大?

第一个结果对应随机顺序下的直接微调。为了固定一组看另一组,作者取出两个子集:同训练数据不同架构的子集,以及同类架构不同训练数据的子集,并用多数据与新架构的任务作为外部参照。报告显示,在同数据子集上,未见任务的等错误率下降更快更强,多数情况下模型只需看过 1 到 2 个任务就能达到接近零的错误并在已见任务上保持低错误;在同架构不同数据子集上,某个基于小规模单人数据的任务对所有模型都构成挑战。

支持的判断是,攻击者训练数据的影响至少与架构相当,只增加架构种类不足以构造高难度数据集。另一个报告是预训练表示模型在外部参照任务上也保持较低错误,作者推测自监督特征更鲁棒,这属于可能而待验证的解释。 下图前导读面向初学者:该热图矩阵的行列都是任务编号,格子颜色深浅表示在学到某 1 阶段时对某一任务的等错误率,越浅越好,左右两列分别对应上述两个子集,上下三行分别对应 3 种模型,需要按训练推进方向逐列阅读。

看图路径: 1. 先看左右两列分别对应相同训练数据不同架构与同类架构不同数据两组对照;2. 再按行比较轻量卷积网络、残差网络与 wav2vec2AASIST 三行热图的深色格位置;3. 最后沿横轴训练顺序观察未见任务格子如何从深色变为浅色

原论文 Figure 1:Equal Error Rates (EERs) of Subset 1 and Subset 2 are shown in left column and right column…

论文图 1。原论文 Figure 1::“Equal Error Rates (EERs) of Subset 1 and Subset 2 are shown in left column and right column respectively. Lower the better. The x-axis shows the training order.”。

针对可见内容的解释是:左列同数据组的浅色区域出现更早且更连贯,说明跨架构泛化更容易,右列同架构组的深色格更顽固,尤其是小模型在特定数据任务上出现高错误峰,预训练大模型的深色格更少且恢复更快,但像素不能精确读出的具体步数不要硬写,结论应结合原文的分组说明一起归因,不能把单格颜色推广为全程最优。

任务顺序与说话人多样性如何区别对待不同方法?

第二组与第三组结果用平均等错误率曲线展示。任务顺序对比中,随机回放在所有模型上最稳,平均错误最低且少有突增,代价是需要存储旧样本并承担内存负担。无遗忘学习对小模型顺序敏感,轻量网络与残差网络在两种顺序下高低互换,而在大模型上从同数据段开始呈现近乎单调下降,作者解释为平滑过渡有助于输出逼近,小容量模型更依赖任务特有捷径。

单类别方法在小模型上稳,但随容量增大波动加剧,大模型上平均错误起伏明显,作者推测与嵌入维度变大或真实信息变丰富导致单个锚向量难训练有关。说话人多样性对比中,直接微调、回放与无遗忘在高低多样性下表现相近,作者认为伪造生成时已带入相似说话人信息,单靠说话人信息难以判伪;例外仍是单类别方法,降低多样性后更稳定,支持高多样性破坏真实紧致前提的判断。

下图前导读:左列比较随机顺序虚线与按数据排序实线的差异,右列比较低多样性虚线与高多样性实线的差异,每行对应一种模型,4 条曲线对应 4 种策略,纵轴是平均等错误率,越低越好,横轴是任务推进编号。

看图路径: 1. 先确认左列为两种任务顺序对比、右列为两种说话人多样性对比;2. 再对照图例中直接微调、单类别、随机回放与无遗忘学习四条曲线的虚实线含义;3. 最后沿横轴任务编号观察平均等错误率曲线的波动与发散位置

原论文 Figure 2:Results for RQ2 and RQ3 are shown in the left and right columns, respectively.

论文图 2。原论文 Figure 2::“Results for RQ2 and RQ3 are shown in the left and right columns, respectively.”。

针对可见内容的解释是:左列小模型图中无遗忘曲线的虚实线分离明显,大模型图中分离减小,单类别曲线在大模型图中上下跳动大;右列前 3 种策略的虚实线基本贴合,只有单类别曲线在高多样性下波动更大,但具体峰值数值受像素限制不硬读,趋势不等同于每一步都成立,也不能把曲线向下直接等同于某单任务性能变好,需回到任务分组理解。

如果只换一种条件,结论还成立吗?

把第 3 个问题当作消融来读会更清晰。保持任务顺序为随机顺序而只把真实来源从低多样性换成高多样性,可以视为 1 次单因素替换。结果是 3 种策略基本不变,只有单类别方法变化明显,这支持多样性影响具有方法特异性,而非普遍规律。类似地,保持数据分组而只换顺序,可以视为对无遗忘与回放的消融:回放因有真实旧数据而不怕顺序变化,无遗忘因只能靠旧输出约束而对相邻任务相似度敏感。

论文还隐含了模型容量的消融:同一策略在小模型与大模型上表现相反,说明不能把在小模型上验证的稳健方法直接推广到大模型。未胜出项值得保留:直接微调作为最简单的基线并未在任何序列上持续最优,回放虽稳但不可部署于隐私受限场景,单类别虽省数据但在大模型高多样性下不稳。未评测边界包括只用平均等错误率而未报告误接受与误拒绝的分解、延迟与存储成本的量化,以及更多语种与信道条件。

为便于复现对照,下表再次用原文连续句固定关键配置,列数达到五列以支持逐项核对,数字写法保留原文。

对照维度任务总数伪造侧配置真实侧配置任务内划分与说话人
顺序与多样性对照191,00046,29480/20 划分,3 位说话人与 2,339 位说话人对比,平均每任务超过 100 位说话人
基础与序列数据量191,00046,29480/20 划分,均匀分布到 19 个任务

表后解释是:该表的收益是把复现时最易混淆的数量关系 1 次固定,代价是它不含任何性能数字,不能替代结果曲线,未胜出项是外部参照任务的多数据混合特性无法用单行数字概括,复现时需回到任务身份表确认其特殊性。

哪些结论是报告,哪些只是推测?

需要严格区分 3 层表述。直接报告的是:在受控分组下同数据跨架构泛化更快,特定小数据任务更难,大模型在外部任务上更稳,回放在两种顺序下最稳,无遗忘在小模型上顺序敏感,单类别在大模型或高多样性下波动大。有限解释的是:自监督特征更鲁棒、小模型更依赖捷径、大嵌入维度使单锚难训练、高多样性使真实集合不再紧致,这些都有机制上的合理性并得到曲线支持,但没有直接测量特征相似度、捷径使用率或嵌入空间半径,因此只能写成支持而非证明。

未验证推测包括把结论推广到更多录制设备、口音、噪声与语种,以及认为某种策略必然降低部署成本,论文未测量延迟、帧率与内存随任务增长的具体开销,不能承诺这些量得到改善。原文图表与文字若有冲突应以分组定义与指标方向为准,不自行编造划分或聚合口径来弥合,缺失证据应如实记为缺项而非技术错误。

要复现这组对照,先做什么,后补什么?

复现的第一步是按任务身份表重建 19 个任务:每个任务绑定一个攻击者,伪造各取 1000 条,真实总量取四万六千多条并均匀分任务,任务内按 8 比 2 划分训练测试,低多样性用原真实集的 3 位说话人,高多样性用朗读书替换并保证上千说话人规模与每任务 100 人以上。

基线模型先在竞赛逻辑接入数据上训练,再按随机顺序与按数据排序两种链条依次适应,训练策略至少实现直接微调、随机回放、无遗忘与单类别 4 种可运行版本,指标统一用等错误率且越低越好。第二步是先复现同数据与同架构两个子集的早期泛化差异,再复现顺序敏感性与多样性特异性,避免一开始就跑全组合。需要补的验证包括学习率、轮数、缓冲大小、散度权重、锚向量维度与间隔等超参数,以及多次随机种子的方差,因为原文未完整报告这些细节。

资源状态方面,官方代码分支当前可用,状态码为二百,可以下载对照实现,但权重是否可直接下载与系统能否一键运行需以仓库实际说明为准,不把代码可用等同于开箱可运行。

何时值得借鉴这篇论文,何时要谨慎?

当你的伪造检测系统需要长期应对新合成器,且能明确记录每个攻击者的架构与训练数据时,这篇论文的分组思路值得借鉴:不要只堆架构种类,要检查训练数据是否重复,任务顺序尽量让相近数据相邻,评估时至少保留直接微调与随机回放两个可运行基线。当你不能存储旧语音或模型容量很大时要谨慎:无遗忘可能把旧捷径带入新任务,单类别方法可能因真实多样性升高而不稳,此时应先在小规模序列上验证波动,再决定是否上线。

常见的误解是把平均错误下降当成每个任务都变好,或把自动指标的改善当成人工听感的改善,论文只报告检测错误率的序列趋势,不涉及主观质量与延迟承诺。收束一句话:攻击者数据与架构同等重要,顺序与多样性的影响因模型与策略而异,稳健性来自对因素的控制而非对单一方法的信仰。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-18 语音/音乐/音频论文速递