英文题目:Towards Deployable Underwater Vessel Classification

标签:#音频分类 | #CNN | #评测协议 | #端侧运行

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Abishek Soti:机构信息未在 arXiv HTML 中可靠披露
  • Thura Pyae Sone:机构信息未在 arXiv HTML 中可靠披露
  • Naqib Ibnul:机构信息未在 arXiv HTML 中可靠披露
  • Htoo Htet Aung:机构信息未在 arXiv HTML 中可靠披露
  • Henry Zhong:机构信息未在 arXiv HTML 中可靠披露
  • Gregory Cohen:机构信息未在 arXiv HTML 中可靠披露
  • Ying Xu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

水下舰船分类需从被动声学输入预测舰船类别,难点在于信道多变与同录音片段泄露会虚高精度并误导部署选型。该工作先将音频切分为固定时长片段并生成多种时频与耳蜗表示,再沿时间维做均值与标准差统计池化以压缩可变长信息,接着用紧凑卷积或经典分类器完成类别判定,最后以录音级划分与梯度类激活映射 Grad-CAM 回看频带依据。与单纯堆大模型的路线不同,该方法把性能来源放在表示选择与严格划分上,强调小模型加对的表示即可保持判别力。表示内部先压缩时域冗余再保留频带结构,使小参数量模型仍能利用类别相关的低频与中频线索。在DeepShip录音级评测协议下,四层紧凑卷积的验证集宏F1为0.6519,高于ResNet18的验证集宏F1 0.6110。结论仅适用于已评测的四类舰船与短片段条件,跨海域与跨设备外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留哪些可核对信息?

本文解读的对象是水下舰船被动声学分类,输入是水听器等平台收到的连续水下声音,目标是判断当前片段来自哪类船只。论文使用两个公开数据集做载体,ShipsEar 约 3.1 小时、90 个录音会话、11 种船型,常被归为 5 类,采样后统一到 16 kHz 处理。

DeepShip 包含 265 艘船、4 类即 Cargo、Passenger、Tanker 和 Tug,共 609 个可读录音、约 47.2 小时。解读必须保留的信息有 3 类,第一是表示与模型如何搭配,第二是划分是否按录音隔离,第三是每个数字对应的数据集、模型、阶段、指标与聚合对象。

本文输出按学习依赖展开,先讲任务与路线,再讲表示全景与组件计算,再讲训练与划分,最后讲结果、反证与复现。凡是教学举例会明确标为例子,不把例子当作论文报告的数值。

资源状态方面,本次没有发现来源绑定且完成验证的资源,因此不声称代码、模型或数据已公开或可用。初学者应把本文读作方法与评估的复述,而不是部署性能的保证。

已有路线在比什么,为什么本文不先把模型做大?

已有工作大致沿两条路线推进,一条是换表示,例如短时傅里叶变换、梅尔谱、梅尔频率倒谱系数、恒 Q 变换、低频分析记录谱,以及耳蜗启发的表示。另一条是换分类器容量,例如可分离卷积自编码器、移动视觉变换器、双分支卷积变换器、大残差网络与多头序列模型。

论文把部署约束放在前面,自主水下滑翔机与剖面仪的功耗、算力与通信都受限,因此作者选择先研究表示工程,而不是先增加模型容量。论文引用的上下文包括 DeepShip 原始研究用恒 Q 变换加可分离卷积自编码器报告 77.53% 准确率,移动视觉变换器在低频受限表示上报告 98.50% 准确率。

以及明确做录音分离的 ShipsEar 研究中残差网络准确率只有 63.96%、序列多头方法为 70.31%。这些数字的划分、切分与指标各不相同,论文明确要求不把它们当作同条件排名。

理解这一点很重要,否则会误以为参数多的模型一定更好。表示路线关心的是让小模型看到更对的谱结构,容量路线关心的是让大模型记住更多细节,本文优先验证前者。

为什么近满分反而让作者怀疑评估本身?

作者在 ShipsEar 现成划分上先得到很高的分数,双层卷积在短时傅里叶变换上达到 99.10% 准确率,宏 F1 为 0.9918。按常理这似乎说明问题已解决,但作者提出一个可验证的担忧。

现成分发的 ShipsEar 是 1778 个训练片段与 445 个测试片段的 5 秒预切分,没有保留足够的源录音标识,无法验证来自同一原始录音的片段是否只出现在一个集合中。如果同一录音的邻近片段同时出现在训练与测试,模型可能记住该次录音特有的发动机转速、信道、海况与背景噪声。

此时测试分数衡量的是同一录音内的插值,而不是对未见录音的泛化。于是论文把 ShipsEar 定位为诊断性基准,把能按录音隔离的 DeepShip 作为主要评估。

教学例子:假设同一艘货船的 1 次出航被切成 100 段,50 段进训练、50 段进测试,模型记住该次海况即可得高分,但换 1 次出航就可能失效。这个例子只用于解释泄漏机制,不是论文的实测数值。

方法全景:一个样本走完输入到输出需要哪几步?

沿一个 5 秒音频样本走一遍流程最清楚,第一步是重采样与切分,主要实验把 DeepShip 统一到 16 kHz 并切成无重叠 5 秒段。第二步是时频表示,把 1 维波形变成 2 维时频图,可选短时傅里叶变换、梅尔谱、倒谱系数、恒 Q 变换与耳蜗表示。

得到 26933 个训练段、3266 个验证段和 3457 个测试段,单独的残差网络复现分支沿用 3 秒、32 kHz 的已发表协议。这是另一条分支,不与主分支混淆,初学者复现时必须先确认自己走的是哪条分支。

第三步是分类,经典分类器先做时间统计池化再接逻辑回归或径向基核支持向量机,紧凑卷积则先做卷积特征提取再做统计池化后分类。第四步是选择与评估,用验证集宏 F1 做模型选择与早停,测试集只做最后 1 次评估。

解释方法放在最后,用梯度类激活映射回看紧凑卷积在正确预测时依赖哪些频率。整个设计的特点是表示多样、分类器小、评估严格,容量增加只作为对照。

表示全景:六种时频图到底在看什么不同?

白话先讲术语,短时傅里叶变换就是把信号加窗后逐窗做傅里叶变换,得到时间乘频率的能量图,英文为 Short-Time Fourier Transform,缩写为 STFT。梅尔谱就是在它的能量上按梅尔刻度合并频率通道,更重视低频。

梅尔频率倒谱系数是对梅尔对数能量再做离散余弦变换,得到更紧凑但可视性较弱的系数,缩写为 MFCC。恒 Q 变换是让频率轴按对数分布、品质因数保持恒定,对低频分辨率更高,缩写为 CQT。

Gammatone 滤波器组是一组模拟耳蜗的带通滤波器,CARFAC 是级联非对称谐振器加快速压缩的耳蜗模型,输出包括基底膜响应、内毛细胞响应与侧抑制。论文对同一段 ShipsEar 音频生成这些表示并放在同一张大图中,便于初学者直观比较。

该图把同一段 5 秒渔船拖网船类波形与其多种表示并置,横轴都是时间,纵轴分别是频率或系数序号,右侧色标为相对幅度分贝,标题注明类别 A 与 16 kHz 条件,适合作为表示差异的第一手观察。

短时傅里叶变换 × 梅尔谱: 短时傅里叶变换负责把波形按短窗切分并给出线性频率上的能量分布,保留原始谱细节但维度高且对感知非均匀性不敏感;梅尔谱负责在短时傅里叶变换能量上再做梅尔滤波器组加权,把频率轴按人耳对低频更敏感的方式压缩合并。两者搭配的理由是前者提供可复现的基准细节,后者用更少的通道突出船舶低频线谱与宽带包络,组合意义是让同一紧凑分类器在不增加参数的情况下比较线性细节与感知压缩哪种更利于录音级泛化。

时间统计池化 × 卷积神经网络: 时间统计池化负责把每个频率或滤波通道沿时间轴算均值和标准差并拼接成定长向量,丢掉精确时刻但保留该频带有多强和多不稳定;卷积神经网络负责先在 2 维时频图上学局部谱纹理再交给分类层。搭配理由是 5 秒片段的时频矩阵太大,直接展平会让分类器输入维度爆炸且容易记住某次录音的偶发事件,统计池化先把时间维度压缩,组合意义是用很小的输入维度保留可部署的判别信息,论文中它同时用于经典分类器和卷积特征图之后。

CARFAC × Gammatone 滤波器组: Gammatone 滤波器组负责用一组带宽随中心频率变化的线性滤波器模拟耳蜗频率分解,给出相对稳定的多通道包络;CARFAC 负责在类似级联谐振之外再加入快作用压缩与后级处理,并输出基底膜响应、内毛细胞响应和侧抑制输出 3 种形态。搭配理由是前者是计算简单、可解释的听觉基线,后者引入非线性压缩和侧向对比以增强弱线谱与瞬态,组合意义是在同一紧凑模型下检验增加听觉非线性是否值得,而不是直接把模型做大。

看图路径: 1. 先看左上波形面板的时间轴与归一化幅度,确认这是 5 秒 16 kHz 的同一段输入;2. 再横向比较 STFT 与 Mel 与 CQT 与 Gammatone 四块时频图的低频横纹与 3 秒附近垂向瞬态是否同时出现;3. 观察 MFCC 面板纵轴变为倒谱系数后纹理明显变淡,思考为何它丢失了可视线谱;4. 最后比较 CARFAC 基底膜与内毛细胞两块在低频段的亮度与对比度差异

原论文 Figure 1:Example ShipsEar waveform and corresponding conventional and auditory-inspired acoustic…

论文图 1。原论文 Figure 1::“Example ShipsEar waveform and corresponding conventional and auditory-inspired acoustic representations used in this study.”。

从像素可见,左上波形杂乱且包络起伏大,直接看波形难以区分船型。右上 STFT 在低频有多条近水平亮纹,中高频为斑块状背景,3 秒附近有一条垂向瞬态。

Mel 谱把高频压缩后低频亮带更集中,同一瞬态依然可见,CQT 在 50 赫兹到数千赫兹呈现更细的对数频率纹理。Gammatone 与 CARFAC 两块整体更亮,横纹连续性更强,说明耳蜗滤波保留了包络起伏。

MFCC 面板明显不同,纵轴为系数序号,大部分区域对比度很低,只有底部少数系数有结构,这对应倒谱压缩丢掉了可视线谱。教学上可以这样复述:同一段声音,STFT 保留细节,Mel 与 CQT 做频率重排,听觉表示做平滑与压缩,MFCC 最紧凑但最不直观。

模型如何训练,选择标准与更新方式是什么?

训练过程按模型类型分开理解,经典分类器没有反向传播训练卷积核,它的计算是先对时频图做均值加标准差池化。再用逻辑回归或径向基核支持向量机拟合,以 128 通道 STFT 为例,每个通道算一个均值和一个标准差。

拼接后为 256 维向量,直接作为分类器输入,论文还把该分类器部署到树莓派并配了选文件与预测的轻量界面。作为嵌入式推理的概念验证,但未报告延迟与功耗实测,不能当作部署基准。

紧凑卷积的训练使用 AdamW 优化器与类别加权交叉熵损失,用验证集宏 F1 做模型选择与早停。ShipsEar 用双层卷积,DeepShip 主体用 4 层 TinyVGG 风格卷积,通道数为 32、32、64、64。

卷积核分别为 5 乘 15、9 乘 9、3 乘 3、3 乘 3,在第二和第四卷积阶段后接 2 乘 2 最大池化,再对学到的特征图做统计池化后分类。浅层补丁变换器把 2 维表示切成局部块并投影为词元,再过轻量变换器编码器分类,作为非卷积对照。

大容量对照为标准 ResNet18,论文未给出学习率、权重衰减、批量大小与早停容忍轮数等完整超参数。这是复现时需要补记的缺项,不能从模型名称推定实现,初学者应把缺项记入实验记录表。

划分、指标与基线如何保证比较公平?

实验条件是理解本文的关键,ShipsEar 使用现成固定划分,1778 训练段与 445 测试段,均为 5 秒片段。但源录音标识不足,无法验证录音级隔离,DeepShip 主实验先按源录音分配到训练、验证、测试。

再做无重叠 5 秒切分,得到 26933、3266 和 3457 段,最终清单中训练、验证、测试之间没有源录音重叠。单独的 ResNet18 复现沿用 3 秒、32 kHz、80 比 20 录音级划分、128 维梅尔、2048 点傅里叶变换与 80 轮配置。

未在原文中说明的实现细节被当作复现假设处理,指标以宏 F1 为主,准确率为辅,验证宏 F1 用于选模型与早停。测试集只做最终评估,避免用测试集反复挑模型导致的乐观偏差。

录音级划分 × 片段级划分: 片段级划分负责先把长录音切成多个 5 秒小段再随机分到训练、验证和测试集,同一条原始录音的邻近片段可能同时出现在两边;录音级划分负责先按原始录音来源把录音分到不同集合,切分之后也不允许同一来源跨集合。搭配比较的理由是前者在 ShipsEar 现成分发中无法验证是否隔离,后者是 DeepShip 中作者可控的严格协议,组合意义是揭示分数里有多少来自记住同一录音的信道与背景,而不是真正认出船型。

宏 F1 × 准确率: 准确率负责统计所有测试片段中猜对的总体比例,对数量多的类别更敏感;宏 F1 负责先在每个船型类别上算精确率与召回率的调和平均,再对类别取平均,让小类与大类权重相同。搭配理由是水下数据集中 Cargo、Passenger、Tanker、Tug 等类别的片段数不均衡,只看准确率会掩盖小类失效,组合意义是论文把宏 F1 作为模型选择与早停的主指标,准确率只作为辅助报告,避免用总体猜对率夸大部署效果。

基线分为 3 类,第一类是同表示下的经典分类器,用验证宏 F1 选择逻辑回归或支持向量机配置。第二类是同协议下的不同表示,比较 STFT、Mel、MFCC、CQT 与耳蜗表示,第 3 类是跨容量的 ResNet18 对照。

以及引用但划分不同的已发表结果,后者只作背景,不作直接排名。硬件方面,论文提到受限的 8 GB 开发系统上支持向量机训练不到 2 分钟,而对应卷积实验约需 4.5 小时。这说明经典模型适合快速迭代,但该时间是在特定受限系统上的记录,不等同于通用训练成本。

时间池化与诊断满分说明了什么,又没说明什么?

要回答的比较问题是:在同一 STFT 输入下,加时间统计池化能否用更小维度得到更好测试宏 F1。公平条件是同一 ShipsEar 现成划分与同一 STFT 表示,只改变是否沿时间求均值加标准差。

指标方向是测试宏 F1 越高越好,同时观察输入维度和参数量,该比较直接检验池化是否值得作为默认压缩步骤。

ModelPoolingInput dim.ParamsTest F1
RBF-SVMNone60,800–0.9641
RBF-SVMMean+std256–0.9883
2-layer CNNNone302,0801.668M0.8987
2-layer CNNMean+std5,120183K0.9698

上表显示,不池化时支持向量机输入为 60800 维,测试 F1 为 0.9641,加均值加标准差后输入降为 256 维,测试 F1 升为 0.9883。双层卷积也有同样趋势,不池化输入 302080 维、参数 1.668M、测试 F1 为 0.8987,加池化后输入 5120 维、参数 183K、测试 F1 为 0.9698。

这支持一个判断:在该诊断划分上,时间池化同时降低维度与参数并提升分数。但限制必须讲清,这是 ShipsEar 现成划分上的结果,不能推广为未见录音一定更好。因为该划分未验证录音隔离,且历史探索性调参也用了该划分做配置与轮数选择。

未胜出项是无池化双层卷积,它参数最多但分数最低,说明直接展平大时频图既贵又容易过拟合到片段细节。第二个比较问题是 ShipsEar 诊断基准上紧凑模型与稍复杂模型的排序如何,公平条件仍是同一现成 5 秒划分。

指标为准确率与宏 F1,紧凑策略包括 STFT 双层卷积与池化支持向量机,稍复杂对照为 STFT 补丁变换器,文献背景因划分不同只作参照而不参与排名。

条件指标紧凑可运行策略稍复杂对照文献背景不直接排名
ShipsEar 现成 5 秒划分准确率与宏 F1STFT 双层卷积 0.9910 与 0.9918STFT 补丁变换器 0.9708 与 0.9711低频受限移动视觉变换器 0.9850
ShipsEar 现成 5 秒划分准确率与宏 F1STFT 支持向量机 0.9888 与 0.9883补丁变换器 303621 参数双分支卷积变换器 0.9819

上表数字来自论文连续原句报告,紧凑双层卷积与池化支持向量机接近满分,补丁变换器参数更多但分数更低。这支持在该划分上增加结构复杂度没有带来收益,但同样受录音泄漏质疑限制。

论文因此不把 ShipsEar 作为泛化证据,只作为诊断基准。图 2 进一步从机制上补充表示为何有判别结构,导读如下:该图是对 DeepShip 测试集正确预测按类别平均后的频率相关性曲线,横轴为对数频率,纵轴为平均归一化相关性。

看图路径: 1. 先确认横轴为对数频率纵轴为平均归一化相关性,再区分四条类别曲线的颜色图例;2. 观察 Passenger 在 10 赫兹附近的尖峰高度与其他三类在该处的取值差距;3. 比较 Tug 在 100 赫兹附近的峰与 Tanker 的宽平轮廓,确认模型依赖频段并不相同

原论文 Figure 2:Class-wise mean normalized Grad-CAM relevance as a function of frequency for correct DeepShip test…

论文图 2。原论文 Figure 2::“Class-wise mean normalized Grad-CAM relevance as a function of frequency for correct DeepShip test predictions using the four-layer STFT CNN.”。

从像素可见,橙色 Passenger 在 10 赫兹附近形成超过 0.8 的尖峰,远高于其他类别,红色 Tug 在 100 赫兹附近形成约 0.5 的峰。绿色 Tanker 整体低平宽缓,蓝色 Cargo 几乎贴零,只有 1000 赫兹附近有微弱凸起。

这显示紧凑 STFT 卷积对不同船型依赖不同频段,而不是用同一模板猜所有类别。但需注意这是正确预测的平均,不能说明错误样本的失败原因,也不能推出某频段是因果特征。

换表示与加容量,谁真正改变录音级泛化?

要回答的核心问题是:在录音级隔离的 DeepShip 上,表示选择与模型容量分别带来什么变化。公平条件是同一 5 秒、16 kHz、录音级划分主协议,模型选择用验证宏 F1,测试集只评估 1 次。

指标方向是验证与测试宏 F1 越高越好,同时记录参数量,该设置保证比较的是未见录音上的泛化而非同录音记忆。

条件指标紧凑 4 层卷积可运行策略经典分类器可运行策略大容量对照
DeepShip 录音级 5 秒协议验证宏 F1 与测试宏 F1Mel 验证 0.6519 测试 0.7226STFT 支持向量机验证 0.6266 测试 0.6871ResNet18 验证 0.6110 低于紧凑 Mel 的 0.6519
DeepShip 录音级 5 秒协议参数量与观测范围紧凑卷积约 157K 测试范围 0.6336 到 0.7226CQT 支持向量机测试 0.7027 验证 0.5830ResNet18 约 11.17M 约 71 倍参数

上表综合论文直接报告:紧凑 4 层卷积测试宏 F1 在 0.6336 到 0.7226 之间,基底膜验证最高为 0.6766,Mel 测试观测值为 0.7226。论文特别提醒,不能因为 Mel 测试最高就事后选 Mel 为最佳表示。

因为选择必须基于验证集,测试高分只是留出集上的观测结果,基底膜验证 0.6766 测试 0.6694 的落差正好说明验证与测试排序可能不一致。代价与反例很清楚:约 71 倍参数的 ResNet18 在匹配协议上验证为 0.6110,低于紧凑 Mel 卷积的 0.6519。

说明单纯加容量没有解决泛化困难,经典分类器也呈现类似中等水平,CQT 支持向量机测试可达 0.7027,但验证只有 0.5830。表明表示与正则配置的波动很大,不能只看测试最优就宣布某种表示最好。

五折分组交叉验证进一步显示 Mel 支持向量机片段级验证宏 F1 均值为 0.6200,录音级聚合后为 0.6974。训练与验证平均差距为 0.3196,说明困难来自未见录音本身,而非某 1 次划分偶然。

哪些结论有边界,哪些验证还没有做?

论文的限定写得比较明确,第一,ShipsEar 近满分不能解释为录音无关泛化。因为源录音溯源无法重建,且历史调参用了该划分做选择,因此只能作为诊断基准。

第二,DeepShip 录音级结果更温和,紧凑模型测试宏 F1 最高观测为 0.7226,但验证选出的基底膜测试只有 0.6694。说明验证与测试之间存在表示排序不一致,直接报告测试最优会夸大可部署收益。

第三,ResNet18 复现分支在 3 秒协议上训练准确率达 99.47%,但留出准确率仅 62.13%、宏 F1 为 0.6192。远低于文献报告的 95.13%,论文将其视为诊断而非无偏测试估计,因为实现与划分细节不全。

且训练停止时参考了留出性能,不能当作独立测试。第四,Grad-CAM 只分析正确预测的平均频率相关性,未测量误判率、延迟、功耗与实际推理帧率。

因此不能承诺这些量得到改善,树莓派部署只说明选文件与预测的轻量界面跑通,属于概念验证。没有给出可复现的延迟与内存预算,这些缺失不是技术错误,但初学者不应把趋势外推为每组表示都成立。

要复现这篇工作,先做什么才能不踩划分的坑?

复现的第一步是先重建划分,而不是先调模型。对 DeepShip,必须先按源录音标识把 609 个可读录音分到训练、验证、测试。再做 5 秒无重叠切分,并用脚本断言同一源录音不跨集合,同时记录 26933、3266、34573 段数量是否一致。

对 ShipsEar,只能复现 1778 与 445 的现成划分,并明确标注无法验证录音隔离。不应把它的分数当作泛化指标,否则后续所有表示比较都会建立在泄漏之上。

第二步是固定表示管线,STFT、Mel、MFCC、CQT、Gammatone 与 CARFAC 三输出要分别保存参数。统计池化要明确是均值加标准差拼接,避免把不同池化混为一谈,表示参数不同会导致维度与纹理完全不同。

第三步是固定选择规则,所有超参数与早停都只看验证宏 F1,测试集只跑 1 次。经典分类器的 C 值也要按验证选择,不能事后用测试最优覆盖验证选择,这是本文反复强调的方法纪律。

第四步是先跑支持向量机与逻辑回归快速验证管线是否漏泄漏,再跑紧凑 4 层卷积。因为前者在受限系统上只需分钟级,需要补的验证包括报告类别级精确率与召回率。

以及给出分组交叉验证的录音级聚合细节,补充推理延迟、内存与功耗的实测。资源方面,本次未获得可验证的代码与权重链接,因此复现应按论文文字重写管线,不假设官方实现可用。

何时值得尝试这种表示优先的小模型路线?

综合来看,当部署平台算力与功耗受限,且水下声音的判别信息集中在低频线谱与包络起伏时。值得先尝试表示工程加统计池化加紧凑卷积的路线,它的好处是参数少、迭代快。

经典模型可用于快速排查管线,紧凑卷积在严格录音级评估下仍保留中等判别力,且 Grad-CAM 显示不同船型依赖不同频段。当数据存在同一录音多片段复用风险时,更要先做录音级划分,否则高分可能是记住信道。

不值得尝试的情形是希望靠单纯增大残差网络容量解决泛化问题,本文证据显示 11.17M 参数并未超过约 157K 参数的紧凑模型。也不应把 ShipsEar 诊断满分直接当作上船依据,诊断满分与部署泛化是两个不同的问题。

初学者可复述的方法链是:16 kHz 切 5 秒无重叠段,按录音隔离划分,生成多种时频与耳蜗表示。时间池化压缩,紧凑卷积分类,验证宏 F1 选模型,测试集 1 次性评估,最后用正确预测的频率相关性检查模型是否用了类别相关的谱证据。

📎 论文与评分元数据

排名:前50% | 文档类型:应用研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-25 语音/音乐/音频论文速递