英文题目:Improving streaming ASR with foundation models using emission policies

会议身份:conference:interspeech:2026:conference-paper-id:masmolla26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #语音大模型 #流式处理 #语音识别

评分:6.0/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Gerard Mas Mollà:机构信息未能从会议 PDF 纯文本可靠映射
  • Albert Sanchis:机构信息未能从会议 PDF 纯文本可靠映射
  • Alfons Juan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

离线语音基础模型(Speech Foundation Model,SFM)在流式自动语音识别(Automatic Speech Recognition,ASR)中因上下文受限而退化,如何在不读取模型内部张量、不训练的前提下实现低延迟高精度转写是本文任务。方法链分三步衔接:滑动音频缓冲(Sliding Audio Buffer)先按固定切块长度 $L_c$ 累积音频,达到最大窗口 $L_{max}$ 后维持固定长度滑动窗口并送入黑盒模型得到词级转写与时间戳;基于时间戳的去重模块(Repetition Control)以已提交词的最后时间戳 $T_{last}$ 为界过滤重叠历史词,保证时间单调推进;发射策略(Emission Policy)模块再对候选缓冲决定延迟发射以抑制闪烁(Flickering)并输出稳定文本。与依赖注意力或对齐头的模型感知策略不同,本文仅用文本与时间戳做判决,因而可跨架构复用且无需训练。在 Earnings22 上 Parakeet-v3 流式基线词错率(Word Error Rate,WER)为 25.35%,LocalAgreement(LA)策略将其降至 11.45%且延迟约 2.25 秒,接近同模型 11.19%的离线水平;TedLium-v3 从 17.16%降至 3.00%,VoxPopuli 从 10.24%降至 6.40%。该结论目前仅在三套英文朗读与会议类数据上验证,未覆盖噪声、重叠语音、多语及长尾口音的外推情形。原文未披露训练成本,推理仅说明在 NVIDIA RTX 4090加 Intel Core 10920X 节点上评测。

🔗 开源与复现资源

🧭 深度解读

输入是什么,要输出什么,为什么直接切块会变差?

论文研究的输入是连续到达的英语语音流,目标是在说话还在继续时就逐段给出文字,而不是等整句或整篇结束后再转写。输出是随时间追加的文本流,要求既准又稳:准指与离线转写接近,稳指已经显示给用户的词不频繁被改写。初学者容易把流式理解为把长音频切成小块分别识别再拼接,但语音基础模型在离线训练时习惯看到完整上下文,切块后每块缺失右侧未来信息和部分左侧历史,声学边界被截断,语言模型也失去长程约束,因此词错误率会明显上升。论文首先确认了这种退化,然后提出不改模型权重的外部管线来弥补。

论文使用的基础模型是英伟达的 Parakeet-tdt-0.6b-v3 和 Canary-1b-v2,简称 Parakeet-v3 和 Canary-v2。术语首次出现需要白话铺垫:语音基础模型指在大规模多任务多语数据上预训练、能直接做识别的大模型,流式识别指音频边到边播、文字边解边出的工作方式。后文固定用这两个简称。论文强调管线是模型无关且免训练的黑盒方式,唯一要求是模型能给出词级时间戳,用时间戳判断哪些词是重叠窗口带来的重复。

语音基础模型 × 流式识别: 语音基础模型负责提供在大规模数据上学到的通用声学与语言表示,流式识别负责在音频边到边播时就逐块给出文字;前者分工是保证单次识别质量,后者分工是约束输出时机,两者搭配的原因是离线模型 1 次看全句而流式只能看局部,组合意义是用外部缓冲和发射控制弥补上下文缺失而不改模型内部。

本解读的输入是论文正文与官方原图像素,目标是让研究生能核对并复述方法。必须保留的信息包括滑动窗口的尺寸定义、去重依据、4 种发射策略的放行条件、实验数据集与延迟统计方式。输出是一套按学习依赖展开的说明:先讲任务与相关路线,再讲管线全景与组件计算,然后讲无训练的推理过程、实验条件、结果与反例,最后讲复现要点。凡是教学举例会明确标为例子,不虚构数值。

同样做流式,内部改模型与外部控发射有何不同?

流式语音识别有一条直接路线是块解码:把语音按固定长度块顺序处理,每块再拼一点过去和未来音频以补充上下文。论文提到这类做法本身有效,但要进一步做好往往引入专用机制,例如连续积分发放、单调块注意力或对齐注意力引导何时输出。这些方法需要读取模型的注意力头或内部状态,属于模型相关的实现,换一个架构就要重写。

另一条路线是本文选择的外部发射控制:把模型当黑盒,只看它输出的文字和时间戳,用外部缓冲与策略决定何时提交。相关工作中的 Wait-K 来自同步机器翻译,指固定等待若干输入单位再按固定节奏输出;Hold-N 指扣留假设末尾若干词,只提交被后续词顶出缓冲区的稳定部分;LocalAgreement 指比较相邻 2 次假设的最长公共前缀,只放行连续 2 次一致的词。论文的增量是系统比较这些纯文本策略,并提出基于编辑距离放宽的 LocalAgreement-Levenshtein。

与同时期利用语音基础模型内部特征引导解码的工作相比,本文刻意不用内部张量。代价是决策信息较少,好处是可迁移到任何能产生时间对齐转写的模型。论文还与开源的 SimulStreaming Whisper 对比,后者使用模型感知的对齐注意力策略,能做更知情的放行,因此延迟更低,但需要特定架构支持。这构成后文公平比较的基线:一方是通用黑盒,一方是专用白盒。

要解决的矛盾是什么,成功标准如何定义?

中心矛盾是离线大模型质量高但不能等全文,流式切块延迟低但质量掉得太多。论文把成功标准定为在可接受的流式延迟下恢复到接近离线转写质量,且不重新训练模型、不读取内部张量。延迟不是理论块长,而是用户感知延迟,论文按外部对齐方式统计每个词的输出滞后并报告均值与标准差。准确性用词错误率衡量,文本先去除大小写和标点再计算,遵循开放语音识别榜单的归一化。

举例说明:假设一句话很长,离线模型 1 次看到整句能正确断句,流式若每次只看 1 秒就可能把边界词切错。论文要回答的是多看一点历史能否补回损失,以及多等一会儿再提交能否避免把不成熟的假设过早显示。为此它固定了两个可调旋钮:音频侧的窗口长度与块长,文本侧的发射策略参数。所有结论都围绕这两个旋钮的权衡展开,而不是宣称某种策略在一切条件下最优。

三模块管线如何串起音频到稳定文字?

论文管线由 3 个模块串联。第一步是滑动音频缓冲负责增量吃入音频,第二步是基于时间戳的重复控制负责滤掉重叠带来的旧词,第 3 步是发射策略负责决定候选词何时真正显示。沿一个样本走一遍:新到的 1 秒或 2 秒音频块被加入缓冲,缓冲达到最大窗口长度后保持定长滑动,模型每次重译整个窗口得到词与时间戳,去重模块丢弃时间戳早于已提交词的旧词,剩余候选进入输出缓冲,发射策略只放行稳定部分,其余暂留待下一轮再验证。

下图是论文给出的 LocalAgreement 示例,值得沿箭头细读。它把音频、模型、去重条带、相邻两步假设比较和最终输出画在同一张图里,正好对应上述 3 步。

看图路径: 1. 沿左上音频缓冲到右上识别模型的箭头确认主数据流向;2. 观察中间重复控制条带中斜线划掉与保留部分的划分依据;3. 对比右下相邻两步假设中公共前缀与被扣留词的变化;4. 跟踪左下输出文本如何只追加已稳定的公共部分

原论文 Figure 1:Streaming ASR pipeline using LocalAgreement policy.

论文图 1。原论文 Figure 1:“Streaming ASR pipeline using LocalAgreement policy.”。

从像素可见,左上是随时间推进的音频缓冲,黑色竖条表示当前窗口内的波形,左侧灰色虚线块表示被滑出窗口的旧块,下方标注块长与最大窗口长度。右上是标有雪花符号的识别模型,表示推理时参数冻结。模型下方是一条候选文本带,前半段被斜线划掉表示因时间戳早于已提交时刻而被过滤,后半段保留进入右下发射策略框。框内上下两行分别标为相邻两步假设,只有两步都出现的词才被确认为公共前缀并向左输出,最终追加到左下输出文本末尾。该图 teaching 点在于重叠解码必然重译,稳定输出必然只取共识,延迟正来自这一步等待。

滑动窗口与时间戳去重各自算什么?

滑动窗口的计算很具体。设块长为 Lc,最大窗口长度为 Lmax,解码步为 t,则当前输入可理解为从 t 乘 Lc 减 Lmax 到 t 乘 Lc 的音频段。流的开头缓冲是累积增长的,直到填满 Lmax,之后每进一块就推出最老的一块,保持定长。论文指出解码器通常比编码器轻,因此每步重译整个窗口不会带来显著计算负担。这是选择大窗口补上下文的工程依据:用重复计算换质量,而不是改模型结构。

时间戳去重的计算依赖状态变量 Tlast,即上一步已提交词序列中最后一个词的时间戳。每步模型返回词与时间戳后,系统丢弃所有时间戳早于 Tlast 的词,只保留新推进部分,从而保证转写单调前进。没有这一步,重叠窗口会在每步重复输出同一段历史,输出文本会膨胀且无法评价延迟。论文明确该机制同时防止重复文本在重叠设置下被重复发射。

滑动音频窗口 × 时间戳去重: 滑动音频窗口负责每次把最新音频块和一段历史拼成固定长度输入,让模型总能看到过去上下文,时间戳去重负责用词级时间戳丢弃已提交时刻之前重复解码出的词;前者分工是补上下文,后者分工是保单调递增,搭配原因是窗口必然带来重叠,重叠必然带来重复输出,组合后才能在反复重译整个窗口的同时只向前推进新词。

四种发射策略何时放行,何时代价显现?

发射策略工作在已去重的候选上。Wait-K 是固定延迟策略,要求多等 K 秒或 K 块再按固定节奏放行,实现简单但不看语音难易,对所有位置施加均匀延迟。Hold-N 是稳定缓冲策略,扣留假设末尾 N 个词,只提交被后续词顶出缓冲区的部分,同样引入与 N 成正比的固定延迟。两者都属于静态策略,调大 K 或 N 会单调改善词错误率但增大延迟。

LocalAgreement 是动态策略,比较最近 2 次假设并取最长公共前缀,只放行两步一致的部分。高置信词很快达成一致而被快速放行,模糊段因两步改口而被自然推迟。论文按已有发现只比较最近两步。LocalAgreement-Levenshtein 放宽了严格逐词相同的要求,计算两步假设的编辑距离,若低于阈值就放行,用阈值控制宽松程度。阈值越大越不激进,延迟越低但可能放过不稳定词。

闪烁效应 × 发射策略: 闪烁效应指重叠解码时同一音频区随新上下文到来被反复改写、用户看到尾部文字跳变,发射策略负责决定候选词何时真正提交为输出;前者是需要抑制的现象,后者是抑制手段,搭配原因是不能靠模型内部置信度,只能靠文本层面的延迟或一致性检查,组合意义是以可控延迟换取用户可见文本的稳定。

论文强调这些策略只用输出文本,不用内部张量,因此是黑盒可迁移的。理解时不要把等待等同于音频未来上下文:音频窗口提供的是过去上下文,发射等待提供的是让模型用更多后续音频修正假设的机会。两者的延迟来源不同,前者是块累积,后者是文本确认。

静态策略 × 动态策略: 静态策略指 Wait-K 与 Hold-N 这类固定延迟或固定保留词数的规则,动态策略指 LocalAgreement 这类比较相邻 2 次假设一致性再放行的规则;前者分工是实现简单且延迟可预测,后者分工是按模型自身是否改口来自适应等待,搭配比较的原因是二者都只用文本而不用注意力等内部张量,组合意义是论文能在同一管线上系统比较固定代价与自适应门控的延迟精度权衡。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练任何神经网络,也没有微调 Parakeet-v3 或 Canary-v2。论文明确管线是免训练的,模型以黑盒方式调用,推理时参数冻结。需要如实指出缺项:原文未报告梯度路径、优化器、学习率或参数更新范围,因为不存在这些过程;也不能从模型名称推定其内部实现细节。把无训练等同于确定性求解是误解,模型前向仍是概率解码,只是本研究不改变权重。

真实计算是仿真流式推理。按算法描述循环推进:取滑动窗口音频送模型得词与时间戳,按 Tlast 过滤,再按策略放行并更新 Tlast 为本次放行序列最后一个词的时间戳,逐步产生输出。流结束后做 1 次尾部转写收尾。实验中的搜索是网格搜索窗口与策略参数,不是梯度训练。复现时应把重点放在推理环境、解码配置与时间戳解析上,而不是找训练脚本。

资源状态需要如实交代:论文正文给出代码链接,但本次核对该链接返回不可用,不能写已公开可用;2 个模型权重链接本次未能确认可达,只能写未能确认;第三方 NeMo 工具库链接当前可用。后续复现应优先用可达的 NeMo 基线与本地已下载权重起步。

在哪些数据与指标上测,如何保证条件可比?

论文在开放语音识别榜单的 3 套英语任务上评估:VoxPopuli 来自欧洲议会发言,风格正式结构化;TedLium-v3 来自 TED 演讲,专业但偏自发;Earnings22 来自全球公司财报电话会,口音与场景更野,用于考验鲁棒性。评估分 3 个阶段:先测音频缓冲的块长与窗口尺寸,再调发射策略参数,最后与离线基线、流式基线和 SimulStreaming Whisper 对比。硬件为单节点英伟达 RTX 4090 与英特尔酷睿 10920X。词错误率在去除大小写与标点后计算,延迟用外部隐马尔可夫对齐系统对输出转写做对齐后统计。

下表先回答数据规模问题:3 套任务的时长各是多少,这决定结果的可信覆盖面。比较条件是同一榜单归一化下的词错误率,指标方向为越低越好。

数据集任务类型时长评估文本归一化指标方向
VoxPopuli欧洲议会正式发言4.9 小时去除大小写和标点词错误率越低越好
TedLium-v3TED 演讲自发语音2.6 小时去除大小写和标点词错误率越低越好
Earnings22财报电话野外口音5.4 小时去除大小写和标点词错误率越低越好

表中时长数字来自原文任务表,文本归一化与指标方向来自方法描述。规模上 Earnings22 最长,TedLium 最短,因此 Earnings22 上的差距更值得重视。需要说明的边界是论文只做英语,未评测多语或中文场景;延迟统计依赖外部对齐工具链,不同工具链会带来系统差,跨论文直接比绝对延迟需谨慎。

最佳系统相对离线与流式基线恢复了多少,代价是什么?

核心比较问题是:在可接受的流式延迟下,黑盒管线能否把流式基线的大幅退化补回接近离线水平。公平条件是同一模型、同一数据集,离线基线复刻榜单数字,流式基线用 NeMo 自带块解码配置,窗口配置为左 20 秒块 1 秒右 1 秒。指标为词错误率越低越好,延迟为用户感知延迟均值加标准差,越低越好。

模型与策略Earnings22 词错误率与延迟TedLium-v3 词错误率与延迟VoxPopuli 词错误率与延迟相对流式基线变化
Parakeet-v3 离线11.19%2.8%6.09%准确性上限参考
Parakeet-v3 流式基线25.35% (0.80s ± 0.28)17.16% (0.82s ± 0.18)10.24% (0.77s ± 0.13)未加发射控制退化显著
Parakeet-v3 LocalAgreement11.45% (2.25s ± 1.10)3.00% (2.48s ± 0.90)6.40% (2.34s ± 0.70)大幅恢复接近离线
Parakeet-v3 Wait-2 秒11.71% (1.98s ± 0.79)3.27% (2.18s ± 0.57)6.60% (2.17s ± 0.51)延迟略低精度略降
Canary-v2 LocalAgreement-Lev 阈值 211.53% (2.05s ± 0.95)4.16% (2.44s ± 0.86)6.31% (2.24s ± 0.62)在两套上优于其离线

表后解释必须同时讲收益与代价。收益是 Parakeet-v3 加 LocalAgreement 在 3 套数据上把流式基线的 20% 左右词错误率拉回 11.45%、3.00%、6.40%,与离线 11.19%、2.8%、6.09% 只差零点几个百分点;Canary-v2 加放宽版一致性策略甚至在 Earnings22 和 TedLium 上略优于自身离线基线,论文报告为 11.53% 对 11.79% 和 4.16% 对 4.29%。代价是延迟从 0.8 秒级升至 2 秒级,且标准差超过 0.6 秒,说明尾部波动大。未胜出项也要点名:Hold 策略在同表低延迟档精度明显更差,Parakeet-v3 加 Hold-8 在 TedLium 为 4.45%,Canary-v2 加 Hold-5 在 TedLium 为 6.06%,说明固定扣词在难例上不如一致性检查。

词错误率 × 延迟: 词错误率负责衡量转写与参考文本的不一致程度,延迟负责衡量词被确认输出相对其发声时刻的滞后;前者分工是刻画准确性,后者分工是刻画实时性,搭配原因是流式必须同时看两者,单看词错误率会掩盖为刷分而无限等待的做法,组合意义是论文所有结论都以两者配对数字呈现,不单独宣称某一侧改善。

窗口多大够用,策略参数如何取舍?

消融要回答两个操作问题:窗口长度与块长怎么选,发射参数怎么调。论文固定 Wait-K 为 2 秒,先扫窗口长度 10、20、30、40 秒与块长 1、2 秒。总体趋势是窗口越大词错误率越低,因为更多历史文本与声学上下文可用,但 20 秒已拿到主要收益,继续增大改善平坦。下图左右面板分别展示 2 模型在 3 数据集上的曲线,可据此核对上述拐点。

看图路径: 1. 先确认左右两面板分别对应哪个模型、纵轴是否为词错误率;2. 比较同色实线与虚线在相同窗口长度下哪条更低;3. 观察窗口长度从 10 秒增至 20 秒后曲线的下降幅度与后续平坦段

原论文 Figure 2:Effect of Lc and Lmax in terms of WER using the Wait-K policy with K = 2 seconds.

论文图 2。原论文 Figure 2:“Effect of Lc and Lmax in terms of WER using the Wait-K policy with K = 2 seconds.”。

从像素可见,左面板 Parakeet-v3 的 3 组曲线随窗口长度从 10 增至 20 秒均有可见下降,之后趋平;虚线块长 2 秒普遍低于实线块长 1 秒。右面板 Canary-v2 在块长 1 秒时 Earnings22 和 VoxPopuli 曲线几乎水平,说明增大窗口对其帮助有限,这是论文明确指出的例外。教学动作是先分颜色认数据集,再分线型认块长,最后只读 10 到 20 秒段的斜率,不要把 40 秒处的平坦误读为窗口无用。基于该结果,后续策略调参统一固定为块长 2 秒、窗口 20 秒。

策略参数的取舍如下图三面板所示,横轴分别为编辑距离阈值、等待秒数与扣留词数,纵轴均为词错误率。

看图路径: 1. 确认左中右三面板分别对应哪种策略参数横轴;2. 观察中间面板参数从 1 增至 2 时的陡降与之后平坦;3. 对比右面板随保留词数增大而持续下降的平滑趋势

原论文 Figure 3:WER against the parameter of each emission policy (K, N and τ).

论文图 3。原论文 Figure 3:“WER against the parameter of each emission policy (K, N and τ).”。

从像素可见,左面板阈值增大时词错误率轻微上扬,说明放宽一致性会牺牲精度换延迟,论文取阈值 2 为折中。中面板等待从 1 增至 2 秒时 3 数据集曲线陡降,之后再增大几乎水平,因此 Wait-2 秒被视为性价比拐点。右面板扣留词数从 0 增至 10 时曲线持续平滑下降,没有明显拐点,取值 4 到 8 需按最终延迟预算定。反证是静态策略越大越准但越慢,动态放宽版则反向权衡,选参必须同时报延迟,不能只看词错误率最低点。

哪些条件下结论不成立,还有什么没测?

首先是延迟口径的限制。论文延迟用外部对齐统计用户感知延迟,包含缓冲、重译与策略等待,不是模型前向耗时。总体趋势不等于每句都如此,标准差常达 0.5 到 1.1 秒,意味着长尾 utterances 可能明显更慢。未测量误判率、计算吞吐与显存占用随窗口增大的变化,因此不能承诺大窗口在端侧设备上同样划算。

其次是模型与数据覆盖的限制。只验证了两个英伟达模型与 3 套英语数据,未验证中文、多语混杂、强噪声或远场场景;Canary-v2 在块长 1 秒低延迟档未能达到 1.5 秒内目标,只有 Parakeet-v3 进入低延迟对比,说明结论与模型时间戳质量强相关。若某模型时间戳漂移,去重基准 Tlast 就会错位,这是黑盒方案的单点脆弱性。

最后是与白盒方案的边界。论文承认对齐注意力这类模型感知策略能做更知情的放行,因此 SimulStreaming Whisper 延迟更低。黑盒通用性是以约 0.4 秒额外延迟换来的,在极限低延迟场景可能不占优。相关性不等于因果:窗口大伴随精度高,但不能断言全因上下文,解码稳定性与语言模型约束同样起作用,论文未做因果分解。

要复现应先跑通什么,关键超参数如何设置?

复现先做三件事。第一是准备可运行的推理环境:安装可达的 NeMo 工具包,用本地已有 Parakeet-v3 与 Canary-v2 权重离线跑通整句识别,确认能输出词级时间戳。若拿不到论文自有脚本链接,不要等待,先用 NeMo 自带流式基线复刻退化现象,窗口按左 20 秒块 1 秒右 1 秒起步。第二是实现仿真流循环:按块长切分长音频,维护最大窗口定长滑动,每步重译全窗口并按 Tlast 过滤,再接策略放行。第三是统一评测:去除大小写与标点算词错误率,用同一外部对齐链统计延迟均值与标准差。

关键超参数按论文最优点起步:常规精度档用块长 2 秒、窗口 20 秒,策略三选一为 LocalAgreement 无参、放宽版阈值 2、Wait-2 秒;低延迟档改块长 1 秒、窗口 20 秒再测。低延迟对比问题是:能否在 1.5 秒内接近 SimulStreaming Whisper。下表给出可直接对照的数字,条件是 Parakeet-v3 低延迟配置。

系统Earnings22TedLium-v3VoxPopuli延迟含义
SimulStreaming Whisper14.92% (1.01s ± 0.27)4.11% (1.02s ± 0.15)10.26% (0.92s ± 0.23)白盒对齐策略延迟更低
Parakeet-v3 放宽版阈值 2 低延迟12.43% (1.27s ± 0.54)4.17% (1.44s ± 0.45)7.45% (1.27s ± 0.29)延迟略降精度略降

表后解释:收益是黑盒方案在 3 套数据上词错误率均优于白盒基线,尤其 Earnings22 领先约 2.8 个百分点;代价是延迟高约 0.3 到 0.4 秒且波动更大。复现时若延迟对不上,应先检查块长是否为 1 秒、是否误把窗口累积阶段计入稳态,并确认对齐工具与原文一致。不建议为凑延迟而删去不利基线,保留 SimulStreaming 才能看清通用性代价。

何时值得尝试这套黑盒方案,还需补哪项验证?

当手头已有能输出时间戳的离线大模型,又不允许改架构或重训,且业务能接受 2 秒左右延迟时,这套方案值得尝试。它把工程量集中在外部缓冲与文本策略,迁移到新模型只需适配时间戳解析。反之,若目标是 1 秒内极限延迟,或模型时间戳不可靠,则应优先考虑模型感知的白盒策略或流式专用训练。

复现与选型建议是先用 20 秒窗口与 2 秒块验证精度上限,再按延迟预算下调块长与放宽阈值,每次只动一个旋钮并成对报告词错误率与延迟。还需补的验证包括中文与噪声场景、端侧吞吐与显存随窗口的变化、长时间会议级音频的漂移,以及时间戳误差对去重的敏感性分析。只有补齐这些,才能把接近离线的结论从 3 套英语榜单推广到真实部署。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总