英文题目:Automatic pitch prediction from speech articulation: Where does the f0 information come from?

会议身份:conference:interspeech:2026:conference-paper-id:ozkan26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#CNN #发声与构音 #韵律 #静默语音接口

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Beliz Ozkan:机构信息未能从会议 PDF 纯文本可靠映射
  • Jonas Michael:机构信息未能从会议 PDF 纯文本可靠映射
  • Thomas Hueber:机构信息未能从会议 PDF 纯文本可靠映射
  • Olivier Perrotin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究处理从发音观测预测基频的矛盾任务,输入为超声舌图与唇图视频,输出为浊音段对数基频,难点在于源滤波器理论预言声门源与声道滤波独立而实证却部分可预测。方法链第一步用四层二维卷积编码器分别将超声舌图或唇图压缩为二百维嵌入并拼接为四百维双模态表示,第二步用一维卷积解码器融合一至十七帧时域上下文回归当前帧基频。第三步经连续小波变换重音分级与朗读或自发划分做假设检验,将词级相关与感知可接受率作为评价依据。与既有静默语音接口直接拟合全局轨迹不同,该工作将机制定位为局部韵律功能耦合而非声门泄漏,强调重音实现时的发音与基频协同具有实际意义。在TaL1语料自发语音测试条件下,L+T模型的全局相关性指标为0.39,低于朗读条件下全局相关性指标的0.70。结论仅适用于朗读训练与重音局部预测,未验证真正静默与跨语言外推,自发会话仍失效。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为何说基频不该被猜中?

这篇论文的输入是发音观测,目标是逐帧预测基频。输入包括超声舌图和唇部视频,前者用超声探头记录舌体截面运动,后者用光学图像记录唇形变化,采样后统一对齐到唇图每秒 60 帧的节拍。目标基频指声带振动的基频,用对数变换加按说话人做标准化处理,并在不发声段做线性插值,使回归目标连续可学。必须保留的信息是训练只用正常有声音语音的发音与音频配对,以便用音频提取的真值基频做监督,同时只保留发音图像作为预测输入。

矛盾来自源滤波器理论。白话说,发声好比吹哨加捏管,声源是声带振动决定的音高,滤波器是舌唇位置决定的音色,二者理论上独立。按此理论,只看捏管动作不该知道哨声多高。但静音语音接口文献报告用舌图能部分预测基频,例如用全连接网络达到约 0.74 的相关。论文因此不追求新方法,而是回头问信息从哪里来。

声源 × 滤波器: 声源指声带振动决定的基频 fo 与嗓音强弱,滤波器指舌唇运动构成的声道形状决定的共振特性,二者按源滤波器理论应相互独立,搭配讨论的理由是静音语音接口只观测到滤波器侧却报告能预测声源侧,组合意义在于判断预测成功是真的跨域信息还是局部韵律耦合造成的假象。

学习依赖上,先要理解静音接口的任务是把无声发音转成可懂语音,基频负责传达重音与语用功能。再理解 4 种假设分别对应输入模态、时序动态、过拟合与局部重音耦合。后续方法全景会沿一个样本走完图像到嵌入再到基频的路径,实验再逐项检验。本文资源状态为没有发现来源绑定且完成验证的资源,因此不得声称代码模型或数据已公开,只能按论文文字复述可重放的划分与超参数。

同输入同目标的前人走到了哪里?

同输入同目标的路线是用发音生物信号直接预测基频。论文回顾了表面肌电加全连接网络约 0.27 相关,超声舌图加时序上下文约 0.74 相关,卷积网络预测基频均方根误差 65 赫兹,以及电磁发音仪加核岭回归均方根误差 10.3 赫兹。这些工作输入不同但目标一致,都是在可发声数据上以声学基频为真值,比较发音预测与真值的接近程度。

同目标不同输入的路线是用声学倒谱预测基频。论文引用了用 16 个倒谱系数做线性回归达到 0.85 相关的工作,说明声学包络本身携带丰富的基频相关信息。这为后文的对照埋下伏笔,即把发音图像路径与倒谱路径放在同一解码器下比较。

同输入不同目标的路线是静音接口更常见的可懂度优化,例如把超声与唇图转成频谱或语音波形。这类工作不直接评价基频,但共享相同的编码器结构,例如 4 层 2 维卷积加全连接的视觉语音识别特征提取。论文沿用了该编码器家族,使复现更贴近已有实践。

区别在于本文不提出新的预测器,而是做假设检验。前人多在朗读孤立句上训练测试,可能学到规整语调模板。本文把自发语音专门留作测试,并按词级突显度分层,就是要区分通用映射与语料特有模板。

要回答的问题与四个可证伪假设是什么?

核心问题是为何能从发音手势部分预测基频。论文把它拆成 4 个假设。第一个假设说信息在输入模态中,因为训练用的可发声数据可能残留声源信息,例如舌骨随喉部运动在超声中可见。第二个假设说发音时序动态映射到基频变化,例如元音开与辅音闭交替带来的微韵律,扩大时序上下文应能提升预测。第三个假设说过拟合,即在朗读孤立句上训练测试学到的是固定语调模式,换到自发语音就会失效。第 4 个假设说局部重音耦合,即重音实现时基频抬升与发音增大同步出现,模型只在重音局部有效,累积起来显得整句不错。

每个假设都有对应的操作。第一个假设对应比较唇、舌、双模态与倒谱子带,并用注意力图检查是否看向舌骨。第二个假设对应 1 帧、3 帧、7 帧、17 帧 4 种解码器时序窗。第三个假设对应朗读训练、自发测试的划分。第 4 个假设对应按无重音、中间重音、高重音分层计算词级相关,并做感知可接受度实验。

需要明确的是,论文把相关系数与以八度为单位的均方根误差作为互补指标,相关看走势是否同起同落,误差看绝对偏离多大。统计上用回归模型检验模态、时序、语体与重音的影响,显著性取小于 0.05。教学例子是,若重音词预测好而非重音词预测差,全局相关仍可能被重音词拉高,这就是局部有效全局好看的典型情形。

从一帧图像到一个基频值要经过哪几步?

沿一个样本走完全程有助于建立依赖。假设取某说话人在某时刻的唇图帧与超声舌图帧,先把两种图像缩放到 128 乘 170 像素并归一到 0 到 1 区间。唇分支与舌分支各自经过 2 维卷积编码器得到 200 维向量,双模态时拼接成 400 维嵌入,单模态时只用 200 维。嵌入送入 1 维卷积解码器,解码器看以当前帧为中心的若干帧嵌入,再经 3 层全连接输出当前帧的对数基频预测。训练时与真值对数基频算均方误差,测试时只在浊音帧计算相关与误差。

编码器与解码器分工明确。编码器负责把高维图像压缩成紧凑发音表示,解码器负责把时序上下文映射到基频。声学对照分支把 13 个倒谱系数或其子集送入 4 层全连接编码器得到 32 维嵌入,再用同一家族的 1 维卷积解码器预测,以保证比较的是信息来源而非解码器容量。

数据来自塔尔语料,包含同步音频、每秒 80 帧超声与每秒 60 帧唇视频。论文只用正常有声部分以获得真值基频,塔尔 1 人集约 21.45 分钟经去首尾静音后使用,塔尔多人集选出高重音比例最高的 8 人并均衡到每人平均 4.35 分钟。朗读句按八二分作训练与测试,自发段全部留作测试,重音分层用强制对齐加连续小波变换打分再聚为 3 类。

编码器与解码器各自记住什么,时序窗如何取值?

发音编码器基于已有视觉语音工作,每个模态用过滤器数为 6、16、32、64 的 4 层 2 维卷积,配合批归一化、线性整流激活与最大池化,再接 1000、500、200 的 3 层全连接。输出 200 维意味着把舌体形状与唇形压缩成可回归的连续向量。声学编码器是输入维度对应倒谱个数的 4 层全连接,尺寸为 256、128、64、32,输出 32 维嵌入,容量小于图像分支。解码器是 1 维卷积加 32 个滤波器,后接 16、8、1 的 3 层全连接,时序窗取 1 帧约 16.7 毫秒、3 帧约 50 毫秒、7 帧约 116.7 毫秒、17 帧约 283.3 毫秒。

超声舌图 × 唇图: 超声舌图负责记录舌体轮廓的内部运动,唇图负责记录唇形开合的外部运动,搭配理由是二者共同构成可观测的发音手势,组合意义在于检验唇部信息是否在舌信息之外提供额外基频线索,原文结果显示双模态与单舌模态相当因而支持单模态输入。

声学子带的划分是理解对照的关键。低阶 0 到 2 阶捕捉强度与谱倾斜等声源相关特性,高阶 3 到 12 阶捕捉共振峰动态等声道特性,全量 0 到 12 阶则两者兼有。

梅尔倒谱系数 × 基频: 梅尔倒谱系数负责以紧凑频谱包络描述声道响应与部分声源倾斜,基频负责作为逐帧回归目标,搭配理由是用声学特征做对照可以分离声源线索与声道线索各自的贡献,组合意义在于若低阶系数与高阶系数都能预测基频,则说明声学路径同时利用了强度谱倾斜与共振峰动态。

为检验第一个假设是否偷看了喉部,论文对单舌模型用梯度加权类激活映射生成帧级注意力图,再按 13 个元音与 9 个说话人平均。导读是 3 张平均图分别对应基本元音,暖色表示编码器更关注的区域。若高亮稳定落在舌骨,则支持残留声源解释,若分散在舌体轮廓,则不支持。

看图路径: 1. 先确认三张子图对应三个基本元音的平均注意力图;2. 再看暖色高注意力是否落在舌体轮廓而非舌骨喉部区域;3. 最后对比三个元音之间的高亮位置是否一致或分散

原论文 Figure 2:Average Grad-CAM images for the cardinal vowels 5, i: and U of the TaL80 19fs speaker.

论文图 2。原论文 Figure 2:“Average Grad-CAM images for the cardinal vowels 5, i: and U of the TaL80 19fs speaker. The warmer the colour, the highest the attention of the CNN encoder.”。

解释是像素显示暖色多在舌体与周边而非稳定聚焦舌骨,论文据此报告没有发现舌骨的一致注意力,从而在图像输入下反驳输入残留声源的简单解释。但这只是定性观察加统计检验的补充,不能证明超声完全不含喉部振动的间接影响,只能说编码器没有直接利用可见舌骨运动。

训练了多少模型,优化与验证如何安排?

训练条件需要完整复述以便复现。论文训练 24 种模型条件,即 6 种输入模态乘以 4 种时序窗。输入模态包括唇、舌、唇加舌、低阶倒谱、高阶倒谱、全量倒谱。每个条件先在单人集说话人上训练,再微调到多人集的 8 个说话人,合计 216 个模型。优化器用亚当,学习率千分之一,批量为 1 个话语,训练 30 轮,损失为均方误差,硬件为 48 吉字节显存的图形处理器。

验证与选择走消融加网格搜索。发音编码器先在保留验证集上比较全连接层数与卷积层数,再搜索每层神经元数,取唇与舌折中的最佳结构用于双模态。声学编码器同样先搜层数再搜宽度。解码器搜索 1 维卷积滤波器数,最终各模态共享同一解码器家族。验证集取训练数据的 10%,论文未报告早停 patience 或权重衰减的具体取值,这是复现时的缺项。

监督来源是声学提取的对数基频,经按说话人标准化与清音段插值。倒谱用窗长 0.015 秒、起始 100 赫兹、间隔 100 赫兹提取 39 个系数并取前 13 个。梯度路径按描述是从基频损失经解码器回传到对应编码器,双模态时 2 分支联合更新,单模态时只更新使用分支。论文未给出梯度裁剪与学习率衰减安排,复现时应保持原文的固定学习率与轮数,不自行添加正则技巧。

数据划分、指标聚合与感知实验如何保证可比?

数据划分同时服务两个假设。为测过拟合,所有自发语音只进测试集。为测重音效应,朗读句按词级突显度均衡分配,保证训练与测试都有高重音句。具体流程是先用蒙特利尔强制对齐得到词边界,再用连续小波变换给每个词打连续突显分,再用三分聚类得到无重音、中间、高重音 3 类。多人集选高重音比例最高的 4 女 4 男,并把训练话语数均衡到最少者,以避免说话人数据量不均。

指标与聚合要分清。客观指标是在话语级逐帧比较预测与真值,只选浊音帧,相关用斯皮尔曼相关,误差以八度为单位。重音分析时把相关改到词级,分别在 3 类重音词与全局条件下计算。统计用贝塔回归与线性回归检验模态、时序、语体与重音的影响,非显著交互逐步剔除,事后比较用边际均值方法。

感知实验控制合成伪影。取单人集上 17 帧的唇舌模型与全量倒谱模型,用神经声码器做分析合成,只把真值基频替换成预测基频,基线是同样经过声码器的原始音频。按话语中高重音词占比分为低、中、高三档,每档随机选 20 句,共 60 句乘以 3 种条件得 180 个刺激,38 名英语母语者做可接受或不可接受的二选判断。聚合是把每被试每条件每重音档的 20 个二值分聚成接受率,再用贝塔回归检验模型与重音比例的影响。

不同输入与时序下谁好谁差,数字如何读?

比较问题是发音图像能否达到先前报告的水平,以及声学对照揭示了什么。公平条件是同一单人集、同一解码器家族、同一浊音帧聚合,指标方向是相关越高越好、误差越低越好。图前导读是左侧相关箱线图与右侧误差箱线图共享横轴 6 种输入,颜色区分 4 种时序窗,箱体反映话语间分布而非单点均值。

看图路径: 1. 先沿横轴比较 L、T、L+T 与三组倒谱输入的中位相关;2. 再按颜色比较 1 帧到 17 帧时序扩展是否抬升箱体;3. 最后对照右侧均方根误差是否随输入从发音转向声学而下降

原论文 Figure 1:Effect of input modality and temporal context on fo prediction correlation (left) and RMSE…

论文图 1。原论文 Figure 1:“Effect of input modality and temporal context on fo prediction correlation (left) and RMSE (right) on TaL1.”。

解释是发音侧舌模型与双模态明显好于唇模型,而唇加舌与单舌相当,说明唇信息在有舌时没有额外增益。时序对发音模型影响不显著,1 帧与 17 帧差异小,提示局部线索已够。声学侧随上下文增大而明显改善,全量倒谱在 17 帧达到最高。像素上唇分支箱体更宽更低,舌与双模态箱体更高,声学全量分支在右侧误差最低,这些相对位置支持上述判断,具体数值以正文与下表为准。

下表整理复现与先前工作的可比数字,条件是单人集单舌模型与文献中超声单帧条件,指标含相关与误差,单位保留原文写法。表前已说明比较问题与公平条件,表中数字需结合语料语言与说话人理解。

条件指标文献基线本研究单舌模型比较对象
1 帧上下文相关0.710.63文献 6 与本研究 T 模型
17 帧上下文相关0.740.68文献 6 与本研究 T 模型
单帧输入均方根误差65 Hz0.21 octave文献 7 与本研究 T 模型
单人平均基频参考平均基频119 Hz18.6 Hz真值参考与换算误差
法语固定重音对照相关0.750.75本研究法语单人集

表后解释是本研究相关略低于匈牙利语文献,论文用英语重音多变难预测解释,并以法语固定重音达到 0.75 为旁证。误差换算显示 0.21 八度约合 18.6 赫兹,优于文献的 65 赫兹,但语料与说话人不同,不能直接判胜负。未胜出项是唇单模态在两种指标上都差,负结果是扩大时序没有帮助发音模型,这直接指向第二个假设不成立。

另一张表整理声学对照,条件是同一解码器下不同倒谱子带,指标为相关范围与峰值,单位为原文相关系数。表前问题是声源线索与声道线索谁更重要,公平条件是只换编码器输入不换解码器。

条件指标低阶声源子带高阶声道子带全量组合
短到长上下文相关范围0.61 to 0.84与低阶相当0.91 in the 17-frame configuration
16 系数线性回归文献相关0.850.850.91 in the 17-frame configuration
显著性差异p > 0.05p > 0.05最高
信息归因来源强度谱倾斜共振峰动态互补
教学含义结论声源有用声道有用两者互补

表后解释是低阶与高阶表现相当且无显著差异,全量组合达到 0.91,说明在声学路径中声源与声道信息同等重要且互补。这反衬发音路径的特殊性,即图像没有直接利用声源残留,却仍能部分预测,线索应来自别处。代价是声学对照不可部署于真正静音场景,只能作为信息来源分析的上限参考。

语体与重音如何改变预测,哪个假设被支持?

本节按问题组织消融。先测语体泛化,再测重音分层,二者条件一致的保证是同一唇舌模型、同一训练只用朗读、测试分别用朗读与自发。指标方向仍是相关越高越好。导读是箱线图横轴为 4 组语体与说话人组合,颜色区分 3 类重音与全局,纵轴为相关,箱体越窄越高表示越稳越好。

重音 × 发音手势: 重音指词级突显度决定的基频抬升与时长能量变化,发音手势指为实现突显而增大的唇颌开度与舌位移,搭配理由是二者在重音实现中同向增强,组合意义在于模型可能只在局部重音位置学到耦合关系,全局轨迹的好坏于是取决于重音词的比例而非整句语调建模。

看图路径: 1. 先确认横轴四组为朗读与自发乘以单人与多人的组合;2. 再比较每组内从 P0 到 P2 再到全局的相关中位线走向;3. 最后观察自发组箱体是否比朗读组更宽更低

原论文 Figure 3:Effect of speech type, speaker, and prominence level on fo prediction correlation with the L+T…

论文图 3。原论文 Figure 3:“Effect of speech type, speaker, and prominence level on fo prediction correlation with the L+T model.”。

解释是自发全局相关相对朗读大幅下滑,多人集与单人集趋势一致,重音越高箱体越高,高重音词预测明显好于无重音词。像素上左侧朗读组的高重音箱体窄而高,右侧自发组的同色箱体更宽更低,说明重音耦合本身也依赖语体。这同时支持第三与第四假设,即存在朗读过拟合,且预测能力集中在局部重音实现。

下表给出关键数字的整理,条件是唇舌模型全局相关与高重音比例下的感知接受率,指标含相关与接受率,单位保留原文。表前问题是下降幅度与感知是否一致,公平条件是朗读训练不变只换测试语体与重音比例。

条件指标朗读全局自发全局高重音感知
单人集相关与接受率0.700.39 for TaL187.5%
多人集相关与接受率0.650.38 for TaL8087.5%
显著性差异p < 0.05p < 0.05无显著模型差异
聚合对象粒度话语级全局话语级全局高重音占比话语
含义判断朗读模板泛化失败局部可接受

表后解释是全局相关从 0.70 掉到 0.39 以及从 0.65 掉到 0.38,降幅大且显著,说明朗读孤立句的规整语调没有教会模型处理自发韵律。未胜出项是非重音词相关低且分布宽,负结果是仅靠增加时序不能挽回自发损失。边界是多人微调只用不到 5 分钟仍能达到与单人相当的朗读全局相关,说明架构适配快,但快的适配不等于跨语体泛化。

感知实验支持什么,又在哪些边界上不能推广?

感知问题是客观相关低是否等于听感不可接受。条件是同一单人集、同一声码器、只换基频轨迹,被试判断的是语调可接受而非音质。导读是箱线图纵轴为接受率百分比,颜色区分低中高三档重音比例,横轴隐含真值与两种预测条件,箱体越高表示越多被试给可接受。

朗读语音 × 自发语音: 朗读语音负责提供句式规整语调模式稳定的训练样本,自发语音负责检验模型在停顿犹豫与多变语调下的泛化,搭配理由是 prior 研究只在孤立朗读句上训练测试,组合意义在于若朗读训练在自发测试上大幅下降,则说明学到的是朗读语调模板而非通用的发音到基频映射。

看图路径: 1. 先确认纵轴为可接受率百分比横轴隐含三种合成条件;2. 再比较每组内从低重音比例到高重音比例的变化;3. 最后看高重音比例下预测与真值的箱体是否接近顶部

原论文 Figure 4:Effect of P2 proportion on the acceptability of fo pre- dicted from L+T and M0:12 vs.

论文图 4。原论文 Figure 4:“Effect of P2 proportion on the acceptability of fo pre- dicted from L+T and M0:12 vs. Ground-Truth (GT) on TaL1.”。

解释是 3 类条件下接受率都随重音比例上升而上升,高重音占比时两种预测与真值一样达到约 87.5% 的优秀接受率,且两种预测之间无显著差异。像素上浅色低重音箱体更低更分散,深色高重音箱体贴近顶部,这与客观上高重音词相关更高的发现一致。论文据此提出评价应从全局相关转向局部韵律功能实现,因为听感更看重重音等功能是否成立。

限制必须讲清。第一,训练与感知都基于可发声数据的发音,真静音下的舌唇运动可能更小更弱,结论外推到静音需待验证。第二,注意力图未发现舌骨聚焦是否定性证据,不能排除间接喉部影响。第三,时序无益的结论限于 32 滤波器的小解码器与 283 毫秒内窗口,更大语言模型可能不同。第四,感知只用单人英语与 38 名母语者,未测语义理解与自然度细项。缺失证据不是技术错误,相关性也不是因果,论文用支持而非证明来表述耦合解释是恰当的。

若要复现,应先做什么并保留哪些关键设置?

复现先做数据与对齐。获取塔尔语料的同步音频、超声与唇视频,只取正常有声部分,按唇图 60 帧对齐并去首尾静音,图像缩到 128 乘 170 并归一到 0 到 1。音频用窗长 0.015 秒、起始 100 赫兹、间隔 100 赫兹提取倒谱并取前 13 个,基频取对数按说话人标准化并在清音段插值。划分上自发全部留作测试,朗读按八二分且保证高重音在两边均衡,重音打分走强制对齐加连续小波变换再三分聚类。

模型先搭单舌基线再扩展。编码器用 6、16、32、64 的 4 层 2 维卷积加批归一化与池化,后接 1000、500、200 全连接得 200 维,解码器用 32 滤波器 1 维卷积加 16、8、1 全连接,时序先做 1 帧与 17 帧两端。训练用亚当、学习率千分之一、批量 1 话语、30 轮、均方误差,先训单人再在多人每人约 4 分钟上微调。评估只在浊音帧算话语级斯皮尔曼相关与八度误差,重音分析转到词级,统计显著性取 0.05。

还需补的验证包括真静音数据上的测试、更大时序与语言模型的对照、以及按韵律功能的多维感知评价。资源状态上本次没有验证到可用的代码模型或数据链接,因此复现应以论文文字与上述超参数为准,不假设存在官方权重下载。若只能跑小规模,可先复现单人集上舌与唇的差距以及朗读到自发的下降,这两处效应最大且最稳。

何时值得尝试这种预测,何时应换思路?

值得尝试的情形是应用允许关注局部重音实现而非整句精确轨迹,例如在静音接口中先保证重音词的音高起伏可感知,再逐步优化全局自然度。若训练数据多为朗读孤立句,应优先补录对话式自发数据,否则上线自发场景会遇到类似从 0.70 到 0.39 的下滑。若只有唇视频而无超声,应预期效果有限,因为唇单模态在两种指标上都明显弱于舌。

应换思路的情形是需要精确复刻全局语调或处理大量非重音功能词,此时仅靠发音图像的局部耦合不够,需引入语言与语用上下文或显式韵律建模。评价上应同时报告全局相关、重音分层相关与感知可接受率,避免被全局均值掩盖局部失败。教学上最易误解的是把相关高误当因果证明,实际上论文显示的只是发音增大与基频抬升在重音处的伴随关系,以及朗读模板在自发下的失效。

收束是信息来源主要来自局部重音耦合而非直接声源残留或长时序,语体依赖强,感知上高重音比例可达可接受水平。后续工作应把数据转向真实对话,把目标从复制整条基频曲线转向实现可感知的韵律功能,这更贴近基频在交际中的语用角色。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总