英文题目:Paediatric-HGNN: A Hybrid Heterogeneous Graph Neural Network for Detecting Disfluency in Children’s Speech via Multiscale Acoustic Fusion

会议身份:conference:interspeech:2026:conference-paper-id:liyanarachchi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#图神经网络 #言语障碍 #语音 #病理语音评估

评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • Rashini Liyanarachchi:机构信息未能从会议 PDF 纯文本可靠映射
  • Rachael Mackay:机构信息未能从会议 PDF 纯文本可靠映射
  • Alison Short:机构信息未能从会议 PDF 纯文本可靠映射
  • Aditya Joshi:机构信息未能从会议 PDF 纯文本可靠映射
  • Erik Meijering:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

儿童口吃自动检测需以连续语音为输入并输出流利、核心口吃与典型发育性不流利三类标签,难点在于儿童基频高、发声生理不稳定且病理性阻断与正常搜索行为声学重叠严重。本文方法链分四步推进:混合特征抽取为词与帧节点提供表征,异构图构建编码层级与上下文关系,跨模态注意力与关系图卷积实现词向帧的异常定位,双向门控循环单元融合时序节律后分类。相对同构图与纯声学时序模型,该设计以词汇意图节点为语义锚点,使发育性修订依赖邻域上下文而病理性事件依赖局部能量尖峰。在UCLASS与FluencyBank-CWS混合语料说话人独立5折验证协议下,Paediatric-HGNN的Typical Disfluency F1为0.38,高于SEP-28k预训练加微调基线的Typical Disfluency F1 0.08。该模型加权准确率为82.4%,流利F1为0.904,核心口吃F1均值0.280。该结论限于英语自发会话与朗读混合的小样本儿科场景,未验证跨语言与跨站点外推能力。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

儿童口吃自动检测难在哪里?

输入是本次收到的论文原文证据与 3 张官方原图像素,目标是让刚进入语音领域的研究生能核对方法并复述流程,必须保留的关键信息包括数据来源与划分、特征维度、图构造、训练损失与评估协议,输出是按学习依赖展开的技术解读。任务是儿童口吃自动检测,英文为 automated stuttering detection,缩写为 ASD。白话说,就是让机器听儿童说话,逐词判断是流畅、病理性口吃,还是发育期正常的磕绊。难点有两层。

第一是声音本身变化大,儿童基频更高,语音运动控制还在发育,阻断与拖长在声学上经常混在一起。第二是语言发展带来典型不流畅,英文为 typical disfluency,例如整词重复、短语重复、修订和填充词 um,这类行为在学习语言阶段是正常的探索,却与病理性核心口吃在波形上重叠。论文报告的背景数据显示,约 5% 到 8% 的儿童在学龄前会出现口吃相关表现,而临床依赖语言治疗师主观观察,存在评估者间差异大与耗时问题。

成人语料 SEP-28k 上训练的模型直接搬到儿童时会失效,这正是论文要解决的域偏移。教学例子仅为例子:比如儿童说 anniversary celebration 时出现 ce 重复,可能是用力卡住的病理重复,也可能是在想下一个词时的发育性迟疑,单看一小段波形无法区分,必须看词义与上下文,这就引出后文为何要用词节点提供词汇意图。

已有路线各解决了什么,又缺了什么?

按同输入、同目标、同监督来对照,已有路线可分 3 类。第一类是帧级与多秒级声学模型,例如 StutterNet 用时延神经网络抓帧级信息但缺长程上下文,空洞卷积网络能看多秒不流畅。它们输入相同,都是语音声学,目标相同,都是检测不流畅,但在儿童数据上缺少词汇语境,容易把发育性修订误判。第二类是高维与自监督路线,例如 DDSS 与 Wav2Vec 2.0 改造,论文引用结论称词识别是准确检测的前提,这支持了引入词汇信息的动机,但这类方法仍是偏声学的 1 维序列建模。

第 3 类是图与大模型路线,例如 StutterCut 用归一化割做分割但用同构图把所有语音段当作统一声学节点,StuD 则依赖私有大模型嵌入。论文的选择是异构图,英文为 heterogeneous graph,即图中有不止一种节点类型,区别于同构图。与 StutterCut 的同条件差异在于节点类型与边的语义:StutterCut 只有声学节点,本文有词与帧两类节点,并显式建模层级归属。与 StuD 的差异在于不依赖私有大模型嵌入,而是用公开的 Wav2Vec2-base-960h 加手工声学与语境时长特征。

相关性不等于因果,论文并未证明图结构必然优于所有序列模型,只在给定儿童合并语料与三分类协议下报告了对照结果。

三分类标签如何定义?四分类又用来做什么?

论文经与言语治疗专家协商,把 FluencyBank-CWS 与 UCLASS 的不一致标注统一为三分类临床框架。流畅为 0 类,包括标准流畅语音与自然停顿。核心口吃为 1 类,包括音、音节、词重复以及拖长和阻断,强调病理性。典型不流畅为 2 类,包括填充停顿、短语重复和修订,强调非病理性发育打断。选择三分类的理由是口吃样不流畅分类学把部分词重复与节律异常发声并为一临床类别,且儿童阻断与拖长区别常因发育模糊,合并更贴合是否需要持续干预的临床优先级。

核心口吃 × 典型不流畅: 核心口吃指病理性不流畅,包括音、音节、词重复以及拖长和阻断;典型不流畅指非病理性发育打断,包括填充停顿、短语重复和修订。二者分工是把临床最关心的是否需要持续干预与正常语言探索期分开;搭配为三分类评价的原因是儿童阻断与拖长在生理上常模糊,且整词重复既可病理也可发育,强行四分会放大标注噪声;组合意义是用 SLD 分类思想把拖长、阻断与部分词重复并入一类,保留与发育性修订的对照。

为与学术基准透明比较,论文额外做了传统四分类评估,即流畅、重复、拖长、阻断。在比较时,为对齐分类体系,基线的典型不流畅 F1 由其报告的填充词或其他不流畅类性能派生。这意味着四分类与三分类数字不能直接混比,聚合对象与映射规则不同。复述时要先说清当前数字属于哪种分类体系,再说模型与基线,避免把四分类的重复 F1 当成三分类的核心口吃 F1。

Paediatric-HGNN 让一个样本走完哪条流水线?

Paediatric-HGNN 全称含义是面向儿童的混合异构图神经网络,核心模块名为语境感知部分整体交互网络,英文为 Context-aware Part-whole Interaction Network,缩写为 CaPIN。沿一个样本走全程:输入是一段儿童语音及其词切分,先为每个词抽 945 维混合向量,为每个声学帧抽 768 维 Wav2Vec2 嵌入;然后把语音建模为异构图,词节点与帧节点通过层级边连接,相邻词通过序列边连接,正负 2 词邻域通过语境边连接,另有自环保持自身特征;接着词节点作为查询去注意其下属帧,做层级跨模态注意力,再经 2 阶段关系图卷积在序列与语境边上传播。

之后图增强序列进入两层双向门控循环单元建模全局节律,再与图特征做门控残差融合,最后送入三分类多层感知机输出流畅、核心口吃、典型不流畅。图 1 展示了这种层级不流畅建模的连接思想,上方为词节点,下方为帧节点,箭头区分归属、序列、语境与自环。

读图前需要先明确该图不是模型全部计算流,而是图构造的连接语义,时间范围是连续若干词及其下属帧,对象是节点类型与 4 种边。

看图路径: 1. 先从下往上看帧节点如何用实线箭头汇入上方对应的词节点;2. 再沿上方词节点之间的实线箭头确认从左到右的序列流向;3. 对比上方虚线长弧线的上下文边与各节点的自环箭头;4. 对照右侧图例确认四种边的线型与节点形状含义

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

从像素可见,上方有 5 个标为 W 的矩形词节点,从左到右有实线箭头串联表示前向流动;下方有一排小矩形帧节点,多条实线箭头向上汇入对应的词节点表示部分到整体归属;上方另有多条虚线长弧跨越一个或两个词表示上下文聚合,每个词节点附近还有细虚线自环;右侧图例明确区分词节点、帧节点与 4 种边。这种连接让声学扰动能被放回所属词与邻域中解释,为后文区分用力重复与探索性迟疑提供结构基础。

词节点 × 帧节点: 词节点负责承载词汇意图,即实际说出的词及其 945 维混合特征所代表的语言学上下文;帧节点负责承载细粒度声学实现,即 Wav2Vec2 嵌入所代表的局部声学片段。二者搭配的理由是儿童重复、拖长、阻断在声学上相似,只有把声学扰动放回其所属词及前后词语境中才能区分病理性与发育性;组合后异构图通过层级边把帧连向父词,再用序列边和语境边在词层传播,形成部分到整体的归属与上下文推理。

特征、注意力与融合各自算什么?

特征抽取分两路。词节点 945 维向量融合四部分:Wav2Vec2-base-960h 的深层自监督语境嵌入、经全局均值与最大池化的梅尔谱纹理、传统手工声学如梅尔倒谱系数与过零率,以及时间物理代理与语境时长,包括能量不稳定性、经 YIN 算法的基频稳定性、自相关,还有对数缩放的段时长与当前词相对前词时长比。帧节点用 768 维 Wav2Vec2 特征,代表声学窗口。两路经线性投影到共享 256 维隐空间,再做层级跨模态注意力,词为查询,帧为键与值,目标是让词有选择地放大其内部与拖长、重复、能量尖峰相关的帧。图 2 给出了从投影到分类头的完整堆叠,包括注意力、层归一化加残差、两个异构卷积、时序双向 GRU、门控融合与分类头。

看该架构图时应沿自上而下的主路径核对维度与模块顺序,再比较左右分支的差异。

看图路径: 1. 先看顶部词 945 维与帧 768 维如何经线性投影变为查询与键值;2. 再看中间层级注意力与层归一化加残差的先后顺序;3. 比较左右两个异构卷积分支标注的多头拼接与平均差异;4. 沿底部链路确认双向 GRU、门控融合与三分类头的输出类别

原论文 Figure 2:Paediatric-HGNN model architecture.

论文图 2。原论文 Figure 2:“Paediatric-HGNN model architecture.”。

像素显示顶部左右分别为词 945 维与帧 768 维框,各经线性投影后标注为查询与键值汇入层级注意力;其下为层归一化加残差,再分叉为左右两个异构卷积框,均标注 GATv2Conv 与序列和语境边,但左分支标注 4 头拼接,右分支标注 4 头平均;之后汇入时序双向 GRU、门控残差融合与分类头,分类头分出流畅、核心口吃、典型不流畅 3 路。这对应正文所述的 2 阶段关系图卷积与门控融合,拼接与平均的差异影响特征维度与平滑程度,复现时应按图注与正文同时保留。

层级注意力 × 关系图卷积: 层级注意力负责跨模态选择,即以词节点为查询有选择地听其下属帧节点的值,定位能量尖峰或拖长等微观伪影;关系图卷积负责在同层词图上传播,即沿序列边和正负 2 词语境边用 GATv2Conv 聚合邻居信息。搭配的原因是只做注意力会丢失话语节律,只做卷积会被平均池化淹没局部异常;组合后先做自下而上的声学 grounding,再做横向的语境平滑,分别支撑核心口吃定位与典型不流畅的语境判别。

门控融合的计算目标是自适应权衡,空间图特征擅长局部尖峰,时间循环特征擅长长程迟疑,融合后再分类。论文未给出门控的具体初始化与梯度细节,复述时只说可学习门控加权,不推定其收敛行为。

空间图特征 × 时间循环特征: 空间图特征负责刻画局部结构,即经异构卷积后的词表示,强调当前词及其邻域的声学-词汇交互;时间循环特征负责刻画全局节律,即经两层双向 GRU 后的序列表示,强调长程迟疑与节奏模式。搭配的原因是重复需要对局部尖峰敏感,迟疑与修订需要看长程模式;组合通过可学习门控残差融合按公式 H = g·HRNN+(1−g)·HGNN 动态加权,让模型在不同样本上偏向空间或时间分支后再送入三分类多层感知机。

数据不平衡时训练如何加压少数类?

训练优化用 AdamW 与焦点损失,英文为 Focal Loss,gamma 为 2,类别权重 alpha 为 1、3、3,意图是压低多数流畅类的损失贡献,迫使模型优先学习少数病理与发育不流畅类。批级别加权采样保证少数类在每批出现,训练后用动态阈值优化非流畅类 F1 的决策边界。数据层面先做信号与图级增强:核心口吃段做物理变换如片段重复与音高抖动,典型不流畅做合成静音与能量下降以增加声学多样性;之后做选择性过采样,含核心口吃的图复制 8 倍,含典型不流畅的图复制 4 倍。

需要区分的是增强改变样本多样性,过采样改变类别频率,焦点损失改变梯度权重,三者作用阶段不同。论文未报告学习率、批大小、训练轮数与早停细节,也未说明 Wav2Vec2 参数是否冻结与梯度是否回传,因此复现时应标记为缺项,不从模型名称推定微调方式。

焦点损失 × 加权采样与动态阈值: 焦点损失负责在目标函数层面压低易分流畅样本的权重,用 gamma=2 和类别权重 alpha=[1,3,3] 迫使模型关注少数病理类;加权采样与动态阈值负责在数据与决策层面平衡,即批级别加权采样保证少数类出现概率,训练后调整分类边界以最大化非流畅类 F1。二者搭配的原因是仅改损失仍可能因批内全是流畅而梯度稀疏,仅改采样仍可能因阈值 0.5 不适合不平衡;组合后从梯度、数据分布与决策点三处共同缓解自发语料中口吃事件稀有的问题。

该节承担的教学任务是讲清监督来源与加压路径:监督来自统一后的三分类词级标注,损失与采样共同把梯度与数据分布推向少数类,阈值只在训练后调决策点,不参与梯度。若缺失具体超参数,应如实说未报告,而不是用默认值填补。

数据、划分与基线在什么条件下可比?

数据用 UCLASS 选 25 名儿童与 FluencyBank-CWS 子集选 22 名儿童,共 47 名儿童,包含自发对话访谈与受控朗读,排除成人样本与无标注录音,强调严格儿童自发语音训练分布。评估用 5 折交叉验证,且按说话人划分,即同一说话人的所有录音只进同一折,避免信息泄漏。指标用精确率、召回率、F1 与总体准确率,按 5 折加权平均报告均值与标准差。基线包括 ResNet 加双向长短时记忆、StutterNet、空洞卷积与 Whister,覆盖 1 维时序与 2 维谱方法,并代表在 UCLASS 上常用的对照。

另设迁移基线:先在成人 SEP-28k 上预训练同一架构捕捉广义病理特征,再在儿童合并集上微调,以度量成人到儿童的域偏移。硬件、训练时长与推理成本未报告,复现时只能说成本缺项,不能把准确率趋势当作效率结论。比较公平性取决于分类体系与聚合口径是否一致,三分类临床框架与四分类学术基准应分开看,派生映射的典型不流畅 F1 只能做参考对照。

主结果测了什么,谁在什么指标上更好?

主问题是在儿童三分类下能否同时保住流畅识别并分开两类不流畅。与自身 5 折均值比,论文报告从零在儿童数据上训练达到稳定总体准确率 82.4%,流畅 F1 高而两类不流畅 F1 明显更低,说明多数流畅易分,少数不流畅仍难。典型不流畅均值 0.386,在特定折峰值 0.43,支持词汇词节点为发育性修订提供了必要上下文的解释。核心口吃均值 0.280,个别折峰值 0.318,报告称训练中稳步提升但受自发语料中事件稀少限制。

四分类基准上本文流畅 0.90 高于所列基线,但重复、拖长、阻断并非全面领先,这是一个必须保留的未胜出细节。图 3 用注意力权重解释两类不流畅的判别依据,上面板为核心口吃,下面板为典型不流畅,横轴为时间帧索引,纵轴为归一化幅度。

理解该图需先确认纵轴是归一化幅度而非原始能量,橙色为注意力,浅色为声学,两类面板时间范围与标注词相同但注意力形状不同。

看图路径: 1. 先看横轴时间帧索引与纵轴归一化幅度的范围与单位;2. 对比上面板两处尖锐橙色峰与下面板宽缓橙色峰的宽度差异;3. 观察浅色声学曲线与橙色注意力曲线在阴影区内外的重合位置;4. 核对上下板标注的词 anniversary、celebration、on、May 与 ce、um 位置

原论文 Figure 3:3

论文图 3。原论文 Figure 3:“3”。

像素显示上面板在 ce 重复处有两个尖锐高耸的橙色峰,周围流畅语境注意力接近零,浅色声学在对应位置仅有小起伏;下面板在 um 处橙色曲线为横跨 anniversary 到 celebration 的宽缓单峰,阴影标出正负 2 词语境,浅色声学在 um 段低平而在两侧词处较高。这支持论文的解读:核心口吃注意微观能量尖峰,典型不流畅把注意力分散到邻域以捕捉语言规划期的探索行为。但这属于有限解释,相关性不是因果,未测量误判率时不能承诺临床误诊下降。

下表整理三分类主结果的精确率、召回率与 F1,比较问题是 3 类难度是否一致,公平条件是同一儿童合并集与说话人独立 5 折均值,指标方向为越高越好。

条件指标流畅核心口吃典型不流畅
儿童合并集 5 折均值精确率0.914 ± 0.020.292 ± 0.040.390 ± 0.08
儿童合并集 5 折均值召回率0.900 ± 0.030.274 ± 0.030.362 ± 0.07
儿童合并集 5 折均值F1 分数0.904 ± 0.020.280 ± 0.060.386 ± 0.05
儿童合并集 5 折均值加权平均0.832 ± 0.020.824 ± 0.030.826 ± 0.02

表后解释需同时说收益与代价:收益是流畅识别稳定,加权准确率 82.4% 主要由多数流畅类支撑;代价是两类不流畅精确率与召回率均低,核心口吃 F1 仅 0.280 意味着漏检与误检仍多。最后一行加权平均三格分别对应精确率、召回率、F1 的加权值,阅读时不能把 0.824 当成某类的准确率。未评测边界包括真实诊室噪声、不同口音与更年幼年龄段,论文未覆盖则不外推。

拿掉哪个部件,哪类 F1 掉得最多?

消融问题是 3 个部件各自对两类不流畅的贡献是否可分离。对照为完整模型与 3 个变体:去掉注意力后用朴素均值池化,去掉语境后移除正负 2 词邻域边,去掉门控融合后用标准加法合并空时特征,条件均为同一 5 折平均。结果显示典型不流畅对语境边最敏感,去掉后从 0.386 掉到 0.287,支持发育性修订需要周围语言语境的判断;核心口吃对注意力最敏感,去掉后掉到 0.213,支持层级注意力对定位微观声学异常的作用。

去掉门控融合后两类均有下降但幅度居中,总体准确率从 82.6% 降到 81.3%,支持自适应加权带来稳定性。成人预训练加微调的域偏移对照显示典型不流畅 F1 跌到 0.08,核心口吃 F1 为 0.15,流畅仍有 0.88,说明成人模型并非全坏,而是在发育性类别上灾难性失效,常把认知语言性重复误为流畅或病理阻断。

下表并置消融与迁移对照,比较问题是部件缺失与域偏移哪种损失更大,公平条件是同一儿童测试分布,指标方向为 F1 与准确率越高越好。

条件核心口吃 F1典型不流畅 F1总体准确率流畅 F1
完整儿童模型0.2800.38682.6%0.90 ± 0.02
去掉注意力0.2130.36180.4%未报告
去掉语境边0.2630.28780.7%未报告
去掉门控融合0.2480.33781.3%未报告
成人预训练加微调0.150.08未报告0.88

表后应指出具体代价与反例:语境边带来典型不流畅近 0.1 的 F1 差距,但完整模型典型 F1 绝对值仍不足 0.4,不能说已解决;注意力对核心类最关键,但核心类去掉注意力后仍非零,说明声学与时长特征本身有一定区分力;成人迁移在流畅上保持 0.88,反驳了成人模型完全无用的极端说法,其失败集中在需要语境的发展类别。论文未做统计显著性检验,标准差显示儿童样本方差大,差值解读应留有不确定性。

哪些结论证据不足,还缺什么验证?

直接报告的是在 47 名儿童合并集与说话人独立 5 折下的准确率与 F1,以及消融与成人迁移的对照数字。有限解释的是注意力形状与探索行为的对应,论文用尖峰与宽峰分别对应运动性阻断与语言规划搜索,这由可视化支持但未做因果干预,例如遮挡语境后是否必然改变决策的系统性测试不足。

未验证推测包括临床可用性与早期干预价值,论文未测量误诊率、评估时间节省、不同治疗师间一致性变化,也未报告延迟、模型参数量与推理帧率,因此不能承诺降本或提速。数据局限是样本量小且以自发与朗读混合构成,核心口吃事件稀有,依赖 8 倍与 4 倍过采样与合成增强,合成静音与能量下降是否引入可被模型利用的人工痕迹,论文未做伪影分析。

标注局限是三分类合并虽符合临床优先级,但把阻断与拖长并为一类会掩盖二者差异,四分类映射又依赖派生,跨论文比较需谨慎。资源状态方面,本次未发现来源绑定且完成验证的开源代码、模型或数据,不得声称已公开,复现需按论文文字重建。

要复现这套方法,先做什么、记什么?

复现先做数据与标签:按 UCLASS 取 25 名儿童、FluencyBank-CWS 取 22 名儿童,排除成人与无标注,保留自发访谈与受控朗读,并在专家指导下映射为流畅、核心口吃、典型不流畅 3 类,同时保留四分类映射以便对照基线。划分必须按说话人独立做 5 折,同一人只进同一折,指标按折加权平均并记录均值与标准差,避免用随机切分夸大性能。特征按词 945 维与帧 768 维重建,词侧包括 Wav2Vec2-base-960h 嵌入、梅尔谱全局池化、梅尔倒谱与过零率、YIN 基频稳定性、能量不稳定性、自相关与对数时长比,帧侧用 Wav2Vec2 嵌入,两路投影到 256 维。

图按层级边、相邻序列边、正负 2 词语境边与自环搭建,注意力用词查帧,卷积用 2 个阶段 GATv2Conv 分别处理序列与语境边,之后接两层双向 GRU 与门控融合,分类为 3 类多层感知机。训练用 AdamW 加 gamma 为 2 的焦点损失与 alpha 为 1、3、3,配合批加权采样、核心 8 倍与典型 4 倍过采样及训练后动态阈值调优。必须记录的缺项包括学习率、批大小、轮数、早停、Wav2Vec2 是否冻结、硬件与用时,缺失时在报告中明确写未报告,不用默认值代替。

教学例子仅为例子:可用 anniversary 到 celebration 的 um 样本检查注意力是否呈宽峰,但不把单样本可视化当作整体性能证明。

何时值得尝试这种异构图思路?

当任务同时满足 3 个条件时值得尝试:对象是儿童自发语音且发育性不流畅占比高,错误代价在于把正常探索误判为病理或漏掉病理,以及有词级切分与标注能提供词汇意图。若只有纯声学无词信息,或数据全为成人稳定病理模式,异构图的额外复杂度收益可能有限,应先用声学基线验证域内性能。复现优先级是先保证说话人独立划分与三分类口径,再补注意力与语境边的消融,最后才调阈值与采样倍率,避免把阈值红利误认为结构红利。

还需补的验证包括更大儿童队列、诊室噪声鲁棒性、治疗师一致性研究,以及延迟与计算开销测量,因为总体趋势不等于每组每步都成立。回到中心矛盾:儿童口吃检测的难点不是听不清声音,而是听清了仍不知属于病理卡住还是发育寻找,论文用词与帧分开建模的意义正在于把声学放回语言语境中判断,而 0.386 与 0.280 的 F1 提醒这条路仍处于可用探索阶段而非成熟临床工具。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总