英文题目:Computational Analysis of Prosody for Clinical Psychiatry

会议身份:conference:speechprosody:2026:conference-paper-id:joyce26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#信号处理 #统计分析 #韵律 #语音 #病理语音评估

评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Jeremiah Joyce:机构信息未能从会议 PDF 纯文本可靠映射
  • Erik Clemens:机构信息未能从会议 PDF 纯文本可靠映射
  • Josh Boesche:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为医患临床对话的长时WAV录音,输出为分说话人、带轮次与停顿结构、词级时间戳及韵律参数的JSON标注与可复核可视化,难点在于交互不可打断、重叠与角色混淆普遍,且需多语言部署与纵向可比。流水线先以说话人分离标注切分谁在何时说话,并基于200ms静音阈值构建停顿间单元、轮次、暂停、间隙与轮内轮间重叠,再以语音识别转写并强制对齐词级时间戳以承接韵律计算,随后以de Jong和Wempe声学法检测音节核得到构音速率与语速变异性等指标,最后经人工同步视听复核修正后归档。与直接输入音频或文本预测疾病的端到端黑箱不同,该方法坚持语言学可解释的显式预处理与透明时序结构,使测量可追溯、可修正并服务于精神状态检查中的言语评估。在CASLIM个体内纵向评测任务下,发言时长条件的关联指标为β=0.54,高于构音速率条件的关联指标的β=0.24。该工具同时支持英语、西班牙语与加泰罗尼亚语的自动语言检测与声学音节法统一分析,以保证跨语言比较的一致性。结论的适用边界受限于成人住院躁狂缓解对照,Barcelona躁郁区分、门诊随访与谵妄环境传感尚未验证。原文未披露训练、推理或部署成本

🔗 开源与复现资源

  • 第三方资源:https://aclanthology.org/L06-1082/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

精神科为什么需要把听出来的说话方式变成可核对的数字?

输入是这篇论文要解决的临床现实:精神科诊断高度依赖医生在精神状态检查中直接观察到的现象,其中说话方式既包括说了什么,也包括怎么说。目标读者是刚进入语音或音频领域的研究生,需要先理解为什么精神科与其他科室不同。论文开场用心脏科做对比,症状是患者主诉的胸痛,体征是医生用听诊器听到的心脏杂音,诊断检验是心电和损伤标志物,而精神科长期缺乏类似的仪器和检验,只能靠受过训练的医生本人作为仪器去捕捉体征。

必须保留的信息是这种人力观察的 3 个局限:术语松散如催促性言语和贫乏性言语缺乏统一操作定义,医生通常没有接受正式语言学训练因而效度和一致性受限,记录只有定性描述词难以做纵向比较。输出是本文的技术解读要回答的问题:如何在不打断问诊的前提下,把录音变成按说话人区分、按时间对齐、可人工复核的韵律测量,供临床决策和记录使用。

后续章节按学习依赖展开,先讲已有路线为什么不直接套用,再讲工具全景、组件计算、调用而非训练的实施方式、实验条件与结果边界。

已有路线把语音直接送进深度模型,为什么本文不这样做?

论文回顾了两条历史线索。第一条是临床观察史:从早期对躁狂语速快、音量大、话多且不让出话轮,以及抑郁语速慢、停顿多、音调范围窄的定性描述,到用留声机、模拟装置和磁带机试图记录言语,但因为预处理和评估仍需大量手工,未能真正进入常规实践。第二条是当代自动语音分析的主流做法:把词文本或原始音频直接输入在临床标签上训练的深度学习模型,把模型当作化验单式的诊断检验,让患者对着设备说话后在诊室外完成预测。

论文引用的 2024 年综述指出了这类做法在临床落地中的困难,包括忽视精神科评估的交互细节、可解释性不足、对医患互动考虑太少。本文选择的是增强路线:计算分析嵌入临床空间,辅助医生完成精神状态检查,把语言学上成立且临床相关的特征抽出来量化并写入病历,而不是替代医生做分类。理解这个分叉很重要,后面所有设计如保留人工校对、输出分说话人指标、支持多语言,都是为增强而非替代服务的。

任务是什么:输入一段医患录音,需要输出什么?

举一个教学用的例子帮助建立输入到输出的映射,例子本身不是论文数据。假设输入是一段 WAV 格式的门诊对话录音,时长十几分钟,包含 1 名医生和 1 名患者。期望输出不是一个疾病标签,而是一份带时间的结构化描述:哪段时间是谁在说话,每轮话轮从何时到何时,中间的停顿属于轮内停顿还是轮间间隙,有无重叠,每个词的起止时间,每个音节核的发生时刻,以及按说话人汇总的发声时长、发音速率、速率不均匀性和话轮交接间隔。

论文强调理想技术应精确测量相关语言特征,同时增强而非干扰临床互动,因此录音方式是高保真记录问诊音频并允许回放,而不是要求患者完成额外的朗读任务。任务的约束包括说话人数量当前按一医一患设计,语言当前支持英语、西班牙语和加泰罗尼亚语,运行环境要求能处理 1 小时以上的音频并在图形处理器加速下以小于音频时长的时间返回结果,以支持在 encounter 期间参考。

工具全景:一段录音要经过哪几站才变成韵律指标?

先给出全流程的动作顺序,便于后面逐站核对。第一站是预处理的结构化:用说话人日志区分声音身份,用轮次分析建立对话结构,用语音识别把声音转成文字并与说话人时间对齐,用角色指派区分患者与医生,用语言检测选择对应模型,用音节核检测提供语速计数基础。

第二站是人工复核:把日志与轮次可视化放在面板上半部分,把语谱图与词和音节时间戳放在下半部分,加载 WAV 后可边听边看对齐是否准确,当前靠手工改输出文件修正,最常见的错误是漏检音节核,未来计划与标注工具 ELAN 双向导入导出。第三站是特征量化:初期聚焦时间和韵律侧面,包括发声时长、停顿统计、发音速率、速率变异性、话轮交接偏移,情绪音调和语调特征列为正在开发。软件用 Python 3.11.9 编写,预处理结果存为带时间标注的 JSON 格式,便于复核和下游计算。

下面这张说话人可视化图展示了第一站输出的外观,阅读时先把握时间跨度和颜色分工,再看长短块的分布含义。

看图路径: 1. 先看横轴时间从 00:00 到约 01 分,确认这是分钟级对话的说话人分布;2. 再对比上排红色块与下排蓝色块的占据位置,判断两人是否轮流说话;3. 注意中间大段空白对应的一方长时间独占,思考这与长轮次的关系;4. 观察细窄竖条与宽块的差别,区分短插入语和持续发言

原论文 Figure 2:Diarization visualization.

论文图 2。原论文 Figure 2:“Diarization visualization.”。

这张图的上排红色与下排蓝色分别代表 2 位说话人在 00:00 至约 01 分范围内的发声占据,白色为空白或对方发言。可以看到左侧蓝色有 3 个短块而红色有一个极宽的连续块,说明一方在短促问答后另一方进入长时间独白;中部 00:30 之后蓝色出现一串中等宽度块,表明话轮回到蓝色说话人并保持多轮连续发言;右侧红色仅剩细窄竖条,提示短插入或反馈性话语。这种长短对比正是轮次分析要形式化的现象:连续发声段如何合并为轮,轮内静音算停顿,轮间静音算间隙,重叠如何标记。看懂这张图,就理解了为什么后续所有韵律指标必须先按人切分时间,否则语速和话量会被混在一起。

谁在何时说话:日志切分与轮次规则如何协同?

说话人日志这一步使用开源库 pyannote.audio。动作是先用滑动窗口把音频切成时间小块,在每块内用神经网络提取代表音色的多维向量即说话人嵌入,连同持续时长一起记录,再把相似声音的块拼接合并成不同的说话人及其发声时长。白话说就是先按音色聚类,再把属于同一人的碎片连起来。轮次分析建立在日志输出之上,采用改进的会话分析框架。规则是每一时刻归属为 1 人、多人或无人。

被大于 200 ms 的静音隔开的同一说话人连续发声定义为停顿语段即 IPU,同一说话人连续的 IPU 构成一轮;重叠分为轮内重叠即在他人轮内插入,和轮间重叠即延续到下一说话人轮中;轮内静音叫停顿,轮间静音叫间隙。

说话人日志 × 轮次分析: 说话人日志负责回答谁在何时说话,把连续录音切成带说话人标签的发声段;轮次分析负责回答这些发声段如何构成对话结构,把同说话人的连续语段组织成轮次并标记停顿、间隙与重叠。二者搭配的原因是只有先把时间归属到人,才能计算分说话人的停顿和抢话,组合后新增的作用是得到可按患者单独统计的对话时间线。

沿一个样本走完这部分:输入是原始波形,日志输出是谁在何时发声的时间段,轮次模块再把这些时间段按 200 ms 阈值切成 IPU 并组装成轮,输出是带轮次标签和停顿间隙标记的时间线。这个时间线直接决定后续统计的公平性,例如患者的发声时长只累计归属患者的段,医生的提问不计入。需要指出的缺项是论文未报告日志的错误率与轮次阈值在不同语言中的敏感性分析,200 ms 是沿用的文献阈值而非本研究新搜索的最优值。

说了什么与何时说的:识别、角色与语谱校对如何衔接?

自动语音识别即 ASR 负责把声学数据转成文本,本文采用 Whisper 这个在大规模转写数据上训练的端到端 Transformer 模型,扩展包 WhisperX 提供词级和话语级的起止时间,再与日志输出对齐以标明谁在何时说了什么。未来版本计划引入蒙特利尔强制对齐器以保证正字法转写与时间的精确同步。

说话人角色指派解决日志只区分说话人 0 和 1 但不知道谁是医生的问题,当前针对一医一患的受限交互,用临床医生话语中的特有关键词做规则指派,未来对多医生或家属在场的情况计划用大语言模型按词内容分类。多语言支持通过自动检测会话语言实现,当前支持英语、西班牙语和加泰罗尼亚语,因为多步预处理依赖语言相关模型。

自动语音识别 × 强制对齐: 自动语音识别负责把声音变成文字,输出词序列;强制对齐负责把每个词和音节精确定位到时间轴上。二者搭配的原因是仅有文字无法做韵律的时长统计,仅有声学切分又不知道词边界,组合后新增的作用是形成谁在何时说了哪个词的时间标注,为语速和停顿计算提供可核对的锚点。

下面这张窄带语谱与词对齐图展示了下半部分校对面板的外观,阅读时把声学纹理与文字块对应起来看。

看图路径: 1. 先看顶部图例中说话人 0 与 1 的颜色和符号,确认蓝色为当前发言人;2. 再看中部窄带语谱图的横向谐波纹理,确认浊音段与清擦静音的交替;3. 沿底部蓝色词块从 explain 到 this 按时间顺序阅读,核对词与语谱的对齐;4. 注意 01:00 附近的竖直黑线,理解它是播放校对时的同步游标

原论文 Figure 1:Audio spectrogram (narrowband) and

论文图 1。原论文 Figure 1:“Audio spectrogram (narrowband) and”。

图中部是随时间展开的窄带语谱,深色横向条纹为谐波结构,亮色竖向间隙多对应清音或静音;底部蓝色横块为识别出的词,从 explain、to、you 到 you’ve、probably、heard、this 按时间排列;顶部图例区分说话人 0 和 1 的词与音节核符号;中部黑色竖线是播放游标,落在 you’ve 附近,说明校对时可听觉核对该词边界是否落在浊音起始处。这种声学加正字法的双重显示让复核者能发现识别错词或时间漂移。论文报告最常见的错误是漏检音节核,修正目前需手工改文件,这意味着下游语速若不经校对可能被低估。

数什么来代表快慢与乱:音节核、速率与交接间隔如何计算?

音节核检测沿用 de Jong 和 Wempe 的方法,经由语谱分析声学检测发音事件。为检验可靠性,论文在英语、西班牙语和加泰罗尼亚语上比较了声学法与基于词典的方法,报告两者高度一致,随后分析只用声学法,因为它能给出精确时间戳并容纳特殊发音。基于这些时间戳,论文定义发音速率为音节数除以总发声时长秒数;言语速率变异性采用相邻音节起始时刻的归一化成对变异指数即 nPVI,数值越大表示相邻音节时长差异越大、语流越不均匀;话轮转移偏移即 FTO 计算为相邻两轮之间的间隔,可为负表示轮间重叠、为正表示间隙、为零表示无缝衔接。

音节核 × 发音速率: 音节核指元音能量峰对应的可检测发音事件,是计数的最小单位;发音速率指单位发声时长内的音节数,是临床可解释的快慢指标。二者搭配的原因是直接数词会受词长差异干扰,而数声学能量峰更贴近实际发音动作,组合后新增的作用是用统一的声学计数得到跨语言可比的语速量。

层间转移偏移 × 言语速率变异性: 层间转移偏移负责度量轮次交接的时间间隔,为负表示重叠、为正表示间隙,刻画患者是否抢话或反应延迟;言语速率变异性负责度量相邻音节时长的不均匀程度,刻画语流是否忽快忽慢。二者搭配的原因是前者看人与人之间的时间协调,后者看个人内部的节奏稳定,组合后新增的作用是从交互和产出两个层面刻画躁狂常见的语量增多与节律不稳。

沿样本继续走:输入是已对齐的词与音节时刻,计算时先按说话人过滤出患者段,再数音节核个数除以患者发声总时长得到发音速率,再取相邻音节起始间隔算 nPVI 得到不均匀性,再取患者轮与医生轮的边界差得到 FTO。输出是分说话人的 4 个数,可直接与临床量表并列观察。这里的教学要点是速率与变异性看的是不同维度,一个人可以说得快但均匀,也可以说得平均但忽快忽慢,论文同时保留两者正是为了区分这两种临床印象。

本研究训练了什么、调用了什么?

本研究没有训练新的神经网络模型,该节必须明确说明没有训练阶段,以免误解。真实计算过程是调用已有模型做推理加规则计算:说话人嵌入网络来自 pyannote.audio 的预训练能力,识别来自 Whisper 及其时间戳扩展,音节核检测是基于信号处理的固定算法而非梯度优化,发音速率、nPVI 和 FTO 是确定性公式统计,角色指派当前是关键词规则。因此不存在本研究的梯度路径、参数冻结与更新、优化器、训练轮数或重置时机的报告,这些是具体缺项而非可从模型名称推定的实现。

论文明确提到未来才会引入蒙特利尔强制对齐器做更精细同步,以及用大语言模型做角色分类,但那是计划而非本次已验证的对照。复现时应把重点放在推理环境与版本固定上,包括 Python 3.11.9、所用预训练权重版本、语言检测模型版本和 GPU 运行时,而不是寻找训练脚本。不能把调用冻结模型等同于系统输出确定,因为解码采样、硬件与版本差异仍可能带来波动,需以人工复核面板为准。

在哪些患者、什么协议下验证:数据与条件如何交代?

论文汇总了已完成与计划中的多病种多场景应用,但给出可核对数字的主要是双相 I 型障碍的 CASLIM 研究。条件是 18 例因躁狂住院于梅奥诊所的英语患者,在治疗缓解过程中接受系列半结构化研究访谈并同步录音,同时采集临床量表评估症状存在与严重度。总量为 57 次访谈共 5.6 小时,采用被试内分析,把每人在躁狂期的言语与其自身缓解后基线比较,并在模型中调整个体差异和调节效应。

其他研究按证据分别交代:巴塞罗那医院诊所的加泰罗尼亚语和西班牙语双相 I 型人群用于跨语言初步验证;纵向门诊研究 LASSO 刚开始在梅奥常规门诊收集双相言语以推动转化和早期检测;墨西哥新莱昂自治大学和墨西哥国立自治大学附属精神病院计划在未来一年用 CASLIM 的西班牙语翻译协议收集数据,以扩展语言文化多样性并建立发作期与健康期的参考值。

谵妄部分是计划与背景论证,指出谵妄因病因治疗后多可逆、波动大且仅 12% 至 35% 被正确识别,常规人力难以近连续监测,因而提出用病房环境传感器延续类似分析,但该文未报告谵妄的定量主结果。

以下第一张表整理预处理中可运行的关键规模与阈值,阅读时注意阈值决定 IPU 切分,训练规模决定识别底座,音频长度决定临床可用性。

环节对象规模或阈值单位在流程中的作用
语音识别底座Whisper 转写训练数据量680,000hours提供多语言识别能力
临床可用性单次可处理音频长度over an hourhour覆盖多数问诊时长

表中 200 ms 决定 IPU 边界,680,000 hours 说明识别底座的数据规模,over an hour 表明工具可处理超过 1 小时的录音。需要强调 over an hour 是可用性陈述而非精度指标,不能据此推定长录音的日志准确率不变;200 ms 阈值的跨语言适用性在本文未做消融,复现时应原样保留再另做敏感性试验。

躁狂严重度与哪些时序指标一同变化:主结果如何读?

要回答的核心问题是时序韵律指标能否在个体内追踪躁狂严重度的变化。比较条件是同一患者躁狂期与自身缓解后基线的纵向对照,而非患者与健康对照的横断面分类,这减少了个人基线语速差异的混淆。指标方向需逐个理解:发音速率越高表示单位时间音节越多,速率变异性越高表示节奏越不均匀,说话时长越长表示话量越大,FTO 越小甚至为负表示交接越快或重叠越多。

论文报告在调整个体差异后,发音速率、速率变异性、话轮转移偏移和说话时长均与躁狂症状严重度显著相关,且临床医生主观评定的思维紊乱与言语紊乱的自动度量密切相关。跨语言初步结果支持这些发现也出现在西班牙语和加泰罗尼亚语中,并提示这些韵律元素可区分躁狂与抑郁期采集的言语,但该部分在本文仅为初步结果陈述,未给出完整统计表。

以下第二张表把主结果的 4 个时序指标与思维紊乱关联放在同一口径下,便于核对方向、效应与显著性。

条件指标效应值显著性比较对象与方向
躁狂严重度纵向追踪articulation rateβ = 0.24p = 0.0038同一患者基线,症状越重速率越高
躁狂严重度纵向追踪speech-rate variabilityβ = 0.23p = 0.0041同一患者基线,症状越重越不均匀
躁狂严重度纵向追踪floor-transfer offsetβ = −0.31p = 0.007同一患者基线,症状越重交接越快
躁狂严重度纵向追踪speaking durationβ = 0.54p < 0.001同一患者基线,症状越重话量越大
思维紊乱对照speech disorganizationβ = 0.97p = 0.023医生主观评分越高自动紊乱度越高

表后解释需同时看到收益与代价。收益是 4 个指标方向与临床印象一致:说得更快、更不均匀、抢话更多、话量更大,且效应在个体内可重复测量,支持作为纵向监测的候选。代价与限制是样本仅 18 例且为英语住院躁狂人群,5.6 小时总量不大,统计模型虽调整个体差异但本文未披露完整协变量与多重比较细节;β 是关联强度而非分类准确率,不能直接读成诊断正确率;初步跨语言区分躁狂与抑郁的结论尚无可运行的分类阈值和独立测试集,属于待验证而非可部署收益。

哪些对照支撑方法选择:声学数音节与人工复核为何保留?

论文虽未做传统意义的消融即去掉某模块看性能下降多少,但提供了两类方法选择的已验证对照。第一类是音节检测方法的对照:在英语、西班牙语和加泰罗尼亚语上比较声学法与词典法,报告高度可靠一致,词典与声学比值在英语为 0.967、西班牙语为 1.176、加泰罗尼亚语为 1.162 附近。选择声学法的理由是能给出精确时间戳并容纳特殊发音,这对 nPVI 这类依赖起始时刻的指标至关重要。

若改用词典法,遇到方言或含糊发音时词典无覆盖会导致计数偏差,而声学法仍可按能量峰计数,这是保留声学法的机制依据。第二类是人工复核的对照:论文明确指出计算方法可能引入影响下游的误差,因此保留可视化面板供边听边看,当前最常见错误是漏检音节核。这意味着若跳过复核直接计算,发音速率会被系统性低估,FTO 和停顿统计也可能因边界漂移而失真。

未评测的边界包括不同信噪比病房录音下的日志错误、Whisper 在重口音下的词边界漂移对 nPVI 的影响,这些在谵妄病房传感器场景中可能放大,需另行验证。

不能从本文推出什么:样本、泛化与成本缺项有哪些?

首先区分论文直接报告、有限解释与未验证推测。直接报告的是 CASLIM 的纵向关联与工具流程可运行;有限解释的是跨语言初步一致性;未验证推测的是病房传感器监测谵妄波动和用小设备随身分析的前景,后者尚未测量误判率、延迟或人力成本,不能承诺改善。相关性不是因果,语速与躁狂同变不能推出改变语速能改善病情。

缺失证据不是技术错误,但复现必须正视:角色指派当前仅靠关键词区分一医一患,多人访谈的准确率未报告;语言仅覆盖 3 种,墨西哥计划中的数据尚未采集;训练资源、推理开销、输出帧率与实际延迟分别讨论,论文只说 GPU 下分析耗时为音频时长的一小部分、可近实时返回,但未给出具体硬件型号、并发量和最长延迟分布。总体趋势不等于每组都成立,平均关联显著不代表每个患者都单调变化,个体阈值需建立个人基线后才能使用。

要复述与复现,先固定什么、再核对什么?

复现的第一步是固定信息条件:录制 WAV 格式的完整问诊音频,记录采样率与麦克风位置,固定 Python 3.11.9 与各依赖版本,记录所用 Whisper 与 pyannote 权重版本及语言检测结果。第二步是按顺序执行可核对动作:运行日志得到分说话人时间段,运行轮次规则按 200 ms 切 IPU 并组装轮次,运行识别加时间戳并与日志对齐,运行关键词角色指派区分患者与医生,运行声学音节核检测并在语谱面板上边听边看,重点补漏检的音节核,再按说话人计算发声时长、发音速率、nPVI 和 FTO 并存为 JSON。

第三步是验证:先用已知说话人轮流的短录音检查日志颜色块与实际声音是否对应,再用底部词块与语谱浊音段检查词边界是否漂移,最后用同一说话人 2 次录音检查指标稳定性。还需补的验证包括在目标科室录音环境下重测日志错误率,在目标语言下重做声学与词典计数一致性,以及建立健康期个人基线后再解读发作期变化。

代码开源、权重下载与系统可运行是三件不同的事,本文说明软件为持续开发的临床工具,未给出公开仓库链接,复现时应按论文方法自建流水线而非假设可一键下载运行。资源状态方面,ELAN 工具的引用链接当前可用,但那只是未来计划导入导出的标注工具,不是本系统本身。

何时值得尝试这种增强式韵律分析,何时不值得?

当临床问题是纵向监测同一患者的话量、语速与互动节奏变化,且有条件录音并做人工校对时,这种工具值得尝试,因为它输出可解释、可写入病历的时间结构化指标,并已在住院躁狂的个体内追踪中显示一致方向。当目标是单次录音即给出诊断标签,或在多人嘈杂病房无校对直接运行时,不值得直接套用,因为角色泛化、噪声鲁棒性和分类阈值都尚未验证。

对研究生而言,学习依赖应是先掌握日志与轮次的时间表示,再掌握识别对齐与音节计数的衔接,最后才谈与量表的关联建模,避免把 β 系数误读为准确率。论文特有的误解需要澄清:近实时是指分析耗时小于音频时长而非零延迟,支持 3 种语言是指预处理有对应模型而非在所有语言下精度相同,人工复核是方法的一部分而非临时补丁,去掉它后的数字不可直接用于临床判断。

未来工作按论文顺序是保证自动化精度、确定何种语言现象最适合作为何种疾病的标志物、验证跨语言泛化,以及定义机器与临床医生在快速演进技术中的分工。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总