英文题目:The Effect of Neck Skin Vibration on the Periauricular Acoustic Receiver
会议身份:
conference:interspeech:2026:conference-paper-id:li26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#信号处理 #发声与构音 #麦克风阵列 #语音 #声场重建
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Ruoyan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhao Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Fan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自发声耳周采集的输入是口腔辐射与颈部皮肤振动叠加的混合声场,输出是各测点相对口前参考的相对传递函数,难点在于活体中两类源始终耦合而难以分离定量。作者先用GRAS KEMAR假头口部模拟器播放20 Hz至20 kHz扫频信号建立无振动的纯口腔辐射基线,其输出作为验证仿真的对照参考。再对2名真人持续发声做多通道同步录音并以协方差特征分解估计相对传递函数,得到的实测传递进入与仿真的对比环节。接着用自研GPU加速边界元法对三维扫描头模施加口部均匀声压激励仿真纯口腔场,并以假头实测吻合验证模型后将真人实测系统性偏离归因于颈振。相对已有仅把口腔视为唯一声源的自声仿真,该研究的关键机制差异是引入颈部皮肤振动经空气二次辐射到达耳周接收器的附加路径解释,并发现越靠近颈部的耳下测点偏离越大。在人体持续发声语音评测设置下,高频能量可忽略条件的频率指标为4000 Hz,高于低频信噪比有效条件的频率指标200 Hz。结论仅适用于200 Hz至1000 Hz低频段的近耳贴肤接收场景,无法外推至高频、鼻音辐射、不同发声强度与广泛人群。其适用边界受限于仅2名受试者与未校准传感器,尚未验证更广泛人群与发声强度的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
自己说话时,耳边的麦克风到底在收什么?
输入是佩戴者自己发声,目标是解释耳机、助听器和耳挂设备上耳周麦克风收到的自发声信号由哪些物理路径构成,必须保留的信息是口部辐射不是唯一路径,颈部皮肤振动也可能辐射空气声并被耳周麦克风收到。输出是让研究生能复述何时必须在仿真中加入颈部 2 次源,何时只用口部源就够。
初学者常把语音想成从嘴里发射出来的单一声波,戴在耳朵上的麦克风只是远距离接收这个波。论文的起点是纠正这个简化:声门气流驱动声带振动后,声波在声道内共振整形,一部分从口鼻辐射出去,另一部分以压力脉动激励声道壁、喉支架和周围软组织。因为喉和下声道离颈部表面很近,内部振动会传到颈部皮肤,形成可测的表面振动。已有颈部加速度计和接触传感器的文献显示这类振动信噪比高且包含基频和谐波,但它们回答的是接触传感器能收到什么,没有回答不接触皮肤的耳周空气声麦克风会被颈部振动影响多少。
自发声 × 耳周声接收器: 自发声指说话人自己发声时声门激励经声道整形并经组织振动向外传播的过程,耳周声接收器指放在耳道旁、耳上、耳下和耳后等耳周位置的麦克风,二者搭配的理由是可穿戴设备要在离嘴较远且被头耳遮挡的位置拾取佩戴者自己的声音,组合意义在于必须把口部直达声之外的颈部振动辐射也计入自发声到耳周的传递。
学习依赖上,本节先建立两条路径的区分:一条是口部向空气辐射再经头耳散射到达耳周,另一条是组织振动传到颈部皮肤再向空气辐射到达耳周。前者是传统头相关传递函数只算的部分,后者是本文要分离的增量。后续所有实验设计都是围绕如何让第一条路径可计算、可复现,再看实测相对第一条路径多出了什么。
已有颈部振动研究与本文耳周问题的差别在哪里?
同输入的工作是用颈部加速度计、接触麦克风或柔性振动传感器估计发声声压级、声门下压或基频,输入同样是自发声,目标是把颈部振动当作干净的声门信息源,监督来自声学麦克风或气压标定。这类路线关心振动本身有多准,不关心振动再辐射到耳周空气中会给远处麦克风增加多少分量。
同目标但不同运行阶段的工作是喉麦语音增强和可穿戴拾音,目标同样是提升佩戴者语音质量,但常用做法是把喉部信号当作独立通道做均衡或生成,运行在算法端而非声场物理端。论文引用这类工作说明颈部能量集中在低频,但没有沿用它们的增强框架,而是回到物理层面问耳周空气声麦克风是否已经混入了这部分能量。
本文的差异是有源对照:用口部是唯一声源的边界元仿真作为可计算的零假设,用无组织振动的假头验证该零假设成立,再用真人打破该零假设。因此相关工作不能当作同条件基线去比谁的信噪比更高,只能用来支撑低频集中的先验和振动可测的前提。
要判断的问题:耳周多出的能量是否随位置靠近颈部而变大?
论文把问题定义为在自发声条件下,耳周声接收器收到的空气声中,有多少不能被口部辐射单独解释,以及该残差是否与到颈部的距离有关。判断标准不是绝对声压值,而是以口前麦克风为参考的相对传递函数的幅度和相位。选择相对量是为了消掉声源频谱、播放增益和朗读用力差异,保留传播和 2 次源带来的差别。
需要区分直接报告和推测:直接报告的是真人耳下位置实测幅度系统性高于仿真预测,且越靠近颈部偏离越大;有限解释是该偏离与颈部皮肤振动辐射一致;未验证的推测是该振动分量的绝对声压与颈部表面加速度之间的定量映射,原文明确说传感器未标定,所以不能给出绝对映射。
一个教学例子是把前额麦克风当作阴性对照。例子仅用于理解逻辑,不代表新数据:若多出的能量来自全局建模误差,前额和耳周都应偏离;若多出的能量来自颈部局部源,则前额保持吻合而耳周偏离。论文后续正是用这个空间趋势来支撑颈部源的判断。
三路对照如何构成一个可复述的证据链?
方法全景是 3 条线收敛到同一比较量。第一条是假头扫频实测,用装有口部模拟器的假头播放可控扫频,同步记录耳周、前额和口前麦克风,经逆扫频卷积得到脉冲响应,再做傅里叶变换得到频率响应。第二条是边界元仿真,用 3 维扫描保留耳廓细节的头模,在口部区域加均匀压力边界条件,计算外部声场到各麦克风位置的传递。第 3 条是真人稳定发声实测,记录连续朗读的多通道信号,用协方差主特征向量估计传播向量。3 条线最后都换算成相对口前参考的相对传递函数,于是幅度和相位可以直接叠图比较。
边界元仿真 × 硬壁边界条件: 边界元仿真指只离散头部表面求解外部声场的频域数值方法,硬壁边界条件指把头部表面设为法向振速为零的刚性散射体,前者负责算出口部激励到各麦克风的声传播,后者给出不含皮肤振动时的理想对照,搭配后形成口部是唯一声源的零假设,实测超出该预测的部分才被归因讨论。
为说明求解器可信,论文先做球散射基准验证。下面这张图是理解仿真精度的关键,读图时先看精度再看速度,避免把快当成准。
看图路径: 1. 先看左下面板相位随频率下降并出现折叠跳变的重合程度;2. 再看左上面板幅度三条曲线在全频段是否重叠;3. 最后比较右图两种求解器耗时随单元数增长的分叉速度
论文图 2。原论文 Figure 3:“(a) Accuracy comparison among the analytical so- lution, the self-developed BEM solver, and COMSOL for the sphere-scattering benchmark; (b) Computational time compar- ison…”。
左图显示自研求解器、商业软件与解析解在散射声压幅度和相位上三线基本重合,说明在刚性球这种有解析解的情形下数值离散和求解正确;右图显示随单元数增加到约两万,自研求解器的耗时增长明显慢于商业软件,原文报告的量级是单个头模扫频约 30 分钟。这为后文把仿真与实测的偏离归因于模型缺失 2 次源而非求解器算错提供了前提,但注意该验证只覆盖刚性散射,不覆盖皮肤阻抗和鼻孔辐射。
从一段录音到一条曲线:每个组件算什么?
沿一个样本走完流程有助于复述。输入是同步多通道录音,假头情形输入是麦克风收到的扫频响应,真人情形输入是连续朗读的时域波形。表示是频域复数传递关系,假头用逆扫频滤波器卷积得到脉冲响应,真人用短时傅里叶变换得到时频矩阵。组件是相对化操作,假头和仿真都用耳周通道除以口前通道,真人用传播向量中耳周分量除以口前分量。目标是得到与声源强度无关的相对幅度和相对相位,输出是可叠图比较的频率响应曲线。
颈部皮肤振动 × 空气声 2 次源: 颈部皮肤振动指喉部和下声道压力脉动经软组织传到颈部表面形成的可测机械振动,空气声 2 次源指该振动表面再向空气中辐射出的声波,二者分工是前者提供靠近耳周的机械激励位置,后者提供麦克风实际收到的声压增量,搭配理由是振动本身不直接等于麦克风电压,必须经振动到声辐射这一步才能解释耳周幅度抬升。
相对传递函数 × 口前参考麦克风: 相对传递函数指耳周或前额通道与口前参考通道在频域的复数比值,口前参考麦克风指放在嘴前方用作归一化基准的麦克风,前者负责消掉声源频谱和整体增益以保留传播差异,后者提供共同分母使假头扫频、真人语音和仿真可以在同一基准下比较,组合后得到可对比幅度和相位的归一化频率响应。
符号与计算目标需要讲清。假头分支的逆扫频卷积目标是把扫频激励的影响 deconvolve 掉,得到线性时不变假设下的脉冲响应;相对传递函数目标是消掉公共声源谱。真人分支假设单主导源且竞争源可忽略,把多通道短时谱写成传播向量与口部源谱的乘积,在语音主导噪声且准平稳的时段内估计空间协方差,再取主特征向量作为传播向量的估计,最后同样除以参考通道消掉任意复数尺度。原文明确给了这些公式的文字定义,本解读不另写展示公式以避免引入原文之外的符号。
组合机制上,假头分支验证传播模型,真人分支提供待检验现象,二者共用同一参考归一化才能比较。若参考麦克风本身也被颈部振动污染,相对量会低估耳周增量,论文把口前麦克风放在嘴前方并当作空气声参考,正是为了让分母以口部直达为主。
本研究有没有训练?实际计算过程是什么?
本研究没有训练神经网络,也就没有梯度路径、参数冻结与更新、优化器和早停。必须明确说明未训练的是声学模型和语音增强模型,避免把无训练误读为系统输出确定。实际计算是 3 类确定性数值处理加一类仿真求解。
第一类是扫频解卷积,对每个假头录音通道与逆扫频滤波器做卷积得到脉冲响应,再经傅里叶变换得到频率响应。第二类是真人语音的协方差估计与特征分解,对多帧短时谱估计协方差矩阵并做特征分解,取最大特征值对应的特征向量作为口部传播估计。第 3 类是相对化除法,统一除以口前参考通道。第四类是边界元频域扫频求解,头表面用三角形常单元离散并施加硬壁条件,口部区域加单位压力激励,逐频率求解外部声压。
空间协方差矩阵 × 主特征向量: 空间协方差矩阵指对多人声真人录音多帧短时频谱向量估计得到的通道间 2 阶统计,主特征向量指该矩阵最大特征值对应的特征向量,前者负责在语音主导且准平稳时段内累积相干声源的结构,后者作为口部到阵列传播向量的估计,二者组合使非平稳真人语音也能得到与扫频脉冲响应可比的相对传递函数。
缺项需要指出:原文未报告短时傅里叶窗长、帧移、频率分格和协方差平均帧数,未报告网格单元数的具体分布和口部区域划分细节,未报告振动传感器的标定曲线。因此复现时只能按原理重搭流程,不能声称与原文逐参数一致。
假头、真人和仿真各自在什么条件下测?
实验条件按问题组织:测的是相对传递函数的幅度和相位,与谁比是同位置仿真预测,公平条件是同一参考麦克风、同一麦克风贴放拓扑和同一频率轴,指标方向是幅度高于预测且越靠近颈部越高则支持 2 次源,相位保持总体趋势则说明主导仍是口部传播。
假头用带口部模拟器的假头消除试次间差异,音频接口采样率高且播放线性扫频覆盖全频带,4 个麦克风同步记录耳周两个位置、前额一个位置和口前参考。真人是 2 名受试者稳定朗读至少 30 秒,5 个麦克风同步记录耳周 3 个位置、前额和口前参考,耳周与前额麦克风都贴近皮肤。仿真用 3 维扫描头模保留耳廓,硬壁条件加口部均匀压力激励,真人头模扫频限于低中频并固定步长以控制网格与算力。
下图先建立几何对应,否则后文耳上、耳旁、耳下的比较无从谈起。导读后看图,再回到文字解释贴放如何影响结论。
看图路径: 1. 先看左侧灰色仿真头模上耳周与口部黑点的位置关系;2. 再看右侧真假头照片上前额、耳旁、耳下和口前四个红框的贴放高度;3. 确认耳周麦克风都贴近皮肤表面而口前麦克风留出声学参考距离
论文图 1。原论文 Figure 1:“1”。
左为仿真用的光滑头模侧视,可见耳周黑点与口部开口的相对距离;右为假头实物侧视,可见前额、耳旁、耳下和口前 4 个红框,耳周麦克风用胶带固定贴近表面,口前麦克风悬于嘴前。这说明前额离颈部最远,耳下离颈部最近,空间趋势的单调性正是后文归因的关键。若复现时把耳下麦克风抬高或远离皮肤,颈部增量会被低估。
下表把 3 个分支的采集与计算条件放在同一版式下核对,表前已提出比较问题与公平条件,表后将解释代价。表中数字与单位保留原文写法,裸值不擅自添单位。
| 条件 | 指标 | 假头采集 | 真人采集 | 仿真计算 |
|---|---|---|---|---|
| 接口与采样 | 采样率 | 48 kHz | 48 kHz | 不适用,频域求解 |
| 激励带宽 | 扫频范围 | 20 Hz–20 kHz | 连续朗读至少 30 s | 0–8 kHz,步长 125 Hz |
| 网格与耗时 | 单头模成本 | 不适用 | 不适用 | 少于 20,000 单元约 30 minutes |
| 通道数 | 麦克风数量 | 4 通道 | 5 通道 | 与实测位置对应 |
| 参考 | 归一化 | 口前麦克风 | 口前麦克风 | 口前位置声压 |
表后解释需要同时讲收益与代价。收益是假头扫频带宽最宽且可重复,适合验证仿真;真人覆盖真实组织振动但带宽受语音限制;仿真提供缺失 2 次源的纯口部对照。代价是三者带宽和激励都不一致,只能在重叠低频段严格比较,高频段受耳廓细节、摆位误差和语音能量不足三重影响。
至少一个未胜出项是前额通道:它在 3 分支中最吻合,恰好说明全局建模没有系统性失效,反衬耳周偏离的局部性。未评测边界是鼻孔辐射和皮肤阻抗,原文明确留待后续考虑。
主结果:谁吻合、谁偏离,偏离在哪里最大?
主结果按频率分段报告。假头在全频带的相对幅度与相位总体上仿真能复现主要趋势,前额最吻合,耳旁与耳下跟随总体趋势但波动更大,低频吻合好于高频。真人语音能量集中在低频,口前语谱在 200 赫兹以上信噪比可用,4 kHz 以上能量可忽略,1 kHz 以下成分突出,因此后文聚焦 200 到 1000 赫兹。真人前额同样吻合仿真,耳周相位总体趋势仍一致,但幅度系统性高于仿真,且耳下最高甚至超过前额,这与纯口部仿真中前额高于耳周的分布相反。
下图解释为何只能谈低频,以及纯口部模型预期的空间分布是什么。先读语谱再读声压分布,避免把高频噪声当成证据。
看图路径: 1. 先看左图语谱图在 200 赫兹以上与 4000 赫兹以上的能量分布分界;2. 再看左图 10 秒内竖条纹代表的连续朗读与间隙;3. 最后看右图 1000 赫兹仿真声压在口部、前额和耳周的颜色高低顺序
论文图 4。原论文 Figure 5:“(a) Spectrogram analysis of front-of-mouth micro- phone recordings from participant S1; (b) Sound pressure level on surface of simulated GRAS dummy head at 1000hz”。
左图是受试者口前麦克风约 10 秒语谱,横轴为时间,纵轴为频率,颜色为声压级,可见低频连续能量强,高频仅在爆破时刻出现窄条纹,4 kHz 以上大面积深蓝表示能量可忽略;右图是假头在 1000 赫兹的仿真表面声压分布,口部最红、前额次之、耳周和颈肩偏蓝绿,表示口部唯一源假设下前额应高于耳周。真人实测耳下超过前额正好反转了这个顺序,因而需要 2 次源解释。像素不能精确读数的具体分贝值不硬写,以趋势为准。
下表把频率先验与验证条件整理为可核对的宽表,表前问题是哪些频段值得比较,表后将说明支持的判断与限制。
| 条件 | 指标 | 口前语谱能量 | 皮肤振动先验 | 本研究聚焦带 | 球基准验证 |
|---|---|---|---|---|---|
| 低频下限 | 可用起点 | above 200 Hz | below approximately 2 kHz | 200–1000 Hz | radius 0.1 m |
| 高频上限 | 能量边界 | beyond 4000 Hz 可忽略 | below 1 kHz 关键 | below 1 kHz | 0.1 m 场点 |
| 显著区 | 突出成分 | below 1 kHz | 低频最显著 | 耳下抬升最大 | 全频段重合 |
| 仿真预期 | 空间顺序 | 口部最高 | 不适用 | 前额高于耳周 | 解析解一致 |
| 实测偏离 | 空间顺序 | 耳下超过前额 | 越近颈部越大 | 相位仍跟随 | 耗时更低 |
表后解释主要收益与反例。收益是低频段信噪比足够且振动先验最强,耳下偏离最大而前额不偏离,空间单调性支持颈部源。代价是该表混合了能量描述与先验描述,不能当作同一指标下的模型胜负;球基准只验证刚性散射求解器,不能证明真人头模几何完全准确。反例是耳上位置偏离小于耳下,说明不是所有耳周位置同等受影响,建模时应按位置分别处理而非给耳周统一增益。
反证:去掉颈部振动的假头是否就不再偏离?
论文没有做神经网络消融,但做了物理意义上的对照消融:假头没有组织振动,等价于去掉颈部 2 次源;仿真只设口部源,等价于关闭振动边界条件;真人保留全部路径。若偏离来自颈部,则假头对仿真应吻合,真人对仿真应在耳周偏离,且偏离随靠近颈部增大。结果正是如此,因此该对照承担了消融职责。
下面这张低频三排图是全文最强的证据闭环,读图顺序应先看阴性对照再看阳性偏离。
看图路径: 1. 先横向比较三排中前额红色点线在幅度和相位上的贴合程度;2. 再纵向看每排内耳下绿色点是否高出同排仿真虚线;3. 最后核对 200 到 1000 赫兹内相位三排是否仍保持单调下降趋势
论文图 7。原论文 Figure 7:“Measured and simulated amplitude and phase re- sponses for multi-channel relative transfer functions in the 200–1000 Hz frequency range for (a) GRAS dummy head; (b) participant…”。
三排分别为假头、受试者一和受试者二在 200 到 1000 赫兹的幅度和相位,每排上为幅度、下为相位,点为实测、线为仿真,红色为前额、蓝色为耳旁、绿色为耳下,另有品红耳上仅真人有。第一排假头红蓝绿点线基本重合且红线在上,符合口部唯一源预期;第二三排红色前额仍贴合,但蓝色与绿色点系统性高于同色虚线,绿色耳下最高,甚至高于红色前额,而相位三排都保持单调下降且趋势一致。这说明主导延迟仍由口部传播决定,多出的主要是同频能量而非全新延迟路径,与颈部表面再辐射叠加到直达声上的图像一致。
限制同样要读出:高频段原文未纳入该闭环,因为耳廓精细散射、摆位误差和语音高频能量不足会同时放大偏差;2 名受试者的耳下抬升量并不相同,提示颈部几何和组织特性的个体差异未被量化;振动传感器未标定,只能说存在可测耦合,不能给出加速度到声压的绝对传递。
哪些结论不能推广?缺了哪项标定?
直接报告的是相对传递函数层面的耦合存在性和空间依赖,有限解释是颈部振动辐射是合理解释,未验证的是绝对物理映射、个体普适性和高频行为。原文明确列出三项限制:受试者仅 2 人,颈部几何、组织特性和发音方式的个体差异会影响耦合大小;传感器未标定且本底噪声会影响真人常态音量下的测量精度;当前只关注相对耦合而非绝对加速度到耳周声压的标定映射。
相关性不是因果的提醒在此适用:耳下幅度高与靠近颈部相关,且假头对照排除了纯口部模型误差,但仍未直接测量颈部表面法向振速并将其作为边界条件代入仿真复现抬升量,因此严格因果链条待后续振动标定加仿真闭环补足。同样未测量的是误判率、延迟和算力,论文没有承诺加入颈部源后语音增强或声纹指标一定提升,也没有给出实时系统的帧率与延迟。
训练资源与推理开销需要分开讨论:本研究无模型训练开销,成本是仿真网格与扫频时间;若未来把高保真自发声传递函数用于生成训练数据,成本将转移到数据合成与增强模型训练,原文只提出方向而未给出预算。
要复现这条证据链,先做什么、记什么?
复现先做几何与参考的固定。再搭同步多通道采集,保证耳周、前额和口前麦克风同声卡同步以保留相位;记录麦克风到皮肤的距离和耳廓朝向照片,因为高频对摆位敏感;假头播放扫频时记录逆扫频滤波器版本,真人朗读时记录朗读文本、用力要求和有效时长。仿真侧保留 3 维扫描网格、口部区域划分、硬壁设置和频率步长,网格少于两万单元时的单头模耗时可作为预算参考。
计算侧按分支复现:假头分支做逆滤波卷积加傅里叶变换,真人分支做短时谱加协方差加特征分解,统一除以口前参考得到相对传递函数。核对时先看前额是否吻合,若前额都不吻合应先查几何、摆位和参考位置,而非直接归因颈部;前额吻合而耳下系统性偏高且越近颈部越高,才进入颈部源讨论。
还需补的验证是振动标定:用标定过的加速度或振速传感器测颈部表面法向振动频响,将其作为边界条件代入声场仿真,看是否能定量复现耳下抬升量;同时考虑皮肤阻抗和鼻孔辐射。资源状态方面,本次未发现来源绑定且完成验证的开源代码、模型或数据,不得声称已公开,可运行性应理解为按上述步骤自搭系统而非下载即用。
何时值得在耳周建模中加入颈部振动?
当任务是佩戴者自发声在耳周的拾取、仿真或合成,且工作频段包含 1 kHz 以下,且麦克风位于耳下或耳旁等靠近颈部的位置时,值得把颈部振动当作 2 次空气声源加入。此时若仍只用口部辐射建模,会低估耳周低频能量并误判前额与耳周的相对高低。前额位置或远离颈部的耳上位置受影响较小,可暂用口部唯一源近似,但应注明位置适用边界。
论文特有的误解需要澄清:耳周多出的低频不是录音噪声大,而是在同一口前参考下归一化后仍存在的系统性幅度增量;相位总体跟随仿真不代表没有 2 次源,而是说明 2 次源与直达声同频叠加而非引入全新主导延迟;假头吻合不代表仿真完美,只代表在无组织振动时口部唯一源假设成立,真人偏离才暴露缺失的物理。
收束回答:问题是耳周自发声是否混入颈部辐射,方法选择是假头加仿真构成零假设、真人打破零假设,最强证据是 200 到 1000 赫兹内耳下实测超过仿真甚至超过前额且越近颈部越大,主要代价是 2 人样本、未标定振动传感器和高频未决。若做可穿戴定向拾音与增强,下一步应先做颈部振动标定与振动声耦合仿真,再谈数据生成与算法收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



