英文题目:Speaker or Language? Explaining Variance in Charismatic Prosody Across Luxembourgish and French

会议身份:conference:interspeech:2026:conference-paper-id:hosseinikivanani26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #韵律 #多语言 #语音 #语音属性识别

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Nina Hosseini-Kivanani:机构信息未能从会议 PDF 纯文本可靠映射
  • Nafiseh Taghva:机构信息未能从会议 PDF 纯文本可靠映射
  • Peter Gilles:机构信息未能从会议 PDF 纯文本可靠映射
  • Oliver Niebuhr:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文输入为10名卢森堡双语政客在公共演讲等场景中每人卢森堡语与法语各20句共400句自发话语,输出为说话人与语言对魅力韵律方差的相对解释量及差异方向,难点在于自然语境下内容与语用功能难以跨语言对齐。方法链分三步:先筛选高度可比的自发语句并经LuxASR转写与WebMAUS对齐及人工校对,再用ProsodyPro提取基频、强度与音质等41个声学韵律特征,最后经主成分分析可视化并以线性混合效应模型分离说话人随机截距与语言固定效应。与既有单语魅力研究相比,关键机制差异在于将语言声望与身份功能作为系统性嗓音设置检验,而非仅比较整体韵律强度,因而能区分个人特质与语言选择效应。在400句双语政治演讲语料的检验条件下,第一主成分的方差解释率指标为31.4%,高于第二主成分的方差解释率指标16.8%。该结论仅适用于政治公共演讲且未经感知实验验证,无法外推至日常对话或其他人群。跨人群与日常对话场景的适用边界尚未验证且受限于单一政治语料与声学分析。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要解释的魅力韵律方差从哪里来?

这篇解读的输入是会议论文正文给出的研究设计、特征定义、统计模型与结果数值,目标是让刚进入语音音乐音频领域的研究生能复述方法并判断结论的边界,必须保留的关键信息是被试构成、语料规模、特征数量、建模公式结构与方差分解数字,输出是 1 篇按学习依赖展开的中文技术解读。

魅力言语在这里不是抽象赞美,而是指听众从声音中感知的可信、有活力、有说服力的印象。已有政治演讲与商业演讲研究把这种印象与可测量的声音动作联系起来:更高的基频水平与变化、更大的基频范围、更强的强度动态、更清晰的时间组织、更少的迟疑,以及与频谱倾斜有关的嗓音质量变化。初学者容易把魅力理解为嗓音好听,论文的起点是把它操作化为多维声学韵律模式,而不是单一音高或音量。

魅力言语 × 声学韵律特征: 魅力言语负责定义听众感知的目标印象,即可信、有能力、有感染力的说话风格;声学韵律特征负责把这种印象翻译成可测量的声音操作,如基频水平与变化、强度动态、时长组织和嗓音质量。本研究把二者搭配的原因是已有文献显示魅力不是单一线索而是多维声学模式,组合意义在于用 41 个已验证相关的特征去检验语言切换是否系统性移动了这些魅力设置,而不是只看某一个音高值。

卢森堡提供了 prestige 不对称的双语检验场。卢森堡语与日常口语互动、地方归属和真实感相连,法语与行政、法律和高 prestige 机构域相连,德语主要在书写教育媒体中重要而口语自发互动中相对次要,因此本研究只比较卢森堡语和法语。竞争性预期很直接:在法语中为贴合高 prestige 规范而增强魅力线索,还是在卢森堡语中因群内亲近与真实而呈现更突出的魅力线索。论文把这个问题拆成两个可检验问题:语言是否系统性改变魅力相关线索的方向,以及语言解释的方差是否大于同性别说话人之间的个体差异。

相关路线:单语魅力研究与双语韵律研究各自缺了什么?

魅力声学路线已经积累了方向性证据。正向关联包括基频水平与变异性、基频范围、强度水平与变异性、 utterance 的时程旋律动态塑造;负向关联包括较低的短语末基频、较短的短语时长与魅力评价正相关,以及与频谱倾斜有关的长时谱斜率、H1-H2 或 H1-A3 差值越大魅力越低,即更浅的谱斜率与更小的谐波幅度差对应更高魅力;填充停顿则与说话表现负相关,越少越短印象越好。总体图景是增强韵律努力与动态、减少迟疑、时间组织清晰。

双语韵律路线则报告同一说话人在两种语言中会出现音高范围、时间组织与嗓音质量的系统位移,既可能来自语言结构约束,也可能来自正式礼貌等社会索引意义,声源特征与频谱分布也会跨语言移动。但魅力研究多用单语者与准备或半控制 speech,对自发双语 speech 中语言选择如何重塑魅力韵律几乎没有直接证据。

声望语言 × 身份语言: 声望语言指在卢森堡承担行政法律与高 престиж 机构功能的法语,预期与正式、有礼、克制的声音设置相连;身份语言指承担民族认同与日常口语互动的卢森堡语,预期与亲近、真实、有投射力的声音设置相连。搭配研究的原因是同一批人在 prestige 不对称的双语环境中公开使用两种语言,组合意义在于检验魅力线索是向 prestige 规范增强还是向群内归属增强,从而把社会语言学功能与频谱和韵律位移对应起来。

因此本研究的增量不是再报告一个魅力相关系数,而是把同一批人在高度可比交际情境下的两种语言产出做被试内比较,并用方差分解回答谁更大。这要求语料在场合、听众、话语功能上尽量对齐,要求特征覆盖已有魅力文献的核心维度,要求统计能同时分离说话人与语言。

任务与问题:RQ1 和 RQ2 到底在比什么?

任务是解释魅力韵律方差:给定自发政治演讲句子,量化说话人身份与语言选择各自贡献了多少可测声音变化,并判断语言位移的方向。输入是一个句子级别的观测,输出是 41 个标准化声学韵律特征上的语言效应值与方差份额。

RQ1 问说话人在说法语与说卢森堡语时是否系统性实现不同的魅力相关线索,方向是 prestige 语言更强还是身份语言更强。这是 1 个方向性检验,需要逐特征报告法语减卢森堡语的效应,并控制性别与句长。RQ2 问在其他交际条件 otherwise comparable 下,语言解释的方差是否大于同性别组内说话人之间的差异,换句话说同一人跨语言的差异是否大于同一语言内人与人之间的差异。这是一个量级比较,需要说话人组内相关与语言边际决定系数的并置。

教学例子:想象同一位部长先用卢森堡语谈社区活动,再用法语谈司法程序。如果只比较 2 次录音的平均音高,会混入她当天状态与话题差异;论文的做法是每人各取 20 句、共 400 句,用随机截距吸收她稳定的个人基线,再看语言平均位移是否在多人中方向一致、幅度多大。例子不附加数值效果,只说明为什么需要被试内设计与方差分解。

方法全景:从 400 句自发话语到方差分解要走哪几步?

全流程可以沿一个样本走完。取某位女性部长的一句卢森堡语自发陈述,先从 RTL 档案视频中截取对应片段并转为单声道 16 kHz 音频,再做正字转写与句子边界标注,接着用 ProsodyPro 脚本提取基频、强度、时长与嗓音频谱度量,最后把该句的 41 个特征值放入以句子为观测的混合效应模型,估计语言效应与说话人方差。同一说话人的法语句子走完全相同流水线,区别只在语言标签不同。

表示层面是句子级特征向量,不是波形端到端表示。组件层面分为语料构造、转写对齐、特征提取、统计建模 4 个模块。目标层面不是训练分类器预测魅力评分,而是描述与分解已有魅力相关特征的变异来源。输出是每个特征的语言 Cohen’s d、显著性与方差份额,以及合成魅力指数的语言主效应。

关键控制是可比性:所有材料来自公开政治或机构场合的自发非朗读 speech,包括演讲、新闻发布、访谈或议会辩论,内容不平行因为场合不同但在风格与领域上可比;含重叠说话、背景噪声、笑声咳嗽等突出非语音发声的片段被排除;句子被定义为语调与句法上连贯的单位,依据可听韵律边界并参考转写标点人工切分。这种自然主义数据不可避免有情境变异,作者明确这是 ecologically valid 条件下的 principled 被试内比较,而不是实验室平行文本朗读。

特征与工具:41 个度量如何覆盖旋律与声源?

特征提取用 Praat 的 ProsodyPro 脚本,它提供适合统计分析的离散度量流水线。基频域包括最大最小平均中位 F0、F0 范围、F0 excursion、句末 F0、F0 最大值时间位置等;强度域包括平均强度;时长域包括区间时长与基于标注区间的派生度量;嗓音与频谱域包括生物信息维度度量,如 H1-H2、H1-A3 等谐波幅度差、谱斜率指标如 Hammarberg 指数与谱重心、倒谱峰突出度、抖动与微颤、谐噪比、各频带能量分布。这些度量共同捕捉韵律与发声的多方面。

基频 × 嗓音质量: 基频分工是刻画旋律线的高低、范围、 excursion 大小和句末边界调,如平均 F0、中位 F0、F0 最大值位置与句末 F0;嗓音质量分工是刻画声门发声方式与频谱倾斜,如抖动、微颤、谐噪比、H1-H2、Hammarberg 指数和各频带能量。二者搭配的理由是魅力文献同时强调动态的时程旋律塑造和清晰有力的发声设置,组合后才能区分法语偏礼貌克制的发声与卢森堡语偏在场感强的频谱是来自旋律还是来自声源。

转写与对齐的具体动作值得复述。先用 LuxASR 系统对卢森堡语与法语片段自动生成正字转写,人工检查并纠正明显识别错误;再在 Praat 中细化每对说话人语言组合的 20 加 20 句边界;接着用 WebMAUS 以语言特定的音系模型做句子级自动切分与标注,所有自动边界再对照波形与宽带语图按已确立的语音切分标准人工复核调整,最后导出为 Praat TextGrid。这种语言特定强制对齐加人工复核的安排理由是两种语言音系不同,不能用同一模型硬切,否则时长与 F0 区间度量会系统偏移。

建模前每个特征检查离群与明显伪迹,偏态严重者做对数变换,然后在全数据集上标准化到零均值单位方差。这样固定效应估计可以直接读成条件之间的标准差差异,为后续 Cohen’s d 解释铺路。

被试与材料:10 人 400 句的平行结构如何构成?

被试是卢森堡 10 名高知名公众人物,5 男 5 女,均为卢森堡语法语功能双语并在公开交际中常规使用两种语言,包括首相、部长、议员、市长与欧洲议会议员等现任或前任职务。数据来自 RTL 档案并获许可使用。

材料结构是严格的被试内平行:每人 20 句自发卢森堡语句子加 20 句自发法语句子,共 400 个句子 token。句子内容跨语言不平行但在风格领域可比,全部为自发非朗读。这种设计让语言比较不依赖不同人之间的比较,而是同一人两种语言的配对位移,再用随机效应吸收个体基线。

初学者常问为什么不用平行文本朗读来控制内容。论文的选择是生态效度优先:政治魅力的真实使用就是自发演讲,朗读会抹掉填充停顿、边界调与发声设置的自然变异。代价是话题与话语结构差异无法完全消除,后续需要用时长协变量与话语结构建模来缓解,作者在展望中也承认这一点。

没有神经网络训练时,计算到底发生在哪里?

本研究没有训练神经网络、没有优化器更新权重、没有梯度路径与早停,也没有冻结与微调的区分。该节必须明确这一点,真实计算是统计建模与降维:主成分分析、无监督的标准化变换,以及线性混合效应模型的参数估计与方差分解。

说话人随机截距 × 语言固定效应: 说话人随机截距分工是吸收每个政治人物稳定的基线差异,允许同一个人所有句子上下浮动但共享一个均值偏移;语言固定效应分工是估计在控制性别和句长后法语相对卢森堡语的平均标准差位移。搭配理由是同一说话人在两种语言中重复出现,必须先把个体签名分离出来,语言位移才不会被个体差异污染,组合意义就是方差分解与语言显著性检验可以在同一模型中同时得到。

基线模型对每个特征单独拟合,形式为特征约等于语言加性别加句长加说话人随机截距。从该模型取出说话人随机项方差与残差方差计算说话人组内相关,反映稳定说话人之间差异占总方差比例;语言贡献用同一模型的边际决定系数与三型平方和估计,从而在 41 个特征上比较说话人与语言的方差份额。为回答 RQ1 再扩展出语言乘性别交互模型,语言固定效应在 z 分数尺度上捕捉法语与卢森堡语平均差异,交互检验该差异是否依赖性别,每个特征报告估计、标准误与基于 Satterthwaite 自由度的 p 值,语言主效应的 p 值再经 Benjamini-Hochberg 错误发现率校正以应对 41 重检验。

主成分分析 × 组内相关系数: 主成分分析分工是把 41 维标准化特征压缩到 2 维做可视化总览,看句子是按说话人聚类还是按语言分带;组内相关系数分工是对每个特征定量回答有多少总方差来自稳定的说话人之间差异。搭配原因是可视化只能给直觉而不能给每个特征的比例,组合后先用散点判断全局结构,再用中位 0.56 等数值确认说话人主导不是某几个特征的假象。

主成分分析先对 41 个 z 分数特征运行,前两个成分分别解释总方差的 31.4% 与 16.8%,描述性用于可视化句子按说话人与语言的聚类,以及识别驱动主要韵律对比的特征束。核心推断仍靠逐特征混合模型,而不是靠主成分得分做检验。未报告的缺项是求解器细节与随机效应方差的置信区间,论文只给出点估计与分布概括,不能从中推定个体排序的显著性。

实验条件:比较是否公平、指标方向如何读?

公平条件的核心是同一人、相似场合、相似听众、相近话语功能、自发非朗读。转写用同一 LuxASR 加人工纠错流程,对齐用同一 WebMAUS 加人工复核流程,特征用同一 ProsodyPro 流水线,建模对所有特征统一做标准化与同一固定随机结构。这种统一流水线保证语言差异不是工具切换造成的。

指标方向需要分开读。Cohen’s d 定义为法语减卢森堡语,正值表示法语更高,负值表示卢森堡语更高;组内相关越大表示该特征越像说话人签名;合成魅力指数把 6 个已确立线索按魅力方向对齐后平均,包括中位音高与 excursion 大小、Hammarberg 指数、低频能量、抖动与微颤,值越高表示设置越偏魅力方向,但这只是基于文献相关性的构造指数,不是听众实测评分。

下面第一张表把可运行的实验配置与关键规模数字放在同一处,便于复现时逐项核对条件是否一致。

条件指标基线规模本研究配置比较对象
说话人人数与性别10 人5 女 5 男同性别组内比较
语料每人每语言句数20 句卢森堡语 20 加法语 20被试内配对
语料总句子数400 句400 个观测41 特征建模
特征魅力相关维度41 个基频强度时长嗓音频谱逐特征混合模型
音频采样与声道16 kHz单声道 16 kHz全库统一

表前提出了比较问题:语言位移是否在可比场合与统一流水线下依然存在,公平条件是同一人配对与同一工具链,指标方向是 d 正为法语高、ICC 高为个体稳定。表后需要强调代价:内容不平行带来话题混杂,句长只作为线性协变量控制而话语结构未显式建模,10 人单言语社区限制了向其他群体与场合的推广。未胜出项是德语被排除在比较之外,尽管卢森堡官方三语,但论文明确德语在自发口语互动中相对次要,因此结论不能外推到德语 prestige 效应。

全局结构:说话人主导与语言小位移如何同时成立?

先看韵律空间的总览。主成分前两轴共解释约一半以下方差,法语与卢森堡语句子沿第一主成分形成部分重叠的条带,卢森堡语 token 向更高 PC1 方向偏移,但两种语言大幅重叠,说明语言引起系统但相对温和的整体位移,而不是彻底分离的两个簇。

看图路径: 1. 先看左图 A 横轴 PC1 与纵轴 PC2 的百分比标签,确认第一主成分解释力最大;2. 再对比红色法语句子点与蓝色卢森堡语句子点沿 PC1 的左右错位与重叠带;3. 最后看右图 B 纵轴说话人 ICC 分布,确认白色中位线与红色 50% 虚线的位置关系

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

左图 A 显示红色法语点偏左、蓝色卢森堡语点偏右但中间大量交错,右图 B 显示 41 个特征的说话人组内相关分布中位线在 0.56 附近,红色 50% 虚线以下仍有不少低 ICC 特征点,说明典型特征一半以上方差来自稳定说话人差异,但也有少数特征个体稳定性很低。像素细节支持正文判断:句子主要按说话人聚类,语言只是次要分带;箱体与小提琴分布同时显示最稳定的线索如中位平均 F0、250 Hz 能量与多个中频能量级的说话人方差份额在 70% 到 80% 左右,而语言中位只占 0.5%。

这回答了 RQ2 的量级问题:说话人身份是迄今主导的变异来源,语言解释很少。但少不等于无,下一节看哪些维度出现了系统位移。

语言位移:法语高的两项与卢森堡语高的十六项是什么?

在控制语言性别及其交互并以说话人为随机截距的模型中,经错误发现率校正后 41 个特征中有 18 个显示显著语言效应。其中只有微颤与句末 F0 在法语中可靠更高,效应量分别为 0.90 与 0.68,指向法语句末音高略高与幅度微扰略大,并伴随嗓音清晰度的微弱趋势如倒谱峰突出度与 Hammarberg 指数的正向但非显著位移。

相反 16 个特征在卢森堡语中更高,包括 250 Hz 附近低频能量带与 500 到 3750 Hz 之间几乎所有长时谱带,负向效应量很大,例如 2750 Hz 处负 1.67、2500 Hz 处负 1.62,以及 F0 最大值时间的适度位移。方向与幅度提示卢森堡语频谱平衡更亮、能量更高,而法语相对频谱阻尼。语言乘性别交互在校正后无一存活,因此语言差异方向对男女说话人相似。

下面第二张表把可运行策略的实际数字并置,数据表不能替代结果表,这里直接比较语言效应量。

条件指标法语更高项卢森堡语更高项比较对象
嗓音微颤 d0.90—法语减卢森堡语
旋律句末 F0 d0.68—法语减卢森堡语
频谱2750 Hz 带 d—-1.67法语减卢森堡语
频谱2500 Hz 带 d—-1.62法语减卢森堡语
合成魅力指数 d-0.03p 0.89无语言主效应

表前比较问题是语言位移是否集中在特定声学域,公平条件是同一混合模型结构与错误发现率校正,指标方向是 d 正为法语强、负为卢森堡语强。表后解释主要收益与代价:收益是定位到嗓音与频谱域的系统位移而非全局韵律缩放,反例是合成魅力指数语言主效应接近零且无性别交互,说明逐特征差异没有合成为一方的全局魅力优势。未胜出项是大量基频均值与嗓音谐波差等特征在校正后非显著,不能把灰色点的微弱趋势当作法语更清晰的证据。

反证与消融:去掉什么后结论会动摇?

论文没有神经网络消融,但有 3 类等价的反证检验。第一是多重检验校正:若不做 Benjamini-Hochberg 校正,会有更多特征看似显著,但校正后只剩 18 个,这防止把 41 次检验的假阳性当作语言 prestige 效应。第二是性别交互:加入语言乘性别后无一交互存活,说明观察到的方向不是某单一性别驱动,若去掉性别协变量则可能把男女基频基线差异误读为语言差异。第三是合成指数:把 6 个魅力线索按魅力方向对齐平均后语言效应消失,这反证了逐特征显著不等于全局魅力一方胜出。

下图把 41 个特征的效应量放在同一坐标下检验,红色显著只有顶部两条,蓝色显著集中在底部频带,中间大片灰色非显著构成失败条件的可视化。

看图路径: 1. 先沿横轴 Cohen’s d 正负方向确认右侧为法语更强、左侧为卢森堡语更强;2. 再数顶部红色显著条只有两条,其余显著蓝色条集中在底部频带区;3. 最后核对图例中显著 18/41 与非显著 23 项的三分法是否与正文一致

原论文 Figure 2:Language effects across prosodic features.

论文图 2。原论文 Figure 2:“Language effects across prosodic features.”。

该图可见元素支持上述判断:横轴零线两侧方向明确,顶部标注显著 18/41,非显著 23 项的灰色棒虽有一定长度但未通过错误发现率阈值;蓝色频带条长度普遍超过 1 个标准差,红色两条也在 0.6 以上,说明显著项不是边缘显著。需要警惕的误读是把句末 F0 更高直接当作法语更有魅力,原文明确这很可能受法语语调音系中高短语末边界调影响,应理解为语言特定音系贡献而非风格选择,相关性也不是因果。

边界与代价:哪些结论不能直接拿去用?

直接报告的是声学产出差异,不是听众感知的魅力评分。基于已确立的声学参数与感知魅力的相关,作者预测该库中卢森堡语产出平均会被判断为略更有魅力,但这属于有限解释而非实测结果,检验它需要专门的感知实验。把自动声学差异当作人评胜负是常见误用,本研究没有提供误判率、延迟或成本等部署指标,也不能承诺切换语言能改善实际说服效果。

样本边界同样明确:仅 10 名高知名政治人物、单一言语社区、仅政治演讲;自然主义内容不平行,话语结构未显式建模,随时间展开的魅力策略无法捕捉。训练资源与推理开销在此不适用,因为没有模型训练,但复现仍需 Praat、ProsodyPro、WebMAUS 与 LuxASR 的运行环境与人工复核时间。总体趋势不等于每组每步成立:说话人主导是跨特征中位结论,个别特征说话人方差份额低至 0.01,语言中位 0.5% 也不代表每个频带都小,频带效应量可达 1.6 以上。

资源状态是正文开源声明的唯一依据:本次未发现来源绑定且完成 HTTPS 状态验证的资源,不得声称代码模型或数据已公开。匿名链接仅指向 41 个特征清单,不能当作可运行系统。

复现先做什么:能一步步重放的最小动作集?

先按被试内结构重建语料:为每位说话人各收集 20 句卢森堡语与 20 句法语自发政治话语,确保公开机构场合、自发非朗读、排除重叠噪声与突出非语音发声,按语调句法连贯切分句子。然后统一转码为单声道 16 kHz,用 LuxASR 生成两语正字转写并人工纠正明显错误,再用 WebMAUS 语言特定模型做句子级强制对齐,对照波形与宽带语图人工调整边界并导出 TextGrid。

接着用 ProsodyPro 提取 41 个基频强度时长与嗓音频谱度量,检查离群与伪迹,必要时对数变换并全库标准化。统计时对每个特征拟合特征约等于语言加性别加时长加说话人随机截距的线性混合模型,计算说话人组内相关与语言边际决定系数;再拟合加入语言乘性别的模型,用 Satterthwaite 自由度检验语言效应并做 Benjamini-Hochberg 校正;最后按文献方向对齐六线索构造合成魅力指数并检验语言主效应。

还需补的验证是感知实验:招募不了解说话人身份的听众对两语产出做魅力与正式礼貌评价,检验声学预测是否成立;扩展到更多说话人群体与交际场合,并显式建模话语结构与话题,以分离 prestige 语用设置与音系结构约束。

何时值得尝试这种双语魅力分析?

当研究问题是同一人在 prestige 不对称语言间是否调整声音社会意义,且能获得高度可比的自发语料时,这套方差分解值得尝试。它用随机截距先固定个人签名,再用固定效应估计语言位移,避免把个人音色当作语言效果。预期收获不是找到一方的全局魅力优势,而是定位到嗓音与频谱设置的细微但一致的位移:法语偏克制有礼的声音设置,卢森堡语偏投射在场的频谱轮廓,这与前者机构权威正式、后者非正式真实群内归属的社会语言学功能相吻合。

不值得尝试的情形是只有朗读平行文本或只有单语者,此时语言效应与内容或个体完全混杂;也不应把频带能量更高直接等同于魅力更高,因为句末 F0 等位移可能只是音系边界调,频谱差异也可能包含通道与话题残留。实践格言是语言切换不会把弱演讲者变成强演讲者,说话人主导的结论与公共演讲经验一致,语言只是叠加在个人签名上的社会语用微调。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总