英文题目:Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá

会议身份:conference:speechprosody:2026:conference-paper-id:osakuade26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#向量量化 #韵律 #语音 #音频分类

评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Opeyemi Osakuade:机构信息未能从会议 PDF 纯文本可靠映射
  • Simon King:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为普通话与约鲁巴语元音段的冻结自监督连续表征,输出为音位与词法声调类别,难点在于量化后声调等超音段信息比音位信息丢失更快。先用冻结的MandarinHuBERT与AfriHuBERT从语音中抽取帧级隐向量,得到同时保留音位与声调的连续表征,再将其送入量化环节进行离散化。再用经典K均值、神经VQ/RVQ及残差K均值等量化器把上述隐向量转为离散语音单元码本向量,输出码本向量序列以进入探针评测。最后在强制对齐得到的元音段上训练轻量探针分类器,帧序列用单层LSTM加线性头、单向量用逻辑回归,输出加权F1分数以比较音位与声调保留度。关键差异是残差K均值先在均值池化段上做50类粗聚类吸收音位身份,再对残差做450类细聚类回收声调,与单层平面码本形成粗到细对照,其实际意义在于把方差大的音位与方差小的声调分层建模,避免距离或重构目标被音位主导。在AISHELL-1普通话元音探针评测设置下,深层残差向量量化的Tone F1分数为0.82,高于经典K均值的Tone F1分数0.70。结论适用边界受限于仅做元音探针分类而尚未验证语音合成或语言建模等下游任务,也尚未验证对重音与节奏等广义韵律的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?为什么声调值得单独拿出来检验?

这篇解读的输入是会议论文正文证据,不附带可验证的代码与数据链接,本次也不能确认任何外部资源可达,所以只讲论文内部报告的方法与数字。目标读者是刚进入语音与音频方向的研究生,目标是把论文的整条链路复述到可核对:它研究什么任务,用什么数据与模型,量化方法如何变化,探针如何测量,以及哪些结论有数字支撑。必须保留的信息包括两种语言与语料规模、两种自监督模型、量化配置与码本量级、探针类型与评价指标、关键 F1 数字及其比较条件。

要理解这项工作,先把白话与术语对齐。自监督学习是用无标注语音做掩蔽预测或重构来学习表示的方法,英文是 self-supervised learning,缩写是 SSL;它输出的连续帧向量叫作自监督隐变量。离散语音单元是把这些连续向量聚类或量化为有限符号的方法,英文是 discrete speech units,缩写是 DSU;下游语言模型更喜欢符号序列,因为文本与语音可以放在同一词表里建模。

声调是普通话与约鲁巴语中区分词义的超音段特征,英文是 lexical tone;它不是某 1 帧的绝对音高点,而是跨越元音或音节的一段相对变化,需要时间上下文才能感知。论文选择声调作为探针对象,正是因为它能暴露离散化是否把随时间展开的弱变化丢掉了。

一个具体样本可以帮助建立直觉。假设输入是一段普通话音节录音,模型先输出每 20 毫秒左右 1 帧的连续向量,同一元音对应一串向量;若直接用这些向量训练分类器,音素与声调都可能分得很好。若把每 1 帧独立映射为 500 个符号之一,下游只看到符号对应的质心向量,音素身份大体还在,但同一元音内部细微的基频走势可能被同一个质心抹平。教学例子到此为止,例子中的帧长与效果数字仅为示意,不代表论文的测量值。

这项工作站在哪条研究路线上?

论文处在离散单元与韵律表征的交叉点上。一条路线关心如何从自监督表示得到更适合语言模型的符号,包括用 K 均值、向量量化与残差量化压缩语音,同时归一化说话人与信道变化。另一条路线关心自监督表示是否编码了音素之外的信息,例如词汇、句法与韵律结构。论文引用了 ToneUnit 等前期工作,指出连续隐变量里存在声调信息,但 K 均值后保留不好;也引用了把声调编码作为研究对象的多语言分析。

同输入同目标的对照因此很清楚:同样以声调语言语音为输入,同样问声调是否可分,连续隐变量基线与不同量化后表示形成可比条件。论文没有把类别差异当作胜负,而是把量化方法作为唯一实验变量,数据与冻结的自监督模型保持固定,这样探针分数的变化才能归因于量化策略本身。这种设计对初学者很重要:不要把自监督模型换了、数据换了、探针也换了之后再比较码本,那样无法定位损失来自哪里。

论文要回答哪两个 linked 问题?

论文把现象收敛为两个相连的问题。第一,量化为什么损伤声调信息?作者的有限解释是音素变化在隐变量空间中的幅度或方差更大,无论基于距离的 K 均值还是基于重构的神经向量量化,都会被主导成分牵引。第二,能否用更好的量化减轻这种损伤?作者尝试了 3 条路线:帧级神经向量量化器、考虑时间上下文的段级方法、分层或残差的从粗到细方法。

需要区分论文直接报告与待验证推测。直接报告的是探针分数在量化后声调掉得比音素多,以及多级方法部分挽回声调。有限解释是音素方差主导量化的说法,它与残差实验的现象一致,但论文没有直接测量隐变量空间中音素与声调方向的方差分解。待验证的是声调结论自然推广到韵律的说法,作者明确说这是信念而非本工作测量的部分,解读时应保留为可能,不能当作已证明。

整条管线如何从波形走到探针分数?

管线可以沿一个元音样本走完。输入是 16 千赫重采样的语音,先经过冻结的自监督模型得到帧级连续向量;再按强制对齐找到元音段,可选地对段内多帧做平均池化得到段向量;接着用某种量化方法把向量替换为码本中的质心或重构向量;最后用探针分类器只在元音上预测音素身份与声调类别,用加权 F1 评价。量化方法是唯一变量,数据划分与模型冻结,探针只探测向量而不探测整数编号本身。

自监督隐变量 × 离散语音单元: 自监督隐变量负责保留连续帧级声学细节,包括音素差异和基频高度与走势等声调线索;离散语音单元负责把这些连续向量映射为有限词表符号以便语言模型使用;两者搭配的理由是下游需要符号序列,但组合新增的作用是压缩与归一化,也带来了信息取舍,论文显示这种取舍优先保留了方差更大的音素结构而弱化了声调。

论文强调探测的是质心背后的向量而非整数索引,这一点对复现很关键。如果直接把整数当作类别特征输入线性模型,与把质心向量输入模型,得到的几何关系不同。论文选择后者,意味着探针看到的是量化后的连续近似,而不是纯符号。这样做的好处是保留了码本几何,更接近下游使用码本嵌入的方式;代价是它不是对符号序列建模能力的直接测量,解读时不能把它等同于语言模型任务的成败。

四种量化组件各自做了什么计算?

第一种是经典 K 均值基线,直接对帧级隐变量聚类,得到 K 个质心,每帧用欧氏距离最近的质心替换。它把帧看作独立样本,不利用段内时序。实现上简单,词表大小就是 K,下游词表压力直接来自 K。

第二种是神经向量量化与残差向量量化,遵循 RepCodec 结构,用小编码器加量化器加解码器重构隐变量。单层向量量化用 500 条码本,残差版本有两种配置,分别是 250 乘 2 级与 125 乘 4 级。训练完成后保留编码器与量化器用于离散化。与 K 均值的距离聚类不同,它的优化目标是重构,但论文发现它同样受主导成分影响。

K 均值量化 × 残差 K 均值: K 均值量化负责按欧氏距离把每 1 帧独立归入最近质心,1 次完成全部压缩;残差 K 均值负责先用粗量化拿走音素身份,再对残差做第二次聚类;搭配理由是若音素方差主导距离,单次聚类难以分出声调,组合新增的作用是让第二级在剥离音素主成分后专门组织声调相关剩余变化。

第三种是分段变体码本,英文是 Segmentation-Variant Codebooks,缩写是 SVC。它为每 1 帧分配两个质心,一个来自帧级码本,一个来自对应音素级池化码本,再把两个质心平均得到融合表示。它试图同时纳入细粒度帧信息与段上下文,但平均操作本身也可能平滑掉细节。

第四种是残差 K 均值,先对平均池化后的音素段做粗量化,K 取 50 以大致对应音素数量,得到音素身份码本;再用原始隐变量减去所属音素级质心得到残差,对残差用 K 等于 450 再聚类,总码数 50 加 450 等于 500,与其他 500 量级条件可比。段级版本与帧级版本的区别在于第一级与第二级作用的粒度,论文报告段级版本更好。

向量量化 × 残差: 向量量化负责用编码器加量化器加解码器的重构目标学习单层码本;残差负责把第一级重构不掉的误差逐级再量化;搭配理由是单层码本仍受主导成分牵引,组合新增的作用是用多级从粗到细保留单层难以容纳的声调变化,论文中更深的层级配置保留声调更好。

帧与段的差异值得单独强调,因为它直接关系到声调轨迹是否被保留。帧级保留了段内多点采样,分类器可以用序列模型利用走势;段级平均把多点压成一点,走势信息只能留在平均值的偏移里。论文的普通话结果显示平均池化后声调更差,这支持了轨迹被削弱的解释。

帧级表示 × 段级平均池化: 帧级表示负责保留元音段内随时间展开的基频轨迹;段级平均池化负责把对齐到同一元音的多帧取平均得到一个向量;搭配理由是声调是超音段特征需要时间上下文,组合的代价是平均会抹平轮廓变化,论文显示平均池化后聚类在普通话上声调探针明显更差,说明轨迹信息被削弱。

哪些模型训练了?哪些参数是冻结的?

本研究的自监督主干没有重新训练。普通话用在普通话语音上训练的 MandarinHuBERT,约鲁巴语用在包含约鲁巴语的多语言数据上训练的 AfriHuBERT,论文说明这样选择是为了让量化前的表示同时包含音素细节与声调相关信息。强制对齐器与词典用于切分与评价,约鲁巴语词典由支持声调的字形到音素工具生成。对齐只在评价与部分量化条件中使用,不是所有量化都依赖对齐。

需要训练的是神经量化器部分。论文按 RepCodec 训练小编码器加量化器加解码器去重构隐变量,单层与残差是不同配置的 2 次训练。K 均值、平均池化 K 均值、SVC 与残差 K 均值没有神经网络梯度训练,它们的计算是聚类与平均:估计质心、最近邻替换、残差相减后再聚类。论文未报告神经量化器的学习率、轮数与早停细节等完整超参数,复现时这是一个具体缺项,只能按 RepCodec 原结构与 500 量级码本先复现趋势,不能声称与原文完全同参。

探针本身需要训练,但它是轻量分析工具而非下游任务。帧序列用一层隐藏 128 的长短期记忆网络加任务头,丢弃率为 0.3,用类别加权交叉熵与验证 F1 早停;段向量用带 softmax 的逻辑回归。探针训练使用官方划分,这保证了比较条件一致,但也意味着探针分数受对齐质量与类别不平衡处理的影响,解读时应视为下游性能的代理而非下游本身。

数据、划分、指标与基线如何保证可比?

数据方面,普通话用 AISHELL-1,论文报告为 170 小时 400 说话人;约鲁巴语用 BibleTTS,论文报告为 93 小时单说话人。两种语言的声调都主要在元音核上实现,但音系理由不同:普通话声调关联音节整体而语音上落在元音核,约鲁巴语是典型的元音声调语言。论文因此只在元音上探测音素与声调。普通话声调探针是词汇声调,因为语料未标注变调。所有音频重采样到 16 千赫以适配模型,并沿用各自语料的官方训练验证测试划分。

音素探针 × 声调探针: 音素探针负责检验离散化后是否还能区分元音身份;声调探针负责检验同一元音上承载的声调是否还可分;两者搭配的理由是只看音素会高估离散质量,组合新增的作用是形成对照,若音素分很高而声调分明显掉,就能定位问题在超音段而非整体表征崩坏。

指标是加权 F1,方向是越高越好。连续隐变量作为上限基线,经典 K 均值作为单层基线,其他方法在相近总码量下比较。论文在 K 等于 500 处给出跨方法主表,并在不同 K 下扫描趋势。比较的公平条件包括同一语言同一模型、同一对齐与同一探针协议,只有量化不同。单说话人与多说话人的语料差异是天然不对齐的背景条件,跨语言比较时只能谈趋势异同,不能把绝对分数差直接归因于声调类型。

下面整理实验配置有助于复现时核对条件,表中数值与单位均来自原文连续句,裸值不擅自添加百分号,时长与人数保留原文写法。表前问题是:复现需要固定哪些数据与基线条件才能让量化成为唯一变量?公平条件是同语言同模型同划分,指标方向是加权 F1 越高越好。

配置项普通话条件约鲁巴语条件模型与对齐评价基线
音频与切分16 kHz,元音段探测16 kHz,元音段探测Montreal Forced Aligner 对齐K 均值 500 为单层基线
声调类型轮廓声调为主水平声调为主词汇声调,未标变调加权 F1 越高越好
探针LSTM 序列与逻辑回归分段LSTM 序列与逻辑回归分段类别加权与验证 F1 早停音素与声调双探针
码量500 量级可比500 量级可比残差 50 加 450 总量 500多级与单级同量级比

表后解释需要同时给出收益与代价。固定模型与划分的最大收益是归因清晰,任何探针变化都指向量化;代价是结论依赖所选主干,若换模型则趋势可能变化。只在元音上探测的收益是聚焦声调承载单位,代价是忽略了辅音与跨音节协同发音的影响。未胜出项在后文主结果中专门保留,例如平均池化与 SVC 并未全面取胜,这说明加入段信息不等于自动保留声调,关键在于如何组织 2 级信息。

主结果:离散化更伤声调还是更伤音素?

论文首先报告连续隐变量接近上限而经典 K 均值明显拉开差距。以普通话为例,连续隐变量的音素与声调接近 0.99 与 0.94,帧级 K 均值把声调降到 0.70 而音素仍高。跨语言看,普通话从 0.94 降到 0.70 的落差大于约鲁巴语从 0.92 降到 0.77 的落差,论文据此认为普通话声调对离散化更敏感。解读时应注意这是报告的落差比较,不是声调难度的绝对证明,因为两套语料说话人数与模型都不同。

下面是 K 等于 500 附近的可运行策略对照,表中数字来自原文连续句而非自行计算的差值,比较对象均为实际可运行的量化器,不用事后最优值代替可部署收益。表前问题是:在总码量相近时,单层与多级量化谁保留声调更好?公平条件是同语言同冻结模型,指标方向是加权 F1 越高越好。

语言连续隐变量音素与声调经典 K 均值声调神经 VQ 声调最优多级声调
普通话0.99 / 0.940.700.780.82,125 乘 4 残差向量量化
约鲁巴语0.97 / 0.920.770.660.83,段级残差 K 均值
落差含义上限基线单层明显掉声调普通话改善约鲁巴语未改善多级部分挽回但仍低于上限
音素对照音素仍接近高位音素保持高位音素未崩音素保持高位
可比性同划分同探针K 等于 500500 单码本总量 500 量级

表后解释要给出具体代价与反例。主要收益是多级一致缓解了声调损失,但最优解随语言变化:普通话是更深的残差向量量化最好,约鲁巴语是段级残差 K 均值最好。反例是神经 VQ 并非处处优于 K 均值,它在普通话从 0.70 到 0.78 有改善,在约鲁巴语从 0.77 到 0.66 反而更差。另一个反例是音素分数不能代表声调质量,多数方法音素都保持在 0.9 以上,但声调差距可达 0.1 以上。论文把这种不对称归因为音素方差主导量化,这属于有限解释而非直接测量的因果。

下面导读图 1,它扫描了 K 从小到大时音素与声调的变化,是理解增大词表为何不是可行解的关键。导读的观察顺序是先看面板与坐标,再看图例与基线,最后比较声调与音素曲线的高度与斜率。

看图路径: 1. 先确认左右两块面板分别为普通话和约鲁巴语,横轴为聚类数对数轴;2. 再对照图例区分元音与声调、池化与非池化以及连续隐变量虚线基线;3. 观察声调两条蓝紫曲线随 K 增大缓慢爬升但始终低于基线;4. 比较元音红绿曲线贴近顶部基线,说明离散对音素损伤更小

原论文 Figure 1:Weighted F1 scores for Mandarin and Yor`ub ́a phone and tone classification using K-Means…

论文图 1。原论文 Figure 1:“Weighted F1 scores for Mandarin and Yor`ub ́a phone and tone classification using K-Means codebooks of varying sizes.”。

对图 1 可见内容的解释需要紧扣像素。左右面板横轴都是 K 的对数轴,从 50 到 10000,纵轴是加权 F1。红色与绿色两组元音曲线贴近顶部红色连续基线,说明增大 K 后音素很快饱和;蓝色与紫色两组声调曲线明显更低且爬升缓慢,普通话声调非池化从 50 附近约 0.5 爬到 10000 附近约 0.88,池化版本更低,约鲁巴语两条声调曲线起点更高但同样低于基线。原文用 1000 到 5000 仅从 0.80 到 0.87 来说明增大 5 倍也只是适度改善,因此增大 K 收益递减且词表代价大,不能作为可行方案。像素不能精确读出的中间点不硬写数值,以原文报告的区间为准。

换一种组织码本的方式能挽回多少?

这一节按消融逻辑组织:测什么、与谁比、条件是否一致。测量的是声调加权 F1,比较的是单层与多级、池化与非池化、帧级残差与段级残差。条件一致性来自总量 500 量级与同一探针协议。关键数字是残差向量量化 125 乘 4 在普通话达到 0.82,在约鲁巴语为 0.76;段级残差 K 均值在普通话为 0.79,在约鲁巴语为 0.83。

支持的判断是多级残差有助于保留单层难容纳的变化;限制是语言间最优不同,且都未回到连续上限。

下面整理非神经方法的对照,重点是平均池化为何失败以及残差为何部分成功。表前问题是:段信息与残差结构各自带来什么?公平条件是同语言同模型,指标方向仍是加权 F1 越高越好。

语言平均池化 K 均值声调SVC 声调帧级残差 K 均值声调段级残差 K 均值声调
普通话0.570.620.760.79
约鲁巴语0.760.780.800.83
结构含义单层平均丢失轨迹帧加段平均融合先粗分音素再分残差段级粗分效果更好
与单层 K 均值比普通话明显更差普通话更差约鲁巴语略好两语言均改善两语言最佳非神经
代价轨迹被平滑融合仍偏向音素需要对齐做第一级同样需要对齐

表后解释要指出未胜出项与边界。平均池化 K 均值在普通话只有 0.57,明显低于经典 K 均值的 0.70,这是否定平均即保留上下文的直接反证。SVC 介于两者之间但仍弱于残差方法,说明简单平均两个质心不足以分离音素与声调。残差 K 均值的代价是第一级需要对齐,若在低资源场景无对齐,论文建议的替代是固定时长分段或自动单元发现,但这些替代在本工作中未被测量,属于待验证而非已验证。神经残差向量量化的优势是不需要对齐,这是部署条件上的重要差异。

下面导读图 2,它只聚焦普通话的第一级与第二级,是残差机制最直接的证据。导读顺序是先确认标题限定普通话,再区分元音与声调颜色组,最后比较虚线第一级与实线第二级。

看图路径: 1. 先确认横轴仍为聚类数,纵轴为加权 F1,标题限定为普通话第一级与第二级比较;2. 再区分绿色元音组与紫色声调组,以及实线第二级与虚线第一级;3. 观察第一级元音已接近基线而声调远低于基线;4. 观察第二级声调实线明显上移并向连续基线靠拢

原论文 Figure 2:L1 refers to first-pass K-means on the mean-pooled phone segment at different K; L2 represents…

论文图 2。原论文 Figure 2:“L1 refers to first-pass K-means on the mean-pooled phone segment at different K; L2 represents clustering on resid- uals.”。

对图 2 可见内容的解释如下。绿色元音组中虚线第一级已接近顶部基线,说明第一级粗量化足以编码元音身份;紫色声调组中虚线第一级明显偏低,而实线第二级随 K 增大显著上移并向紫色连续基线靠拢。论文据此认为第一级拿走了音素主导成分后,第二级不再被其压制,从而更好地组织声调剩余变化。需要强调这是与机制一致的现象支持,不是对方差分解的直接测量,原文也用相信与可能等措辞保留了推测成分。

哪些结论不能从这组实验推出?

第一个局限是评价止于探针而非下游任务。探针是任务无关的代理,论文遵循了常见基准的做法,但语音合成、语音翻译与口语建模的真实收益仍需下游测量。不能把声调 F1 提高 0.1 直接翻译为可懂度或自然度提高同样幅度,原文也没有做这种换算。

第二个局限是对齐依赖。探针需要强制对齐来定位元音,这不影响量化的公平性,因为评价对所有方法一致;但残差 K 均值的第一级在量化时也用了对齐,若无对齐则需要其他切分。论文提出了固定时长或自动发现的思路,但未报告其分数,因此在低资源场景的可用性仍是缺项。

第三个局限是跨语言归因。普通话轮廓声调与约鲁巴语水平声调的实现确实不同,论文用稳定元音对齐解释了段级残差在约鲁巴语更有效,用协同发音与变调解释了普通话需要更深层级。但两套数据的说话人数、时长与主干模型都不同,严格来说不能把最优方法的差异完全归因于声调类型。相关性不等于因果,缺少控制说话人与模型的对照时,应把类型解释记为有限解释。

第四个局限是资源状态。本次没有发现来源绑定且完成验证的资源,因此不能声称代码模型或数据已公开或当前可用。复现应以论文文字与数字为准,缺失的超参数与实现细节需要明确记为缺项,而不是从模型名称推定实现。

如果要复现,先固定什么再跑什么?

复现的第一步是固定信息条件。按官方划分准备 AISHELL-1 与 BibleTTS,重采样到 16 千赫,用对应语言的冻结模型提取帧向量,用同一对齐器得到元音段。先复现连续隐变量上限与经典 K 均值 500 个基线,确认普通话声调明显低于音素、约鲁巴语落差较小的模式是否出现,再引入其他量化。若上限本身不接近 0.99 与 0.94 量级,应先检查模型版本与对齐,而不是直接调码本。

第二步是控制码量。单层 K 均值、单层 VQ、残差向量量化与残差 K 均值都放在 500 量级附近比较,残差 K 均值用 50 加 450 的分配。扫描 K 时用对数轴观察声调缓慢爬升与音素快速饱和的分离现象,验证增大词表收益递减的判断。探针要严格区分帧序列与段向量:帧序列用单层长短期记忆网络加权训练,段向量用逻辑回归,探测质心向量而非整数编号。

第三步是记录未报告项。神经量化器的训练细节、对齐错误率、统计显著性与计算开销在原文中不完整,复现报告应逐项标注缺失,而不是用默认配置冒充原文配置。若要测试无对齐替代,需要另设对照并说明它已偏离原文条件。训练资源、推理开销与延迟应分别记录,总趋势不等于每组都成立。

何时值得尝试残差思路?还需补哪项验证?

当任务涉及声调语言且下游对声调敏感时,值得尝试残差或多级思路。具体选择可按论文的现象先行:若声调较稳定且与元音对齐良好,可优先试段级残差 K 均值;若轮廓变化大且上下文依赖强,可优先试更深的残差向量量化。但这只是起点假设,因为跨语言差异尚未被严格解耦,实际选择仍需在自己的数据上用同探针协议比较。

还需补的验证包括下游任务、更多说话人条件与无对齐切分下的稳定性。特别是语音合成与语音翻译中声调错误会造成同音混淆,探针改善是否转化为词义错误下降,需要任务级测量。论文指向的更大问题是离散单元隐含地偏向音段信息,声调只是超音段中的一个例子,短语、重音与节奏可能有类似风险。未来的工作应发展声调感知或韵律感知的离散化,而不是简单增大 K。

对初学者的特有误解需要澄清。第一,音素分高不等于符号质量好,超音段需要单独探测。第二,平均池化不等于利用上下文,它可能恰好抹掉需要的时间轨迹。第三,多级更好不等于层数越多越好,论文只比较了有限配置,更深或更复杂的方案仍待设计与验证。记住这些边界,才能把这篇论文的数字用在正确的位置上。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总