英文题目:LitCodec: ASR-Guided Streaming Speech Coding with Unified Quantization

会议身份:conference:interspeech:2026:conference-paper-id:dinh26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#向量量化 #严格因果 #流式处理 #语音 #语音编码

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Son Dang Dinh:机构信息未能从会议 PDF 纯文本可靠映射
  • Nguyen Thi Minh Anh:机构信息未能从会议 PDF 纯文本可靠映射
  • Nhat Tran Hong:机构信息未能从会议 PDF 纯文本可靠映射
  • Huyen Ngo Thi Thu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

实时语音交互要求编码器将输入波形压缩为低码率离散序列并逐帧输出,同时在重建自然度与语言内容可懂度上都不塌陷,而现有波形编码在低码率丢失音素细节,语义编码又依赖非因果或双分支结构。LitCodec先用短时傅里叶变换与因果Conformer编码器将波形映射为帧级隐表示,再以可拆卸文本解码器在量化前施加CTC语义约束使其携带语言结构,随后经有限标量量化压缩为单流离散序列,最后由镜像因果解码器与判别器恢复波形。与双分支蒸馏的本质差异在于监督直接塑造瓶颈前表示而非事后融合语义,避免了多码本同步与非因果依赖,使单次流式解码即可兼顾声学与语义,降低了下游语言模型集成复杂度。在LibriSpeech test-clean评测设置下,LitCodec-V2的WER为3.1%,低于EnCodec的WER 29.0%。该结论目前仅限于英语干净朗读的客观指标,尚未验证噪声、自发、多语与主观听感。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么流式低码率很难两全?

这篇论文研究的输入是连续到来的语音波形,目标是把它压成紧凑的离散 token 序列,再能解回可听语音,同时让 token 直接可用于传输、存储和语音语言模型。输出有两个要求,一是重建语音在信号级可懂且自然,二是 token 序列本身保留语言内容,不需要额外语义流。对刚入门的同学,白话是编码器先把声音变成帧级向量,再经量化变成整数编号,解码器只看编号恢复波形。

难点在于低码率本身就是信息瓶颈,波形导向的编码器为最小化频谱误差,会优先保留能量大的声学成分,而感知上细微但区分词义的音素差异容易被压掉。流式又加了因果约束,每 1 帧只能看过去帧,不能看未来,上下文信息天然少于非因果模型。论文要解决的矛盾正是因果单路径与语义保留之间的冲突,既不能为语义加非因果教师或第二分支导致多流同步困难,也不能退回纯波形优化导致低码率下可懂度崩溃。

必须保留的信息是任务为 16 kHz 英语朗读语音的流式编码,输出为单码本扁平 token 流,评价同时看重建质量与语言保留。本文解读按学习依赖展开,先讲路线与全景,再讲组件计算与训练,最后讲实验条件、结果反证与复现要点。

初学者易混的概念如何一次理清?

初学者常把码率、每秒 token 数与延迟混为一谈。码率是每秒比特数,每 token 比特乘每秒 token 数即得,V1 约 16 比特乘 50 即 800bps。每秒 token 数决定下游序列长度,直接影响注意力计算量。延迟由块长除以帧率决定,与训练总步数无关。另一个易混点是 WER 与 STOI,WER 来自识别器对重建语音的转写错误,越低语言保留越好,STOI 是信号级可懂度相关度量,越高越好,二者相关但不是同一指标,不能互相替代。

还有人把单码本当成质量一定差,实际上单码本的优势是结构简单免同步,质量取决于量化前表示是否已带语义,LitCodec 正是用 ASR 监督补这一环。最后要区分客观指标与人评,PESQ 与 UTMOS 都是自动预测自然度与质量的代理,不能当成听感金标准,论文未做主观测试即是明确边界。

已有路线各解决了什么,又在哪里不满足流式要求?

第一条路线是波形导向的神经编码器,代表是 SoundStream、EnCodec、DAC 及其后续效率改进。它们用卷积编码器加残差向量量化,再加对抗训练优化重建,做法成熟,感知质量高。但原文指出它们优化的是声学重建而非语言结构,在低码率下对下游语音语言建模不友好。第二条路线是语义感知的编码,代表是 SpeechTokenizer 蒸馏自监督语音表示,DualCodec 与 SAC 用双分支结构,X-Codec 融合语义与声学嵌入。它们的共同代价是依赖双分支设计或非因果的自监督编码器,需要多流同步或全句上下文,与流式单遍输出不兼容。

第三条路线是流式与低延迟建模,流式 ASR 证明了严格延迟下做语义推理可行,但多数流式编码器仍是波形导向,有语义特征的 Mimi 又需要多码本流。教学上可以这样记,同输入都是语音波形,同目标都是低码率 token,但监督来源不同,运行阶段也不同。波形路线监督来自重建与对抗,语义路线监督来自自监督蒸馏或双分支融合,LitCodec 则选择流式 ASR 已有成熟因果做法的监督来源。原文的判断是缺口不能靠加分支补,必须把语义结构直接嵌入因果编码器,且保持计算高效。

本文只讲论文实际比较的基线,不把类别差异直接当同条件胜负,后文结果会分别按可比码率与可比因果条件组织。

与最接近的流式基线相比,公平性条件是什么?

最接近的可比对象是同为流式的 TS3-Codec 与 Mimi。公平条件是同为因果约束、同档码率、相近每秒 token 数。LitCodec-V1 与 TS3-Codec 同为 800bps 与 50 token 每秒,条件最齐,PESQ、STOI 与 WER 的比较可直接读。与 Mimi 比时码率与 token 数都不同,Mimi 为 1100bps 与 100 token 每秒,LitCodec 以更低码率和一半 token 取得更高 PESQ 与 STOI,这个结论支持效率优势,但不应说成同码率胜负。与非流式 BigCodec、DualCodec、X-Codec 比时,对方可用双向上下文或更大训练数据,LitCodec 在因果约束下追平或超过部分指标,只能作为补偿因果损失的参考,不能当成架构全面优越的证明。

EnCodec 在超低档退化到 29.0% 的例子说明纯波形路线在极低码率下语言保留脆弱,但 EnCodec 参数量与训练目标都不同,比较时应注明路线差异。教学例子仅为帮助理解比较逻辑,不添加无源数值。

论文把问题形式化成什么,成功标准有哪些指标?

论文把问题定义为低延迟流式语音编码,输入波形经短时傅里叶变换转到频域,再经因果编码得到帧级嵌入,量化为单 token 流,解码回波形。成功不是只看一个数,而是多维约束同时成立。声学保真用宽带 PESQ 与 STOI 衡量,数值越大越好,分别反映感知质量与可懂度相关的信号级接近程度。语义保留用重建语音再经 HuBERT-Large 识别的词错误率衡量,数值越小越好,反映语言内容是否经压缩仍可识别。自然度与说话人保持用 UTMOS 与基于 WavLM 嵌入的说话人相似度衡量,数值越大越好。

效率约束包括每秒 token 数、比特率与单码本扁平结构,token 数越少,下游自回归模型的自注意力负担越轻。论文设两个运行点,V1 是 50 Hz 对应 800bps,V2 是 40 Hz 对应 640bps。举例说,同样 10 秒语音,LitCodec-V1 产生 500 个 token,而 EnCodec 在 150 token 每秒下会产生 1500 个,由于注意力复杂度随长度平方增长,序列缩短 3 倍会直接降低下游计算量。理解这套标准后,才能看懂后文为什么有时 PESQ 领先但 UTMOS 落后,二者优化目标本就不完全一致。

LitCodec 让一个样本走完输入到输出需要经过哪些部件?

先沿一个样本走全程。输入波形记为 x,经短时傅里叶变换得到频谱,论文把实部与虚部拼接成实值表示,再经带步长的线性投影降采样到目标帧率。V1 用窗长 400 跳长 160 对应 100 Hz 再降到 50 Hz,V2 用窗长 500 跳长 200 对应 80 Hz 再降到 40 Hz。接着因果 Conformer 编码器把投影映射为嵌入 H,维度为 1024,编码器与解码器各用 4 层 Conformer,8 头,前馈 4096,卷积核 9。H 经有限标量量化变为离散表示,再由镜像因果 Conformer 解码器解回频谱,经逆短时傅里叶变换得到重建波形。

训练时另有一条仅训练存在的 ASR 分支,从 H 分叉,先做时域掩蔽,再经两层 Conformer 文本解码器加线性投影预测 1024 个 SentencePiece 子词,用 CTC 损失对齐到真值文本。推理时文本解码器可拆掉,不影响重建路径。下面先看官方架构图建立整体位置感,再分节讲每个部件的计算与训练细节。

本段为图前导读,说明黄色主路是训练与推理都存在的声学编解码单路径,蓝色上框是只在训练出现的语义监督分支,二者在音频编码器输出处分叉,读图时应先分清实线与虚线箭头的时间属性,再看量化前后表示符号的变化。

看图路径: 1. 先沿下方黄色声学编解码主路从 Audio X 看到 Xrec,确认编码器到量化器到解码器的单路径;2. 再看蓝色虚线从音频编码器分叉进入上方语义监督框,确认只在训练时存在;3. 对照图例中 A 与 Aq 以及 Aaug 的色块,区分连续声学特征、量化后特征与加掩蔽语义特征;4. 观察上方预测文本块与真值文本块的双向箭头,确认 CTC 对齐比较的位置

原论文 Figure 1:LitCodec architecture. The Acoustic Codec path (yellow) encodes input waveform x(t) into…

论文图 1。原论文 Figure 1:“LitCodec architecture. The Acoustic Codec path (yellow) encodes input waveform x(t) into frame-level embeddings H, quantizes them to ˆH via FSQ, and decodes to reconstructed…”。

上图可见下方黄色框从左侧波形 Audio X 经音频编码器到连续特征 A,再经音频量化器到量化特征 Aq,最后经音频解码器到重建音频 Xrec,形成单路径闭环。上方蓝色框从编码器输出向上引出虚线,经 SpecAugment 到增强特征 Aaug,再经文本解码器到预测文本块,最后与真值文本块比较。图例明确区分声学特征、量化声学、语义特征与文本 token 的颜色与线型,虚线表示训练专用。这种画法直接对应论文主张,语言结构在量化前注入编码器,而不是在量化后恢复,从而避免双流表示碎片化。

量化前监督与单码本量化各自负责什么计算?

编码器输出 H 是形状为帧数乘维度的连续矩阵,ASR 分支不对它做量化,而是先按 Nmask 为 5、时间掩蔽概率 5% 的 SpecAugment 式掩蔽遮掉部分帧。目的是打破模型只依赖窄时间窗的捷径,迫使音素信息冗余分布到多帧,提高分块流式时的鲁棒性。掩蔽只作用于语义路径,重建流保持完整。文本解码器以掩蔽后特征为输入预测子词,CTC 损失不建模输出依赖,只要求单调帧到 token 对齐,因此更鼓励局部音素可分性。梯度直接回传塑造 H,使语言内容在离散化前已存在。

因果 Conformer 编码器 × ASR 监督: 因果 Conformer 编码器负责把 STFT 输入逐帧变成只依赖过去帧的连续特征 H,保证音频到来即产出表示;ASR 监督负责在量化前用 CTC 文本解码梯度要求 H 能区分音素子词,二者搭配的理由是量化瓶颈会丢掉隐空间里没有显式结构的信息,只有让编码器先带上语言结构,离散化后才留得住,组合后形成可流式产出的语义敏感连续特征。

量化采用有限标量量化,把编码器输出投影到 6 维,每维独立圆整到少量整数等级。V1 与 V2 都用等级 8、8、8、5、5、5,对应约 64000 个码本条目,约每 token16 比特。50 Hz 乘 16 比特得到 800bps,40 Hz 乘 16 比特得到 640bps。有限标量量化是确定性的固定网格,不需要承诺损失,不存在码本坍缩调参问题,每个码都可达。输出是单条离散流,可直接被语言模型消费,不需要交织多码本。

有限标量量化 × 残差向量量化: 残差向量量化用多层码本逐级残差离散,层数多会隐式分层并带来承诺损失与码本坍缩调参问题;有限标量量化把低维投影每维独立圆整到固定整数网格,不需要辅助损失且网格固定故天然可达,二者搭配比较的意义是 LitCodec 选择后者,用单条扁平 token 流同时装语义与声学信息,免去多流交织与同步,便于直接喂给自回归语言模型。

掩蔽与 CTC 的配合需要单独理解,因为初学者容易把数据增强当成与目标无关的技巧。

SpecAugment 时域掩蔽 × CTC 损失: SpecAugment 时域掩蔽负责在语义支路上遮掉部分帧,逼编码器把音素信息冗余分布到多帧;CTC 损失负责在不建模输出依赖的前提下强制帧到子词的单调对齐,要求局部可判别,二者搭配是因为只用 CTC 仍可能走捷径依赖窄窗口,掩蔽打破捷径后 CTC 才能学到更鲁棒的跨帧语言表示。

流式因果通过注意力掩蔽只看过去帧与因果填充卷积实现,所有 Conformer 层都满足该约束。论文强调因果结构本身不保证短块鲁棒性,因此训练用动态分块,细节放在训练节。解码器是编码器的镜像因果 Conformer,只依赖量化后表示,保证推理时音频到来即同步产出 token,不需要多流同步。

训练时哪些参数更新,三项损失与分块策略如何配合?

训练更新编码器、量化投影、解码器、判别器与文本解码器,推理时丢掉文本解码器。生成器损失由三项加权组成,重建权重 2、对抗权重 1、语义权重 0.5。重建用 SoundStream 的多尺度 mel 谱损失,在多个 STFT 分辨率上结合 L1 与对数域 L2。对抗用多周期判别器加多尺度 STFT 判别器,按 LSGAN 目标训练,做法跟随 BigCodec 与 TS3-Codec。语义项是 CTC 损失,权重虽小,但作用是纠正纯重建目标压掉语言关键差异的倾向。

动态分块训练 × 算法延迟: 动态分块训练负责在每步以 0.2 概率用全序列、否则从 4、8、12、16 帧中均匀采样块长,让同一模型见过多种上下文长度;算法延迟由块长 C 除以帧率 R 决定,负责刻画流式等待时间,二者搭配的理由是只训长句则短块推理退化、只训固定短块则表示能力受损,组合后一个模型可同时服务流式与离线模式。

动态分块的具体操作是每步以 0.2 概率用全序列上下文,否则从 4、8、12、16 帧中均匀采样块长。块长除以帧率即算法延迟,4 帧在 50 Hz 下对应 80 毫秒,适合直播字幕或流式语音翻译等交互场景。这种采样让模型见过可变上下文,同一个模型可服务流式与离线。

多尺度 mel 重建损失 × 对抗判别器损失: 多尺度 mel 重建损失负责在多个 STFT 分辨率上用 L1 与对数域 L2 约束频谱保真;对抗判别器损失用多周期与多尺度 STFT 判别器按 LSGAN 目标要求听感自然,二者分工是前者保信号级接近、后者补感知自然度,再与语义项按权重相加,共同防止纯重建目标压掉感知不敏感但语言关键的音素差异。

优化用 AdamW,beta1 为 0.9、beta2 为 0.95,OneCycleLR 调度,峰值学习率 1e-5,1% 热身,共 1,000,000 步,8 块 80 GB 的 H100,混合精度 bf16,每卡批量 16。文本分词用在 LibriHeavy 转录上训练的 SentencePiece,词表 1024。量化噪声丢弃概率 0.5。论文未报告梯度裁剪、判别器更新频率与早停细节,这些是复现时需要补看代码或按常见做法记录的缺项,不能从模型名推定。

数据、基线与指标在什么条件下比较才公平?

训练数据是 LibriHeavy,约 50,000 小时源自 LibriVox 有声书的英语朗读,重采样到 16 kHz。评测在 LibriSpeech test-clean 上做。基线覆盖 8 个模型,声学类有 EnCodec、BigCodec、WavTokenizer,语义感知类有 SpeechTokenizer、DualCodec、X-Codec,流式类有 TS3-Codec、Mimi。论文说明基线结果引自各自原文发表值,部分基线在更大或多语数据上训练,可能对其有利,因此跨数据比较时应留有余量。比较按码率分两档,一档约 1 kbps,一档 750bps 以下,并区分流式因果与非流式双向上下文。

指标方向为 PESQ 越高越好,STOI 越高越好,WER 越低越好,说话人相似度越高越好,UTMOS 越高越好。每秒 token 数越低,下游负担越小。语义用 HuBERT-Large 识别重建语音算 WER,声学用宽带 PESQ 与 STOI,自然度用 UTMOS,说话人用 WavLM 嵌入相似度。硬件预算在训练节已交代,推理延迟除 80 毫秒示例外未系统测量不同块长的权衡,这是后文讨论局限时要保留的边界。资源状态方面,本次未发现来源绑定且完成验证的代码模型数据链接,因此不能声称代码模型或数据已公开,复现应以论文文字参数为准。

主结果在可比码率下证明了什么,又在什么指标上没有赢?

比较的问题是同为流式因果约束下,谁在相近码率与相近每秒 token 数下同时保住信号质量与可懂度。指标方向是 PESQ 与 STOI 越高越好,WER 越低越好,UTMOS 越高越好。下表聚焦约 1 kbps 档,把 LitCodec-V1 与更高码率的 Mimi 以及同码率 TS3-Codec 放在一起,数值保留原文写法与精度,横杠表示该单元格数字未在所选连续原句中单独列出,不做推算填充。

条件指标LitCodec-V1MimiTS3-Codec
码率bps800 bps1100 bps800 bps
信号质量PESQ2.562.22—
可懂度相关STOI0.9250.905—
语义保留WER2.8%—3.6%
自然度UTMOS3.62—3.85

表后解释需要同时讲收益与代价。LitCodec-V1 报告显示在 800bps 与 50 token 每秒下取得流式最优 PESQ 与 STOI 和最低 WER,与更高码率的 Mimi 相比仍以一半 token 取得更高 PESQ 与 STOI。相对 TS3-Codec,论文报告在信号级重建上提升 PESQ 加 0.34、STOI 加 0.016,可懂度上 WER 为 2.8% 对 3.6%。代价是 UTMOS 为 3.62 对 3.85,TS3-Codec 更高,反映其偏自然度优化。论文还报告 WER 追平非流式 BigCodec 在 1040bps 的 2.8%,并在 PESQ 上超过参数量更大的非流式 DualCodec 的 2.33,支持 ASR 监督补偿因果信息损失的判断,但这属于有限解释而非因果证明。

在超低码率档,LitCodec-V2 在 640bps 取得 PESQ 2.41、STOI 0.913,说话人相似度 0.73 超过 TS3-Codec 的 0.61 与 Mimi 的 0.58,但 UTMOS 仍以 3.45 低于 TS3-Codec 的 3.69。未胜出项必须保留,超低档的自然度领先者仍是 TS3-Codec。语义鲁棒性的反例是 EnCodec 在 750bps 时 WER 退化到 29.0%,而 LitCodec-V2 在 640bps 保持 3.1%,差距来自可运行策略的直接报告,不是事后最优挑选。

拿掉监督、移动监督位置、拿掉掩蔽会发生什么?

消融要回答监督是否必要、放在量化前是否关键、掩蔽是否只是小技巧。比较条件都是 LitCodec-V1 在 LibriSpeech test-clean 上的同一流程,只改一处。下表只放连续原句中明确出现的数字,未出现的 STOI 等格用横杠表示,避免把不同指标差值混入模型列。

变体PESQSTOIWER说明
完整 LitCodec-V12.560.9252.8%量化前 ASR 监督加掩蔽
去掉 ASR 监督2.420.9113.5%相对 WER 上升 25%
监督移到量化后2.45—3.2%PESQ 与 WER 均介于两者之间
去掉时域掩蔽2.51—3.1%WER 上升 PESQ 下降

表后解释先讲主要收益与代价。去掉语义监督退化最大,WER 从 2.8% 到 3.5%,PESQ 从 2.56 到 2.42,STOI 从 0.925 到 0.911,而说话人相似度与 UTMOS 相对稳定,论文解释为后两者主要由重建与对抗目标决定,支持 ASR 监督针对性保语言而不干扰声学自然度的判断。去掉监督后的 3.5% 接近同架构无语义监督的 TS3-Codec 的 3.6%,支持改进来自训练而非结构差异的解释。三向比较显示量化后监督的 3.2% 优于无监督的 3.5% 但远差于量化前的 2.8%,且 PESQ 接近无监督基线,支持瓶颈前必须显式存在结构的观点。去掉掩蔽使 WER 到 3.1%、PESQ 到 2.51,支持掩蔽迫使冗余编码的机制解释。负结果也要保留,监督位置与掩蔽主要影响语言与信号级指标,对说话人和自然度影响小,不能推广为全面提升。

哪些结论还没有被验证,部署前还要补什么?

论文明确把评测限定在英语干净朗读的客观指标上,未做主观听感测试,也未在噪声、自发或多语语音上验证。下游任务如语音合成与口语理解也未验证,因此不能把 PESQ 与 WER 的领先直接等同于这些任务一定受益。延迟方面只给出 4 帧 50 Hz 下 80 毫秒的算法延迟算例,未系统测量不同块长、真实推理耗时与误判率,训练资源与推理开销应分开讨论,总体趋势不等于每步都成立。UTMOS 两档都落后于 TS3-Codec,说明自然度优化目标下 LitCodec 不是全能最优,选择时要按应用权衡可懂度还是自然度。

论文还提示低延迟高保真能力可能被误用于实时变声,建议部署加水印与来源追踪,这是负责任使用的边界。缺失证据不是技术错误,相关性也不是因果,凡未测量的延迟、成本与误用率都不应承诺改善。

要复现 LitCodec 应先固定哪些超参数与信息条件?

复现先固定数据与采样,训练用 LibriHeavy 约 50,000 小时 16 kHz 英语朗读,评测用 LibriSpeech test-clean,文本分词用在 LibriHeavy 转录上训练的 1024 词表 SentencePiece。模型固定编码器解码器各 4 层 Conformer,维度 1024,前馈 4096,8 头,卷积核 9,文本解码器 2 层。量化固定投影到 6 维,等级 8、8、8、5、5、5,约 64000 条目,约每 token16 比特。V1 按 STFT 窗 400 跳 160 再降到 50 Hz,V2 按窗 500 跳 200 再降到 40 Hz。损失权重固定重建 2、对抗 1、语义 0.5,掩蔽固定 5 块、时间概率 5%,只作用于语义支路。

动态分块固定 0.2 概率全序列,否则均匀采 4、8、12、16 帧。优化固定 AdamW、OneCycleLR、峰值 1e-5、1% 热身、1,000,000 步、8 卡 H100、bf16、每卡 16、量化噪声丢弃 0.5。评测固定 HuBERT-Large 算 WER,宽带 PESQ、STOI、UTMOS 与 WavLM 说话人相似度。由于本次没有可用资源链接,不应假设代码权重可下载,应按上述文字从零搭建并记录缺失的判别器调度与裁剪细节。先跑通 800bps 单点与 3 个消融,再扩展到 640bps,避免 1 次铺开多码率导致条件不一致。

何时值得尝试 LitCodec,何时应选别的路线?

当应用需要单遍流式、单码本扁平 token、低每秒 token 数,且低码率下仍要保住可懂度时,LitCodec 值得尝试,例如直播字幕与流式语音翻译的前端编码。其可复述的方法是因果编码器输出先经掩蔽与 CTC 塑造语言结构,再经固定网格有限标量量化统一输出,重建与对抗保证自然度。当应用更看重自然度评分而非逐词可懂度,或已有非因果离线流程可用时,同码率 TS3-Codec 或非流式大模型可能是更合适选择。当需要多语、噪声、自发语音保证时,论文未提供证据,应先补评测再部署。

复现的最小闭环是固定上述超参数,复现完整版、去监督版、量化后监督版三点,观察 WER 是否呈现 2.8% 对 3.5% 对 3.2% 的排序,同时检查 PESQ 是否同步变化,再决定是否引入掩蔽与动态分块。记住单点领先不等于全程最优,保留未胜出的 UTMOS 与未验证的主观听感,才能把这篇工作用对地方。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总