英文题目:TontaubeV1: Streaming Text-to-Speech with Hierarchical Codec Modeling and Bounded Context

标签:#文本到语音 | #自回归模型 | #语音 | #流式处理 | #高效推理

评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Fritz Cremer:机构信息未在 arXiv HTML 中可靠披露
  • Jonathan Cremer:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理流式零样本文本到语音合成,输入为已口语化文本与至多约 60 秒参考音频,输出为连续语音,难点在于长文本韵律一致性、有界上下文与首包延迟的兼顾。方法链条分为四步:语义阶段由大模型生成第一码本并固定时长与语调骨架;三个小模型逐级补足声学残差且不改写语义轴;文本与音频以共享逻辑位置与成对边界标记维持跨块对齐;重叠非因果重建经声学编码器转入因果解码器实现流式输出。与单遍交织或共享残差模块的已有分解不同,该设计把韵律容量集中于语义流并让声学阶段无跨块状态,从而支持并发精炼与有界缓存。在 400 段英文有声读物成对评测中,系统韵律偏好得分为 50.1%,与 ElevenLabs Flash v2.5 基本持平,正确性为 48.9%。结论仅限于英文朗读韵律与词级正确性,未验证德语与多语、音色相似度、长篇连贯与流式音质。单卡首音频约 200 ms,单路端到端实时因子约 0.08,8 路并发聚合实时因子约 0.02。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,哪里最容易丢自然度?

这篇论文研究的任务是流式文本转语音。输入是已经转成可朗读形式的字符文本,加上可选的参考音频和语言风格标签,输出是连续的朗读音频。参考音频不需要配套文字,最长约接受 1 分钟,用于控制音色和朗读风格。目标不是只把字读对,而是在连续朗读中保持自然的节奏、语调、重音和停顿。

初学者容易把语音合成理解成逐字发音的拼接。论文强调的难点恰好在连续段落里:单字读对不等于长段落好听,单调、重音放错、短语边界切错都会在有声书式阅读中暴露出来。同时系统要在单张消费级显卡上跑,还要尽早出声,不能等整段文字全部生成完再解码。因此它必须同时回答 3 个问题:用什么离散表示同时保留语言内容和声音细节,如何分配模型容量,以及长文本如何不让上下文无限增长。

为核对方法,需要保留的关键信息是表示、模型分工、位置与分块、推理与重建、评测条件。表示决定了帧率和码率,模型分工决定了谁定韵律谁补细节,位置与分块决定了长文本如何对齐与丢弃历史,推理与重建决定了延迟从哪里来,评测条件决定了结论能推广到哪里。后文就按这个依赖顺序展开,例子会明确标为例子,不把例子里的数字当成论文报告的数字。

同样用语言模型加离散声码,分叉点在哪里?

近年常见路线是把预训练语言模型主干与离散音频编解码结合,用自回归预测下一码本符号。论文把 Fish-Speech、Qwen3-TTS 与自身归为同一大路线,其中 Qwen3-TTS 被点名为最接近的已发表系统,同样基于 Qwen3 系列并使用 12.5 赫兹多码本切分,第一层偏语义、后层偏声学。

分叉点在于如何处理堆叠的多层码本。一种做法是用延迟模式把多层交织成一个输出流,1 次自回归完成全部码本。另一种做法是把最粗码本交给大主干,把残差交给一个小的共享模块逐帧处理,例如 Fish-Speech 的快速变换器和 Qwen3-TTS 的多符号预测模块。TontaubeV1 选择第三种:每一层码本各用一个独立模型,尺寸可以分别设定。论文报告早期实验发现每层独立建模收敛更好,这是采用该分解的直接动机。

代价也写得很清楚。独立 4 模型意味着需要 4 个检查点,并且在每个块内按顺序执行。同时声学阶段不跨块携带状态,可以分别调度。连续隐变量路线则不同,例如 VibeVoice 用扩散头预测下一隐状态而非查表选码。论文只借用 VibeVoice 的声学编码器和解码器做流式重建,不用它的语言模型和扩散头。理解这条对照线后,就不会把 4 模型设计误读成简单的模型集成。

问题如何形式化,哪些条件是给定的?

形式化上,给定可朗读文本和每层对应的参考提示流,任务是从保留码流堆栈的条件分布中采样。保留的是 4 层:语义层加 3 层声学细化层。帧时钟是 12.5 赫兹,1 分钟音频占 750 个符号,因此较长的文本和音频上下文可以用较少的符号数保留下来。论文把文本按字符编码,把提示流按帧截断,把控制块用子词编码,这些都是输入契约的一部分。

给定条件还包括语言与风格标签、参考音频可缺省、数字与缩写必须先转成朗读形式。论文明确指出 1984 这类写法不能指望模型从字符形状可靠判断读法,必须先转成 nineteen eighty-four 等形式。英文有单独发布的生成式转写器可用,其他支持语言要求调用方直接提供已转写文本。转写器独立于 4 阶段图,温度为零运行,但仍可能转写错误或改动措辞,需要人工检查。

输出约束是 4 层共享同一时间轴,时长由语义阶段 1 次决定,后续阶段只生成等长符号,不改时长、不重采样语义流。默认声学阶段温度为零,给定文本、提示和语义流后输出是确定性的。这个约束把问题从联合搜索变成按序生成:先接受一个语义候选,再补残差细节。

四阶段加有界上下文的全景是什么?

全景可以沿一个样本走一遍。假设输入是一句英文有声书文本加一段参考音频。系统先把文本转成字符符号,把参考音频用 DualCodec 编成 4 层提示流,再拼上控制块。第一个大模型读文本和语义提示,逐帧生成语义符号并决定何时停止,停止位置即 utterance 时长。随后 3 个逐层变小的模型依次生成第一到第 3 层声学符号,每层都看到文本、自己可用的提示层和已完成的下层。

得到 4 层符号后,系统用 DualCodec 解成波形,但为避免块边界的接缝,把重叠窗口重编码进 VibeVoice 隐空间,只保留稳定的中间帧,再用因果解码器连续输出。长文本则切成字符块,每块带前一块文本与语义音频作局部上下文,并用配对标记在边界重对齐,做完一块就丢弃最老的 1 对,使变换器输入有界。流式时先攒一段语义前缀,扣住不稳定的边界帧,稳定后再按约 2 秒间隔提交。

这个全景里容量分配是有意的:韵律主要由语义流承担,所以最大模型放在第 1 个阶段;声学阶段逐层变小,只做块内细化且不跨块记状态。这样长文本可以持续生成,多块语义就绪后声学细化还能并发或成批执行。

谁定韵律,谁补细节,四层如何按序生成?

表示层使用 DualCodec 的 12 赫兹版本配置,把 24 千赫音频编成 8 层残差向量量化流,帧率为 12.5 赫兹。第一层从自监督语音特征量化而来,偏语音与语言信息,其余层编声学残差。论文只保留语义层和前 3 层声学层,码率从完整 8 层的每秒 1225 比特降到每秒 625 比特,舍去最细的 4 层,理由是非正式试听显示后层收益递减。语义码本 16384 项,每帧 14 比特;每层声学码本 4096 项,每帧 12 比特。单独解码语义流已可懂且有短语与语调,但声学细节明显不足。

语义流 × 声学细化流: 语义流是 DualCodec 第一层码本输出的分流,负责内容、停顿、语调轮廓和总时长;声学细化流是后面 3 层残差码本输出的分流,负责音色、清晰度和细节。两者搭配的理由是论文假设韵律在语义流生成时已基本确定,因此把大容量分配给语义阶段,小容量逐层补残差,组合后先定骨架再补质感且时长不再改变。

生成顺序先用链式法则写成从粗到细的精确分解,再加上条件限制。每阶段只看到截至本层的提示流,看不到更高层的符号,后 1 阶段不能修改前 1 个阶段。第 1 阶段输出长度记为总帧数,后 3 阶段必须生成等长符号。4 层共享时间轴,时长一旦由语义阶段固定就不再改变。

\[p(C^{0:3}\mid X,P^{0:3})=\prod_{i=0}^{3}p(C^{i}\mid X,P^{0:3},C^{\lt i}).\]

上式是未加限制的精确分解。符号含义是文本为输入条件,提示流为参考条件,已完成下层为细化条件,目标是 4 层堆栈的联合分布。论文的实现在此基础上加了条件独立假设,即低阶段不依赖高层的提示流。

\[q(C^{0:3}\mid X,P^{0:3})=\prod_{i=0}^{3}q_{i}(C^{i}\mid X,P^{0:i},C^{\lt i}).\]

上式是模型实际使用的分解。每阶段用独立网络建模对应因子并按序生成,不允许后阶段修订早层。这是一种归纳偏置,不是链式法则本身的限制。低层量化误差可由高层残差补偿,但语义符号与长度保持固定,发音、组块与时长因此被第 1 阶段强约束。

字符、位置与边界如何让长文本保持对齐?

输入序列化把提示流、控制块、字符文本和已完成音频行拼成一个平面序列,但逻辑时间另行分配。提示流的 4 层相互覆盖而非首尾相接,文本行与音频行从同一坐标起步,每行第几帧就取同一坐标。物理顺序决定因果可见性,共享坐标编码同时性。控制块与朗读文本被看作同一文本行,打开音频行的填充符号取提示长度处的坐标,语义行结束符再加一。

字符级切分的具体做法是每个字符单独送入继承的分词器,只保留返回序列的第一个编号。这样普通内容恰占字符数个符号,合并不跨字符边界。好处是块大小、前瞻窗口和位置都用与邻词无关的单位度量,发音模式在几百个字符编号上复用,而不是在数万个稀疏子词上学习。大小写保留,推理侧只做空白规范化,不转小写。

字符级切分 × 位置坐标: 字符级切分把待朗读文本按字符逐个编码,使块大小与前瞻窗口以稳定单位度量;位置坐标按发生时刻而非序列化下标分配,使文本字符与音频帧对齐到同一逻辑时间轴。搭配原因是字符单位稳定了边界公式中的长度项,而共享坐标让不同行的同时刻帧相对偏移为零,组合后切块与重对齐不再依赖子词划分。

块边界用配对标记实现。文本侧放文本切分标记,音频侧放音频切分标记,两者共享同一边界位置。边界位置取文本长度加偏置与可用语义长度中较大者,再加上起始坐标。偏置在发布检查点取 25 个字符位置,用于在语义长度未知前预留余量。

\[M_{k}=S_{k}+\max(n^{x}_{k}+\delta,n^{a}_{k}),\qquad S_{k+1}=M_{k}+1.\]

上式中起始坐标、文本长度、语义长度与偏置共同决定边界与下一块起点。单调推进且大致随语音时长增长。

文本切分标记 × 音频切分标记: 文本切分标记标出字符行的块边界,音频切分标记标出语义流中对应的块边界,两者在同一边界共享一个逻辑位置。分工是文本侧推进字符时钟、音频侧推进帧时钟,搭配理由是两时钟速率不同会在块内漂移,必须在边界处跳到同一坐标重对齐,组合后滑动窗口丢弃最老块时时间轴不漂移且上下文保持有界。

声学阶段在普通块内细化时见不到切分标记,只有在续写前缀中才会在前缀与当前文本之间见到文本切分标记,并在语义行对应处见到音频切分标记。适配器通过给预填充坐标加统一常数来兼容推理框架,使相对偏移保持不变,从而保留学到的对齐关系。

DualCodec 重建 × VibeVoice 因果解码: DualCodec 重建负责把保留的 4 层码流解成 24 kHz 波形,但其解码器非因果,边界附近样本依赖未来帧;VibeVoice 因果解码负责在声学隐空间中用有界卷积缓存连续解码。搭配理由是不重新训练因果声码器,而是把重叠的 DualCodec 波形重编码进 VibeVoice 隐空间只保留稳定的中间帧,组合后在隐空间拼接即可边生成边提交音频。

训练了什么,没报告什么?

4 个预测器都只用监督微调训练,数据约 200000 小时配对语音与文本,覆盖 7 种语言,以公共领域有声书与公开语音语料为主。论文明确不披露数据配比、训练 schedule 与超参数细节。这意味着复现时无法从报告中恢复学习率、批量、轮数或采样权重,只能确认训练范式与数据量级和领域偏置。

架构起点是 Qwen3 系列的变换器。语义阶段用大尺寸主干并保留较多层数,3 个声学阶段用小尺寸主干且层数逐层减少。继承的输入嵌入表被扩展以支持各阶段词表,并与主干联合优化;继承的语言模型头被丢弃,每阶段换成新初始化的两层音频头,先扩到 4096 维再过非线性映射到本阶段音频词表。采样时对目标词表外 logits 做掩码。

参数统计区分存档参数与受限输入参数。存档计数是检查点张量元素总数,受限计数减去按文档输入文法不可达的嵌入行,输出头各行保持有效。4 模型存档总数约 2,870,000,000。不可达行保留在发布中是为了以后扩展控制标签,实现时若严格执行文档文法可以省略这部分嵌入行。训练分块按强制对齐段在文本与音频联合预算下分组,推理侧的 350 字符上限是上下文余量,不是训练分块规则,两者不要混淆。

延迟如何测,朗读如何判,条件是否一致?

服务性能在单张 RTX 5090 上测量,权重常驻且进程预热,不含启动与加载时间。单输入看首段编码音频时间与端到端实时率,多输入并发看聚合吞吐。实时率小于 1 表示快于播放,数值越小越快。论文同时报告约 200 毫秒到首音频,以及单路与 8 路并发的实时率,这是延迟与吞吐的两个不同维度,不能互相替代。

下表把延迟与吞吐问题组织成可核对的条件对照。比较问题是单路是否可交互、并发是否可摊薄成本。公平条件是同一显卡、权重常驻、预热后测量。指标方向是首音频时间越短越好,实时率越小越快。

条件指标单路取值8 路并发取值指标方向
单输入端到端实时率0.08未报告越小越快
八文本并发聚合实时率未报告约 0.02越小越快
播放速度参照倍速约 12.5 倍约 50 倍仅换算

上表的主要收益是单路约 200 毫秒可开始出声,端到端约 12.5 倍于播放,8 路并发聚合约 50 倍实时,支持低成本服务的论点。具体代价是测量排除启动加载,且未报告不同文本长度与参考时长下的分布,单点数值不能推广为任意输入的保证。流式路径还需扣住不稳定帧,延迟与稳定性之间存在取舍。

朗读评测用冻结的 400 段英文书摘,每段 250 到 500 字符,取自 PG-19 测试分支。TontaubeV1 用有声书模式、语义采样温度 0.55、声学温度零生成。对每段文本,双方合成同一文本,波形独立归一到平均负 20 分贝全刻度后送判。法官是 Gemini 模型,收到参考文本与两个波形,分别对韵律与逐词正确性判优,忽略音色与录制编解码瑕疵。每对判 2 次并交换顺序,偏好计 1 分、平局计 0.5 分、落败计 0 分,800 次判断取均值,不确定性按 400 段成簇自助得到区间。

条件一致性需要特别说明。鱼声比较双方用同一冻结克隆参考,其余 3 组 TontaubeV1 用克隆参考而对手用固定厂商音色。韵律与参考朗读风格不完全可分,因此后 3 组可能偏向能继承参考风格的 TontaubeV1。论文明确提示了这一不对称,阅读结论时必须保留该限定。

有声书韵律与正确性到底得到什么分数?

先看核心问题:在英文有声书朗读中,韵律是否达到可用且可比的水平。论文报告与 ElevenLabs Flash v2.5 的韵律偏好为 50.1%,区间包含平局,正确性 48.9% 同样与平局无统计区分。对 Fish Audio S2 Pro、2026 年 4 月 Gradium 接口、Cartesia Sonic 3 的韵律偏好分别为 82.1%、86.2%、82.3%。正确性对鱼声与平局无区分,对后两者偏向 TontaubeV1。结论限定在该英文朗读基准内,不涉及德语、多语、音色相似度、对话与长篇连贯性。

下表把主结果组织成可复述的对照。比较问题是同一文本下韵律与正确性谁更优。公平条件是同文本、独立响度归一、顺序平衡各判 2 次。指标方向是偏好分数越高越偏向 TontaubeV1,50% 为平局。

维度对手TontaubeV1 偏好分数结论适用边界
韵律ElevenLabs Flash v2.550.1%与平局无区分仅英文朗读
韵律Fish Audio S2 Pro82.1%领先同克隆参考
韵律Gradium API86.2%领先对手用固定音色
韵律Cartesia Sonic 382.3%领先对手用固定音色
正确性ElevenLabs Flash v2.548.9%与平局无区分同上

上表的主要收益是韵律在该基准上与一家持平、对三家领先。具体代价与反例是正确性并非全面领先,对鱼声与 ElevenLabs 都包含平局,且后 3 组存在参考条件不对称。未胜出项必须保留:与 ElevenLabs 的两项指标都没有统计学上的胜负,这是理解竞争位置的关键。

导读下面这张官方结果图时,先确认面板与坐标,再读点与区间,不要只记百分比。左侧为韵律面板,右侧为正确性面板,横轴为偏好百分比,50% 虚线为平局,圆点为 TontaubeV1 偏好分数,横线为按段成簇自助的 95% 区间,点下标注每次判断的平局率。

看图路径: 1. 先看左右两块面板标题,确认左侧为韵律、右侧为文本正确性;2. 再沿每条横线找到圆点数值与须线区间,区分 50% 平局线左右的位置;3. 对照圆点下方 ties 字样,比较不同对手下平局率的高低;4. 注意纵向四个对手名称,确认比较对象不是同一语音条件

原论文 Figure 2:LLM-as-a-judge pairwise audiobook-reading benchmark.

论文图 2。原论文 Figure 2::“LLM-as-a-judge pairwise audiobook-reading benchmark.”。

从像素可见,左侧韵律面板中 ElevenLabs 圆点紧贴 50% 线且区间跨过平局线,其余三点明显偏右且区间远离平局线,说明领先不是由单次顺序效应驱动。右侧正确性面板中前两点靠近 50% 且平局率高达约 80%,说明多数判断为平局;后两点偏向右侧但平局率仍高,正确性差异的证据弱于韵律差异。纵轴 4 个对手不可比作同一条件,因为鱼声组为同参考、其余为固定音色。图中数值与正文报告的 50.1%、82.1%、86.2%、82.3% 一致,须按数据集、阶段、指标与聚合对象同时核对,不能把韵律分数挪作正确性或音质结论。

哪些构造细节决定了可运行性,而非单纯提分?

论文没有传统意义的逐模块消融表,但有多处可运行性构造值得按失败条件理解。第一是分块与上下文。发布切分器把块封顶在 350 字符,超长时在标点处优先切断,无标点则在空白处切断,都没有则硬切。中间块带前一块文本与语义音频,外加最多 50 字符的下一短语前瞻,首块无前导空格、非首块有前导空格、末块才带换行。这些边界线索告诉模型窗口在全篇中的位置。

下表把上下文与提示截断整理成配置对照。比较问题是输入增长时上下文是否保持有界。公平条件是同一字符单位与同一帧时钟。指标方向不是越高越好,而是够用且可调度。

对象配置项取值单位作用
文本分块单块上限350字符推理侧上下文余量
前瞻下一短语截断50字符生成当前音频前看到后文
边界偏置delta25字符位置文本音频长度未知前预留
提示总时长参考上限约 60秒无需文字稿

上表的主要收益是上下文随篇幅增长而有界,声学阶段无跨块状态因而可并发细化。代价是长篇切块可能引入不连续,4 阶段串行增加延迟,且训练分块规则与推理切分规则不同,推理上限不能反推训练行为。未评测边界是长篇连贯性与流式质量,论文明确说基准不覆盖这两项。

第二是重建与流式。下表把重建窗口与流式提交整理成可执行的动作对照,教学例子中的数字均为论文报告值,不是自行假设。

阶段窗口或前缀保留与扣住对齐效果
完整重建30 秒内容窗两侧各 6 秒上下文隐空间拼接避免波形直接拼接缝
增量提交新语义段到达提交新稳定帧约 2 秒间隔边生成边发
收尾生成结束提交剩余帧因果缓存连续无生成边界缝

上表的收益是无需训练因果声码器即可流式输出。代价是需要第二套编解码参与推理,并主动扣住几帧音频,延迟换稳定。若扣住太少可能出现边界不稳定,若窗口太大则首音频变慢,论文默认取上述折中,未报告扫参曲线,因此不能断言该组参数全局最优。

哪些错误仍然可能出现,哪些结论不能推广?

技术局限首先是自回归语义生成的固有风险:可能漏字、重复、改写,或结束过早过晚。参考控制可能不完全传递音色,也可能连带录音环境特征。长篇切块可能引入断裂,4 阶段串行增加延迟,生成式转写器可能转写错误或改动措辞。训练偏向有声书,论文提示有声书生成可能比对话与智能体风格更可靠,换领域前应在目标领域复测。

语言覆盖需要逐项核对。支持的语言标签包括英语、德语、西班牙语、法语、意大利语、荷兰语与葡萄牙语,但这只是输入契约,不等于质量等同。论文只说非正式试听中德语语调较强但音素实现有时不准,其余语言未经母语者检查,不做结论。基准只测英文朗读韵律与逐词正确性,不确立德语与多语质量、音色相似度、对话表现、长篇连续性与流式质量。

安全与许可同样是复现条件。语音克隆可被用于冒充、欺诈与误导性媒体,发布中提供的是模型生成的合成参考音而非真人录音,调用方对自供参考音仍需负责征得同意,部署侧应做认证、限流、日志、合成披露与滥用响应。权重按社区模型许可发布,不是开源许可,另有商业收入与服务限制;转写器与推理实现按 Apache 许可分开发布,还需遵守上游组件各自的通知与许可。需要什么、缺什么都在原文中点名,未测量误判率与成本时不应承诺这些量得到改善。

要复现与核对,先做什么,需要哪些证据?

复现先从输入契约做起。准备已转写的朗读文本,数字日期货币缩写先转成朗读形式,英文可用发布转写器并人工抽查,其他语言自行转写。文本按字符编码并做空白规范化,每段末尾按规则补句点;调用方不要自行加首空格与末换行,这些边界线索由推理引擎按块位置添加。控制块写成语言冒号风格形式,语言与风格只用发布集合内的标签。

再核对提示与分块。参考音频可选,最长约 1 分钟,无需文字稿,按阶段截断为 750、300、150、100 帧。长文本用发布切分器按 350 字符封顶切块,保留前一块文本与语义音频加最多 50 字符前瞻,边界偏置取 25。位置按提示覆盖、文本音频同起点、每帧同坐标分配,续写时配对标记共享边界坐标。推理时语义阶段在音频切分或语音结束符停止并去掉停止符,声学阶段按语义长度等长生成,默认声学温度零。

资源状态是可用性判断的唯一依据。本次收到的资源状态显示代码仓库链接当前可用,模型权重链接本次未能确认可达,因此只能写代码当前可用、权重本次未能确认可达,不能写权重已公开可下载。权重许可不是开源许可,商用前先读社区模型许可全文。评测复现需用 400 段冻结书摘、同文本、同响度归一、顺序平衡各判 2 次、按段成簇自助,否则数字不可比。Seed 集上的 1024 类零样本词错率需用指定转写模型与温度复测,不能把自动词错率当成人评韵律。

何时值得尝试这个设计,还需补哪项验证?

当任务是长文本朗读且只有单张消费级显卡,同时要求尽早出声,这个设计值得尝试。它的可取之处在于把最难的韵律决策集中到语义阶段,把声学细化做成块内无状态的小任务,从而兼顾上下文长度、调度灵活性与流式输出。若应用对首音频敏感,可从默认 40 帧前缀与扣住 5 帧起步;若做有声书,可沿用有声书模式与零声学温度;若要换音色,优先用短而干净的参考并检查是否带入环境特征。

还需补的验证取决于部署目标。做中文或德语等多语上线前,必须补母语者听评与逐词正确性,不能把英文基准结论平移。做长篇连播前,必须补跨块连贯性与流式边界听评,因为原基准明确不覆盖这两项。做成本决策前,必须在目标硬件与目标文本长度下重测首音频分布与并发实时率,原报告排除加载且为单点测量。需要区分的相关性与因果是:独立小模型收敛更好是早期实验观察,支持该分解选择,但不证明任何分层都必然如此。

模型评委与人类排序的高相关来自引用研究,不等于本 exact 协议已对人验证。保留这些边界后,方法才能被准确复述与合理使用。

📎 论文与评分元数据

排名:前50% | 文档类型:模型报告 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-10 语音/音乐/音频论文速递