英文题目:RePlay: Retrieval-Based Voice Playback for Multi-Turn spoken dialogue
标签:#语音对话系统 | #检索增强 | #轮次切换 | #语音
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5
👥 作者与机构
- Sathvik Udupa:机构信息未在 arXiv HTML 中可靠披露
- Naveen Kumar:机构信息未在 arXiv HTML 中可靠披露
- Ryan Folmsbee:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向娱乐角色、场馆导览与客服等需逐字可控内容与固定演绎的语音交互,输入为连续用户语音与固定台词库,输出为回应时机与预录音频,要求在重叠与停顿下低延迟且不篡改台词。探测阶段对PersonaPlex做逐层逐帧探测,找到回合起始标识回灌后可解码出整句回复的最早层与帧,其隐状态输出进入截断阶段。截断阶段仅保留前16层并丢弃后16层与语音生成器,将文本流简化为轮次分类,其轮次起始判定输出进入检索阶段。检索阶段在起始帧用嵌入头将隐状态映射到文本嵌入空间并按余弦相似度检索对应台词直接播放。与边说边检索知识再生成的全双工方案不同,该设计在回合边界直接检索回复本体并立即播放,省去自动语音识别与语音合成。在模拟多轮面试评测下,RePlay的对话质量得分Q为3.76,高于Cascade C的对话质量得分Q 2.99,且中位延迟为383 ms,该结论的适用边界受限于封闭台词场景。该结论限于300句封闭台词与合成训练加小规模真人验证,新意图泛化与精确选句仍偏弱。原文未披露训练步数、优化器、学习率与推理部署成本。
🔗 开源与复现资源
第三方资源:https://github.com/resemble-ai/chatterbox — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/BreezeBlue/Breeze-TTS-2 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?为什么固定台词任务不能只靠开放生成?
本文输入是连续的用户语音和一个已知的固定台词集合,目标是在多轮对话中决定何时接话以及播放集合中的哪一条预录音频。输出不是现生成的语音,而是台词编号及其对应的录音波形。必须保留的信息包括内容必须逐字可控、演绎方式必须与录音一致、延迟必须低到不打断交谈节奏。论文研究的是娱乐角色、场馆向导和客服坐席这类场景,开放式全双工模型虽然延迟低,但不能保证说出指定句子,也不能复现指定表演;级联系统能限定在预设回答内选择,但要等待语音识别终点判定、转写和大语言模型解码,延迟明显更高。
全双工语音对话 × 级联系统: 全双工语音对话负责连续监听用户语音并在内部建模何时接话,分工是低延迟交互;级联系统负责先由语音活动检测或语音识别判定回合结束,再转写并由大语言模型选句,分工是保证内容可控;RePlay 搭配的原因是既要前者的接话时机,又要后者的固定台词控制,组合意义是用全双工隐状态直接检索固定台词,省掉转写和生成等待。
对刚入门的读者,可以把任务理解为带麦克风的点唱机:用户说一段话,机器要在几百毫秒内按下某一首已录好的曲目。例子仅为教学比喻,真正的信号是语音编码器输出的声学帧、语言模型隐状态和文本嵌入向量的相似度,不是点唱机的按键。论文要解决的矛盾正是低延迟接话与精确复现之间的冲突,后续方法都围绕如何不经过转写和生成就拿到可检索的回应表示展开。
全双工语音对话模型内部已经对用户语音和系统语音做了连续建模,文本大语言模型也被报道在生成前隐状态中包含未来内容,作者据此假设全双工语音模型在系统回合起点同样形成对整句回应的表示,于是可以直接用该表示做检索,把端到端延迟与选择式控制结合起来。
同输入同目标的已有路线如何隐藏或暴露检索延迟?
第一条路线是从语音直接做检索以辅助生成。论文提到神经嵌入模型支持语义相似度检索并扩展到检索增强生成,语音侧有把语音编码器对齐到冻结文本检索器的做法,也有在对话中用口语查询检索或在长音频上检索。这些方法都是在用户说完后检索 1 次知识,再把知识作为条件去生成回答,检索到的信息要经过生成才能到达用户。也就是说检索对象是知识,回应仍需现写,因此精确内容和固定演绎无法保证。
第二条路线是在对话系统中隐藏检索与工具调用延迟。论文区分了级联系统和端到端系统两类尝试:有的方法在用户说话过程中提前查询,有的方法在回应期间异步检索。但原文明确指出,这类系统仍须基于检索内容再生成回应,因此不能保证精确内容和固定演绎。检索延迟被掩盖了,但生成延迟依然存在,且生成本身引入了措辞漂移。
RePlay 的不同在于检索对象本身就是回应。它在回合边界检索回应自己,选中后立即播放录音,不再经过条件生成。这使得比较必须按同运行阶段划分:在用户说完才选句的基线之间比较延迟与选句质量才公平,而把生成式系统的开放回答质量直接当成固定台词任务的胜负是不对等的。论文因此没有与开放生成模型比拼语言多样性,而是与同样播放预录音频的级联系统比较谁在相近对话质量下更快、谁在相近延迟下更准。
要回答的具体问题是什么?成功标准如何定义?
论文把问题归约为两个联合判断:在每 1 帧判断是否轮到系统说话,以及在开始说话的下 1 帧判断应播放哪一行。成功标准有 3 组。第一组是检索与对话质量,包括意图一致率和不同粒度的召回率,以及法官对投入感和响应性的 1 到 5 分评分。第二组是轮次行为,包括从用户语音结束到系统回应的延迟分布,以及在用户说完前抢话的截断率。第 3 组是泛化与成本,包括对未见台词和未见意图的表现,以及训练数据量和推理截断带来的计算变化。
关键约束是新增台词不应重新训练。因此检索头不能把参数绑定到具体台词编号,只能输出与冻结文本嵌入对齐的向量,新台词只需嵌入即可加入候选。另一个约束是评估不能让模拟用户偷看系统意图,否则会高估选句准确率,论文因此让模拟访问者只持有高层话题而不知晓意图与台词。轮次判断与检索选择必须联合完成,不经过自动语音识别或语音合成,这既是延迟要求,也是架构取舍:省掉转写意味着模型必须从语音连续表示中直接读出对话状态,省掉合成意味着必须提前备好录音并保证台词覆盖。
RePlay 沿一个样本走完从语音到播放的全路径
假设用户正在向名为 Nobu 的角色提问。系统通道和用户通道的语音先进入 PersonaPlex 继承来的语音编码器与前 16 层语言模型,文本流中用不同记号区分填充、回合起始和词。轮次头逐帧判断当前是否出现回合起始记号,一旦该记号概率最高,下 1 帧就把该记号作为输入回灌,检索头读取第 15 层隐状态并投影到文本嵌入空间,与全部 300 句 Nobu 台词的冻结嵌入做余弦相似度排序,得分最高者被选中并立即播放其预录音频,同时把该句的音频送入系统通道、把词按强制对齐时间插入文本流以维持多轮上下文。
<EPAD> × 回合起始:<EPAD> 在 PersonaPlex 文本流中负责标记每个词前的位置,在 RePlay 中被收窄为只保留在每句回应首词之前,分工是给出明确的回合起始记号;回合起始负责触发检索查询的读取时刻;搭配的原因是只有该记号被回灌为输入后回应内容才可恢复,组合意义是把轮次检测和检索查询绑定在同一帧上联合完成。
这条路径的关键是表示与决策同点发生。输入侧保留语音系统提示和文本系统提示,输出侧不再产生词与声学码本,而是产生对已有台词的选择。轮次检测与检索查询共享同一截断主干,前者决定何时取查询,后者决定取哪一句。播放的音频又回灌为下一轮的历史,使多轮上下文得以延续,而不需要把生成文本再编码 1 次。原文文字说明这种安排的理由是探测已显示回应内容在回合起始回灌后才可恢复,因此把检索点放在该时刻既符合表示规律,也把判定与选择合并为 1 次前向计算。此处不再对已移除的架构像素图作解释,机制依据以原文文字与探测曲线为准。
在哪一层哪一帧读取回应表示?探测如何决定截断?
PersonaPlex 原本有语音编码器、32 层语言模型和预测系统语音码本的深度变换器,语言模型还预测系统文本流,其中首个出现在用户回合之后的回合起始记号标志着系统回应的开始。论文考察两个候选帧:预测出该记号的帧,以及下 1 帧把该记号作为输入的帧。对每一层和每 1 帧,训练岭回归把隐状态映射到 PersonaPlex 回应的文本嵌入,评估指标是留出回应中的前 5 检索准确率,以及对回应嵌入做 16 类聚类后的均衡准确率。训练与测试使用 200 与 100 个单轮通用问答,要求答案不含显著关键词,以迫使探针编码整体内容而非关键词。
下图为逐层探测结果,左右分别对应问答检索准确率与聚类准确率,横轴为层数,虚线标在第 15 层,图例区分预测帧与回灌输入帧两条曲线,时间范围覆盖全部 32 层的逐层探针结果。
看图路径: 1. 先看图例区分蓝色虚线与红色实线分别对应预测帧与回灌输入帧;2. 再沿横轴层数观察红色曲线在 13 到 15 层附近的跃升位置;3. 对照左右两图确认问答检索与聚类两种探针是否同向变化;4. 找到 15 层处的黑色虚线并判断其作为截断点的早晚
论文图 1。原论文 Figure 1::“Per-layer probing for the upcoming response: (a) QA accuracy, (b) clustering accuracy. Dotted line: layer 15.”。
从像素可见,蓝色虚线代表的预测帧在所有层都贴近底部几乎不上升,红色实线代表的回灌输入帧在 12 层之前同样很低,约在 13 到 14 层急剧爬升,左侧问答图在 15 层附近达到约 0.4 左右并继续上升到 21 到 23 层的约 0.7 附近,右侧聚类图上升更平缓并在 25 层之后达到约 0.4 左右。两图共同支持的判断是回应表示只在回合起始记号被回灌为输入后才出现,而不是在预测出该记号时就已形成。
论文因此选择回灌帧的第 15 层作为最早的可用层,并只保留前 16 层,把语言模型计算减半,同时保留清晰的回应信号。需要强调的是,截断不是任意剪枝,而是由探测曲线的跃升位置决定的。保留 16 层对应保留了跃升后一层的表示能力,去掉后 16 层与语音生成意味着推理不再支付文本自回归与声学码本预测的成本。
Head_Turn × Head_Embed: Head_Turn 负责逐帧分类为<PAD>、<EPAD> 或<WRD> 以判定系统是否开始说话;Head_Embed 负责把第 15 层隐状态投影到文本嵌入空间并与冻结台词嵌入做余弦相似度打分;搭配的原因是先由前者决定何时取查询,再由后者在下 1 帧决定取哪一句,组合意义是去掉文本与语音生成仍能完成何时回与回哪句两个动作。
检索头用什么监督对齐?参数如何冻结与更新?
检索头在每个回合起始记号后的那 1 帧训练,目标是与冻结台词嵌入对齐。监督来源是真实选中的目标行编号,候选集合包含目标行与挖掘的难负例,并排除与目标余弦相似度高于 0.9 的近义复述,避免把合理复述当成负例惩罚。难负例一半取自批量目标的近邻,一半均匀采样,在第一阶段数据中还包含全部台词与 600 个跨批共享负例。台词嵌入使用预训练文本嵌入模型得到并保持冻结,因此新增台词无需重训。
损失由单向对比项与余弦对齐项组成,符号含义是批量内系统回合集合、投影与候选行的余弦相似度、目标行指示、正负标签、可学习的逆温度与偏置,以及对齐项权重。计算目标是同时提高目标相似度并压低难负例相似度,且让投影方向贴近目标嵌入。
\[\mathcal{L}=-\tfrac{1}{|B|}\sum_{i\in B}\sum_{j\in\mathcal{C}(i)}\log\sigma\big(y_{ij}(\tau s_{ij}+b)\big)+\tfrac{\lambda}{|B|}\sum_{i\in B}(1-s_{ii^{+}}),\]上式中第一项为单向 SigLIP 形式的对比损失,第二项为余弦对齐项,原文实现上两个头联合训练并使用教师强制。由于训练数据是合成的,为保留对真实语音的鲁棒性,论文对 0 到 9 层使用秩为 256 的低秩适配,只对 10 到 15 层做全量微调。轮次头使用交叉熵并对回合起始记号加权 9 倍,逆温度与偏置分别初始化为 10 与负 10。训练序列最长 90 秒,在 8 块 40 显存的加速卡上进行。原文未报告优化器类型、学习率与步数等细节,这些属于缺项,不能从模型名称推定。
SigLIP 损失 × 余弦对齐项: SigLIP 损失负责把投影与目标行的相似度推高、与难负例的相似度压低,分工是区分性检索;余弦对齐项负责直接拉近投影与目标嵌入的余弦距离,分工是稳定对齐;搭配的原因是仅有对比项时绝对方向可能漂移,仅有对齐项时难区分近义行,组合意义是在小批量共享难负例下同时保证方向正确与可区分。
数据、基线与指标在什么条件下才是可比的?
数据分两部分。第一部分是合成多角色对话,用于预训练,包含 100 个角色、每角色约 300 句去重台词、每句至多 20 词、覆盖 30 个意图,共 29225 行,由大语言模型生成人物与台词后再生成含自由访问者回合的对话,其中 1/4 访问者回合故意写得欠明确以迫使模型利用上下文并输出澄清句。对话共 52768 段、1071 小时,用语音克隆合成与噪声增强合成,声音来源与噪声条件按原文交代。
第二部分是目标求职面试,评估对象 Nobu 是外形接近人但明显非人的角色,作者为其编写 300 句覆盖 30 个面试意图的台词,并按同样方式仿真面试,先在 100 角色数据上训练再用 2 小时仿真面试微调。为测泛化,微调分 3 种划分:全部见过、每意图留出一半台词、留出一半意图。
基线是 3 个级联系统,都在检测到的用户回合结束时选句并立即播放录音。商业大模型级联用云端语音识别终点与全量台词选择,本地级联用流式识别与语音活动检测,大模型本地版从全量台词中选择,小模型本地版先自由回复再映射到最近台词。RePlay 与基线在评估时都作为 Nobu 从同样的 300 句中选择,且台词嵌入不带元数据,这是公平条件之一。
意图一致率 × 召回率: 意图一致率负责衡量播放台词是否落在法官认为应答的意图内,分工是粗粒度恰当性;召回率负责衡量播放台词是否命中法官排序的前 1、前 3 或扩展后的前 10 参考行,分工是细粒度精确性;搭配的原因是仿真没有唯一参考行,组合意义是同时看到找对方向与找对原句的差距,解释 RePlay 意图接近但精确行偏低的现象。
指标方面,模拟访问者由小语言模型扮演,只给人物、目标与话题顺序,不给系统意图与台词,且用户语音用固定合成器与固定克隆声音合成并做对齐裁剪,在系统说完 0.4 秒后插入。法官同样由小语言模型担任,给定完整对话与按意图分组的全部台词,为每个系统回合选出应答意图并排出前三行,由此计算意图一致率与多粒度召回率,并给出对话级评分。延迟从用户语音结束算到系统回应开始,抢话单独计为截断率。
硬件预算与统计方法除加速卡数量与对话数外报告有限,复现时应按原文保留合成与法官条件,不宜替换为更强的法官后直接比较分数。资源状态是正文开源声明的唯一依据:本次收到的资源 1 地址为语音合成仓库链接,状态为可用且状态码 200;资源 2 地址为语音合成模型链接,状态为可用且状态码 200。两者均为第三方合成工具,与 RePlay 本体是否开源无关,不能据此写 RePlay 当前可用或已公开。
主结果:延迟下降了多少?对话质量与代价是什么?
比较问题是:在可选台词集合与评估流程相同的条件下,RePlay 相对可运行的级联基线能否以更低延迟达到相近的对话质量,指标方向是召回率、评分与意图一致率越高越好,截断率与延迟越低越好。所有系统均作为 Nobu 从 300 句中选句并播放录音,模拟流程为 100 段上限 90 秒的对话,延迟不含抢话回合,质量由语言模型法官按意图分组排序后评定。
| 条件 | 指标 | 基线 A | 本方法 | 比较对象 |
|---|---|---|---|---|
| 中位延迟 | 用户结束到回应 | 2.6 s | 383 ms | 比级联 A 与 B 快 6.8 倍与 3.2 倍 |
| 对话质量 Q | 法官 1 到 5 分 | 3.90 对 3.77 | 3.76 | 接近两强基线 |
| 意图一致 | 落在应答意图比例 | 0.85 | 0.83 | 接近最强基线 |
| 精确行 R@1 | 命中法官首选 | 0.52 | 0.35 | 落后最强基线 |
| 轮次稳定 | 截断率与分位差 | 8.7% 与 17.0% 过早触发 | 3.6% 与 106 ms 分位差 | 更少抢话更稳定 |
上表显示的主要收益是延迟大幅下降而粗粒度质量基本保持。原文报告 RePlay 把中位延迟降到 383 毫秒,比两个级联快 6.8 倍与 3.2 倍,总体比同等对话质量的语音识别加大语言模型级联低 3 到 7 倍,且 10 分位与 90 分位之间仅差 106 毫秒,说明在回合起点检索比等待识别与解码更稳定。对话评分 3.76 与两个较强基线的 3.90 和 3.77 接近,意图一致率 0.83 接近最强基线的 0.85。具体代价是精确行选择差距明显,R@1 为 0.35 对 0.52,论文解释为通常能找到合适回应但与法官首选不是同一句。
未胜出项是小模型级联虽然延迟接近,但意图一致率与评分明显更低,不能只看延迟就认为它可替代;另一个反例是本地语音活动检测在 8.7% 与 17.0% 的回合中过早触发,而 RePlay 截断率为 3.6%,说明其轮次头对短暂停顿更保守。
两阶段训练与未见台词、未见意图的表现如何分离?
比较问题是:预训练与目标微调各自贡献多少,以及在不重训条件下新增台词与新增意图是否可行,指标方向仍是召回率、评分与意图一致率越高越好。训练分 2 个阶段,先在 100 角色合成对话上预训练,再在 2 小时 Nobu 仿真面试上微调,泛化划分包括全见、每意图留出一半台词、留出一半意图 3 种条件,评估口径与主结果一致。
| 条件 | R@1 | R@10 | Q | IntentAgr |
|---|---|---|---|---|
| 仅 D1 预训练 | 0.23 前值 | 未见意图迁移 | 3.16 左右 | 45% |
| D1 加 D2 全见 | 0.35 | 0.60 左右 | 3.76 | 0.83 左右 |
| D1 加未见行 UL | 0.28 左右 | 0.57 左右 | 3.74 对 3.76 | 0.76 左右 |
| D1 加未见意图 UI | 0.21 左右 | 0.35 | 3.47 左右 | 0.65 |
上表结合原文连续句解释的收益是 2 阶段缺一不可。仅见 100 角色预训练时正确意图率为 45%,说明对未见角色有一定迁移;仅在目标数据微调已明显更强,两者结合在所有指标上最好,R@1 从 0.23 提升到 0.35。泛化方面,同意图内新增台词接近全见过模型的 3.74 分对 3.76 分,支持通过嵌入文本直接新增台词而无需重训;未见意图则意图一致率掉到 0.65 且 R@10 为 0.35,虽然仍优于仅预训练,但在适用条件上明确得多:新意图需要自己的训练数据。表中部分精确行数字以原文连续句为准,不能用其他指标的差值填充,也不能把自动召回当成人评,未胜出项正是未见意图的明显下滑,它限定了免重训泛化的边界。
用户研究支持什么?哪些边界尚未验证?
比较问题是:真实用户是否感知到延迟收益,以及在更强基线面前偏好是否仍然成立。条件是 14 名参与者每人以平衡顺序体验 RePlay 与一个基线,事先只给场景描述而不给意图与示例问题,会话时长 78 到 253 秒、中位 149 秒,评价维度包括等待时间、节奏、来回交互与响应性。原文明确排除了延迟最高的商业大模型基线,只比较两个本地级联。
| 对比 | RePlay 偏好 | 基线偏好 | 显著性 | 补充 |
|---|---|---|---|---|
| 对快速小模型级联 | 63% | 12% | p=0.008 | 全体总体更喜欢 RePlay |
| 对较强本地大模型级联 | 46% | 21% | p=0.50 | 回复恰当性基线略优 |
| 延迟稳定性 | 383 ms | 3 到 7 倍更低 | 106 ms 分位差 | 回合起点检索更稳定 |
上表支持的判断是对快速小模型级联的偏好显著,而对较强基线的偏好不显著且样本更小,前者 8 人、后者 6 人。对快速级联的 63% 对 12% 达到显著水平,且全体总体更喜欢 RePlay;对较强基线的 46% 对 21% 不显著,参与者更喜欢等待与节奏但认为基线回复略更恰当。限制在于评估依赖合成训练数据、语言模型法官与小规模用户研究,论文结论部分亦承认这一点。
未验证的边界包括真实噪声与口音下的轮次稳定性、长对话中的上下文漂移、台词库扩大到数千句时的检索区分度,以及推理开销与实际端到端延迟在不同硬件上的对应关系。相关性不等于因果,未测量误判率与部署成本时不应承诺这些量必然改善。
复现应先固定什么?最小可运行链路怎么做?
复现先固定信息条件:同样的 300 句 Nobu 台词集合、同样的冻结文本嵌入、同样的模拟访问者不知晓意图与台词的协议,以及同样的法官按意图分组排序的流程。任何替换合成器、法官模型或台词分组方式都会改变召回率与评分的口径,应作为新条件单独报告。台词嵌入不带元数据这一条也需保留,否则检索难度会被人为降低。用户语音的合成声音、插入间隔 0.4 秒、对齐裁剪方式同样影响延迟与截断率统计,改动后不能直接比较毫秒数。
最小链路建议按学习依赖顺序执行。第一步复现探测:用 200 训练与 100 测试的通用问答,在预测帧与回灌帧分别对每层训练岭回归,检查是否只有回灌帧在 13 到 14 层后上升,并确认第 15 层可作为截断点。第二步搭建截断模型:保留前 16 层,丢弃后 16 层与语音生成,将回合起始记号收窄为每回应首词前仅保留一个,并在系统通道用播放音频、文本流用强制对齐词维持上下文。
第三步训练两个头:轮次头做三分类并对回合起始加权,检索头在回灌帧用对比损失加余弦对齐训练,难负例排除余弦高于 0.9 的近义行,低层用低秩适配、高层微调以保留对真实语音的鲁棒性。第四步按 100 段、上限 90 秒的仿真跑通延迟与截断率统计,再跑用户研究的平衡顺序流程。
关键超参数按原文保留:聚类数 16、前 5 检索、截断层 16、读取层 15、回合起始加权 9、逆温度初值 10、偏置初值负 10、序列上限 90 秒。缺失的优化器、学习率与训练步数需要自己补验证实验,不能从模型名称推定实现,也不能把无训练的调用阶段误认为确定性求解。训练资源为 8 卡加速器,推理开销与输出帧率、实际延迟需分别测量,总体趋势不等于每组每步都成立。
何时值得尝试 RePlay?还需补哪项验证?
当任务满足 3 个条件时值得尝试:回应必须从已知集合中原样播放、演绎必须复现录音、用户对等待敏感且能接受偶尔不是最优措辞。此时在回合起始回灌帧读取截断表示并直接检索,比等待转写与大模型解码更符合延迟要求,且新增同意图台词只需嵌入即可上线。娱乐角色、场馆向导、固定话术客服属于此类,它们的价值在于可控复现而非开放创作,延迟直接决定交互是否可接受。论文显示的中位 383 毫秒与 106 毫秒分位差意味着等待更短且更可预测,这对多轮追问尤为重要。
当任务需要开放回答、新意图频繁出现或精确措辞决定成败时,不应直接套用。原文显示未见意图明显更难,精确行召回落后于大模型全量选择,对较强基线的用户偏好也不显著,这些都是具体代价而非营销式判断。若台词库频繁新增意图,就需要准备对应的微调数据;若业务要求每次都命中法官首选行,大模型全量选择的精确性仍有优势,只是要付出秒级延迟。后续验证应补三项。
第一是在真实用户语音与真实噪声下重测轮次头与检索头的稳定性,因为现有训练以合成数据为主。第二是扩大台词库并报告不同库规模下的召回率与延迟变化,以确认冻结嵌入方案的可扩展性。第三是公开可运行的延迟测量口径,包括硬件、批大小、音频分帧与播放链路,避免把模型前向时间直接等同于用户感知的等待时间。
论文特有的误解是把意图一致率高误读为选句完全正确,实际上意图对而具体行不同是常态,复述方法时应同时报告粗粒度和细粒度指标。
📎 论文与评分元数据
排名:前25% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
