英文题目:POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
会议身份:
conference:interspeech:2026:conference-paper-id:li26k_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#迁移学习 #跨语言 #零样本 #语音翻译
评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Xuanchen Li:机构信息未能从会议 PDF 纯文本可靠映射
- Chenrui Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Meng Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Zikang Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Jin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuheng Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Nyima Tashi:机构信息未能从会议 PDF 纯文本可靠映射
- Longbiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jianwu Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理多语言语音到文本翻译(Speech-to-Text Translation,S2TT),输入为多源语言语音,输出为中文文本,难点在于语音编码器表征按语种聚类导致低资源语言难以复用高资源翻译映射。方法链分三步,首先由偏差补偿(Bias Compensation,BC)模块估计并减去语种均值偏置以粗对齐编码器输出,其结果送入冻结编码器后的查询变换器(Query Transformer,Q-Former)。接着在Q-Former内部利用语义相同的跨语言平行语音对施加分词级别最优传输(Optimal Transport,OT)约束,以Sinkhorn距离学习软对齐并与翻译交叉熵联合优化。最后由在线奖励引导层调度策略基于置信上界(Upper Confidence Bound,UCB)选择最受益的浅层施加OT,避免深层与解码目标冲突。与以往仅做语音到文本跨模态对齐的方法不同,该框架直接对齐源语言语音之间语义一致性,保留声学细节并促进跨语言共学。在FLEURS数据集上相对同结构基线5语种平均提升1.29 BLEU,零样本语言平均提升2.93 BLEU,显示低资源泛化收益。结论仅在英日西韩俄到中文及6个零样本方向验证,未验证其他目标语言与大规模噪声场景外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么直接翻译不够?
这篇解读的输入是论文正文文字证据与 3 张官方原图像素,目标是让刚进入语音与翻译方向的研究生能复述做法与实验条件。必须保留的信息包括任务定义、冻结与训练边界、平行语音用量、评价语言与指标方向,输出是一套可按样本走查的流程说明。
任务本身是语音到文本翻译,也就是输入一段源语言语音,直接输出目标语言文本。本文统一做成到中文的翻译,不经过先转写再翻译的中间步骤。初学者容易以为只要把语音编码器接上大语言模型就能自动多语言通用,但论文指出多语言编码器表示是按语言抱团的。
相同语义的不同语言语音并不靠近,模型先记住语言身份再猜意思。于是解码器学到的英语到中文映射很难搬到日语上,高资源语种好而低资源与零样本语种差。这个差距不只是数据多少的问题,更是表示空间不可比的问题。
语音大模型 × 语音到文本翻译: 语音大模型分工是把语音编码器输出映射到大语言模型文本嵌入空间并完成推理生成,语音到文本翻译分工是把源语言语音直接转为目标语言文本而不经过中间转写,二者搭配的理由是前者提供可复用的翻译映射与生成能力,后者给出具体的跨语言泛化任务,组合意义是让表示是否跨语言可比直接决定翻译能否跨语种复用。
沿一个样本走一遍会更清楚,例子输入西班牙语 Hola, Mundo。语音编码器先给出随时间变化的语音表示,投影模块把它变成大语言模型能读的语音嵌入。嵌入再与提示词嵌入拼接后由大语言模型生成中文你好,世界,理想情况下英语 Hello, World 应落到相近位置。
论文要解决的正是这一步没有发生,没有跨语言约束时西班牙语和英语嵌入各在自己区域。翻译只能靠各自数据量硬撑,低资源语言自然落后,这就是后文引入跨语言对齐的动机。
同输入同目标的已有路线为什么被认为不够?
在相同输入输出与相同运行阶段下,已有语音表示对齐工作主要做语音到文本的跨模态映射。早期有无监督跨模态嵌入对齐,后续有用词对齐的对比学习。还有为接入大语言模型做的自适应内部对齐,这些工作的监督都来自文本。
论文承认这类跨模态建模让机器翻译解码器知识更容易迁移,但指出两个局限。第一是对齐方向被限定为语音跟随文本,学习目标由文本监督定义。第二是容易压缩文本中没有的细粒度声学细节,每个源语言也被独立处理。
没有显式利用不同源语言之间可迁移的共享表示,跨语言知识迁移因此受限。教学上可以这样记,已有路线回答语音如何像文本。POTSA 要回答不同语言的语音如何像彼此,这是方向上的根本差异。
论文还把对齐度量分成严格点对点度量与最优传输两类,前者在语音令牌下标不对齐时会失效。后者允许未知对应下的全局最优软匹配,给出更稳定且保持结构的对齐信号。这为后文选择 Sinkhorn 距离形式的最优传输损失埋下依据。
偏差具体长什么样,对齐后应变成什么样?
论文用示意图把问题具象化,对齐前英语、西班牙语、日语的语音点各自聚成语言簇。纵使文字含义相同也不会混在一起,对齐后同一语义的不同语言点应收敛到共享表示。论文称之为枢轴语言,这不是真的生成一种中间语言。
而是指表示空间中按语义组织的中立位置,下面这张图就是该对比的教学载体。左为语言聚类而右为语义聚类,阅读时先看颜色与语义标签的关系,再看虚线汇聚方式。
看图路径: 1. 先看左图蓝色英语点绿色西班牙语点红色日语点是否各自抱团而不按语义混合;2. 再看右图同一语义的不同颜色圆点是否用虚线连向同一个灰色支点;3. 对照图注中共享表示的说法确认对齐目标是语义聚类而非语言聚类
论文图 1。原论文 Figure 1:“(a) Language-specific clusters before alignment. (b) Utterances with the identical semantics converge toward a shared representation (pivot language).”。
从像素可见左图蓝色英语点、绿色西班牙语点、红色日语点各自抱团,右图则出现灰色枢轴节点。同一组问候语的不同颜色点用虚线连向同一灰点,例如早上好与对应西班牙语和日语表达被拉到一起。这说明期望不是让日语语音变成英语语音。
而是让二者在更高层表示中弱化语言身份、只保留语义,这也解释了后文两步做法。前者用全局偏置相减打散语言簇,后者用令牌级软匹配按语义重建簇。两步衔接后解码器才能复用同一套语义到中文的映射。
三步框架如何分工,哪些参数动哪些不动?
POTSA 全景可以按数据流记忆,底部是 1 对平行语音,语义相同但语言不同。例如西班牙语 Hola, Mundo 与英语 Hello, World,它们进入同一个语音编码器得到表示。表示经过偏置补偿减去语言偏置,然后进入 Q-Former 投影为语音嵌入。
嵌入最后与提示词嵌入一起进入大语言模型生成译文并计算翻译交叉熵,与此同时平行对在 Q-Former 内部被施加令牌级最优传输损失。层调度决定该损失作用在哪几层,关键冻结边界是原文明确给出的。
只训练 Q-Former 而语音编码器与大语言模型都冻结,翻译真值只在训练期经分词器进入模型。下图展示该主路径与训练期平行分支的关系,读图时先走主翻译路径,再看平行分支在哪里汇入对齐损失。
看图路径: 1. 沿底部平行语音对向上追踪语音编码器到投影器再到大语言模型的主路径;2. 确认语音编码器和大语言模型旁的冻结标记与投影器的可训练标记;3. 观察右侧提示词与翻译真值经分词器进入大语言模型的监督路径
论文图 2。原论文 Figure 2:“Model Architecture of Our Cross-Lingual Speech Alignment Framework”。
从可见像素看底部虚线标注平行语音对,上方语音编码器到投影器再到大语言模型构成纵向主链。右侧分词器把提示词与翻译真值送入大语言模型,顶部输出译文并标出交叉熵损失。偏置补偿位于编码器输出之后,Q-Former 内部多层结构是后文层调度对象。
复述时要强调梯度路径,翻译损失更新 Q-Former 以写准中文。对齐损失同样只影响 Q-Former 而不解冻编码器与大模型,因此跨语言一致性是通过投影方式学会的。这不是靠重训编码器或大模型实现的,边界必须记准。
偏置补偿做了什么减法,推理时偏置从哪来?
偏置补偿是粗对齐,白话解释是先承认每个语言有一个整体偏移,再把它减掉。英文名是 Bias Compensation,论文假设编码器输出可加性分解为语言无关成分与语言相关偏置。某语言某条语音的表示等于去偏后表示加上该语言共享的偏置向量。
做法是把该语言所有语音在时间池化后的句级表示取平均,得到偏置估计。再从每条语音中减去它,训练时按训练集估计每个语言的偏置。推理时直接沿用训练配置中的偏置,不重新估计。
偏置补偿 × 最优传输: 偏置补偿分工是在编码器输出端减去按语言平均得到的全局语言偏置以缩小整体偏移,最优传输分工是在 Q-Former 内部对平行语音令牌序列做全局最优软匹配以建立细粒度语义对应,二者搭配的理由是粗对齐先让表示可比再做细对齐更稳定,组合意义是用全局减偏置加局部软匹配两步把同一语义的不同语言语音拉向共享表示。
这个减法的教学意义在于它不看语义配对,只看语言整体分布。因此它只能缩小系统性偏移,不能保证同一句话的不同语言版本真正对齐。但它让后续细粒度匹配起点更可比,避免最优传输一开始就被巨大语言偏移主导。
需要注意原文未报告池化具体算子之外的细节,也未交代偏置维度的额外处理。复述时不应自行脑补归一化或投影实现,缺项就明确记为缺项。这一步是为细对齐准备的可比空间,而不是最终语义对齐。
令牌级最优传输如何绕开下标不对齐?
细对齐发生在 Q-Former 内部,白话解释是最优传输允许软匹配,英文名是 Optimal Transport。平行语音对经过投影后变成两个令牌序列,长度可能不同且下标没有对应关系。如果用均方误差或余弦相似度做严格点对点比较,就会要求第几个令牌对第几个令牌。
这在语速与切分不同时不成立,最优传输转而学习一个传输计划矩阵。在均匀等边缘约束下寻找全局最优软对应,再以平方欧氏距离为地面代价计算加权距离。并加入熵正则项控制匹配平滑程度,论文对选中中间层都计算该层损失。
平行语音对 × Q-Former: 平行语音对分工是提供语义内容相同但语言不同的语音锚点,Q-Former 分工是用可学习查询把变长语音表示压缩投影为定长令牌并送入大语言模型,二者搭配的理由是只有语义相同的成对输入才能在不依赖目标文本偏置下定义跨语言一致性损失,组合意义是让唯一可训练的投影层在平行锚点约束下学会语言无关的投影方式。
多层损失取平均后与翻译交叉熵按权重系数联合优化,原文给出的权重系数是 10。沿样本继续走,西班牙语与英语平行语音在同一层各得到一组查询令牌表示。最优传输损失迫使这两组表示在软匹配下距离最小,而翻译交叉熵迫使各自都能生成正确中文。
翻译交叉熵 × 层调度: 翻译交叉熵分工是保证语音到中文译文的准确性,层调度分工是决定最优传输损失加在哪几层 Q-Former 上,二者搭配的理由是高层靠近解码器主要受翻译目标驱动而全层加对齐会与翻译目标竞争,组合意义是用在线奖励选择语义收益最大的层施加对齐从而同时学准翻译并保持跨语言对应。
两者联合的结果是投影层既要写准目标语言,又要让源语言之间互相靠近。原文未给出传输计划是否截断梯度等全部梯度细节,复述时只说损失作用于 Q-Former 层。不猜测英语分支是否截断之外的实现,避免把推测当事实。
训练分几段走,每段用什么数据与学习率?
训练流程按论文交代可分为先验预训练与多语言微调两大段,先在大规模 CoVoST2 上用 364 小时训练数据训练语音大模型。先做英语到英语的自动语音识别预训练,再做英语到中文的语音翻译训练,两段任务目标不同但共享同一语音大模型结构。
随后在 FLEURS 上做多语言混合监督微调,FLEURS 覆盖上百语言,每语言约 10 小时监督语音。源语言到中文任务使用英语、日语、西班牙语、韩语、俄语 5 种训练语言,平行语音每语言仅用 10 小时用于对齐学习。
模型实现基于 SLAM-LLM 框架,语音编码器与语言模型冻结,跨语言对齐经由 Q-Former 实现。Q-Former 有 8 个 Transformer 块与 80 个查询令牌,训练采用 2 阶段学习率分别为 1 乘 10 的负 4 次方与 1 乘 10 的负 5 次方。
训练并带预热机制稳定早期训练,最优传输联合损失权重为 10,所有实验在 NVIDIA RTX 4090 上进行。需要区分 364 小时是初始语音大模型训练量,10 小时是后段每源语言的平行与监督量。论文未报告批量大小、优化器种类与训练步数等完整预算,复现前应把这些记为缺项。
在什么数据与基线上测,指标方向如何读?
评价围绕两个问题组织,常见语言是否整体变好,未见过的零样本语言能否泛化。数据集是 FLEURS 测试集,训练语言为上述 5 种到中文的方向。零样本语言包括法语、德语、卡布佛得语、宿务语、阿斯图里亚斯语、吉尔吉斯语,指标是 BLEU。
方向是越高越好,比较对象包括自建基线与外部强基线。自建基线是 Whisper-v3 加 Q-Former 加 Qwen-2.5-7B 的端到端系统,训练数据与本方法相同。外部包括 Qwen2-Audio、Qwen2.5-Omni 与 Minmo,其中 Minmo 被注明非公开且训练语料大得多。
因此不能视为同条件胜负,对齐方法对比包括均方误差、余弦相似度与最优传输。并报告 95% 置信区间与统计显著性,层选择对比包括单层、多固定层、随机层、全层调度与低层调度。
一致性分析另用 R@1 度量点级跨语言检索准确性,用 1 减 JSD 度量全局分布一致性。两者都是越高越好,阅读数字时必须同时核对数据集、基线、阶段与聚合对象。平均 BLEU 与零样本平均 BLEU 是不同列,不能混读。
主结果提升多少,零样本为何更值得看?
主结果要回答的比较问题是,在相同训练数据下对齐框架是否带来一致增益。以及在未训练语言上增益是否更大,公平条件是自建端到端基线与本方法共享编码器、大模型与训练数据。指标方向是 BLEU 越高越好,下表整理了论文报告的五训练语言与平均分。
数值保留原文写法,平均列为五语言平均,零样本平均另见正文描述,阅读时先确认语言方向与聚合对象。
| 方法 | en→zh | ja→zh | es→zh | ko→zh | ru→zh | 五语平均 | 零样本平均 |
|---|---|---|---|---|---|---|---|
| Qwen2-Audio | 37.45 | 20.02 | 28.69 | 25.69 | 29.01 | 28.17 | 16.67 |
| WhisperV3 加 Qwen2.5 端到端基线 | 40.09 | 24.32 | 30.14 | 27.07 | 31.13 | 30.55 | 17.91 |
| POTSA 本方法 | 40.87 | 25.97 | 31.10 | 28.97 | 32.30 | 31.84 | 20.84 |
表后解释需要同时给出收益与代价,论文报告本方法五语言平均达到 31.84。比自建基线高约 1.29 BLEU,在零样本平均上达到 20.84,比基线高约 2.93 BLEU。且每源语言只用 10 小时平行语音,分语言看韩语与俄语等提升较明显。
英语本身已高仍有小幅提升,代价是需要构造平行语音对并引入额外最优传输损失与层调度。训练复杂度高于只做翻译微调,未胜出项是部分语言上外部大模型仍有单点优势。例如 Minmo 在个别语言上数值更高,但其训练量与可获得性不同。下面这张图把表示一致性与翻译质量联系起来,上排显示补偿前后分布从分离到重叠。
看图路径: 1. 先比较上排补偿前后多语言密度区域是从分离变为大面积重叠;2. 再看下排散点中本方法点是否整体向右上迁移即 R@1 和 1-JSD 同时升高;3. 区分灰色基线点与绿色本方法点的纵向差距以理解分布一致性改善
论文图 3。原论文 Figure 3:“Alignment analysis: coarse bias compensation and fine-grained OT alignment improve cross-lingual consistency (R@1 and 1 −JSD) and translation quality.”。
从像素可见上排补偿前各语言密度区域分离,补偿后大面积重叠。下排横轴为 R@1 百分比越高越好,纵轴为 1 减 JSD 越高越好。绿色本方法点集中在右上,灰色基线点偏左下,论文据此认为语言对向右上迁移对应约 1.29 BLEU 增益。
这支持表示统一让解码器不再被语言差异干扰的解释,但这仍是相关性证据。不能直接读成因果证明,还需结合消融判断各模块的独立贡献。
拿掉哪一块掉得最多,平行对应该怎么配?
消融要回答两个可操作问题,粗对齐与细对齐各自贡献多少。平行对用英语锚定还是随机配对更好,比较条件是相同主干与相同数据。指标仍是 BLEU 越高越好,下表同时收录组件消融、对齐方式与配对策略。
最后一列为零样本平均,中间列为训练语言平均附近的报告值,阅读时注意两类平均不可互换。
| 条件 | 训练平均 | 零样本平均 | 梯度控制 | 对比含义 |
|---|---|---|---|---|
| 去掉偏置补偿 | 31.11 | 19.34 | 2 分支正常更新 | 粗对齐缺失仍有细对齐 |
| 去掉最优传输对齐 | 30.73 | 18.51 | 2 分支正常更新 | 细对齐缺失只剩粗对齐 |
| 英语锚定固定分支 | 30.80 | 18.37 | 英语分支不回传梯度 | 英语锚定但单侧稳定更新 |
| 英语锚定可训练分支 | 25.34 | 11.53 | 双向更新英语分支 | 英语中心双向更新漂移最大 |
| 随机成对对称对齐 | 31.84 | 20.84 | 随机两语言双向更新 | 本方法最终策略效果最好 |
表后解释先看组件,论文显示去掉偏置补偿后训练平均降至 31.11 左右。去掉最优传输后降至 30.73 左右,说明粗对齐带来可观增益。细对齐进一步提升整体质量,且零样本端掉点更明显,另一组特有细节是最优传输与严格点对点度量对比。
论文报告最优传输平均最高,余弦与均方误差更低,置信区间显示差异非随机波动。再看配对方式,随机成对对称对齐在每步随机选两种语言双向对齐,效果最好。英语锚定固定分支略好于可训练分支但仍不如随机配对,可训练英语分支最差。
论文的解释是英语中心不对称会带来表示漂移与遗忘,固定锚更稳定但仍受锚主导限制。该解释属于有限解释,论文未直接测量遗忘率,复述时应标为支持性说法。随机配对去除了锚主导并促进跨语言共学,但同样待更直接的机制验证。
召回率 R@1 × 1-JSD: 召回率 R@1 分工是度量点对点的跨语言检索准确性即平行句能否互检到对方,1-JSD 分工是度量全局分布一致性即不同语言表示分布是否重合,二者搭配的理由是只看单点会漏掉整体偏移而只看分布会漏掉细粒度错位,组合意义是共同验证粗细 2 级对齐是否把表示空间真正统一而不只是 BLEU 上升。
层选择上允许适度探索的低层调度最好,全层调度与多固定深层最差。论文归因于高层靠近解码器并主要受交叉熵驱动,再加强行跨语言收敛会形成竞争目标。该归因同样是事后解释,未做梯度冲突的直接测量,复现时应先在低层搜索。
层数与置信区间告诉我们改进是否只是运气?
这一节把论文特有的统计与层调度细节展开,避免把单次最高分当成结论。论文对不同对齐策略报告了平均 BLEU 与 95% 置信区间,并标注与基线相比显著性小于 0.05。单层、随机层与低层调度等策略的区间较窄,最优传输区间为正负 0.09 左右。
优于均方误差的正负 0.17 与余弦的正负 0.12,层调度对比中随机选一层优于固定单层与多固定层。而把在线奖励调度限制在低层 Q-Former 的策略最好,把调度放到全部层反而最差。
操作含义是复现时不应默认全层加对齐,而应先在低层搜索。对初学者要提醒,总体趋势不等于每组都成立。论文的显著性是针对平均值的判断,不能推广为每个语言或每一步都显著。
未评测的边界包括更深的大模型、非中文目标语言,以及更长的平行语音量下的收益曲线。这些在原文中没有报告,不能自行推断,任何推广都需标注为待验证。
哪些结论还不能下,哪些成本没有测?
论文直接报告的是 BLEU 与一致性指标的提升,有限解释是对表示漂移、目标竞争与跨语言共学的归因。未验证的推测是这些机制必然在更大模型或更多语言上同样成立,缺失证据不是技术错误,但复述时要用词区分。
报告用报告或显示,支持性分析用支持,推广用可能或待验证。资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成验证的资源。因此不得声称代码、模型或数据已公开,原文中的仓库链接只能视为文本提及。
不能写成当前可用,训练与推理成本方面论文只给出 GPU 型号与部分超参数。未报告总训练时长、显存占用、推理延迟与输出帧率,因此不能承诺延迟或成本得到改善。评价方面未测量误判率、人工评分与非中文目标的翻译质量。
自动指标不能当作人工评价,数据方面平行语音的构造方式、说话人是否重叠、噪声与口音分布等细节未充分交代。10 小时是否在所有语言上都充分也待验证,理解这些边界后才能避免误读。不能把零样本平均提升直接理解为任意新语言都能提升。
要复现应先准备什么,先跑哪条最小链路?
复现先做三件事,第一按原文准备数据链路。先用 CoVoST2 的识别与英到中翻译做初始语音大模型,再用 FLEURS 的五训练语言做多语言微调。每源语言保留 10 小时可配对的平行语音,测试时覆盖训练语言与 6 个零样本语言。
第二按冻结边界搭建模型,冻结语音编码器与大语言模型,只让 Q-Former 可训练。Q-Former 按 8 块与 80 查询令牌配置,编码器输出后先实现按语言平均再相减的偏置补偿。推理时沿用训练期偏置,不要重新估计,这是容易出错的细节。
第三按损失搭建训练目标,翻译交叉熵加权重为 10 的最优传输损失。传输损失对选中 Q-Former 层的中间嵌入计算,层选择先从低层随机与奖励调度开始。不要一开始就全层施加,否则可能与翻译目标竞争。
最小可运行链路是先跑通无对齐的端到端基线并复现五语言与零样本平均,再加入偏置补偿看分布是否重叠。最后加入最优传输与层调度并用 R@1 与 1 减 JSD 检查一致性是否向右上移动,仍需补的验证包括批量大小与优化器等缺失超参数。
还需不同随机种子的区间,以及平行对中说话人与内容的控制实验。常见误解是以为冻结编码器就意味着输出确定,实际上解码仍受采样与提示影响。冻结只说明参数不更新,不保证输出确定,这点必须向初学者讲清。
何时值得尝试这种对齐,何时不必?
当任务是多语言语音到同一目标语言的翻译,且已有较强的冻结编码器与大语言模型。但低资源与零样本语言明显落后时,值得尝试这种只动投影层的跨语言对齐。它用较少的平行语音换取表示可比性,适合数据预算有限但需要泛化的场景。
当目标只是单语言识别或单高资源语言翻译,或者已有充足的多语言监督能直接学好映射时。额外引入传输损失与层调度的收益可能有限,不必优先做,论文特有的经验是粗细 2 级缺一不可。
全局减偏置解决语言簇分离,令牌级软匹配解决语义对应,随机配对避免英语锚主导。低层调度避免与翻译目标竞争,把这四句操作化就能在不重写全文的情况下复述方法。也能定位失败与设计下一步对照,这是本篇最可迁移的结论。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


