英文题目:PED: Route-Decoupled Diagnostics for Persona Consistency in Spoken Agents
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.445
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#评测协议 #人类参与评测 #模型比较 #语音 #语音对话系统
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Weihao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Junrui Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Zhao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Ju Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
长时全语音角色扮演的输入是携带人格设定的多轮口语对话历史与当轮合成语音,输出是维持说什么与怎么说一致的人格化回复,实际难点在于破格时难以区分是文本生成漂移还是语音实现坍缩且缺乏轮次级定位信号。为此先为每个人格与路由采集无状态锚样本形成情感指纹以界定可分性上界,其输出的锚向量直接作为后继对齐的参考基准;再用固定的文本与语音情感投影仪将每轮转录与波形映射到同一七维情感单纯形,得到可比的路由级情感向量;最后沿基线-加压-恢复轮次计算与锚点的余弦对齐、跨人格收敛与文本-音频耦合,从而把长程轨迹转为故障定位信号。相对已有语音加角色整体打分,关键差异在于按路由解耦与按轮次追踪而非系统级聚合排名,因而能揭示文本中性坍缩与音频表达坍缩的不对称失效。在基线-加压-恢复对话协议评测下,级联管线音频路由的最近锚点准确率为44.0%,高于端到端模型的30.7%。该结论适用边界受限于固定脚本、三个人格、两类约3B架构与特定投影仪下的情感切片测量,尚未验证事实一致性与风格方言等非情感维度的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
要解决的调试难题是什么?
输入是这篇 ACL 2026 Findings 论文的正文证据与 4 张官方原图像素,目标是为刚进入语音与音频方向的研究生写出可核对、可复述的方法解读。必须保留的信息包括任务定义、两条路由的划分、共享情感测量接口、锚点与 3 阶段对话协议、两种实例化架构与 3 个人设,以及主要诊断结论与限制。输出是 1 篇按学习依赖展开的中文技术解读,不做营销式判断。
任务是长程全语音角色扮演中的人设一致性诊断。用户期待同伴聊天或游戏角色在多轮对话中保持角色,崩人设会直接损害交互质量。难点在于崩人设发生后,现有整体打分只给语音加角色的系统级分数,不说明是哪一段链路出的问题。对于端到端模型,文本与语音联合生成,问题可能在联合建模;对于级联系统,问题可能在大语言模型写错了文本,也可能在语音合成实现错了风格,还可能是两者配合错位。如果没有按轮次、按路由的证据,修复只能靠试错。
论文因此把问题框定为故障定位,而非排名比较。它只观察系统输出,即智能体说了什么文本,以及这些文本被说出来时听起来怎样。情感被选作人设表达中可观测的一个切面,因为它在文本侧体现为用词选择,在音频侧体现为韵律表达,两侧可以在同一测量接口下比较。需要强调的是,这只是人设的一个情感切片,不覆盖事实一致性、目标维持或语言风格等非情感线索。把整体评价重写为轮次级、路由级信号,是全文的学习主线。
已有路线为何不够定位故障?
同输入同目标的第一条路线是文本对话的人设与角色扮演评测。这类工作检验智能体是否遵循给定人设,覆盖多提示与多场景,也有点对多轮一致性与自动一致性指标的研究。它们的报告粒度多为提示级或对话级,不给出长程交互中的漂移轨迹。也就是说,它们能说有没有偏离,但很少说第几轮开始偏、偏离后是否恢复。
同运行阶段的第二条路线是语音智能体与语音角色扮演评测。近期基准把角色扮演扩展到语音交互,评估语音加角色的整体行为,支持跨系统比较。但论文指出,这类工作多为多维度聚合分,诊断价值有限:很少把失败归因到文本生成还是声学实现,也不提供长程漂移何时出现的按轮证据。另有工作指出零样本音频语言评委可能漏掉副语言线索,把多方面压缩为粗糙总分,这进一步说明需要更细、更可定位的评估。
同监督含义的第 3 条路线是文本与音频情感不一致与解耦研究。有研究考察词法与声学线索冲突时模型更依赖文本语义,有研究把声学与文本情感不一致当作下游任务的可学习信号,也有研究在表征层面解耦文本与声学因素。这些工作支持在共享情感视角下做分路由测量,但它们本身不是长程人设诊断框架。PED 的位置是把上述动机装进一个固定协议:共享测量接口、可比的两路量化、无状态锚点与按轮按相轨迹,从而把文本生成、声学实现及其交互分开讨论。
诊断对象如何形式化?
研究对象是角色条件下的语音对话。在第 t 轮,给定人设说明 p 与对话上下文,上下文包含此前各轮用户话语与智能体回复,以及当前用户话语。智能体输出回复转录与对应语音信号。主要测量被聚焦为两项基于情感的路由度量:转录上的文本情感一致性与语音上的声学情感一致性。
论文围绕 4 个研究问题组织分析。第一,统一情感空间中,两条路由是否呈现跨人设可分的情感模式。第二,文本与声学漂移如何随对话演化,是否有向共享空间中主导区域集中的一致方向。第三,端到端与级联系统的人设保持与典型失败有何不同。第四,不同人设在两条路由上的稳定性有何差异,文本人设与声学人设在统计上是耦合还是基本独立。
举例来说,假设同一尽责性人设连续对话 25 轮,某轮文本仍条理清晰但合成语音听感平淡,整体打分可能只下降一点。PED 要求分别回答文本与自身文本锚点有多对齐、语音与自身音频锚点有多对齐,以及这种偏离出现在基线段、压力段还是恢复段。这个例子只是帮助理解问题形状,不代表论文报告过该具体数值。
PED 的三段式诊断如何走通?
PED 的方法全景可以沿一个样本走一遍。输入是人设说明与截至当前轮的完整对话历史,系统先产生本轮回复文本与语音。接着两条路由分别进入固定的情感投影器,文本投影器读转录,语音投影器读波形,各自输出一个 7 维情感向量。最后这些向量与同系统、同人设、同路由的锚点比较,形成按轮轨迹与按相汇总,用于判断退化何时出现、源自哪条路由。
下图给出框架总览,先看从配置到可观测输出再到共享情感透镜的三栏流向,有助于把后文 3 个诊断原语放进同一位置。
看图路径: 1. 从左侧配置框沿箭头看到可观测输出框,确认输入是人设说明与长程对话;2. 对比中间文本路由与音频路由两个分支的图标与走向;3. 再看右侧两个固定情感估计器如何汇入共享情感空间并输出诊断
论文图 1。原论文 Figure 1:“PED framework for route-level diagnosis of persona consistency in long-horizon spoken interaction.”。
该图从左到右分为配置、可观测输出与共享情感透镜三部分。左侧说明诊断起点是人设说明与长程对话场景。中间把系统输出拆为说什么的文本路由与怎么听的音频路由。右侧用两个固定的情感估计器分别把文本与语音映射到共享情感空间,再输出何时漂移、源自文本还是音频或其交互、以及随轮次的轨迹。这一结构直接对应后文的测量接口、锚点与轨迹 3 个原语。
3 个诊断原语缺一不可。共享测量接口让文本与音频的量化可比,本次实例化是 7 类情感标签上的概率单纯形。按路由无状态基线即锚点,为每个系统、人设与路由提供参照,避免跨系统强加统一参照。轮次与相位索引轨迹暴露退化何时出现,实例化采用 25 轮固定脚本。3 个原语共同支持把原因归因到文本生成、声学实现或其交互。
锚点 × 漂移轨迹: 锚点分工是提供无长程上下文的系统自身在角色内情感指纹,作为每个系统、每种人设、每条路由的参照;漂移轨迹分工是记录连续 25 轮对话中每轮与锚点对齐度的变化,暴露何时开始退化。两者搭配的理由是没有参照就无法判断偏离,没有按轮记录就无法区分压力触发与持续恶化。组合意义是把有状态向量理解为相对自身锚点的偏离,从而做基于参照的相位稳定性分析。
共享空间、锚点与轨迹如何计算?
共享情感空间在本次实例化中是固定标签集上的分布。标签集包括生气、厌恶、恐惧、高兴、中性、悲伤、惊讶 7 个坐标。两个固定投影器把回复转录与实现语音映射为文本向量与音频向量,分量落在单纯形内。论文明确把投影器当作测量仪器而非标准情感标注器。它们在人类标注情感数据上训练,可作情感代理,但在合成语音与压力提示上可能失准,因此所有结论只限同一投影器内比较,标签名只表示投影器输出坐标,不应读作校准后的真实情感。
锚点是路由特定的参照。做法是对每种人设开新会话、清空对话历史,生成 20 个单轮回复,分别经固定路由投影器投影后取均值,得到该系统、该人设、该路由的在角色情感指纹。因为锚点按组合独立估计,有状态向量被理解为相对自身锚点的偏离,对齐下降表示相对自身基线退化,而非跨系统不匹配。该设计避免用一套参照衡量两种架构。
有状态对话采用固定 3 阶段脚本。基线段为第 1 至 5 轮,低压验证角色建立;压力段为第 6 至 20 轮,施加怀疑、分歧与更高情感负荷的递进挑战;恢复段为第 21 至 25 轮,回到常规提示以检验是否向基线回摆。每种人设跑一个连续对话,每轮条件为完整历史,并记录文本、波形与两路情感向量。论文说明该脚本只是受日常对话动态启发的一种实例化,其他实例化可替换脚本。
度量围绕锚点几何与轨迹展开。可分性从锚点间余弦相似度与最近锚点分类两面看,前者刻画对话前指纹是否重叠,后者把每轮观测向量判给最近的人设锚点并报告准确率与预测分布。漂移用每轮与对应锚点的余弦相似度即锚点对齐轨迹表示,再按相求均值与方差得到稳定性画像。主导标签分析取向量最大分量,统计按相出现频率与中性坐标概率质量,以检验是否向共享原型集中。
跨人设收敛在同一脚本轮索引下计算人设间两两余弦均值,按相汇总以揭示是否坍缩到共享情感模式。跨模态耦合对同一对话内文本对齐轨迹与音频对齐轨迹求皮尔逊相关,低绝对值表示在固定投影器下路由异步。
文本路由 × 音频路由: 文本路由分工是承载说什么,即回复转录中的词法与语义情感倾向;音频路由分工是承载怎么说,即同一回复语音中的韵律与表达强度。两者搭配的理由是完整语音交互的人设只能从这两路可观测输出中体现,单独看一路会把生成问题与实现问题混在一起。组合意义在于同一共享情感空间下分别测量,才能把退化定位到文本生成、声学实现或两者交互。
本研究训练了什么、冻结了什么?
本研究没有训练新的语音或语言模型,也没有报告梯度路径、优化器更新或参数冻结细节。两条路由的情感投影器是现成固定模型,文本侧使用英文情感分类模型,语音侧使用基于大语音模型的语音情感识别模型,各自原生输出被映射并重排到固定 7 维顺序,每轮每路由得到一个向量。论文把它们当作固定测量仪器使用,不在本研究中更新。
真实计算过程是调用与仿真,而非学习。端到端配置调用联合生成模型由对话上下文与人设 1 次产生文本与语音。级联配置先调用指令模型产生回复文本与短风格描述,再以固定中性音色参考调用语音合成模型合成语音。音色参考为 1 次性离线生成、全人设全轮次复用,以控制音色变量。解码设置在每种配置内固定且跨人设不变,不做按人设调参,因此差异被归因到架构与人设条件行为。
需要补的缺项是随机性控制不对称。论文说明主要分析是每个人设与系统组合的 1 次主要对话运行,级联有 3 次随机种子重跑作为稳健性检查,端到端只有少量重跑作定性核对。未报告完整的多次运行方差、解码温度与采样细节时,不应把单次轨迹读作确定性结论,后文只把跨运行保持的定性模式当作可支持的判断。
在什么条件下对比两种架构?
实例化选在数十亿参数量级,以反映常见延迟、成本与端侧约束,并控制模型规模而隔离端到端与级联的设计选择。端到端为 3B 量级的联合语音模型,级联为 3B 量级指令模型加高表现力零样本语音合成。提示与解码在各配置内跨人设固定。
人设集合取自大 5 人格中的尽责性、外向性与神经质,分别操作化为受控任务导向、积极投入与压力 reactive 的情感与压力反应倾向。每种人设用固定系统提示规定行为约束,措辞在接口允许范围内尽量一致。回复要求简洁自然,通常为英文 2 至 5 句。锚点估计另用中性锚点提示与情感诱发锚点提示两套单轮提示,每路由每人设 20 个样本。
对话协议为 25 轮固定脚本,基线 5 轮、压力 15 轮、恢复 5 轮。基线聊日常与自我介绍,压力含质疑通用性、要求证明理解、指责敷衍与矛盾、追问诚实评分等递进挑战,恢复回到缓和与合作。每轮记录回复文本、语音波形与两路情感向量,级联额外记录中间风格提示。风格提示以结构化输出给出,包含情感、语速与能量 3 个紧凑字段,供合成模型使用。
下图先看锚点指纹的形状差异,它决定后文可分性上限,阅读时重点比较端到端声学是否重叠、级联声学是否张开。
看图路径: 1. 先看四幅雷达图的标题,区分上排文本与下排声学、左列端到端与右列级联;2. 对比左下端到端声学三条人设折线是否几乎重合;3. 再看右下级联声学三条折线在不同情感轴上的张开程度
论文图 2。原论文 Figure 2:“Top: TEC anchors for E2E and Cascade; Bottom: AEC anchors.”。
该图上排为文本锚点、下排为声学锚点,左列为端到端、右列为级联,图例区分尽责性、外向性与神经质。可见左下端到端声学 3 条折线几乎重合在同一情感轴附近,而右下级联声学 3 条折线指向不同情感轴。上排文本锚点在两种架构下都相对张开。这种锚点几何直接约束最近锚点可分性,尤其预示端到端声学在高相似下难以区分人设。
端到端语音大模型 × 级联管线: 端到端语音大模型分工是联合生成文本与语音,实例中为 Qwen2.5-Omni-3B;级联管线分工是先由大语言模型生成回复文本与风格提示,再由语音合成模型合成语音,实例中为 Qwen2.5-3B-Instruct 加 IndexTTS2。两者搭配的理由是要在相近参数规模下隔离一体生成与分阶段实现的设计差异。组合意义是同一对话协议下对比,才能把差异归因到架构与人设条件行为,而非量级或流程不一致。
文本漂移与音频结构呈现什么分化?
先看可分性。锚点几何显示音频路由差异最大,端到端声学锚点两两余弦高达 0.984 至 0.999,几乎重叠,而级联声学锚点最小余弦约 0.270,外向与神经质分离明显。文本路由两种架构都相对分离,最小余弦约 0.61 至 0.63。对话内最近锚点分类准确率整体偏低,文本路由两种系统都受尽责性主导,音频路由端到端接近机会水平,级联高于机会并对神经质恢复较好。预测分布进一步揭示原型偏置,端到端文本多判给尽责性,级联音频多判给神经质。阅读规则是锚点重叠时高相似可能只是共享指纹,而非人设可辨。
再看文本路由漂移。按相文本相似度显示尽责性在两种系统中都最高且最稳。级联中外向与神经质呈现压力触发的机制切换,压力开始后文本相似度下降并持续到恢复段。端到端中尽责性随相变化温和,外向与神经质基线本就较低。主导标签分析发现中性在文本路由最常见,压力使多数组合的中性概率质量上升,但级联神经质呈相反倾向。
轮级统计显示中性主导率高但非排他,神经质会出现恐惧等非中性主导,且恢复段有种子依赖的模式切换。跨人设收敛呈现架构相反方向,端到端在压力段更收敛,级联在压力段更发散,说明漂移不仅降低锚点对齐,还改变人设间相对几何。
音频路由呈现架构分化。端到端声学相似度全人设偏高,但人设可分性接近机会,结合近重叠锚点与投影器下概率质量集中在窄区,可读作表达变异减小方向的坍缩。论文明确不把该模式唯一归因于模型行为或仪器效应。级联声学可分性高于端到端,呈现更具人设结构的变化。盲听审计抽取 60 条语音由 8 名评分者做二值诊断判断,评分者一致性约为 0.69,超过九成的端到端样本被判更平更弱,级联被判人设间更可分,该审计只作轻量一致性核对。
下图展示按轮文本与声学相似度轨迹,阅读时先分清红蓝与 3 阶段底纹,再看压力起点是否出现持续下跳。
看图路径: 1. 先确认横轴为 1 至 25 轮、纵轴为与锚点的余弦相似度,红蓝分别代表声学与文本;2. 按行对比尽责性、外向性、神经质三行,按列对比端到端与级联两列;3. 重点观察压力段起始附近文本蓝线是否出现下跳且恢复段是否回升
论文图 3。原论文 Figure 3:“Turn-level TEC-sim and AEC-sim trajectories under the baseline–stress–recovery protocol. Shaded regions denote phases.”。
该图左列为端到端、右列为级联,上中下三行分别为尽责性、外向性与神经质,横轴为轮次,纵轴为与锚点余弦相似度,红色为声学、蓝色为文本,底纹区分基线、压力与恢复。可见尽责性文本蓝线在两种架构下都相对平稳,外向与神经质文本在级联压力段波动更大且恢复段未完全回升,而端到端声学红线在部分人设上高位平稳但缺少人设区分。逐轮尖峰与持续低谷需结合按相均值理解,避免把单轮抖动当作整体趋势。
文本情感一致性 × 声学情感一致性: 文本情感一致性分工是度量转录相对文本侧锚点的对齐,记为 TEC;声学情感一致性分工是度量语音相对音频侧锚点的对齐,记为 AEC。两者搭配的理由是只有同处共享情感坐标系,跨路由的相似度与相关性才可比。组合意义是通过分别计算 TEC-sim 与 AEC-sim 及其轮间相关,可以判断双路由是同步退化还是异步解耦。
以下两张原表承担宽表要求的定量对照。第一张比较不同随机种子下级联文本路由的中性主导与按相相似度,用于检验单次运行的模式是否稳定,阅读时关注压力与恢复段是否保持同一方向。
| Seed | 1 | 72.0 | 66.7 | 60.0 |
|---|---|---|---|---|
| Seed | 2 | 60.0 | 53.3 | 60.0 |
| Seed | 3 | 72.0 | 73.3 | 60.0 |
该表按种子报告全程、压力段与恢复段的中性主导率及基线、压力与恢复 3 段的相似度均值。若多种子下压力段相似度下降与中性集中方向一致,则支持文本漂移的定性趋势而非单次偶然;若种子间恢复段差异较大,则说明恢复行为更敏感,需在结论中保留不确定性。表中数值保留原文写法与精度,不另做差值或换算。
第二张继续报告另 1 人设在 3 种子下的中性主导、恢复主导模式与相关均值,用于区分外向与神经质的稳健性差异,阅读时重点看压力后 persona 典型情感是否持续受抑。
| Seed | 1 | 60.0 | 60.0 | 60.0 |
|---|---|---|---|---|
| Seed | 2 | 68.0 | 53.3 | 80.0 |
| Seed | 3 | 76.0 | 80.0 | 80.0 |
该表同样按种子报告全程、压力与恢复的中性主导率、恢复段主导模式构成与相关均值。若外向在多种子下都呈现压力后高兴受抑与中性集中,则该模式可认为跨运行一致;若神经质恢复段在中性与恐惧等模式间切换,则需表述为恢复更具种子敏感性。两张表共同说明主要文本倾向不是单轮伪影,但强度因人设而异。
拿掉风格提示与切断耦合能证明什么?
风格提示消融固定转录,只开关中间风格描述后用同一合成后端与同一音色提示重生成语音,统计 1 至 25 轮。结果显示去掉风格提示后级联声学向更集中区域移动,人设可辨结构减弱,平均声学向量与端到端参照的余弦距离因人设而异地变化。论文据此判断显式控制通道有助于形成人设结构化的声学表达,但文本路由在压力下仍是瓶颈。也就是说,级联音频侧的优势依赖是否暴露可控韵律通路,保留并验证该通路很关键。
跨模态耦合测量对每种人设计算逐轮文本相似度与声学相似度的皮尔逊相关。6 组 persona 与架构组合的相关都弱,表明在固定投影器下双路由行为路由异步。结合级联中外向与神经质文本在压力后变化而声学仍相对结构化,可读作压力下的文本与声学解离。弱耦合不是证明两者因果无关,只是说明用当前仪器在当前协议下,对齐轨迹的线性同步性很低。
下图用热图汇总 6 组相关系数,阅读时先确认行列含义,再判断是否全表接近零。
看图路径: 1. 先确认行是两种架构、列是三种人设,格内数值为皮尔逊相关系数;2. 观察全部六格数值是否都接近零,正负与深浅变化是否很小;3. 结合底部色条范围判断弱耦合结论是否来自全表一致的低值
论文图 4。原论文 Figure 4:“Pearson correlation between per-turn TEC- sim and AEC-sim across personas and architectures.”。
该热图行为端到端与级联,列为 3 种人设,格内数值为皮尔逊相关系数,底部色条范围约为负 0.15 至正 0.15。六格数值分别为端到端 0.03、0.09、0.01 与级联负 0.03、0.07、0.02,颜色深浅变化很小。全表一致的低绝对值支持路由异步的判断,也说明不能用一路的对齐轨迹预测另一路。
风格提示 × 语音合成: 风格提示分工是级联中由大语言模型输出的短情感与节奏能量描述,用于约束同一文本该怎么说;语音合成分工是 IndexTTS2 在固定音色提示下把文本与风格提示实现为波形。两者搭配的理由是级联显式暴露了文本到声音的中间控制通道,可做有无消融。组合意义是固定转录只开关风格提示重合成,就能检验音频侧人设结构是否依赖该控制通道。
哪些结论不能超出本次实例化?
实例化范围有限。模型为两个约 3B 配置,3 个人设均为大五子集,脚本为固定基线、压力与恢复,解码在系统内恒定。论文明确这些是受控条件下的诊断,不必然推广到其他模型家族、语言、对话场景或提示解码选择。锚点按系统、人设与路由分别定义,主要支持系统内诊断,跨系统使用需要匹配协议与测量接口。
测量仪器依赖是核心限制。共享接口用两个现成情感投影器映射到 7 维标签单纯形,标签集会丢掉细微差别,投影器对合成语音与压力提示可能失准。因为锚点与漂移由同一仪器测量,系统性偏差可能产生内部一致但仪器特定的模式,坐标名如生气不必对应人类感知。因此结论刻画的是所选测量空间中的退化,换仪器可能改变可分性与主导坐标。
情感代理不等于完整人设。PED 把人设操作化为情感表达以获得跨路由可比测量,不捕捉话语组织、事实一致、长期目标维持或个人习语等非情感线索。结论只关乎情感性人设表达及其稳定性,不是对角色保真度的完整度量。
单轮协议与随机性也需保留。主文每组合分析 1 次主要连续对话,稳健性依赖有限重跑,随机解码可产生不同轨迹,且随机性控制在架构间不对称。因此只能主张跨报告运行保持的定性模式,不能把单次轨迹的精确数值推广为固定规律。伦理上所有数据为模型生成文本与语音,不含真实用户对话与个人标识,人格概念仅用于定义虚拟角色,不用于推断真人,部署需披露合成属性并配套滥用监测。
要复现诊断需要准备什么?
复现先固定可比条件。准备两种架构实例,端到端用联合语音模型,级联用指令模型加语音合成,并保持参数量级与解码设置在配置内跨人设一致。准备 3 种人设系统提示,尽责性强调条理可靠,外向性强调热情主动,神经质强调紧张易扰,回复约束为英文简短自然。准备固定中性音色参考,级联全程复用,端到端默认语音与之保持一致。
再搭建测量与协议。部署两个固定情感投影器并统一映射到相同 7 维顺序,文本读转录,语音读波形。实现锚点估计流程,每系统、每人设、每路由在空历史下采样 20 个单轮回复并取均值。实现 25 轮 3 阶段脚本,基线 5 轮、压力 15 轮、恢复 15 轮中按原文逐轮提问,恢复 5 轮回到缓和。每轮记录文本、波形、两路向量,级联额外记录风格提示的结构化情感、语速与能量字段。
计算时先求锚点间余弦与最近锚点分类,再求逐轮锚点对齐轨迹与按相均值方差,接着统计主导标签频率与中性概率质量,以及跨人设收敛与双路由皮尔逊相关。稳健性至少对级联做 3 种子重跑,核对压力触发与中性集中是否保持方向,恢复段是否种子敏感。资源状态方面,未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,复现应按论文附录提示词与脚本自行搭建。
何时值得尝试这种分路由诊断?
当语音智能体出现长程变淡、压力下变平或人设混淆,且整体打分无法说明改文本还是改声音时,值得尝试 PED 式诊断。它的价值不在给出总分高低,而在给出何时漂移、哪条路由偏离、是否向共享原型集中、双路由是否解耦 4 类可行动信号。3 个阅读规则可直接复用:锚点重叠限制可分性,高相似不等于可辨;文本失败常表现为最近锚点偏置与中性集中;压力可改变人设间相对几何,收敛与发散都可能发生。
对模型设计的启示因架构而异。端到端音频侧问题是人设可分性弱而非对齐低,优先提高音频可控性与人设可辨韵律。级联显式风格通道有助于音频结构,但文本路由在压力下仍是瓶颈,需在保持长上下文人设依从的同时验证风格通路。还需补的验证包括更多模型家族、更大人设与场景集合、非情感测量接口,以及系统性多轮运行与人类听感校准,以检验路由级诊断是否预测可感知的人设漂移。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
区域 5 · 查看论文原页
区域 6 · 查看论文原页
区域 7 · 查看论文原页
区域 8 · 查看论文原页
另有 15 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses











