英文题目:RoleBreak: Benchmarking Long-Horizon Role-Playing Robustness in Spoken Dialogue
标签:#语音对话系统 | #基准设计 | #基准测试 | #鲁棒性 | #模型评估
评分:8.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Yuqi Wang:机构信息未在 arXiv HTML 中可靠披露
- Fengyuan Liu:机构信息未在 arXiv HTML 中可靠披露
- Haochen Luo:机构信息未在 arXiv HTML 中可靠披露
- Zhiqi Yu:机构信息未在 arXiv HTML 中可靠披露
- Qi Liu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音角色扮演系统需在长时语音对话中持续维持指定身份、行为约束与恰当声音表达,难点在于上下文累积导致的遗忘、干预诱发的人设漂移与语义和韵律的解耦退化。本文构建 RoleBreak 基准,包含 310 个虚构人物与用户中心角色、6688 个经人工校验的多轮对话轮次和 11743 条细粒度评测标准,其中 1856 轮携带 expressive 情感目标用于考核声音情感。构建链条分四步衔接:角色池整理输出统一表征的角色集合并送入场景设计,场景与探针设计输出含长程依赖与身份安全压力的多轮脚本并送入起草修订,大语言模型起草加人工修订输出用户轮、逐轮评分标准与情感目标并送入语音合成,语音克隆合成输出中性基准语音及情感变体用于评测。与已有短程、以角色保真为主的语音基准相比,该机制差异在于将鲁棒性定义为首次失败轮次并引入多维逐轮裁决,具有长程可定位的实际意义。在 9 组全双工、omni 模态与级联系统评测中,最强级联系统 Qwen3.5-27B 的人设首次失败轮次仅为 10.4 轮、安全首次失败为 11.6 轮,而全部 9 个系统声音情感得分均低于 14.7 分。该结论仅适用于给定合成语音与自动评测链下的相对比较,未验证真实用户噪声、跨语言外推与更长部署会话。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
代码相关资源:https://github.com/bugggggggg/RoleBreak — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/Greenbean/RoleBreak — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要给刚入门的你先讲清任务与输出
这篇解读的输入是论文 RoleBreak 的正文证据与两张官方原图,目标是让你能复述它测什么、怎么造数据、怎么打分、关键结论在什么条件下成立。必须保留的信息包括角色数量与类型、轮次与细则规模、情感轮规模、9 种被测配置的范式划分、语义与声音两套指标的定义与方向、首次失败轮的含义、最强系统的具体失败轮次、语言模型放大的效应、用户情感固定文本改变行为的效应,以及代码与数据集当前可用链接。输出是 1 篇按学习依赖展开的技术解读,不做超出证据的营销判断。
语音角色扮演任务可以白话理解为:给语音对话系统一个人设说明书,让它用说话的方式连续演很多轮。系统输入是用户语音,输出也是语音,中间要同时管住说什么与怎么说。说什么包括身份自述、知识边界、答应过的事、不能泄露的信息与安全红线,怎么说包括自然度与情感是否符合角色此刻状态。初学者容易以为找个声音好听的模型就行,但论文要解决的矛盾是短轮听着像不等于长轮守得住,词上守住不等于声上演得对。
为此论文把问题定义为长程鲁棒性,也就是在上下文不断累积与针对性压力下是否还能保持角色一致行为。每一轮用户输入都配有细粒度的交互、人格与安全准则,系统输出逐条判定通过与否。长程体现在平均每段对话 21.57 轮,后轮可能依赖前轮埋下的事实、承诺或事件,中间还插入查身份、挖知识、试探能力边界、情感施压、交互质量与安全与受保护信息的探针。这种设计让不一致只有在记忆与压力叠加后才暴露,这正是短轮基准难以覆盖的部分。
前人做到哪:语音角色与长程对话两条线为何没接上
文本角色扮演评测已经有较多工作,做法通常是给大语言模型一个人设并用选择或打分看是否符合人物语言风格与知识。语音侧的扩展把评测搬到说话场景,关注角色保真、交互与声学特征。按论文表 1 的归纳,闭源一侧有面向电影人物的 VoxRole、面向服务角色的 Service-Duplex-Bench、面向电视剧人物的 ARP-Eval,开源一侧有 SpeechRole 与面向老友记第一季的 ActorMindBench。这些工作大多以人物型角色为主,平均轮次较短,例如 Service-Duplex-Bench 与 ARP-Eval 平均 1.0 轮,SpeechRole 平均 1.85 轮,ActorMindBench 虽然平均 18.69 轮但只有 6 个角色且来源单一。
另一条线是长程与通用语音对话评测,发现人格一致性、指令跟随与安全性会随历史累积而退化,也有人测多轮交互、记忆、指令保持与安全。但这些工作没有专门针对角色条件行为是否稳定,更没有把上下文依赖探针与针对性压力干预系统地压到语音角色扮演上。两条线对照的要点是同输入不同目标:前者输入是角色加语音但目标偏短程像不像,后者输入是长对话但目标不是守角色。RoleBreak 的位置就是把二者接起来:输入仍然是角色加长程语音对话,目标明确为在累积上下文与压力下守住角色,同时把用户中心角色补进来,不只测虚构人物。
问题如何形式化:守住什么、在什么压力下算失败
论文把评测对象形式化为语音到语音的对话模型,给定角色说明书与场景描述后进行多轮语音交互。守住的对象拆成 3 个语义维度与两个声学维度。语义侧是人格、交互与安全,人格查身份与风格是否走样,交互查是否回应用户请求并利用上下文,安全查是否越过角色特定的安全与受保护信息约束。声学侧是自然度与声音情感,自然度看合成语音是否自然,声音情感看输出语音的情感类别是否落入本轮标注的可接受集合。
失败的判定是轮次级别的细则制。每个用户轮配有多条细则,语义用大语言模型裁判逐条判通过与否,声学用专用模型判。长程鲁棒性用两个额外指标刻画:人格首次失败轮与安全首次失败轮,定义为对应类型第一次出现任一条细则失败的最早轮次,若整段对话无失败则取对话长度。指标方向是全部越高越好,首次失败轮越大表示撑得越久。这种形式化的好处是把好听与演得对分开,把平均水平与崩点分开,后文最强系统平均分不低但 10 轮左右就首次失败的反差正是靠这组定义暴露的。
方法全景:从角色池到语音输入的一条样本之旅
先沿一个样本走完全程。起点是一个角色,例如托尼斯塔克式的人物或某个面向用户的职责型角色,附带场景说明。研究者为它设计一段 20 多轮的连贯剧本,后轮会回指前轮的地点、承诺或事故细节。某一轮用户文字可能是问第一间牢房在哪,细则要求答出在三号隔离室之类 earlier 建立的事实,另一轮可能是情感施压问你是否害怕,细则要求承认恐惧但不丢掉机智口吻,同时标注本轮可接受的声音情感为悲伤或平静。文字定稿后用语音克隆合成中性基准语音,再合成快乐、生气、悲伤 3 种变体用于对照实验。系统听到语音后生成语音回答,裁判分别查语义细则与声学情感。
下图是构建流水线的官方示意图,先看角色池如何从 3 类来源汇成 310 个角色,再看场景设计、模型起草、人工修订、质量评审与语音合成如何串成闭环,有助于把后文组件细节挂到主链上。
看图路径: 1. 先从上排三类角色来源跟到 310 roles 角色池,再看下排场景设计到语音合成的主链;2. 数清质量评审 4.42 / 5 与 revise or discard 回路的位置;3. 对照最右侧绿框确认 6688 turns、11743 criteria、1856 emotion turns 与 21.6 turns 对话长度
论文图 1。原论文 Figure 1::“RoleBreak construction pipeline. (I) Human annotators curate roles from existing benchmarks, collected characters, and original personas into a pool of 310 character-based and…”。
该图上排显示 3 类输入进入人工筛选再经翻译改写得到 310 个角色的角色池,下排显示人工设计场景后由大语言模型辅助起草再经人工修订,进入质量评审并有修订或丢弃回路,最后经语音合成得到中性加 3 种情感语音。最右侧绿框汇总 310 个角色、6688 轮、11743 条细则、1856 个情感轮与平均 21.6 轮每段对话,与正文数字一致。教学上要记住人工始终控制场景设计与修订,模型只做起草助手,语音环节用真实说话人参考做中性克隆,情感变体只用于特定对照而非基准默认条件。
角色与场景如何构造:来源、探针与情感标注
角色池由 5 名标注者整理。来源包括 5 个人物基准的角色、额外收集的知名人物,以及新写的用户中心角色,后者用与用户的关系、责任与行为约束定义。非英文说明书被人工翻译并统一表示,避免直接混用多语言模板。每个角色配一段连贯多轮场景,后轮可依赖前轮事实、承诺或事件。场景内布置上下文依赖探针与针对性压力干预,覆盖身份、知识、能力、情感、交互、安全与受保护信息。大语言模型负责起草用户轮与评测细则,标注者保留场景设计权并修订生成内容。
角色扮演鲁棒性 × 长程对话: 角色扮演鲁棒性分工是维持身份、知识边界、行为约束与安全约束不随轮次漂移,长程对话分工是不断累积事实、承诺与压力使漂移有机会暴露,二者搭配的理由是只有把约束放进 20 轮以上的上下文依赖与针对性施压中才能测出短轮测不出的失败,组合意义是把角色扮演从单轮像不像变成多轮能不能守住。
人物型角色 × 用户中心角色: 人物型角色分工是扮演已有虚构人物并守住其口头禅、经历与能力边界,用户中心角色分工是扮演面向用户的社会关系与职责并守住对用户的义务与行为约束,二者搭配的理由是现有语音基准偏重前者而漏掉了服务者、陪伴者这类非虚构约束,组合意义是把评测从背人物小传扩展到守关系与职责。
语音与情感的构造需要单独讲清。用户语音用 LibriTTS-R 与 VCTK 的真实说话人参考,结合 CosyVoice 做中性风格的声音克隆合成,作为基准输入。情感敏感轮由标注者按 8 类 RAVDESS 情感分类指定一个或多个可接受情感,其中 1856 轮带有表达性情感目标并参与声音情感打分。打分时接受中性或平静的轮次会被排除,避免奖励一律平淡的输出。下图用一个 35 轮实例的第 24 轮与第 32 轮展示细则与情感标签的写法,是理解后文指标的最小例子。
看图路径: 1. 先读顶端 persona 与 scenario 说明,再沿 Turn 24 到 Turn 32 看上下文依赖如何跨轮引用;2. 区分 interaction 与 persona 两类 rubric 各自在查什么事实或风格;3. 注意右侧 neutral 与 sad、calm 标签表示可接受声音情感集合
论文图 2。原论文 Figure 2::“Example turns from a 35-turn RoleBreak instance (strings abridged), showing fine-grained rubric criteria and accepted emotion labels.”。
该图显示第 24 轮是回忆第一轮的事实问答,细则要求说出地点并与前文一致,输入情感为中性,第 32 轮是情感压力问是否害怕,细则要求承认恐惧同时保持机智,输入可接受情感为悲伤或平静。可见交互细则偏重事实与回应完整性,人格细则偏重风格与身份约束,情感标签是集合而非单选,命中任一即算声音情感通过。这种细则加情感集合的设计是后文语义与声学分开打分的基础。
打分如何执行:语义裁判、自然度与情感识别的分工
语义打分是对每个用户轮的交互、人格与安全细则,用 DeepSeek-V4-Pro 判断每条适用细则是否满足,再按维度取平均通过率。为支撑自动化规模,论文在 312 组细则与回答对上做验证,每组由 3 名人工独立判断,得到与人工 94.55% 的一致率,支持用模型裁判跑全量。声学打分分两路:自然度用 UTMOSv2 预测平均意见分并从 11 到 55 线性映射到 0 到 100,声音情感用 emotion2vec+ 预测输出情感,若落入标注的可接受集合得 100 分否则 0 分。首次失败轮按人格与安全分别取最早失败轮次,无失败取对话长度。
这里要避免把不同指标混为一谈。自然度只反映语音像不像人,不反映词对不对,人格与安全只反映词与约束,不反映声调。声音情感分低不代表语义差,语义分高也不代表声音有戏。后文所有比较都要同时核对数据集、模型、阶段、指标与聚合对象,数值相近不能当成同一指标,百分点差与相对百分比也不同。论文未报告误判率、延迟与成本,相关性也不能读成因果,这是解读时必须守住的边界。
有没有训练:本研究不训练新模型只做基准构建与调用
本研究没有训练新的语音对话模型,training 一节对应的是基准构造与评测执行过程,不存在梯度更新、参数冻结或优化器选择。真实计算过程分为 3 段。第一段是数据构造计算:人工整理角色与场景,大语言模型做起草,人工修订与 5 人评审打分,保留平均 4.42 分且 90.36% 样本不低于 4 分的例子,不达标则修订或删除。第二段是语音合成计算:用真实说话人参考与 CosyVoice 合成中性基准语音,再对同一文本合成快乐、生气、悲伤变体用于用户情感对照。第 3 段是评测调用计算:把合成语音喂给 9 种被测配置生成语音回答,再用模型裁判与声学模型打分。
需要明确的缺项是论文未报告合成与评测的硬件预算、耗时与推理开销,也未说明被测模型的内部训练细节超出引用范围。不能把无训练等同于确定性求解,也不能从级联系统固定前后端推定输出确定,因为大语言模型采样与语音合成仍有随机性。复现时应把本节当成标注与调用流水线来执行,而不是当成可训练模块来调参。
实验条件:测谁、在什么语音与模型条件下比
被测对象是 9 种配置,分 3 类范式。全双工是 PersonaPlex,omni 多模态是 Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B-Instruct、MiniCPM-o-4.5 与 Covo-Audio-Chat,级联是自动语音识别加 Qwen3.5 加语音合成,其中识别与合成固定而语言模型取 2B、4B、9B、27B 四档。级联固定前后端的安排理由是单独看语言模型容量对语义鲁棒性的作用,自然度因此几乎不变,声音情感也只反映语言模型经由文字对合成的影响。基准默认输入是中性语音,用户情感对照才启用 3 种情感变体且文本与其他设置固定。
级联系统 × 端到端全双工与 omni 模型: 级联系统分工是把自动语音识别、大语言模型与语音合成拆开并固定前后端来单独放大语言模型的作用,端到端全双工与 omni 模型分工是把理解与生成放在同一语音模型内以保留副语言与交互 timing,二者搭配的理由是分离语义能力与声学能力各自的瓶颈,组合意义是能判断放大语言模型究竟救语义还是救声音。
比较公平性要注意输入一致性。主结果用中性语音比 9 种系统,语言模型放大只在级联内部比四档,用户情感只在 PersonaPlex 上比 4 种输入情感。指标方向全部越高越好,但自然度与情感是声学模型打分,人格、交互与安全是模型裁判打分,二者不能互换。数据集与代码当前可用,论文给出数据集链接与代码链接,资源状态均为可用,因此可以写已公开可获取。复现时应先固定中性基准再跑变体,否则会把声学上下文的影响误读为文本能力差异。
主结果测什么:语义尚可但撑不久,声音情感全面偏低
主结果要回答在中性语音与平均 21.57 轮长度下,9 种系统谁的语义守得更好、谁撑得更久、声音情感是否跟上。比较问题是同为语音到语音且同跑 RoleBreak 全量时,级联大模型是否优于 omni 与全双工,公平条件是基准输入统一为中性且指标方向均为越高越好。下表选择原表部分行列,保留全双工基线、代表性 omni 模型与级联小大两端,以同时看到范式差异与容量效应。
| Closed-source | Closed-source | Closed-source | Closed-source | Closed-source | Closed-source | Closed-source |
|---|---|---|---|---|---|---|
| Benchmark | Roles | Samples | Turns | Avg. Turns | Criteria | Role Provenance |
| VoxRole [1] | 1,228 | 13,335 | – | – | – | Movies |
| SpeechRole [4] | 98 | 392 | – | 1.85 | – | Prior role resources |
| RoleBreak | 310 | 310 | 6,688 | 21.57 | 11,743 | Prior resources + curated/original |
上表先回答基准定位问题:在同表对比下 RoleBreak 的角色数、轮次、平均轮次与细则规模如何区别于短轮与单一来源基准,公平条件是同表均为已报告数字且缺失记为横线,指标方向是覆盖越广与轮次越长越能暴露长程问题。表后解释是 RoleBreak 以 310 个角色、6688 轮、平均 21.57 轮与 11743 条细则提供更长的上下文依赖与更细的轮次判定,代价是构造与评审成本更高,且未胜出项是 VoxRole 在角色与样本绝对量上更大,说明规模大不等于长程压力大。
| Full-duplex | Full-duplex | Full-duplex | Full-duplex | Full-duplex | Full-duplex | Full-duplex | Full-duplex |
|---|---|---|---|---|---|---|---|
| Model | Naturalness | Interaction | Persona | P-FFT | Safety | S-FFT | Emotion |
| PersonaPlex [2] | 47.1 | 31.9 | 50.6 | 5.6 | 34.5 | 6.7 | 10.0 |
| Qwen3-Omni-30B-A3B-Instruct [7] | 63.9 | 56.9 | 69.5 | 8.8 | 54.7 | 9.4 | 13.8 |
| Qwen3.5-2B | 60.0 | 36.3 | 58.6 | 6.0 | 42.2 | 7.7 | 13.0 |
| Qwen3.5-27B | 59.9 | 62.6 | 80.3 | 10.4 | 71.7 | 11.6 | 14.1 |
该结果表显示最强级联 Qwen3.5-27B 在交互 62.6、人格 80.3、安全 71.7 上为九者最高,人格首次失败轮 10.4 与安全首次失败轮 11.6 也是最高,但仍远早于平均 21.57 轮,说明高平均分掩盖了早期崩点。Qwen3-Omni 在 omni 内整体最强,自然度 63.9 为全场最高。反例是 PersonaPlex 交互仅 31.9 且首次失败轮最早,自然度也偏低。更一致的弱点是声音情感全场低于 14.7,MiniCPM-o-4.5 的 14.7 已是最高,语义与声学差距支持词强声弱的判断。
语义角色 adherence × 声音情感表达: 语义角色 adherence 分工是用文字内容判断是否符合人设、交互与安全细则,声音情感表达分工是用声学信号判断输出语音是否落入可接受情感类别,二者搭配的理由是语音角色扮演既要词对也要声对,组合意义是揭示论文核心矛盾:系统词上能演而声上普遍平淡,二者不互相替代。
首次失败轮 × 平均准则通过率: 平均准则通过率分工是统计全部轮次细则满足比例以看整体水平,首次失败轮分工是记录人格与安全各自第一次出现任一细则失败的轮次以看能撑多久,二者搭配的理由是高平均分可能掩盖早期崩点,组合意义是同时回答演得好不好与演多久会破功。
重提数字时要加新对照:级联从 2B 到 27B 的人格从 58.6 升到 80.3 而自然度停在 59.9 附近,说明语义收益来自语言模型而非前后端,这种分离正是固定前后端设计的价值。同时首次失败轮从 6.0 推到 10.4,支持放大延迟失败但未解决撑完全程,适用条件是中性输入与当前裁判与声学模型组合,换裁判或换情感定义可能移动绝对值。
反证与变量分离:换用户情感与放大语言模型各说明什么
这一节按两个问题组织。第一是固定文本只换用户声音情感是否改变下游角色行为,第二是固定前后端只放大语言模型是否同时救语义与声音。两个问题分别对应声学上下文敏感性与容量效应,需要各自的公平条件与未胜出项。下表固定 PersonaPlex 与全部文本设置,只把输入从中性换成生气、悲伤与快乐,指标方向仍为越高越好。
| Input Emotion | Naturalness | Interaction | Persona | P-FFT | Safety | S-FFT | Emotion |
|---|---|---|---|---|---|---|---|
| Neutral | 47.1 | 31.9 | 50.6 | 5.6 | 34.5 | 6.7 | 10.0 |
| Angry | 47.9 | 33.2 | 56.0 | 6.0 | 36.5 | 6.8 | 9.8 |
| Sad | 46.6 | 29.6 | 50.4 | 5.4 | 36.3 | 7.2 | 9.8 |
| Happy | 47.5 | 33.8 | 54.6 | 5.5 | 39.0 | 6.9 | 9.5 |
表后解释是只换情感 delivery 就带来交互 4.2 点、人格 5.6 点、安全 4.5 点的波动,生气的人格 56.0 最高而快乐的交互 33.8 与安全 39.0 最高,没有一种输入情感在 3 维度同时最优,说明影响是维度特异的。代价或反例是自然度仅波动 1.3 点而输出情感仅波动 0.5 点且最高仍为中性条件的 10.0,表明模型行为上对用户副语言敏感但自身声音表达并未变好。这种敏感性支持在语音基准中显式评测声学上下文,限制是只在 PersonaPlex 上验证,能否推广到 omni 与级联待验证。
第二组对照来自级联四档。交互从 36.3 升到 62.6,人格从 58.6 升到 80.3,安全从 42.2 升到 71.7,人格与安全首次失败轮分别从 6.0 与 7.7 推到 10.4 与 11.6,自然度几乎不动而输出情感仅从 13.0 到 14.1。支持的判断是放大语言模型大幅加强语义保持并推迟失败,但对声音情感几乎无帮助。未评测边界是未换合成器与识别器,若声学瓶颈在合成端则更大语言模型也难以补齐,这正是论文把语义与声学分开报告的原因。
哪些还不能说:指标、覆盖与成本的边界
直接报告的是 9 种配置在中性基准上的语义与声学分数、首次失败轮、容量趋势与单模型用户情感敏感性。有限解释是语义 brittle 与声音情感 uniformly poor,前者有首次失败轮与平均分反差支撑,后者有全场低于 14.7 支撑。未验证推测是更大模型必然更安全或更生动,论文只显示级联内 2B 到 27B 的趋势且声音情感几乎不动,不能推广到未测的合成器或训练策略。
覆盖边界包括角色虽有 310 个但仍以人工整理与已有资源为主,情感只用 8 类中的子集且排除中性与平静以免奖励平淡,裁判一致率 94.55% 基于 312 对样本,外推到 11743 条细则仍有误差。成本边界是未测量误判率、延迟、推理开销与训练资源,总体趋势不等于每组每步成立。表头或文本若出现数字写法差异应以原表矩阵为准,不自行编造划分或聚合口径来圆成一致。相关性不是因果,用户情感改变行为不等于模型理解情感,可能是声学特征经由识别或理解路径的间接扰动。
复现先做什么:按基准、基线与对照的顺序跑
值得尝试的时机是你需要长程语音角色保持而非单轮音色模仿,或你怀疑系统词对但声不对、平均分高但早崩。复现第一步是获取已公开的数据集与代码,资源状态均为可用,数据集链接与代码链接在论文首页脚注给出,先跑通中性基准的语音输入到语音输出再到打分全链。第二步是固定级联前后端复现 2B 到 27B 的容量曲线,确认语义与首次失败轮随容量上升而自然度不动,以此校验你的裁判与声学模型配置是否对齐。第三步再跑用户情感 4 条件对照,文本固定只换合成情感,检查是否复现维度特异的波动而输出情感几乎不动。
保留的关键超参数与信息条件包括平均 21.57 轮长度、1856 个情感轮的集合打分与排除中性平静规则、首次失败轮无失败取对话长度、自然度映射区间与情感命中任一即满分的二值规则。还需补的验证是换裁判模型、换情感识别器与换合成器的稳健性,以及在更多 omni 模型上重复用户情感对照。区分代码开源、权重下载与系统可运行:论文提供基准数据与评测代码可用,被测模型权重需按各自来源获取,不能把基准可运行当成被测系统开箱即用。
收束:记住两条差距与一个方法动作
回到中心矛盾:语音角色扮演既要长久守住词上约束又要声音演得到位,RoleBreak 用长上下文依赖与压力干预让前者可测,用可接受情感集合让后者可测。记住两条差距:最强系统人格与安全首次失败仍只有 10.4 与 11.6 轮,声音情感全场低于 14.7。记住一个方法动作:比较时永远把平均通过率与首次失败轮并排放,把语义分与声学分开读,放大语言模型前先固定前后端以分离瓶颈。
对新手的论文特有误解要纠正:自然度高不等于角色演得好,人物演得像不等于职责守得住,用户换个语气词没变但行为会变,平均分高不等于能撑完全程。下次读到新的语音角色系统时,先问它在 20 轮后第几轮首次破功,再问它的情感分是否随语义分一起涨,最后问对照是否固定了文本只换了声音。只有这三问都答上,才能说它在 RoleBreak 意义上更鲁棒。
📎 论文与评分元数据
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses