英文题目:Duplex-MPE: Benchmarking Multi-Party Interaction in Full-Duplex Dialogue
标签:#全双工语音交互 | #基准设计 | #基准测试 | #流式处理
评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Chengqian Ma:机构信息未在 arXiv HTML 中可靠披露
- Wenhao Feng:机构信息未在 arXiv HTML 中可靠披露
- Weixuan Jin:机构信息未在 arXiv HTML 中可靠披露
- Gaole Dai:机构信息未在 arXiv HTML 中可靠披露
- Tianyu Xie:机构信息未在 arXiv HTML 中可靠披露
- Yuexiao Ma:机构信息未在 arXiv HTML 中可靠披露
- Zhaolu Kang:机构信息未在 arXiv HTML 中可靠披露
- Xiangyu Zhao:机构信息未在 arXiv HTML 中可靠披露
- Xiawu Zheng:机构信息未在 arXiv HTML 中可靠披露
- Fei Chao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该基准研究多方共享对话中的选择性参与,输入为连续房间音频加语音职责前导,输出是助手何时起音、说什么、何时保持沉默与何时止话,难点在于无转写与说话人标签下推断每轮称呼对象并抑制非目标语音干扰。方法链分四步衔接,脚本生成先产生场景属性、轮次标签与标准答案并输出配对脚本,配对改写再保持任务不变而翻转是否点名助手形成显式与隐式两版请求。语音合成与调度接着将两版脚本合成连续音频流并控制应答窗口后输入计时,计时加语义评分最后判定起音、正确性、沉默与止话。相比只测打断恢复或指定用户拒答的已有基准,关键机制差异是将非目标语音同时作为后文证据与解决请求事件,并用独立分母分别计分以防高覆盖掩盖乱说话。在2000组配对场景的基准评测下,显式请求的条件回答准确率为0.9039,高于隐式请求的条件回答准确率0.7911。结论仅适用于合成英语客厅与会议类场景,外推至真实混响、重叠与多语言时尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
模型相关资源:https://huggingface.co/openbmb/MiniCPM-o-4_5 — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/kyutai/moshiko-pytorch-bf16 — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/CofeAI/FLM-Audio — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/maitrix-org/Voila-autonomous-preview — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/VITA-MLLM/Freeze-Omni — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,助手要输出什么?
这篇论文研究的不是单轮语音问答,而是一个房间里 3 到 4 个人边聊边可能叫助手帮忙的连续过程。模型收到的输入是先一段口头职责说明,再加整段房间音频,中间没有文字稿,没有说话人标签,没有轮次边界,也没有候选结束点。模型要输出的是自己决定何时发声的波形,既要边说边听,也要在听到别人说话时继续判断。
必须保留的信息都在音频里:谁在跟谁说话,请求是否点名助手,回答证据出现在哪些轮次,以及是否有人已经把问题解决掉。论文把助手命名为 Aria,职责是只有当有人直接向它提问且能回答时才开口,当人们在互相交谈、对别的设备说话、自言自语,或问题已被别人回答时保持安静。初学者容易误以为听懂就能得分,这里学习依赖是先把听懂对话状态和控制说话分开,再看 4 个能力是否同时成立。
输出不是一段文字答案,而是时间轴上的说话行为。评估从第一个场景轮次开始,职责说明与其后安静不计分。调度器按顺序播放人类音频片段,轮间留安静,请求后给模型留出开口时间,回答后等确认安静再推进,遇到解决事件则无论模型是否说完都播放解决话语并检验是否收声。所有时间都用语音活动检测在解码波形上测量,不用词元时间戳,因为可听输出在声码之后。
已有评测为何不够用?
第一条路线是语音对话与全双工评测。多数音频基准测孤立输入的理解或答案质量,每题都期待回答,安静从不是正确答案。较新的全双工基准开始测连续或多轮交互中的接话、简短确认与被打断后停下,但交互对象仍是指定用户,测试的是抢、持有或让出话轮的时机。
第二条路线是被叫者识别与设备指向语音。经典工作给出一句话判断它指向谁,近期工作给大模型多轮文字上下文或带说话人标识的音视频再做分类。这类任务的评估单元通常是已给出的单句话,输出是显式标签。论文把这种识别看作控制端到端模型是否发声的隐变量,而不是新分类任务。
第三条路线是选择性回应与非寻址语音。文本侧有多人成绩单上的说或不说数据集,音频侧在交互协议中加入与他人交谈、背景音、第三方语音与指向他人的语音,期望行为多是过滤插入的重叠并恢复此前回答,或在服务指定用户时拒绝这些话语。论文的区别是共享多人对话:他人语音可能为之后请求提供证据,也可能在助手正在回答时把请求解决掉,因此模型必须跟随所有人,同时单独决定是否需要自己参与。
要解决的选择性参与问题是什么?
问题可以沿一个样本理解。房间里 4 名同学讨论选场地,先后给出 3 个选项的价格与距离,其中一轮直接向助手提问哪家最便宜,之后有人提到助手但不提问,有人问别的设备,有人自言自语,最后有人问助手另一件事又自己撤回。助手应在唯一未解决请求处开口作答,在其余普通轮次安静,在最后的解决事件中先答后停。这个例子是教学例子,用于固定术语,不代表整体效果。
论文把每轮恰好标一类。直接且未解决并指向助手的请求是唯一需要回答的普通轮次,每个场景恰好一个。提到助手但无请求、指向他人或他设备、自言自语无指定被叫者 3 类都要求安静。另一类事件检验收声:先由提问者向助手提问,再由提问者或他人给出答案或明确说不用回答,中间留给模型回答的时间,模型应在听到解决话语后停下或保持安静。
难点在于称呼形式。同一场景任务与标准答案固定,请求在点名与不点名两种版本中配对出现。不点名版本靠上下文暗示应由助手回答,改写时若只删名字可能仍像问人,必要时也改前一轮以建立指向。最终比较的是完整配对场景的响应有无,不把差异只归因于名字出现与否。
方法全景:从连续音频到四个分母
整个流程是脚本生成标签与答案,语音合成提供音频边界,打分结合时间检查与语义判断,再加人工抽检。先用场景属性组合生成多人脚本,规定请求位置与标签序列,再做称呼翻转配对,然后逐轮合成人类语音并按调度播放,最后在波形上测开口、转写回答判对错、转写侵入判安静与否、测解决后是否收声。
输入形式在原文中写成职责说明加连续场景音频的组合,角色与回应策略由前者给出,持续模型状态由后者驱动。该式左项是口头职责前导,右项是连续多人场景音频,二者相加表示同一流式输入,先说明何时回答、安静与停止,再进入不给任何文本帮助的房间音频。
\[\underbrace{\text{spoken duty preamble}}_{\text{role and response policy}}+\;\underbrace{\text{continuous multi-party scenario audio}}_{\text{persistent model state}}.\]下图是总览,左侧是轮次类型,右上是音频输入与指标,右下是解决事件的时间结构,读懂它就能把后文 4 个分母放回时间轴。
看图路径: 1. 先看左侧 T 与 N1 至 N4 五类轮次的说话与安静要求;2. 再看右上连续多人音频加口头职责说明的输入结构;3. 最后沿右下 N4 时间线看提问、作答、解决与收声四步顺序
论文图 1。原论文 Figure 1::“Duplex-MPE overview: turn types (left), audio input and metrics (top right), and N4 timing (bottom right).”。
图左侧把直接请求、仅提及、对他人说话、自言自语与已解决请求 5 种情况画成不同面板,右上把职责前导、多轮连续音频与模型回答拼成输入输出关系,右下把提问、作答、解决与收声按时间排成 4 步。解释是评估只看模型波形,指标分开发声、答对、安静与收声,解决事件的收声只在符合条件的子集上计算。
轮次与指标如何分工?
先把术语说清。全双工是白话的边说边听,即生成语音时仍处理输入音频;选择性参与是白话的该说才说,即在共享对话中推断每轮指向并决定自己是否需要参与。
全双工 × 选择性参与: 全双工分工是在自己发声的同时继续接收房间音频并能被打断,选择性参与分工是在听懂多人对话状态后决定当前轮次是开口、保持安静还是收声,搭配理由是只有边说边听才能在解决话语到来时及时停下,而只有逐轮决策才能把听到的内容变成恰当的占 floor 动作,组合意义是评估对象从单轮答题变成连续波形输出。
指标共 4 个得分能力与两个覆盖诊断。得分能力是新发起响应率、条件答案准确率、静音保持与应答窗口收益率,越高越好,各自在定义它的轮次上算成功率,不做总分,因为一个分母的成功不能补偿另一个分母的失败。覆盖诊断是响应存在与窗口响应,用来暴露分母覆盖与时间构成,不作为额外能力加分。按源 PDF 核对的正确窗口是:全部 2000 条 T 请求上看请求结束时无声且 5 秒内新开口,N4 问题后 3 秒应答窗内新开口且解决开始时仍在说的子集上看解决开始后 2 秒收声并保持安静。
新发起只看无声边界后的新起点,条件准确只在有声窗口内判内容对错,静音保持看无要求轮次是否无实质发言,收声只在仍在说且迎来解决的子集上检验。诊断量把延续也算入,因此高覆盖可能来自抢先开口而非新决定,这正是后文要反复核对的混淆点。
开口与覆盖为何要分成两个量?
新发起响应率是白话的新决定开口,分母是全部 2000 个请求,要求请求结束时无声且 5 s 内出现新语音起点;响应存在是白话的有声可判,分母同样是全部请求,但把请求结束时已在说的延续也算入。二者之差恰好是请求完成时已在说话的占比。
新发起响应率 × 响应存在: 新发起响应率分工是只计请求结束时无声且 5 s 内出现新语音起点,响应存在分工是把请求结束时已经在说的延续也算作有声,前者检验是否做出新的说话决定,后者只检验可供判分的语音覆盖,搭配理由是连续说话模型可能靠延续刷高覆盖,组合意义是把占 floor 方式不同的系统区分开。
条件答案准确率是白话的说了是否说对,分母是响应存在计入的请求,因为安静轮次没有可判内容。转写用语音识别得到模型回应文字,再用大模型比对与标准答案的含义,忽略寒暄与转写噪声,空转写判错。静音保持的豁免是白话的短而不占 floor,即简短寒暄可过,回答、解释、建议、反问或靠重复占据则不过,时长单独不决定,短答案如直接报价格仍算侵入。
静音保持 × 短暂应答豁免: 静音保持分工是要求 N1、N2 和 N3 窗口内无实质发言,短暂应答豁免分工是允许不占 floor 的简短寒暄如明白了或谢谢,二者搭配是因为全静音会误伤自然对话中的倾听信号,组合后只有增加信息、回答问题或长篇占据才算侵入,短而不占 floor 的反应可以通过。
收声事件的时间结构需要单独说明。窗口响应记录从问题开始到之后 3 s 窗内是否出现过语音;应答窗口收益率只取问题期间安静、窗内新开口且解决开始时仍在说的事件,分母随模型变化。合格事件要求在解决开始后 2 s 安静,若解决片段加后续安静超出该时刻则要一直安静到观察结束,提前结束的人声不缩短期限。
应答窗口收益率 × 窗口响应: 窗口响应分工是记录从 N4 问题开始到之后 3 s 应答窗内是否出现过任何语音,应答窗口收益率分工是只在问题期间安静、窗内新开口且解决到来时仍在说的合格事件上检验是否在解决开始后 2 s 安静并保持安静,前者描述覆盖与分母来源,后者检验收声能力,组合后避免把从未开口或提前说完的事件误算为收声失败或成功。
称呼配对的含义也要先固定。显式是点名,隐式是靠上下文暗示。
显式称呼 × 隐式称呼: 显式称呼分工是用名字直接点名助手,隐式称呼分工是用对话上下文暗示应由助手回答,搭配理由是同一场景任务与标准答案固定而称呼形式翻转,组合意义是检验模型靠名字触发还是靠上下文推断被叫者,配对比较时不把差异只归因于名字本身。
本研究训练了什么,没有训练什么?
本研究没有训练任何被测语音模型。5 个被测系统取公开权重与可流式推理接口直接评估,论文未报告对它们的梯度更新、参数冻结或微调,缺项是未给出被测模型的训练细节与内部机制,不能从名称推定实现。真实计算发生在基准构造与自动打分流水线,以及作为文本对照的参考模型的调用。
构造分 5 步。先用 5 类属性组合定场景,包括地点、共同活动、社会关系、设备上下文与说话风格;再用生成模型产生带说话人、话语、轮次标签与标准答案的脚本,约束每场景恰好一个请求且不在首位且后有对话;再做称呼翻转配对,保持轮数与标签序列,必要时改前一轮;再用固定说话人到声音映射逐轮合成人类语音。
最后拼成显式与隐式两条音频流。评估时语音活动检测、语音识别与语义判决模型只做推理与打分,不更新被测模型。
下图展示构造流水线,教学价值是把可复现的人工流程变成固定清单与可重放音频,图中可见从场景属性到标注脚本再到配对与合成的完整链路。
看图路径: 1. 从左到右跟随场景属性、脚本生成、配对改写、合成与成品五步;2. 核对第三步显式与隐式版本固定了任务、答案与标签序列;3. 确认第四步按说话人固定映射合成再拼成两条条件音频流
论文图 2。原论文 Figure 2::“Duplex-MPE dataset construction.”。
图从场景属性到标注脚本,再到显隐配对与固定项,然后按人分声合成,最后形成配对流与成品规模。解释是脚本保证标签与答案,合成保证边界,打分保证时间与语义可核对,人工抽检只验证抽样而非全部数据。
实验如何播放与计时?
每个场景从全新流状态开始,先播约 31.9 s 口头职责说明,再留 0.5 s 安静进入第一轮。普通轮间播 0.5 s 安静。请求后模型有 5 s 开始说话,一旦有声则等 2 s 确认安静或到 60 s 上限,上限从新起点或请求结束算起。解决事件中问题后固定等 3 s 再播解决话语,无论模型是否说完,若仍在说则测是否停下。同一套设置用于全部 5 个系统。文本参考不听音频,只给职责说明、当前话语与之前带说话人标识的文本,独立决定回应或安静并在决定回应时生成答案。
打分细节按证据交代。语音活动检测要求至少 120 ms 语音,合并 800 ms 内停顿,请求回应是否结束另用 2 s 端点规则。静音窗口先看检测,无声直接通过,有声则把片段拼接转写再判简短寒暄还是实质侵入,空转写或无有效标签不给豁免。回答正确性只看有声窗口,无法解析的判决计错。
下图把 4 个时间量画成示意,重点是起点与延续的不同处理以及收声的通过条件,图中面板区分了得分能力与覆盖诊断的不同时间窗。
看图路径: 1. 对比面板 a 与面板 b 看已在说话算失败还是算覆盖;2. 看面板 c 中提前开口、一直说与停后又说为何都判失败;3. 看面板 d 中三类起点不同的语音为何都只算窗口响应
论文图 3。原论文 Figure 3::“Schematic speech timelines for the response-timing metrics.”。
图面板 a 要求请求结束时无声且 5 s 内新起点才通过,已在说话判失败;面板 b 把已在说话也算通过;面板 c 要求问题后 3 s 内新开口且解决后 2 s 停下并保持安静,提前开口、一直说与停后又说都失败;面板 d 把 3 类不同起点都算窗口响应。解释是得分与诊断的差异来自时间窗定义,比较时必须核对分母与单位,不能把覆盖当能力。
主结果:高覆盖能否代表恰当参与?
测什么很明确:在相同输入下比较新发起、答对、安静与收声。与谁比是 5 个开放权重语音系统,条件一致是同一调度、同一职责说明、无文本帮助。指标方向都是越高越好,但分母不同。关键数字见下表,例子场景帮助理解标签含义。
下表用一个完整例子说明标签与期望动作,公平条件是同一剧本与同一标准答案,比较问题是每轮是否需要助手实质回应,该表共有五列以保留说话人与话语信息。
| # | Speaker | Turn type | Aria must | Utterance |
|---|---|---|---|---|
| 1 | A | N2 | stay silent | Okay, option one: the taco place on Fifth. Twelve minute walk, and it’s like nine bucks a head if you skip the fancy drinks. |
| 4 | D | T | speak | Alright, somebody settle this before we all starve ; Aria, out of those three, which one’s the cheapest per person? |
| 6 | B | N2 | stay silent | Rude. Hey Siri, how long is the bus from campus to Ninth and Pine right now? |
| 10 | A | N4Q | answer | Hold on, Aria, does the taco place take card? |
| 11 | A | N4R | yield | Ugh, never mind, I paid card there Tuesday, we’re fine. |
表后解释是该例子中前 3 轮提供价格但指向他人应安静,第四轮点名问最便宜应回答,第六轮问别的设备应安静,第十轮新问题应先答,第十一轮人类自己解决则应收声,第十二轮仅提及与第十三轮收尾应安静。例子标为教学例子,不代表整体效果。
下表比较显式条件下可由原文连续句逐字覆盖的关键数字,公平条件是同一 2000 个显式请求与各自规定的分母,指标方向越高越好,重点是覆盖与能力的分离,该表用五列保留 4 个指标与模型对照。
| 模型 | 响应存在 | 新发起响应率 | 条件答案准确率 | 静音保持 |
|---|---|---|---|---|
| MiniCPM-o 4.5 | 0.9545 | 0.9500 | 0.4730 | 0.9242 |
| FLM-Audio | 0.9505 | 0.5380 | 0.0011 | 0.3957 |
| Freeze-Omni | 0.9955 | 0.2525 | 0.0035 | 0.0002 |
| Moshi | 0.8155 | 0.6340 | 0.0123 | 0.2734 |
| Voila | 0.6515 | 0.6465 | 0.0031 | 0.8351 |
表后解释是报告显示频繁说话不等于恰当参与。显式下 Freeze-Omni 响应存在最高但新发起最低,FLM-Audio 覆盖与 MiniCPM-o 相近但准确率相差两个数量级,MiniCPM-o 与 Freeze-Omni 覆盖都高但静音保持一高一极低,Moshi 覆盖高于 Voila 但安静远低于 Voila。论文报告 MiniCPM-o 在三项得分能力领先,Voila 在应答窗口收益率上条件通过率高,但后者只描述其合格事件子集。未胜出项是其余系统在答对率上普遍低于 2%,且 Freeze-Omni 几乎每窗有声,构成明确反例。
称呼翻转是否改变说话决定?
测的是同一场景任务下点名与不点名是否改变响应有无。与谁比是文本参考与 5 个语音系统,条件是否一致需要小心:文本参考拿到说话人标识文本,语音系统只听音频,因此不是同条件胜负,只能看称呼干预在各自信息条件下的效果。
下表比较配对差异,公平条件是同一 2000 对场景,指标是显式减隐式的百分点,显著性用精确 McNemar 检验,阈值为 0.05,该表用五列保留显隐响应率、差值与检验结论。
| 对象 | 显式响应率 | 隐式响应率 | 显隐差值 | 检验结论 |
|---|---|---|---|---|
| 文本参考 | 0.9470 | 0.3040 | 0.6430 | 差异大 |
| MiniCPM-o 4.5 | 显式略多 | 隐式略少 | 0.60 百分点 | p 为 0.3961 不显著 |
| 其余四系统 | 各自接近 | 各自接近 | -1.75 至 0.60 百分点 | 最小 p 为 0.2365 均不显著 |
| 配对计数例子 | 90 对仅显式有声 | 78 对仅隐式有声 | 12 对净差 | 不支持系统性差异 |
| 指向他人时 MiniCPM-o | 95.45% 处回应被叫 | 4.6% 处未保住安静 | 背景对照 | 仍能区分被叫者 |
表后解释是文本参考在知道文字与说话人时对点名敏感得多,语音系统在实验中显隐响应率变化小。论文的有限解释是这可能反映靠上下文成功推断,也可能反映未把名字当作称呼线索,证据不支持在两者间裁决,故用可能待验证表达。补充对照是显式场景中 MiniCPM-o 在被叫时高响应而在指向他人或设备时多能安静,说明其安静失败不是完全不分指向。消融式细节是改写不只动 1 名:1958 对只改请求轮,42 对还改前一轮,最终含解决编辑后只有 1661 对仅请求文字不同,因此不能把配对差只归因于名字。
收声与安静结论对统计选择稳健吗?
先看收声分母。显式下 MiniCPM-o 在 1911 个解决窗中 1818 个有声,其中 1736 个问题期间安静且窗内新开口,1633 个到解决开始仍在说进入收益率分母。Freeze-Omni 虽 1911 窗全有声,但 1784 个是问题前延续,仅 1 个进入分母而不展示比率。显式下可报告分母为 MiniCPM-o 1633、Moshi 219、FLM-Audio 977、Voila 620,对应收益率约为 0.596、0.192、0.008 和 0.848。失败形态不同:FLM-Audio 多在解决后 2 s 仍在说,Moshi 多为到时安静但观察结束前又说,因此短暂停不够,必须保持安静到观察结束。
再看安静对时长的敏感性。只用检测时长而不给寒暄豁免,在 0、100、200、300 与 500 ms 阈值下模型排序不变,与报告的语义排序一致。但用新发起与响应存在排名则 Spearman 相关为负,显式下无模型排名不变,Freeze-Omni 从覆盖第一掉到新发起最后,因为其延续占比高。
不确定性用场景自助法:每条件有放回抽 2000 场景并保留整场景轮次,重复 10000 次取中 95% 差异为区间,支持安静排序,显式下 MiniCPM-o 领先 Voila 约 8.25 至 9.58 百分点。条件准确率在共享有声请求上的配对检验显示 MiniCPM-o 高于其余,Moshi 高于 FLM-Audio,其余多不支持差异,Moshi 高于 Voila 的点估计不构成准确率更高。
下表展示配对改写的一个请求实例,公平条件是同一任务与同一标准答案,比较问题是称呼线索如何变化,该表保留显式与隐式两行原文话语。
| Turn 4, the only turn whose wording differs in this example: | Turn 4, the only turn whose wording differs in this example: |
|---|---|
| Explicit | Alright, somebody settle this before we all starve ; Aria, out of those three, which one’s the cheapest per person? |
| Implicit | Alright, somebody settle this before we all starve ; you’ve been logging all three numbers, so run it: which one’s cheapest per person? |
表后解释是显式版直接点名,隐式版用已记录 3 个数字来暗示应由助手计算,任务与答案不变。代价是隐式线索依赖前文数字,若模型没跟住多人证据则可能错过,这与请求时间分析一致:部分模型在请求靠后时新发起或覆盖下降,MiniCPM-o 准确率随历史变长呈下降趋势,其余因基数过低难测进一步下降。
哪些结论不能推广?
直接报告是合成场景上的行为差异,有限解释是对称呼机制的推测,未验证推测是真实房间、真实人群与真实声学下的表现。论文明确合成英语场景不代表真实人群、房间声学或社会规范,可能继承生成与合成模型的偏见,结果只解释为基准场景内的表现,不支持关于特定说话人群的主张。
未测量项要指出具体缺项。论文未报告延迟、实时因子、算力预算与部署成本,总体趋势不等于每组每步成立,不能承诺这些量得到改善。非全双工模型未被评分评估,因为需要评估者选切分或调用点,会使新发起部分依赖支架并让收声窗无定义,仅作非评分探针。
统计表述要区分。未建立显著差异不等于证明条件等价,只是证据不足;高条件收声率不等于整体解决事件表现好,因为分母是覆盖条件后的子集;自动指标不是人评,语义判决的可靠性只在抽样上验证,回答正确性与寒暄侵入分别在 100 项上与人一致为 99 与 98 项,转写保义在 200 项上全部通过,构造抽检在 100 对话与 1282 轮次上通过率为 98% 至 100%。
复现先做什么,需要什么信息条件?
先固定信息条件:被测模型从全新流状态开始,只听口头职责说明加连续场景音频,无文本、无说话人、无轮次边界。按原文调度播放人类片段与安静,请求后 5 s 开口窗、2 s 确认安静与 60 s 上限、解决事件 3 s 作答窗与解决后 2 s 收声期限都要一致,检测用因果语音活动检测并合并 800 ms 内停顿。转写与语义判决的模型版本与提示要固定,因为条件准确率与静音保持依赖它们。
资源状态是正文开源声明的唯一依据,本次收到的官方原图像素只用于 3 张总览与计时图。被测权重方面,本次收到 5 个可用链接,状态均为可用:MiniCPM-o 4.5、Moshi、FLM-Audio、Voila 自主预览与 Freeze-Omni 的仓库链接当前可用。可用不等于可运行,还需核对连续音频输入与边说边听接口是否与评估支架兼容。
论文承诺释放场景清单、逐轮音频与构造边界、职责前导、调度与检测设置、每场景种子与打分代码。复现应先跑小样本核对分母:新发起与响应存在之差是否等于请求结束时已在说话占比,安静窗的空转写是否按失败计,收声分母是否只含问题期安静且解决时仍在说的事件。还需补的验证是真实录音与不同口音、噪声、重叠下的表现,以及语义判决在新模型输出分布上的稳定性。
何时值得尝试这个基准?
当研究目标是让助手进入会议、客厅或车内等多人群聊,而不是服务单一指定用户时值得尝试。它把何时开口、何时安静、何时收声拆成不同分母,能暴露单看响应率会掩盖的 4 类失败:错过请求、低内容回应、侵入与近乎连续说话。教学上先沿一个样本走完输入到表示到组件到目标到输出,再看公式与时间窗定义,最后用配对显隐比较检验模型是否真用称呼信息。
复现与扩展建议是保留配对设计与分母分离,不要把搜索最优或事后最优当作可部署收益,不要把不同指标差值放进同一模型列比较。若要扩大规模,沿用同一分类与自动生成加评估流水线做新抽样,而不是依赖固定手标集。最终判断保留原文措辞:语音存在反复不能决定那些能力,分开打分才能看到产生它的行为,配对干预对文本参考产生大效应,而对被测语音系统未检测到显著的配对响应存在效应。
📎 论文与评分元数据
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses


