英文题目:TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs
标签:#音频问答 | #强化学习 | #数据集 | #基准测试
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Kaidi Yang:机构信息未在 arXiv HTML 中可靠披露
- Hualei Wang:机构信息未在 arXiv HTML 中可靠披露
- Zhaohui Wang:机构信息未在 arXiv HTML 中可靠披露
- Chenxuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Hong Liu:机构信息未在 arXiv HTML 中可靠披露
- Xiangdong Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多轮多音频时间问答的输入是按序可见录音、模型生成的对话历史与当前问题,输出是事件时刻、时长、计数与跨录音比较的答案,难点在于目标录音范围随追问与增量上传切换,且漏检一个实例就会算错总量。所提框架TEMA每轮依次生成路由、跨度、推理与答案四段,其中路由负责从问题与历史推断需检查的录音集合并标记无事件录音的缺席状态。跨度承接路由确定的录音范围,为每段录音输出全量条件音频描述即全部相关实例的起止区间,再由推理承接该事件表做实例选择与时长累加、排序比较等时间运算后生成答案。与直接生成时间引用或只奖励单区间对齐的前人方法不同,该工作以完备性优先的Span-only奖励直接对照事件表校验范围、数量与边界,使证据可验证。基于Qwen2.5-Omni的模型在TEMA-Bench自然多轮评测中问答准确率达到69.81%,显著高于原始基线与专有大模型对照。其适用边界是依赖强事件标注的合成对话场景,对真实长录音噪声、口语化追问与跨轮证据一致性的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
代码相关资源:https://github.com/KadeeYoung/TEMA — 链接不可用(HTTP 404)
模型相关资源:https://github.com/KadeeYoung/TEMA — 链接不可用(HTTP 404)
数据相关资源:https://github.com/KadeeYoung/TEMA — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留哪些信息?
本文解读的对象是标题为 TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs 的研究,编号 2609.30029。目标读者是刚进入语音、音乐和音频方向的研究生,重点是能复述方法、能核对实验条件,而不是记住结论口号。
必须保留的信息包括任务定义、证据格式、数据规模与来源、3 个训练阶段的输入与监督信号、评测协议与指标含义,以及主结果中可运行模型的数字。输出是 1 篇按学习依赖展开的中文技术解读,所有事实只来自本次收到的论文原文证据与官方原图像素,不引入外部评价。
从输入看,每一轮模型可见的是已上传录音、对话历史和当前用户问题。录音可以 1 次给全,也可以在后续轮次增量上传,只有已上传音频在当前轮可访问。
目标是回答涉及事件时刻、时长、次数、顺序和跨录音时间关系的问题。难点在于目标事件会随追问变化,录音会切换,历史会引用更早讨论过的实例。模型既要跨时间轴找回全部实例边界,又要做计算和比较。
为支撑学习,本文先讲任务与已有路线的区别,再给方法全景,然后拆开证据组件与计算,接着讲数据构造与 3 阶段训练,再讲实验条件、结果与反证,最后讲复现要点。术语首次出现会先用白话解释,再给英文名,后文简称固定。
凡是论文未报告的实现细节,会明确指出缺项,不做推测。
已有路线解决了什么,还缺哪一块?
第一条路线是单录音时间定位。论文提到的方法包括用事件时间戳构造时间问答监督、用时间标记和时间感知编码支持密集描述与接地、再用可验证奖励加强时间对齐。
这类工作的训练和评测多围绕单个录音的单轮查询,强调带时间戳的描述和接地。它们解决了语义与时间位置对齐的基础问题,但默认录音不变、问题不延续。
第二条路线是对话与多音频理解。一方面有多轮对话数据支持追问和引用更早音频,由人工评估事实性与有用性。另一方面有单轮多录音的属性识别与比较,包括时长和节奏等时间属性。
但后者做法是在候选录音中做选择并算选择准确率,不要求输出每个事件的起止区间,也不要求显式时间计算。论文明确指出,选出滴答总时长更长的录音,并不能证明模型找回了每 1 次滴答及其边界并算出总时长。这正是缺口所在。
第 3 条路线是在推理中引入时间引用。例如在思维链中生成区间并重新引入对应音频片段复听,或把中间推理步骤与时间戳关联以整合长音频证据。这类方法组织了推理内容,但生成的时间引用本身不保证准确框住问题需要的事件。
多轮时间问题还需要能准确表达当前音频范围、事件实例和边界的证据。论文把目标定为跨轮次和跨录音的完整查询条件证据,同时检查音频范围、实例数、缺席状态和边界,这与只做时间对齐奖励的做法不同。
多轮多音频时间问答到底要模型做什么?
论文把音频问题组织为 5 个任务族共 18 种类型。白话说,第一族是定位与测量,包括事件定位、时长和事件间隔。第二族是识别与验证,包括时间窗识别、存在与缺席判断和错误前提纠正。
第三族是单音频内结构,包括计数和排序。第四族是跨音频检索与比较,包括检索、计数比较、最早出现、排除检索、存在与计数比较、时长比较和每音频计数。第五族是多轮时间引用,包括对最近提到或更早讨论过的事件实例问时长。
为保证监督一致,每轮模型按顺序生成 4 段。Route 直译是路线,这里指需要检查的录音范围,包括需要验证缺席的录音。Span 直译是跨度,这里指完整查询条件时间证据,可看作结构化条件音频描述。
Reason 是选择、计算与比较过程,Answer 是最终回答。问题和历史决定取什么,Span 记录每个匹配实例的起止区间,无匹配录音记 [NONE]。即使问题只要最早实例,Span 仍保留全部实例,以便支持不同运算。
下图展示了 5 轮对话如何随录音增加而推进,以及第 5 轮的可见录音状态与结构化证据如何对应,适合对照 4 段输出理解任务闭环。
看图路径: 1. 先从上到下看 Turn 1 到 Turn 5 的提问与新增录音顺序;2. 再看左下三条时间轴上目标 ticks 与其他事件的区间标注;3. 最后对照右下 Route、Span、Reason、Answer 四段如何引用同一组区间
论文图 1。原论文 Figure 1::“Temporal QA and evidence in multi-audio dialog.”。
上图上半是 5 轮对话示例,第一轮上传第一个录音问汽车首次经过,第二轮上传第二和第 3 个录音问滴答总时长更长者,第 5 轮问滴答最早开始于哪个录音。下半左侧给出第 5 轮可见的 3 条时间轴,目标事件为滴答声。
右侧给出第 5 轮的结构化证据,Route 覆盖 3 个录音,Span 记录第一个录音无滴答、第二和第 3 个录音的全部滴答区间,Reason 比较起始点后 Answer 给出录音编号。该图说明证据与运算的关系,这是后续训练与评测的设计依据。
TEMA 的全景流程如何走通一轮问答?
TEMA 的全景可以沿一轮走完。输入是当前可见录音、历史对话和当前问题。第一步生成 Route,确定本轮要看哪些录音。第二步生成 Span,在每个录音时间轴上列出全部匹配实例的开始与结束时间。
第三步生成 Reason,从 Span 中挑选实例并做计算或比较,例如取最早开始时间、求和时长、计数或排序。第四步生成 Answer,给出用户可读的最终回答。整个链条把事件感知与基于证据的作答连接起来,证据是中间的可核对依据。
Route × Span: Route 负责定范围,指出当前问题需要检查哪些录音,包括需要验证缺席的录音;Span 负责记全证据,在 Route 范围内列出每个匹配实例的起止时间,无匹配则记 [NONE]。两者搭配的理由是时间计算依赖完备实例集合,缺一个就会算错总数或总时长,组合后形成先定域再取全量的可核对中间表示,供后续选择、计算和比较使用。
沿第 5 轮最早滴答问题的样本走一遍更具体。输入是 3 个录音与追问哪一录音滴答开始最早。Route 输出 3 个录音编号。Span 输出第一个录音无滴答、第二个录音一段区间、第 3 个录音 3 段区间。
Reason 比较各段起点并选最小者,Answer 输出录音编号。关键是 Span 不因问题只要最早就只写最早,而是写全集合,这样同一份证据换一个问题也能算总数或排序。
论文用这种完备性来应对漏检改变结果的风险,尤其对计数和累计时长任务重要。
Route、Span、Reason 如何分工与计算?
Route 的计算目标是音频范围判定。它依据当前问题措辞与对话历史推断需要检查的录音集合,包括那些需要验证缺席的录音。Span 的计算目标是区间集合恢复。
它在 Route 范围内对每个录音输出全部匹配实例的开始与结束时间,缺席录音输出 [NONE]。Reason 的计算目标是实例选择与时间运算。它引用 Span 中的区间做取最小起点、求和、计数或比较,不再重新估计边界。
这种分工使错误可定位:范围错归 Route,漏段或边界偏归 Span,算错归 Reason。Span 质量的判定分两层。第一层是完全正确指示,只有当预测音频范围、每录音实例数和缺席状态与参考一致,且误差都在 0.1 秒内,才为 1。
第二层是连续分,用于区分尚未完整但程度不同的候选,取值在 0 到 1 之间。最终奖励把两者加权,完整候选至少 0.9 分,有效但不完整候选至多 0.1 分,无效证据给负分,体现完整性优先。
奖励公式原文如下,符号 y 表示生成的证据,H 为完全正确指示,D 为连续分。
\[r(y)=\begin{cases}0.9H(y)+0.1D(y),&y\text{ is valid evidence},\\ -0.1,&\text{otherwise}.\end{cases}\]上式中有效证据得 0.9H 加 0.1D,无效证据得负 0.1。实现上先判断格式与范围有效性,再算 H 与 D。连续分本身由三部分组合:音频范围集合值、实例匹配分和缺席分。
实例匹配先算预测区间与参考区间的匹配质量,再在每个录音内做最大权匈牙利匹配求和。匹配质量结合交并比与端点误差,端点误差用与区间长度相关的尺度归一化并裁剪到 0.1 到 0.5 秒。公式原文如下。
\[\displaystyle q(p,g)\]上式含义是区间重叠越好分越高,起点终点偏离越大分越低,短事件与长事件用不同容差。得到匹配总分后,与参考和预测区间数算出软实例分。
缺席分统计参考中无匹配事件的录音有多大比例被正确纳入范围并显式标记,若无此类录音则为 1。最终 D 按有无非空区间和有无缺席录音分 3 种情况组合,原文如下。
\[D=M\begin{cases}0.8F_{\mathrm{occ}}+0.2N_{\mathrm{acc}},&n>0,\ |Z|>0,\\ F_{\mathrm{occ}},&n>0,\ |Z|=0,\\ N_{\mathrm{acc}},&n=0.\end{cases}\]上式第一种是有实例且有缺席录音时兼顾两者,第二种是只有实例时只看实例分,第 3 种是无实例时只看缺席分。
Span × Reason: Span 负责提供全部候选区间事实,Reason 负责在这些事实上做选择、计算和比较。分工是感知与运算分离,Span 不做最早或最长这类判断,只保证实例齐全和边界准确;Reason 不再重新听音频找边界,只引用 Span 中的区间。搭配后即使问题只要最早实例,Span 仍保留全部实例,使同份证据可支持计数、累计时长和排序等不同运算。
需要强调的是这些公式用于第 3 阶段强化学习的奖励,不是 Reason 的计算公式。Reason 的加减与比较由语言模型在监督微调中学到,不在这里用公式直接优化。
数据如何构造,三阶段训练各学什么?
数据构造先准备事件标注。论文整合 3 个公开来源的事件表,保留已有起止区间,把其中一路的片段描述映射到统一类别并归一化粒度。另一路用 AudioSet 风格事件名叠加在静音上并提供计数与起点,再用波形幅度和连续静音补全结束点。
计数任务要求计数与单个区间对应可验证,做法是从 456 个类别中人工选出 202 个可数候选并抽样录音,用大模型预测计数与时间戳,再用计数一致与区间交并比筛选核心事件并扩展重复验证,只有验证过的记录才用于计数问题。
音频分组与对话生成分两步。分组有相似组与随机组,相似组用事件标签相似度检索候选再用组内最小成对相似度过滤,支持相似声音的实例区分。随机组引入不同声景差异以多样化比较关系,并生成描述用于问题措辞。
为减少 1 次生成中的事实与时间错误,先规划后实例化:规划用粗事件信息、音频编号与合法菜单安排问题、上传顺序与历史引用;实例化结合完整事件表与详细音频描述生成每轮问题与 4 段回答。审计包括规则检查与模型检查,不通过则丢弃,并人工抽查 100 个对话。
下图展示了从 3 路标注到分组、描述、2 阶段生成与审计分流的全链路,适合核对监督来源与数据规模。
看图路径: 1. 先看顶部三路数据源如何汇入统一事件表;2. 再看中部两阶段对话生成中规划与实例化各用什么输入;3. 最后看右下规则检查与模型检查后如何分流为两个数据集规模
论文图 2。原论文 Figure 2::“Construction pipeline for TEMA-Dialog and TEMA-Bench.”。
上图顶部是 3 路音频与时间标注经相似与随机分组进入统一事件标签框,同时生成音频描述。左下是 2 阶段对话生成,规划用粗事件摘要与任务菜单,实例化用完整时间线与详细描述。
右下是证据与对话审计,先规则检查再模型检查,不通过丢弃,通过后分流为两个规模节点。该图把监督来源说清:区间事实来自事件表,措辞来自描述,规划保证跨轮引用合法。
3 阶段训练各有输入与更新范围。第一阶段时间定位初始化用 AudioGrounding 子集 98,401 个正例,给定单录音与查询,用标记交叉熵监督输出全部相关区间的 Span 回答。第二阶段完整对话监督微调在对话数据上监督每轮完整 4 段,学习推断音频范围、生成证据与时间运算。
论文报告前 2 阶段在语言模型与音频投影层训练秩 64 的适配器,基座权重与音频编码器冻结。第 3 阶段是完整性优先的仅 Span 强化学习,只生成并优化 Route 与 Span,停在 Span 结束标记。
做法是每基座的微调模型筛选自己的强化学习问题,以 Qwen2.5-Omni 为例从 7,292 个问题每题采样 8 个候选,保留同时有完全正确与有效但不完整候选的 1,034 题。训练语言模型上秩 16 的新适配器,音频编码器与投影器冻结。
时间定位初始化 × 完整对话监督微调: 时间定位初始化负责建立查询到区间的对齐能力,用单音频接地数据先学会输出全部相关区间;完整对话监督微调负责学会在对话上下文中用证据,先根据问题和历史推断音频范围,再生成证据并完成推理作答。先对齐再学上下文使用的原因是直接做多轮监督时细粒度感知不足,组合后模型既有边界能力又有跨轮引用能力。
完整性优先 × 边界精度: 完整性优先指奖励首先要求音频范围、每录音实例数和缺席标记完全正确,缺一不可;边界精度指在完整基础上进一步要求起止误差小,用交并比和端点误差衡量。分工是先保证不漏不多,再把每段掐准。搭配原因是计数和累计时长对漏检极敏感,宁可先拿全再修边界,论文奖励中完整项占 0.9 而连续分只占 0.1 即体现该取舍。
论文的假设是经过对话监督后已学到证据到答案的映射,且参考证据诊断显示好证据能大幅提分,因此只优化可验证证据也有望提升作答。该假设在结果节用消融验证,不能当作事先成立的因果。
在什么条件下测,用什么指标判定好坏?
评测在 Test253 上进行,共 253 个对话 1,239 个问题,其中 209 个为多音频对话,并经过额外人工复核与修正。做法是自然多轮评测:用上传顺序的录音与模型生成的历史。
贪心解码每轮至多 1,024 个标记,所有模型条件一致。比较对象包括开放模型与私有模型。基线直接回答,TEMA 及其消融生成 4 段后再回答,只对结构化输出打证据分。
指标分答案与证据两类。问答方面,问题涉及可验证的事件属性,包括身份、次数、顺序与时间。做法是给定问题、参考历史与事件标注,先用模型判断非时间正确性并抽取时间断言。
再用确定性规则以包含式 0.1 秒容差验证时间值。QA 衡量最终回答是否满足问题要求,QA+T 额外检查所有主动给出的时间断言。打分只用参考历史,跨轮聚合。
证据方面,Span 微 F1 在录音内 1 对一匹配、交并比不低于 0.5 时池化统计;H 是 0.1 秒容差下的完整证据比例。方向都是越高越好。
训练与评测的实现条件需要同时核对。基座为 Qwen2.5-Omni-7B 与 AF-Next,两者用相同时间定位数据与对话数据。前 2 阶段适配器秩 64、缩放 128、丢弃 0.05。
强化学习阶段用新适配器秩 16、缩放 32。论文未报告硬件型号、训练时长与推理延迟等预算细节,这是复现时需要补记的缺项,不能从模型名推定开销。
主结果显示了什么,代价与反例在哪里?
比较问题是:在相同自然多轮条件下,基于完整证据的 TEMA 是否在总体问答与各任务族上优于直接回答的基线,证据分是否同步提升。公平条件是同为 Test253、同为模型生成历史与贪心解码,指标方向均为越高越好。
下表选择原表表头与关键行列,保留总体问答、证据与跨族问答数字,基线为原始开放与私有模型,策略为 TEMA 的可运行版本。
| Supplied gold Route/Span: diagnostic only | Supplied gold Route/Span: diagnostic only | Supplied gold Route/Span: diagnostic only | Supplied gold Route/Span: diagnostic only | Supplied gold Route/Span: diagnostic only | Supplied gold Route/Span: diagnostic only | Supplied gold Route/Span: diagnostic only |
|---|---|---|---|---|---|---|
| Model | Training | Overall | Overall | Evidence | Task-family QA | Task-family QA |
| QA | QA+T | Span F1 | F4 | F5 | ||
| Qwen2.5-Omni-7B | Original | 46.09 | 38.90 | — | 22.67 | 33.33 |
| Qwen3.5-Omni-Plus | Original | 57.71 | 46.49 | — | 52.44 | 5.56 |
| TEMA (Qwen2.5-Omni) | I+S | 68.93 | 58.27 | 52.30 | 53.33 | 66.67 |
| TEMA (Qwen2.5-Omni) | I+S+G | 69.81 | 58.76 | 58.65 | 51.11 | 69.44 |
上表显示 TEMA 在 Qwen2.5-Omni 上总体问答 69.81%,在 AF-Next 上 58.84%,高于表中所有直接回答基线。相对原始 Qwen2.5-Omni,定位与测量族从 26.05% 升至 62.03%,跨音频比较族从 22.67% 升至 51.11%。
私有模型中 Qwen3.5-Omni-Plus 在识别与验证族领先但在定位族远低于 TEMA,说明学区间及其使用对精细时间理解有价值。代价一是需要结构化输出与 3 阶段训练,二是证据分虽提升但并未满分,仍有漏检与边界误差空间。
反例是原文报告 Qwen2.5-Omni 的跨音频比较从 2 阶段的 53.33% 降到 3 阶段的 51.11%,说明区间恢复提升并不总是转化为跨录音运算提升,需要轮级误差分析改进覆盖、精度与跨轮一致性。
问答准确率 × 证据恢复质量: 问答准确率负责衡量最终回答是否满足问题要求,证据恢复质量负责衡量中间 Span 是否找全实例且边界准确。前者看结果对错,后者看依据是否完整。两者搭配的理由是时间问答的错误可能来自证据缺失,也可能来自计算错误,联合评估才能区分是没找全还是算错,论文因此在 TEMA-Bench 上同时打分。
金证据诊断进一步支持证据的价值。供给参考 Route 与 Span、保留模型生成历史且不给参考推理与答案时,2 阶段模型问答提升 27.52 个百分点,即使原始模型也能达到 82.81%。
这表明模型能有效使用准确时间事实,同时揭示瓶颈在证据获取而非完全不会用证据。该诊断是供给参考的上限分析,不能代替可部署收益。
去掉初始化或只奖证据会发生什么?
第一个消融看时间定位初始化。在相同对话监督下,加初始化的问答与证据分明显提升,跨音频比较也提升。这支持先学查询到区间对齐再学上下文使用的安排。
无初始化的单阶段监督版本明显低于 2 阶段版本,说明直接做多轮监督时细粒度感知受限。第二个消融看仅 Span 的强化学习。不直接奖励推理与答案时,两基座的证据分与问答分均有提升。
这支持论文假设,即在对话监督后优化可验证证据可以改善作答。但增益幅度不对称,证据分提升大而问答提升小,且存在跨音频比较下降的反例。
以下整理消融报告的百分点变化,用于区分证据增益与问答增益的不同幅度,指标方向均为越高越好。
| 消融条件 | 问答变化 | 证据变化 | 适用基座 | 变化性质 |
|---|---|---|---|---|
| 加时间定位初始化 | 11.79 个百分点 | 20.14 个百分点 | Qwen2.5-Omni | 问答与 Span F1 提升 |
| 加 Span-only 强化学习 | 0.88 / 0.81 个百分点 | 6.35 / 14.29 个百分点 | Qwen2.5-Omni / AF-Next | 证据提升大问答提升小 |
上表说明初始化带来 2 位数的问答与证据提升,而仅优化证据带来较小的问答提升。未来工作应按轮分析实例覆盖、边界精度与跨轮证据一致性,而不是只看总体分。
还需注意百分点与相对百分比不同。本文所有变化均按显示舍入分数的百分点差报告,不做相对百分比换算。不同指标差值不能混放,也不能把自动指标当作人工评价。
哪些边界尚未评测,哪些推测还未验证?
论文直接报告的是 Test253 上的答案与证据分数,以及供给金证据的诊断上限。有限解释是完整证据有助于计数与累计时长,因为漏一个就会改变结果。
这有机制支持但未逐类给出漏检率与误差传播的定量分解。未验证推测是仅优化证据必然持续带来问答提升,实际上跨音频比较出现下降,说明该因果不稳定,应表述为可能与待验证。
未评测边界包括误判率、延迟与成本。论文未测量训练资源消耗、推理开销、输出帧率与实际延迟,因此不能承诺这些量得到改善。总体趋势不等于每组每步都成立。
例如历史引用族在 AF-Next 上 3 阶段略降,私有模型在识别族仍领先。相关性不是因果,证据分高与问答分高同时出现不能直接断定前者完全导致后者。
缺失证据不是技术错误,应如实记录为未报告,而不是指责方法无效。
若要复现,先准备什么,先跑哪一步?
先核对数据与划分。对话与基准分别取自源数据集的训练与测试切分,下表整理规模、录音数、轮数与上传方式等可重放条件,数字来自原文连续句,裸值不擅自添单位,百分比保留原精度。
| 数据集 | 对话数 | 回答轮数 / 问题数 | 录音与上传条件 | 初始化正例 |
|---|---|---|---|---|
| TEMA-Dialog | 40,704 dialogs | 198,195 response turns | 75,561 recordings,1–6 recordings,2–13 turns | 98,401 positive examples |
| TEMA-Dialog 上传方式 | 23,858 dialogs 增量上传 | 16,846 dialogs 前置上传 | 78.80% 为多音频对话 | — |
| TEMA-Bench Test253 | 253 dialogs | 1,239 questions | 209 multi-audio dialogs,人工复核修正 | — |
上表说明复现的数据起点:对话级 40,704 个对话与 198,195 个回答轮次,录音 75,561 个,每对话 1 到 6 个录音、2 到 13 轮。多音频对话占 78.80%,增量与前置上传数量分别明确。
复现时应先按事件表重建区间事实,再检查分组与审计逻辑,最后才看措辞生成,因为区间对错由事件表决定。再核对训练与评测超参数。
前 2 阶段训练语言模型与音频投影层的适配器,秩 64、缩放 128、丢弃 0.05,基座权重与音频编码器冻结。强化学习阶段训练语言模型新适配器,秩 16、缩放 32。评测贪心解码每轮至多 1,024 标记。
论文称已发布代码、数据集细节与模型权重并给出地址,但本次资源状态显示 3 个链接均为不可用,状态 404,因此当前应写链接当前不可用,不能写已公开或可下载。
何时值得尝试,还需补哪项验证?
当任务同时满足多轮、多个录音与需要精确区间计算时值得尝试 TEMA 思路,例如跨录音计数比较、总时长比较与最早出现判断。做法是先定义 Route 的范围规则与 Span 的完备输出格式。
无匹配必须显式标记,再让推理只引用 Span 做计算。若问题只是单轮选择哪个录音更长而不需区间,则不必引入全量证据,按论文对照那属于不同任务条件,不宜直接比高低。
复现建议按依赖顺序做:先跑单音频接地建立边界能力,再跑完整对话监督学会范围推断与 4 段生成,最后在小规模问题上试仅 Span 奖励并同时跟踪证据分与问答分。若只见证据分涨而问答不涨,应检查推理的引用是否对齐实例编号与录音编号。
还需检查跨轮历史是否引入旧区间干扰。还需补的验证包括轮级错误分类、缺席判断准确率、长对话一致性,以及训练与推理成本测量。
只有补齐这些,才能判断完整性优先的奖励在实际部署中是否划算。
📎 论文与评分元数据
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses

