英文题目:GigaChat Audio: Time-aware Large Audio Language Model
会议身份:
conference:interspeech:2026:conference-paper-id:kutsakov26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据集 #多模态学习 #音频大模型 #长音频处理 #音频问答
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:模型报告
👥 作者与机构
- Aleksandr Kutsakov:机构信息未能从会议 PDF 纯文本可靠映射
- Mariia Sadovina:机构信息未能从会议 PDF 纯文本可靠映射
- Georgii Gospodinov:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandr Maximenko:机构信息未能从会议 PDF 纯文本可靠映射
- Oleg Kutuzov:机构信息未能从会议 PDF 纯文本可靠映射
- Pavel Bogomolov:机构信息未能从会议 PDF 纯文本可靠映射
- Fyodor Minkin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理最长 120 分钟会议、播客、讲座类录音的时间感知理解,输入为长音频加自然语言问题,输出为带显式时间区间的回答、给定区间的片段描述(fragment description)与自主切分的时间锚定摘要,难点是标准音频 token 流无时间坐标,长上下文易输出不可解析或无支撑的时间声明。方法链为:先用 VoxLingua107 语言识别过滤英文并用 WhisperX 获得词级时间戳转录,按静音比过滤并按时长分桶平衡,再用文本大模型 GPT-OSS-120B 在约 10 分钟转录切片上生成问答并用全局验证器在全转录上过滤不一致样本,最后在 10B-A1.8B 混合专家文本基座外挂音频编码器并在音频 token 流中每 60 秒周期性插入时间标记后做音频监督微调。相对短音频定位与转录中心系统的差异在于把时间显式交错进输入输出接口,使模型可在稀疏锚点间插值出秒级精度。主证据是在 20 分钟至 40 分钟时间定位(temporal grounding,TGr)上本模型达到 53.8 mIoU,而 Qwen3-Omni-30B-A3B 同设置仅为 3.6;在 AMI 会议 15 分钟至 50 分钟短语定位上本模型中点 MAE 为 3.5 秒,Qwen 为 290.5 秒。结论边界是长短时长混合训练与锚点缺一不可,单时长训练呈现非对称泛化失效,纯秒制编码与过稀疏锚点显著退化。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文输入是最长 120 分钟的长录音,包括会议、播客、讲座和客服通话这类连续语音,目标是让音频语言模型在回答问题、描述片段和生成摘要时同时给出显式时间戳,使用户能跳转到对应音频位置核对。必须保留的信息包括时间如何被写进输入输出接口、合成监督如何构造与校验、不同时长混合如何影响泛化,以及锚点频率与格式带来的精度与开销交换。
读完本文解读,你应能复述从波形到带时间答案的完整动作:音频如何编码为连续向量、时间标记以何种间隔插入、问答对如何从切片转写生成并经全局校验、评测如何按时长分桶计算区间重叠与秒级误差。论文把时间定位视为可验证性基础能力,而非附加修饰,核心矛盾是标准音频 token 流天然没有时钟,长录音会放大内部表示与用户可见时间戳之间的错位,表现为内容看似合理但时间戳不可解析、过粗或无支撑。
为此作者提出 GigaChat Audio,在 10B 混合专家文本基座上外挂音频前端,用交错的时间锚点提供位置参照,并用大规模级联合成管线提供监督。教学上先把一个样本走通:一段会议录音进入编码器变为连续音频 token,每 60 秒插入一个文本时间戳,再与用户问题文本 token 拼接送入语言模型,模型输出包含起止时间的答案。例子仅为帮助理解流程,不代表论文报告了该样本的数值效果。
后文按学习依赖展开,先对照相关路线,再拆方法全景与组件计算,然后讲数据构造与训练动作,最后按实验条件组织结果、反证与复现要点。关于权重与数据集可得性,论文正文写了发布地址,但本次收到的证据中没有完成网络可达验证的资源绑定,因此本解读不声称代码、模型或数据当前已公开或可用,需要读者自行核对原文链接。
同输入同目标的已有路线卡在哪里?
与本文同输入的通用音频语言模型包括专有系统与开源全模态模型,论文点名的有 GPT-4o、Gemini、Qwen3-Omni 和 Voxtral,以及更早的 Qwen2-Audio 和 SALMONN。这类工作支持从语音直接做指令跟随、转写和通用问答,但论文指出其长时间定位行为很少被单独系统分析,长录音下容易出现时间 grounding 不可靠。另一条同目标但不同任务重心的路线是长语音转写与富转写,例如 VibeVoice-ASR 和 MOSS Transcribe Diarize,以及提供词级对齐的 WhisperX,它们的目标主要是把字转准并附带说话人与时间,而非开放式问答与摘要的时间锚定。
在短音频事件定位一侧,已有文本到音频 grounding 基准和检索式 формулировка,例如音频时刻检索与 Clotho-Moment、CASTELLA 数据集,以及面向语言模型的 TimeAudio,引入了显式时间建模。视频中的自然语言时刻定位与带时间分隔符的视频语言模型也提供了灵感。本文与它们的区别在于输入时长扩展到 120 分钟,并系统研究表示时间的最简稳健方式、长录音监督如何低成本生成、以及单一时长训练能否泛化。评估开放生成时,论文对片段描述与定时摘要采用大模型作裁判,但对时间定位本身坚持用区间重叠这类可验证指标,避免把主观判断当作时间准确性的证据。
要解决的三个实际问题是什么?
论文把研究收敛为 3 个可操作问题。第一,在音频语言模型的输入输出接口中,用最小且稳健的方式表示时间,是用纯文本时间串还是新加专用符号,多久插入 1 次。第二,长录音人工标注太贵,如何大规模生成时间监督并保证质量。第三,在单一时长区间训练的时间模型能否泛化到其他长度,是否必须混合多种时长。
对应的失败形态在引言中讲得很具体:模型内容流畅但时间戳不可解析、只给粗粒度引用、或给出无支撑的时间断言。理解这一点后,后续的锚点频率消融、格式比较与时长混合矩阵就有了明确归属:前两者回答表示问题,合成管线回答监督问题,长度外推矩阵回答泛化问题。初学者容易误以为把上下文窗口加大就能解决长音频定位,论文的对照恰好说明窗口只是容量条件,没有显式时间参照与匹配的时长混合,定位精度仍会崩塌。
方法全景:一个样本如何走完输入到输出?
先沿一个样本走完全程。一段会议录音先变为频谱或波形特征,进入音频编码器,再经降采样与投影对齐到文本嵌入空间,形成连续音频 token 序列。系统提示与用户问题作为文本 token,时间标记作为第 3 种 token,三者在分词后交错拼接送入语言模型。模型输出不再是纯文字答案,而是带有起止区间的回答、给定区间的描述,或自行分段的多段定时摘要。原文图 1 把这一交错关系画成顶部一行小方块,蓝色为文本,黄色为音频,绿色为时间,底部是编码器与投影的纵向通路。
阅读该架构图时,先抓住主路径再看汇合点,才能理解时间信息是在何处被显式注入的,而不是把它当成后处理拼接的时间字符串。
看图路径: 1. 先从底部频谱经音频编码器到降采样投影再到音频 token 的纵向箭头走一遍主路径;2. 再看顶部语言模型输入行中蓝色文本方块与黄色音频方块的交错位置;3. 找到夹在黄色音频块之间的绿色时间小块,确认其周期出现位置;4. 对照右侧图例确认文本、音频、时间三种方块的颜色含义
论文图 1。原论文 Figure 1:“1”。
从像素可见,底部为声谱图,上方依次是音频编码器与降采样投影模块,输出一串黄色音频方块;左右两侧虚线框分别为系统提示与用户提问的文本输入,经分词后与音频黄块和绿色时间块在同一行汇合,再进入顶部语言模型大框。右侧图例明确区分了 3 种颜色,绿色时间块稀疏地插在黄色序列之间,直观对应正文所说的周期性间奏时间标记,并在序列末尾还有一个结束标记。这种设计把时钟直接写进模型看得见的输入流,后续输出的时间戳就有了可对齐的参照,而不是让模型凭空猜测绝对时间。
音频前端与时间锚点各自负责什么?
音频前端由编码器、降采样器和投影器组成。编码器采用分块注意力,原文给出 8 秒分块与 40 毫秒步长,并使用闪速注意力实现,输出帧率对齐到 160 毫秒 1 帧。投影的作用是把声学向量映射到语言模型的文本嵌入空间,使后续语言模型能像读文本一样读音频内容。训练时该前端与 10B 混合专家文本基座联合微调,基座具有 256k 词元上下文以容纳长录音。原文固定了部分学习率设置,编码器与解码侧采用不同学习率,但未完整报告优化器状态、梯度裁剪与重置时机等细节,本解读不从模型名称推定这些实现。
时间锚点的默认做法是在连续音频 token 之间每 60 秒插入一个纯文本时间戳,格式为时分秒,并在每段音频序列末尾追加一个结束标记。输出侧同样要求模型生成显式区间,评测时按区间重叠计分。这种安排的理由是文本时间串复用了语言模型已有的数字表示,无需新词表即可被理解与生成。
连续音频 token × 周期时间标记: 连续音频 token 分工是把编码器输出的语音声学内容对齐到语言模型嵌入空间,保持语义连续;周期时间标记分工是在输入流中每隔固定时长插入一个可读时间戳作为位置参照。搭配理由是纯音频 token 没有显式时钟,语言模型难以把内部相对位置映射到用户可跳转的绝对时间;组合后模型可在稀疏锚点之间做插值,从而同时保留内容理解与可解析的时间输出。
对初学者而言,关键是把内容通道与时钟通道分开:前者解决听懂了什么,后者解决发生在何时。去掉后者,模型仍能生成流畅描述,但无法被跳转验证;保留后者,即使锚点稀疏到每分钟 1 次,模型也能在锚点之间插值出秒级精度,这是后文频率消融要验证的机制。
三种时间任务的输入输出有何不同?
论文定义了 3 种时间任务。时间定位问答给定文字事件描述,要求预测其在音频中的时间区间,接近音频时刻检索。片段描述给定区间,要求用自然语言描述该窗口内发生的事,类似按预切分片段做字幕或语音摘要。带时间的摘要要求模型自行决定分段边界并给出多段锚定摘要,既要切分又要描述,难度最高。
三者的监督都来自带时间戳的转写,但构造方式不同。问答需要从切片中生成问题再经全局校验,摘要则是 1 次性基于完整转写生成,不做多采样聚合之外的切片采样。理解这一差异有助于复现时分别准备数据管线,而不是用同一套提示处理所有任务。
时间定位问答 × 片段描述: 时间定位问答分工是给定文字事件描述预测其在音频中的起止区间,考察找时间的能力;片段描述分工是给定起止区间描述该窗口内发生了什么,考察在已知时间下理解内容的能力。搭配理由是两者互为逆过程,共用同一套时间表示才能互相约束;组合意义在于同一模型既要会由文找时,也要会由时生文,摘要则进一步要求自行决定分段边界。
教学例子:假设用户问旅行计划在何时讨论,定位任务应返回类似 17 分 03 秒至 17 分 35 秒的区间;若用户给定该区间要求描述,模型应概括该窗口的讨论内容;若要求摘要,模型需先把长会议切成若干语义块再逐块总结并标注时间。例子仅说明任务形态,不附加论文未报告的数值效果。
合成监督如何构造、校验与划分?
数据起点是 YODAS2 的 6 个英文分片,先用语言识别模型过滤非英文,再用 WhisperX 得到词级时间戳与对齐转写,并按静音比例过滤与时长分桶。原文报告的规模变化是理解成本的关键:原始分片量级、过滤后保留量级与静音过滤后保留量级逐级收缩,并按 20 分钟以下、20 至 40 分钟、40 分钟以上分桶平衡。训练与评测在音频层面划分,同一录音的所有问题必须在同一侧,避免同一录音的片段同时出现在训练与评测中。
问答合成的具体动作是取约 10 分钟转写切片,用纯文本大模型生成问答对,再用独立校验器对照完整带时间戳转写过滤不一致生成。论文说明曾尝试音频加文本联合生成但效果更差,因此最终采用纯文本生成器加音频转写的级联路线。评测集额外提高采样温度对同一问题生成 5 个答案变体,再聚合过滤,摘要任务则直接基于完整转写单遍生成。
切片生成 × 全局校验器: 切片生成分工是只取约 10 分钟转写片段来构造问答,避免生成器只关注录音开头的前载偏置;全局校验器分工是用完整带时间戳转写检查每个问答对是否一致,滤除幻觉或矛盾。搭配理由是局部生成保证覆盖均匀,全局检查保证跨片段一致;组合后才能在无大规模人工标注时得到可用于长录音训练的监督。
下图把上述分支画得很清楚,读图时注意区分训练与评测两条去向,不要把聚合器当成训练过滤器。
看图路径: 1. 先从底部波形经语音识别加对齐到带时间戳转写的上行箭头看起点;2. 再比较上方切片转写与下方完整转写分别进入问答生成器与校验器的分支;3. 跟踪校验器向右到训练集与向下经多答案生成到聚合器再到评测集的两条输出线
论文图 2。原论文 Figure 2:“Synthetic supervision pipeline for temporal grounding.”。
从像素可见,最下方为波形,经语音识别加时间对齐得到完整转写框;完整转写向上还可切出一个带具体时间戳的片段框。片段框向右进入问答生成器,生成示例问题与答案;该问答对与完整转写共同进入校验器,校验通过的进入右侧蓝色训练集圆圈。校验器的另一路向下进入答案生成器,对同一问题产生多个时间略有差异的答案,再经聚合器进入橙色评测集圆圈。
图中示例时间集中在 17 分左右,5 个答案的起止秒数有小幅抖动,直观说明多采样聚合是为了保留有难度但仍一致的样本,滤除完全离散的错误样本。基础音频后训练混合包括字幕、多轮对话、情感识别与多语识别等多任务,论文在时间消融中固定该混合,以孤立时间设计的影响。
用什么数据、基线与指标测时间能力?
评测覆盖 4 组基准。短片段音频定位基准包含 980 个 7 至 10 秒样本,要求预测声学事件区间,报告平均交并比。会议基准为 15 至 50 分钟录音,自动生成 150 个针对 3 至 5 秒话语的短语定位问题,报告区间中位绝对误差。DCASE 音频问答的时间子集选取以何时开始为形式的 144 个 6 至 10 秒选择题,时间答案例如 5.2 秒,报告点 wise 平均绝对误差。自建基准按 0 至 1 分钟、2 至 5 分钟、20 至 40 分钟分桶,分别报告定位的重叠率、片段描述的大模型裁判分,以及最长桶上定时摘要的时间结构分、内容聚合分与整分段占比。
比较对象包括开源的 Qwen3-Omni 与 TimeAudio,以及专有 Gemini Flash,并附带自家去掉时间锚点与改变锚点频率的消融。论文特别说明 TimeAudio 在超过 2 分钟音频上常输出不可解析时间戳,因此只在与其原始设置匹配的时长上报告其结果,避免跨条件误比。指标方向需记牢:重叠率与裁判分越高越好,秒级误差与整分段占比越低通常表示更精细而非取整猜测。
平均交并比 × 中点中位绝对误差: 平均交并比分工是衡量预测区间与参考区间重叠程度,越高表示定位越准,用于区间输出;中点中位绝对误差分工是取区间中点计算与参考中点的时间差并取中位,单位为秒,越低越好。搭配理由是重叠率对长短区间敏感而中点误差更直观反映秒级偏差;组合使用可同时看到定位是否找对段以及偏差了多少秒。
片段描述的裁判从事实覆盖与幻觉两方面打分,摘要裁判从时间结构、事实准确率、错误率与文体 4 维打分,其中内容聚合分由准确率、错误率与文体综合计算。自动的整分段比例用于辅助判断模型是否在用整分钟粗切分应付,比例高可能意味着分段过粗,这是解读摘要时间结构分时的重要对照。
主结果:长录音下谁还站得住,锚点起了什么作用?
比较的核心问题是:在时长从秒级拉长到 20 至 40 分钟时,各模型的时间定位是否一致可比,指标方向是否相同。公平条件是同一分桶、同一重叠率与秒级误差口径,自建长桶与公开短基准共同构成对照。下表把论文正文连续句子中实际出现的关键数字整理为可核对形态,列数满足宽表要求,数值与单位保留原文写法,不做四舍五入或单位拆分。
| 条件 | 任务与时长 | 指标 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 20–40m 时间定位 | TGr 长桶 | mIoU | 53.8 mIoU on 20–40 min | 3.6 mIoU on 20–40m TGr |
| 20–40m 时间定位加密锚点 | TGr 长桶 | mIoU | 65.2 mIoU | 53.8 mIoU |
| 去掉周期锚点 | TGr 长桶 | mIoU | 14.2 | 53.8 |
| AMI 会议短语定位 | AMI | interval MAE | 未报告本方法该格 | 290.5 s interval MAE on AMI |
表后解释需要同时讲收益与代价。本方法在 20 至 40 分钟桶上保持 53.8 的重叠率,而 Qwen3-Omni 在同桶跌至 3.6 并在会议上产生 290.5 秒的中点误差,说明强短片段表现不直接迁移到长时定位,这是论文报告的直接结果。将锚点加密到每 7 秒可进一步提升到 65.2,但代价是 token 开销上升。反例是去掉周期锚点后长桶从 53.8 跌至 14.2,定时描述与摘要同步退化,支持周期锚点必要的判断。未胜出项也要保留:默认每 60 秒锚点的本方法在部分短基准上并未超过 TimeAudio 与 Qwen,说明该设计优先保证长时稳定而非短时最优。
看图路径: 1. 先确认横轴为评测音频时长从 0 至 120 分钟、纵轴为训练时长窗口的矩阵布局;2. 再逐行比较只用短音频训练的前两行在右侧长评测列上数值接近零的现象;3. 最后看最下一行全时长混合训练在各列上均为列内最深色的表现
论文图 3。原论文 Figure 3:“Length extrapolation up to 120 min for temporal grounding in mIoU (↑).”。
该热力矩阵的行是训练时长窗口,列是评测时长,最下一行为全时长混合训练。从像素可见,前两行在右侧 60 至 120 分钟列上数值接近零且颜色最浅,表明只用短音频训练无法外推到长录音;中间 20 至 40 分钟训练行在长列上恢复到 50 左右;最下一行在各列上均为列内最深,数值从 40.6 到 68.8 不等,支持混合时长训练泛化最好的结论。阅读时注意颜色是按列归一化,只表示列内相对好坏,不能跨列直接比较绝对值大小。
锚点多密才够用,精度与开销如何交换?
要回答的比较问题是:在输入流中多久插入一个时间锚点,秒级误差能降多少,又要多付多少 token。公平条件是同一模型与同一评测,指标为重叠率越高越好、中点秒级误差越低越好,附加比例为时间 token 相对音频 token 的占比。下表仅使用论文正文连续原句中逐字出现的数字与单位整理,不引入原表矩阵中未在连续句子中出现的精度数字,避免为凑宽度编造证据。
| 条件 | 锚点间隔 | 指标 | 本方法中位误差 | 开销定性 |
|---|---|---|---|---|
| 稀疏锚点 | 60 s anchors | median error | 3 s | 低于密集锚点 |
| 密集锚点 | 7 s anchors | median error | 1.5 s | 高于稀疏锚点 |
| 输入流 | periodic anchors | 作用 | inserted into the input stream | 需占用上下文 |
| 帧率背景 | 160 ms frame rate | 基准 | audio tokens at 160 ms | 决定相对占比 |
表后解释要给出可操作的交换。论文报告即使每 60 秒一个锚点,中位误差仍可达 3 秒,而加密到每 7 秒可降至 1.5 秒,说明模型能在分钟级锚点之间插值出秒级精度。代价是锚点越密,相对音频 token 的附加比例越高,原文的频率对照显示从每 240 秒到每 7 秒附加比逐级上升。实践含义是每分钟 1 次的稀疏锚点已能满足可靠定位,加密锚点属于用可预期的上下文开销换取秒级精度的选择,而非必要条件。未评测边界是超过 120 分钟的输入与更密于 7 秒的配置,论文未报告这些点的开销与收益,不应外推。
时间该写成什么样子,专用符号值得吗?
第二个消融比较锚点格式与词表设计。候选包括规范时分秒串、分钟索引简写与纯秒数,以及把时分秒字符替换为专用时间 token 的方案,专用符号从对应数字与冒号嵌入初始化。论文报告纯秒数明显退化,分钟索引接近规范格式且 token 更省,而专用符号在小时间数据占比下表现很差,只有在时间数据占比提高到很高时才追平纯文本基线。
纯文本时间格式 × 专用时间 token: 纯文本时间格式分工是直接用时分秒字符串作为锚点,复用语言模型已有的数字与冒号表示;专用时间 token 分工是把同样语义换成新加的专用词表符号,需从对应数字嵌入初始化后重新学习。搭配比较的理由是两者语义相同但词表代价不同;组合对照的意义在于检验是否值得为时间单独开词表,论文报告显示专用符号需要大得多的时间数据占比才能追平纯文本。
这支持一个实用判断:复现时优先用纯文本时分秒加稀疏频率,不必为时间单独开词表。专用符号的额外词表与训练数据成本在当前证据下没有显示出可部署收益,论文也未报告其在推理延迟或解析成功率上的补偿优势。另一个细节是序列末尾的结束标记,原文明确保留,复现时不应省略,否则长录音尾部的时间参照会缺失。关于时长混合的不对称性,论文用独立矩阵显示只用短音频训练在长评测上失效,只用长音频训练则损害短音频表现,只有混合训练在各长度上最稳,这与锚点结论共同构成时间感知的两个必要条件。
哪些结论有边界,什么还没有被测量?
论文直接报告的是区间重叠与秒级误差上的提升,以及裁判打分下描述与摘要的改善,这些属于有数字支撑的范围。有限解释是稀疏锚点足够用的说法,它建立在每分钟 1 次仍能插值到 3 秒中位误差的观测上,但是否对所有语速、噪声与音乐场景成立,论文未分场景报告。未验证推测包括把曲线末端结果推广到更长输入,或把专用符号在极高数据占比下的追平视为普遍更优,这些都不应作为确定性结论。
缺失证据不是技术错误,但需要明确点出。原文未报告训练所需的硬件预算与 wall-clock 成本,也未系统测量推理延迟、输出帧率与实际跳转体验的关系,因此不能承诺该方法改善了延迟或部署成本。评测上片段描述与摘要依赖大模型裁判,裁判提示与一致性细节在补充材料中,正文只给出维度定义,复现裁判分时需注意裁判模型版本与温度会改变分数。
数据上合成监督依赖转写与对齐质量,静音过滤与语言识别阈值会改变数据分布,论文给出了阈值与保留量级,但未报告阈值扰动的敏感性。最后是可得性边界:由于本次没有完成资源可达验证,本解读对权重与数据集只转述论文的发布陈述,不做可用性承诺。
复现先做什么,需要保留哪些关键设置?
若要复现时间感知行为,建议按学习依赖顺序先做三件事。第一,复刻输入构造:把音频编码为 160 毫秒帧率的连续向量,每 60 秒插入纯文本时分秒并在末尾加结束标记,再与文本拼接送入长上下文语言模型,先在短录音上验证时间戳可解析输出。第二,复刻数据管线:从长音频经词级对齐得到带时间戳转写,按约 10 分钟切片生成问答,用完整转写做全局校验,并在音频层面划分训练评测,避免同录音泄露。第三,复刻时长混合:不要只用单一时长训练,至少覆盖短、中、长三档并按时长分桶评估重叠率与中点误差,确认混合训练的增益。
必须保留的关键超参数与信息条件包括编码器分块与步长、帧率、锚点间隔与格式、基础混合固定、切片长度、多采样聚合数与音频级划分。数据规模的起点可参考原文报告的量级变化,下表把连续原句中的规模数字整理为核对表。
| 阶段 | 数据来源与操作 | 规模 | 过滤条件 | 用途 |
|---|---|---|---|---|
| 原始分片 | YODAS2 | 24k hours | six English shards | 起点 |
| 语言过滤后 | English filtered | 16k hours after filtering | p(English) > 0.7 | 保留英文 |
| 静音过滤后 | silence-ratio filtered | 14k hours | silence-ratio thresholds | 平衡分桶 |
| 合成后 | temporal dataset | 10k+ hours | transcript slicing | 时间问答与摘要 |
该表数字全部来自原文连续句子,未做单位拆分与四舍五入。复现时若数据量不足,可先缩小桶数但保留混合原则,并如实报告与原文规模的差距。权重与数据集链接以原文为准,本次未能确认可达,复现前需自行验证链接与许可。训练时只按原文说明更新对应参数,不从名称推定冻结策略,未报告的优化器细节应明确记为缺项而不是默认常见配置。
何时值得尝试这种时间写法?
当你的应用需要用户点击答案跳转到原音频核对,例如会议纪要、播客导航与客服质检,且输入从几分钟延伸到几十分钟甚至 120 分钟时,值得尝试周期文本锚点加混合时长训练的组合。它的新增作用是把时钟写进模型可见的输入流,使输出时间戳有据可依,并用切片加全局校验解决长录音监督不足的问题。预期收益是在长桶上保持可验证的定位精度,预期代价是锚点带来的上下文开销与合成管线对转写质量的依赖。
不值得盲目尝试的情形是只有短片段事件检测需求,或已有人力逐秒标注且时长单一,此时加密锚点与混合训练的边际收益可能有限。动手前先用区间重叠与中点误差建立按时长分桶的基线,再做去掉锚点、改变频率与改变格式的 3 组对照,任何一组缺失都会让结论难以归因。最后提醒一个特有误解:纯秒数锚点看似更短更省,但论文报告其性能明显更差,省 token 不能以破坏语言模型对时间的先验表示为代价;分钟索引简写是更稳妥的压缩方向。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


