英文题目:SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
会议身份:
conference:aaai:2026:conference-paper-id:40745
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#会议转录 #多模态学习 #语音识别 #说话人分离标注 #说话人识别
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告
👥 作者与机构
- Han Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Yafeng Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chong Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Luyao Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chao-Hong Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Qian Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangang Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人日志与识别需从多人混合长录音直接输出带说话人归属的转写,要同时回答谁在何时说了什么,级联式先日志后识别框架存在边界误差传播、重叠语音难处理且日志与识别缺乏联合优化。首先音频编码器加投影器将长录音映射为大语言模型可读的声学token,实现声学与文本空间对齐;接着冻结的说话人嵌入提取器加线性投影将注册语音转为身份向量,并与姓名文本拼接为上下文提示,与声学token一同输入;最后指令微调后的Qwen2.5大语言模型自回归生成分行转写,无注册时输出匿名编号,有注册时输出真实姓名。四阶段渐进训练让识别预热输出进入仿真粗对齐,再经真实声学适配进入全模块联合优化。与级联基线用独立日志切分再对齐识别结果不同,该机制将注册身份向量直接作为提示参与端到端联合建模,减少了切分错误传播并保留了重叠区的声学语言协同。在AliMeeting-Eval测试集Match-Regist条件下,SpeakerLM的saCER指标为15.57,低于SA-Transformer的41.55。该结论的适用边界受限于普通话会议与车载远场语料,尚未验证英文、高重叠与流式部署下的外推能力。训练成本为在4块NVIDIA A800 GPU硬件上每个阶段训练1M步,且注册嵌入需2至10秒语音平均得到代表向量。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,为什么不能只做转写?
本文的输入是一段包含多人交替与可能重叠的连续音频,目标是直接输出带说话人归属的转写,也就是谁在何时说了什么。初学者需要先建立白话理解:说话人日志回答谁在何时说话,自动语音识别回答说了什么内容,而说话人日志与识别要求把两者对齐到同一文本中。只做转写会在会议纪要与对话系统中丢失责任主体,无法区分同一句话是谁说的;只做日志则没有内容,无法形成可读记录。论文把研究限定在普通话多说话人场景,训练与评测围绕会议室、录音室与车载等真实录音展开,教学例子是 3 人简短对话经模型后变为带名字的多行文本。
说话人日志 × 自动语音识别: 说话人日志负责把连续音频按说话人身份切分并回答谁在何时说话,自动语音识别负责把语音内容转写为文字;二者搭配的理由是真实会议需要带说话人归属的文本,组合意义是 SpeakerLM 把切分归属与内容转写放在同一个自回归生成过程中联合优化,避免先切分再对齐转写的时间错位。
为保证可复述,本文后续统一简称:说话人日志为日志,自动语音识别为识别,日志与识别联合任务为联合任务。输入侧的关键动作是把长录音切为 40 至 50 秒的片段进行训练与测试,输出侧的关键动作是按说话人分行生成文本。无注册时输出匿名编号,有注册时输出真实姓名。理解这一输入到输出的约定后,才能进入路线比较与模型结构的学习。
三条路线如何分工,级联与后校正的边界在哪里?
按同输入、同目标、同运行阶段对照,论文梳理了 3 条路线。第一条是日志加识别的级联,先用语音活动检测或神经说话人活动检测得到分段,再抽取说话人嵌入并聚类,同时用识别模块输出带时间戳文本,最后按时间对齐得到归属文本。代表性日志工具包括传统聚类路线与神经活动检测路线,识别模块在本文基线中采用在大规模数据上预训练的模型。第二条是级联加语言模型后校正,用文本大模型修正级联输出中的说话人标签错位,本文分别尝试零样本与微调两种用法。第 3 条是端到端联合建模,用统一模型同时学习日志与识别,本文属于这一路线。
下面这张图把 3 条路线的主路径与校正位置画在同一版式中,适合先建立结构记忆再读细节。
看图路径: 1. 先看三行主路径:上面两行是双分支加对齐,下面一行是单统一模型直达结果;2. 再看中间一行多出的大语言模型校正框及其虚线输入来源;3. 最后对比每行输出标注,确认只有统一行不需要显式时间戳对齐
论文图 1。原论文 Figure 1:“Comparison between three different SDR frame- works: (a) SD+ASR (b) SD+ASR+LLM and (c) E2E-SDR.”。
从图中可见,上面两行都有并行的日志分支与识别分支,区别是第二行在汇合后多了一个语言模型校正框;最下一行只有一个统一模型从波形直达结果。这 1 对比说明了后校正的边界:它只能在已有分段与转写基础上改标签,若上游边界错误或时间错位严重,后校正难以彻底修复。论文还指出另一类联合工作依赖预先抽取且与真值完全匹配的说话人嵌入,无法处理未注册或过度注册,因此提出更灵活的注册机制作为区别点。
级联系统 × 端到端说话人日志与识别: 级联系统分工是日志模块先给出带时间戳的说话人分段,识别模块再转写后按时间对齐,端到端说话人日志与识别分工是统一模型直接生成带说话人标记的转写;搭配理由是级联存在误差传递且难以处理重叠语音,组合意义在于本文用统一模型探索日志与识别的协同,让说话人与文本对齐在训练中联合学习。
级联的三个具体困难是什么,本文要改变哪个环节?
论文把级联的困难拆为 3 个可操作的环节。第一是误差传递:日志给错边界或标签后,识别侧按错误分段转写与归属,错误被放大为带说话人的文本错误。第二是重叠语音:传统语音活动检测假设单说话人分段,难以标注同一时刻多个活动说话人,而真实对话中重叠常见。第三是缺乏联合优化:日志与识别常用不同数据与框架独立训练,无法利用两者协同,例如文本语义本可帮助判断说话人切换。本文要改变的是建模环节本身,不再保留独立分段加对齐的流水线,而是让统一多模态大语言模型直接生成带说话人标记的文本。
同时本文要改变信息条件的处理方式。真实应用中说话人信息有 3 种可用程度:完全未知、恰好已知当前音频中的说话人、注册池大于实际出现人数。传统联合方法只假设第二种,本文要求同一模型能处理 3 种条件,并在冗余注册时抑制无关身份。这一定位决定了后续注册分支与 4 阶段训练的设计。
沿一个样本走完输入到输出,模型做了什么?
以一段 3 人会议音频为例,模型先把输入多说话人音频送入音频编码器得到声学表示,再经音频投影器映射到文本大模型的特征空间。若无注册,模型只看到音频词元,解码时为每个说话人分配匿名编号并逐行输出内容。若有注册,模型还会看到每个注册人的姓名词元与示例语音嵌入,解码时把音频中的声音与注册嵌入比对并输出真实姓名。输出是自回归生成的文本行,每行以说话人标记开头,后接该说话人的话语内容。
下面这张总体结构图展示了音频主路与注册支路如何汇入同一个大语言模型,读图时重点看冻结与可训练标记的分工。
看图路径: 1. 先沿底部输入多说话人音频经音频编码器与音频投影器向上的箭头看主路径;2. 再看左侧注册分支中姓名分词器与嵌入抽取加线性投影的两路汇入位置;3. 最后对照顶部无注册输出匿名编号与有注册输出真实姓名的示例差异
论文图 2。原论文 Figure 2:“Overall architecture of the proposed SpeakerLM.”。
从可见内容看,底部是输入音频经编码器与投影器向上的主路径,左侧虚线框是注册分支,其中姓名与特殊标记走冻结的文本分词器,注册语音走冻结的嵌入抽取器再经线性投影器,顶部是大语言模型按低秩适配方式微调。图中顶部示例明确区分了无注册输出匿名编号与有注册输出真实姓名的两种目标格式。这一设计把声学理解、身份比对与文本生成放在 1 次解码中完成,是理解后续公式与训练阶段的基础。
编码器、投影器与注册分支各自负责什么计算?
组件按原文可分为四部分。音频编码器用预训练的语音编码器初始化,负责提供多语种识别与音频事件理解所需的稳健表示;音频投影器用随机初始化的两层变换器加一层卷积做维度对齐,负责把连续声学特征变为大语言模型可接受的词元序列。嵌入抽取与投影分支用开源说话人嵌入模型抽取区分性表示,再用单层线性层做维度对齐;注册姓名与起始结束标记走冻结分词器。大语言模型主干采用预训练的指令模型,负责在给定音频词元与注册词元条件下生成归属文本。
音频编码器 × 大语言模型: 音频编码器分工是把多说话人音频变为连续声学表示,投影器负责维度与模态对齐,大语言模型分工是按指令生成带说话人标记的文本;搭配理由是预训练语言模型有较强的指令跟随与上下文推理能力,组合意义是轻量对齐让声学证据与注册说话人信息以词元形式进入同一解码空间。
注册机制用真值说话人数与注册人数的关系定义 3 种条件,无注册对应注册数为零,精确匹配对应注册数等于真值人数,过度注册对应注册数等于真值人数加冗余人数。训练时过度注册的冗余人数在 1 至 50 之间均匀采样,测试时进一步考察更大冗余区间的稳定性。评估无注册总体误差时需要经最小编辑距离搜索最优标签置换,有注册时按姓名直接对齐。增量指标的定义是总体误差减去纯识别误差,原文明确给出连接最小置换误差的增量形式。
\[∆cp = cpCER −CER\]上式中连接最小置换字错率是内容加归属的总体误差,字错率是忽略说话人身份的纯识别误差,两者之差反映因归属错误带来的下降,可作为日志能力的度量。类似地,有注册条件下的说话人归属误差减去纯识别误差得到另一增量。
下面这张图用同一段真值演示 3 种注册的输入与期望输出,适合固定标记格式的记忆。
看图路径: 1. 先看顶部同一段真值对应三种注册输入的人像数量差异;2. 再看每种条件下模型输出的说话人标记是匿名编号还是真实姓名;3. 最后确认冗余注册条件下模型仍只输出实际出现的说话人
论文图 3。原论文 Figure 3:“Overview of the proposed three different speaker registration mechanisms: (a) No-Regist (no speaker regis- tration) (b) Match-Regist (exact actual speakers in the audio are…”。
从可见内容看,左侧无注册输入只有音频并输出匿名编号,中间精确匹配输入音频加恰好 3 人注册并输出对应姓名,右侧过度注册输入音频加 6 人注册但仍只输出实际 3 人。图注说明匹配与过度注册时注册顺序随机,这要求模型不能依赖注册顺序猜答案。
说话人注册 × 说话人嵌入: 说话人注册分工是提供已知说话人的姓名与示例语音作为先验,说话人嵌入分工是用冻结的说话人模型把示例语音压缩为可区分身份的向量;搭配理由是真实场景中已知用户与匿名会议并存且注册人数可能多于实际人数,组合意义是嵌入经线性投影后与音频词元拼接,使模型在解码时做名字关联或抑制冗余身份。
四阶段训练按什么顺序冻结与更新,数据如何构造?
训练按 4 个阶段渐进展开,每阶段训练 1,000,000 步。第一阶段只用识别数据训练得到识别起点模型,采用低秩适配方式调整大语言模型以保留预训练语言能力,采样 600,000 小时公开识别音频,此时不包含说话人嵌入抽取器与投影器。第二阶段用仿真联合数据训练随机初始化的投影器,同时冻结大语言模型与音频编码器,目标是快速建立音频与文本在联合任务上的粗对齐。
仿真方法是把近场语音随机拼接为 50 秒、含 2 至 4 人的片段,并按 10 分贝至 20 分贝信噪比加入真实噪声与混响。第三阶段用真实联合数据联合微调音频编码器与投影器,同时冻结大语言模型,以适应真实声学与说话人多样性。第 4 阶段联合微调全部模块并对大语言模型应用低秩适配,实现语言与声学信息的联合优化。
优化器用 AdamW,学习率先从 1e-5 线性热身至 5e-5 再按余弦衰减,采用按长度动态组批且最大词元限制为 6K,在 4 张显卡上训练。注册语音在实现上切为 2 至 10 秒片段抽取嵌入再平均为单个代表向量。原文给出了训练伪代码与提示词位置,但本次证据未包含具体提示文本,因此复现时提示词是缺项,需要回到原文代码页核对。仿真数据总量为训练 5000 小时与评测 5.6 小时,真实数据还包含大量自有录音室数据与公开会议数据。
在哪些数据与指标下比较,公平条件是什么?
评测围绕普通话会议与车载场景组织。域内测试为会议室远场第一通道的公开会议集,域外测试为车载混合噪声下的公开集,另有仿真测试用于观察阶段变化。基线分两类:4 套日志加识别级联,共享同一识别模块而日志模块分别采用不同开源工具;3 套级联加语言模型后校正,以最强级联为前端分别做零样本与微调校正。本文方法作为统一端到端模型只用一个模型完成全部任务。指标方向均为越低越好,其中纯识别误差忽略说话人,总体误差同时考核内容与归属,增量反映归属误差。
连接最小置换字错率 × 说话人归属字错率: 连接最小置换字错率分工是在无注册时经说话人标签最优置换后衡量内容加归属的总体误差,说话人归属字错率分工是在有注册时按姓名直接对齐衡量总体误差;搭配理由是两种信息条件下是否允许置换搜索不同,组合意义是再减去纯识别字错率得到增量即可分离出归属误差,便于判断提升来自识别还是日志。
下面这张表把训练数据规模与仿真构造的关键数量放在同一版式中,便于核对数据依赖,指标单位按原文保留小时与信噪比写法。
| 训练阶段 | 数据来源 | 数据量 | 音频构造 | 模型状态 |
|---|---|---|---|---|
| 第一阶段识别起点 | 公开识别音频 | 600,000 hours | 长片段统一采样 | 低秩适配语言模型 |
| 第二阶段仿真对齐 | 近场语音随机混合 | 5,000 hours | 50 秒含 2 至 4 人 | 冻结编码器与语言模型 |
| 第二阶段仿真评测 | 仿真测试划分 | 5.6 hours | 同仿真流程 | 仅评测投影器对齐 |
| 后续联合训练 | 公开加自有联合数据 | 212.25 hours 至 7,638.95 hours | 40 至 50 秒真实片段 | 渐进解冻至全量微调 |
| 过度注册采样 | 注册示例语音 | 冗余 1 至 50 人 | 2 至 10 秒分段平均 | 冻结嵌入抽取器 |
上表说明数据规模是本文最强的解释变量,从 200 余小时到 7000 余小时的跨度决定了结论是否成立;仿真只做简单拼接而不建模强噪声与混响,因此第二阶段后在部分真实集上出现失配是可预期的。原文明确给出另一增量的计算形式,便于区分有注册与无注册的归属误差。
\[∆sa = saCER −CER\]上式中说话人归属字错率是有注册时的总体误差,纯识别误差含义不变,两者之差同样用于分离归属误差。公平性上需注意识别起点模型用了更大识别数据因而纯识别误差天然更低,但增量不受识别性能影响,更适合比较归属能力。
数据规模扩大后,主结果与域外表现如何变化?
无注册条件下的比较显示,4 个级联中结合预训练声学特征的日志工具加识别表现最好;两个零样本语言模型校正反而明显恶化总体与纯识别误差,原因是模型不只改标签还改写了话语内容,微调后幻觉减轻并略超最强级联。本文统一模型在仅 200 余小时联合数据时落后多数级联,但随数据增至 7000 余小时,总体误差与增量持续下降,而纯识别误差改善较小,原文解释是自有数据多为近场录音,对远场混响识别增益有限。在最大数据量下,统一模型在 3 个公开测试集的总体误差上均明显优于最强级联,域外车载集的增量降至不足 1 个百分点,报告显示模型对未见噪声环境有较强泛化。
下面这张 4 阶段曲线图展示了从识别起点到联合微调的完整变化,重点是第二阶段的失配与后 2 阶段的恢复。
看图路径: 1. 先确认四个子图分别对应两个域内集、一个域外集与一个仿真集;2. 再看每子图内三条曲线随第一至第四阶段的变化方向;3. 最后重点观察第二阶段在部分数据集上识别误差抬升而后续阶段回落的转折
论文图 4。原论文 Figure 4:“The performance of SpeakerLM on test sets under No-Regist condition across different training stages.”。
从可见内容看,4 个子图横轴均为第一至第 4 个阶段,纵轴为百分比指标,3 条曲线分别对应纯识别误差、总体误差与增量。在会议与仿真集上 3 条曲线总体下行,在另两个真实集上第二阶段纯识别误差高于第一阶段,原文归因是仿真未包含这 2 个数据集的音频因而存在域失配,第三与第 4 阶段用真实会议数据微调后显著缓解。这一形态支持多阶段策略的必要性,也提醒不能把末步结果推广为每阶段都单调改进。
下面这张表把可直接复述的关键收益与注册条件放在同一版式中,数值保留原文百分比写法,比较对象均为原文实际可运行的策略。
| 评测条件 | 指标 | 最强级联参照 | 本文方法收益 | 注册冗余 |
|---|---|---|---|---|
| 会议域内无注册 | 总体误差改进 | 最强级联为基准 | 6.60% | 无注册 |
| 会议域内无注册 | 总体误差改进 | 最强级联为基准 | 6.56% | 无注册 |
| 车载域外无注册 | 总体误差改进 | 最强级联为基准 | 13.82% | 无注册 |
| 会议有注册 | 归属总体误差改进 | 联合基线为参照 | 25.98% | 精确匹配 |
| 训练过度注册 | 冗余人数范围 | 级联不适用 | 1 至 50 人均匀采样 | 过度注册 |
上表的主要收益是统一模型在大规模数据下同时改善域内与域外总体误差,且在有注册时大幅优于需要精确匹配嵌入的联合基线;具体代价是小数据下统一模型落后级联,且仿真阶段会暂时抬高部分真实集的纯识别误差。未胜出项是零样本大模型校正,它在 3 个测试集上均未带来可用增益,这是重要的负结果。
注册冗余与嵌入模型改变时,哪些结论仍然成立?
有注册对比显示,精确匹配与过度注册在纯识别与总体误差上接近,但归属增量在精确匹配下 consistently 更低,说明冗余注册引入了不必要信息并轻微影响归属。对冗余人数的进一步考察把测试冗余从 1 至 10 人扩展到 90 至 100 人,未观察到随冗余增加而显著退化,报告支持模型能聚焦相关说话人表示并抑制无关身份。嵌入抽取器的对照把默认模型替换为另一说话人嵌入模型后训练与测试,在无注册、有注册与过度注册下默认模型的总体与归属误差均更优,支持嵌入模型在说话人验证上的优势可以传递到联合任务。
下面这张原表整理了同一会议评测集上两种嵌入抽取器的直接对比,行身份为不同注册模式与抽取器的组合,数值保留原文小数精度。
| ERes2NetV2 outperforms | the variant with CAM++, | indicat- |
|---|---|---|
| CAM++ | 14.63 | 16.74 |
| ERes2NetV2 | 13.97 | 16.05 |
| CAM++ | 14.74 | 17.23 |
| ERes2NetV2 | 13.98 | 15.57 |
| CAM++ | 14.71 | 16.92 |
| ERes2NetV2 | 13.96 | 15.71 |
上表的主要信息是嵌入质量是可替换的增益来源而非决定成败的唯一因素,默认嵌入在 3 种注册模式下均保持领先;具体代价是更换嵌入需要重新训练与测试,不能直接混用不同嵌入的向量。未评测边界是冗余人数超过 100 人或注册语音质量显著下降时的稳定性,原文未给出这部分测量,因此不能承诺更大注册池下同样平稳。
哪些验证缺失,哪些推论不能从现有证据得出?
从证据完整性看,资源状态是本次未能确认可达之外的唯一依据,证据清单中未发现完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开或当前可用,复现前必须回到原文链接逐一确认。训练成本只报告了显卡数量、步数与验证间隔,未报告总时长、显存占用与推理延迟,总体趋势不等于每步都高效,不能从训练规模推定实际延迟得到改善。指标均为自动字错率类度量,未测量人工可懂度与说话人误判率的细分布,相关性不是因果,不能把自动指标直接当作人工评价。
从适用条件看,实验限定普通话会议与车载场景,尚待验证的是英语或其他语言、更强混响与更多说话人数下的表现。仿真构造明确说明未建模很强噪声与混响,且第二阶段在部分真实集上出现纯识别误差上升,这可能待验证是否会随仿真真实度提升而缓解。过度注册训练只覆盖 1 至 50 人,测试扩展到更大区间虽平稳,但更大注册池与注册语音不足时的边界仍未测量,不宜推广为任意规模都成立。
要复现最小可运行版本,先做什么、保留什么?
复现应先固定信息条件与数据划分:确认无注册、精确匹配与过度注册 3 种输入格式,固定远场第一通道与 40 至 50 秒切分,注册示例语音按 2 至 10 秒分段平均,并保留冗余人数在训练时 1 至 50 均匀采样的设置。模型侧保留原文组件选择与冻结关系:音频编码器与投影器、冻结的嵌入抽取器与分词器、单层线性投影,以及 4 阶段从识别起点到投影器对齐再到真实数据微调的顺序。优化侧保留学习率热身与余弦衰减、动态组批与最大词元限制等关键超参数。
评测侧先复现无注册的纯识别误差、总体误差与增量,再复现有注册的归属总体误差与增量,比较时保留原文实际可运行的级联与微调校正基线,搜索最优或事后最优值只能另行标注,不能代替可部署收益。由于本次证据未包含训练伪代码与提示词全文,复现前必须回到原文代码页核对具体提示模板与数据混合比例,避免从模型名称推定实现细节。
何时值得尝试这种统一方案,何时仍用级联?
当任务需要直接输出带说话人归属的文本、存在重叠语音且能提供数千小时联合数据时,值得尝试统一多模态方案,因为它把归属与转写放在 1 次解码中联合优化,并在域外噪声集上显示出较强的泛化。当只有 200 余小时联合数据、无法承担大语言模型微调成本,或应用必须保留显式时间戳分段供下游对齐时,仍可先用最强级联加微调校正,因为小数据下级联更稳且模块可独立调试。当已知用户需要个性化姓名输出且注册池大于实际人数时,可采用本文的注册分支并重点验证冗余抑制;当注册语音质量不可控时,需先补测嵌入质量与冗余规模的边界再上线。
对刚入门的研究生而言,可复述的方法链是:输入长音频切分后经编码器与投影器进入大语言模型,按注册条件拼接姓名与嵌入词元,自回归生成带标记文本;训练按识别起点、仿真对齐、真实适配、全量联合 4 步推进;评测用总体误差与增量分离识别与归属,并始终保留未胜出的零样本校正与小数据落后的反例作为适用条件的提醒。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



