结构化预测

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

📄 DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models #语音识别 #说话人日志 #大语言模型 #多语言 #结构化预测 🔥 8.0/10 | 前25% | #说话人识别 | #大语言模型 | #语音识别 #说话人日志 | arxiv 学术质量 6.5/7 | 选题价值 1.5/2 | 复现加成 0.0 | 置信度高 👥 作者与机构第一作者：Li Li（武汉大学人工智能学院）通讯作者：Ming Li（香港中文大学（深圳））作者列表：Li Li（武汉大学人工智能学院），Ming Cheng（武汉大学计算机科学学院），Weixin Zhu（腾讯天籁音频实验室），Yannan Wang（腾讯天籁音频实验室），Juan Liu（武汉大学人工智能学院），Ming Li（香港中文大学（深圳），通讯作者） 💡 毒舌点评亮点：论文最大的贡献在于提出了一种务实的“半端到端”框架，在当前端到端大模型尚未完全称霸的阶段，巧妙地将“说话人日志”这一成熟技术的输出作为结构化提示（Prompt）注入大语言模型（LLM），实现了用更小的模型、更少的数据达到甚至超越超大模型的效果，这为实际落地提供了一条高性价比路径。短板：框架高度依赖外部说话人日志系统的质量。尽管论文通过标签扰动训练提升了一定的鲁棒性，但本质上仍是“管道式”思维的变体，未能完全摆脱对上游模块的依赖。当面临日志系统完全失效的场景时，其性能上限可能会受到制约。 🔗 开源详情代码：论文中未提及DM-ASR的完整代码仓库链接。仅在评估部分引用了公开的评估工具MeetEval。模型权重：未提及是否会公开DM-ASR的训练后模型权重。数据集：训练所用的数据集大多为公开数据集（如AMI, ICSI, Fisher, AISHELL-4, AliMeeting等），论文中未提及使用私有数据。论文未提供统一的数据获取入口或脚本。 Demo：未提及提供在线演示。复现材料：论文详细说明了训练设置，包括：使用的预训练模型：Whisper-large-v3-turbo, Gemma3-270m, Qwen3-0.6B/1.7B。微调方法：LoRA (r=16, α=32)。优化器：AdamW，峰值学习率 1e-4，线性warmup-decay。硬件与批次：8 x NVIDIA A6000 48GB GPU，每卡 batch size 2。数据处理：切片长度15-25秒，使用MFA生成词级时间戳。缺失信息：未明确总训练步数/轮数、warmup比例、具体解码参数（如beam size）、以及是否提供预训练检查点。论文中引用的开源项目： Whisper (语音编码器), Gemma, Qwen (LLM解码器), MFA (词级时间戳对齐), MeetEval (评估工具), DiariZen, S2SND (前端日志系统)。总结：论文提供了充分的复现思路和关键配置，但缺乏直接可用的“一键复现”材料（如代码仓库、模型权重），因此公开程度为中等偏上。 📌 核心摘要要解决什么问题：传统多说话人ASR（联合说话人识别、时间定位和文本转录）在级联方案中存在误差传播问题，而纯端到端大模型方案则需要海量数据和算力，训练成本高昂。论文旨在寻找一种更高效、更精确的平衡方案。方法核心：提出DM-ASR框架，将多说话人转录重构为多轮对话生成任务。给定音频和来自外部日志系统的分段说话人及时间信息，模型以这些信息为结构化提示（包含说话人ID和时间戳的特殊token），分“轮次”转录每个说话人在对应时段的文本内容。此外，模型可选地进行词级时间戳预测。与已有方法相比新在哪里：不同于级联方案：不将日志结果用于音频分割再送入单说话人ASR，而是保留完整多说话人音频上下文，让LLM直接处理混合语音。不同于端到端Speech-LLM：不依赖模型从零学习日志能力，而是显式地将日志作为结构化先验输入，大幅简化任务，使小模型也能获得高性能。独特能力：支持词级时间戳生成（如表1所示），这在同类Speech-LLM工作中较为少见。主要实验结果：在中英文基准测试上，DM-ASR用0.6B/1.7B参数的模型，性能（cpCER/tcpCER）显著优于多种强基线（包括级联方案和7B级Speech-LLM）。例如，在AliMeeting测试集上，1.7B的DM-ASR (S2SND) 取得了19.15% cpCER 和 19.45% tcpCER，优于VibeVoice-ASR (7B) 的29.33% cpCER。消融实验表明，词级时间戳、更长上下文、更多数据和更大模型均带来稳定提升。实际意义：证明了在资源受限（模型、数据）的条件下，将传统语音处理模块（日志系统）的输出作为大模型的结构化提示，是一种非常有效的多模态融合范式。为会议转录等应用提供了一套高性价比、高精度的解决方案。主要局限性：框架性能受限于前端日志系统的质量。虽然可通过训练修正不完美日志，但论文显示在完全不依赖日志提示（LLM预测全部）的设置下，性能仍有差距，说明模型本身独立完成全任务的能力有待加强。 🏗️ 模型架构 DM-ASR的整体框架如下图所示，由四个主要组件构成： ...