VibeVoice-ASR-Streaming Technical Report

📄 边听边分清谁在说:把长历史留下来做说话人归属 英文题目:VibeVoice-ASR-Streaming Technical Report 一句话:针对流式会议转录要同时低延迟输出文字与说话人标签的难题,论文把固定块加前视与历史交错放入单一自回归上下文,用 7B 模型在五集合均值与 12 个归属设置上取得最优,代价是 8 分钟上限与首包更慢。 标签:#语音识别 | #语音大模型 | #说话人日志 | #流式处理 | #会议转录 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yujie Tu:University of Chinese Academy of Sciences Zhiliang Peng:Microsoft Research Jianwei Yu:Microsoft Research Li Dong:Microsoft Research Songchen Xu:Shanghai Jiao Tong University Yaoyao Chang:Microsoft Research Wenhui Wang:Microsoft Research Zilong Wang:Microsoft Research Zehua Wang:Microsoft Research Yan Xia:Microsoft Research Jiajun Zhang:University of Chinese Academy of Sciences Xie Chen:Shanghai Jiao Tong University Furu Wei:Microsoft Research 💬 毒舌点评 把长历史保留在自回归上下文里来固定说话人身份是漂亮而务实的选择,云端对比的延迟与代价测量也难得诚实。但序列化单流输出对长时重叠的妥协、八分钟上限与首包延迟问题让实时声称打了折,技术报告仍更像强工程而非范式突破。 ...

2026-09-03 · 更新于 2026-09-04 · 2 min · 294 words

Soft Posterior Speaker Injection for Multi-Talker Speech Recognition

📄 不做硬切分:用连续说话人占比给 Whisper 注入重叠感知 英文题目:Soft Posterior Speaker Injection for Multi-Talker Speech Recognition 一句话:针对重叠语音下硬切分会不可逆截断语音的问题,论文用混合归一化的连续说话人占比通过多层 FiLM 与解码器记忆提示注入 Whisper,在受控双说话人合成集上相对同骨干 SOT 降低 1.1 个点 cpWER 且在高重叠区间增益更大,但在 LibriCSS 零样本上与基线持平、仅靠冻结后验的重叠富集适配才拉开差距,代价是两遍编码的推理开销。 标签:#语音识别 | #语音大模型 | #说话人日志 评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Jian Zhu:机构信息未在 arXiv HTML 中可靠披露 Cheng Luo:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用连续的混合归一化说话人占比代替硬切分,通过多层特征线性调制(Feature-wise Linear Modulation,FiLM)与解码器记忆提示的互补注入,在可控重叠上做出统计显著的小幅提升并设计了冻结后验的域迁移策略。短板是核心增益仅 1.1 个点且依赖合成数据的能量比软标签与两遍编码,零样本在真实 LibriCSS 上与基线持平,整体仍是 Whisper-medium 上的精巧插件而非可扩展的多说话人范式。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1467 words

HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding

📄 听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音 英文题目:HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding 一句话:针对多说话人场景下语音模型靠语义先验猜测谁说了什么的问题,论文以 Erber 听觉层级构建 HEAR 诊断基准与声纹交换的 CASH 硬负样本,并用转录优先的 GRPO 训练 A2R,在配对评估与三项零样本迁移上显著提升声学接地,代价是显式转录带来的延迟与合成分布局限。 标签:#说话人日志 #强化学习 #语音识别 #音频理解 #基准测试 评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Dongwook Lee:IPAI, Seoul National University (SNU) Sangkwon Park:Department of ECE, SNU Eunwoo Song:Department of EE, Yonsei University Che Hyun Lee:Department of ECE, SNU Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Junho Kim:机构信息未在 arXiv HTML 中可靠披露 June Young Yi:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用反事实语音克隆把语义先验与声学身份彻底解耦,配上配对评估让依赖文本捷径的模型无处遁形,诊断非常犀利。短板是 CASH 完全依赖合成语音构建 hard negative,且仅在 Qwen3-Omni 单一基座上验证 GRPO 收益,对真实声学多样性和架构泛化性的说服力仍显单薄。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1590 words

Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior

📄 当发言意愿也需要先验:用 Beta 倾向补全多通道日志的贝叶斯闭环 英文题目:Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior 一句话:针对远场会议中重叠与混响导致日志不稳的问题,论文把二值活动掩码改写为带 Beta 先验的连续发言倾向,利用共轭性得到日志分支的闭式 ELBO 并以 PERT 重参数化训练,在 AMI 上将 Full 口径 DER 从 18.73% 降至 15.31%,代价是仅在单数据集验证且未评估分离质量。 标签:#说话人日志 #变分自编码器 #语音分离 #多通道 评分:6.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5 👥 作者与机构 Sicheng Mao:机构信息未在 arXiv HTML 中可靠披露 Mathieu Fontaine:机构信息未在 arXiv HTML 中可靠披露 Anthony Larcher:机构信息未在 arXiv HTML 中可靠披露 Roland Badeau:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把原本用二元交叉熵硬监督的说话人活动分数替换为带 Beta 先验的变分下界,利用共轭性得到闭式 KL 与期望,对 Neural FCASA 的贝叶斯化补上了最后一块拼图且仅增加 257 个参数。短板是验证仅局限于 AMI 单一语料、未报告分离质量、未与近年的多通道端到端日志模型做公平对比,所谓 16% 相对提升的泛化性仍存疑。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1659 words

TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

📄 给声音装上刻度:TEMPO 如何让大音频语言模型学会报时 英文题目:TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models 一句话:针对大音频语言模型只会整段描述、不会精确报时的问题,TEMPO 用原子时间戳、墙钟投影与高斯软标签的三件套监督微调加可验证奖励的 GRPO 精炼,在五项时序任务上把多说话人 ASR 的 WER 从 69.7% 压到 43.5%,代价是 0.1 秒固定分辨率与合成音乐主导的训练分布。 标签:#音频事件检测 #后训练 #说话人日志 #强化学习 评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5 👥 作者与机构 Apoorva Kulkarni:University of Maryland, College Park, USA Kaousheik Jayakumar:University of Maryland, College Park, USA Sreyan Ghosh:University of Maryland, College Park, USA Utathya Aich:University of Maryland, College Park, USA Ramani Duraiswami:University of Maryland, College Park, USA Dinesh Manocha:University of Maryland, College Park, USA 💬 毒舌点评 把原子时间戳、分时墙钟投影和高斯软标签打包成可复用的后训练配方,并在5个跨域任务上用单一解码器打通,SFT阶段25个点的WER下降是硬核说服力;短板是GRPO在4个任务上仅0.8至1.4个点的边际精炼却包装成首个统一强化学习,音乐分支困在合成Slakh2100且和弦F1仅6.2%,0.1秒固定分辨率与冻结Whisper-large前端的根本瓶颈并未触及,离专用系统31.4% WER与19.6% DER仍有明显差距。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1816 words

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

📄 DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios 标签:#语音识别 #语音大模型 #说话人日志 #强化学习 #长音频处理 7.3/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #语音大模型 | #说话人日志 #强化学习 | arxiv 👥 作者与机构 第一作者:Bingshen Mu(Audio, Speech and Language Processing Group (ASLP@NPU), School of Computer Science, Northwestern Polytechnical University, Xi’an, China) 通讯作者:正文未明确标注 作者列表:Bingshen Mu、Xian Shi、Xiong Wang、Zhifang Guo、Ting He、Xize Cheng、Yu Xi、Jin Xu、Lei Xie(机构:Audio, Speech and Language Processing Group (ASLP@NPU), School of Computer Science, Northwestern Polytechnical University, Xi’an, China;Independent Researcher) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 451 words

Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation

📄 Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation 标签:#语音情感识别 #自监督学习 #多任务学习 #说话人日志 8.4/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.4/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #自监督学习 | #多任务学习 #说话人日志 | arxiv 👥 作者与机构 第一作者:Guan-Hua Wen(Department of Computer Science and Information Engineering / Graduate Institute of Digital Learning and Education, National Taiwan University of Science and Technology, Taipei, Taiwan) 通讯作者:正文未明确标注 作者列表:Guan-Hua Wen、Kuan-Yu Chen、Hou-Chiang Tseng(机构:Department of Computer Science and Information Engineering;Graduate Institute of Digital Learning and Education, National Taiwan University of Science and Technology, Taipei, Taiwan) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 555 words

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

📄 Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction 标签:#语音识别 #模型融合 #语音分离 #说话人日志 #会议转录 7.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #模型融合 | #语音分离 #说话人日志 | arxiv 👥 作者与机构 第一作者:Hermann Yepdjio Nkouanga(Portland State University, USA) 通讯作者:正文未明确标注 作者列表:Hermann Yepdjio Nkouanga、Minwei Luo、Maggie Wigness、Suresh Singh(机构:Portland State University, USA;US Army Research Laboratory, USA) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 541 words

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

📄 Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations 标签:#音视频理解 #图神经网络 #说话人日志 #医疗音频 8.9/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频理解 | #图神经网络 | #说话人日志 #医疗音频 | arxiv 👥 作者与机构 第一作者:Vincenzo Marco De Luca(University of Trento, Trento, Italy) 通讯作者:正文未明确标注 作者列表:Vincenzo Marco De Luca、Antonio Longa、Andrea Passerini(机构:University of Trento, Italy;UiT the Arctic University of Norway, Norway) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 319 words

Target Speaker Identification: A Low-Latency Streaming Pipeline

📄 Target Speaker Identification: A Low-Latency Streaming Pipeline 标签:#说话人验证 #说话人日志 #预训练 #流式处理 #助听器 5.6/10 | 创新 0.9/2 | 严谨 0.9/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 📝 5.6/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #说话人验证 | #预训练 | #说话人日志 #流式处理 | arxiv 👥 作者与机构 第一作者:Patrick S. Burke(Children’s National Hospital) 通讯作者:未说明 作者列表:Patrick S. Burke(Children’s National Hospital)、Satyam Raj(Arizona State University)、Sean Kinahan(Arizona State University) 💡 毒舌点评 这是一份把 Pyannote、Diart、TitaNet 等现成工具干净地串成助听器可用控制链的工程化报告,把识别控制信号与音频播放路径解耦的想法对实际落地很务实;但全篇只注册并评估了一位目标说话人、调参只用了一集数据,就号称“低延迟”却给出 1 秒端到端延迟,证据厚度撑不起一个扎实的系统级结论。更挑剔地看,基线对比与 Diart 超参调参都只用了一集数据,每集仅跑一次、没有任何重复实验或显著性检验;数据又相对干净、缺少重叠语音与背景噪声,噪声下的性能衰减被作者自己承认。「低延迟」的宣称与一秒端到端识别延迟之间的张力,对快速轮替对话场景是实打实的短板。 ...

2026-08-19 · 更新于 2026-09-04 · 4 min · 689 words