DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

📄 DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech 标签:#语音合成 #语音大模型 #语音识别 #说话人日志 #数据集 6.1/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #语音大模型 | #语音识别 #说话人日志 | arxiv 👥 作者与机构 第一作者:Pengcheng Wang(Department of Information and Communications Engineering, Institute of Science Tokyo, Yokohama, Japan) 通讯作者:未说明 作者列表:Pengcheng Wang(Department of Information and Communications Engineering, Institute of Science Tokyo, Yokohama, Japan)、Sheng Li(Department of Information and Communications Engineering, Institute of Science Tokyo, Yokohama, Japan)、Jiyi Li(Hokkaido University, Hokkaido, Japan)、Takahiro Shinozaki(Department of Information and Communications Engineering, Institute of Science Tokyo, Yokohama, Japan) 💡 毒舌点评 亮点是把对话内容、交互时序与声学渲染拆成三个责任边界明确的阶段,并用 script-constrained duplex decoding 把“说什么”锁死、“何时说”留给两个互听模型,确实在 FTO 分布上显著优于两个不会产生 overlap 的拼接基线。但缺点同样明显:所谓 emergent timing 仍被 handoff window、max_padding、bc_refractory 三个旋钮和“仅限话轮转换区”的重叠约束限制,宏观动态不是完全涌现;论文又没有公开任何代码、权重或数据集访问方式,声明的 released benchmark 无法被审稿人核查。综合看,是一篇中规中矩、证据覆盖面不错但离完整资源贡献仍有距离的工作。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 789 words

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

📄 Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge 标签:#说话人日志 #参数高效微调 #语音识别 #音频理解 #多语言 6.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #说话人日志 | #LoRA | #参数高效微调 #语音识别 | arxiv 👥 作者与机构 第一作者:Kexin Shi(Ant Group,依据邮箱与第一作者位置) 通讯作者:未说明 作者列表:Kexin Shi、Renhe Sun、Yuge Huang、Ximeng Wang、Jiayi Zhou、Jian Liu、Malu Zhang 机构说明:论文标注“1 Ant Group, 2 UESTC”,但未逐一匹配作者与单位;从邮箱可确认 Kexin Shi 与 Renhe Sun 属于 Ant Group。论文脚注标注“These authors contributed equally to this work”,但作者列表中未用具体符号标出共同一作对象。 💡 毒舌点评 这套系统报告胜在两条任务链路都闭环,消融数字清楚,尤其静音反事实过滤是聪明的数据清洗策略。但整体仍像挑战赛工程笔记:没有外部基线、没有跨语言/时长拆解,也不公开代码、权重或合成数据;作为系统报告,推理延迟、峰值显存、单条数据处理成本等工程指标同样缺失,使其参考价值更多停留在“战术说明”层面。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 752 words

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

📄 Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning 标签:#音频事件检测 #参数高效微调 #说话人日志 #自监督学习 #Transformer 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #LoRA | #参数高效微调 #说话人日志 | arxiv 👥 作者与机构 Xulin Fan:University of Illinois Urbana-Champaign, USA Jialu Li:University of Arizona, USA Mohammad Nur Hossain Khan:Worcester Polytechnic Institute, USA Kexin Hu:University of Illinois Urbana-Champaign, USA Bashima Islam:Worcester Polytechnic Institute, USA Mark Hasegawa-Johnson:University of Illinois Urbana-Champaign, USA Nancy L. McElwain:University of Illinois Urbana-Champaign, USA 通讯作者:论文未明确标注通讯作者;作者邮箱在论文中列出,但未说明通讯作者身份。 ...

2026-08-13 · 更新于 2026-09-04 · 4 min · 766 words

Speaker Role and Language Diarization for Analyzing Multilingual Interviews for Language Proficiency of Older Adults

📄 Speaker Role and Language Diarization for Analyzing Multilingual Interviews for Language Proficiency of Older Adults 标签:#说话人日志 #语音大模型 #参数高效微调 #多语言 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #说话人日志 | #语音大模型 | #参数高效微调 #多语言 | arxiv 👥 作者与机构 第一作者:Anfeng Xu(南加州大学 Viterbi 工程学院) 通讯作者:Anfeng Xu(南加州大学 Viterbi 工程学院;邮箱 anfengxu@usc.edu;主页 https://anfengxu136.github.io/) 全部作者:Anfeng Xu、Tiantian Feng、Kevin Huang、Sudarsana Kadiri、Shrikanth Narayanan(南加州大学 Viterbi 工程学院);Pranali Khobragade、Anushikha Dhankhar、Sarah Gao、Jinkook Lee(南加州大学经济与社会研究中心);Madeleine Snider、Miguel Arce Rentería(哥伦比亚大学欧文医学中心) 💡 毒舌点评 该文把说话人角色日志、语言日志和熟练度评估串成一条面向印度多语言老年访谈的自动分析流水线,数据来自真实 LASI-DAD 项目,方向务实。但语言日志的绝对性能仍然偏低,最佳自动 VAD 条件下语言混淆率约 25%,且系统只与 Whisper-Original 做内部对比,没有与 Pyannote、ariZen 等现有日志系统、也没有与已有口语熟练度评估系统进行外部比较,实验说服力受限。若能把 Telugu 标注一致性问题解决,并公开标注协议和代码,该工作的参考价值会明显提升。 ...

2026-08-11 · 更新于 2026-09-04 · 3 min · 632 words

A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States

📄 A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States 标签:#说话人日志 #大语言模型 #音频分类 #数据集 #领域适应 8.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #说话人日志 | #大语言模型 | #音频分类 #数据集 | arxiv 👥 作者与机构 第一作者:Samuel Bestvater (Pew Research Center) 通讯作者:labsinfo@pewresearch.org (未具名) 作者列表: Samuel Bestvater (Pew Research Center) Athena Chapekis (Pew Research Center) Skyler Seets (Pew Research Center) Anna Lieb (Pew Research Center) Sono Shah (Pew Research Center) Aaron Smith (Pew Research Center) 💡 毒舌点评 这篇论文提供了一个在社会科学与语音处理交叉领域极具价值的大规模语料库,其工程完整度和数据透明度值得称赞,填补了宗教广播内容自动化分析的数据空白。然而,作为一篇面向顶会的数据集论文,其技术新颖性几乎为零——核心流水线是纯工程集成,且仅用一个月的数据快照能否代表长周期的内容生态存疑,这使得其短期的数据时效性成为一个显著的硬伤。 ...

2026-07-30 · 更新于 2026-09-04 · 2 min · 312 words

Towards Operational Conversational Intelligence: A Speech Intelligence Framework

📄 Towards Operational Conversational Intelligence: A Speech Intelligence Framework 标签:#说话人日志 #模型集成 #语音识别 #语音增强 #语音活动检测 6.4/10 | 创新 1/2 | 严谨 1.5/1.5 | 实验 0.5/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 ✅ 6.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #说话人日志 | #模型集成 | #语音识别 #语音增强 | arxiv 👥 作者与机构 第一作者:C. Vishnoi(Indian Institute of Technology Kanpur;实习于 EXL) 通讯作者:未说明 作者列表:C. Vishnoi(Indian Institute of Technology Kanpur, EXL)、S. Khurana(EXL)、A. Timmapur(EXL)、S. Rai(EXL)、S. Mohanty(EXL) 💡 毒舌点评 本文敏锐地捕捉到“增强陷阱”(Enhancement Trap)这一有价值的工程洞察——即语音增强对ASR和说话人日志有相反的效果——并以此为基础设计了模块化的双路径流水线架构。概率引导的VAD切分策略也展现了在系统集成层面的巧思。然而,评估仅基于作者自建的、仅含8条录音(总计31分钟)且声学场景混杂(包含演播室录音)的极小数据集,无任何公开基准对比,且完全闭源,导致其宣称的“统一框架”价值难以被量化和复现,使得核心贡献停留在工程经验报告层面,科学严谨性严重不足。 ...

2026-07-29 · 更新于 2026-09-04 · 2 min · 313 words

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

📄 Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages 标签:#说话人日志 #模型评估 #语音识别 #基准测试 #多语言 7.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.1/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #说话人日志 | #模型评估 | #语音识别 #基准测试 | arxiv 👥 作者与机构 第一作者:Deovrat Mehendale(Sarvam AI, AI4Bharat, IIT Madras) 通讯作者:未明确标注(论文使用公共邮箱 deovrat.mehendale@gmail.com, adityam0309@gmail.com, dhruvsubhashrathi@gmail.com) 作者列表:Deovrat Mehendale(Sarvam AI, AI4Bharat, IIT Madras)、Aditya Mehndiratta(Sarvam AI, AI4Bharat, IIT Madras,以公共邮箱标注)、Dhruv Rathi(Sarvam AI, AI4Bharat, IIT Madras,以公共邮箱标注)、Kaushal Bhogale(Sarvam AI)、Mitesh M. Khapra(Sarvam AI, AI4Bharat, IIT Madras) 💡 毒舌点评 亮点:首次全面覆盖印度宪法承认的全部 22 种语言的多说话人 ASR+diarization 联合基准,108 小时的三场景(近场/远场/野外)数据填补了一个明确的生态空白;联合评估 cpWER/WDER 的实验设计比传统 decoupled 评估更贴近生产实际;code-mixing 感知的双重转写协议是印度语言 ASR 评估中实际而长期被忽略的痛点。 ...

2026-07-28 · 更新于 2026-09-04 · 5 min · 1037 words

Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding

📄 Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding 标签:#语音识别 #强化学习 #参数高效微调 #多模态模型 #说话人日志 6.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #强化学习 | #参数高效微调 #多模态模型 | arxiv 👥 作者与机构 第一作者:Pengfei Zhang(机构标为¹,未注明具体名称) 通讯作者:Li Liu(机构标为¹,未注明具体名称) 作者列表:Pengfei Zhang¹、Biao Tian²、Tianxin Xie¹、Minghao Yang¹、Xiangang Li²、Li Liu¹(通讯作者) 注:原文以脚注¹和²标注作者隶属关系,但脚注中未给出机构全称,所有机构均为"未说明" 💡 毒舌点评 论文用一句"Listen, Do Not Copy"干净地暴露了全模态模型在文本线索面前的感知绕过捷径——沉默测试这招虽不复杂但直击要害,迫使研究者正视"高分不等于好听力"的尴尬。然而AGSC的内部化收益呈现出明显的马太效应:弱模型Ming狂降56个百分点,最强Qwen3仅降16点且全链训练中CI包含零,让"通用解决方案"的说服力打了折扣。全链强化训练下门控频繁崩溃、靠额外SFT步骤恢复的应急方案更像工程补丁而非理论突破,离生产级鲁棒仍有一段路。 ...

2026-07-27 · 更新于 2026-09-04 · 3 min · 451 words

What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio

📄 What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio 标签:#会议转录 #端到端 #语音识别 #说话人日志 #音频理解 4.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 📝 4.8/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #端到端 | #会议转录 #说话人日志 | arxiv 👥 作者与机构 第一作者:Cheng Siong Chin 通讯作者:Cheng Siong Chin 作者列表:Cheng Siong Chin(纽卡斯尔大学新加坡分校,科学、农业与工程学院)、Jianhua Zhang(青岛理工大学,信息与控制工程学院)、Mohan Venkateshkumar(Amrita Vishwa Vidyapeetham,Amrita工程技术学院,电气与电子工程系) 💡 毒舌点评 论文提出了一个具有实用价值的“透明第一”设计框架,并在工程上集成了一个完整的语音音频分析原型。然而,作为一篇顶会水平的研究论文,它最致命的缺陷在于几乎没有提供任何支撑其系统能力声明的实验验证。它更像一份详尽的产品设计文档或系统说明书,而非一篇经过严格实验检验的研究工作。审稿人无法评估其转录质量、日志准确性或任何声称功能的实际效果,这极大地削弱了其作为学术论文的可信度和影响力。 ...

2026-07-22 · 更新于 2026-09-04 · 2 min · 237 words

The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026

📄 The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026 标签:#说话人日志 #端到端 #语音识别 #领域适应 #音频理解 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #说话人日志 | #端到端 | #语音识别 #领域适应 | arxiv 👥 作者与机构 第一作者:Xuanji He 通讯作者:Xuanji He(论文未明确标注通讯作者,根据署名顺序推断) 作者列表:Xuanji He, Gaoyang Dong, Xiaoxiao Li, Minchuan Chen, Fengjie Zhu(五位作者署名后均标注“1”,表明来自同一机构,但论文未提供具体机构名称) 💡 毒舌点评 论文的最大亮点在于其精心设计的“失效感知主导说话人回退策略”,将重叠语音处理这一经典难题与工程上的鲁棒性考量巧妙结合,在比赛中取得了优异成绩。然而,其最大的“原罪”在于彻底的“黑盒”性质:在强调开源和可复现性的顶会审稿标准下,一个完全闭源、不提供任何代码、模型、复现配置乃至详细训练日志的系统报告,其科学贡献和对社区的实质推动作用大打折扣,甚至令人怀疑其结果的可验证性。 ...

2026-07-21 · 更新于 2026-09-04 · 2 min · 399 words