PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

📄 PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads 标签:#音视频生成 #多模态模型 #端到端 #高效推理 #可解释性 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #多模态模型 | #端到端 #高效推理 | arxiv 👥 作者与机构 Ao Fu(ORCID: 0009-0006-9933-9240,邮箱:220232248@seu.edu.cn):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 Yi Zhou(ORCID: 0000-0003-3021-3229,邮箱:yizhou.szcn@gmail.com):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 论文发表于 Proceedings of the 34th ACM International Conference on Multimedia(MM ‘26),2026年11月10–14日,巴西里约热内卢。DOI: 10.1145/3767308.3835096。 💡 毒舌点评 把音素级离散语言信息和连续音频特征用门控融合注入 3DGS 说话头,确实打中了“漏嘴”(leaky mouth)和嘴部过平滑这一真实痛点;LFM 的可视化也让融合过程有了初步可解释性。但整体仍是对 per-person 说话头框架的组件级改进,而非范式级突破:所谓音素来自离线 ASR+强制对齐,且仅 2 个受试者的消融与跨数据集实验支撑一个高达 40 音素的词汇表,证据链偏单薄;代码权重一概未公开,可复现性近于零。把“phoneme-driven”的普适性说到太满之前,至少应给出多身份、多语言、对 ASR 噪音的鲁棒性分析。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 721 words

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

📄 Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders 标签:#语音翻译 #语音大模型 #端到端 #课程学习 #多语言 8.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音翻译 | #语音大模型 | #端到端 #课程学习 | arxiv 👥 作者与机构 第一作者:Yexing Du(机构未说明;论文标注为 1,2) 通讯作者:论文未注明通讯作者 作者列表: Yexing Du(机构未说明;标注 1,2) Kaiyuan Liu(机构未说明;标注 1,2) Youcheng Pan(机构未说明;标注 2) Bo Yang(机构未说明;标注 2) Chengpeng Fu(机构未说明;标注 1,2) Yu Wang(机构未说明;标注 2) Ming Liu(机构未说明;标注 1,2) 说明:论文只给出作者单位编号 1 和 2,没有提供单位名称,因此无法确认具体机构。 💡 毒舌点评 用“冻结高资源专家 + 可训练中低资源专家”的方式把资源分层直接做进语音编码器,思路不算复杂,但确实直击共享编码器的容量竞争问题,45 语言全方向评测的工程量也值得肯定。不过“打破多语言诅咒”这个结论仍偏强:MoSE 本质上只是按人工资源等级把模型容量切成两半,缺少参数匹配对照、显著性检验和更精细的资源分组依据,效果有多少来自路由、多少来自直接翻倍编码器参数,论文并没有彻底说清。全方向 1,980 个翻译方向的主结果表也只给出聚合分布与代表方向,逐方向失败模式仍未充分暴露。 ...

2026-08-06 · 更新于 2026-08-14 · 8 min · 1514 words

Crowdsourced Multilingual Speech Intelligibility Testing

📄 Crowdsourced Multilingual Speech Intelligibility Testing 标签:#语音质量评估 #端到端 #多语言 #基准测试 #数据集 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #语音质量评估 | #端到端 | #多语言 #基准测试 | arxiv 👥 作者与机构 第一作者:Laura Lechler(所属机构未说明) 通讯作者:未说明 作者列表:Laura Lechler(未说明)、Kamil Wojcicki(未说明) 💡 毒舌点评 这篇工作把经典的 DRT 诊断押韵测试搬上众包平台,并实打实公开了五种语言的有声测试材料,弥补了多语言可懂度评测资源长期缺失的空白,工程执行力值得肯定。但实验设计整体偏“验证流程可用性”而非“建立高灵敏度评测方法”,缺少噪声条件下的系统对比和更强基线,结论的说服力仍显单薄。 📌 核心摘要 该论文提出了一种基于 DRT(诊断押韵测试)的多语言众包语音可懂度评估方法,核心贡献是公开英语、德语、西班牙语、法语和普通话五种语言的词表与 16 kHz 录音语料。方法上,作者将众包质量控制流程(预筛、听力筛查、练习轮、验证题、事后过滤)适配到可懂度测试场景,并采用文件级而非听众级计分来支持按音素/特征细粒度分析。较之以往以转写任务为主的众包可懂度测试,该方法采用封闭二选一判别任务,规避了拼写错误和记忆效应,测试时间更短、更适合大规模部署。实验一显示,西班牙语众包组在 NB PCMU 条件下比 WB 参考低 4.3 分,而内部专家组差异不显著;实验二重复测试相关系数为 0.87 与 0.86,跨人群复测无显著差异。实验三在 AMR 码本对比中复现了 ITU 实验室的下降趋势,按区别特征的相关性达到 0.86/0.94。实验四显示 PCMU 在五种语言的辅音 DRT 中普遍造成约 4-5 分的显著下降,中文声调 DRT 则无显著变化。该测试方案对语音编解码和语音增强算法的快速迭代评估具有明确实用价值,但目前仍缺少噪声提升灵敏度的系统性验证,且测试软件尚未完全开源。 ...

2026-08-06 · 更新于 2026-08-14 · 3 min · 560 words

Leveraging Beam Search Information for Confidence Estimation in E2E ASR

📄 Leveraging Beam Search Information for Confidence Estimation in E2E ASR 标签:#语音识别 #端到端 #模型评估 #鲁棒性 #音频理解 6.3/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #端到端 | #模型评估 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Yichen Jia(KU Leuven, Department Electrical Engineering ESAT-PSI) 通讯作者:Yichen Jia(KU Leuven, Department Electrical Engineering ESAT-PSI) 作者列表:Yichen Jia(KU Leuven, Department Electrical Engineering ESAT-PSI)、Hugo Van hamme(KU Leuven, Department Electrical Engineering ESAT-PSI, Senior Member, IEEE) 💡 毒舌点评 这篇文章用一个几百参数的浅层MLP把beam search里现有的分数和排名重新“炒”了一遍,竟然在MCE上爆杀一众复杂基线。轻量、架构无关的卖点确实讨巧,但创新深度有限,更像是一种精巧的工程特征设计,且开了一个空仓库,审稿人的好感度被打了不少折扣。 ...

2026-08-03 · 更新于 2026-08-14 · 5 min · 917 words

Unfolded Recursive Expectation-Maximization Neural Network For Speaker Tracking

📄 Unfolded Recursive Expectation-Maximization Neural Network For Speaker Tracking 标签:#声源定位 #端到端 #音频理解 #Transformer #模型评估 5.4/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.4/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #端到端 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Rina Veler(Bar-Ilan University, Faculty of Engineering) 通讯作者:未说明 作者列表:Rina Veler(Bar-Ilan University, Faculty of Engineering)、Sharon Gannot(Bar-Ilan University, Faculty of Engineering) 💡 毒舌点评 这篇文章用“算法展开”的瓶子装了“递归EM跟踪”的酒,核心卖点是用FiLM和位置编码让网络自己学递归步长,动机清晰、路径合理。然而实验部分薄弱得令人不安——基线只有固定步长的CREM,没有与任何粒子滤波、卡尔曼滤波或纯DNN跟踪方法对比,这让“性能优异”的结论仅限于自家澡盆里游泳。混响下0.55米的RMSE意味着跟踪点经常在说话人半米外徘徊,这与宣称的“鲁棒跟踪”有不小差距。整体来看,概念有趣但说服力不足。 ...

2026-07-30 · 更新于 2026-08-14 · 2 min · 287 words

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

📄 Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models 标签:#语音交互 #课程学习 #语音大模型 #端到端 #高效推理 7.6/10 | 创新 1.8/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音交互 | #课程学习 | #语音大模型 #端到端 | arxiv 👥 作者与机构 第一作者:Pengchao Feng(上海交通大学,上海创新研究院,中国上海) 通讯作者:未说明 作者列表:Pengchao Feng(上海交通大学,上海创新研究院,中国上海)、Chao-Hong Tan(通义实验室,阿里巴巴集团,中国上海)、Qian Chen(通义实验室,阿里巴巴集团,中国杭州)、Wen Wang(通义实验室,阿里巴巴集团,美国森尼维尔)、Xiangang Li(通义实验室,阿里巴巴集团,中国杭州)、Xie Chen(上海交通大学,上海创新研究院,中国上海) 💡 毒舌点评 亮点在于首次系统性地将高效推理(压缩思维链)的概念引入语音语言模型,并提出了一个完整的、基于课程学习的端到端训练框架。实验在多个口语数学问答基准上验证了其精度-效率优势。短板显著:工程细节和可复现性支持严重不足,未提供代码、模型或可下载的数据集;评估高度受限于英语数学问答任务,泛化性未得验证;对压缩策略依赖外部工具(LLMLingua-2)且未讨论其在SLM语境下的适配性或潜在瓶颈。 ...

2026-07-23 · 更新于 2026-08-14 · 6 min · 1117 words

End-to-End Markov State Sequence Learning for Auditory Attention Decoding

📄 End-to-End Markov State Sequence Learning for Auditory Attention Decoding 标签:#语音交互 #端到端 #音频理解 #Transformer #模型评估 8.3/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音交互 | #端到端 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Yushan Yashengjiang(中国科学技术大学,语音及语言信息处理国家工程研究中心,NERC-SLIP) 通讯作者:Jie Zhang(中国科学技术大学,语音及语言信息处理国家工程研究中心,NERC-SLIP) 作者列表: Yushan Yashengjiang(中国科学技术大学,NERC-SLIP) Jie Zhang(中国科学技术大学,NERC-SLIP) Miao Sun(广州海事大学,信息与通信工程学院) Huadong Liang(iFLYTEK Company, Ltd.,人工智能研究院) Xin Li(iFLYTEK Company, Ltd.,人工智能研究院;中国科学技术大学,信息科学技术学院) Zhen-Hua Ling(中国科学技术大学,NERC-SLIP) 💡 毒舌点评 本文将序列判别训练(CRF)引入听觉注意力解码(AAD)以改善独立窗口训练与推理不匹配的问题,视角新颖且有效。实验在动态切换和静态数据集上均显示了稳定提升,消融分析清晰地归因于“序列感知发射学习”。然而,最佳因果解码延迟(23.3秒)对实时应用而言仍过高,且泛化性(如跨被试、跨设备)未被探讨,这限制了其临床转化潜力。同时,对静态数据集性能提升的机制解释可以更深入。 ...

2026-07-22 · 更新于 2026-08-14 · 3 min · 528 words

What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio

📄 What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio 标签:#会议转录 #端到端 #语音识别 #说话人日志 #音频理解 4.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 📝 4.8/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #端到端 | #会议转录 #说话人日志 | arxiv 👥 作者与机构 第一作者:Cheng Siong Chin 通讯作者:Cheng Siong Chin 作者列表:Cheng Siong Chin(纽卡斯尔大学新加坡分校,科学、农业与工程学院)、Jianhua Zhang(青岛理工大学,信息与控制工程学院)、Mohan Venkateshkumar(Amrita Vishwa Vidyapeetham,Amrita工程技术学院,电气与电子工程系) 💡 毒舌点评 论文提出了一个具有实用价值的“透明第一”设计框架,并在工程上集成了一个完整的语音音频分析原型。然而,作为一篇顶会水平的研究论文,它最致命的缺陷在于几乎没有提供任何支撑其系统能力声明的实验验证。它更像一份详尽的产品设计文档或系统说明书,而非一篇经过严格实验检验的研究工作。审稿人无法评估其转录质量、日志准确性或任何声称功能的实际效果,这极大地削弱了其作为学术论文的可信度和影响力。 ...

2026-07-22 · 更新于 2026-08-14 · 2 min · 237 words

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

📄 FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications 标签:#端到端 #音视频生成 #音视频交互 #高效推理 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频生成 | #端到端 | #音视频交互 #高效推理 | arxiv 👥 作者与机构 第一作者:Krish Agarwal(Carnegie Mellon University, Infini-AI-Lab) 通讯作者:Beidi Chen(Carnegie Mellon University, Infini-AI-Lab) 作者列表:Krish Agarwal(Carnegie Mellon University, Infini-AI-Lab)、Zhuoming Chen(Carnegie Mellon University, Infini-AI-Lab)、Yanyuan Qin(AMD)、Zhenyu Gu(AMD)、Atri Rudra(University at Buffalo)、Beidi Chen(Carnegie Mellon University, Infini-AI-Lab) 💡 毒舌点评 这篇论文的亮点在于其巧妙的系统设计,将AI代理作为编排者,解决多模态应用部署的NP难题,方法新颖且实验结果令人印象深刻(如~70x延迟降低)。但短板同样明显:其性能高度依赖昂贵的顶级推理模型(Claude Opus 4.8),且对模型内部优化(如算子融合、内核优化)基本无能为力,本质上是“用一个黑盒AI代理去编排其他黑盒模型的部署”,工程鲁棒性和可预测性存疑。对于语音/音频领域的读者,此工作的核心贡献(自动化部署框架)是系统层面的,不直接解决算法或建模问题,实用价值有限。 ...

2026-07-21 · 更新于 2026-08-14 · 3 min · 524 words

SSTMark: Robust Training-Free Semantic-Level Speech Watermarking

📄 SSTMark: Robust Training-Free Semantic-Level Speech Watermarking 标签:#音频水印 #端到端 #语音合成 #语音识别 #音频理解 6.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.4/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频水印 | #端到端 | #语音合成 #语音识别 | arxiv 👥 作者与机构 第一作者:Kuan-Lin Chu (CITI, Academia Sinica, Taiwan, ROC) 通讯作者:未说明 作者列表:Kuan-Lin Chu (CITI, Academia Sinica, Taiwan, ROC), Jun-Cheng Chen (CITI, Academia Sinica, Taiwan, ROC), Chun-Shien Lu (IIS, Academia Sinica, Taiwan, ROC) 💡 毒舌点评 亮点在于将水印载体从脆弱的信号层提升到相对稳定的语义层,概念新颖且有洞察力,在AudioMarkBench的多种攻击下展现出极具说服力的平均鲁棒性优势,特别是在面对神经编解码器压缩时表现突出。短板同样明显:该方法严重依赖外部ASR和TTS模型,引入了额外的复杂性、延迟和潜在的单点故障;且基础检测率(No-atk TPR)低于一些信号级方法,表明其在“无攻击”场景下并非最优;此外,对语义攻击(如转述)的脆弱性未被评估,且未讨论多比特水印嵌入能力,限制了其作为通用溯源工具的潜力。 ...

2026-07-21 · 更新于 2026-08-14 · 8 min · 1502 words