DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

📄 DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization 标签:#语音质量评估 #自监督学习 #多任务学习 #模型评估 8.2/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音质量评估 | #自监督学习 | #多任务学习 #模型评估 | arxiv 👥 作者与机构 第一作者:Naiyuan Li(Ningbo University,College of Information Science and Engineering) 通讯作者:Diqun Yan 作者列表:Naiyuan Li、Li Dong、Diqun Yan(机构:Ningbo University,College of Information Science and Engineering;Ningbo University of Finance and Economics,College of Artificial Intelligence;浙江省大宗商品数字供应链与人工智能协同创新中心) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 506 words

Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation

📄 Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation 标签:#语音情感识别 #自监督学习 #多任务学习 #说话人日志 8.4/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.4/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #自监督学习 | #多任务学习 #说话人日志 | arxiv 👥 作者与机构 第一作者:Guan-Hua Wen(Department of Computer Science and Information Engineering / Graduate Institute of Digital Learning and Education, National Taiwan University of Science and Technology, Taipei, Taiwan) 通讯作者:正文未明确标注 作者列表:Guan-Hua Wen、Kuan-Yu Chen、Hou-Chiang Tseng(机构:Department of Computer Science and Information Engineering;Graduate Institute of Digital Learning and Education, National Taiwan University of Science and Technology, Taipei, Taiwan) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 555 words

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

📄 FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation 标签:#音频分离 #流匹配 #生成模型 #自监督学习 9.0/10 | 创新 1.9/2 | 严谨 1.5/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.5/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.0/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #音频分离 | #流匹配 | #生成模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Yi Yuan(University of Surrey,英国) 通讯作者:正文未明确标注 作者列表:Yi Yuan、Xubo Liu、Haohe Liu、Xiyuan Kang、Mark D. Plumbley、Wenwu Wang(机构:University of Surrey,英国;Meta Superintelligence Labs,美国;King’s College London,英国) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 493 words

Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition

📄 Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition 标签:#语音识别 #多任务学习 #自监督学习 #低资源 8.2/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #多任务学习 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Sophia Riaz(Kaliber AI,San Mateo,California) 通讯作者:Aneesh Jonelagadda 作者列表:Sophia Riaz、Haoze Zheng、Amos Roche、Miyu Zhang、Anamika Ragu、Salvatore Penachio、Kaustav Mukherjee、Aneesh Jonelagadda(机构:Kaliber AI,San Mateo,California) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 347 words

Self-Supervised Speech Representations Track Spoken Language Convergence to Adult Models in Infants and Children Who Are Deaf/Hard-of-Hearing

📄 Self-Supervised Speech Representations Track Spoken Language Convergence to Adult Models in Infants and Children Who Are Deaf/Hard-of-Hearing 标签:#语音属性识别 #自监督学习 #医疗音频 #可解释性 9.7/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.7/10 | 前10% | 文档类型:应用研究 | 评分置信度:中 | #语音属性识别 | #自监督学习 | #医疗音频 #可解释性 | arxiv 👥 作者与机构 第一作者:Landon Choy(Stanford University,美国) 通讯作者:正文未明确标注 作者列表:Landon Choy、Ali Sartaz Khan、Sonia Patrizi、Daisy Ye、Julianna Gross、Margaret Cychosz(机构:Stanford University,美国) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 497 words

Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations?

📄 Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations? 标签:#音频理解 #自监督学习 #理论分析 #模型评估 5.6/10 | 创新 1.3/2 | 严谨 1.4/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.3/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #自监督学习 | #理论分析 #模型评估 | arxiv 👥 作者与机构 Wenxuan He、Yunpeng Li 为西交利物浦大学智能科学系研究生,Shan Liang(通信作者)任教于同一院系,机构位于中国苏州。研究使用公开的 LibriSpeech 数据,未收集人类被试数据,作者声明无利益冲突。 💡 毒舌点评 这是一篇问题意识清晰、实验纪律近乎苛刻的机制分析小品:为了回答「软 GMM 目标里非最大分量的映射到底重不重要」,作者构造了两个匹配对照,把数值概率结构与类别映射干净地解耦,还做了目标审计、说话人聚类自助法和分级暴露实验——方法论素养远超同类 SSL 分析工作。但也要泼两盆冷水。第一,效应量小得可怜:DeepTailCE 的降幅在千分之几到百分之几之间晃动,Seed B 对 FIXED-RANDPERM 的置信区间直接穿过零点,作者虽然诚实地报告了这一点,但「映射很重要」这一标题级结论的实际效应强度撑不起太大的理论野心。第二,外部效度几乎为零:20 小时 LibriSpeech 子集、51 个说话人、单一 S-JEPA 架构、100 分量固定 GMM、纯线性探针——所有结论都被锁死在这个微型设定里,与社区真正使用的大规模预训练 regime 相距甚远。此外全文没有提及任何代码发布,两个对照构造的实现细节又高度依赖工程选择,第三方想复现这套审计流程会相当吃力。 ...

2026-08-21 · 更新于 2026-09-04 · 3 min · 564 words

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

📄 Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners 标签:#音频理解 #自监督学习 #Transformer #预训练 8.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #自监督学习 | #Transformer #预训练 | arxiv 👥 作者与机构 Umberto Cappellazzo、Stavros Petridis、Maja Pantic 来自帝国理工学院,Xubo Liu 来自萨里大学。论文首页提供项目页与代码链接(HTML 超链接形式),致谢中感谢 Nvidia 研究员的讨论。 💡 毒舌点评 这是那种让整个子领域重新审视自己「配方复杂度」的论文:当音频自监督学习卷到需要重建解码器、声学分词器、EMA 教师网络和正则化辅助损失齐上阵时,作者只用了因果掩码加停止梯度就做到了与最强方法打平——AS-2M 上 50.18 mAP 追平依赖音频混合监督与学生教师架构的 SSLAM,IEMOCAP 上以 3.5 个点的优势大幅刷新。设计哲学的克制(极简配方)与实验的全面(六基准、三规模、逐层探针、注意力可视化)形成了少见的平衡。但严格审视仍有几处值得较真。其一,「追平 SSLAM」的说法要打折:SSLAM 的预训练数据与 NAPE 并不完全同口径,50.2 对 50.18 的差距在无方差报告的情况下无法解读为等价。其二,全部实验没有多种子方差或置信区间,自监督训练对种子和超参敏感是常识,单点数字的说服力有限。其三,因果扫描顺序虽然被论证为音频的关键设计轴,但对角扫描相对光栅的优势幅度很小且随规模变化,这一「音频特有设计轴」的实际重要性可能被叙事放大了。其四,线性探针绝对值偏低(AS-2M 最高 27.1 mAP),说明预测目标与线性可分性的错位真实存在,特征要用起来还是得微调。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 408 words

The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report

📄 The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report 标签:#语音伪造检测 #自监督学习 #工业应用 #模型评估 6.6/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 ✅ 6.6/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音伪造检测 | #自监督学习 | #工业应用 #模型评估 | arxiv 👥 作者与机构 第一作者:Anton Firc(按作者顺序首位) 通讯作者:未说明 作者列表:Anton Firc、Kamil Malinka、Vojtěch Staněk、Miroslav Hlaváček、Marek Bartoň 机构:Security@FIT, Brno University of Technology, Czech Republic;Phonexia, Brno, Czech Republic 项目资助:Czech Ministry of the Interior,SECTECH 安全研究项目 “Tools to Combat Voice DeepFakes”(项目号 VB02000060);Brno University of Technology 内部项目 FIT-S-26-9011 用户组织:Czech Police 利益冲突:作者包含 Phonexia 员工,Phonexia 是该技术的商业厂商 生成式 AI 使用声明:作者在语言润色和文本修改中使用了 Google Gemini、ChatGPT 和 Grammarly 注:论文未将每位作者与机构逐一对应;正文中以 [University] 和 [Company] 指代合作双方,地址信息显示机构为 Brno University of Technology 与 Phonexia。 ...

2026-08-19 · 更新于 2026-09-04 · 5 min · 1017 words

A survey of AI-generated voices and their detection

📄 A survey of AI-generated voices and their detection 标签:#语音伪造检测 #语音大模型 #语音合成 #语音克隆 #自监督学习 6.1/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 ✅ 6.1/10 | 前50% | 文档类型:综述 | 评分置信度:中 | #语音伪造检测 | #语音大模型 | #语音合成 #语音克隆 | arxiv 👥 作者与机构 第一作者:Chengzhe Sun(纽约州立大学布法罗分校计算机科学与工程系) 通讯作者:Siwei Lyu(纽约州立大学布法罗分校计算机科学与工程系) 作者列表:Chengzhe Sun(纽约州立大学布法罗分校计算机科学与工程系)、Tianle Yang(纽约州立大学布法罗分校语言学系)、Siwei Lyu(纽约州立大学布法罗分校计算机科学与工程系) 💡 毒舌点评 这是一篇把语音学/生理学视角拉进音频深伪检测的综述,方向上比单纯罗列模型更有洞察力。但作为“survey”,它没有可复现的检索协议,更像是作者熟悉工作的地图;参考文献管理有明显瑕疵,XTTS 出现两条高度重合条目。没有代码、权重或统一 benchmark,对工程实践者而言只能是导览,不是工具箱。 ...

2026-08-18 · 更新于 2026-09-04 · 2 min · 310 words

Contrastive Learning with Variational Regularization for Multi-Session EEG-to-Speech Decoding

📄 Contrastive Learning with Variational Regularization for Multi-Session EEG-to-Speech Decoding 标签:#语音合成 #对比学习 #变分自编码器 #自监督学习 5.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #对比学习 | #变分自编码器 #自监督学习 | arxiv 👥 作者与机构 第一作者:Tomoaki Mizuno(The University of Electro-Communications, Tokyo, Japan) 通讯作者:未明确标注;第一作者邮箱为 t.mizuno2301@uec.ac.jp 作者列表:Tomoaki Mizuno(The University of Electro-Communications, Tokyo, Japan)、Toru Nakashika(The University of Electro-Communications, Tokyo, Japan) 💡 毒舌点评 这篇文章在单被试 SpREAD 数据集上,把 MoCo 跨会话对比学习和不传入 decoder 的变分正则化拼接在一起,得到 CER 从 0.968 降到 0.948、PCC 仅恢复到 baseline 水平的微小改进,没有跨数据集/跨被试验证,也没有与已发表 EEG-to-speech SOTA 横向对比。比较干净的是利用同一刺激三次重复记录构造正样本对,session probing 确实降到 chance level;但“VR 恢复 PCC”仅靠 h_bar 标准差的观察支撑,机制解释停留在“方差变宽”层面,且 SPA 提升未达显著仍被反复作为趋势讨论,有一定过度解读。未开源、训练细节缺失,复现门槛不低。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 910 words