葫芦丝高音为何更暗更不混乱:亮度、锐度与分形维度的聚类证据
该研究用 9 支葫芦丝的 81 个平均音和 7 个心理声学特征训练自组织映射,报告只有频谱质心、锐度和分形关联维能形成音高聚类,其中高音 fa、sol、la 混沌度最低且亮度反直觉偏低,代价是低音区无稳定聚类且录音未公开。
该研究用 9 支葫芦丝的 81 个平均音和 7 个心理声学特征训练自组织映射,报告只有频谱质心、锐度和分形关联维能形成音高聚类,其中高音 fa、sol、la 混沌度最低且亮度反直觉偏低,代价是低音区无稳定聚类且录音未公开。
针对双人竞争听觉注意解码中短窗 Fisher-z 相关方差大、单尺度无监督 GMM 难分 attended 与 unattended 分量的问题,论文提出跨 8 种窗长共享均值、方差按 1/(N_L-1) 缩放的多尺度 GMM 联合估计 HMM 发射参数,在 72 分钟全量下 1 秒窗提升 1.82 个百分点、在 6 分钟数据下提升 8.32 个百分点,但数 …
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究用德语产出数据的静态参数聚类与基频轮廓聚类对照人工标注的重音类型,再以随机森林比较它们对突显评分的预测力,发现轮廓四类解与人工类型预测力相近,但聚类不等同于音系类别,且重音有无仍是最强预测因子。
针对开封话低调变体靠专家看图分类、难以刻画动态的问题,论文用函数型主成分分析提取基频曲线动态再用狄利克雷过程高斯混合做不定类数聚类,在 456 个低调音节上得到下降、凹降、上升三类,并以广义加性混合模型回放验证,其中下降类占 284 例为多数而上升类是前人未报告的新发现。
论文以朗读为参照比较 50 名护理员在访谈与模拟照护中的音节级基频、能量、时长对比和元音离散度,用贝叶斯混合模型与 k-means 聚类报告了照护语音基频升高与超调制及两组个体策略分化,但能量区分弱、轮廓分离度仅中等且存在地域与朗读表现力的混杂。
针对稀疏双耳房间脉冲响应重建后 700 个时域等效源带来双耳卷积负担的问题,论文提出能量加权方向 K 均值聚类把重建方向压缩到 30 个,ABX 显示与全分辨率难以区分,而按能量排序的基线在全部条件下均可被区分,代价是低能量但定位重要的源可能被合并且结论限于特定房间与早期反射条件。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究把任务定为无监督异常定位以减少人工听音时间,只用风声训练两层 LIF 脉冲网络并结合重构与发放统计打分,在稀疏合成集上报告 83% 召回与 80% 时间缩减,代价是 F1 偏低且对短密事件与未见底噪仍不稳定。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对多系统分数融合采用全局映射会抹掉信道与性别等条件差异的问题,该文用嵌入推断离散隐条件并按条件做高斯生成式似然比融合,在 SRE24 评测上相对逻辑回归取得约两成相对改善,但代价是引入嵌入维度与条件数等超参数和更复杂的无监督训练。
该文把说话人身份当作一阶模式,把表征聚类当作刻画网络认法 的二阶模式,用单链接聚类发现、用语义匹配解释、用基于梯度代价外推的新方法判定未见语音归属,报告显示路径完整度从百分之十一点六八升至百分之三十四点一九,原子语义召回从零点五一一九升至零点五六六九,但国籍召回仍明显偏低。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。
针对被动声学监测中标注稀缺与域偏移问题,论文提出先做无监督结构发现再做定向验证的路线,用 MFCC 加 UMAP-HDBSCAN 组织大规模 soundscape 并以 LEAVES 做簇级标签传播,报告两站点约 98% 的四类区分准确率与最高 7.12 倍的标注加速,但 79-90% 的簇标签一致性与未解决的复音分离仍是主要代价与边界。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对无编程背景学生与生物声学研究者难以串起特征、降维、聚类与分类的问题,AI EcoSound Tutor 用 MFCC/OpenL3 加 PCA/t-SNE/UMAP 加 K-Means/GMM/HDBSCAN 的可配置流水线组织学习,最强证据是在蝗虫录音上 MFCC-UMAP 组合达到轮廓系数 0.9 并经频谱图与回放验证,代价是方法子集有限且仅支持 …
该文把单通道分离写成已知加性混合的逆问题,只用单源扩散先验加迭代重建引导完成分离,并用混合加噪初始化、三重注意力骨干与混合引导强度解决梯度冲突,代价是 200 步迭代采样的计算开销与同质语音的排列不确定性。
音频分离 | 6.6/10