论文解读

葫芦丝高音为何更暗更不混乱:亮度、锐度与分形维度的聚类证据

该研究用 9 支葫芦丝的 81 个平均音和 7 个心理声学特征训练自组织映射,报告只有频谱质心、锐度和分形关联维能形成音高聚类,其中高音 fa、sol、la 混沌度最低且亮度反直觉偏低,代价是低音区无稳定聚类且录音未公开。

 · 更新于 2026-09-24 · 约 21 分钟 · 10057 字 阅读 →
论文解读

短窗相关性太 noisy:用多尺度高斯混合稳住 HMM 发射分布

针对双人竞争听觉注意解码中短窗 Fisher-z 相关方差大、单尺度无监督 GMM 难分 attended 与 unattended 分量的问题,论文提出跨 8 种窗长共享均值、方差按 1/(N_L-1) 缩放的多尺度 GMM 联合估计 HMM 发射参数,在 72 分钟全量下 1 秒窗提升 1.82 个百分点、在 6 分钟数据下提升 8.32 个百分点,但数 …

 · 更新于 2026-09-24 · 约 21 分钟 · 10460 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

重音类型是音系类别,还是线索打包?德语产出与突显感知的对照检验

该研究用德语产出数据的静态参数聚类与基频轮廓聚类对照人工标注的重音类型,再以随机森林比较它们对突显评分的预测力,发现轮廓四类解与人工类型预测力相近,但聚类不等同于音系类别,且重音有无仍是最强预测因子。

 · 更新于 2026-09-24 · 约 19 分钟 · 9045 字 阅读 →
论文解读

不预设几类声调:用函数型主成分加非参数聚类重看开封话低调

针对开封话低调变体靠专家看图分类、难以刻画动态的问题,论文用函数型主成分分析提取基频曲线动态再用狄利克雷过程高斯混合做不定类数聚类,在 456 个低调音节上得到下降、凹降、上升三类,并以广义加性混合模型回放验证,其中下降类占 284 例为多数而上升类是前人未报告的新发现。

 · 更新于 2026-09-24 · 约 23 分钟 · 11518 字 阅读 →
论文解读

照护语音不是统一变温柔:两组护理员用不同声学策略进入照护情境

论文以朗读为参照比较 50 名护理员在访谈与模拟照护中的音节级基频、能量、时长对比和元音离散度,用贝叶斯混合模型与 k-means 聚类报告了照护语音基频升高与超调制及两组个体策略分化,但能量区分弱、轮廓分离度仅中等且存在地域与朗读表现力的混杂。

 · 更新于 2026-09-24 · 约 20 分钟 · 9978 字 阅读 →
论文解读

700 个等效源算不动时:用能量加权方向聚类保住早期反射

针对稀疏双耳房间脉冲响应重建后 700 个时域等效源带来双耳卷积负担的问题,论文提出能量加权方向 K 均值聚类把重建方向压缩到 30 个,ABX 显示与全分辨率难以区分,而按能量排序的基线在全部条件下均可被区分,代价是低能量但定位重要的源可能被合并且结论限于特定房间与早期反射条件。

 · 更新于 2026-09-24 · 约 14 分钟 · 6995 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只学风声、不学兽鸣:用脉冲网络把长时生物声学录音先筛一遍

该研究把任务定为无监督异常定位以减少人工听音时间,只用风声训练两层 LIF 脉冲网络并结合重构与发放统计打分,在稀疏合成集上报告 83% 召回与 80% 时间缩减,代价是 F1 偏低且对短密事件与未见底噪仍不稳定。

 · 更新于 2026-09-24 · 约 16 分钟 · 7920 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

不换打分只换加权:按隐含条件自适应融合说话人确认分数

针对多系统分数融合采用全局映射会抹掉信道与性别等条件差异的问题,该文用嵌入推断离散隐条件并按条件做高斯生成式似然比融合,在 SRE24 评测上相对逻辑回归取得约两成相对改善,但代价是引入嵌入维度与条件数等超参数和更复杂的无监督训练。

 · 更新于 2026-09-24 · 约 17 分钟 · 8222 字 阅读 →
论文解读

网络先认说话人,聚类再认网络的认法:二阶模式识别如何判定未见语音

该文把说话人身份当作一阶模式,把表征聚类当作刻画网络认法 的二阶模式,用单链接聚类发现、用语义匹配解释、用基于梯度代价外推的新方法判定未见语音归属,报告显示路径完整度从百分之十一点六八升至百分之三十四点一九,原子语义召回从零点五一一九升至零点五六六九,但国籍召回仍明显偏低。

 · 更新于 2026-09-24 · 约 19 分钟 · 9366 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

把混叠的音频表示拆开:AudioSAE 用稀疏自编码器解剖 Whisper 与 HuBERT

该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。

 · 更新于 2026-09-24 · 约 21 分钟 · 10239 字 阅读 →
论文解读

先发现结构再贴标签:用无监督组织对抗 soundscape 的域偏移与复音

针对被动声学监测中标注稀缺与域偏移问题,论文提出先做无监督结构发现再做定向验证的路线,用 MFCC 加 UMAP-HDBSCAN 组织大规模 soundscape 并以 LEAVES 做簇级标签传播,报告两站点约 98% 的四类区分准确率与最高 7.12 倍的标注加速,但 79-90% 的簇标签一致性与未解决的复音分离仍是主要代价与边界。

 · 更新于 2026-09-24 · 约 18 分钟 · 8845 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

不写代码也能走完音频 AI 全链路:AI EcoSound Tutor 如何把鸣声变成可见、可听、可验证的学习对象

针对无编程背景学生与生物声学研究者难以串起特征、降维、聚类与分类的问题,AI EcoSound Tutor 用 MFCC/OpenL3 加 PCA/t-SNE/UMAP 加 K-Means/GMM/HDBSCAN 的可配置流水线组织学习,最强证据是在蝗虫录音上 MFCC-UMAP 组合达到轮廓系数 0.9 并经频谱图与回放验证,代价是方法子集有限且仅支持 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10813 字 阅读 →
论文解读

不用成对混合也能分离:扩散先验与重建引导如何分开又合上声音

该文把单通道分离写成已知加性混合的逆问题,只用单源扩散先验加迭代重建引导完成分离,并用混合加噪初始化、三重注意力骨干与混合引导强度解决梯度冲突,代价是 200 步迭代采样的计算开销与同质语音的排列不确定性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9209 字 阅读 →
论文解读

单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作

音频分离 | 6.6/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12996 字 阅读 →