jep-2026 论文深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究用可解释的韵律声学特征加树模型做说话人级自闭症与典型发育分类,芬兰语内准确率 0.84 而跨语迁移差异大,说明基频分布部分通用但谱特征依赖语言且录音条件不齐。
该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。
该研究用 11 个声学参数加随机森林区分女性双侧声带小结与健康嗓音,最强证据是声调 3 模型准确率 0.836 与 AUC 0.902,代价是仅覆盖女性北方官话单字朗读且未验证连续语流与男性泛化。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。
针对板混响脉冲响应中弱模态与重叠模态难以直接检出的问题,该研究先用回归器预测四个频带的模态数量以确定稠密网格基数,再固定频率对衰减与增益做有界可微校准,在两个仿真验证集上把本地挑战式误差相对官方默认峰值拾取降低约 66%,主要收益来自计数误差下降而衰减与增益仍是最大残差。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
该研究把加州艺术学院机器实验室改造成以天花板 8×8 共 64 个 Modulets 为核心的分布式声场,用指挥—客户端—中央服务器的开放声音控制网络组织合奏,并以多层感知机加最近邻的加权集成自动校准打击乐器,在 4 种和弦密度下多数配置优于单模型,但 9 音符均方根误差仍以单多层感知机最好,且校准后落入正负 1 点 5 可觉差容限。
音频分类 | 5.7/10
音乐推荐 | 5.8/10
语音属性识别 | 7.2/10
音频分类 | 5.6/10
音频理解 | 5.6/10
音频理解 | 5.5/10
语音伪造检测 | 7.0/10
语音情感识别 | 7.4/10
集成学习 | 7.5/10
语音识别 | 7/10