每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

自闭症儿童语音线索跨语言能通用吗:芬兰语、法语和斯洛伐克语的对照分类

该研究用可解释的韵律声学特征加树模型做说话人级自闭症与典型发育分类,芬兰语内准确率 0.84 而跨语迁移差异大,说明基频分布部分通用但谱特征依赖语言且录音条件不齐。

 · 更新于 2026-09-24 · 约 18 分钟 · 8536 字 阅读 →
论文解读

转录文本里的停顿与问答为何比语义向量更能分开自闭症与发育迟缓

该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9496 字 阅读 →
论文解读

声调轮廓为何能暴露双侧声带小结:基频与周期性线索的可解释分类

该研究用 11 个声学参数加随机森林区分女性双侧声带小结与健康嗓音,最强证据是声调 3 模型准确率 0.836 与 AUC 0.902,代价是仅覆盖女性北方官话单字朗读且未验证连续语流与男性泛化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8929 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

只用三个元音能判断年龄吗:科西嘉塔拉瓦方言的尝试与落空

该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。

 · 更新于 2026-09-24 · 约 19 分钟 · 9233 字 阅读 →
论文解读

先数清有多少个模态,再去校准每个模态:密集板混响的计数优先估计

针对板混响脉冲响应中弱模态与重叠模态难以直接检出的问题,该研究先用回归器预测四个频带的模态数量以确定稠密网格基数,再固定频率对衰减与增益做有界可微校准,在两个仿真验证集上把本地挑战式误差相对官方默认峰值拾取降低约 66%,主要收益来自计数误差下降而衰减与增益仍是最大残差。

 · 更新于 2026-09-24 · 约 19 分钟 · 9465 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

把天花板变成乐器:64 个敲击点如何与网络和校准一起工作

该研究把加州艺术学院机器实验室改造成以天花板 8×8 共 64 个 Modulets 为核心的分布式声场,用指挥—客户端—中央服务器的开放声音控制网络组织合奏,并以多层感知机加最近邻的加权集成自动校准打击乐器,在 4 种和弦密度下多数配置优于单模型,但 9 音符均方根误差仍以单多层感知机最好,且校准后落入正负 1 点 5 可觉差容限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9875 字 阅读 →
论文解读

别只看频谱长什么样:用 19 维力学视角重写环境声音的描述方式

音频分类 | 5.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9991 字 阅读 →
论文解读

当乐评人说两位歌手很像,声音本身答应吗?

音乐推荐 | 5.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6935 字 阅读 →
论文解读

Separating Voice from Age in COPD Screening

语音属性识别 | 7.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5333 字 阅读 →
论文解读

Machine-Learning-Based Diagnostic Framework for Passive Ultrasonic Detection of Railway Wheel Defects

音频分类 | 5.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5133 字 阅读 →
论文解读

Band-Count Dense Modal Estimation with Fixed-Frequency Differentiable Resonator Refinement

音频理解 | 5.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5290 字 阅读 →
论文解读

Simulation-Based Plate-Reverb Parameter Estimation from a Single Impulse Response

音频理解 | 5.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4638 字 阅读 →
论文解读

Toward Interpretable Speech Deepfake Detection using Artifact-Specific Experts and Calibrated Detection Scores

语音伪造检测 | 7.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8363 字 阅读 →
论文解读

Automatic Detection of Stress from Speech in the Trier Social Stress Test

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7439 字 阅读 →
论文解读

Probing-Guided Layer Selection from Self-Supervised Speech Models for Generalizable Audio Deepfake Detection

集成学习 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6363 字 阅读 →
论文解读

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

语音识别 | 7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5029 字 阅读 →