论文解读

只听静音也能分类:临床语音数据集里的捷径从何而来

该研究在抑郁、构音障碍、帕金森和口吃五个语音数据集上只用首秒或静音段做分类,发现其加权 F1 常与全音频持平甚至更高,说明录音条件等非言语线索可能贡献了预测性能,但未定位确切混杂源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9426 字 阅读 →
论文解读

单语能分开慢阻肺,换语言就失灵:用疾病方向一致性筛出 26 个跨语言声学特征

针对自发语音中疾病效应被语言音系差异掩盖的问题,CL-DAF 在英孟 272 维公共声学空间中用符号秩二列效应与语言不变分数筛选出 26 个方向一致特征,使英译孟与孟译英 AUC 分别达到 0.825 和 0.722,而代价是需要双语标签估计对齐且目标全参与选择时会高估约 0.04 到 0.09。

 · 更新于 2026-09-24 · 约 19 分钟 · 9339 字 阅读 →
论文解读

日常闲聊里藏着肺部信号:SpiroPhonia 如何用自发语音做 COPD 判别

针对肺功能检查依赖设备与配合的问题,SpiroPhonia 用真实访谈中的自发语音提取抖动、频谱与停顿三类特征,在 201 人被试独立测试上报告 78% 准确率、80% F1 与 87% AUC,代价是小样本下置信区间宽且跨语言跨设备泛化待验证。

 · 更新于 2026-09-24 · 约 17 分钟 · 8439 字 阅读 →
论文解读

不只数出多少词:CCMAN 用词间不稳定捕捉流畅性任务中的认知衰退

针对一分钟语义和音位流畅性任务中整段平均会抹掉检索动态的问题,CCMAN 用词级多模态序列加双向跨模态注意与迁移学习建模时间不稳定性,在 843 人语料上语义二分类宏 F1 达到 0.81 而多分类仅 0.59,代价是三分类区分 MCI 与痴呆仍不显著且依赖 ASR 时间戳质量。

 · 更新于 2026-09-24 · 约 21 分钟 · 10114 字 阅读 →
论文解读

气道狭窄听得出来吗:冻结语音基础模型加多任务聚合的筛查路径

该研究把气道狭窄检测做成患者级多录音分类,用冻结的 WavLM 第 15 层表示加 TransMIL 聚合,在 748 人五折交叉验证中报告 AUROC 为 0.952 与准确率为 0.924,而细粒度分型与严重度分级仍明显更难。

 · 更新于 2026-09-24 · 约 21 分钟 · 10216 字 阅读 →
论文解读

只听说话方式不看说了什么:手工声学特征叠加 YAMNet 嵌入检测阿尔茨海默病

该研究只用语音音频区分阿尔茨海默病与健康对照,用 Librosa 手工声学均值特征与冻结 YAMNet 的 1024 维嵌入拼接后训练分类器,在 160 条合并数据上以 70% 训练 30% 测试取得 89% 测试准确率,代价是小样本、无人口学控制且未报告延迟与误判细节。

 · 更新于 2026-09-24 · 约 21 分钟 · 10343 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

韵律特征省而可释,MFCCs 繁而自动:癌症相关认知损伤语音筛查的对照试点

该试点以 9 名乳腺癌幸存者和 13 名健康对照的叙事语音比较韵律特征与 MFCCs,用逻辑模型树加十折交叉验证报告 86% 对 82% 的准确率,代价是 MFCCs 需 11 个系数且临床可解释性不足。

 · 更新于 2026-09-24 · 约 18 分钟 · 8655 字 阅读 →
论文解读

跨采集条件仍能判准吗:用迭代对抗自训练把源域边界搬向目标域

针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。

 · 更新于 2026-09-24 · 约 19 分钟 · 9191 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

阿尔茨海默病是元音更集中还是更夸张:半控制地图任务下的 F1 与 F3 证据

该研究用地图任务比较 5 名轻中度阿尔茨海默病女性与 5 名健康老年女性的意大利语元音共振峰,发现 F1 与 F3 存在组间差异并呈轻微元音空间扩张趋势,但样本仅 10 人且 FCR 差异不显著,不能作为确诊依据。

 · 更新于 2026-09-24 · 约 21 分钟 · 10078 字 阅读 →
论文解读

转录文本里的停顿与问答为何比语义向量更能分开自闭症与发育迟缓

该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9496 字 阅读 →
论文解读

长短时间尺度对不齐:ALS 构音障碍中频谱流与语调短语起点的相位一致性下降

该研究以朗读语段检验频谱变化快尺度与语调短语慢尺度之间的跨尺度相干,发现 ALS 组在语调短语起点频率附近的成对相位一致性显著低于对照组,而语调短语起点频率本身及其变异性无组间差异,提示计划相对保留而启动执行环节受损,但样本小且仅为朗读。

 · 更新于 2026-09-24 · 约 24 分钟 · 11872 字 阅读 →
论文解读

不识别情绪类别,只跟踪状态漂移:用效价唤醒优势曲线看接警员是否还在状态

该研究把接警员投入度与心理灵活性下降转写为可实时跟踪的声音心理生理状态变化,用预训练模型输出效价唤醒优势三轴曲线先在中性到非中性合成序列上验证再在真实接警录音上试探,合成条件下变化可被标出而真实通话结果混杂因而需要更多通话特征。

 · 更新于 2026-09-24 · 约 20 分钟 · 9996 字 阅读 →
论文解读

甲状腺术后声音变了但喉镜看不出:/apa/上的相对基频能抓住什么

该研究用术后第 1 天六遍/apa/的相对基频比较 17 名健康对照、38 名术后无感知嗓音改变和 8 名术后嗓音障碍者,发现消退段组间差异高度显著但效应量小到中等,且不能区分两组术后患者,提示它是敏感但非特异的早期客观线索。

 · 更新于 2026-09-24 · 约 21 分钟 · 10169 字 阅读 →
论文解读

绕口令里的加速与升调:口语流利自闭症儿童的性别差异与症状关联

该研究用朗读句与加速绕口令的任务差值比较口语流利自闭症与典型发育儿童的平均基频与语速,发现自闭症女孩加速与升调幅度最大,且症状越重任务差值越小,但该关联在男孩中更强,代价是样本小且仅覆盖两类韵律指标。

 · 更新于 2026-09-24 · 约 17 分钟 · 8317 字 阅读 →
论文解读

只留韵律能听出精神分裂症谱系障碍吗:人类感知与机器分类的平行验证

该研究用自适应低通滤波去掉可懂语义后,比较 33 名评分者对 25 人语音的韵律判断与 108 个声学时序特征训练的逻辑回归分类器在 251 人数据上的表现,两者准确率均为 80.0%,代价是灵敏度中等且韵律标记与症状总分无显著关联。

 · 更新于 2026-09-24 · 约 17 分钟 · 8278 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把转录文本连成图:用主体词关系检测阿尔茨海默症

该文把轻量语音转文本后的饼干失窃描述转成词共现图,用两层图卷积区分阿尔茨海默症与健康人,在 ADReSS-o 上主体词图达到 88.73%、精炼版 90.14%,代价是词表依赖该图片描述任务且只用文本模态。

 · 更新于 2026-09-24 · 约 16 分钟 · 8007 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →