把可懂度比较搬进声道:九维收缩变量为何能替掉上千维自监督特征
针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。
针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。
该研究在抑郁、构音障碍、帕金森和口吃五个语音数据集上只用首秒或静音段做分类,发现其加权 F1 常与全音频持平甚至更高,说明录音条件等非言语线索可能贡献了预测性能,但未定位确切混杂源。
该研究用四种语音基础模型嵌入加四种浅层分类器做健康对照、轻度、重度三分类,在意大利语、英语、哥伦比亚西班牙语之间做零样本与每类 49 个目标片段的 k 样本适配,发现 k 样本一致提升目标语言 F1 且源语言基本稳定,但重度与轻度边界和预处理线索损失仍是主要代价。
该研究在相同骨干与训练流程下比较按病因拆分与混合病因的严重度分类,报告脑瘫、帕金森、肌萎缩侧索硬化三个方向上按病因模型全面领先混合基线,代价是需要病因路由、单次训练与以英语为主的评测局限。
针对自发语音中疾病效应被语言音系差异掩盖的问题,CL-DAF 在英孟 272 维公共声学空间中用符号秩二列效应与语言不变分数筛选出 26 个方向一致特征,使英译孟与孟译英 AUC 分别达到 0.825 和 0.722,而代价是需要双语标签估计对齐且目标全参与选择时会高估约 0.04 到 0.09。
针对肺功能检查依赖设备与配合的问题,SpiroPhonia 用真实访谈中的自发语音提取抖动、频谱与停顿三类特征,在 201 人被试独立测试上报告 78% 准确率、80% F1 与 87% AUC,代价是小样本下置信区间宽且跨语言跨设备泛化待验证。
针对一分钟语义和音位流畅性任务中整段平均会抹掉检索动态的问题,CCMAN 用词级多模态序列加双向跨模态注意与迁移学习建模时间不稳定性,在 843 人语料上语义二分类宏 F1 达到 0.81 而多分类仅 0.59,代价是三分类区分 MCI 与痴呆仍不显著且依赖 ASR 时间戳质量。
该工作在西班牙语德语捷克语帕金森语音上对比语音大模型的编码器表示解码器表示与零样本生成,报告编码器优于解码器而生成接近随机,并用样本自适应层聚合代替单层搜索,但跨语言绝对性能仍明显低于多语言混合训练。
该研究把气道狭窄检测做成患者级多录音分类,用冻结的 WavLM 第 15 层表示加 TransMIL 聚合,在 748 人五折交叉验证中报告 AUROC 为 0.952 与准确率为 0.924,而细粒度分型与严重度分级仍明显更难。
该研究只用语音音频区分阿尔茨海默病与健康对照,用 Librosa 手工声学均值特征与冻结 YAMNet 的 1024 维嵌入拼接后训练分类器,在 160 条合并数据上以 70% 训练 30% 测试取得 89% 测试准确率,代价是小样本、无人口学控制且未报告延迟与误判细节。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该试点以 9 名乳腺癌幸存者和 13 名健康对照的叙事语音比较韵律特征与 MFCCs,用逻辑模型树加十折交叉验证报告 86% 对 82% 的准确率,代价是 MFCCs 需 11 个系数且临床可解释性不足。
针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究用地图任务比较 5 名轻中度阿尔茨海默病女性与 5 名健康老年女性的意大利语元音共振峰,发现 F1 与 F3 存在组间差异并呈轻微元音空间扩张趋势,但样本仅 10 人且 FCR 差异不显著,不能作为确诊依据。
针对清醒脑肿瘤手术中电刺激引起的短暂构音障碍难以实时听辨的问题,论文提出录音去噪加 Whisper 切分加 MFCC 加 GRU 的二分类方法,在计数与 DO80 任务上报告约 90% 以上验证精度,但合并任务出现过拟合且异常样本仍偏少。
该研究用可解释的韵律声学特征加树模型做说话人级自闭症与典型发育分类,芬兰语内准确率 0.84 而跨语迁移差异大,说明基频分布部分通用但谱特征依赖语言且录音条件不齐。
该研究不做端到端疾病分类,而是构建覆盖说话人日志、轮次结构、识别对齐与韵律计量的临床增强工具,并在 18 例躁狂住院患者的 5.6 小时纵向访谈中报告发音速率等四项时序指标与症状显著相关,代价是仍需人工校对且多语言与角色泛化待验证。
该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。
该研究以朗读语段检验频谱变化快尺度与语调短语慢尺度之间的跨尺度相干,发现 ALS 组在语调短语起点频率附近的成对相位一致性显著低于对照组,而语调短语起点频率本身及其变异性无组间差异,提示计划相对保留而启动执行环节受损,但样本小且仅为朗读。