自闭症儿童语音线索跨语言能通用吗:芬兰语、法语和斯洛伐克语的对照分类
该研究用可解释的韵律声学特征加树模型做说话人级自闭症与典型发育分类,芬兰语内准确率 0.84 而跨语迁移差异大,说明基频分布部分通用但谱特征依赖语言且录音条件不齐。
该研究用可解释的韵律声学特征加树模型做说话人级自闭症与典型发育分类,芬兰语内准确率 0.84 而跨语迁移差异大,说明基频分布部分通用但谱特征依赖语言且录音条件不齐。
该研究以/papa/与/papi/中 V1 受 V2 影响的声学距离指数检验预期性 V 到 V 协同发音,发现老年人指数低于年轻人而双任务无显著影响,支持年龄相关资源下降假说而不支持本次双任务过载假说。
论文以法语为实验组、英语为对照组,用复述童话反派台词诱发嘎裂嗓,对比 H1-H2 与 H1*-H2* 与视听定性判断的一致性,报告校正量 H1*-H2* 在英语对照中达 89% 而在法语中仅 72% 且出现双向误判,因此不建议直接移植英语阈值。
该研究用去词汇化朗读检验双语听者仅凭韵律区分印地语和印度英语的能力,再对同一批话语的感知边界做基频、强度、时长和停顿的词级声学分析,最强证据是总体语言识别准确率为 63.5% 且印地语边界分类更依赖相对强度而英语更依赖时长,代价是朗读体、单一切分与小样本朗读者限制了推广。
该研究以美国英语两组同元音句为对象检验窄焦点与宽焦点下的下颌下降量,并以同步 EMA 与 MARRYS 对比设备一致性,最强证据是窄焦点词在 81.6% 话轮中为全句最低点且 DTW 后两系统平均相关 0.97,代价是仅 5 人小样本且旧版 MARRYS 需额外时间对齐。
该研究不做端到端疾病分类,而是构建覆盖说话人日志、轮次结构、识别对齐与韵律计量的临床增强工具,并在 18 例躁狂住院患者的 5.6 小时纵向访谈中报告发音速率等四项时序指标与症状显著相关,代价是仍需人工校对且多语言与角色泛化待验证。
论文追问句末插入央元音后非南方法语延续升调尾部下落是音系还是语音现象,用已有语料分布与声学长度证据和南北对照试产证明应仍标为延续升调并承担尾部高边界调次级关联的代价是南方与非南方需用不同关联方式解释。
该研究把听者重叠贡献分为回馈、协作与打断,把说话人行为分为不变继续、回合内适应与让出,用 300 个人工确认线索对比录音人与 PersonaPlex 的配对延续,最强证据是 66 个协作对中录音人 68.2% 适应而模型仅 34.8%,代价是其余行为分流为不变继续与让出且评估依赖转录打分与受限复现条件。
该研究以法语单音节与双音节无意义词为材料,用声学时长与喉头仪信号加听辨实验检验耳语中清浊对立的保持机制,最强证据是耳语仍可听辨且时长对比基本保留,代价是塞音后接口塞音时尾音节清浊时长对比消失。
该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。
针对多人同时交谈且严重重叠的 MCoRec 任务,该工作用互视分数加语音重叠分数做会话聚类,并用 CTC/attention 与 Whisper 双模型输出融合做识别,在评测集上聚类 F1 达到 0.910,词错误率降到 48.67%,联合误差降到 0.289,代价是依赖几何假设、边界框与抽帧处理。
该研究用 Seed-VC 把健康对照的持续元音转换成癌与良性黏膜病变的嗄声并请专家做 GRBAS 与四级可信度评定,结果显示转换声不总被判为人工但仍可被感知且常规声学差值解释不了,提示先别直接拿去训练分类器。
该研究在 10 名法语 4 岁儿童约 200 小时家庭录音中检验社交情境对说话速度的影响,发现含家庭外成员的小组中语速更快,且身体活动越高语速越慢,支持补偿而非共同唤醒解释。
该研究以朗读语段检验频谱变化快尺度与语调短语慢尺度之间的跨尺度相干,发现 ALS 组在语调短语起点频率附近的成对相位一致性显著低于对照组,而语调短语起点频率本身及其变异性无组间差异,提示计划相对保留而启动执行环节受损,但样本小且仅为朗读。
该研究以芬兰语、法语、斯洛伐克语共 8212 个停顿间语段的 88 维 eGeMAPS 特征经主成分分析降维后用线性混合效应模型检验组别差异,最强跨语言证据是自闭症组整体强度变异更大、嗓音更清晰少气息、动态强度斜率与中心基频更低,代价是数据高度不平衡且法语单语建模无显著结果。
本文沿录制、测量与可视化三条动作重走从奥斯特电磁实验到爱迪生留声机、利萨如与柯尼希与亥姆霍兹光学装置、再到长笛与管风琴羽管键琴类比与斯特鲁伊肯单弦测听计的链条,最强证据是可用装置参数与操作步骤的原文对应,代价是它不提供可运行的定量比较实验与误差统计。
该研究以 wav2vec 2.0 第四层表示加 1024 单元多层感知器做鼻音二分类,用 50 毫秒窗与 10 毫秒步在无音位标注的连续法语上逐窗打分再聚成说话人指数,在 23 名说话人的朗读与自发配对比较中全局平均最简单稳定而语境归一化更可比,但分数仍与基频等总体嗓音特征纠缠而特异性待验证。
该研究以二分类检测特发性帕金森病的运动性言语障碍为问题,用冻结的 Wav2Vec 2.0 XLS-R 加 128 维多层注意力分类头做跨库评估,最强证据是三库联合训练在未见过的 MDVR-KCL 上达到 85.3% AUC 并避免单库模型的跨库崩塌,代价是对低 UPDRS 评分和 OFF-DOPA 条件的患者仍明显更难检出且结果受随机划分影响大。
该研究把接警员投入度与心理灵活性下降转写为可实时跟踪的声音心理生理状态变化,用预训练模型输出效价唤醒优势三轴曲线先在中性到非中性合成序列上验证再在真实接警录音上试探,合成条件下变化可被标出而真实通话结果混杂因而需要更多通话特征。
该文把朗伯德检测做成由干净语音预测诱发噪声级的回归任务,比较卷积、卷积加长短期记忆、变换器编码器三类架构与三类高维表示加六类可解释声学线索的组合,在留出德语数据集上显示卷积加 WavLM 泛化最可靠,而增加音高与谱倾斜能显著降低损失,但中间噪声级与跨数据集泛化仍是主要代价。