论文解读

声带不振动时,法语清浊对立靠时长和邻音保住,但塞音连缀会中和

该研究以法语单音节与双音节无意义词为材料,用声学时长与喉头仪信号加听辨实验检验耳语中清浊对立的保持机制,最强证据是耳语仍可听辨且时长对比基本保留,代价是塞音后接口塞音时尾音节清浊时长对比消失。

 · 更新于 2026-09-24 · 约 19 分钟 · 9098 字 阅读 →
论文解读

转录文本里的停顿与问答为何比语义向量更能分开自闭症与发育迟缓

该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9496 字 阅读 →
论文解读

转换来的嗄声能当真病人用吗:Seed-VC 扩增的临床可信度检验

该研究用 Seed-VC 把健康对照的持续元音转换成癌与良性黏膜病变的嗄声并请专家做 GRBAS 与四级可信度评定,结果显示转换声不总被判为人工但仍可被感知且常规声学差值解释不了,提示先别直接拿去训练分类器。

 · 更新于 2026-09-24 · 约 20 分钟 · 9532 字 阅读 →
论文解读

把声音变成可比的痕迹:从电磁记录到光学比较与乐器模型

本文沿录制、测量与可视化三条动作重走从奥斯特电磁实验到爱迪生留声机、利萨如与柯尼希与亥姆霍兹光学装置、再到长笛与管风琴羽管键琴类比与斯特鲁伊肯单弦测听计的链条,最强证据是可用装置参数与操作步骤的原文对应,代价是它不提供可运行的定量比较实验与误差统计。

 · 更新于 2026-09-24 · 约 20 分钟 · 9838 字 阅读 →
论文解读

从逐帧鼻音概率到说话人指数:滑动窗口聚合在连续法语中的稳定与混杂

该研究以 wav2vec 2.0 第四层表示加 1024 单元多层感知器做鼻音二分类,用 50 毫秒窗与 10 毫秒步在无音位标注的连续法语上逐窗打分再聚成说话人指数,在 23 名说话人的朗读与自发配对比较中全局平均最简单稳定而语境归一化更可比,但分数仍与基频等总体嗓音特征纠缠而特异性待验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10371 字 阅读 →
论文解读

音素串能否替代专家打分:17 个法语预训练模型的域内精度与病理跨域对照

该文把 17 个 Wav2vec 2.0、HuBERT 和 Whisper 模型统一微调为法语 35 音素识别器,先在 Common Voice 健康语音上建立基线,再冻结模型到 111 例 C2SI 病理语音上测跨域衰减与临床相关,最强证据是 Wav2vec 2.0 以 6,2% 错误率领先且错误率与人工评分高达 0,88 和 0,91 相关,但最低错误率 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7862 字 阅读 →
论文解读

多语多设备之下帕金森构音障碍检测为何跨库就失效:冻结声学模型加多库训练的取舍

该研究以二分类检测特发性帕金森病的运动性言语障碍为问题,用冻结的 Wav2Vec 2.0 XLS-R 加 128 维多层注意力分类头做跨库评估,最强证据是三库联合训练在未见过的 MDVR-KCL 上达到 85.3% AUC 并避免单库模型的跨库崩塌,代价是对低 UPDRS 评分和 OFF-DOPA 条件的患者仍明显更难检出且结果受随机划分影响大。

 · 更新于 2026-09-24 · 约 19 分钟 · 9479 字 阅读 →
论文解读

不识别情绪类别,只跟踪状态漂移:用效价唤醒优势曲线看接警员是否还在状态

该研究把接警员投入度与心理灵活性下降转写为可实时跟踪的声音心理生理状态变化,用预训练模型输出效价唤醒优势三轴曲线先在中性到非中性合成序列上验证再在真实接警录音上试探,合成条件下变化可被标出而真实通话结果混杂因而需要更多通话特征。

 · 更新于 2026-09-24 · 约 20 分钟 · 9996 字 阅读 →
论文解读

四人声嘈杂中听句子的青春期改善:抑制反应时部分传递年龄效应

本研究以法语快速噪声言语测试固定四人声嘈杂条件追踪 10 岁至 20 岁九个月正常听力者的 RSB50,报告随年龄平均改善 1,93 dB 并以中介模型显示 Stroop 不一致条件反应时解释 20,5% 的总效应而数字广度无显著路径,代价是熟悉度顶格与横断面设计无法确立因果。

 · 更新于 2026-09-24 · 约 23 分钟 · 11487 字 阅读 →
论文解读

可读难了,机器还能听准吗:可听性中结构复杂度与识别错误的解耦

该研究以 CLEAR 文本经合成语音再由 Whisper Tiny 识别为链路,用全局可读性指数与词错误率检验文本复杂度是否影响识别,最强证据是转写前后指数相关 0.97 而指数与错误率相关仅 0.03 且回归无法预测,代价是人类判断仍保留约负 0.28 的相关而未做真人听测验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8739 字 阅读 →
论文解读

不会写脚本也能用 PsyToolkit:DYE 把感知评测做成图形化拼装

针对非专家用户难以编写 PsyToolkit 脚本的问题,DYE 用 R 与 Shiny 图形界面拼装强迫选择与李克特量表并生成可直接导入编译的代码与图片,代价是目前仅覆盖 PsyToolkit 有限子集且多元素需顺序呈现。

 · 更新于 2026-09-24 · 约 17 分钟 · 8118 字 阅读 →
论文解读

读词末尾多出来的摩擦音:法兰西岛 /i/ 尾语料中性别效应偏向男性一侧

该研究在法兰西岛 2018-2025 年读词孤立词任务中检验性别对摩擦性增音的影响,基于 434 条以/i/结尾的录音和逐条有无标注,发现录音层面的混合模型显示男性录音显著更多,而人均比例模型不显著,代价是仅 22 人且未做声学参数测量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8914 字 阅读 →
论文解读

广播里混着音乐和重播,编码器该吃什么:法语语音自监督的数据选择对照

该研究从法国电视广播档案出发固定编码器与训练步数,只改变一千小时预训练子集的成分,再用语音识别与语音音乐检测等下游对照检验成分效应,结果显示去音乐有助于识别而多样内容有助于兼顾语音与音乐,重复则同时带来识别下降与记忆上升。

 · 更新于 2026-09-24 · 约 21 分钟 · 10452 字 阅读 →
论文解读

自发性病理语音转写为何随严重程度分化:以 CER 为轴的多层次误差解读

该研究以 27 例唇口咽癌后自发对话语音检验 Whisper large 转写,发现字符错误率与感知严重度呈强负相关并以 50% 为界分出两组,重度组多层错误率平均高约 42.82%,其中词法与句法层代价最大而纯词性类别差异最小。

 · 更新于 2026-09-24 · 约 22 分钟 · 10522 字 阅读 →
论文解读

把百科知识换成一张图:用句子验证任务测言语可理解度

该研究把句子真假判断改为听句看单图做符合判断,用正常、戴咬合块、咬合块加鸡尾酒噪声三条件验证敏感性,用 1.0 版 87.7% 与 1.1 版 97.9% 的正常条件正确率暴露并修复图像歧义问题。

 · 更新于 2026-09-24 · 约 20 分钟 · 9632 字 阅读 →
论文解读

对齐到文本之后,说话人信息去哪了:残差、层权重与注意力权重的三路核查

论文追问句级语音语义向量是否还残留可用的说话人信息,用与各自对齐几何一致的音频减文本残差做无监督聚类检验,并用冻结编码器的说话人分割层权重与帧级注意力分布定位信息位置,最强证据是按句聚类准确率仍高达 0 点 96 以上而按说话人聚类接近随机,代价是该结论只在朗读平行语料与特定分割流程下成立。

 · 更新于 2026-09-24 · 约 21 分钟 · 10092 字 阅读 →
论文解读

不重建声音本身:在潜空间里预测被遮住的法语语音

针对法语语音自监督编码问题,论文用 data2vec 2.0 式师生预测潜表示并引入 10 万小时 INA 电视广播音频,语音多任务上达到或超过 LeBenchmark 基线,但 114k 小时在大模型上在 CommonVoice 验证集未继续降低词错误率。

 · 更新于 2026-09-24 · 约 18 分钟 · 8768 字 阅读 →
论文解读

机器和人耳都会听错年龄:误差从何而来,又靠哪些声学线索解释

该研究用说话人嵌入加回归器做年龄估计,再用成对听辨实验对照人类表现,显示系统误差能预测人耳难易,且双方共享基频等声学线索而人耳额外依赖语速节奏,但数据不均衡与噪声限制了结论外推。

 · 更新于 2026-09-24 · 约 18 分钟 · 8983 字 阅读 →
论文解读

归一化后还能听出发声有多用力吗:从频谱过拟合到自监督表示的跨录音条件泛化

论文复现基于频谱的句级嗓音强度回归并在新录音条件下发现其失效,进而用 Wav2Vec 2.0 浅层表示训练回归器,在 VIC 上把决定系数维持在 0.83 左右,代价是跨条件差距仍未完全消除。

 · 更新于 2026-09-24 · 约 18 分钟 · 8838 字 阅读 →
论文解读

送气主要靠时长,声调约束基频:普通话与阜新话 VOT 与 CF0 的分工与补偿

该研究以普通话和阜新话送气对立为对象,用手动测量的 VOT 与起振后 10 毫秒内 CF0 检验声调如何调制两线索分工,最强证据是 VOT 在四声下稳定区分送气而 CF0 仅在特定声调显著,代价是仅 6 名男声冠音样本且结果限于声学产生层面。

 · 更新于 2026-09-24 · 约 21 分钟 · 10385 字 阅读 →