论文解读

焦点重音放在句首还是句尾:3 到 9 岁儿童如何从随机猜测走向成人式感知

本研究用整句基频全局操纵的 11 步韵律连续统配合儿童 ABX 匹配与成人标识任务,显示 3 岁 1 个月到 5 岁 0 个月随机多变、5 岁 1 个月到 7 岁 0 个月快速建构、7 岁 1 个月后趋稳的三阶段发展,且位置对比、声调与有无语义显著调节进程与终点。

 · 更新于 2026-09-25 · 约 25 分钟 · 12490 字 阅读 →
论文解读

四人声嘈杂中听句子的青春期改善:抑制反应时部分传递年龄效应

本研究以法语快速噪声言语测试固定四人声嘈杂条件追踪 10 岁至 20 岁九个月正常听力者的 RSB50,报告随年龄平均改善 1,93 dB 并以中介模型显示 Stroop 不一致条件反应时解释 20,5% 的总效应而数字广度无显著路径,代价是熟悉度顶格与横断面设计无法确立因果。

 · 更新于 2026-09-25 · 约 23 分钟 · 11487 字 阅读 →
论文解读

升调是谁的:话语语境如何左右普通话声调与语调的判断

该研究用语境一致与不一致对话检验普通话陈述与疑问语调辨认,报告一致配对更快更准、声调 4 与陈述语调独立提高辨认率,而声调 2 疑问句在冲突语境中准确率低但反应相对快,代价是语境预期会覆盖清晰声学线索。

 · 更新于 2026-09-25 · 约 17 分钟 · 8362 字 阅读 →
论文解读

可读难了,机器还能听准吗:可听性中结构复杂度与识别错误的解耦

该研究以 CLEAR 文本经合成语音再由 Whisper Tiny 识别为链路,用全局可读性指数与词错误率检验文本复杂度是否影响识别,最强证据是转写前后指数相关 0.97 而指数与错误率相关仅 0.03 且回归无法预测,代价是人类判断仍保留约负 0.28 的相关而未做真人听测验证。

 · 更新于 2026-09-25 · 约 18 分钟 · 8739 字 阅读 →
论文解读

走快了说也快,说快了走却不快:走路加说话的不对称耦合

该研究让普通话母语者在走 45 米的同时读文章或重复/pɑ/并只改变一侧速度,发现改变步速会连带改变语速而改变语速几乎不改变步速,显示不对称耦合且不支持对称振子互 entrain 的强预测。

 · 更新于 2026-09-25 · 约 20 分钟 · 9620 字 阅读 →
论文解读

把打断与背景声做成可听的监督:DuplexDrama 四阶段合成管线解读

DuplexDrama 针对全双工对话训练数据稀缺问题,用四阶段管线同时合成人设场景、三种全双工行为、表情语音与剧本对齐的声音事件,最强证据是相同语音加背景仅带来 UTMOSv2 与 NISQA 的可控下降,主要代价是全双工轮次占比仅 3.8% 且剧本合理性依赖 LLM 判断。

 · 更新于 2026-09-25 · 约 16 分钟 · 7540 字 阅读 →
论文解读

不会写脚本也能用 PsyToolkit:DYE 把感知评测做成图形化拼装

针对非专家用户难以编写 PsyToolkit 脚本的问题,DYE 用 R 与 Shiny 图形界面拼装强迫选择与李克特量表并生成可直接导入编译的代码与图片,代价是目前仅覆盖 PsyToolkit 有限子集且多元素需顺序呈现。

 · 更新于 2026-09-25 · 约 17 分钟 · 8118 字 阅读 →
论文解读

诗句的停顿不是刻死的:语速一变,双字脚就合并且消失

该研究让 40 名普通话母语者用三种朗诵风格读五言和七言诗联,用当前音节与前一音节时长比估计边界强度,报告慢速诗体中第 2 字和第 4 字处的高边界在日常语速下基本消失,且七言首个双字组从不独立成组。

 · 更新于 2026-09-25 · 约 20 分钟 · 9694 字 阅读 →
论文解读

突出时听者为何反而少用频谱线索:英语紧松元音感知的产生镜像

本研究用 7×7×2 重合成 hid-heed 连续体检验 f0 突显如何改变频谱与时长线索权重,结果显示突显使频谱斜率变平而时长稳定,支持产生镜像而非全局增强,但三阶交互与设计差异仍限制推广。

 · 更新于 2026-09-25 · 约 22 分钟 · 10592 字 阅读 →
论文解读

低频拉长边界而语义场启动缺席:德语边界时长的非对称证据

本研究在德语载体句中并置词汇频率与语义场启动对边界区间时长的影响,报告显示低频在三段边界区间上一致更长而启动总体不显著,代价是当前仅一轮拉丁方小样本与冠词韵尾上小幅反向交互均待全样本验证。

 · 更新于 2026-09-25 · 约 17 分钟 · 8277 字 阅读 →
论文解读

读词末尾多出来的摩擦音:法兰西岛 /i/ 尾语料中性别效应偏向男性一侧

该研究在法兰西岛 2018-2025 年读词孤立词任务中检验性别对摩擦性增音的影响,基于 434 条以/i/结尾的录音和逐条有无标注,发现录音层面的混合模型显示男性录音显著更多,而人均比例模型不显著,代价是仅 22 人且未做声学参数测量。

 · 更新于 2026-09-25 · 约 18 分钟 · 8914 字 阅读 →
论文解读

广播里混着音乐和重播,编码器该吃什么:法语语音自监督的数据选择对照

该研究从法国电视广播档案出发固定编码器与训练步数,只改变一千小时预训练子集的成分,再用语音识别与语音音乐检测等下游对照检验成分效应,结果显示去音乐有助于识别而多样内容有助于兼顾语音与音乐,重复则同时带来识别下降与记忆上升。

 · 更新于 2026-09-25 · 约 21 分钟 · 10452 字 阅读 →
论文解读

自发性病理语音转写为何随严重程度分化:以 CER 为轴的多层次误差解读

该研究以 27 例唇口咽癌后自发对话语音检验 Whisper large 转写,发现字符错误率与感知严重度呈强负相关并以 50% 为界分出两组,重度组多层错误率平均高约 42.82%,其中词法与句法层代价最大而纯词性类别差异最小。

 · 更新于 2026-09-25 · 约 22 分钟 · 10522 字 阅读 →
论文解读

把百科知识换成一张图:用句子验证任务测言语可理解度

该研究把句子真假判断改为听句看单图做符合判断,用正常、戴咬合块、咬合块加鸡尾酒噪声三条件验证敏感性,用 1.0 版 87.7% 与 1.1 版 97.9% 的正常条件正确率暴露并修复图像歧义问题。

 · 更新于 2026-09-25 · 约 20 分钟 · 9632 字 阅读 →
论文解读

对齐到文本之后,说话人信息去哪了:残差、层权重与注意力权重的三路核查

论文追问句级语音语义向量是否还残留可用的说话人信息,用与各自对齐几何一致的音频减文本残差做无监督聚类检验,并用冻结编码器的说话人分割层权重与帧级注意力分布定位信息位置,最强证据是按句聚类准确率仍高达 0 点 96 以上而按说话人聚类接近随机,代价是该结论只在朗读平行语料与特定分割流程下成立。

 · 更新于 2026-09-25 · 约 21 分钟 · 10092 字 阅读 →
论文解读

不重建声音本身:在潜空间里预测被遮住的法语语音

针对法语语音自监督编码问题,论文用 data2vec 2.0 式师生预测潜表示并引入 10 万小时 INA 电视广播音频,语音多任务上达到或超过 LeBenchmark 基线,但 114k 小时在大模型上在 CommonVoice 验证集未继续降低词错误率。

 · 更新于 2026-09-25 · 约 18 分钟 · 8768 字 阅读 →
论文解读

强烈负情绪下高度熟练者也会漏出母语韵律:以音高范围为核心的证据

该研究让 19 名高熟练牙买加英语、卡斯蒂利亚西班牙语和南部标准英国英语说话人在中性、积极、消极条件下用英语做自发与半自发表达,测量语调短语时长、停顿时长、语速、发音速率和音高范围,发现只有消极高强度情绪带来可重复的组间交互且以音高范围变窄最突出,而发音速率不受情绪影响。

 · 更新于 2026-09-25 · 约 18 分钟 · 8865 字 阅读 →
论文解读

巴西口音英语重音:时长缩减不足,响度对比来补

该研究用三音节词朗读任务比较美国母语者和巴西二语者的重音实现,显示母语者时域元音缩减更充分而二语者缩减不足并依赖更大的响度对比和更宽的共振峰分布,基频在两组间均未形成可靠区分。

 · 更新于 2026-09-25 · 约 19 分钟 · 9092 字 阅读 →
论文解读

压低末尾音高峰反而更快:听损者话轮结尾预测中的韵律线索取舍

该研究以自报听力困难的老年听者为对象,用自然、增强末尾重读音节 f0 峰、压低 f0 峰并提前下降三种问句条件做在线按键预测,发现压低条件比增强条件更快更准,而增强峰反而损害预测,同时主观努力与信心因天花板效应未能区分条件。

 · 更新于 2026-09-25 · 约 18 分钟 · 8850 字 阅读 →
论文解读

只给看、不给听的反馈:视觉反馈如何帮普通话人建立粤语声调范畴

该研究用听音辨调加试后三秒视觉反馈的四天训练,检验普通话母语者对粤语六声的即时学习、新说话人泛化和一周保持,并报告音乐能力稳定预测成功而工作记忆只支持初期增益、音高敏感性作用有限,但未分离视觉与反馈各自的独立贡献。

 · 更新于 2026-09-25 · 约 20 分钟 · 9803 字 阅读 →