论文解读

既像元音又有摩擦噪声:平良方言摩擦元音为何不能归为一类

本研究以 6 名平良老年双语人的 760 个可用片段为证据,用中间段共振峰与随时间变化的振幅距离说明摩擦元音同时具有高央元音的共振峰位置和不同于擦音的摩擦时间形态,因而不能简单归为高央元音或音节擦音。

 · 更新于 2026-09-25 · 约 18 分钟 · 8753 字 阅读 →
论文解读

降阶重音真的更省力吗:用瞳孔扩张检验可及与全新语境下的韵律适配

该研究用瞳孔扩张这一在线认知负荷指标检验主流美国英语中降阶轮廓与信息状态的适配关系,最强证据是全新语境配高星重音时扩张最大、可及语境配降阶时扩张最小,代价是刺激经重合成且匹配试次重复呈现使生态效度受限。

 · 更新于 2026-09-25 · 约 17 分钟 · 8089 字 阅读 →
论文解读

句末先嘎吱后清化:伊纳里萨米语中清化时长随词长增长而嘎吱不跟随

该研究以四名母语者的朗读句末双、三、四音节词为对象,测量清化与嘎吱段时长,发现清化时长随词长增加而变长且被前置嘎吱压缩,而嘎吱时长无此规律,代价是样本小、仅朗读体且一人模式明显不同。

 · 更新于 2026-09-25 · 约 17 分钟 · 8236 字 阅读 →
论文解读

用伪词堵住语言补偿之后,可懂度评分还变吗

该研究用 80 名口腔与口咽癌患者的伪词解码任务检验可懂度评分是否随词表、面对面与远程场景和评估者经验而变,结果显示词表与场景无显著差异而重度损伤段专家评分幅度更收敛,但专家效应仍是待解释的代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9127 字 阅读 →
论文解读

位置不同,对立的作用就不同:法语功能负荷的位置依赖解读

该研究以法语词库最小对立为对象,用词频加权且只差一个区别特征的计数估计音位、对立和特征的功能负荷,显示音节首与韵尾、词首词尾的排序差异很大,而归一化与转写选择是主要代价与限制。

 · 更新于 2026-09-25 · 约 16 分钟 · 7892 字 阅读 →
论文解读

只用三个元音能判断年龄吗:科西嘉塔拉瓦方言的尝试与落空

该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。

 · 更新于 2026-09-25 · 约 19 分钟 · 9233 字 阅读 →
论文解读

青春期前就有性别口音:8-10 岁儿童 VOT、嗓音质量与 t/d 塞擦化的阶级分化

该研究用巴黎两所极端社会位置学校的 36 名 8-10 岁儿童朗读任务,报告了女孩在清塞音 VOT 更长、浊塞音前置浊化更长、H1-H2 更高三项指标上均与成年女性方向一致的性别差异,并显示 VOT 性别差在优势学校更大而嗓音质量性别差在弱势学校更大,代价是样本小、无中间阶层且塞擦化仅做听辨加频谱图二分判断而未做统计检验。

 · 更新于 2026-09-25 · 约 18 分钟 · 8943 字 阅读 →
论文解读

先抹掉再贴上:用颤音匹配把齐奏混音藏成一个声源

该文研究齐奏混音中不同颤音模式暴露多声源的问题,提出先抑制目标颤音再从源信号迁移频率调制与分谐波幅度调制加残差谱包络调制的方法,以声谱图示例和同命运变换分离失效为证据,代价是尚无听音实验与客观分离指标量化。

 · 更新于 2026-09-25 · 约 18 分钟 · 8865 字 阅读 →
论文解读

看得见的重音:波斯语焦点越强,头部摆动越大越快

该研究用电磁发音仪追踪 12 名波斯语母语者在背景、宽域、窄域、纠正四种焦点下目标词附近的三维头动,报告随突显度增加位移增大、速度整体抬升且速度曲线呈双峰节拍形态,但个体差异大、多数两两比较仅为趋势而非强证据。

 · 更新于 2026-09-25 · 约 22 分钟 · 10692 字 阅读 →
论文解读

面子威胁越高声音越低吗:用整句语调曲线检验墨西哥西班牙语提议的礼貌

该研究用 8 种权力亲疏负担组合诱发提议句并对整句基频建模,报告面子威胁越高平均基频越低且距离效应最强,但权力呈现反向的局部差异,代价是朗读任务与非完全相同句式限制了自然度。

 · 更新于 2026-09-25 · 约 18 分钟 · 9003 字 阅读 →
论文解读

先把法语语音从 WavLM 还原出来:层选择与对抗监督决定重建上限

论文把法语 WavLM 到波形的重建作为连续语音转换的前置步骤,对比只用谱损失与加入多周期多尺度对抗监督的 HiFi-GAN vocodeur,并在 15 个未见说话人样本上用谱、感知和基频指标验证对抗监督带来一致增益,同时以可学习的层融合分析各层贡献。

 · 更新于 2026-09-25 · 约 18 分钟 · 8797 字 阅读 →
论文解读

中性爱尔兰语合成句能否只改嗓音源就听出喜怒:全局与重音局部变换的叠加检验

该研究以一句爱尔兰语男声合成中性句为基线,只按真人情感录音改造嗓音源参数并叠加语速与共振峰,用全局、重音局部与组合三类刺激做听辨,发现组合识别率最高而高激活情感区分更清晰,低激活情感则互相混淆。

 · 更新于 2026-09-25 · 约 19 分钟 · 9405 字 阅读 →
论文解读

一部手机如何托住一条嗓音:VoixTenue 的手势音高与力度控制

VoixTenue 把触屏纵向画线与手机俯仰横滚倾角映射为 Pink Trombone 的基频与强度,在 E2-E5 三组八度内以约 60 Hz 更新实现全机端实时嗓音合成,代价是触屏模式暂缺力度控制而倾角模式音高精度较低且未经被试实验验证。

 · 更新于 2026-09-25 · 约 21 分钟 · 10094 字 阅读 →
论文解读

什么算错?把背诵转写差异分成错误、修正与可接受形式

该工作把古兰经背诵 ASR 转写与标准文本的差异标注为带位置的类型化事件,用可执行评分器同时考核标签与跨度,并报告朴素差分、生产组件适配与编码智能体试点的对照与代价。

 · 更新于 2026-09-25 · 约 17 分钟 · 8221 字 阅读 →
论文解读

焦点拉长时长,语义似然却未必:德语朗读实验中的时长编码

该研究用德语问答朗读操纵焦点结构与名词语义似然,以词时长为指标,发现窄焦点稳定拉长目标词而语义不搭并未缩小双名词时长差,重复给定词仅在客体位置出现缩短。

 · 更新于 2026-09-25 · 约 16 分钟 · 7981 字 阅读 →
论文解读

不均匀噪声下同时算出传递函数与各通道噪声:可学习的确定性最大似然波束形成

针对麦克风间距未知、增益未校准且各通道噪声功率不同的自组织阵列,论文用确定性最大似然把语音序列与传递函数的闭式解代入似然,只留对角噪声协方差做数值优化,在 4 通道 LibriSpeech 仿真上把阵列信噪比做到 21.18/20.63 dB 而逼近已知噪声的广义特征值波束形成上限,代价是每条语音单独迭代约 2000 轮且混响下客观可懂度与音质提升有限。

 · 更新于 2026-09-25 · 约 22 分钟 · 10633 字 阅读 →
论文解读

稀疏程度随房间而变:把最小二乘加多重稀疏约束的模型族展开为可学习的 ADMM 网络

针对语音激励、混响与噪声变化下的批量声学系统辨识,该工作把最小二乘加多重稀疏约束的参数化模型族用交替方向乘子法求解并展开为 ADMM-SysIDNet,在 Bar-Ilan 实测房间冲激响应与 LibriSpeech 激励下以归一化均方偏差为指标优于最小二乘和 ADMM-ℓ1,代价是依赖分混响条件的离线训练与批量观测流程。

 · 更新于 2026-09-25 · 约 21 分钟 · 10068 字 阅读 →
论文解读

低信噪比谐波噪声下先做循环平稳波束形成再做神经网络去噪

针对旋转机械主导的低信噪比谐波噪声,该文用单通道循环平稳最小功率无失真响应做前端抑制谐波再接轻量掩蔽网络,在合成与真实发动机噪声上报告了一致提升,但维纳滤波对照显示增益互补而非可替代,且依赖噪声频率稳定可估计。

 · 更新于 2026-09-25 · 约 17 分钟 · 8446 字 阅读 →
论文解读

不改模型也能治啸叫:用啸叫与降噪混合数据微调语音增强网络

该工作把预训练实时语音增强网络用离线合成啸叫样本加原始降噪数据联合微调,报告显示 60% 啸叫加 40% 降噪配比在在线啸叫抑制上明显提升而降噪 PESQ 仅从 2.564 降到 2.556,代价是 75% 高啸叫配比时 PESQ 降到 2.47 且 SDR 从 17.62 降到 16.79。

 · 更新于 2026-09-25 · 约 20 分钟 · 9690 字 阅读 →
论文解读

在嘴型与动作抢注意力时,如何让化身在正确时间做正确动作

ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10172 字 阅读 →