真浊塞音一定压低基频吗:坦头闽南语四个声调里的反例
以坦头闽南语清、不送气塞音、真浊塞音与鼻音三重最小对立为对象,用广义加性混合模型检验四个声调的辅音微扰效应,发现三个声调符合鼻音高于清音高于浊音而升调 35 呈现浊音最高的反转,且鼻音后整体基频意外偏高。
以坦头闽南语清、不送气塞音、真浊塞音与鼻音三重最小对立为对象,用广义加性混合模型检验四个声调的辅音微扰效应,发现三个声调符合鼻音高于清音高于浊音而升调 35 呈现浊音最高的反转,且鼻音后整体基频意外偏高。
该研究用自动标注从 200 篇儿童文本中抽出 129608 个法语补唇语钥匙并统计 10 个音位变量,为按学习复杂度挑选视频胶囊提出可复算的排序依据,但尚未完成聋人学习者验证。
本研究以 6 名平良老年双语人的 760 个可用片段为证据,用中间段共振峰与随时间变化的振幅距离说明摩擦元音同时具有高央元音的共振峰位置和不同于擦音的摩擦时间形态,因而不能简单归为高央元音或音节擦音。
该研究以法语词库最小对立为对象,用词频加权且只差一个区别特征的计数估计音位、对立和特征的功能负荷,显示音节首与韵尾、词首词尾的排序差异很大,而归一化与转写选择是主要代价与限制。
针对小频移下谱平均被抹糊的问题,该文把熵正则 Wasserstein 重心约束为给定阶数全极点谱,用 Sinkhorn 加反射系数参数化梯度下降求解,在 TIMIT 五音素上以平衡准确率与 F1 略优于非参数重心,但优化非凸只能得到次优平稳点。
针对固定帧与浊音基音周期非整数比造成频谱失真的问题,该文用声门闭合时刻定帧界并重采样到统一时频网格,在 TIMIT 音素分类上以 6 ms 表观支撑达到 47.3% 准确率,超过 24 ms 固定帧的 46.8%,代价是依赖 GCI 估计与二维插值且未建模上下文。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究针对波兰儿童浊卷舌擦音发音部位分类,用支持向量机比较梅尔倒谱、谱描述子、摩擦噪声与新提出谱比值特征及多种特征选择方法,最强证据是梅尔倒谱加谱描述子加谱比值配合套索选择达到灵敏度 0.72 与特异度 0.81,代价是小样本与类别不平衡下的稳定性仍需更多验证。
论文以 96 个语言的类比成功率与声码器重合成声学测量为证据,说明自监督语音模型以线性方向编码音系特征并以向量尺度连续控制实现程度,但合成效果仍受声码器与上下文切分条件限制。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文在 Archi 与 Kina Rutul 两种东高加索濒危语言上整理约 45 分钟与 75 分钟训练语音并统一为 IPA 转写,对比 CTC 专用模型与 Whisper 及音频大语言模型,发现音素 F1 随对数训练频次呈 S 形增长,而面向语音的专用结构加语言相关词表与平均初始化在可运行条件下取得更低错误率,但稀有复合音素仍近乎无法识别。
该文把群体差异拆成嵌入偏置与嵌入方差,用单群体训练的线性音素探针检验偏置、用同音素近邻距离检验方差,发现方差与识别错误稳定相关而同域训练收益有限,且领域增强对抗微调未改变两项几何指标。
针对无文字低资源语言难以从原始音频发现音素单元的问题,该工作在 HuBERT 基础上用 55 语言的发音特征与音素监督做多语言续训,再以 ABX 可辨别性检验上下文不变性,最强有监督自适应在开发集与测试集取得 3.07% 与 3.39% 的平均误差,但自监督与有监督之间仍有差距且评估集中于 ABX。
POWSM 用同一注意力编码器解码器结构统一完成音素识别、语音识别、带音频的字转音与音转字四项任务,在未见语言上取得可比最优的音素错误率,但多任务对域内识别的增益并不稳定且仍偏向高资源语言。
PRiSM 把音素实现识别拆成转写准确与转写探针加表示探针两类下游使用来考,证据显示多语言覆盖与编码器加 CTC 更稳定而专用模型仍领先大音频语言模型,但以声学保真与任务依赖为代价。
针对端到端转写丢失时间信息的问题,该研究用谱重力初始化加截止时间限制的期望最大化估计每帧共振峰并做语音切分,在爱尔兰语、特威语和沃提克语上以零样本方式取得高同质性和可比的归一化互信息,但对鼻音和滑音等过渡音仍存在过切分代价。
该文把音位识别错误转到 39 维区别特征空间做可复述诊断,报告跨 12 种语言替换错误中位距离 4 对随机基线 9、平均差约 2.8 且 PS 约 0.64,代价是只分析替换错误并依赖 soundvectors 特征与自举区间判断。
该研究用 10982 词、84932 条语义维度标注检验多模态大模型能否从发音形式推断意义,发现模型在多数维度上超过 0.50 基线并在深层更关注标志性音素,但与人类的维度分布仍有明显差距。
针对严重噪声下生成式增强容易编造内容与音色的问题,PASE 把预训练 WavLM 蒸馏成去噪专家并用高低层双流重建波形,在自建 LibriTTS 低信噪比集上把内容错误压到更低,同时以双流声学条件把说话人相似度拉回可用水平,代价是浅层声学流会带入残留噪声并拉低部分感知分。