只用三个元音能判断年龄吗:科西嘉塔拉瓦方言的尝试与落空
该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。
该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。
该研究用巴黎两所极端社会位置学校的 36 名 8-10 岁儿童朗读任务,报告了女孩在清塞音 VOT 更长、浊塞音前置浊化更长、H1-H2 更高三项指标上均与成年女性方向一致的性别差异,并显示 VOT 性别差在优势学校更大而嗓音质量性别差在弱势学校更大,代价是样本小、无中间阶层且塞擦化仅做听辨加频谱图二分判断而未做统计检验。
该研究用电磁发音仪追踪 12 名波斯语母语者在背景、宽域、窄域、纠正四种焦点下目标词附近的三维头动,报告随突显度增加位移增大、速度整体抬升且速度曲线呈双峰节拍形态,但个体差异大、多数两两比较仅为趋势而非强证据。
该研究用 8 种权力亲疏负担组合诱发提议句并对整句基频建模,报告面子威胁越高平均基频越低且距离效应最强,但权力呈现反向的局部差异,代价是朗读任务与非完全相同句式限制了自然度。
该研究用德语问答朗读操纵焦点结构与名词语义似然,以词时长为指标,发现窄焦点稳定拉长目标词而语义不搭并未缩小双名词时长差,重复给定词仅在客体位置出现缩短。
论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对二语流利度评估中声学加文本的朴素双模态融合在转写含噪时会低于纯声学基线的问题,论文用声学自监督嵌入加 BERT 文本加六维心理语言学标记的三模态投影加 BiLSTM 融合恢复并超过基线,在 Speechocean762 上达到 82.60% F1、在 Avalinguo 上达到 95.84% F1,代价是依赖转写与三编码器拼接带来的额外计算量。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该研究用 1000 人 227.3 小时四种平行音频与 11 个属性检验说话人属性隐私泄露,显示传统模型与微调后多模态大模型在多属性上明显高于随机猜测,但非语音信号与细粒度属性仍存在显著不确定性与评估代价。
论文提出只用声纹推断八类隐私属性的 HearSay 基准,用 22,064 段真实音频证明模型在性别上平均达到 92.89% 准确率且几乎不拒绝,而思维链推理在强模型上进一步放大泄露,轻量提示防御难以根治生理属性泄露。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
论文指出全局离散符号困惑度把长程语义波动平均进声学判断,提出窗口化与局部化加归一化以及基于真实续写的人评与嵌入裁判评估,并在 SALMon 上以相关性提升与 84.1% 人类差距闭合为证据,代价是依赖转折时刻标注与裁判选择。
本文用范围综述梳理对话语音中可推断的个人与群体属性,指出话轮接管、语言趋同和互动词模式是单人声学之外的新推断通道,并提醒当前推断技术多不讨论隐私防护与威胁模型。
该文以声门源波形为输入、声学韵律聚类为自监督目标、说话人归一化与对抗说话人损失为解耦手段,在音高重建与 ToBI 事件检测上超过 HuBERT-base 与原始韵律基线,并以说话人识别准确率大幅下降为代价证明了解耦效果。
该研究把冻结的语音编码器、投影器和大语言模型连成三阶段流水线,用多头分类器探测说话人属性在各阶段的可恢复性,并用频谱对抗掩蔽选择性压制目标属性,最强证据是编码器端说话人标识准确率从 0.51 降到 0.01 而词错误率几乎不变,代价是越抽象的表示越难控且情感属性跨数据集不稳定。
针对流利度评分既要看整体节奏又要抓局部停顿且等级有序的问题,该研究用专家特征锚定 Whisper 时序表示做深度融合,并用距离感知的顺序平滑损失建模等级远近,在 SpeechOcean762 上报告 83.40% 准确率,代价是依赖冻结声学表示与有限人群验证。
论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。
针对音素到词到语句单向建模不足与分层加深导致初始编码遗忘问题,论文提出双向交互注意力加残差分层的 HIA 框架,在 speechocean762 上以音素词句多指标领先为证据,代价是小数据下增大容量反而难优化。