赢球和输球听得出来吗:用赛后采访捕捉自发情感的语音数据集
该工作把网球赛后发布会视频加工成带说话人角色、转写和词级对齐的自发情感语音语料,并用预训练声学与文本模型做维度回归、离散分类和文本情感三组基准,显示胜者效价与优势感更高、败者悲伤主导更集中,但两组文本多呈积极且 arousal 差异小。
该工作把网球赛后发布会视频加工成带说话人角色、转写和词级对齐的自发情感语音语料,并用预训练声学与文本模型做维度回归、离散分类和文本情感三组基准,显示胜者效价与优势感更高、败者悲伤主导更集中,但两组文本多呈积极且 arousal 差异小。
该研究用 383 名法英双语人的朗读句和 VOCALISE 系统比较单语与双语条件下的似然比分数,发现双语比较显著压低相似度并削弱同一说话人优势,使同人跨语言分数向异人分数靠拢。
该研究以法语合成语音为对象,用强制对齐加共振峰提取得到元音空间面积、元音内离散和元音间距离三类指标,并在系统层用斯皮尔曼相关对照平均意见分,最强证据是元音间高度对比/a-i/与/i-E/在 F1 上显著相关而多边形面积不显著,代价是离散指标整体偏弱且结论限于单语料单说话人风格。
该研究针对越南语词尾不除阻的塞音/p,t,k/难以靠爆破辨认的问题,在 C1VC2 伪词载体句中测量元音后段共振峰与强度过渡,发现即使无爆破仍在 70% 后出现显著分化,但分析目前只限 5 名女性高调发音。
该研究用听觉启动加默读选择任务检验含 only 歧义句的信息结构启动,报告显示动词重音启动提高了非常见动词关联选择,而去词汇与自然启动的效果差异取决于工作记忆与听觉想象等个体差异,但总体启动并不稳定且代价是条件依赖性强。
该研究以普通话与西安话双元音为对象,用广义加性混合模型分离声调贡献并比较基频与第一共振峰极值对齐,再用函数主成分加随机森林只看第一共振峰预测四声,最强证据是跨说话人分类达到普通话 49% 与西安话 43%,代价是只覆盖两个双元音且未直接观测发音运动。
该研究让 36 位母亲在相同指认任务中分别对假想儿童和成人说话,发现对儿童元音更长、音高更高,且困难指认拉长时长、对儿童抵抗二次提及弱化,但音高不随困难升高而是抵抗了列表语调的下降。
针对流式语音识别只能用过去和很小当前块导致词错误率上升的问题,SENS-ASR 用过去帧经上下文模块蒸馏句子嵌入教师得到的语义向量拼接增强每帧表示,在 160 毫秒小块上报告了词错误率下降,但大块和全上下文增益消失且需额外训练教师与上下文模块。
该研究用英语为矩阵语、粤语为嵌入语的对比性焦点产出实验检验韵律层面的混合与超清晰化,报告切换词居中而切回后英语词出现类声调转折与更极端高低目标的主要证据与代价。
本研究在 45 名波士顿 AFAB 英语者中比较朗读与自发两种语域下的平均基频、基频范围、元音离散度和发音速率,报告自发语中女同性恋、双性恋与异性恋组间的系统差异在朗读中被中和,代价是语料量不平衡与整文件聚合掩盖个体与话题变异。
该研究用同一批巴西葡萄牙语自发语音对比人工韵律切分、WhisperX 切分与随机森林韵律切分训练 FastSpeech2 的效果,最强证据是自动韵律切分的 F0 曲线走向接近人工切分,但 70% 合成核轮廓偏离自然语音且焦点位置更分散。
论文把任务定为估计第二句相对第一句在九个反义维度上的印象差向量,对比可解释声学特征、自监督表示与多模态大模型三条路线,报告自监督表示在复杂印象上更稳,而多模态大模型零样本不可靠,代价是单女声优与同文本的强受控条件。
该研究用无语境听辨任务检验普通话四类字面与反语的韵律感知,发现反语批评正确率较高而反语表扬极低,且自闭特质量表得分越高反语表扬越差,但样本仅 20 人且为单一女声录音。
该研究同步采集 12 名巴西葡萄牙语朗读者的音频与下颌垂直位移,比较戏剧艺术组与普通组在散文和诗歌中的发音与下颌运动,发现实验组下颌降幅更大、变异更大、开口速度更快且整体强度变异更高,代价是语速更慢且样本仅 12 人、未做元音高度归一化。
本研究以 56 名 60-70 岁粤语正常认知老人的 EEG 回答 SCD 如何调节言语与音乐的皮层追踪,最强证据是扰乱言语在 theta 与平静音乐在 delta 和 theta 随 SCDS 加重而下降,代价是只在缺乏上下文或鲜明节奏的风格中显现且依赖多协变量校正的线性混合模型。
针对大模型预测高码率语音 token 难、表达性数据难对齐的问题,Kraken 用 25 Hz 单层 VQ 低码率 token 加 LLM 与声码器双路源语音条件,在 150k 小时多任务数据上实现可复述的端到端语音到语音翻译,并在 FLEURS 与 CVSS 上保留说话人与韵律,代价是音频质量指标弱于用理想参考音色的大模型。
该试点研究用实时上移第二共振峰的听觉反馈扰动检验可懂度需求是否增强听觉运动适应,在两名法语被试上未发现系统性效应,只在个别被试上看到与假设一致但不一致的趋势,且暴露了顺序与消洗不彻底的方法局限。
该研究用电磁发音仪测量意大利语四音节伪词中跨辅音元音间距,显示当其中一个元音带重音时元音到元音协同发音减弱且重读元音目标更极端,支持手势缪模型的作用域超出重读音节,但前向与后向效应的不对称仍受重音位置混淆限制。
该研究用两次模仿之间插入元音归类任务是否拉大声学差异来检验二语模仿能否走自动选择性知觉模型的语音模式,预备结果显示组间无显著差异且出现与元音相关的变化模式,不支持语音模式解释并提示音系表征仍在起作用,但样本小、试次损失大导致统计力不足。
该研究以 28 名母语者与汉语双语和三语学习者的朗读与半自发法语为对象,用六个节奏度量比较组别与任务交互,最强证据是元音度量随任务系统性上升而辅音度量保持稳定,代价是仅%V 与半自发下 Varco-V 显示组间偏离且语速未显式建模。