多数类准确率会骗人:自然脊柱门诊普通话语音的开源情感识别为何在少数情绪上失效
在 65 条自然脊柱门诊普通话话语上比较 emotion2vec+、SenseVoice 与 FunASR 三套开源语音情感识别,以研究者共识为参照,发现非加权准确率 55.4%-61.5% 掩盖了少数情绪接近零的召回与仅约 24% 的样本加权准确率,代价是标注噪声大与类别极不平衡下无法直接部署。
在 65 条自然脊柱门诊普通话话语上比较 emotion2vec+、SenseVoice 与 FunASR 三套开源语音情感识别,以研究者共识为参照,发现非加权准确率 55.4%-61.5% 掩盖了少数情绪接近零的召回与仅约 24% 的样本加权准确率,代价是标注噪声大与类别极不平衡下无法直接部署。
针对开放回答口语缺少准确度、流利度、韵律逐句标注的问题,OpenEnded 用 1000 条三人标注测试集加 6109 条训练与 2673 条开发伪标签支撑评估,并以冻结骨干加三头评分的 VoxPA 为更强基线,但伪标签偏向中间分且低分常与无语音绑定。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对连续语音韵律短语标注耗时问题,论文提出依赖完整主流美式英语 ToBI 训练的加速分组标注法 Rapid-ToBI,报告双人三分类一致性 κ=.87 而 Wavelet 在中间短语处漏检 78.5%,代价是仍需受训标注员且仅在约十分钟奥巴马讲话上验证。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
针对 MOCHA-TIMIT 文件名与内容不一致且缺乏统一音素与韵律标注的问题,作者用 Whisper 校对加人工质检加英式英语 MFA 强制对齐生成 8 层标注,在 msak0 和 fsew0 共 920 句人工标注上达到约 80.4%-80.5% 音素分类正确率与 14.0-15.9 毫秒边界平均误差,但 19.5% 残余混淆仍集中在元音长短、双元音与连 …
该研究在法兰西岛 2018-2025 年读词孤立词任务中检验性别对摩擦性增音的影响,基于 434 条以/i/结尾的录音和逐条有无标注,发现录音层面的混合模型显示男性录音显著更多,而人均比例模型不显著,代价是仅 22 人且未做声学参数测量。
该研究在法语朗读任务中比较言语失用症、帕金森构音障碍、小脑性共济失调构音障碍与典型对照的韵律成组,报告显示三组都保留四级边界与两级节奏突显的清单但分布不同,而失用症组以过多边界和词内边界形成最碎的切分。
该研究以重音结尾的节奏组为锚点比较四种教学干预,报告显示本体感觉干预在半自发话语中减少不流利并稳定重音手势同步,但样本仅 12 人且起跑线不齐,推广需谨慎。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
以半自发话语补全任务比较 18 名保加利亚犹太西班牙语与保加利亚语双语者及 18 名单语者,报告是非问句多以高边界结尾、特指问句多低降、选择问句前升后降的分布,并显示双语者的保加利亚语更接近单语者但仍有 heritage 影响。
论文以哈维《Ricercare una melodia》从 1984 完整记谱到 2003 简化版的知识流失为证据,提出用两层词表与多层监督标注把演奏推理写成可审计约束网络,但明确完整智能体尚未实现且具身感受无法保留。
该工作把古兰经背诵 ASR 转写与标准文本的差异标注为带位置的类型化事件,用可执行评分器同时考核标签与跨度,并报告朴素差分、生产组件适配与编码智能体试点的对照与代价。
针对类别标签难表混合情绪、维度分数难直观解释的问题,该研究把日语表演性情绪语音标注为色相、饱和度、明度并用回归直接预测,留一说话人交叉验证下多任务学习在色相角误差约 29.7 度、饱和度与明度一致性相关系数约 0.560 与 0.803、六分类准确率 90.8% 上同时优于单任务,但结论限于表演性日语与小规模众包标注条件。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究以语义取向的反思性主题分析追踪 NIME 2001-2025 年文献中 touch 一词的显性用法,用 158 篇初检经两轮过滤到 119 篇与 526 条编码的完整链条显示 453 条编码归于应用技术与设计的操作话语,代价是历史与扩展讨论长期稀缺且缺乏概念化。
针对长录音中说话人、韵律、情感与场景需联合标注的问题,论文用全开源的前端加先验加三智能体加有界复核流程组织标注,并在 8.87 小时九类中文主基准上以时间线与固定时间线两套条件报告了可复述的误差与消融代价。
TimeCues Studio 针对多人整库音乐标注与算法迭代脱节的问题,用共享节拍网格加四类标记与多候选加关键度扩展方案统一标注与评测,并在 109 首电子音乐自建库与 3 首 CC0 演示库上走通全流程,代价是首次分轨与特征缓存开销大且算法建议仍需逐条人工复核。