论文解读

多数类准确率会骗人:自然脊柱门诊普通话语音的开源情感识别为何在少数情绪上失效

在 65 条自然脊柱门诊普通话话语上比较 emotion2vec+、SenseVoice 与 FunASR 三套开源语音情感识别,以研究者共识为参照,发现非加权准确率 55.4%-61.5% 掩盖了少数情绪接近零的召回与仅约 24% 的样本加权准确率,代价是标注噪声大与类别极不平衡下无法直接部署。

 · 约 18 分钟 · 8817 字 阅读 →
论文解读

开放回答也要逐句打分:OpenEnded 用人工测试集约束伪标签训练

针对开放回答口语缺少准确度、流利度、韵律逐句标注的问题,OpenEnded 用 1000 条三人标注测试集加 6109 条训练与 2673 条开发伪标签支撑评估,并以冻结骨干加三头评分的 VoxPA 为更强基线,但伪标签偏向中间分且低分常与无语音绑定。

 · 更新于 2026-09-24 · 约 20 分钟 · 9580 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

又快又要分清两级短语:Rapid-ToBI 只做分组判断的取舍

针对连续语音韵律短语标注耗时问题,论文提出依赖完整主流美式英语 ToBI 训练的加速分组标注法 Rapid-ToBI,报告双人三分类一致性 κ=.87 而 Wavelet 在中间短语处漏检 78.5%,代价是仍需受训标注员且仅在约十分钟奥巴马讲话上验证。

 · 更新于 2026-09-24 · 约 15 分钟 · 7468 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

文件名对不上内容、全员标注缺失:把 MOCHA-TIMIT 九个说话人重新对齐

针对 MOCHA-TIMIT 文件名与内容不一致且缺乏统一音素与韵律标注的问题,作者用 Whisper 校对加人工质检加英式英语 MFA 强制对齐生成 8 层标注,在 msak0 和 fsew0 共 920 句人工标注上达到约 80.4%-80.5% 音素分类正确率与 14.0-15.9 毫秒边界平均误差,但 19.5% 残余混淆仍集中在元音长短、双元音与连 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9942 字 阅读 →
论文解读

读词末尾多出来的摩擦音:法兰西岛 /i/ 尾语料中性别效应偏向男性一侧

该研究在法兰西岛 2018-2025 年读词孤立词任务中检验性别对摩擦性增音的影响,基于 434 条以/i/结尾的录音和逐条有无标注,发现录音层面的混合模型显示男性录音显著更多,而人均比例模型不显著,代价是仅 22 人且未做声学参数测量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8914 字 阅读 →
论文解读

都用边界和重音断句,为何运动性言语障碍的切分轮廓仍然不同

该研究在法语朗读任务中比较言语失用症、帕金森构音障碍、小脑性共济失调构音障碍与典型对照的韵律成组,报告显示三组都保留四级边界与两级节奏突显的清单但分布不同,而失用症组以过多边界和词内边界形成最碎的切分。

 · 更新于 2026-09-24 · 约 21 分钟 · 10463 字 阅读 →
论文解读

法语节奏不是重音位置:意大利学习者如何协调重音、句法与手势

该研究以重音结尾的节奏组为锚点比较四种教学干预,报告显示本体感觉干预在半自发话语中减少不流利并稳定重音手势同步,但样本仅 12 人且起跑线不齐,推广需谨慎。

 · 更新于 2026-09-24 · 约 20 分钟 · 9744 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

濒危遗产语还分得清三种问句吗:保加利亚犹太西班牙语的问句语调

以半自发话语补全任务比较 18 名保加利亚犹太西班牙语与保加利亚语双语者及 18 名单语者,报告是非问句多以高边界结尾、特指问句多低降、选择问句前升后降的分布,并显示双语者的保加利亚语更接近单语者但仍有 heritage 影响。

 · 更新于 2026-09-24 · 约 19 分钟 · 9501 字 阅读 →
论文解读

留不住的不只是磁带机:用监督标注把哈维的延迟语法写回来

论文以哈维《Ricercare una melodia》从 1984 完整记谱到 2003 简化版的知识流失为证据,提出用两层词表与多层监督标注把演奏推理写成可审计约束网络,但明确完整智能体尚未实现且具身感受无法保留。

 · 更新于 2026-09-24 · 约 23 分钟 · 11421 字 阅读 →
论文解读

什么算错?把背诵转写差异分成错误、修正与可接受形式

该工作把古兰经背诵 ASR 转写与标准文本的差异标注为带位置的类型化事件,用可执行评分器同时考核标签与跨度,并报告朴素差分、生产组件适配与编码智能体试点的对照与代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8221 字 阅读 →
论文解读

用颜色说情绪:把语音情绪变成可回归、可解释的色相、饱和度与明度

针对类别标签难表混合情绪、维度分数难直观解释的问题,该研究把日语表演性情绪语音标注为色相、饱和度、明度并用回归直接预测,留一说话人交叉验证下多任务学习在色相角误差约 29.7 度、饱和度与明度一致性相关系数约 0.560 与 0.803、六分类准确率 90.8% 上同时优于单任务,但结论限于表演性日语与小规模众包标注条件。

 · 更新于 2026-09-24 · 约 17 分钟 · 8482 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

NIME 谈触觉时其实在谈实现:119 篇文献的语义编码与三主题证据

该研究以语义取向的反思性主题分析追踪 NIME 2001-2025 年文献中 touch 一词的显性用法,用 158 篇初检经两轮过滤到 119 篇与 526 条编码的完整链条显示 453 条编码归于应用技术与设计的操作话语,代价是历史与扩展讨论长期稀缺且缺乏概念化。

 · 更新于 2026-09-24 · 约 22 分钟 · 10809 字 阅读 →
论文解读

长录音多维标注如何不推倒重来:以字段级复核做局部修复

针对长录音中说话人、韵律、情感与场景需联合标注的问题,论文用全开源的前端加先验加三智能体加有界复核流程组织标注,并在 8.87 小时九类中文主基准上以时间线与固定时间线两套条件报告了可复述的误差与消融代价。

 · 更新于 2026-09-24 · 约 22 分钟 · 10523 字 阅读 →
论文解读

把模糊边界变成可评测事件:TimeCues Studio 的整库标注与算法共用时间轴

TimeCues Studio 针对多人整库音乐标注与算法迭代脱节的问题,用共享节拍网格加四类标记与多候选加关键度扩展方案统一标注与评测,并在 109 首电子音乐自建库与 3 首 CC0 演示库上走通全流程,代价是首次分轨与特征缓存开销大且算法建议仍需逐条人工复核。

 · 更新于 2026-09-24 · 约 22 分钟 · 10650 字 阅读 →