speechprosody-2026 论文深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究用听觉启动加默读选择任务检验含 only 歧义句的信息结构启动,报告显示动词重音启动提高了非常见动词关联选择,而去词汇与自然启动的效果差异取决于工作记忆与听觉想象等个体差异,但总体启动并不稳定且代价是条件依赖性强。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该研究把 Prosody Assessment 的 8 个接受性与 4 个表达性子测验搬到远程 Qualtrics 上,用 224 名 4-13 岁典型发展儿童和 48 名 4-17 岁自闭症儿童检验年龄敏感性与组间差异,最强证据是典型组除表达性升降调外均随年龄显著进步而自闭症组在情感与语用子测验上显著落后,代价是无常模、表达性评分标准模糊与部分任务存在文化 …
该研究用法语同音词增量猜测任务检验共情是否影响核前韵律线索的在线利用,发现只有高共情者在听到 J'ai une 和同音词后随试次推进对对比含义的准确率上升,而低共情者停留在确认偏好或无分化,代价是确认含义准确率下降且任务依赖学习过程。
该研究用 152 人三组标签对照检验镇静与振奋两类情绪音乐,显示人作音乐被评更有效而偏好更偏向 AI,且误标驱动偏好,振奋高唤醒场景下人作优势更明显,代价是刺激仅 4 首且质性编码为单人。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对音频问答依赖短线索和文本捷径的问题,AUDITA 用 9690 个人类撰写的真实音频 trivia 题加项目反应理论分析,显示人类自由作答 32.13% 而模型平均仅 8.86%,代价是题源偏英语 trivia 且人类基线为非专家抽样而非能力上限。
AdoDAS 在不分发未成年人原始音视频的前提下提供 6000 人四会话的匿名化表征与文本,要求在隐藏测试集上完成 D/A/S 二分类筛查与 21 项 DASS-21 序数预测,音视频基线均值 F1 为 0.4604、均值 QWK 为 0.2675,最优提交分别达到 0.5921 和 0.2776,但提升主要来自时序多模态与跨会话建模而非原始编码器规模。