英文题目:Understanding Listener Perceptions of AI and Human-Composed Music in Emotional Applications.

会议身份:conference:nime:2026:conference-paper-id:nime2026_115

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理测量 #统计分析 #主观评测 #音乐理解

评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Kimaya Lecamwasam:机构信息未能从会议 PDF 纯文本可靠映射
  • Tishya Ray Chaudhuri:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究任务以器乐片段为输入,输出听者在镇静与振奋两类情绪目标下的偏好选择与情绪效能判断,实际难点在于作者身份感知与声学属性相互交织,且审美喜欢易与治疗有效性相混淆。方法链分为三步:先按镇静与振奋提示分别制备人类作曲与SunoAI生成刺激并保持配器方向可比,其输出进入被试分组聆听环节;再将152名被试随机分入正确标记组、错误标记组与无标记自判组逐首聆听,其输出进入逐首测量环节;随后采集日内瓦音乐诱发情感清单强度评分与成对偏好效能选择,并用多项逻辑回归与混合效应模型串联定量与定性证据。与既往仅比较偏好的标签效应研究不同,本研究关键机制差异在于分离审美偏好与功能效能并检验方向一致性与误标预测力,其实质意义在于避免以偏好替代情绪调节效果的评估校准。在情绪条件比较的评测设置下,无标记组的AI偏好率指标从镇静音乐的AI偏好率指标68.6%降至振奋音乐的AI偏好率指标39.2%。结论适用边界受限于西方调性氛围器乐、短暂暴露与非临床样本,高唤醒下人类优势与低唤醒下相当的结论尚未验证至多体裁与临床人群。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要回答什么?

本文输入是 4 段各 1 分钟的纯器乐:镇静情绪下 AI 一首加人作一首,振奋情绪下 AI 一首加人作一首。AI 由 SunoAI 按同一约 200 词提示生成,人作由 Myndstream 内部作曲家用数字乐器按同样情绪简报写作,生成后 AI 曲只经过一轮生成无后期加工。目标不是比谁更好听一句话,而是把审美选择与情绪功能分开,检验在情绪应用里听者对 AI 与人作的分类、偏好、目标情绪传达效能和情绪共鸣有何不同。

输出是可复述的实验结论与设计建议:人作总体被评更有效,偏好却更均衡且常偏向 AI;标签信念显著拉动偏好;镇静与振奋两类情绪表现不对称;听者把流动、瑕疵、灵魂感当人性证据。复现必须保留的信息包括 152 人、2024 年 9 月 Prolific 经 Qualtrics 施测、3 组标签条件、两类情绪全因子加块内随机、每首后做日内瓦音乐诱发情绪清单强度评分再做偏好与效能二选一、无标注组加判来源、错误组事后告知反标并追问是否改变判断、预注册在开放科学框架、伦理为麻省理工学院人类被试委员会 E-6149。

学习依赖上先理解任务与相关路线,再看方法全景与测量组件,再看构造与分析计算,再看实验条件,最后看结果与反证、复现与收束。教学例子在下文会明确标为例子,例如把偏好比作点菜时觉得哪道顺眼,把效能比作吃后是否真解饿,只是帮助区分概念,不代表论文测了食欲或有对应数值。

此前研究在情绪音乐与 AI 标签上走到了哪里?

情绪敏感 AI 一支关心音乐能否用于健康干预、自适应配乐和个性化推荐,同时强调临床算法要减少偏倚、保护自主与保密并真正有效,文化与 nurture 差异使简单情绪维度映射容易失效。本文承接该路线,但把落点放在听者如何从声音特征读出人性与可信。

生成音乐伦理一支关心版权、训练偏倚、就业与艺术完整性,以及 SunoAI、Udio、Lyria 等系统跨风格生成能力增强后,感知不可区分度上升对署名与可持续性的冲击。本文引用 2025 年 Deezer 与 Ipsos 9000 人调查中 97% 觉得 AI 与人作感知不可区分的报告,意在说明区分难度已是现实前提,但本文不复测该 97%,只在自己四首刺激上测辨别准确率。

已有 AI 与人作比较构成直接对照。Tigre Moura 与 Maw 发现对 AI 的负面态度与低购买意愿并未影响实际听感评分,意见与体验脱节;Hong 等人发现把 AI 当音乐家接受会推高评分,而拟人化本身不直接提高质量分;Zenieris 直接操纵知情与否,知情时人作评分高 80%,不知情时 AI 被偏好约三分之二;Sun 等人发现拟人特征提升能力与温暖感知。

Chu 等人把悦耳与满意度关联;Fernando 等人综述指出情绪真实性仍被怀疑。本文要补的缺口是既往多看偏好少看情绪效能,少系统检验无标注时辨别准确率如何影响后续判断,少区分镇静与振奋,少检验偏好与效能方向一致性,以及误标率是否预测偏好。本文的对照维度因此是同输入四首器乐、同目标镇静振奋、同听后测量,但在标签条件与情绪类型上做组间组内比较,而不是跨数据集比模型生成质量。

要区分的两个判断是什么,假设如何写成可检验形式?

第一个判断是偏好,即更喜欢哪首。第二个判断是效能,即觉得哪首更有效传达目标情绪。两者都以三分类记录:选 AI、选人作、选既不也不清楚。论文把二者放在同一被试同一对歌曲上比较,看是否同向。

偏好 × 情绪效能: 偏好指觉得哪首更好听、更想选,负责记录审美选择;情绪效能指觉得哪首更有效传达镇静或振奋目标情绪,负责记录功能判断;两者搭配才能区分好听与管用,本研究组合的意义在于发现二者可分离,人作常赢效能而 AI 仍可赢偏好。

假设按无标注与有标签两层写。H1 预期无标注时人作更被偏好且更有效,细分为振奋应在高唤醒高愉悦 GEMIAC 类别得分更高,镇静应在低唤醒高愉悦类别得分更高。H2 预期被标为人作的曲子更被偏好且更有效而不论真来源,同样按振奋与镇静细分高低唤醒类别。H3 把状态焦虑当探索性指标,预期听音乐前后会有变化但需进一步研究。教学例子:好比盲品两杯水,H1 问不告诉品牌时是否更喜欢 A 且觉得更解渴,H2 问贴上品牌标签后是否跟着标签走,这只是例子,论文测的是音乐不是水。

三组标签与两类情绪如何组成全流程?

先做人口学与音乐背景、AI 态度、生成式 AI 经验、健康音乐使用等问卷,加状态焦虑前测,再随机分到正确标注、错误标注、无标注 3 组之一。正确组看到的标签与真实来源一致,错误组看到 AI 被标为人作、人作被标为 AI,无标注组看不到标签但要自己判断哪首是人作哪首是 AI。所有人事先都被告知可能存在误标以满足伦理,错误组在结束时被明确告知曾被反标并被问是否改变偏好与效能选择。

听音采用全因子加随机:先随机从镇静或振奋任一块开始,块内 AI 先还是人作先也随机,共听四首。每首听完立即做 GEMIAC 强度评分,再做该对歌曲的偏好与效能比较与理由、无标注组做来源判断,最后重测状态焦虑。问卷中嵌入两道注意力检查。

标签条件 × 实际来源: 实际来源指曲子真是 SunoAI 生成还是 Myndstream 作曲家用数字乐器写作,负责固定声音事实;标签条件指呈现时告诉被试正确来源、故意反标或不告诉,负责操纵被试信念;两者搭配才能分离声音效果与信念效果,组合意义是检验以为是人作是否就更喜欢更有效。

下图是流程总览,阅读时把底部随机分配与顶部听音测量连起来看,就能复述每个被试经历了什么。

看图路径: 1. 先看底部随机分配到 A 正确标注 B 错误标注 C 无标注三组的分支;2. 再看顶部先人口学加 STAI-S 再听四首最后再测 STAI-S 的主流程;3. 对照右上 II 框内镇静与振奋各一首 AI 一首人作且块内顺序随机;4. 注意每首后都做 GEMIAC 加偏好效能选择,无标注组还要判来源

原论文 Figure 1:(I) – Participants completed demographics/STAI-S questionnaires, and were randomly assigned to one…

论文图 1。原论文 Figure 1:“(I) – Participants completed demographics/STAI-S questionnaires, and were randomly assigned to one experimental group: (A) Correctly labeled AI-generated and human-composed…”。

该图上半右框显示每类情绪下人作加 GEMIAC 与 AI 加 GEMIAC 顺序随机,下接标注偏好收集;下半显示 3 组在镇静振奋各有两类曲目框,正确组标签为真,错误组交叉反标,无标注组不显示来源。底部回到状态焦虑后测,顶部起点为人口学加状态焦虑前测。由此可知组间比较的是标签信念,组内比较的是情绪类型与真实来源,随机化负责抵消顺序效应。

每首之后测了什么,两个量表各自管什么?

核心组件有三。第一是 GEMIAC 强度评分,基于日内瓦音乐情绪量表扩展,覆盖更广正负情绪与流派,论文因刺激短且情绪基调较单一而选用强度评分,按 Coutinho 与 Scherer 建议执行。被试对每首给出放松平静、温柔感动、活力想跳舞等类别的强度,分析时用线性混合效应模型看组别、情绪、真实来源、类别及其交互,随机截距管被试重复测量。

第二是偏好与效能二选一加理由。偏好问更喜欢哪首,效能问哪首更有效传达目标情绪,均为三分类。分析用多项逻辑回归看组别、情绪及其交互,第三类为既不也不清楚,用 Wald 卡方做总体效应并用 emmeans 做 Bonferroni 校正两两比较;偏好效能一致性用广义线性混合模型加被试随机截距,方向一致性用 Fisher 精确检验。

GEMIAC × STAI-S: GEMIAC 即日内瓦音乐诱发情绪清单强度评分,负责逐曲测量感到放松、活力、感动等具体情绪强度;STAI-S 即状态焦虑量表状态分,负责探索前后 momentary 焦虑变化;两者搭配分别管音乐情绪共鸣与一般焦虑状态,组合意义是区分具体情绪被唤起与整体焦虑是否缓解。

第三是状态焦虑前后测,只作探索,不做因果归因。质性自由回答按 Braun 与 Clarke 主题分析归纳,从提到节奏、描述人声等表层码到偏好人不完美、不信任 AI 等潜在含义,再聚为自然感、机械感、情绪共鸣、技术特征等九大主题,但仅单人编码、无评分者一致性,论文明确要求当探索解读。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练任何音乐生成模型,也没有更新 SunoAI 或作曲流程的任何参数,不存在梯度路径、冻结解冻、早停或权重下载。所谓构造只是按 Myndstream 健康音乐负责人写的两段约 200 词提示,一段要柔和钢琴环境合成器空灵效果以消除焦虑,一段要电子鼓明亮合成器活泼节奏以提升情绪,分别交 SunoAI 生成与内部制作人用数字乐器写作,且生成方与制作方互不知对方版本以防偏倚。

真实计算全部在分析侧,用 R 4.5.1 完成。多项逻辑回归用 nnet 包处理偏好与效能三分类;两两比较用 emmeans 包并做 Bonferroni 校正;一致性与人口学预测用 lme4 包的二项广义线性混合模型与线性混合模型,含被试随机截距;方向一致性与标注准确率预测用 Fisher 精确检验与卡方拟合优度。

显著性阈为 0.05 并对多重比较校正。缺项是论文未报告具体随机种子、优化器细节与算力耗时,因为本研究无模型训练,这些本就不存在;分析代码与数据未在正文给出下载,以预注册链接为可核对起点。不能把无训练理解为确定性求解,听者反应本就是随机变量,模型只是估计组别与情绪效应。

被试、刺激、分组与公平条件如何保证可比?

被试 152 人 2024 年 9 月在 Prolific 经 Qualtrics 完成。刺激四首各 1 分钟纯器乐,镇静与振奋各一 AI 1 人作。提示相同但声音实现不同,论文承认难以在所有协变量上完美匹配刺激,这是明确局限。公平条件靠随机化与全因子维持:组间随机分 3 组,组内情绪块顺序随机、块内 AI 人作顺序随机,每首后测量相同,注意力检查相同,伦理告知相同。

镇静 × 振奋: 镇静对应 Calming/Soothing 低唤醒高愉悦目标,负责检验舒缓放松类应用;振奋对应 Upbeat/Invigorating 高唤醒高愉悦目标,负责检验提振活力类应用;两者搭配覆盖情绪应用的两端唤醒水平,组合意义是发现 AI 在低唤醒尚可而在高唤醒活力感上落后。

比较时条件一致性体现在同一被试听同一对歌曲再做偏好与效能选择,组间只差标签呈现,无标注组多一道判来源任务。人口学分析把年龄段转为中点并把组别与情绪作协变量,检验年龄、AI 经验、音乐经验、AI 态度是否预测偏好、一致性与辨别准确率。GEMIAC 分析另纳入主动寻求健康音乐与否等背景。硬件预算与推理开销不适用,因为不部署生成系统;人类听音时长约 4 分钟加问卷时间,未报告精确中位时长,不猜测。

偏好与效能分离到什么程度,标签与情绪如何拉动?

总体上人作被评更有效而偏好更均衡。多项逻辑回归显示偏好与效能分布差异显著,被试把 AI 评为更有效的可能性比按偏好低约 52%。组别显著预测偏好但不显著预测效能,所有组都把人作评为更有效,正确组约 61% 选人作有效,错误组约 53%,无标注组约 63%,组间无显著两两差异。组别对偏好的拉动体现在错误组 AI 偏好显著高于正确组,错误组把 AI 当人作听时镇静达 72% 选 AI、振奋达 50%,正确组镇静 41%、振奋 37%,无标注组镇静 69%、振奋 39% 接近错误组但校正后不显著。

情绪显著影响偏好与效能。镇静 AI 偏好 60.5% 高于振奋 42.1%,正确组与无标注组内情绪效应显著,错误组边缘。效能方面振奋 AI 被评有效概率低约 58.7%,正确组与无标注组内显著,无标注组 AI 有效从镇静 51% 跌到振奋 11.8%。方向一致性总体约 71% 且不随组别情绪变化,但不对称:偏好人作者 89% 也评人作更有效,偏好 AI 者仅 54.8% 也评 AI 更有效,相差 34.2 个百分点,无标注振奋仅 25% AI 偏好者也评 AI 更有效,65% 偏好 AI 振奋者反而评人作更有效。

辨别准确率是关键反证。无标注组振奋正确 56.9% 而镇静仅 13.7%,镇静 80.4% 把人作误判为 AI、76.5% 把 AI 误判为人作,几乎反转。准确率显著预测偏好,标错者镇静 79.1% 偏好 AI 而标对者仅 14.3%,振奋 61.9% 对 24.1%;94.1% 偏好镇静 AI 者与 63.2% 偏好振奋 AI 者把 AI 误标为人作。效能方面镇静评 AI 更有效者 92% 误标为人作,振奋仅 50%。人口学上 34 到 41 岁 AI 偏好 78.7% 异常高,强烈反对 AI 者仍 66.7% 偏好 AI,平均 AI 经验者辨别更差,音乐经验不提高准确率。

下表把总体偏好与效能的分离摆出来,比较问题是同一批人是否把好听等同于管用,公平条件是同一对歌曲同人判断,指标方向是选人作有效占比高于选 AI 有效而偏好更均衡。

条件指标AI 占比人作占比第三种选择
跨情绪总体偏好51.2%43.1%余量为既不也不清楚
跨情绪总体效能33.9%58.9%余量为既不也不清楚
正确组效能选人作—61% human余量为 AI 与不清楚
错误组效能选人作—53% human余量为 AI 与不清楚
无标注组效能选人作—63% human余量为 AI 与不清楚

上表主要收益是效能稳定偏向人作而偏好摇摆,代价是偏好不能代理情绪成功,未胜出项是 AI 在总体效能落后约 25 个百分点。镇静 AI 偏好高但多来自误标,不是声音本身胜出。

下表聚焦无标注辨别,比较问题是镇静与振奋是否一样好辨,公平条件是同一组被试各判 1 对,指标方向是正确率越高越好辨。

条件指标AI 判对或判错人作判对或判错组间对照
振奋正确率56.9% correct—高于镇静
镇静正确率13.7% correct—低于振奋
镇静误标率76.5% mislabeled AI as human80.4% mislabeled human as AI双向反转

上表说明镇静几乎不可辨而振奋稍可辨,反例是即使振奋正确率过半仍有大量误标,未评测边界是仅四首器乐不能推广到有人声或别的流派。

自然感 × 机械感: 自然感指被试用流动、有灵魂、有机、细微瑕疵描述的人性线索,负责解释为何判为人作;机械感指用太完美、机器人化、虚假表演描述的合成线索,负责解释为何判为 AI;两者搭配揭示听者用人性化隐喻做归因,组合意义是即使 AI 曲被误信为人作也会被套用自然感词汇。

下图是偏好与效能的堆叠柱,直观验证上述分离,阅读时先看颜色再数人数。

看图路径: 1. 先对比左侧偏好与右侧效能两大面板的紫色 AI 段与绿色人作段高低;2. 再按横轴六根柱子比较正确错误无标注乘镇静振奋的差异;3. 重点看无标注振奋偏好 AI 者多但效能人作占优的反转柱;4. 读柱内白字人数并注意顶部灰色既不也不清楚人数很少

原论文 Figure 2:Stacked bar plots showing the number of participants in each experimental group (Correct,…

论文图 2。原论文 Figure 2:“Stacked bar plots showing the number of participants in each experimental group (Correct, Incorrect, Unlabeled) who indicated (left) preference for and (right) perceived e!cacy…”。

该图左侧偏好六柱中错误镇静与无标注镇静紫色 AI 段高达 36 人与 35 人,而右侧效能六柱绿色人作段普遍更高,无标注振奋效能人作达 42 人而 AI 仅 6 人。灰色既不也不清楚各柱仅 1 到 8 人,说明被试多能做出选择。像素可见的反转正是偏好跟信念走、效能更贴真实来源的证据。

哪些对照排除了年龄经验与标签事后改变的解释?

人口学对照显示偏好效能不一致跨组稳定,无变量显著预测一致性。年龄显著预测 AI 偏好但情绪仍是强预测,振奋 AI 偏好跨人口学更低。AI 经验与音乐态度不预测 AI 偏好,音乐经验不提高辨别,平均 AI 经验者反而更差,说明听辨难超越技术熟悉与音乐训练。主动寻求健康音乐者 GEMIAC 更高,优秀生成音乐经验者总体 GEMIAC 更高但需警惕确认偏倚,年龄 34 到 41 加好经验者评分更高。

标签事后对照看错误组被告知反标后是否改变。卡方拟合优度显示选维持 29 人、改变 17 人、不清混合 4 人,显著偏向维持原判断,多人称选择出于个人口味而非标签,少数部分 reconsider 但仍强调口味优先。这支持情绪印象不被署名知识完全覆盖,但标签仍在事前显著拉动偏好,二者并不矛盾。

GEMIAC 类别对照显示类别表征不受来源影响但强度在特定处敏感。镇静放松平静、温柔、感动高分,紧张不安与激越低分;振奋活力、想跳舞、受鼓舞高分,忧郁与激越低分。放松显著高于紧张,活力显著高于忧郁。振奋活力项人作显著高于 AI,见于无标注与正确组,镇静放松项 AI 人作无显著差,错误组无显著差。

随机效应方差 0.24 说明个体差异中等。这支持低唤醒 AI 可比、高唤醒人作占优的校准建议,但需更多刺激验证。

哪些边界使结论不能直接推广到治疗效果?

刺激仅四首且为环境情绪器乐,提示与歌曲链接见补充材料,提示多样性与流派文化覆盖不足,西方调性与简单情绪维度可能漏掉跨文化细腻差别。样本 152 人按 3 组乘两情绪细分后每格约 50 人,统计 power 有限,事后多重比较已校正但仍需更大样本。质性单人编码无一致性系数,只能当探索。状态焦虑前后设计无对照静默组,74 人下降 50 人上升 28 人不变、双向均有临床意义的 8 分变化,但无法分离音乐、时间、期待与标签信任的作用,论文明确标为不确定。

听觉瑕疵讨论不具体,音乐与机器学习专长对共鸣的影响未测,信心评分与生理指标未用。不同指标差值不能混放一列,自动声学指标未做故不拿人评代替。原文表头图注无算术冲突,若发现柱图人数与正文百分比因分母口径略有出入,应以分母为组内该情绪作答人数理解,不编造新口径凑平。

要复现最小实验需要准备什么,按什么顺序跑?

先按预注册链接取协议,当前可用状态为链接可达 200,写复现时应写本次确认可达而非永久保证。准备两段情绪简报各约 200 词,一段镇静要柔和旋律温和和声平静速度加软钢琴环境合成器空灵效果,一段振奋要 uplifting 旋律动态节奏活泼速度加电子鼓明亮合成器空灵效果,交生成系统与人类制作人独立制作各 1 分钟纯器乐,互不知对方版本,AI 只做一轮无后期。

招募约 150 人在线施测,记录年龄、音乐训练偏好、AI 态度、生成音乐经验与健康音乐使用。随机分 3 组,组内情绪块与块内曲序随机。每首后做 GEMIAC 强度、无标注组加判来源,每对做偏好与效能三选一加理由,错误组末尾告知反标并追问是否改变,前后各测状态焦虑并埋两道注意力检查。分析用多项逻辑回归加 Wald 卡方与 emmeans Bonferroni、混合模型加被试随机截距、Fisher 精确检验方向一致性与准确率预测,阈 0.05。第三方工具中 emmeans 文档当前可用,BioRender 为作图平台当前可用,Udio 为 AI 音乐平台示例当前可用,Deezer 新闻页为第三方调查当前可用,均只作背景或工具引用,不当本研究数据源。伦理需经机构审查并提前告知可能误标。

何时值得尝试 AI 情绪音乐,复现先做什么,还缺哪项验证?

当目标是低唤醒镇静背景或健康放松且有人类监督署名时可尝试 AI,因镇静效能与人作相当且偏好不低;当目标是高唤醒振奋、激励、庆典或现场驱动时应保留人类创作或协作,因活力感人作显著更高。评估必须把偏好与效能分开看,不能用点击喜欢代替情绪达标,尤其警惕误标驱动的虚假 AI 偏好。设计应保留不完美痕迹与诠释空间,用标签教育区分协作与替代,参考动能雕塑等透明化呈现,而非追求技术完美。

复现先做最小四首 3 组流程并重点复刻无标注辨别与偏好效能不对称,再扩展刺激数量、流派文化与纵向暴露。还需补多评分者质性信度、信心评分、生理标记、临床人群与随机对照焦虑干预,才能谈治疗效果。常见误解是把 AI 偏好高误读为 AI 更有效,或把无训练误读为结果确定,实际是信念拉动偏好而效能更贴真实来源,且人类反应本就有变异。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 67 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 nime-2026 论文汇总