英文题目:Emotion and Expressivity in Music Performance: A Multimodal Approach.
会议身份:
conference:nime:2026:conference-paper-id:nime2026_118
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据集构建 #生理信号 #音乐 #音乐理解
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Natalia Kotsani:机构信息未能从会议 PDF 纯文本可靠映射
- Spyros Kantarelis:机构信息未能从会议 PDF 纯文本可靠映射
- Vassilis Lyberatos:机构信息未能从会议 PDF 纯文本可靠映射
- Edmund Dervakos:机构信息未能从会议 PDF 纯文本可靠映射
- Giorgos Stamou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该协议输入为现场独奏表演的多通道音频与视频、表演者与听众的脑电图、心电、皮肤电等生理信号及效价唤醒连续标注与分类情绪标注,输出为时间对齐的多模态数据集与本体知识图谱,难点在于跨模态同步、表达条件控制与生理噪声抑制。接待校准先采集暗室静息基线与共情问卷并验证传感器,其输出的基线与设备日志进入后续阶段以校正个体差异。随后依次执行基于七种调式的通用练习曲、个人自选曲目非表达与表达对照演奏及自由即兴三阶段,并同步采集生理信号与听众和表演者双侧标注,阶段顺序随机以缓解疲劳与标注漂移。在多模态同步采集设置下,心电与皮肤电传感器的采样指标为500 Hz,高于脑电头带的采样指标250 Hz。最后以GEMS-9分类标注与表演者访谈补充表达意图,并将分阶段平均后的生理与情绪特征进行描述性比较,其关系仅解读为探索性共变而不作因果推断。与采用预录刺激的已有数据集的关键机制差异在于双侧实时采集与表演者可控表达对照,使意图表达与诱发情绪的不一致可被直接比较,为增强演奏过程的AI应用提供基础。结论适用边界受限于小规模独奏录音室探索性描述,不支持因果推断与跨文化外推,且干电极低频局限与西方调式偏置构成失败条件,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 演示资源:https://witheflow.ails.ece.ntua.gr/annotator/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文交付了什么?
本文的输入是现场音乐表演过程本身,包括演奏者发出的声音、演奏动作视频、演奏者与听众的生理信号,以及双方给出的情绪标注。目标不是训练一个情绪分类器,而是给出一个可重复的数据集构造协议,让不同乐器、不同风格的演奏者都能按同一流程留下可对齐的多模态记录,并用初步实现证明流程走得通。
必须保留的关键信息是任务边界。论文研究的是感知情绪、意图情绪与诱发情绪之间的关系,重点是表达性如何变化以及双方记录是否一致或分歧。它不承诺解决通用音乐情绪识别,也不承诺提供医疗级生理推断。输出是一套分阶段演奏任务、双侧标注规范、同步与预处理链条,以及 16 场录音的描述性趋势。
阅读顺序建议先看任务与相关路线的差异,再看协议全景,然后沿着一个演奏片段走完采集到特征的过程,最后看实验条件与限制。凡是教学举例都会标为例子,不把例子当作论文报告的数值。当前可用性方面,文中给出的标注应用链接本次验证为可用,状态码为 200,地址为官方 annotator 页面,读者可按该地址核对界面与标注流程。
已有路线做了什么,为什么还要做现场双侧记录?
已有路线可按输入与监督条件分成 3 类。第一类用预录音乐视频或电影刺激诱发情绪,代表是 DEAP 记录脑电与外周生理并收集效价唤醒度自评,DECAF 引入脑磁图、心电等多信号分析对音乐与电影刺激的反应。这类工作的输入是固定刺激,优点是条件可控,缺点是演奏中的表达变化被冻结,无法观察演奏者与听众的互动。
第二类用为诱发特定情绪而作的曲子,例如 EEGLife 针对高兴、悲伤、平静、愤怒作曲并做脑电情绪识别,MediaEval 相关研究在固定曲库上优化效价唤醒度分类。这类工作的监督多为听众感知标签,缺少演奏者意图侧的同步记录。第 3 类是现场录音数据集,但多为已有作品的演出存档,没有统一的表达性操作协议,也缺少跨被试可比的任务结构。
本文的差异是有源对照下的补位。它把输入改为小型现场演出,把监督改为演奏者分类自评加听众连续与分类双标注,并用练习曲、个人曲目、即兴 3 类任务制造从受限到自由的表达梯度。因此不能把本文的描述性雷达图趋势与上述分类准确率直接比胜负,因为输入阶段、被试角色与监督形态都不一致。
要回答的问题是什么,难在哪里?
核心问题是同一段现场演奏中,演奏者想表达的情绪、听众感知到的情绪、双方身体信号的变化是否同向,以及表达性操作是否系统地改变这些记录。论文把表达性处理为演奏者可控制的操作变量,而不是先给哲学定义再测量,这是一个方法简化,目的是让表达与非表达条件可以并置比较。
难点有 3 层。对齐难在于音频、视频、脑电、心电、皮电与鼠标标注的时间粒度与结构完全不同。对照难在于曲目熟悉度、调式色彩与演奏者习惯都会混入情绪反应。生态与控制的矛盾在于越像真实演出,条件越难标准化,越标准化,又越不像真实演出。
举例说明,假如 1 位吉他手先机械地弹一遍自选曲,再自由地弹一遍,听众的唤醒度曲线可能在第二遍更高,但这既可能是表达更丰富,也可能是听众对曲子更熟悉。协议的作用就是把这类混杂拆开,让调式练习曲提供陌生但结构统一的基线,让个人曲目提供熟悉但难度可变的对照,让即兴提供无谱约束的自由端。
协议全景:一次录音如何从接待走到访谈?
1 次录音大约持续 3 小时。第一小时用于讲解、试音、佩戴传感器与测试,后 2 小时完成各实验阶段与访谈并安排休息。场地分为控制室与录音室,控制室有录音师,录音室有演奏者、听众与研究人员,3 名研究人员负责生理与视频记录。听众固定为 3 名标注者加 1 名佩戴生理传感器的被动聆听者。
为理解人员与信号走向,先看采集现场的角色与连接示意。图中上方是演奏者与话筒,下方是被动听众与相机,左右分别是标注者与研究者,箭头标出音频线与传感器信号的流向,读图时应先沿演奏者到控制室与到听众的两条路径分别追踪。
看图路径: 1. 先找到顶部黄色区的演奏者与下方三支话筒,确认声音采集起点;2. 再看左右粉色区的三名标注者与三名研究者的人数与设备差异;3. 最后沿底部被动听众、相机与传感器信号箭头确认信号汇聚方向
论文图 1。原论文 Figure 1:“Diagram showing roles and connections during data collection.”。
该图显示的教学要点是双侧同步的思想。演奏者侧的声音经音频线进入控制室,被动听众侧的生理信号与相机画面汇入研究者侧,标注者侧通过电脑独立给出连续与分类标注。所有数据流靠统一时间戳与每场演出中的特定音频提示对齐。这种分室安排既保留小型现场的互动,又让工程同步有一个明确的汇聚点。
阶段顺序上,准备校准之后的 3 类演奏按随机顺序执行,以减轻疲劳与标注漂移带来的顺序偏差。每次演奏后有短访谈,全程结束有长访谈,访谈同步录音录像,用于补充表达手法、紧张或厌倦感、曲目选择与对人工智能工具的看法。
演奏任务如何制造从机械到自由的梯度?
准备阶段包括知情同意、传感器佩戴与信号检查,共情用多伦多共情问卷评估,情绪基线用正负情绪量表测量。校准包含黑暗中 2 分钟静息记录,以及弹单音检验运动对传感器的扰动,演奏者还可做 3 分钟热身。这些步骤的目的是让后续生理变化有一个可回溯的起点。
下表把 4 个阶段的任务、时长与操作意图并置,阅读时先提出比较问题。在曲目熟悉度与演奏自由度都不一致的情况下,哪些阶段适合做跨演奏者基线,哪些阶段适合观察个人表达,哪些阶段适合观察无谱创造。公平条件是同一演奏者完成全部任务,同一任务时长与表达指示明确,指标方向需按特征分别判断,不能把所有轴的外扩都读成变好。
| 阶段 | 任务编号 | 内容与表达操作 | 单任务时长 | 标注与访谈 |
|---|---|---|---|---|
| 准备校准 | PH0_T0 至 PH0_T2 | 静息、单音运动检验、可选热身 | 2 分钟静息、3 分钟热身 | 共情与情绪基线问卷 |
| 公共曲目 | PH1_T0 至 PH1_T8 | 7 首调式练习曲加 Greensleeves 非表达与表达各一遍 | 每任务 2 分钟 | 听众连续加分类、演奏者分类 |
| 个人曲目 | PH2_T0 至 PH2_T3 | 两首自选公有领域曲目各演非表达与表达版 | 每任务 2 至 3 分钟 | 同上并记录难度与熟悉度 |
| 即兴 | PH3_T0 至 PH3_T1 | 自由独奏即兴与单音持续音上即兴 | 按现场执行 | 同上并在访谈追问即兴策略 |
表后解释需要同时看到收益与代价。公共曲目的收益是调式系统变化且人人视谱演奏,便于跨演奏者比较,代价是文化熟悉度仍会渗入,例如 Greensleeves 的辨识度可能独立于表达操作影响听众。个人曲目的收益是熟悉度驱动的表达差异更自然,代价是曲目本身不可比。即兴的收益是约束最少,代价是古典背景演奏者即兴经验不均,且时长与结构差异需要在分析时明确说明,不能直接当等长样本平均。
操作细节上,非表达版要求力度变化最小、速度稳定、发音中性,接近机械读谱,表达版留给演奏者自行解释。论文明确要求把演出当作现场对待,错了不重来,可要求休息,可随时退出,以降低生理信号对应激而非音乐的敏感。
两类情绪标注如何分工,连续值怎样落在圆盘上?
连续标注基于罗素环形模型,捕捉瞬间情绪漂移。分类标注用 GEMS-9 的 9 个词加可选的中性,分别是紧张、力量、喜悦、惊奇、温柔、超越、平静、怀旧、悲伤,给出整段的语义落点。演奏者提供分类自评,听众提供连续与分类双报告,被动听众还提供生理信号与分类标签。
音乐表现力 × 效价-唤醒度: 音乐表现力在本协议中指演奏者可控制的演奏方式变化,如力度、速度与发音处理,效价-唤醒度则把情绪压缩为愉悦度和激活度两个连续维度;两者搭配的理由是仅用表达与非表达的二分操作无法刻画瞬间起伏,仅用分类词又缺少连续过程,因此用表现力条件制造可比差异,用效价-唤醒度连续标注跟踪过程变化,组合后才能同时检验表达意图与听众反应的异同。
连续标注 × 分类标注: 连续标注负责每秒记录效价与唤醒度的漂移,分类标注负责在整段表演后给出 GEMS-9 等离散情绪词;连续标注分工是保留时间结构,分类标注分工是保留语义结构,二者搭配是因为生理信号本身无情绪语义,必须靠两类主观报告分别提供动态曲线和可统计的标签,组合后才能把同一段音频同时对应到曲线峰谷和词频差异。
为理解连续标注界面,先看实时标注用的效价唤醒度圆盘。横轴从不愉快到愉快,纵轴从低唤醒到高唤醒,圆内标出生气、兴奋、高兴、愉快、平静、疲倦、悲伤、沮丧等位置,标注者用鼠标连续追踪,程序每秒采样并映射为效价唤醒度数值。
看图路径: 1. 先确认横轴为愉悦度、纵轴为唤醒度的十字结构;2. 再看圆内八个情绪词在四个象限的落点;3. 最后把鼠标连续位置与该圆盘的映射关系对应到每秒采样
论文图 2。原论文 Figure 2:“Russell’s circle used for real-time valence-arousal annotation by the annotators.”。
该圆盘的教学含义是把 2 维坐标变成可操作的手部动作。越靠右越愉快,越靠上越激活,右上对应兴奋,左上对应生气,左下对应悲伤,右下对应平静。初学者易误把鼠标停在词标签上不动,正确做法是随音乐流动连续移动,因为后续分析看的是曲线形态与阶段均值,而不是单点词选择。分类页另有喜悦与熟悉度的李克特量表,用于补充整体评价。
组合机制上,连续曲线回答何时起伏,分类词回答像什么情绪,生理信号回答身体是否同步。只有三者同时对齐到统一时间戳,才能检验演奏者自评的悲伤是否对应听众的怀旧,以及唤醒度峰是否对应皮电峰。
声音、视频与生理信号如何同步与落盘?
音频采用多通道录音,高质量数模与模数转换,支持多通道转换的数字音频接口与工作站软件,前置放大器为高增益低噪声固态型号。每位乐手按乐器指向性分配一至五支话筒,另有演奏者访谈话筒与控制室沟通话筒。视频用三脚架上的无反相机记录脸、手、乐器与设备。
心率变异性 × Baevsky 指数: 心率变异性从 RR 间期序列反映自主神经调节的波动幅度,Baevsky 指数从同一 RR 序列构造压力方向的集中程度指标;前者偏向放松或恢复性状态的描述,后者偏向交感紧张的描述,搭配理由是单一心率均值无法区分平静与紧张的不同机制,组合后可以在同一心电来源上同时观察放松趋势与压力趋势是否分离。
频谱通量 × 起振斜率: 频谱通量度量相邻音频帧频谱变化的剧烈程度,起振斜率度量音符起始段能量上升的陡峭程度;前者分工是刻画音色与和声进行的变化密度,后者分工是刻画触键与节奏颗粒的敲击感,搭配理由是表达性既可能来自音色流动也可能来自发音形态,组合后才能把听到的丰富感拆成频谱维度和包络维度分别验证。
Alpha 功率占比 × Beta 功率占比: Alpha 功率占比指 8-13 赫兹能量在 3 个频带总能量中的比例,Beta 功率占比指 13-30 赫兹能量的对应比例;前者在本文实现中偏向与放松或内省相关的 arousal 侧变化,后者偏向与注意投入或认知负荷相关的变化,搭配理由是单看总功率会被电极接触与个体差异淹没,用占比可在同一总量下比较频带此消彼长,组合后才能区分 repertoire 与即兴阶段中放松与投入是否同向变化。
下表把关键采集与预处理参数并置,阅读问题是不同模态的时间粒度是否可比,公平条件是同一场次统一时间戳加音频提示对齐,指标方向需按模态分别解释,采样率越高不等于情绪推断越准。
| 模态 | 传感器与软件 | 采样与格式 | 电极或分析窗 | 导出特征 |
|---|---|---|---|---|
| 视频 | 无反相机三脚架 | 4K 超高清、30 帧每秒、20.9 兆像素 | 固定机位拍脸手乐器 | 会话文档与行为回溯 |
| 标注 | 网页应用鼠标追踪 | 每 1 秒采样映射为效价值 | Russell 圆盘加分类页 | 连续效价唤醒度、GEMS-9、喜悦与熟悉度量表 |
表后解释要看到代价。干电极头带的代价是低频段质量不如凝胶科研设备,且电极只覆盖枕颞区,没有前额点,因此基于效价的 Alpha 不对称推断受限,更适合做唤醒度侧的探索性描述。商用传感器的代价是通道少、保真度有限,不适合生物医学级结论。未胜出或未评测的边界是缺失值处理仅对 RR 间期做了线性插值,其他模态的丢包与延迟未在正文给出完整量化,复现时需自行记录蓝牙传输的时间戳抖动。
没有模型训练时,计算发生在哪些步骤?
本研究没有训练神经网络,因此不存在梯度路径、参数冻结与更新、优化器与早停等训练要素。该节的真实计算是预处理与特征提取链条,必须按输入到输出的顺序讲清。
沿一个片段走完全程。输入是一段 2 分钟左右的演奏,附带同步的心电、脑电、皮电与鼠标曲线。心电先检测 R 峰得到 RR 间期,对缺失 RR 间期做线性插值,再基于插值序列以 1 赫兹输出心率变异性与 Baevsky 指数。音频用大窗分析提取频谱通量与起振斜率。脑电提取三频带功率并计算 Alpha 占比与 Beta 占比。
皮电对信号随时间积分得到曲线下面积,并计数峰出现频率得到峰频率。标注侧把鼠标位置映射为效价唤醒度序列,并把整段分类词与量表分数汇总。
需要指出的缺项是论文未报告 R 峰检测器型号与阈值、插值比例、伪迹剔除规则、 Essentia 之外的归一化口径,以及每被试归一化的具体公式。复现时只能先按上述文字链条实现占位版本,并在报告中明确这些缺项,不能从工具名称推定默认参数就是原文参数。
验证条件是什么,样本与组织方式有何特点?
验证用了 16 场录音,16 位不同的独奏演奏者,乐器覆盖钢琴、电吉他与古典吉他、电贝司、低音提琴、次中音萨克斯、手风琴、打击乐、奈伊笛、克里特里拉琴、琉特与小提琴。每场听众为 3 名标注者加 1 名佩戴传感器的被动听众。数据组织上另有一个领域本体,把参与者、数据产物与录音组件建成語义知识图谱,支持设备元数据与逻辑推理,并预留与现有音乐本体的对接。
下表汇总样本与背景,阅读问题是结果能推广到谁,公平条件是同一协议与同一标注工具,指标方向是比例越高代表该类背景占比越大,不能把高学历直接读成高演奏水平。
| 对象 | 规模与来源 | 关键比例 | 能力与经验 | 备注 |
|---|---|---|---|---|
| 录音场次 | 16 场独立录音 | 覆盖多乐器独奏 | 跨流派与经验 | 含生理、音频、标注与人口信息 |
| 演奏者学历 | 硕士与博士为主 | 硕士 69.2%、博士 15.4% | 音乐学院 23.1%、大学 23.1%、两者兼有 38.5%、合计正式训练 84.7% | 剩余 15.4% 无正式机构训练 |
| 演奏能力 | 即兴与视谱 | 即兴训练 61.5%、无视谱经验 7.7% | 经验峰值在 34 至 41 岁组 | 人工智能熟悉度多在 2 至 4 级 |
| 听众 | 每场 3 加 1 | 标注者 3 人、被动听众 1 人 | 问卷测共情与情绪基线 | 自愿参与、演奏者获报酬 |
| 伦理与版权 | 院校伦理批准 | 知情同意与隐私保护 | 公有领域、团队原创或放弃版权主张的即兴 | 生理按健康信息管理 |
表后解释要指出偏斜。演奏者性别偏男性、年龄偏大,听众同样存在人口偏斜,多数演奏者受西方音乐训练,中东与东地中海音乐仅部分纳入。伦理侧演奏者有报酬而听众自愿,版权侧只用公有领域、团队作曲或即兴,这保证了开放共享,但也限制了曲目流行度与风格覆盖。未评测的边界是合奏、家庭工作室与业余乐手尚未纳入正式验证,只是未来方向。
不同阶段的身体与标注记录如何分叉?
结果是阶段级描述趋势,不是正式统计模型输出。方法是每被试归一化后在阶段内平均,以公共曲目为基线比较个人曲目与即兴。论文明确提醒该做法未控制任务时长与阶段内时间结构差异,生理与情绪的关系应读作探索性共变,不做因果断言。
为建立直觉,先看分阶段的多模态均值雷达图。左图为演奏者,右图为听众,图例中绿色为第一阶段基线,红色为第二阶段个人曲目,蓝色为第三阶段即兴,轴上同时有生理、音频与情绪标签。
看图路径: 1. 先区分左右两幅雷达图分别对应演奏者与听众;2. 再按图例比较绿色基准与红色个人曲目、蓝色即兴的多边形扩张方向;3. 最后对照音频特征轴与生理特征轴是否同向扩张
论文图 3。原论文 Figure 3:“Comparison of the mean normalized values of multimodal features across different phases, using PH1 as the reference.”。
该图的可见内容支持三点对照。第一,Alpha 功率在双方都于个人曲目与即兴更高,心率变异性也呈平行趋势,个人曲目与即兴高于基线,提示更放松或更投入的状态。第二,Beta 功率分叉,演奏者在第一阶段最高而听众在第一阶段最低,说明陌生练习曲对演奏者的注意负荷与对听众的投入含义不同。第三,听众的 Baevsky 压力指数与皮电曲线下面积、峰频率在即兴最高,个人曲目则表现为曲线下面积较高而峰频率较低,提示即兴的唤醒更偏阵发,个人曲目的唤醒更偏持续。
分类词上双方的高兴都在个人曲目更常见,即兴中演奏者更多选悲伤而听众更多选怀旧,演奏者较少选惊奇与超越,这构成意图与感知的具体分歧例。
必须同时记住反例。总体趋势不等于每组每步成立,雷达面积大小受归一化与轴排序影响,不能把多边形大直接读成情绪更强。音频侧频谱通量与起振斜率在曲目与即兴高于练习曲,支持声音变化更密集,但这不能证明生理变化就是由这些声学变化引起,因为未做因果建模。
固定曲目只切换表达指示时,什么变了什么没变?
表达性对照固定了曲目,只比较表达版与非表达版。表达任务包括第一阶段的表达版 Greensleeves 与第二阶段的两个表达版,非表达任务为对应的机械版。这种设计接近消融思想,即去掉表达自由度后观察记录如何回落,但它不是网络消融,仍是行为条件的对照。
为看清条件差异,先看按表达性分组的雷达图。左为演奏者,右为听众,绿色为表达性,红色为非表达性,轴上同时有生理、音频与情绪标签,读图时先固定一侧再跨侧比较。
看图路径: 1. 先确认图例中绿色为表达性、红色为非表达性的对应关系;2. 再比较左图演奏者侧 Beta 功率与 Baevsky 指数的反向变化;3. 最后看右图听众侧皮肤电与超越感轴在表达性条件下的外扩
论文图 5。原论文 Figure 5:“Comparison of the mean normalized multimodal feature values across expressivity conditions.”。
可见的分离是演奏者 Beta 功率在非表达版更高而 Baevsky 压力指数在表达版更低,提示机械演奏伴随更高的认知负荷,自由表达更接近流畅状态。听众侧皮电峰频率与曲线下面积、心率变异性在表达版更高,效价与超越感也明显上移,提示情绪唤醒与投入增强。音频侧表达版的频谱通量与起振斜率更高,说明音色变化与发音颗粒感同步增强。
未胜出项与边界同样重要。Alpha 功率在该对照中并未呈现一致的单调优势,说明放松指标对表达操作的敏感度不如压力与注意指标。听众的唤醒度提升不能直接等同于愉悦度提升,需分别看效价轴。原文未给出逐曲显著性与效应量,因此只能报告为论文显示的均值趋势,支持表达操作有效,但待验证是否在更大样本与合奏中稳定。
哪些结论不能下,传感与样本的上限在哪里?
第一,生理信号是非特异性的。心率变异性、皮电与频带功率不能直接读成情绪或表达状态,分析只是描述与探索,论文脚注已明确该限定。把某轴升高说成更悲伤或更投入都属于过度解读。
第二,表达性的二分是方法简化。非表达与表达只是操作指示,连续标注与访谈才承载细腻差异。二分标签抹平了演奏者个人风格与曲目难度的影响,不能当作普遍属性。
第三,西方偏斜与人口偏斜明确存在。练习曲与曲目选择偏西方调式体系,多数乐手受西方训练,古典乐手即兴经验有限,演奏者性别与年龄、听众构成都不均衡。第四,传感器上限明确。商用干电极通道少,低频质量有限,无前额点,实验环境也未达到医学研究的控制水平,因此数据不适合高保真生物医学推断。
这些限制决定了本文证据的适用条件。它可能支持用该协议收集可比的多模态演出数据,待验证的是跨文化、合奏与业余场景下趋势是否保持,以及实时生理驱动效果器等应用是否在不侵犯隐私与演奏自主权的前提下成立。
复现先做什么,需要保留哪些信息条件?
先复现流程而非复现数值。第一步按接待、知情同意、传感器佩戴、静息与单音校准、可选热身的顺序搭建检查表,并记录设备与乐器日志。第二步按公共曲目、个人曲目、即兴的任务卡发放谱例,明确非表达版的力度、速度与发音要求,表达版留给演奏者解释,并全程随机化阶段顺序。第三步部署标注网页,保证连续页每秒采样与分类页、喜悦熟悉度量表的跳转逻辑一致,标注应用当前可用,复现前应打开官方链接核对三屏结构。
同步与落盘必须保留统一时间戳加音频提示的双保险。音频按无压缩单声道保存,视频固定机位,生理经蓝牙低功耗传输并保存数值与时间戳的 JSON。预处理先实现 R 峰到 RR 间期、线性插值、心率变异性与 Baevsky 指数以 1 赫兹输出,音频按大窗提取两特征,脑电按三频带求占比,皮电求积分与峰频。
还需补的验证是缺失率、延迟分布、任务时长归一化方式与每被试归一化公式。建议新增静息基线对照、重复演奏一致性检查,以及分乐器汇报,避免把跨乐器平均当作个体效应。代码与权重方面,本文是协议与数据集工作,不涉及模型开源,Essentia 等工具版本需自行锁定并记录。
何时值得尝试,一句话如何带走?
当研究问题必须同时知道演奏者意图与听众反应,并且需要在陌生基线、熟悉曲目与自由即兴之间比较时,该协议值得尝试。当只有录音而无双侧同步记录,或只需要离线分类准确率时,不必照搬全套流程。
带走的判断是现场双侧记录把表达性从形容词变成可操作的对照条件,用统一任务制造梯度,用双标注与多生理信号保留分歧,16 场数据支持流程可行,但传感器保真度与样本偏斜决定了结论只能是趋势而非定论。下一步应补跨文化与合奏验证、正式统计建模与隐私保护下的实时应用评估,任何把相关性说成因果、把趋势说成每段成立的表述都超出了原文证据。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



