📄 Sounds Uncertain: Exploring the Affective Aspects of Sonification for Uncertainty Visualization
标签:#音频生成 #模型评估 #多模态模型 #可解释性
6.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5
✅ 6.7/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #音频生成 | #模型评估 | #多模态模型 #可解释性 | arxiv
👥 作者与机构
第一作者:Marcel-Simon Dutt(机构未说明) 通讯作者:未说明 作者列表:Marcel-Simon Dutt、Sita A. Vriend、Elias Elmquist、Daniel Weiskopf(机构信息未在当前正文中完整说明)
💡 毒舌点评
用声音化探索不确定性的情感维度是有趣的设计研究问题,但这项研究的证据结构撑不起其主题化结论:二十一名同校参与者年龄与背景狭窄;温度预测与气候变化自带的负面语义可能混淆了「ominous」选择——那也许表达的是气候焦虑而非统计不确定性的感知。四个共创主题没有经过新听众盲听验证,目前只是设计假设而非知觉规律。反思式主题分析的解释深度也替代不了编码一致性的检验。
📌 核心摘要
这项研究问的不是‘怎样把误差带读成声音’,而是更难的一层:声音能否把不确定性带来的情绪感受一并传给听众。研究者让普通用户为同一张德国温度图分别设计中性声化与不确定声化,再从创作过程和解释中归纳听觉规律。
21 名参与者最终形成四类稳定主题。中性声化主要落在 clear 与 relaxing:前者追求简单、稳定、少情绪,后者用舒适的背景质感营造放松感;不确定声化主要落在 wavy 与 ominous:前者借振荡和变化表现‘摇摆’,后者用低音、较大音量或恐怖片式联想制造不安。
同一参数并没有固定含义。白噪声既可能像雨声一样令人放松,也可能像信号受干扰一样令人不安;高低音、调制和节奏同样受数据语义、个人经历与文化经验影响。因此,这项工作的价值是给出可检验的设计假设,而不是发布一套放之四海皆准的声化映射表。
对音频与可视化设计者最实用的结论是:若目标是表达不确定性,可以优先试验振荡、随机感和适度的频谱扰动;若目标是保持中性,则应优先保证清晰、稳定和可跟随性。但所有选择都需要在具体数据语境中做听测。
🔗 开源详情
论文中未提及音频样例、代码或参与者数据的公开地址。
🏗️ 方法概述和架构
共创式研究,而非模型训练。 参与者观看一张德国年均温度图:1881—2024 年为历史观测,2025—2100 年为带不确定性区间的预测。每个人都要完成两件作品,一件为历史部分营造中性感,另一件为预测部分营造不确定感;两种任务的先后顺序做了平衡,以降低前一任务对后一任务的影响。
可直接操控的声化工具。 界面提供钢琴、深铜管、轻铜管和电合成器四种音色,但以 Sound 1—4 的中性名称显示,减少乐器名称带来的先入判断。参与者还能调整音量、音高、白噪声、振幅调制、调制频率、频率滤波,以及循环音符的包络长度和间隔;循环时间范围为 0.1—3 秒,音高映射范围可从 50—2000 Hz 的宽区间缩到 800—1600 Hz。
过程数据与主题归纳。 实验在安静房间中进行,使用 Beyerdynamic DT 770 Pro 耳机。研究同时保存口述思考、屏幕交互、计算机音频和最终声化作品。研究团队以反思式主题分析先建立代码和主题,再由另一位研究者复核全部转录,经过合并、拆分和讨论,形成 clear、relaxing、wavy、ominous 四类解释框架。
从参数到解释的对应。 编码并不只统计参与者把某个滑块调高或调低,而是先记录他们怎样定义中性/不确定、联想到何种生态声音或个人经验,再把音色、调制、白噪声、音高和时间参数连接到这些理由。最初 10 人形成 simple、wavy、ominous 三个主题;新增 11 人后由第二位研究者复核全部材料,simple 被细化并新增 relaxing,最终四主题由前三位作者反复讨论收敛。这个顺序保证主题来自声音作品与口述理由的共同模式,而不是事后只凭音频印象命名。
任务内对照与分析单位。 同一参与者既做历史中性声化,也做未来不确定声化,因此个人听觉偏好在两种条件中相对稳定,研究者可以观察他为何在条件切换后增减白噪声、调制或音高变化。最终分析单位不是单独一次滑块操作,而是完整作品、口述理由和任务条件组成的案例。研究团队先归纳‘生态声音、抽象品质、情绪、怪异、警报、无聊、稳定、声音变化’等代码,再看这些代码如何共同支撑四个主题。问卷记录工具体验与人口资料,但主题结论主要来自创作过程与口述,而非把小样本问卷做成显著性检验。
可解释的输出边界。 研究输出的是主题—参数—理由的设计地图:例如 wavy 常由振幅调制和波动产生,ominous 常由低音、较大音量与恐怖声音联想产生;clear 强调最少加工和可跟随性,relaxing 允许舒适的背景质感。它没有把四类训练成自动分类器,也没有从 21 人估计总体概率,后续产品应把这些组合做成多个候选,再由独立听众在具体数据场景中验证。


💡 核心创新点
把不确定性声化从‘数值映射是否准确’推进到‘听众会产生怎样的情绪解释’,补上了传统声化研究容易忽略的情感层。
不由设计者预设最佳声音,而让非专家用户直接创作并解释选择,从作品与理由两条线同时观察参数含义。
将中性与不确定性放在同一工具、同一可视化和同一参与者内比较,得到 clear/relaxing 与 wavy/ominous 的成对设计空间。
主动揭示白噪声、音高和调制的语义歧义,提醒设计者不能把单一听觉参数机械绑定到单一情绪。
研究把声音参数、情感词和个人联想分层编码:例如同一白噪声既可能通过‘像雨’进入 relaxing,也可能通过‘信号受扰’进入 ominous,从机制上解释了参数映射为何会冲突。
工具既提供逐参数试听,也允许把温度逐年映射到音高,使参与者能直接比较‘听清数据’与‘保持情感中性’这两个常常相互拉扯的目标。
主题形成经历 10 人初始分析、11 人扩充、第二研究者全量复核与多作者讨论,为后续定量听测提供了明确的四组可检验假设和对应声学操控变量。
研究没有把强烈情绪等同于有效数据传达,而把愉悦度、清晰度、数据可跟随性和情绪含义保留为不同设计目标;这一拆分能帮助无障碍可视化避免用‘更吓人’替代‘更准确’。
对照“情感声景/中性声景”能把情绪意图与普通可听化区分开;选择参与者共创提高生态效度,但样本和文化背景会影响归纳稳定性。
研究发现不确定性常与 wavy、ominous 的听觉品质相连,中性条件更常出现 clear、relaxing 属性;论文未提供统一数值效果量,结论主要来自共创样本的质性归纳。
流程是视觉不确定性编码、声音设计、参与者创作、质性归纳与跨样本比较。输出不是分类标签,而是关于 wavy、ominous、clear、relaxing 等听觉品质的设计规律。视觉和音频共同构成多模态界面,声音不替代数值,而是补充用户对不确定性的情感解释。
📊 实验结果
这是一项定性共创研究,核心结果是主题分布和可操作的声音规律,而不是一个统一效果量。
下图为Figure 3来自论文原文。

| 条件 | 归纳主题 | 常见声音选择 | 典型设计意图 |
|---|---|---|---|
| 中性 | Clear | 简单音色、少白噪声/少调制、稳定节奏、可跟随的音高映射 | 尽量不唤起情绪,把数据听清楚 |
| 中性 | Relaxing | 轻柔白噪声、舒适调制、背景式持续声 | 用舒适感替代‘完全无情绪’ |
| 不确定 | Wavy | 振幅调制、调制频率变化、音高波动、适度白噪声 | 把区间与摇摆感听觉化 |
| 不确定 | Ominous | 深低音、较大音量、白噪声或调制、恐怖片式音色联想 | 强调风险、陌生和不安 |
参与者共 21 人,其中 7 名女性、14 名男性,平均年龄 26.5 岁,范围 23—32 岁;只有 1 人熟悉声化概念。一个值得注意的观察是,10 个 ominous 作品中有 6 个来自 8 名女性参与者,但样本太小,不能把它解释成稳定的性别差异。研究还发现,白噪声同时出现在 relaxing、wavy 和 ominous 中,说明它更适合作为需要验证的候选变量,而不是安全的默认映射。
参与者、可视化任务、声音制作工具和编码流程是主要实验材料;样本量、统计检验、音频参数和重复实验设置未在摘要完整说明。
🔬 细节详述
为什么不是把温度直接映射为音高。 直接映射确实便于跟随数据,但历史温度本身也在变化;一些参与者认为,只要声音不断起伏,就已经失去‘中性’。因此,数据可辨识度与情感中性并不总是一致。
声音参数背后的个人记忆。 参与者会把乐器音色联想到电子游戏、恐怖电影、电话等待音或雨声。低音常被解释为阴暗和压迫,高音有时代表轻快,有时又像警报。研究由此把参数值和解释理由分开记录,避免只看滑块位置就误读设计意图。
四个主题不是四套固定预设。 Wavy 更强调变化、振荡和‘不确定范围’,ominous 更强调危险和负面情绪;clear 追求信息干净,relaxing 则允许带有舒适情绪。主题描述的是设计逻辑,具体音色和参数仍可重叠。
对产品设计的启示。 若面向公共信息展示,应让用户能关闭或切换情感声层,并优先测试含义可能歧义的白噪声和极端音高。若数据本身带有强烈现实语义,如气候变暖,还需区分用户是在听‘预测不确定性’,还是在回应数据内容带来的焦虑。
⚖️ 评分理由
创新性 (1.2/2):[A_METHOD] 把声化评价推进到不确定性的情感解释,问题选择新鲜且有设计价值,但仍属于探索性框架。
技术严谨性 (1.0/1.5):[A_RIGOR] 任务顺序平衡、预注册、伦理审批和多人复核提升了质性研究可信度;主题仍受解释者与语境影响。
实验充分性 (1.0/1.5):[A_RESULTS] 21 人的共创过程提供了丰富材料,但没有独立听众验证四类作品是否真的传达目标情绪。
清晰度 (0.9/1):[A_CLARITY] 工具、流程、参数和主题关系完整,读者容易复用研究设计。
影响力 (0.8/1.5):[A_IMPACT] 对无障碍可视化、数据新闻和风险沟通有直接启发,影响范围取决于后续定量验证。
开源 (0.5/1.5):[A_OPEN] 作品与代码本作为补充材料提供,但不是可直接部署的标准化声化系统;按锚点规则对应「明确肯定语境中的未来开放承诺」。。
可复现性 (0.3/0.5):[A_REPRO] 工具参数、参与者结构和分析流程披露较充分,质性编码仍难做到完全机械复现。
工程/实践价值 (1.0/1.5):[A_ENGINEERING] 给出了可落地的参数候选与误用警告,距离产品级设计规范还差跨文化、跨任务听测。
🚨 局限与问题
21 名参与者主要来自同一大学环境,年龄范围窄,音乐经验、文化背景和听觉习惯不足以代表更广泛用户。
温度预测与气候变化自带负面语义,参与者的 ominous 选择可能在表达气候焦虑,而不只是表达统计不确定性。
共创结果没有交给新的听众做盲听验证,因此四个主题目前是生成设计假设,不是已验证的知觉定律。
一名参与者在实验中被打断;虽然转录未显示严重影响,仍可能改变其思路。
工具只开放有限参数,便于非专家使用,却也可能压缩用户原本想表达的声响空间。
反思式主题分析强调解释深度,不提供传统意义上的编码者一致性系数;适合回答‘为什么’,但不适合直接推断总体比例。