英文题目:Listening Across Spaces: Perceptual Evaluation of an Ambisonics-Based Sound Installation
会议身份:
conference:icmc:2026:conference-paper-id:paper-238
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#统计分析 #主观评测 #环境声 #空间音频信号 #音频质量评估
评分:5.3/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Felipe Otondo:机构信息未能从会议 PDF 纯文本可靠映射
- Leonardo Santos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以智利南部湿地、海岸带与原生林采集的二阶Ambisonics声场为输入,以听者在不同展演空间对临场感、包围感等五维沉浸得分为输出,难点在于房间混响、扬声器几何与素材内容在真实巡展中耦合变化而无法正交分离。先用Core Sound OctoMic采集并存为Ambix中间格式以解耦声场描述与具体阵列,其输出直接进入适配各场馆的三阶解码矩阵生成扬声器馈给。再将同一批海岸、森林、湿地素材在实验室16.1三层阵列与博物馆单层16只环形阵列上经均衡与声压校准后渲染播放,其播放条件进入下一步听音评测。最后组织16名声学工程受训听者经属性培训后在1-10连续量表上即时评分并做方差分析,其均值与显著性结果回流指导装置的材料均衡与空间作曲。与已有受控实验室空间化研究相比,关键差异在于不孤立房间变量而将实验室与展馆作为生态有效的巡回部署情境整体并置,并把沉浸操作化为临场感、包围感、音色清晰度、稳定性、深度五个可分属性,具有展陈指导意义。原文未提供可核对的关键定量结果。该结论适用边界受限于二阶录制上采样至三阶解码、约0.25秒与1.2秒混响及三层与单层几何的特定组合,三层缺失时深度与稳定性推论存在失败条件,跨其他混响与阵列的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://soundlapse.net/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要核对什么?
本文解读的输入是论文正文与 2 张现场布置照片,目标是让刚进入语音与音频方向的研究生能复述这项听音实验做了什么。必须保留的信息包括录制阶数与解码阶数、2 个场地的扬声器层数与混响时间、受试者数量与评分尺度。
输出是一套可核对的方法复述,而不是对沉浸好坏的总体赞美。学习依赖是先分清声场表示与扬声器映射,再分清包围感与沉浸,最后再看房间如何同时改变频谱与空间线索。
全文只讲论文实际做的自然声景再现任务,教学中举的例子会明确标为例子,不补充论文之外的数值或效果承诺。论文所属的 Soundlapse 项目当前可用,资源状态显示其官网链接可达,但这只说明项目页存在,不代表本文实验数据已公开。
沉浸、包围感与存在感为何不能混用?
初学者容易把好听、包住、有身临其境感混成一个词,论文花篇幅把它们拆开。白话说,包围感就是声音是不是从前后左右甚至上下一起过来,存在感就是你是否觉得自己到了录音的那个海滩或湿地。
沉浸则是更大的心理状态,还包括注意力是否被抓住、情绪是否被带入。英文上分别对应 envelopment、presence 与 immersion。论文采用的观点是沉浸既有系统侧的客观一面,也有主观一面。
教学例子是戴上耳机听雨声觉得四周都是雨,这是包围感强,但如果心里还在想实验表格,那就是沉浸不深。区分的意义在于后文结果出现了分离,存在感主要跟着素材走,包围感与深度却跟着房间走。
论文把 5 个属性锚定在已有沉浸音频文献上,存在感强调到场,包围感强调被环绕,音色清晰度强调透明。这些定义是后文评分表的依据,稳定性强调头部移动下声像不散,深度强调近远层次。
同输入同目标的研究如何对照?
按同输入、同目标、同运行阶段对照,Riionheimo 与 Lokki 关于听音房间对知觉沉浸影响的工作与本文最接近。同样关心房间如何改变沉浸,本文的增量是把对照从受控听音室扩展到真实博物馆展厅。
Agrawal 等关于沉浸定义与视听体验的工作提供了概念框架,本文沿用其多维沉浸观。把感觉、认知与情绪维度落实为 5 个可评分属性,这是概念上的继承。
Kailas 与 Tiwari 关于整体听觉体验测量工具的工作提供了方法参照,本文的差异是在纯音频语境下同时测量空间精度与整体沉浸。Paterson 与 Lee 的 3D 音频著作属于背景类文献,不构成同条件胜负比较。
类别差异不能当胜负,本文不与耳机虚拟现实或对象式音频比好坏。只回答在 2 种扬声器装置现场中自然声景的评价如何漂移,这是本文的边界。
论文要解决的矛盾是什么?
矛盾是同一份高阶 Ambisonics 野外录音要在声学实验室与公共博物馆之间巡回展出。但 2 个地方的房间大小、混响、背景噪声与扬声器摆位完全不同,策展人与工程师不知道听众的沉浸感会如何变化。
已有高阶 Ambisonics 与多扬声器阵列进展很快,但在非理想展厅中物理再现条件与主观整体沉浸的关系仍研究不足。论文不把房间混响孤立成单一自变量,而是比较 2 种真实部署情境。
一种是智利南方大学艺术与技术实验室的受控环境,另一种是瓦尔迪维亚 CIPTLAM 博物馆的未处理展厅。这种生态有效的比较更贴近艺术装置的真实流转,但代价是房间声学与再现几何同时变化。
理解这一点才能正确阅读结果,实验室得分高不等于证明混响是唯一原因。因为 2 地的扬声器层数也不同,事后无法干净归因,这是全文反复强调的前提。
从野外录音到 2 地回放,主链路如何走通?
先沿一个样本走完全程,假设选的是一段海岸林录音。第一步是在野外用 2 阶 Core Sound OctoMic 话筒采集成 Ambix 中间格式,这个格式与具体扬声器无关。
第二步是把同一份 2 阶素材拿到 2 个场地,分别用适配各自 16 只 Genelec 布局的 3 阶解码流程算出增益矩阵。再做频率相关加权以减轻截断误差并保持听音区音色平衡,这是解码侧的关键计算。
第三步是等响校准后随机顺序播放,16 名有批判性聆听经验的声学工程学生用 1 到 10 连续量表对 5 个属性打分。第四步是比较实验室与博物馆的均值模式并做方差分析,看房间与素材如何交互。
存在感 × 空间稳定性: 存在感分工是回答是否觉得自己在那个海岸或森林里的到场感,空间稳定性分工是回答头部轻动时空间影像是否保持稳固,二者搭配的理由是前者更依赖素材内容是否可信,后者更依赖解码与房间是否保持声像不漂,组合意义是论文用同一批听音同时测量两者,才能区分内容驱动的稳健属性与系统驱动的脆弱属性。
沿这条链路可以看出,论文的方法职责不是训练神经网络,而是构造可比的再现与评价流程。录制阶数封顶了空间信息,再现布局与房间决定了信息损失的方式,而评分框架决定了损失能被哪一把尺子量到。
声场表示与扬声器映射各自负责什么?
Ambisonics 的白话是把空间声音先写成标准中间语言,英文是 Ambisonics。扬声器解码的白话是把中间语言翻译成每个喇叭该出多大声,英文是 Ambisonics decoding。
论文用球谐函数加权和来描述声场,编码存成 Ambix,回放时实时解到具体布局。计算上就是求一个把 Ambisonics 通道映射到扬声器的增益矩阵,必要时加频率相关加权。
Ambisonics × 扬声器解码: Ambisonics 负责把听音点周围声场写成与具体扬声器无关的中间格式,扬声器解码负责把该格式实时映射到每个场地实际可用的扬声器布局上,二者搭配的理由是同一份野外录音要在实验室多层阵列和博物馆 1 层圆环之间流通,组合意义是录制阶数决定空间细节上限而解码阶数与布局决定这些细节能被还原多少。
包围感与沉浸的区分同样是组件级概念,需要在评价前先分开。包围感看能量是否从各方向到达,沉浸看心理是否进入并保持投入。
包围感 × 沉浸: 包围感分工是描述声音能量是否从四面八方到达的知觉属性,沉浸分工是包含感觉、认知与情绪的多维心理状态,二者搭配的原因是不能把能量包住等同于心理上进入,组合意义是本研究同时测量包围感与更高层的沉浸相关属性,才能解释博物馆混响增强弥散感却损害定位与深度的分离现象。
对初学者而言,关键是不要把 3 阶解码误解为把 2 阶录音升级成了 3 阶录音。原文明确说录制是 2 阶,再现用更高阶解码策略做适配,这只是更精细的渲染方式。
有效信息仍受限于 2 阶采集,频率加权的真实作用是让截断误差不至于引起明显的音色起伏。而不是创造新的方向细节,这是常见的误解,需要对照原文纠正。
本研究没有训练模型,真正的构造与校准是什么?
本研究没有训练任何神经网络模型,也就没有梯度路径、参数冻结与更新、损失函数与早停需要报告。这是必须先说清的缺项,避免用模型名称推定实现。
真正的计算与构造发生在 3 处,一是用 OctoMic 做 2 阶野外采集并存为 Ambix。二是为 2 套 16 只阵列分别计算 3 阶解码增益矩阵并做频率相关加权与电平校准。
三是对听音人做训练,让他们熟悉 5 个属性定义与 1 到 10 连续量表。以建立一致的内部参照并降低个体间变异,这是听音实验里的训练含义。
录制阶数 × 再现阶数: 录制阶数分工决定采集时球谐函数能保留到第几阶,再现阶数分工决定回放解码矩阵按第几阶的截断与加权去驱动扬声器,二者搭配的理由是本研究录制为 2 阶而回放用 3 阶解码流程做适配,组合意义是高阶解码不能无中生有地补出录制时已丢失的高阶空间细节,只能更平滑地把已有 2 阶信息分配到 2 种不同的 16 只阵列上。
复现时不应寻找训练代码,而应核对解码器阶数设置、扬声器坐标输入、均衡与电平校准文件。以及随机化播放顺序的记录,因为这些才是决定可比性的构造细节。
论文未报告解码矩阵的具体数值与均衡曲线,这是复现链上的具体缺项。后人只能按同阶数与同布局重算,不能直接复用原矩阵。
2 个场地与听音流程的条件是否一致?
比较问题是同一批自然声景在受控实验室与混响博物馆中是否得到相同的沉浸评价。公平条件要求同一批 2 阶素材、同样 16 只 Genelec 系统、校准后等响播放、随机顺序、听后立即评分。
指标方向是 1 到 10 分越高表示该属性感受越强,5 个属性共用同一量表。混响时间与音色清晰度的机制联系是理解场地差异的钥匙,长混响会涂抹细节。
混响时间 × 音色清晰度: 混响时间分工是刻画房间反射拖尾长短的物理条件,音色清晰度分工是刻画听到的场景是否透明、有无发闷发混,二者搭配的理由是长混响会在时间与频谱上涂抹直达声细节,组合意义是实验室约 0.25 seconds 与博物馆约 1.2 seconds 的对比可以直接检验宽带密集素材在混响中清晰度下降的机制。
先看实验室的布置,下段导读帮你把照片与文字条件对上。重点是多层阵列与吸声处理如何共同提供垂直线索并压住反射。
看图路径: 1. 先确认听音人坐在圆环中央,周围地面支架与顶部吊挂扬声器构成多层包围;2. 再看墙面同时挂有吸声板与扩散体,说明房间经过声学处理;3. 最后核对地面蓝色胶带标记,理解听音位置与扬声器距离是被固定的
论文图 2。原论文 Figure 2:“Listening test setup at the Arts and Technology Lab, Universidad Austral de Chile.”。
照片显示听音人坐在房间中央,近处地面支架与远处墙边支架构成水平环。顶部还有吊挂扬声器形成高度层,墙面可见吸声板与条状扩散体,地面有固定听音位的标记。
这与正文描述的 16.1 阵列分布在 3 层、约 0.25 seconds 混响、3 维解码可评估定位与深度的说法一致。实验室的教学价值在于它提供了接近干净的参考,空间线索受反射干扰最小。
| 条件 | 扬声器配置 | 混响时间 | 垂直线索 | 对比性质 |
|---|---|---|---|---|
| 实验室 Arts and Technology Lab | 16.1 阵列分布在 3 层 | 约 0.25 seconds | 有顶部层,可做近完整 3 维解码 | 受控参考 |
| 博物馆 CIPTLAM 展厅 | 16 只 1 层圆环 | 约 1.2 seconds | 无高度层,仅 2 维环 | 真实展览情境 |
表前已提出比较问题与公平条件,表中混响与层数差异是后文归因困难的根源。实验室的收益是空间精度与可重复性,代价是与真实展厅相距较远。
博物馆的收益是生态有效,代价是混响与 2 维布局混在一起。任何包围感或深度的下降都不能单独判给房间,论文明确承认这是局限,并建议未来用可比的多层布局分离 2 种效应。
博物馆圆环与听音人安排如何支持复现?
接着看博物馆的布置,下段导读帮你确认 1 层圆环与开放展厅的对应关系。重点是为什么这里天然缺少垂直线索且反射更强,这是理解结果的前提。
看图路径: 1. 先从高处俯视确认 16 只扬声器在地面围成 1 层圆环,没有顶部扬声器层;2. 再看圆环位于楼梯旁的开放展厅,墙面硬而高,缺少实验室那样的吸声扩散处理;3. 最后注意圆心地面投影与外围走线,理解这是展览现场而非受控听音室
论文图 3。原论文 Figure 3:“Listening test setup at the CIPTLAM museum in Valdivia, Chile.”。
从高处俯视可见 10 多只立在支架上的扬声器在地面围成一圈,圈内有投影。背后是楼梯与高墙,没有实验室那样的吸声与顶部扬声器,这与正文说的 1 层 16 只环一致。
复现时要注意 2 地不仅是混响不同,几何也不同,因此不能把本研究读成单一变量实验。听音流程上,16 名声学工程学生先经过属性培训,再对海岸、森林、湿地环境中选出的 5 段素材打分。
这些素材被描述为具有分层氛围、横向运动与垂直活动,同一批刺激在 2 地都播放。电平经过仔细匹配,顺序随机以减小上下文偏差,每段听后立即对 5 个属性评分,从而支持细粒度跨空间比较。
| 评价要素 | 操作定义 | 评分与呈现 | 受试者与素材 | 可运行策略 |
|---|---|---|---|---|
| 存在感 | 到场感 | 1 到 10 连续量表听后立即评 | 16 名训练有素听音人评 5 段野外录音 | 同素材 2 地播放、电平匹配、顺序随机 |
| 包围感 | 被环绕感 | 1 到 10 连续量表听后立即评 | 16 名训练有素听音人评 5 段野外录音 | 同素材 2 地播放、电平匹配、顺序随机 |
| 音色清晰度 | 场景透明度 | 1 到 10 连续量表听后立即评 | 16 名训练有素听音人评 5 段野外录音 | 同素材 2 地播放、电平匹配、顺序随机 |
| 空间稳定性 | 头动下声像稳固度 | 1 到 10 连续量表听后立即评 | 16 名训练有素听音人评 5 段野外录音 | 同素材 2 地播放、电平匹配、顺序随机 |
| 深度 | 近远距离与层次结构 | 1 到 10 连续量表听后立即评 | 16 名训练有素听音人评 5 段野外录音 | 同素材 2 地播放、电平匹配、顺序随机 |
表前的问题是 5 个属性是否用同一把尺子在 2 地测量,公平条件是同一批人、同一量表、同一批素材与校准流程。这种设计的收益是属性间可比,代价是受试者都是声学工程学生。
批判性聆听能力强但不代表普通博物馆观众,论文后文用观众问卷做补充正是为了弥补这一边界。这是把受控评价推向展览实践时必须记住的适用条件。
哪些属性跟着房间走,哪些跟着素材走?
测量的是 5 个属性在 2 地的均值模式与方差分析结果,与谁比是实验室对博物馆。条件一致性如上节所述,指标方向都是分数越高越强,这是阅读趋势的前提。
论文报告的总体趋势是实验室多数属性评分高于博物馆,但差异大小取决于属性与录音特性。存在感主要由刺激驱动,对房间不敏感,海滩近距离与海岸林在 2 地都最高,湿地最低。
且未观察到房间与录音类型的有意义交互,这是存在感稳健的证据。包围感则更依赖空间,实验室高而稳,博物馆对频谱宽、横向活跃的录音下降更明显,呈现中等交互。
音色清晰度同样实验室更高,博物馆对密集或宽带声景下降更突出。稳定性在实验室更高,复杂或远距离声源在博物馆退化更明显,深度表现出最强的房间依赖。
有显著近远线索的录音在实验室得分远高,在博物馆被部分掩蔽。方差分析佐证了包围感、清晰度、稳定性与深度的稳健房间效应,而存在感相对不受环境影响。
支持的判断是精细空间属性对房间与布局组合更敏感,未验证的推测是不能把每一分下降都归因于混响。因为垂直层缺失同样可能削弱包围感与存在感,湿地素材在 2 地存在感都低,说明内容本身可能是下限。
如果去掉垂直层或换成密集宽带素材会怎样?
论文没有做严格的消融实验,但 2 种对比起到了类似反证作用。一是场地对比可视为去掉垂直层并拉长混响的联合干预,结果是深度与稳定性损失最大。
包围感对宽带横向素材损失明显,这支持垂直线索与反射比共同维持空间精度的解释。二是素材对比可视为内容消融,海滩与海岸林即使在博物馆仍保持较高存在感。
而湿地在 2 地都低,说明存在感更多被生态可信度与显著事件驱动,而不是被房间决定。另一类特有细节是作者提到方法论反哺了艺术装置设计,包括素材选择与播放均衡。
以及宽带密度控制与更适合混响空间的空间作曲策略,这意味着在混响厅中应主动避开过于密集的宽带铺底。或通过均衡与声部稀疏化保留近远层次,这是从结果派生的实践策略。
论文未报告去掉均衡或改变播放声压会怎样,也未给出每段素材的频谱定量参数。因此这些设计建议属于有限解释而非已验证的因果,还需要补做控制均衡与密度的对照才能确认。
混淆、样本与测量的边界在哪里?
第一个局限是实验室 3 层系统与博物馆 2 维系统的差异可能影响结果。特别是与垂直线索密切相关的存在感与包围感,作者在结论中明确承认这一点。
并提出未来应在不同环境部署可比的多层阵列,或系统控制垂直再现以分离房间效应与系统效应。第二个局限是样本代表性,16 名听音人都是有经验的声学工程学生。
评分一致性好但不能推广到普通观众,论文用后续装置的观众问卷做桥接。但正文只给出早期定性观察而未提供可核对的问卷数字,这是证据缺项。
第三个局限是测量层面,原文提到均值表与方差分析表,但在本次可核对的文本证据中 2 张表的具体数字矩阵缺失。只能依据文字报告的趋势复述,不能硬写每段素材的分差或显著性值。
第四个局限是扬声器均衡作为潜在贡献因素尚未检验,作者只说未来会考察。这意味着当前结果是在特定均衡与校准下的联合效应,把这些边界说清后,才能避免把实验室高于博物馆读成所有混响厅都不适合做沉浸装置。
要复现这项听音比较,先做什么?
复现的第一步是准备可流通的素材,用 2 阶 Ambisonics 话筒在海岸、森林、湿地采集片段。素材应具有分层氛围与运动并存为 Ambix,同时记录话筒高度与朝向,因为这决定近远线索的上限。
第二步是搭建 2 套 16 只 Genelec 系统,一套按 3 层 16.1 布置并测得约 0.25 seconds 混响。一套按 1 层圆环布置在约 1.2 seconds 的硬墙展厅,并为各自布局计算 3 阶解码矩阵与频率加权。
保存扬声器坐标、增益矩阵、均衡与声压校准记录,这是可比性的关键。第三步是招募 16 名左右有批判性聆听经验的听音人,做属性培训与 1 到 10 量表锚定。
同一批 5 段素材在 2 地等响、随机播放、听后立即评分,这是流程上的公平条件。第四步是按房间与素材做重复测量方差分析,重点看存在感是否仍稳健、深度是否仍最敏感。
还需补的验证包括补测背景噪声、补报解码与均衡参数、补做普通观众样本。以及在条件允许时把博物馆也搭成多层阵列以分离变量,Soundlapse 官网当前可用,可用于核对项目背景,但实验级数据是否公开在证据中未交代。
何时值得尝试这种装置,结论如何收束?
当你的声音素材本身具有清晰的近远事件与横向运动,且你能在展厅中保留一定的直达声比例与垂直覆盖时。值得尝试 Ambisonics 装置,因为实验室结果显示这类线索一旦被保留,深度与稳定性可以被听出来。
当展厅混响长且只能做 1 层环时,应降低宽带密度、精选生态可信的素材并做针对性均衡。因为博物馆结果显示密集宽带最容易变混,而存在感仍可能靠内容保住,这是内容与系统的分工。
论文的最终判断是沉浸是情境化的,它由声音内容、房间声学与再现条件共同塑造。受控条件出空间精度,混响厅出弥散的整体包裹感,这是 2 种场地的不同优势。
早期观众调查显示即使深度与稳定性下降,整体沉浸与参与仍可很高。这提示情感反应、生态合理性与策展 framing 同样参与了沉浸的构成,但这部分仍是待验证的桥接,需要把属性评分与观众问卷做显式关联后才能下更强的结论。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

