📄 Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models
标签:#Transformer #多模态模型 #基准测试 #模型评估 #可解释性
6.1/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.2/1.5
✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #多模态模型 | #Transformer | #基准测试 #模型评估 | arxiv
👥 作者与机构
- 第一作者:Yun-Shao Tsai(台湾大学)(共同第一作者)
- 共同第一作者:Chun-Wei Chen(台湾大学)、Chee-En Yu(台湾大学)、Yi-Cheng Lin(台湾大学)
- 末位作者(推测为通讯作者):Hung-yi Lee(台湾大学)
- 作者列表:Yun-Shao Tsai*(台湾大学)、Chun-Wei Chen*(台湾大学)、Chee-En Yu*(台湾大学)、Yi-Cheng Lin*(台湾大学)、Hung-yi Lee(台湾大学),其中*表示平等贡献
💡 毒舌点评
本文提出了一个引人入胜的评估框架,将心理学中的经典声音象征范式系统引入语音语言模型评测。然而,其核心发现——当前模型在此任务上表现不佳——面临一个根本性的归因困境:这究竟揭示了模型能力的真实缺失,还是评估目标与训练目标之间的错配?论文自己的实验恰好暴露了这一悖论:Gemini3.5-Flash在跨模态匹配上达到100%正确率,作者却将其归因于词汇记忆而非声学感知,这意味着一个"成功"的案例反而证明了评估指标可能并未测量其声称测量的能力。更关键的是,跨模态实验(Experiment 3)仅使用bouba/kiki两个极度知名的伪词,样本量之小使得任何关于"模型跨模态失败"的结论都缺乏统计稳健性——若换用536个伪词进行跨模态测试,结果可能截然不同。
📌 核心摘要
本文研究语音语言模型(SLM)是否具备人类普遍存在的"声音象征效应"(sound symbolism),即根据语音(如"bouba"对应圆润,“kiki"对应尖锐)来感知形状的能力。研究动机源于SLM在创意应用(如根据语音描述生成图像)中日益广泛的部署——若模型的声音象征直觉与人类不一致,其产出可能令用户感到不协调。研究设计了一套包含四个实验的系统评估框架:听觉强制选择(Experiment 1)、听觉分级评分(Experiment 2)、跨模态匹配(Experiment 3)和纯视觉消融(Experiment 4)。核心创新在于首次使用人类真实语音录音和心理学实验数据作为基准,而非文本或合成标签。实验评估了8个SLM(4个仅音频模型,4个全模态/omni模型),提示语言覆盖25种语言(分析保留10种)。主要发现:(1)模型在听觉判断上与人类对齐程度很低——最佳模型Qwen3-Omni的一阶Pearson \(r = -0.470\)(人类天花板为 \(-0.843\)),RSA \(\rho = -0.104\)(人类天花板为 \(-0.377\));三个模型(Audio Flamingo 3、Step-Audio2、Gemma4-E4B)的相关性在实践中可忽略不计(\(|r| < 0.05\));(2)模型未利用驱动人类判断的关键声学线索(如频谱倾斜,人类 \(\rho = -0.431\)),所有模型在该线索上的相关性极弱;(3)跨模态匹配中,Gemini3.5-Flash表现完美(可能依赖词汇知识),三个开源omni模型均失败且表现出不同的人为偏差(形状偏向、顺序效应等);(4)纯视觉实验表明所有omni模型对形状的感知高度准确(\(r\) 范围0.94–0.97),因此跨模态失败可归因于听觉表征的不足;(5)对数透镜分析显示Qwen3-Omni的感知判断在最后4–6层才形成,图像输入的评分轨迹与人类评级清晰分离,而音频输入的轨迹在整个网络中纠缠不清。
关键实验结果(Experiment 2)表格:
| 模型 | Pearson \(r\) | Spearman \(r_s\) | RSA \(\rho\) |
|---|---|---|---|
| Audio Flamingo 3 | -.033 | -.014 | -.008 |
| Kimi-Audio | -.415 | -.421 | -.056 |
| Step-Audio2 | -.020 | -.032 | -.020 |
| GPT-Audio-1.5 | -.231 | -.200 | -.072 |
| Gemma4-E4B | -.044 | -.054 | -.004 |
| MiniCPM-o-4.5 | -.283 | -.251 | -.063 |
| Qwen3-Omni | -.470 | -.461 | -.104 |
| Gemini3.5-Flash | -.392 | -.337 | -.019 |
| 人类天花板 | -.843 | -.838 | -.377 |
🔗 开源详情
- 代码:论文提供了匿名代码仓库链接:https://anonymous.4open.science/r/Sound-Symbolism-SLM。承诺开源代码及完整翻译集。
- 模型权重:论文评估了8个语音语言模型(SLMs),分为开源权重模型和专有模型。论文未提供新训练的模型权重。
- 开源权重模型:论文提及了模型名称及其发布许可,但未提供直接的HuggingFace/ModelScope链接。具体获取方式需根据许可查找:
- Qwen3-Omni:遵循《Qwen许可》发布(详见模型卡)。
- MiniCPM-o-4.5:遵循《MiniCPM许可》发布(详见模型卡)。
- Gemma4-E4B:遵循《Gemma使用条款》发布。
- Step-Audio2、Kimi-Audio、Audio Flamingo 3:各自遵循其HuggingFace模型卡中详述的许可。
- 专有模型:通过商业API访问。
- Gemini3.5-Flash:通过Google AI API访问,遵循《Google AI开发者服务条款》。
- GPT-Audio-1.5:通过OpenAI API访问,遵循《OpenAI使用条款》。
- 开源权重模型:论文提及了模型名称及其发布许可,但未提供直接的HuggingFace/ModelScope链接。具体获取方式需根据许可查找:
- 数据集:论文使用了三个第三方数据集,均未在论文中提供直接下载链接。
- Ćwiek等人[5]的bouba/kiki录音:根据CC BY 4.0许可发布,链接在原论文的仓库中。
- McCormick等人[22]的假词音频:由原作者出于学术研究目的分享,仅用于非商业研究。
- Lacey等人[18]的形状刺激和相异度矩阵:需联系原通讯作者获取,用于学术研究。
- Demo:论文中未提及在线演示或Demo地址。
- 复现材料:论文附录(特别是附录B)提供了详细的实验复现材料,包括被分析的10种语言列表、所有实验的完整英文提示模板(承诺代码发布时会提供完整翻译集)、用于从模型自由格式回复中提取答案的LLM judge提示模板。论文中未提及模型训练配置或检查点信息,因为本工作是评估现有模型而非训练新模型。
🏗️ 方法概述和架构
本文的核心方法是设计并执行一套系统的行为实验,以评估语音语言模型(SLM)是否表现出人类的声音象征效应(以bouba/kiki效应为代表)。研究并非提出一个新的神经网络架构,而是构建了一个评估框架和方法论,将心理学中经典的bouba/kiki实验范式系统地适配到SLM评估场景中。整体流程为:准备来自心理学研究的人类录音和形状刺激材料 → 设计四个逐步深入的实验任务 → 在多个SLM上执行这些任务并收集模型输出 → 将模型输出与人类基准数据进行多维度的统计比较分析。
1. 刺激材料准备
功能:提供标准化的、与人类心理学实验一致的刺激,确保评估的生态效度和可比性。
实现:使用三个来源的数据:(1) Ćwiek等人[5]的"bouba"和"kiki"录音(25种语言的提示),由单一语音学家录制,遵循CC BY 4.0许可;(2) McCormick等人[22]的536个伪词录音(用于连续评分),由单一美式英语女性说话人以平直语调录制,辅音涵盖响音、擦音、塞擦音和塞音(含浊音和清音),元音在前性和圆唇度上变化;(3) Lacey等人[8]的90个抽象形状图像及其人类评分数据,需联系原作者获取。所有音频均由单一说话人录制以控制说话人变异变量。
2. 实验设计与任务
功能:将bouba/kiki效应分解为可测量的组件,逐步评估模型的听觉判断、跨模态整合和视觉判断能力。四个实验分别对应论文的四个研究问题(RQ1–RQ4)。
研究设计了四个逐步深入的实验任务,以分解评估bouba/kiki效应的不同组成部分。

下图直观地展示了四个实验(Experiment 1-4)的输入、任务和输出形式,分别对应听觉判断、跨模态匹配和视觉评估。
内部结构/实现:
Experiment 1(听觉强制选择):模型听一个"bouba"或"kiki"录音,从"rounded"和"spiky"两个形状标签中选择。提示语言在25种语言中变化。音频固定,仅提示语言变化,因此跨语言差异反映提示语言效应而非声学差异。选项顺序在30次重复中平衡(各出现15次)。共 \(2 \times 25 \times 30 = 1500\) 次试验/模型。
Experiment 2(听觉分级评分):模型对536个伪词分别在"rounded"和"pointed"两个7点量表上进行评分(分别提问,非同时)。使用双量表是因为人类的圆润和尖锐评分对伪词仅呈弱负相关——一个声音可以同时被感知为有些圆润和有些尖锐。组合分数公式为 \(\text{score} = (\text{rounded} + (8 - \text{pointed})) / 2\),值越高表示越圆润。该实验允许进行细粒度的相关性分析和声学线索探查。
Experiment 3(跨模态匹配):模型同时看到两个形状(一圆一尖,来自Lacey等人[18])并听到一个录音(来自Experiment 1),选择匹配的形状。提示语言在25种中变化。选项顺序平衡。这是与人类原始任务最接近的实验。
Experiment 4(纯视觉消融):模型仅看到90个形状中的一个(无音频),在与Experiment 2相同的两个7点量表上进行评分。作为Experiment 3的对照组,用于隔离视觉能力——若模型在该任务上表现良好,则Experiment 3的失败可归因于听觉端而非视觉端。
3. 分析管线
功能:将模型的自由文本输出转化为可量化的数据,并与人类基准进行多层次统计比较。
内部结构/实现:
响应提取:使用一个LLM judge(Qwen3.6-35B-A3B)从模型回复中机械性地提取选择的标签或数字,该judge仅执行提取操作而不进行质量判断。通过每实验500条人工标注进行验证,judge标签与人类标注完全一致。无法解析的回复(拒绝、离题、未选择任何选项)被排除,各实验仅计算可解析试验的比率。
一阶分析(实验2和4):计算模型评分与人类评分的Pearson \(r\) 和Spearman \(r_s\) 相关系数,评估个体刺激的排名一致性。相关系数对照人类天花板进行解读——人类天花板为人类评分的split-half reliability(经Spearman-Brown校正[29,2]),分别计算 \(r\) 和 \(r_s\)。这是模型能达到的最高相关性,因为没有模型能比人类两半之间的匹配更接近人类均值。
二阶表征相似性分析(RSA)(实验2和4):构建模型和人类的刺激间相异度矩阵。人类矩阵来自Lacey等人[18]:每个词的评分被堆叠为一个向量(每位评分者一个条目),两个词之间的相异度为1减去其向量间的Pearson相关,使两个圆润词或两个尖锐词显得相似,而圆润词与尖锐词显得强烈不同。模型矩阵则使用分数的绝对差值。使用Spearman秩相关(\(\rho\))比较矩阵,以Mantel置换检验(10,000次置换)评估显著性。秩相关吸收了人类和模型矩阵构建方式的差异。
声学线索分析(实验2):将模型的听觉相异度矩阵与Lacey等人[8]提供的十个声学参数的相异度矩阵进行RSA,以确定模型判断所依据的声学特征。这十个参数涵盖频谱、时间和声音质量维度:频谱倾斜(Spectral tilt)、时间调制(Temporal modulation)、语音包络(Speech envelope)、自相关(Autocorrelation)、谐噪比(HNR)、非浊音比例(Fraction unvoiced)、脉冲数(Pulse number)、抖动(Jitter)、微颤(Shimmer)、基频标准差(Pitch SD)。每个相关性使用相同的Mantel置换检验评估,并将模型的线索配置文件与人类的进行比较。
对数透镜分析(Logit Lens):对表现最好的开源模型Qwen3-Omni,在其处理音频和图像刺激时,读取每一层最终令牌位置的残差流(residual stream),通过最终的解嵌矩阵(unembedding matrix)投影到完整词表上,并应用softmax以获得输出词表上的概率分布。具体追踪数字令牌(1–7)的分布。追踪两个指标:(i) 所有汇集刺激在每层的最大softmax概率(揭示模型何时真正承诺一个评分);(ii) 每层的argmax数字,按人类评级分组(低[1,3)、中[3,5)、高[5,7])取均值(揭示模型内部表示与人类认知类别的对齐程度)。
4. 关键设计选择及动机
- 使用人类心理学数据而非合成标签:动机是直接测量模型与人类感知的对齐程度,避免LLM生成标签引入的偏见或词汇记忆效应。论文指出先前工作[15]主要使用合成标签和自然词典词,可能引入词汇记忆效应。
- 分解效应:将bouba/kiki效应拆解为听觉(实验1和2)、跨模态(实验3)和视觉(实验4)成分,可以精确定位模型失败的环节(例如,实验4证明视觉完好,则跨模态失败源于听觉)。
- 控制伪影:在实验1和3中明确实施选项顺序平衡(各选项在30次重复中各出现15次),并识别了响应偏见(MiniCPM-o-4.5对"rounded"的默认偏好)和顺序效应(Qwen3-Omni跟踪选项位置而非声音),展示了对实验设计中混杂因素的系统性控制。
- 仅音频与omni模型的分组:仅音频模型(Step-Audio2、Kimi-Audio、Audio Flamingo 3、GPT-Audio-1.5)仅运行实验1和2(因无法接受图像输入),omni模型(Qwen3-Omni、MiniCPM-o-4.5、Gemma4-E4B、Gemini3.5-Flash)运行全部四个实验。
- 推理设置:每个刺激采样30个响应,温度设为0.7,使每个分数反映模型的响应分布而非单次采样。
💡 核心创新点
首次系统性地使用人类心理学实验数据评估SLM的声音象征:先前研究多基于文本-图像关联[1,14,28]或使用LLM合成标签[15]。本文直接采用心理学领域验证过的人类录音和评分数据作为黄金标准,确保了评估的生态效度和可靠性。论文测试了8个模型、25种语言提示、来自三个独立心理学研究的刺激材料。
对声音象征效应的系统性分解:将单一效应分解为听觉判断(实验1&2)、跨模态匹配(实验3)和视觉判断(实验4)四个部分。这种分解设计使得能够精确诊断模型能力缺陷的来源——通过实验4证明视觉能力完好(\(r = 0.94\)–\(0.97\)),从而将跨模态失败归因于听觉表征的不足。
多层次分析方法的组合:不仅报告任务准确率,还运用一阶相关分析、二阶RSA分析模型与人类刺激空间结构的对齐程度、声学线索分析揭示模型判断背后的声学特征、最后用对数透镜分析内部表示的形成过程。这种多层次分析提供了比简单准确率更深刻的诊断视角。
揭示开源与闭源模型在跨模态能力上的关键差异:实验发现开源omni模型在跨模态匹配上失败(各以不同方式:形状偏向、顺序效应等),而Gemini3.5-Flash成功,但后者的听觉对齐同样较弱。这提出了关于模型训练数据、规模和目标如何影响隐式跨模态对齐的重要问题。
实用动机的明确阐述:论文明确指出SLM在创意应用(如从语音描述生成图像)中的日益广泛部署,为声音象征对齐问题提供了现实应用场景——若用户要求模型设计名为"bomu"的机器人却得到尖锐棱角的外形,结果将违背大多数听众的感知期待。
📊 实验结果
实验基于8个模型(4个仅音频,4个omni)和来自三个先前心理学研究的数据集。所有实验结果均与人类基准数据进行对比。
为进一步分析模型内部表示的形成过程,对Qwen3-Omni进行了对数透镜(Logit Lens)分析。

下图展示了在“rounded”和“pointed”条件下,模型根据人类评级分组的刺激在音频和图像输入时,其argmax-digit轨迹的层间变化,清晰地显示了视觉与听觉表征在对齐人类评级上的差距。
在关键的听觉分级评分实验(Experiment 2)中,模型的性能远低于人类基准,关键实验结果如下表所示。

下图显示了表现最佳的模型Qwen3-Omni在处理音频和图像输入时,其模型预测(digit-token概率)在网络各层中的形成过程,揭示了不同模态下信息处理的差异。
Experiment 1(听觉强制选择)
TABLE I: Experiment 1. 各语言中模型将bouba标注为rounded(B)和kiki标注为pointed(K)的比率。每个模型列中最接近人类比率的以粗体标出。星号(\(*\))标记二侧二项检验(\(p < .05\))显著偏离0.50的比率。B vs K列给出跨十种语言汇总的bouba/kiki差异方向;匕首(\(\dagger\))标记Wilcoxon符号秩检验(\(p < .05\))显著性。
| 模型 | en B | en K | ja B | ja K | zh-cn B | zh-cn K | pt B | pt K | fr B | fr K | tr B | tr K | it B | it K | de B | de K | pl B | pl K | hu B | hu K | B vs K |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Human | 0.88 | 0.88 | 0.89 | 0.95 | 0.52 | 0.54 | 0.67 | 0.62 | 0.92 | 0.78 | 0.61 | 0.45 | 0.88 | 0.76 | 0.91 | 0.79 | 0.89 | 0.81 | 0.95 | 0.75 | – |
| Audio Flamingo 3 | 0.53 | 0.57 | \(0.67^*\) | \(0.23^*\) | \(0.97^*\) | \(0.20^*\) | \(0.77^*\) | \(0.27^*\) | \(0.87^*\) | \(0.21^*\) | \(0.83^*\) | \(0.17^*\) | \(0.00^*\) | \(1.00^*\) | \(0.14^*\) | \(0.78^*\) | \(0.21^*\) | \(0.75^*\) | \(0.30^*\) | 0.48 | \(b \gg k^\dagger\) |
| Kimi-Audio | \(0.90^*\) | \(0.07^*\) | \(0.97^*\) | \(1.00^*\) | \(1.00^*\) | \(0.24^*\) | \(0.97^*\) | \(0.10^*\) | \(0.87^*\) | 0.47 | 0.64 | \(0.86^*\) | 0.67 | 0.43 | \(1.00^*\) | 0.53 | \(1.00^*\) | \(0.03^*\) | 0.33 | 0.36 | \(b \gg k^\dagger\) |
| Step-Audio2 | \(0.20^*\) | \(0.77^*\) | \(0.00^*\) | \(0.97^*\) | \(0.30^*\) | 0.60 | \(0.80^*\) | \(0.17^*\) | \(0.80^*\) | \(0.20^*\) | \(0.73^*\) | \(0.27^*\) | 0.47 | 0.63 | \(0.17^*\) | \(0.90^*\) | \(0.23^*\) | \(0.83^*\) | 0.50 | 0.53 | \(k \gg b^\dagger\) |
| GPT-Audio-1.5 | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(0.97^*\) | 0.79 | 0.53 | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(k \gg b^\dagger\) |
| Gemma4-E4B | \(0.77^*\) | 0.40 | \(0.77^*\) | 0.50 | \(0.90^*\) | 0.53 | \(0.93^*\) | 0.40 | \(1.00^*\) | \(0.00^*\) | \(0.93^*\) | \(0.13^*\) | \(0.97^*\) | \(0.07^*\) | \(0.73^*\) | \(0.20^*\) | \(0.97^*\) | \(0.23^*\) | \(0.77^*\) | \(0.00^*\) | \(b \gg k^\dagger\) |
| MiniCPM-o-4.5 | \(0.97^*\) | \(0.00^*\) | \(0.87^*\) | \(0.20^*\) | \(1.00^*\) | \(0.00^*\) | \(0.87^*\) | \(0.13^*\) | \(1.00^*\) | \(0.10^*\) | \(0.93^*\) | \(0.17^*\) | \(0.97^*\) | \(0.00^*\) | \(0.80^*\) | 0.40 | \(0.87^*\) | \(0.20^*\) | 0.70 | 0.40 | \(b \gg k^\dagger\) |
| Qwen3-Omni | 0.33 | 0.37 | \(0.77^*\) | \(0.17^*\) | \(0.70^*\) | 0.53 | \(1.00^*\) | \(0.10^*\) | \(1.00^*\) | \(0.20^*\) | 0.63 | 0.50 | \(1.00^*\) | \(0.00^*\) | \(0.80^*\) | \(0.73^*\) | 0.50 | 0.50 | 0.40 | 0.63 | \(b \gg k^\dagger\) |
| Gemini3.5-Flash | \(1.00^*\) | \(0.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | 0.63 | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(1.00^*\) | \(0.10^*\) | \(1.00^*\) | 0.50 | \(1.00^*\) | 0.50 | \(1.00^*\) | \(1.00^*\) | \(b \gg k^\dagger\) |
MiniCPM-o-4.5表现出强烈的"rounded"响应偏好(对bouba判为rounded的比率为0.90,但对kiki判为rounded的比率也高达0.84),反映默认偏好而非声学感知。Qwen3-Omni表现出明显的顺序效应(rounded列在前时选择率为0.89,列在后时仅为0.45,Wilcoxon \(p = .004\))。因此,该实验无法单独证明模型具有类似人类的声音象征。
Experiment 2(听觉分级评分)
TABLE II: Experiment 2(伪词分级评分)。 模型与人类在逐词分数(一阶)和 \(536 \times 536\) 相异度矩阵(二阶RSA \(\rho\))上的一致性。星号(\(*\))标记 \(p < .05\) 的显著相关。
| 模型 | 一阶 Pearson \(r\) | 一阶 Spearman \(r_s\) | 二阶 RSA \(\rho\) |
|---|---|---|---|
| 人类天花板 | \(-.843^*\) | \(-.838^*\) | \(-.377^*\) |
| Audio Flamingo 3 | \(-.033^*\) | \(-.014^*\) | \(-.008^*\) |
| Kimi-Audio | \(-.415^*\) | \(-.421^*\) | \(-.056^*\) |
| Step-Audio2 | \(-.020^*\) | \(-.032^*\) | \(-.020^*\) |
| GPT-Audio-1.5 | \(-.231^*\) | \(-.200^*\) | \(-.072^*\) |
| Gemma4-E4B | \(-.044^*\) | \(-.054^*\) | \(-.004^*\) |
| MiniCPM-o-4.5 | \(-.283^*\) | \(-.251^*\) | \(-.063^*\) |
| Qwen3-Omni | \(-.470^*\) | \(-.461^*\) | \(-.104^*\) |
| Gemini3.5-Flash | \(-.392^*\) | \(-.337^*\) | \(-.019^*\) |
注:表中所有相关系数为负值,是因为组合分数 \(\text{score} = (\text{rounded} + (8 - \text{pointed})) / 2\) 的计分方向所致。绝对值越大表示与人类评级的对齐程度越高。最佳模型Qwen3-Omni仅恢复了人类天花板约56%的一阶相关性(\(|{-0.470}| / |{-0.843}|\)),三个模型(Audio Flamingo 3、Step-Audio2、Gemma4-E4B)的相关性在实践中可忽略不计(\(|r| < 0.05\))。二阶RSA中,最佳模型仅达到人类天花板约28%的水平。
TABLE III: Experiment 2 声学线索RSA。 各模型音频矩阵与十个人类声学参数矩阵之间的Spearman \(\rho\);粗体标记每行最强线索。星号(\(*\))标记 \(p < .05\)。
| 模型 | 频谱倾斜 | 时间调制 | 语音包络 | 自相关 | 谐噪比 | 非浊音比例 | 脉冲数 | 抖动 | 微颤 | 基频标准差 |
|---|---|---|---|---|---|---|---|---|---|---|
| Human | \(\mathbf{-.431^*}\) | \(-.229^*\) | \(-.130^*\) | \(-.074^*\) | \(-.136^*\) | \(-.082^*\) | \(-.101^*\) | \(-.024^*\) | \(-.059^*\) | \(-.003^*\) |
| Audio Flamingo 3 | \(-.002^*\) | \(-.000^*\) | \(-.001^*\) | \(-.002^*\) | \(-.004^*\) | \(-.000^*\) | \(-.003^*\) | \(-.012^*\) | \(-.014^*\) | \(\mathbf{-.020^*}\) |
| Kimi-Audio | \(-.018^*\) | \(-.025^*\) | \(-.006^*\) | \(-.036^*\) | \(-.044^*\) | \(-.022^*\) | \(-.041^*\) | \(-.027^*\) | \(-.006^*\) | \(\mathbf{-.034^*}\) |
| Step-Audio2 | \(-.026^*\) | \(-.027^*\) | \(-.023^*\) | \(-.010^*\) | \(-.025^*\) | \(-.000^*\) | \(-.017^*\) | \(-.006^*\) | \(-.011^*\) | \(\mathbf{-.011^*}\) |
| GPT-Audio-1.5 | \(-.054^*\) | \(\mathbf{-.087^*}\) | \(-.077^*\) | \(-.033^*\) | \(-.066^*\) | \(-.011^*\) | \(-.037^*\) | \(-.033^*\) | \(-.025^*\) | \(-.020^*\) |
| Gemma4-E4B | \(-.003^*\) | \(-.027^*\) | \(-.015^*\) | \(-.003^*\) | \(-.005^*\) | \(-.004^*\) | \(-.012^*\) | \(-.007^*\) | \(\mathbf{-.014^*}\) | \(-.009^*\) |
| MiniCPM-o-4.5 | \(\mathbf{-.058^*}\) | \(-.019^*\) | \(-.016^*\) | \(-.019^*\) | \(-.040^*\) | \(-.017^*\) | \(-.031^*\) | \(-.005^*\) | \(-.031^*\) | \(-.003^*\) |
| Qwen3-Omni | \(-.057^*\) | \(-.029^*\) | \(-.032^*\) | \(-.039^*\) | \(-.066^*\) | \(-.020^*\) | \(-.044^*\) | \(-.011^*\) | \(\mathbf{-.034^*}\) | \(-.001^*\) |
| Gemini3.5-Flash | \(-.008^*\) | \(-.043^*\) | \(\mathbf{-.104^*}\) | \(-.002^*\) | \(-.006^*\) | \(-.010^*\) | \(-.007^*\) | \(-.008^*\) | \(-.011^*\) | \(-.011^*\) |
人类判断主要由频谱倾斜驱动(\(\rho = -0.431\))。无模型复现此配置文件:各模型的相关性远小于人类,且最强线索分散在不同的参数上。跨所有模型和线索的最大相关性为Gemini3.5-Flash在语音包络上的 \(|{-0.104}|\),但该线索对人类而言仅排第三位(人类 \(\rho = -0.130\)),且仅为人类频谱倾斜值的约四分之一。
Experiment 3(跨模态匹配)与 Experiment 4(纯视觉消融)
TABLE IV: Experiment 3与Experiment 4结果。 Experiment 3报告模型将bouba匹配到rounded形状(B)和kiki匹配到pointed形状(K)的比率(十种最佳解析语言的均值)。Experiment 4报告模型与人类在逐形状分数(一阶)和 \(90 \times 90\) 相异度矩阵(二阶RSA \(\rho\))上的一致性。星号(\(*\))标记 \(p < .05\)。
| 模型 | Exp 3 B | Exp 3 K | Exp 4 Pearson \(r\) | Exp 4 Spearman \(r_s\) | Exp 4 RSA \(\rho\) |
|---|---|---|---|---|---|
| Human | 0.81 | 0.62 | \(.991^*\) | \(.981^*\) | \(.906^*\) |
| Gemma4-E4B | 0.51 | 0.50 | \(.953^*\) | \(.870^*\) | \(.807^*\) |
| MiniCPM-o-4.5 | 0.67 | 0.64 | \(.974^*\) | \(.928^*\) | \(.845^*\) |
| Qwen3-Omni | 0.18 | 0.77 | \(.939^*\) | \(.841^*\) | \(.861^*\) |
| Gemini3.5-Flash | 1.00 | 1.00 | \(.970^*\) | \(.918^*\) | \(.864^*\) |
Gemini3.5-Flash在bouba/kiki匹配上达到100%正确率。然而,鉴于其在Experiment 2中的听觉对齐较弱(\(r = -0.392\))且声学线索RSA接近零,该成功不太可能基于类人的声学表征,更可能是通过识别这两个知名伪词并借助词汇/语义知识进行匹配。三个开源omni模型均失败:Qwen3-Omni表现出形状偏向(0.80的试验选择尖锐形,不论声音);Gemma4-E4B表现出极端顺序效应(1.00的试验选择列在前的选项,Wilcoxon \(p = .002\));MiniCPM-o-4.5仅略高于机会水平且受顺序影响(0.70的试验选择前选项,\(p = .02\))。
纯视觉消融(Experiment 4)中,所有omni模型的形状评分与人类高度一致(\(r\) 范围0.939–0.974,RSA \(\rho\) 范围0.807–0.861,人类天花板 \(r = 0.991\),\(\rho = 0.906\)),证明视觉形状感知能力完好,因此跨模态失败定位在听觉端。
对数透镜分析
对Qwen3-Omni的分析显示,对于音频和图像输入,模型的最终预测在最后4–6层才形成。softmax分布在前约90%深度保持平坦,表明早期argmax轨迹缺乏有意义的部分答案。
对于图像输入,不同人类评分组(低/中/高圆形度)的预测轨迹在最后几层清晰分离——低评分组收敛到数字1附近,高评分组收敛到数字6–7附近,与人类评级对齐。
对于音频输入,三个评分组在整个网络深度中几乎完全纠缠不清,仅在最后一层出现微弱分离。这表明听觉表征未能有效编码圆形/尖锐属性,揭示了听觉与视觉模态之间的根本性差距。
🔬 细节详述
- 训练数据:论文未提及对所评估的SLM进行任何训练。它们是现成的预训练模型,被直接用于推理测试。
- 损失函数:未提及。本研究是行为评估,不涉及模型训练。
- 训练策略:未提及。
- 关键超参数:
- 模型选择:评估了4个仅音频模型(Step-Audio2、Kimi-Audio、Audio Flamingo 3、GPT-Audio-1.5)和4个omni模型(Qwen3-Omni、MiniCPM-o-4.5、Gemma4-E4B、Gemini3.5-Flash)。
- 推理设置:对每个刺激采样30个响应,温度设为0.7。在实验1和3中,对两个选项进行了顺序平衡(各出现15次)。
- 训练硬件:未说明。论文仅说明通过商业API访问闭源模型(Gemini3.5-Flash通过Google AI API,GPT-Audio-1.5通过OpenAI API),通过公开权重访问开源模型。
- 推理细节:如上所述,采用采样而非贪婪解码以获取分布。使用LLM judge(Qwen3.6-35B-A3B)进行响应提取,并通过每实验500条人工标注进行了验证,judge标签与人类标注完全一致。无法解析的回复(如模型拒绝、离题或未选择任何选项)被排除在外。
- 语言筛选:从Ćwiek等人的25种语言中保留了解析率最低的10种(每个模型的不可解析率均低于10%):英语(en)、日语(ja)、中文(zh-cn)、葡萄牙语(pt)、法语(fr)、土耳其语(tr)、意大利语(it)、德语(de)、波兰语(pl)、匈牙利语(hu)。
- 正则化或稳定训练技巧:不适用。
- 统计方法:使用双侧二项检验测试单个比率是否偏离机会水平(0.5);使用Wilcoxon符号秩检验比较bouba和kiki的比率以及顺序效应;使用Mantel置换检验(10,000次)评估RSA相关性的显著性。
- AI辅助声明:论文附录D明确声明使用了AI写作助手辅助手稿文本的起草和修订,但所有科学内容、实验设计、数据分析和结论均由人类作者负责。
⚖️ 评分理由
创新性 (1.3/2):首次系统地将心理学声音象征范式与人类数据用于评估语音语言模型,提出了包含听觉、跨模态、视觉和内部表征分析的分解评估框架([A_SUMMARY]),并结合了RSA、声学线索分析与对数透镜等多种分析方法([A_METHOD]),具有跨学科的方法论价值。
技术严谨性 (1.0/1.5):实验设计考虑了响应偏见和顺序效应等混杂因素并加以控制([A_METHOD]),使用了适当的一阶相关、二阶RSA和Mantel检验([A_METHOD])。扣分点在于:对Gemini成功归因的推测性([A_LIMITS]),以及对数透镜分析中关于“纠缠”和“分离”的判断主要基于可视化检查,缺乏量化度量([A_LIMITS])。
实验充分性 (1.0/1.5):评估了8个模型、25种语言、三个心理学数据集,并采用多层次分析([A_SUMMARY])。实验覆盖听觉、跨模态和视觉维度([A_METHOD])。扣分点在于核心的跨模态匹配实验(Experiment 3)仅使用bouba/kiki两个知名伪词,样本量过小,影响结论稳健性([A_LIMITS]),论文未解释为何未使用更丰富的刺激集。
清晰度 (0.8/1):论文结构清晰,四个研究问题与实验一一对应([A_METHOD])。扣分点在于:实验1结果表格过于宽泛(10种语言×2比率),可读性差([S_TAIL]);对数透镜部分的结果描述与核心结论的关联可以更精炼;相关系数的负值方向在表格与正文讨论中的呈现方式不完全一致。
影响力 (0.5/1.5):对理解语音语言模型在声音象征任务上的局限性具有基础科学价值([A_SUMMARY])。但模型表现不佳更多源于评估目标与训练目标的错配([A_LIMITS]),研究未提供改善听觉表征的具体技术路径([A_LIMITS]),且核心发现过度依赖特定伪词([A_LIMITS]),对语音/音频领域的直接实践影响有限。
开源 (1.0/1.5):提供了匿名代码仓库链接并承诺开源代码及完整翻译集([A_OPEN])。然而,评估所用的三个第三方心理学数据集均未提供直接下载链接,需联系原作者或从原仓库获取([A_OPEN])。符合“核心产物开放但文档不完整”的锚点。
可复现性 (0.3/0.5):提供了详细的实验协议、提示模板、语言筛选标准和统计方法([A_METHOD]),足以理解实验设计。扣分点在于未提供所评估的开源模型(如Qwen3-Omni)的具体版本号或检查点链接([A_LIMITS]),这是关键配置的缺失。
工程/实践价值 (0.2/1.5):本文是典型的评估基准研究,其核心价值在于提出评估框架和揭示问题,而非提供可直接部署的工程解决方案或技术路径([A_LIMITS])。评估方法和分析工具对研究者有参考价值,但距离工业界直接应用(如指导模型训练)还有很大距离。
🚨 局限与问题
论文明确承认的局限:
- 泛化性有限:研究仅基于bouba/kiki两个经典伪词以及McCormick的536个特定伪词的录音,结论能否推广到所有语音、语言和声音象征现象尚不清楚。作者在"更广泛的影响"中明确警告了过度泛化的风险。
- 任务差异:人类参与者进行的是跨模态匹配任务(听声音,看形状,选择),而模型在实验1中只进行听觉分类(无形状输入),任务设置不完全相同。
- 词汇知识混淆:Gemini3.5-Flash在跨模态匹配上的成功可能源于对"bouba/kiki"这两个知名伪词的先验知识,而非纯粹的声学感知。
审稿人发现的潜在问题:
- 评估目标与模型训练目标的根本错位:所评估的SLM均未被设计或训练来处理声音象征这种隐式的跨模态认知任务。模型表现不佳更多是"目标不匹配"而非"能力缺失”。将这种"缺失"视为模型的根本缺陷可能过于强烈,更中性的结论是当前训练范式未能催生出人类般的隐式感知对齐。
- 跨模态实验的刺激集过小:Experiment 3仅使用bouba/kiki两个伪词进行跨模态匹配。这两个词是心理学中最知名的刺激,模型极有可能在训练数据中多次接触过相关讨论。因此,Gemini的成功可能源于记忆,开源模型的失败可能源于对这两个特定词的处理问题。使用536个伪词(如Experiment 2)进行跨模态测试将大幅增强结论的稳健性,论文未解释为何未这样做。
- 单说话人与平直语调的生态效度:所有McCormick录音由单一说话人以平直语调录制。虽然这控制了变量,但也排除了说话人变异、情感语调、语速变化等自然语音中的因素,可能限制了发现的普遍性。论文未讨论这些因素对声音象征感知的潜在影响。
- 对开源模型"失败"的归因过于简化:论文将开源模型在跨模态匹配上的失败归因于听觉表征不足。然而,这些模型在实验2中的听觉相关性(虽然低)并非完全为零,且Qwen3-Omni的一阶相关性(\(|r| = 0.470\))实际上是最高的。它们在实验3中的失败模式(顺序效应、形状偏向)更可能是多模态指令跟随或输出对齐的问题,而非单纯的听觉表征不佳。论文对此的讨论可以更深入。
- 缺乏简单基线对比:论文主要将模型与人类数据比较,但未与更简单的基线(如基于声学特征的传统机器学习分类器或回归器)进行比较。若一个简单的频谱特征+线性回归模型就能达到更高的对齐度,则说明当前SLM不仅未学到人类般的表征,甚至未充分利用原始声学特征。
- 相关系数的显著性标注不一致:Table II中所有条目均标注星号(\(p < .05\)),但论文正文声称"three of the eight models show no significant correlation at all"。对于 \(n = 536\) 的样本量,\(|r| = 0.02\) 的相关在统计上可能显著(取决于具体检验),但论文的正文表述与表格标注存在不一致。论文应更明确地区分统计显著性与实际显著性(效应量)。
- 对数透镜分析缺乏量化支撑:对图像和音频输入的轨迹"分离"与"纠缠"的判断主要基于视觉检查(line chart),缺乏量化度量(如层间的类间/类内方差比)或统计检验,降低了结论的客观性。