英文题目:Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism
会议身份:
conference:aaai:2026:conference-paper-id:40387
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集 #评测协议 #可解释性 #语音学与音系 #音频问答
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Jinhong Jeong:机构信息未能从会议 PDF 纯文本可靠映射
- Sunghyun Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Jaeyoung Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Seonah Han:机构信息未能从会议 PDF 纯文本可靠映射
- Youngjae Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是以拟声词与拟态词的正字法文本、IPA文本或合成音频为输入,对至多25组对立语义维度做二选一含义推断,难点在于排除词汇记忆后仍需从语音形式泛化到语义。先构建LEX-ICON多语言拟态词库并用四个大模型投票生成伪真值,其输出的过滤后语义特征进入评测环节。再用CVCV结构系统构造伪词并引入人类评定系数过滤中性样本,其输出的去记忆化强象征样本进入对比测试。最后以零样本二选一提示测macro-F1并对正确样本做音素级注意力分数归因。与既往仅做bouba-kiki二分类或纯文本探针相比,该工作把音频token与文本置于统一位置编码推理并打通行为表现与内部归因。在语义维度预测任务下,自然词组的macro-F1分数超过0.50基线的维度占比为84.2%,高于构造词组的68.4%。结论适用边界受限于受控合成语音与离散语义维度,尚未验证自然韵律、连续语义或跨文化泛化,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/jjhsnail0822/sound-symbolism — 链接可访问(HTTP 200) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么要用尖与圆来考模型?
输入是这篇论文的全文证据与官方原图像素,目标是让刚进入语音与音频方向的研究生能够核对方法并复述流程,必须保留的关键信息包括数据规模、标注规则、3 种输入形式、评估指标与注意力分析条件,输出是 1 篇按学习依赖展开的技术解读。语音象征是本文的起点,白话说就是某些发音听起来就让人联想到某种意义,例如清脆的塞音容易与尖锐相连,鼻音与圆润相连,经典例子是绝大多数人会把 kiki 配给尖形、bouba 配给圆形。
语义维度是把这种联想变成可测任务的工具,白话说就是把意义投影到 1 对反义词尺度上,例如大对小、快对慢、硬对软,每次只问模型更偏向哪一极。论文最多使用 25 个这样的维度,这是此前语言模型象似性研究中维度最多的 1 次,目的是同时检验多方面的联想,而不是只看一个 bouba-kiki 效应。
语音象征 × 语义维度: 语音象征负责提出待检验的假设,即发音形式与意义之间存在非任意对应;语义维度负责把这种假设变成可测量的二选一任务,例如大对小、尖对圆。两者搭配的原因是单个词的意义是多面的,只有投影到多个对立尺度上才能同时比较人类与模型在哪些意义上敏感,组合后新增的作用是把抽象的象似性直觉转化为可计算的宏平均 F1 与相关系数。
多模态大模型在这里是新的试验台,因为它同时接受文本与音频输入,并把它们映射到统一表示空间。研究生容易误以为只要把音频丢给模型就能自动获得听觉理解,论文要区分的是模型究竟记住了词义,还是真的从发音形式中推出意义。为此作者构建大规模拟声拟态词数据,并在自然词之外专门构造训练中不太可能见过的伪词,再用 3 种输入与人类评估做对照。
同输入同目标的已有路线有何不同?
语言学路线很早就质疑能指与所指完全任意,早期实验让人比较 mil 与 mal 哪个指更大的物体,后续跨文化与大规模词汇研究不断补充证据,并把每个音素与语义维度的关联量化出来。模型路线则经历了从词向量音义分析,到纯文本大模型、视觉与图像生成模型、音视频模型的象似性检验,但原文指出它们在多语言拟声词覆盖与多维度语义分析上都不够全面。
可解释性路线近年关注多模态内部机制,例如通过消融视觉词元观察输出变化,或证明不同模态使用不同处理回路,但音频可解释性相对较少,已有音频分析多是让音频复述文本,没有触及声音本身携带意义的问题。本文的差异在于输入同时包含拼写、音素级国际音标与合成语音,目标是 25 个语义维度的二选一预测,监督来自词典释义的自动标注与人类量表系数,运行阶段是零样本推理加事后注意力分析,而不是微调模型去拟合这些词。
两个研究问题到底要回答什么?
第一个问题是模型能否像人一样把声音象征词与语义特征关联起来,操作化为给定一个词的某种形式,让模型在每个语义维度上二选一。第二个问题是模型的内部注意力模式是否与语音语义关系一致,操作化为在模型答对时,检查标志性音素与正确语义极之间的注意力是否更高。教学上可以把自然词理解为开卷中可能见过的题,构造伪词理解为全新编的题,前者检验现实词汇中的综合表现,后者检验排除记忆后的纯形式敏感性。
拟声拟态词 × 构造伪词: 拟声拟态词负责提供自然语言中真实存在的声音与意义关联样本,但带有训练记忆的混淆;构造伪词负责用受控的辅音元音组合排除记忆,只保留发音形式的效应。两者搭配的原因是只用自然词无法区分记住还是听出,只用伪词又无法说明自然词汇的复杂性,组合后新增的作用是形成记忆对照与纯形式对照。
需要强调的是论文不训练新模型,也不声称模型具有人类感受,它只报告在固定提示与零样本条件下模型的选择分布与注意力分布。任何把高分直接说成模型真正听懂的做法都超出了证据,正确表述是模型在某些维度上的选择与人类标注一致,且内部注意力向标志性音素偏移。
从一个词到一次判断的全流程是什么?
沿一个样本走完全程有助于建立全局观。以英语自然词 boom 为例,系统先准备 3 种可替换的词形:原始拼写 boom、按音素空格切分的国际音标 b u m、由语音合成生成的对应音频。提问部分保持为文本,音频词元被插入到词出现的位置,使其与文本词元共享同一序列的位置编码,从而在统一嵌入空间中推理。提示明确要求基于听觉印象在两个语义选项中只回答编号,例如兴奋对平静中选其一。
评估时对每个维度计算宏平均 F1,以缓解正负类不平衡,自然词组结果在 4 种语言上等权平均。另一条并行路径是内部注意力分析,只在模型答对时抽取每一层中单个音素词元与两个语义特征词元之间的注意力,并做归一化与顺序调换平均,得到注意力分数。
原始拼写 × 国际音标与音频: 原始拼写负责保留正字法与词汇记忆线索;国际音标与音频负责把发音拆到音素级别并提供听觉实现。两者搭配的原因是模型可能依赖拼写记忆而非声音,只有并列 3 种输入才能分离记忆、发音知识与听觉声学的作用,组合后新增的作用是支撑按模态比较优势的语言学解释。
下图是论文给出的总体探针示意,左侧是两种输入形式,中间是统一网络,右上是注意力分析,右下是语义维度预测,阅读时应先分清行为探针与机制探针各自的输入输出。
看图路径: 1. 先看下方左侧绿色输入框,确认文本与音频两条输入同时指向中间网络;2. 再看右侧语义维度预测分支,确认输出是在对立语义极之间二选一;3. 最后看上方两个回溯箭头,确认内部注意力分析与语义预测是并列的两个探针
论文图 1。原论文 Figure 1:“Phonetic iconicity investigation for MLLMs using natural and constructed mimetic words from text and audio modalities in LEX-ICON.”。
该图把方法分成行为与机制两支:下方输入同时给出拼写加音标与声波,右下分支要求在大小等对立极之间做出选择并用对勾标出正确极,上方两个分支分别对文本与音频计算音素与语义之间的关联强度与层间变化。这意味着后文所有结果都可以回溯到同一个样本流程,只是输入形式、词组与维度不同,复述时不应把注意力结论与预测准确率混为一谈。
预测任务与注意力计算各自如何实现?
语义维度预测组件的分工是产生可比较的答案,输入是词形加维度问题,输出是 1 或 2 的编号,指标是每个维度上的宏平均 F1,基线为 0.50。注意力分数组件的分工是解释答对时的内部指向,输入是同一推理过程的注意力权重,输出是归一化后偏向正确语义极的比例,高于 0.50 表示更关注与该音素有文献关联的意义极。具体实现上,若一个音素跨越多个文本词元,则先对这些词元的注意力求和再做分数归一化。
音频则先用蒙特利尔强制对齐器按时间切分音素,再与模型 40 毫秒采样周期对齐,连续相同音素合并为一个音素符号。为抵消模型对前文词元的偏置,作者把两个语义特征的呈现顺序调换后重复实验并取平均,且只统计回答正确的样本,避免把错误路径的注意力也计入象似性证据。
语义维度预测 × 注意力分数: 语义维度预测负责从外部行为上检验模型能否选对意义极;注意力分数负责从内部检验模型在做对时是否真的更关注标志性音素。两者搭配的原因是只看答对可能是利用偏置,只有内部注意力同时指向对应音素才能支持形式与意义关联的解释,组合后新增的作用是把行为评估与可解释性分析连接起来。
这种设计的搭配理由是行为正确不等于机制正确,只有两者同向才能更可信地说模型关注了标志性音素。复述时要说清注意力分析的对象是 Qwen2.5-Omni-7B,且区分国际音标文本与音频波形两种输入、自然词与构造词两种词组,否则不同条件下的分数无法比较。
没有训练时数据与标注是如何构造的?
本研究没有训练或微调任何被测多模态模型,该节的真实计算过程是数据集 LEX-ICON 的构造与标注流水线。第一步收集自然拟声拟态词,作者从 4 种语言的专门拟声词词典与权威词典中人工收集 8052 个词及其代表性释义,日韩占比更高是因为两语言本身拟声词丰富。第二步用 4 种大模型基于释义对每个语义维度标注为某一极或中性,自然词只保留 4 个模型一致同意的特征并删除中性标签。
第三步构造伪词,采用辅辅结构的系统组合,辅音覆盖响音、浊擦音、清擦音、清塞音、浊塞音共 15 个,元音覆盖前元音与后元音共 4 个,先用跨 4 种语言的发音词典过滤掉已存在的形式,再转为英文字母组合并用语音合成试读,剔除发音错误的样本后保留 2930 个。伪词的语义标签不来自词典,而是引用人类评分实验得到的音素类别与语义维度关联系数,对词中 4 个音素取平均,并以距离中性点 1.0 倍标准差为阈值过滤接近中性的点。
第四步统一汇总为 10982 词与 84932 条语义特征,并派生 3 种输入形式。
看图路径: 1. 按从左到右顺序核对四个阶段:原始收集、维度标注、特征过滤、最终汇总;2. 在阶段三重点比较自然词的一致性保留与构造词的阈值过滤两条不同路径;3. 在阶段四确认最终条目同时包含拼写、音标、音频与语义标签
论文图 2。原论文 Figure 2:“A comprehensive figure for the data construction flow of LEX-ICON.”。
该 4 阶段流程图从左到右展示了原始收集、模型标注、特征过滤与最终汇总,中间用 whizz 是否表示快、zah-though 等示例说明标注与打分逻辑,右侧显示最终条目同时包含拼写、音标、音频与语义标签。复述时应强调自然词与构造词在第三步走了完全不同的过滤路径,前者靠模型一致性,后者靠偏离中性的统计阈值,因此两者的标签噪声来源也不同。
评估用了哪些模型、输入与对照条件?
被测模型是官方同时支持文本与音频输入的多模态模型,包括 Qwen2.5-Omni 的 3B 与 7B 版本、Gemini-2.5-flash 与 GPT-4o 系列,其中文本与音频分别对应不同调用方式,Qwen 推理在一块 RTX 4090 上完成。所有实验采用零样本提示且温度设为 0 以保证可重复,查询部分始终为文本,只有被测词在原始文本、音素级国际音标与合成语音之间切换。自然词音频用谷歌语音合成处理英法日、用 MeloTTS 处理韩语,国际音标转换用 Epitran 工具包。人类评估只做音频输入的抽样数据,目的是验证自动伪真值的可靠性,而不是与模型在完全相同的大规模条件下比赛。
伪真值 × 人类听辨评估: 伪真值负责用 4 模型一致或人类量表系数低成本地大规模标注自然词与伪词;人类听辨评估负责在抽样音频上检验这些自动标注是否可信。两者搭配的原因是大规模人工标注不可行而纯自动标注需要校准,组合后新增的作用是以小规模高质量人类数据为自动标注提供可靠性锚点。
下表整理数据规模,阅读时应把词数与特征数分开,前者是词汇条目数,后者是词乘以维度的标注点数,构造词在部分维度上因接近中性被剔除,所以并非 25 维全有。
| 条件 | 指标 | 自然词 | 构造词 | 合计 |
|---|---|---|---|---|
| 词汇条目 | 词数 | 8052 词 | 2930 词 | 10982 词 |
| 语义标注 | 特征数 | 66484 条 | 18448 条 | 84932 条 |
| 语言覆盖 | 语言数 | 4 种语言 | 受控音素组合 | 4 语言加伪词 |
| 输入形式 | 模态数 | 3 种输入 | 3 种输入 | 拼写加音标加音频 |
| 语义维度 | 维度数 | 至多 25 维 | 保留 19 维 | 自然全集加过滤子集 |
该表的主要信息是数据以自然词为主但伪词提供了受控对照,标注特征数远大于词数是因为一词多维度。代价是自然词标签依赖模型一致性,可能继承大模型的语义偏置;伪词标签依赖已有文献系数,可能继承特定实验人群的偏置。未胜出的边界是人类评估仅覆盖音频抽样,因此跨模态的人类对照并不完整。
模型在哪些意义上超过基线?
核心行为结果按维度组织。模型在 3 类输入上平均后的宏平均 F1 在自然词组 84.2% 的维度上超过 0.50 个基线,在构造词组 68.4% 的维度上超过基线,说明不仅可能被记住的自然词,连全新伪词也能在多数维度上被从形式推出意义。去掉规模较小的 Qwen2.5-Omni-3B 后整体表现更高,尖对圆等经典维度的强表现与 bouba-kiki 文献一致。但人类音频评估在多数维度上高于基线且绝对水平更高,证实了伪真值的大致可靠性,也反衬出模型与人类的差距。
按词组看,构造词的模型反应反而比自然词更接近人类分布,作者的解释是自然词中任意的形义映射会淹没微弱的语音语义线索,而大模型长期受自然语言分布语义塑造,容易忽略这些线索。
看图路径: 1. 先确认三列面板分别为自然词、构造词与纯音频人类评估;2. 再沿纵轴比较各语义维度的条形长度与 0.50 虚线的相对位置;3. 最后对照底部图例,观察较小模型与较大模型在同一维度上的点位分散
论文图 3。原论文 Figure 3:“Macro-F1 score results for the semantic dimension A/B test.”。
该图左中两列显示各模型在每个维度上的宏平均 F1 点位与平均条形,右列显示人类音频评估的分布,纵轴维度按表现排序而非固定顺序。可见自然词顶部尖对圆与 abrupt 对连续等维度明显越过虚线,底部真实对幻想等维度甚至低于基线;构造词顶部紧张对放松等维度较高,底部危险对安全等维度偏低。复述时不要把排序当成固定重要性排序,它只是按得分排列的可视化选择。
下表把关键数字放在同一行比较,指标方向都是越高越好,但分属行为准确率与人类相似度两类指标,不可直接相减。
| 比较对象 | 指标 | 自然词 | 构造词 | 人类对照 |
|---|---|---|---|---|
| 多模态大模型 | 超过 0.50 基线的维度比例 | 84.2% | 68.4% | 多数维度高于基线 |
| 注意力分析 | 国际音标平均注意力分数 | 0.507 | 0.523 | 未测量 |
| 注意力分析 | 音频平均注意力分数 | 0.501 | 0.506 | 未测量 |
该表支持的判断是模型具备跨维度的语音直觉且构造词证据更干净,但限制是相关性不等于因果,且人类对照只在音频抽样上成立。特别要说明模态偏好:声学基础更强的大小与快慢维度在构造词音频上更有优势,而依赖唇形与发音姿态的尖圆、美丑与情绪维度更依赖文本,这与共振峰、浊音时长、圆唇手势等文献假设方向一致,但论文只报告支持关系而非证明机制。
换输入与换词组会如何改变内部注意力?
该节相当于论文的机制消融,虽然不是去掉模块训练,但通过比较输入类型与词组来分离条件。总体上构造词的注意力分数高于自然词,国际音标文本高于音频,自然词国际音标平均 0.507、音频平均 0.501,构造词国际音标平均 0.523、音频平均 0.506。作者的解释是文本经过更充分训练而音频声学线索利用不足,自然词的任意映射进一步模糊了标志性音素。
热图进一步显示构造词国际音标条件最贴近语言学先验,例如 p 与 k 在尖锐一侧注意力更高,m 与 n 在圆形一侧更高,大偏向后元音、小偏向前元音。层间曲线显示多数层高于 0.50,且国际音标曲线整体位于音频曲线之上,深层呈上升趋势,提示音素与意义的系统对应在深层更明显。
看图路径: 1. 先确认横轴为注意力层编号、纵轴为注意力分数、灰色虚线为 0.50 个基线;2. 再比较蓝色国际音标曲线与红色音频曲线在多数层的上下关系;3. 最后观察两条虚线趋势线的走向,判断深层是否比浅层更偏向正确语义极
论文图 7。原论文 Figure 7:“Attention fraction scores for the constructed word group, averaged across semantic dimensions.”。
该曲线横轴为层编号,纵轴为跨维度平均后的注意力分数,蓝色圆点为国际音标、红色方块为音频,虚线为各自趋势线。可以执行 3 个观察:先确认多数点位于 0.50 之上,再确认蓝色多数层高于红色,最后确认趋势线随层数缓慢上行。需要注意单层波动较大,不能把某一层的峰值推广为全程最优,也不能把文本高于音频直接说成音频无用,因为行为上音频在部分维度仍有优势。
哪些边界与反例不应被忽略?
首先是未胜出项:自然词中国际音标条件与人类分布的相关最低,部分模型甚至为负,说明把多语言拼写转写为音标后,语言任意性仍可能压过象似性。其次是维度差异:真实对幻想、简单对复杂、危险对安全等维度在模型与人类两端都偏弱,表明并非所有意义都同样适合用声音推断。第三是规模与人类相似度的背离:Qwen2.5-Omni-7B 与人类最相似,而更大的 Gemini 偏离更多,说明增大规模不自动带来更像人的语音直觉。
第四是证据边界:注意力只统计答对样本且只分析一个开源模型,音频对齐依赖强制对齐器与固定采样周期,合成语音缺少语调等超音段信息,人类评估仅为音频抽样。最后是因果限制:注意力偏向与行为正确同时出现只能说支持关联,不能证明模型因为关注该音素才答对,也未测量误判率、延迟与推理成本,因此不能承诺实际应用收益。
要复现需要准备什么?
复现先做三件事:拿到代码与扩展版本并确认当前可达,准备四语言词典来源与标注提示,再固定零样本提示与温度为 0 的推理条件。资源状态是正文开源声明的唯一依据,当前代码链接本次检查可用,扩展版本链接本次检查可用,复述时应写为当前可用而非永久保证。自然词复现需用 Epitran 做国际音标转换、用谷歌语音合成与 MeloTTS 生成音频,并用 4 模型一致规则过滤标签。
伪词复现需按 15 辅音加 4 元音生成组合,用发音词典过滤已存在形式,再用文献系数打分并以 1.0 倍标准差过滤中性点。评估复现需保持音频词元插入位置与文本词元位置序列一致,并对语义顺序做调换平均;注意力复现需用同一开源模型的权重、只取回答正确样本,并按文本多词元求和与音频强制对齐两条路径分别实现。
缺项是论文未公开完整逐词提示细节与全部超参数之外的解码设置,附录指向需以扩展版本为准,硬件预算只报告了 Qwen 在一块 RTX 4090 上推理,未报告全部调用成本。
何时值得尝试这种探针?
当研究问题是模型是否利用发音形式而非词汇记忆时,这套探针值得尝试:先用构造伪词排除记忆,再用三输入比较定位模态优势,最后用注意力分数检查内部是否指向文献中的标志性音素。若只关心下游任务准确率而不关心机制,则不必引入如此重的多维度标注。还需补的验证包括更多母语者与自然发音的人类对照、覆盖语调与重音的音频条件、在更多开源模型上重复注意力分析,以及报告推理开销与稳定性。
常见误解是把伪词高分当成模型具有通感,把文本高于音频当成听觉无用,正确理解是模型在受控条件下表现出与人类部分一致的分布偏好,但分布相似度最高也只有中等相关,且模态优势随语义维度而变化,应用到品牌命名或语言教学前需要单独做人类实验与风险评估。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



