📄 SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations
标签:#音频理解 #音频大模型 #自监督学习 #多模态模型 #Transformer
9.4/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5
🔥 9.4/10 | 前10% | 文档类型:模型报告 | 评分置信度:高 | #音频理解 | #音频大模型 | #自监督学习 #多模态模型 | arxiv
👥 作者与机构
- 共同第一作者:Xiaoyu Yang(University of Cambridge)与 Xuenan Xu(Shanghai AI Laboratory),两人贡献相同。
- 通讯作者:Chao Zhang(Shanghai AI Laboratory / Tsinghua University)
- 作者列表:Xiaoyu Yang(University of Cambridge)、Xuenan Xu(Shanghai AI Laboratory)、Wenyi Yu(Tsinghua University)、Siyin Wang(Tsinghua University)、Changli Tang(Tsinghua University)、Terumi Chiba(Tsinghua University)、Siyuan Hou(Tsinghua University)、Ziyang Zhang(Tsinghua University)、Wen Wu(Shanghai AI Laboratory)、Baoxiang Li(Shanghai AI Laboratory)、Guangzhi Sun(University of Cambridge)、Chao Zhang(Shanghai AI Laboratory / Tsinghua University)、Philip Woodland(University of Cambridge)
💡 毒舌点评
论文的亮点在于用单个统一的自监督编码器(SPEAR)替代了繁琐的多编码器设计,并用精心设计的MLF适配器和MICL训练策略,在数据效率上取得了令人印象深刻的SOTA结果,工程思路清晰。但短板也很明显:尽管展示了MICL能力,但探索的任务类型仍然局限于相对传统的音频理解任务,对更开放的生成或交互场景着墨不多,这使得其“通用听力”的雄心打了折扣。
📌 核心摘要
- 要解决什么问题:现有音频大模型(ALLM)通常依赖多个监督式音频编码器,其能力受限于标注数据的覆盖范围;同时,模型未能充分利用编码器内部的层次化表示,且缺乏有效的多模态上下文学习(MICL)能力来利用如发音参考等外部信息。
- 方法核心是什么:提出了SALMONN-2,其核心是采用一个统一的自监督音频编码器(SPEAR)作为单一感知前端,并提出多层特征融合(MLF)适配器来聚合编码器所有层的特征。同时,引入时间戳注入机制并使用明确的MICL指令微调数据来训练模型。
- 与已有方法相比新在哪里:摒弃了主流的多编码器架构,证明单一的通用SSL编码器能提供更均衡、高效的表示。提出的MLF适配器能更好地利用编码器的层次信息,优于仅使用最后一层或简单加权求和的基线。首次在ALLM中系统研究了MICL,并证明其需要显式训练才能获得。
- 主要实验结果:SALMONN-2在多个综合基准上达到了SOTA,具体结果如下表所示。其训练仅使用了18.2k小时数据,远低于其他模型(数百万小时),体现了高数据效率。
| 模型 | LLM大小 | 数据规模 (h) | MMAU-Pro | MMAR | MMSU |
|---|---|---|---|---|---|
| Qwen2.5-Omni | 8B | - | 52.2 | 56.7 | 61.3 |
| Kimi-Audio | 8B | »13M | 56.6 | 60.8 | 54.7 |
| MiMo-Audio | 8B | »1M | 53.4 | 61.7 | 61.9 |
| AF-3 | 8B | »55k | 51.7 | 58.5 | 61.4 |
| AF-Next | 9B | »500k | 56.3 | 59.7 | 59.4 |
| MOSS-Audio | 9B | »1M | 57.5 | 64.4 | 66.4 |
| SALMONN-2 (ours) | 9B | 18.2k | 58.5 | 64.5 | 69.5 |
| SALMONN-2 (ours) | 30B-A3B | 18.2k | 60.3 | 67.6 | 72.0 |
- 实际意义是什么:为构建高效、通用的ALLM提供了一个新的范式,表明无需海量监督数据和复杂多编码器,通过优化表示利用和训练策略即可实现强大能力。其开源将促进后续研究。
- 主要局限性是什么:模型在未明确训练过的任务(如重叠语音识别)上表现不佳,表明“通用性”仍有局限。实验未充分探索生成任务和真实交互场景。MICL能力虽被证明可行,但探索的上下文类型(仅发音)相对单一。
🔗 开源详情
代码:
https://github.com/bytedance/SALMONN/tree/salmonn2模型权重:论文中明确声明代码和模型开源,并给出了代码仓库链接 (
https://github.com/bytedance/SALMONN/tree/salmonn2)。模型权重文件应包含在该仓库中,但未提供独立的HuggingFace/ModelScope链接。数据集:论文中使用了大量公开和内部数据集用于训练和评估,但未提供统一的下载链接或明确的开源协议。主要数据集包括:
- 训练数据(Table I):LibriSpeech, GigaSpeech, CommonVoice, IEMOCAP, MSP-Podcast, VoxCeleb1, LibriMix, WavCaps, AudioCaps, Clotho, AudioSet, MusicCaps, MillionSong, MusicNet, SPGISpeech, QualiSpeech, AudioSet-strong, FineLAP100k, PicoAudio2, HoliAntiSpoof 以及未明确的 “In-house QA data”。
- 评估数据(Table IV):除了上述部分数据集外,还包括 MMAU-Pro, MMAR, MMSU, DESED, PartialEdit 等。
Demo:论文中未提及。
复现材料:论文提供了详细的模型架构(Section III)、训练配置(两阶段训练,Table II)、模型配置(Table III)以及MICL训练细节(Section IV-D),可用于复现。
论文中引用的开源项目:
- SPEAR 音频编码器:论文引用并使用了
SPEAR模型([32]),但未提供其代码或权重的直接链接。 - OmniVoice:用于生成参考发音的TTS系统([39]),未提供链接。
- 其他基线模型:如
AudioFlamingo([10])、MiMo-Audio([34])、MOSS-Audio([30])、SpotSound([23]) 等,均为引用的已有工作。
- SPEAR 音频编码器:论文引用并使用了
补充链接(自动提取):
- 代码仓库:https://github.com/bytedance/SALMONN/tree/salmonn2)。但模型权重未提供独立的HuggingFace/ModelScope链接,且论文引用的关键组件SPEAR编码器的代码或权重链接也未提供,属于核心产物开放但文档或依赖项不完整。
🏗️ 方法概述和架构
SALMONN-2是一个端到端的音频理解与推理框架,其输入是原始音频波形和文本指令(可选多模态上下文),输出是文本响应。整体流程可概括为:音频通过统一自监督编码器提取层次化特征,经适配器压缩对齐后,与文本嵌入一同输入大语言模型进行条件生成。
主要组件详解:
- 统一自监督音频编码器 (SPEAR):功能是作为唯一的音频前端,从原始波形中提取丰富的、跨领域的层次化表示。SPEAR是一个600M参数的Zipformer模型,训练结合了教师知识蒸馏和掩码标记预测目标,使其能同时学习语音和通用音频的表示。它接收波形输入,输出13个Transformer层的隐藏状态序列,每层维度为1280,序列长度为T,帧率为50Hz。
- 多层特征融合适配器 (MLF Adapter):功能是将编码器输出的13层隐藏状态高效地融合并投影至LLM的嵌入空间。其内部结构分为三步:首先,对每一层的隐藏状态独立应用LayerNorm后,沿特征维度拼接,得到维度为\(13 \times 1280 = 16640\)的向量。然后,通过一个可学习的线性降维层(\(16640 \rightarrow 1280\))压缩特征。接着,沿时间维度每5帧(\(q=5\))进行分组和拼接,将帧率从50Hz降至10Hz。最后,通过一个两层MLP(线性-ReLU-线性)将每个分组(维度\(1280 \times 5 = 6400\))映射到LLM的嵌入维度(如4096)。这输出一个长度为M的音频嵌入序列。
- 时间戳注入模块:功能是为音频嵌入提供显式的绝对时间位置信息。它定义时间粒度\(g=2\)秒,对应的音频令牌数\(k = r \cdot g = 10 \times 2 = 20\)。它每隔20个音频嵌入,插入一个文本标记
`<t seconds>`的词嵌入。这直接复用LLM词表中的嵌入,无需额外参数,使得音频序列与文本在时间语义上对齐。 - 多模态上下文注入:功能是支持MICL,例如在上下文ASR中提供“单词-发音音频”对作为示例。参考发音音频会通过同样的SPEAR编码器和MLF适配器处理,但不会注入时间戳。这些音频嵌入与对应的文本词嵌入交替拼接,形成多模态上下文序列,置于任务指令和查询音频之前。
- 文本大语言模型:功能是接收所有处理后的嵌入序列,进行理解和生成。采用Qwen3系列模型(8B或30B-A3B),使用LoRA进行参数高效微调。
组件间的数据流与交互:原始波形首先送入SPEAR编码器,得到13层隐藏状态。MLF适配器聚合这些状态并生成压缩对齐的音频嵌入序列。时间戳嵌入被周期性地插入此序列,形成带时间信息的音频表示。若存在多模态上下文,其对应的音频和文本嵌入序列会被拼接在查询音频序列之前。最终,指令、上下文、音频序列等所有嵌入在拼接后,作为一整个序列输入LLM进行自回归解码。
下图展示了上述组件间的数据流与交互过程。

下图清晰展示了从原始波形到最终文本响应的完整处理流程,包括SPEAR编码器的层次化特征提取、MLF适配器的特征融合、时间戳的周期性注入,以及最终LLM的生成过程,直观地呈现了模型的整体架构。
关键设计选择及动机:选择单一SSL编码器而非多编码器,旨在降低架构复杂度并测试统一表示的泛化能力。设计MLF适配器而非使用最后一层,是因为SSL模型不同层编码了从低级声学到高级语义的不同信息,融合所有层可保留更丰富的信息。时间戳注入采用复用词嵌入的方式,简单高效且与文本空间对齐。显式训练MICL,是因为观察到它不会从标准指令微调中自然涌现。
💡 核心创新点
- 用单一统一自监督编码器替代多编码器架构:SALMONN-2证明了像SPEAR这样经过跨领域自监督预训练的单一编码器,其能力足以媲美甚至超越由多个监督模型(如Whisper + BEATs)拼接的双编码器系统,同时保持了架构的简洁性。这挑战了ALLM需要复杂多感知前端的范式。
- 提出并验证了多层特征融合(MLF)适配器:针对SSL编码器富含层次信息的特点,设计了比简单加权求和更有效的MLF适配器。该适配器通过先拼接再投影的方式,保留了各层特征的独立性,使LLM能更灵活地利用不同抽象层次的信息,从而在多个下游任务上取得一致提升。
- 首次在ALLM中系统探索并实现多模态上下文学习(MICL):论文明确指出MICL(如利用发音音频进行偏置)不会从常规训练中自然出现。通过精心设计包含正样本、负样本和目标词丢弃的MICL训练策略,使模型获得了利用多模态上下文进行更精准识别的能力,并展现出一定的长度泛化性。
- 构建了高效、全面的训练与评估体系:在仅使用不到2万小时指令数据(远少于其他SOTA模型)的条件下,通过两阶段训练和覆盖语音、音频、音乐、副语言及多个扩展分析任务的综合评估,展示了其框架的数据高效性和能力的均衡性。
📊 实验结果
论文在四类维度上进行了广泛评估:基础任务、综合理解基准、上下文ASR和扩展分析任务。关键对比如下:
综合音频理解基准:在MMAU-Pro、MMAR、MMSU三个挑战性问答基准上,SALMONN-2(9B)以58.5/64.5/69.5的成绩全面超越使用数据量远大于它的MOSS-Audio(57.5/64.4/66.4),证明了方法的优势。
基础任务对比:在LibriSpeech ASR、AudioCaps音频字幕生成、IEMOCAP情绪识别、CoVoST2语音翻译等9个任务上,SALMONN-2表现出均衡且强大的性能,通常位居前列,不像某些基线模型存在严重短板(如Kimi-Audio在音乐字幕上得0分)。
| 模型 | LLM Size | LibriSpeech↓ | GigaSpeech↓ | AudioCaps↑ | Clotho↑ | MusicCaps↑ | IEMOCAP↑ | CoVoST2↑ | LibriMix↓ | VoxCeleb1↑ |
|---|---|---|---|---|---|---|---|---|---|---|
| SALMONN | 7B | 2.1/4.9 | 10.0 | 57.6 | 44.7 | 5.5/21.8 | 69.0 | 33.1 | 23.0 | 94.0 |
| Qwen2.5-Omni | 8B | 1.8/3.4 | 23.0 | 64.4 | 50.2 | 5.5/22.5 | 63.5 | 41.4 | 55.3 | 62.9 |
| Kimi-Audio | 8B | 1.4/2.6 | 9.1 | 52.0 | 50.7 | 0.0/9.0 | 76.2 | 0.3* | 44.4 | 61.9 |
| MiMo-Audio | 8B | 3.5/6.4 | 14.1 | 53.6 | 44.2 | 0.8/15.9 | 61.2 | 35.8 | 57.7 | 50.0 |
| AF-3 | 8B | 1.6/3.1 | 9.3 | 64.0 | 54.4 | 4.0/19.1 | 63.8 | 11.9* | 52.5 | 50.0 |
| AF-Next | 9B | 1.5/2.8 | 9.2 | 61.1 | 54.9 | 3.1/19.2 | 55.0 | 1.7* | 67.6 | 50.0 |
| MOSS-Audio | 9B | 2.2/5.6 | 8.6 | 47.4 | 44.2 | 3.7/19.6 | 62.7 | 23.9 | 45.9 | 61.0 |
| Ours, SALMONN-2 | 9B | 1.7/3.0 | 9.0 | 65.0 | 53.4 | 5.9/22.0 | 71.0 | 46.6 | 8.8 | 93.8 |
| Ours, SALMONN-2 | 30B-A3B | 1.6/3.0 | 8.9 | 65.2 | 53.6 | 5.6/23.5 | 74.0 | 46.4 | 9.0 | 94.1 |
- 上下文ASR消融:在GigaSpeech上,未训练MICL的模型面对文本偏置列表时性能退化严重(WER从9.1升至19.8)。而训练了MICL的SALMONN-2能有效利用文本和发音上下文,在100项偏置列表下,使用MICL(发音+文本)的B-WER(8.0)优于仅用文本偏置(8.8),且总WER(8.5)接近无偏置基线(9.0)。
| Model | MICL training | Biasing Method | No-biasing | L=20 | L=50 | L=100 |
|---|---|---|---|---|---|---|
| AF-3 | × | Text | 9.3 / 15.8 / 9.3 | 18.0 / 19.0 / 17.9 | 17.9 / 19.7 / 17.7 | 19.8 / 21.0 / 19.7 |
| MOSS-Audio | × | Text | 8.6 / 15.2 / 8.4 | 8.7 / 9.1 / 8.6 | 8.9 / 9.6 / 8.8 | 9.3 / 10.2 / 9.3 |
| MICL | - | 26.5 / 26.0 / 26.6 | 53.9 / 31.8 / 54.6 | 65.5 / 36.9 / 66.4 | ||
| SALMONN-2 | × | Text | 9.1 / 15.5 / 9.0 | 9.1 / 12.2 / 9.0 | 9.2 / 14.1 / 9.0 | 9.2 / 15.6 / 8.8 |
| MICL | - | 25.7 / 26.0 / 25.5 | 47.7 / 29.7 / 50.2 | 57.3 / 33.5 / 58.1 | ||
| ✓ | Text | 9.0 / 15.4 / 8.9 | 8.3 / 7.5 / 8.3 | 8.5 / 7.9 / 8.4 | 8.7 / 8.8 / 8.6 | |
| MICL | - | 8.2 / 6.8 / 8.3 | 8.4 / 7.2 / 8.4 | 8.5 / 8.0 / 8.5 |
- 扩展分析任务:在声音事件检测(DESED)、语音伪造检测(PartialEdit)和语音质量评估(QualiSpeech)上,SALMONN-2均大幅超越MiMo-Audio和MOSS-Audio,并达到甚至超过各任务的专用模型性能。
| Model | DESED | Spoofing | QualiSpeech |
|---|---|---|---|
| Specialised Models | |||
| SpotSound-Q | 61.1 | - | - |
| HoliAntiSpoof | - | 71.58 | - |
| QS.-FT-SALMONN | - | - | 0.660 |
| General-Purpose Audio LLMs | |||
| SALMONN-2 | 70.15 | 73.65 | 0.661 |
| MiMo-Audio | 27.65 | 14.27 | 0.358 |
| MOSS-Audio | 48.14 | 19.14 | 0.402 |
- 关键消融实验:
- 编码器与融合策略:对比表明,单一SPEAR+MLF的组合在所有任务上性能最佳,优于Whisper+BEATs双编码器和SPEAR的不同使用方式(仅最后一层、加权求和)。
| Encoder Config. | AudioCaps↑ | MusicCaps↑ | LS. (ASR)↓ | GigaSpeech↓ | CoVoST2↑ | LS. (PR)↓ | LibriMix↓ | IEMOCAP↑ | VoxCeleb1↑ |
|---|---|---|---|---|---|---|---|---|---|
| Dual-Encoder | |||||||||
| Whisper + BEATs | 68.3 | 5.9/22.7 | 2.1/4.9 | 9.6 | 43.4 | 3.1 | 14.8 | 69.1 | 93.2 |
| WavLM + Dasheng | 59.5 | 4.9/21.8 | 2.3/4.3 | 11.2 | 39.5 | 3.5 | 43.2 | 56.3 | 81.0 |
| Single Supervised Encoder | |||||||||
| Qwen2.5-Omni Encoder | 63.6 | 5.4/21.8 | 2.6/6.2 | 11.7 | 39.5 | 9.0 | 47.2 | 63.1 | 88.6 |
| AF-Whisper | 67.2 | 10.2/28.8 | 2.0/4.2 | 12.5 | 44.8 | 3.4 | 25.8 | 73.0 | 86.9 |
| Unified SSL Encoder (SPEAR) | |||||||||
| Last Layer | 65.6 | 5.5/22.4 | 1.7/3.3 | 9.6 | 45.9 | 2.9 | 10.0 | 69.8 | 91.9 |
| Weighted-Sum | 65.7 | 5.6/22.6 | 1.8/3.3 | 9.8 | 45.8 | 2.8 | 12.0 | 69.9 | 93.2 |
| MLF | 68.1 | 5.8/22.6 | 1.6/3.2 | 9.6 | 45.9 | 2.7 | 9.7 | 70.5 | 94.7 |
* **时间戳注入**:移除时间戳注入模块导致DESED性能从70.15下降至68.74,同时三个综合基准分数也略有下降,证明了其对于时间定位任务乃至通用理解的有效性。
| Model | SED | MMAU-Pro | MMAR | MMSU |
|---|---|---|---|---|
| SALMONN-2 | 70.15 | 58.5 | 64.5 | 69.5 |
| – w/o timestamp | 68.74 | 58.2 | 64.3 | 69.3 |
🔬 细节详述
- 训练数据:总计18.2k小时,涵盖语音(LibriSpeech, GigaSpeech, CommonVoice)、音频(AudioSet, AudioCaps, WavCaps)、音乐(MusicCaps, MillionSong)、情感(IEMOCAP, MSP-Podcast)、以及扩展任务数据,包括声音事件检测(AudioSet-strong, FineLAP100k, PicoAudio2)、语音伪造检测(HoliAntiSpoof)和语音质量评估(QualiSpeech)。MICL上下文ASR数据从GigaSpeech和SPGISpeech构建,发音通过OmniVoice TTS合成。
- 损失函数:标准的自回归语言建模损失:\(\mathcal{L} = -\sum_{n=1}^{N}\log p(y_{n}\mid y_{(n)}, \mathcal{P})\),其中\(\mathcal{P}\)是包含指令、音频和上下文的完整输入序列。所有任务使用统一目标。
- 训练策略:两阶段训练。阶段一:40k步,主要对齐音频与文本(ASR,AAC)并引入时间戳(SED)。阶段二:50k步,加入更多任务指令微调数据。两阶段均使用LoRA微调LLM,音频编码器始终冻结,MLF适配器可训练。批量大小192,学习率2e-4。
- 关键超参数:SPEAR编码器:600M参数,13层,1280维,50Hz。MLF适配器:降维后1280维,分组长度\(q=5\),时间戳间隔\(g=2\)秒(\(k=20\))。LLM:Qwen3-8B(LoRA rank 64)或Qwen3-30B-A3B。
- 训练硬件:论文未提及。
- 推理细节:论文未详细描述解码策略(如温度、beam size),但提及MICL评估时从另一说话人池合成发音。
- 正则化技巧:在MICL训练中使用了目标词丢弃(概率0.1)和随机去除发音转为文本偏置(概率0.2)来防止过偏置。
⚖️ 评分理由
创新性 (1.7/2):论文提出了用单一自监督编码器SPEAR替代主流的多编码器架构,挑战了现有范式;设计了多层特征融合MLF适配器,能更好地利用编码器层次信息;首次系统探索并实现了多模态上下文学习MICL能力,证明其需要显式训练。这些是系统设计上的明确创新。
技术严谨性 (1.4/1.5):论文展示了完整的端到端系统设计与训练流程,架构各组件(SPEAR编码器、MLF适配器、时间戳注入、MICL)功能明确,设计合理。训练数据覆盖广泛,实验设计包含综合评估和消融研究。虽然对LLM内部处理音频信息的机制探索不足,但整体技术路径清晰合理。
实验充分性 (1.4/1.5):论文进行了广泛评估,覆盖基础任务、综合理解基准、上下文ASR和扩展分析任务四大维度。通过详尽的消融实验(Table IX, X)验证了编码器选择、MLF适配器和时间戳注入的有效性。但竞品对比时训练数据规模差异巨大,且对MICL泛化性、编码器在专业领域的边界探索不足。
清晰度 (0.9/1):论文结构清晰,从问题定义、方法概述、架构详解到实验设置、结果分析,逻辑连贯。图表、表格和公式详细展示了模型组件与实验结果。写作较为流畅,技术描述易于理解。
影响力 (1.2/1.5):论文为构建高效、通用的音频大模型提供了新范式,展示了通过优化表示利用(SSL编码器、MLF)和训练策略(MICL),可以在远少于竞品的数据量下达到SOTA性能。这对音频理解领域具有明确的实践指导意义。
开源 (1.2/1.5):论文明确承诺并提供了代码和模型的开源链接(https://github.com/bytedance/SALMONN/tree/salmonn2)。但模型权重未提供独立的HuggingFace/ModelScope链接,且论文引用的关键组件SPEAR编码器的代码或权重链接也未提供,属于核心产物开放但文档或依赖项不完整。
可复现性 (0.3/0.5):论文提供了详细的模型架构、训练配置(两阶段、批大小、学习率)、模型配置(维度、LoRA秩等)以及MICL训练细节,信息充分。但未提及训练所用的硬件环境(如GPU型号和数量),推理阶段的详细策略(如解码参数)也未说明,属于大部分关键配置可复现但有少量缺失。
工程/实践价值 (1.3/1.5):工程实践价值突出:1) 提出用单一统一SSL编码器替代多编码器,降低了架构复杂度;2) 仅用18.2k小时数据训练,展示了高数据效率;3) 引入的时间戳注入机制简单有效,支持了时间定位任务;4) 开源了完整系统,为后续研究提供了坚实基础。
🚨 局限与问题
论文明确承认的局限:
- 模型在未被训练数据覆盖的任务(如重叠语音识别OSR、说话人验证SV)上性能显著下降,表明其“通用性”依赖于训练数据的覆盖范围。
- 研究主要集中在音频理解任务,对音频生成、交互式对话等场景的探索不足。
- MICL能力的探索仅限于上下文ASR中的发音偏置,未来可以扩展到其他类型的上下文(如语义提示、视觉参考等)。
审稿人发现的潜在问题:
- 效率与质量的权衡未深入探讨:虽然强调了数据效率(18.2k小时),但未分析模型参数量(尤其是600M的SPEAR编码器)和计算成本。与使用轻量编码器但数据量大的模型相比,其总体效率(性能/算力)优势如何?
- SSL编码器的“通用性”边界:SPEAR编码器在特定领域(如高度专业的医疗音频、特定方言)的表现如何?单一编码器是否会在某些小众但重要的场景下成为瓶颈?
- MICL的泛化性有待验证:虽然在GigaSpeech测试集上表现良好,但MICL能力在不同口音、语速、噪音环境下的鲁棒性,以及迁移到完全不同的语言或词汇集的能力,尚未被验证。
- “SOTA”声明的语境:MMAU-Pro、MMAR、MMSU是相对新的基准,其难度和覆盖面仍需社区进一步验证。论文的SOTA结论应谨慎看待,尤其是在与非完全公平对比(数据量差异巨大)的情况下。
- 对LLM内部机制利用的探索不足:MLF适配器将融合后的音频嵌入输入LLM,但未分析LLM是如何处理这些嵌入的。是否存在注意力瓶颈?音频信息与文本信息在LLM内部是如何交互和对齐的?缺乏这方面的分析使得“为什么有效”的解释不够深入。