Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

📄 Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models 标签:#音频理解 #音频大模型 #预训练 #多模态模型 8.0/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 🔥 8.0/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音频理解 | #音频大模型 | #预训练 #多模态模型 | arxiv 👥 作者与机构 第一作者:Xuanru Zhou(机构未说明) 通讯作者:未说明 作者列表:Xuanru Zhou、Yiwen Shao、Jiahong Li、Dong Yu(机构信息未在当前正文中完整说明) 💡 毒舌点评 免指令对齐的训练思路有理论吸引力,但结论的适用范围被实验设计明显收窄:只验证了音频域和 7B/8B 规模,性能上限又被冻结编码器与冻结语言模型双重锁死——projector 既无法找回编码器丢失的声学细节,也不能赋予 LLM 本来没有的能力。监督信号偏语义的取向意味着韵律、说话人等超语义信息可能仍需专门监督。语音任务明显弱于专门后训练模型这一点尤其值得玩味:定向 SFT 能补语音,但作者已经观察到声音与音乐能力的同步退化,「通用」的代价被轻描淡写了。 ...

2026-08-20 · 更新于 2026-09-04 · 5 min · 888 words

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

📄 Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges 标签:#语音交互 #音频大模型 #多模态模型 #长音频处理 #模型评估 6.5/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #语音交互 | #音频大模型 | #多模态模型 #长音频处理 | arxiv 👥 作者与机构 第一作者:Syeda Faiza Ahmed;合作者 Zien Sheikh Ali、Hunzalah Hassan Bhatti、Firoj Alam、Shammur Absar Chowdhury(卡塔尔计算研究院)。 💡 毒舌点评 这是一篇很适合做项目路线图的综述:它提醒大家“会看、会说、会调用工具”不等于能把一场对话坚持到底。问题是范围极宽,从文本对话一路铺到 omni-agent,很多结论依赖文献作者自己的实验,读者仍需自行判断各 benchmark 是否真正测了跨轮记忆和 grounding。作为综述它也有结构性的局限:「多轮」的定义和指标在各论文间并不统一,横向比较不可避免地带入主观归类;真实部署的成本、延迟与隐私量化几乎缺席;研究议程提出了正确的问题却没有配套统一 benchmark 或代码基线,可执行性打了折扣。 ...

2026-08-19 · 更新于 2026-09-04 · 2 min · 399 words

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

📄 UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding 标签:#音乐理解 #音频大模型 #低资源 #多语言 #基准测试 7.1/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.1/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐理解 | #音频大模型 | #低资源 #多语言 | arxiv 👥 作者与机构 第一作者:Ziya Zhou(未说明) 通讯作者:未说明(论文仅标注 † 但未给出具体姓名;文末出现 wei xue、yike guo 的 HKUST 邮箱,但作者未明确声明其为通讯作者) 作者列表: Ziya Zhou(未说明) Shangda Wu(Independent Researcher) Shenyang Xu(Independent Researcher) Yutong Zheng(Independent Researcher) Dafang Liang(Independent Researcher) Suin Chung(Sogang University, Seoul, Korea) Danbinaerin Han(KAIST, Daejeon, Korea) Junyan Jiang(NYU Shanghai, China) Yongyi Zang(Independent Researcher) Ruibin Yuan(未说明) Rongxiu Zhong(JIUTIAN Research, China Mobile, Beijing, China;The State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China) Shilei Zhang(JIUTIAN Research, China Mobile, Beijing, China;The State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China) Junlan Feng(JIUTIAN Research, China Mobile, Beijing, China) Jinglei Liu(China Mobile (Hong Kong) Innovation Research Institute, Hong Kong SAR, China) Haotian Zhou(Central Conservatory of Music, Beijing, China) Zijin Li(Central Conservatory of Music, Beijing, China) Dasaem Jeong(Sogang University, Seoul, Korea) Wei Xue(HKUST, Hong Kong SAR, China) Yike Guo(HKUST, Hong Kong SAR, China) 💡 毒舌点评 这篇工作的工程体量令人印象深刻:从 38 种以上语言/文化的低资源民间音乐出发,建立了可复现的人机协作 pipeline 和大规模后训练数据集,并系统对比了多种多模态不平衡学习策略。但论文对核心可交付物的开源状态含糊其辞(仅写 “available here” 却无实际链接),且 benchmark 中约 93% 的旋律轮廓题正确答案都包含 “Undulating”,暴露了自动 CantoCore 解析器与问法粒度之间的显著鸿沟,让部分题目更像是文本/标签规律的检测而非真正声学理解的考验。 ...

2026-08-19 · 更新于 2026-09-04 · 6 min · 1114 words

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

📄 ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning 标签:#音频字幕生成 #强化学习 #音频大模型 #后训练 7.5/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频字幕生成 | #强化学习 | #音频大模型 #后训练 | arxiv 👥 作者与机构 第一作者:Fengji Ma(Kling Team 实习,具体机构未说明) 通讯作者:Li Liu(具体机构未说明) 作者列表:Fengji Ma(Kling Team 实习)、Yan Rong(具体机构未说明)、Xu Li(Project Leader,具体机构未说明)、Xuenan Xu(具体机构未说明)、Chen Zhang(具体机构未说明)、Li Liu(通讯作者,具体机构未说明) 💡 毒舌点评 本文把音频字幕从"一次性写完"改造成一个会追问、会停止、会综合证据的 agent,LOOP-GRPO 的多轮信用分配思路确实比只看最终分数的 GRPO 更细腻。但整套评估高度依赖固定 Gold-MCQ 和冻结 judge,且当前没有代码、模型或数据开源,evidence preservation 是否能在自然长段落字幕中稳定泛化仍要打问号。 ...

2026-08-18 · 更新于 2026-09-04 · 6 min · 1174 words

ARENA: Automated Red-Teaming for Large Audio Language Models

📄 ARENA: Automated Red-Teaming for Large Audio Language Models 标签:#音频理解 #后训练 #音频大模型 #SFT #内容审核 6.5/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #后训练 | #音频大模型 #SFT | arxiv 👥 作者与机构 第一作者:Jiaming He(未说明) 通讯作者:未说明 作者列表:Jiaming He(未说明)、Zhicong Huang(未说明)、Tian Jin(未说明)、Zhen Sun(未说明)、Cheng Hong(未说明)、Yi Yu(未说明)、Wenbo Jiang(未说明)、Xudong Jiang(未说明) 💡 毒舌点评 该工作将 LALM 红队测试从静态音频越狱集推进到闭环控制器优化,且在搜索反馈与最终评估者之间做了清晰解耦,设计动机明确,消融也证明了反馈细化和声效变体搜索的价值。但实验基线仅有两个静态集,缺少与文本/图像自动红队方法适配后的横向对比;控制器训练关键超参和训练数据未公开,仅凭"Code is available at Github"的空声明无法真正复现。整体方向有价值,但还远未达到顶会方法论文的完整性标准。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 770 words

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

📄 Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization 标签:#音频理解 #强化学习 #音频大模型 #长音频处理 #基准测试 6.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #强化学习 | #音频大模型 #长音频处理 | arxiv 👥 作者与机构 第一作者:Tony Alex(University of Surrey) 通讯作者:Tony Alex(University of Surrey)、Jiankang Deng(Huawei Noah’s Ark Lab) 作者列表:Tony Alex(University of Surrey)、Wish Suharitdamrong(University of Surrey)、Sara Atito(University of Surrey)、Armin Mustafa(University of Surrey)、Muhammad Awais(University of Surrey)、Philip J. B. Jackson(University of Surrey)、Jiankang Deng(Huawei Noah’s Ark Lab)、Ismail Elezi(Huawei Noah’s Ark Lab) 脚注信息:论文脚注说明 Tony Alex 在 Huawei Noah’s Ark Lab, London 实习期间完成本工作;通讯邮箱为 t.alex@surrey.ac.uk 和 j.deng16@imperial.ac.uk(Jiankang Deng 的邮箱域名与正文所标 Huawei 机构不完全一致,审校时保留原文表述并提示此细节)。 💡 毒舌点评 这篇文章把“音频章节化”从 ASR-LLM 级联主导的旧路径拉进端到端 LALM 训练框架,数据资源和 49 点 F1 提升看起来够猛;但核心任务被简化成 60 秒二分类,真正全长度边界检测在 AF3 backbone 上只有 37.6 F1(换用 MOSS backbone 也只到 46.2),离“navigable media”的叙事还很远。CoT 依赖 Step-Audio-R1 和 Gemini 2.5 Pro 两个闭源模型,方法复现性和数据洁净度都不算硬。实际贡献更像是一个能工作的 pipeline + 一套新 benchmark,而不是对章节化问题的真正解决。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 944 words

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

📄 MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques 标签:#音频质量评估 #音频大模型 #SFT #强化学习 #音乐生成 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频质量评估 | #音频大模型 | #SFT #强化学习 | arxiv 👥 作者与机构 第一作者:Jiabao Zhuang(复旦大学 Fudan NLP Group) 并列一作:Changhao Jiang、Hanchen Wang、Jiahao Chen、Zhixiong Yang、Zhenghao Xiang(均复旦大学 Fudan NLP Group) 通讯作者:Tao Gui(复旦大学 Fudan NLP Group) 作者列表:Jiabao Zhuang(复旦大学 Fudan NLP Group)、Changhao Jiang(复旦大学 Fudan NLP Group)、Hanchen Wang(复旦大学 Fudan NLP Group)、Jiahao Chen(复旦大学 Fudan NLP Group)、Zhixiong Yang(复旦大学 Fudan NLP Group)、Zhenghao Xiang(复旦大学 Fudan NLP Group)、Yifei Cao(复旦大学 Fudan NLP Group)、Jiajun Sun(复旦大学 Fudan NLP Group)、Hui Li(复旦大学 Fudan NLP Group)、Ming Zhang(复旦大学 Fudan NLP Group)、Tao Ji(复旦大学 Fudan NLP Group)、Tao Gui(复旦大学 Fudan NLP Group,通讯作者)、Qi Zhang(复旦大学 Fudan NLP Group)、Xuanjing Huang(复旦大学 Fudan NLP Group) 💡 毒舌点评 把文本生成式奖励模型里的“先写 critique 再打分”范式迁移到长歌曲多维度美学评估,并用自生成 critique 缓解训练/推理分布偏移,这一点做得比较完整,消融证据也清楚。但整体新颖性更接近领域迁移而非本质突破,且 Music Arena 相对 SongEval 的领先只有 0.55 个百分点,没有统计显著性或多 seed 验证,下游 GRPO 效果也缺少人类听感评估来兜底。人工 critique 审核的样本量、接受率与一致性均未量化,进一步削弱了数据构建可靠性。 ...

2026-08-13 · 更新于 2026-09-04 · 2 min · 406 words

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

📄 Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA 标签:#音视频问答 #多模态模型 #音频大模型 #参数高效微调 #鲁棒性 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频问答 | #多模态模型 | #音频大模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Maryam Dehdashti(Inference Matter Labs) 通讯作者:Maryam Dehdashti(Inference Matter Labs;dehdashti@inferencematter.ai) 作者列表:Maryam Dehdashti(Inference Matter Labs) 💡 毒舌点评 这篇论文最有价值的不是又一个 Qwen 变体,而是用受控消融把“音频表示是否保留局部时间细节”与 AVQA 精度强关联起来,并且单卡约 5 小时的可复现成本很吸引人。短板也同样突出:所有结论锁死在 MUSIC-AVQA 的非标准可用视频子集上,Whisper vs PANNs 的 26 点差距被架构、预训练和池化差异共同污染,作者自己也承认这不是干净的因果实验;此外,AVQA 微调会牺牲 ASR 能力,说明得到的“多模态能力”在任务迁移和通用性上仍有明显边界。因此这篇工作更像一次有洞察的系统层观察和务实的模块化适配,而非方法学突破。 ...

2026-08-13 · 更新于 2026-09-04 · 5 min · 1043 words

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

📄 Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models 标签:#语音交互 #对抗训练 #音频大模型 #鲁棒性 5.4/10 | 创新 1.4/2 | 严谨 0.7/1.5 | 实验 1/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.7/1.5 📝 5.4/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv 👥 作者与机构 作者列表:Shuozhe Cheng、Kunlan Xiang、Mingxuan Li、Ji Zhang、Dongxiao Liu、Wenbo Jiang。 论文正文未列出任何作者的单位、实验室名称或完整机构信息。 邮箱信息:论文仅提供 sc8483629@gmail.com 与 wenbo_jiang@uestc.edu.cn 两个邮箱。排版中 Corresponding author 字样紧跟在 sc8483629@gmail.com 之后,但未明确标注该邮箱对应哪位作者;按常见模板惯例可推断 Shuozhe Cheng 可能是通讯作者,但此推断无法被论文正文确证。 wenbo_jiang@uestc.edu.cn 的域名为 uestc.edu.cn,可可靠推断 Wenbo Jiang 来自电子科技大学;其他作者所属机构均为“未说明”。 原文未提供作者顺序对应的机构编号列表,也未提供 ORCID 或贡献声明。 💡 毒舌点评 第一次系统地把文本 LLM 的 DoS 攻击研究拓展到端到端语音大模型,问题切入点有实际意义;四分量联合损失配合 VAD 的 pipeline 设计也具备一定工程完成度。但论文在证据链上存在多处明显瑕疵:消融表 2 的行与组件对应关系无法唯一解码,正文表述与表格数值存在直接冲突(如 FunAudioChat clean input 显存在正文写 17.26 GB、表 1 却写 20.26 GB);使用“ChatGPT 5.5”作为响应质量评测器但未提供任何可独立验证的版本信息;文本基线 Crabs/ExtendAttack 如何适配到语音输入完全没有说明;攻击成功样本的波形分析显示所谓“never stop speaking”实际产生的是大量低能量静音片段而非持续可听语音。这些问题使得当前结果只能视为初步探索,距离顶会主刊的完整证据标准尚有明显距离。 ...

2026-08-12 · 更新于 2026-09-04 · 4 min · 735 words

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

📄 From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs 标签:#音频理解 #对抗训练 #音频大模型 #鲁棒性 #模型评估 7.4/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #对抗训练 | #音频大模型 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Yuanhe Zhang、Weiliu Wang(共同第一作者;机构信息未完整披露) 作者列表:Yuanhe Zhang、Weiliu Wang、Jie Ren、Liang Lin、Zhenhong Zhou、Haoran Gao、Kun Wang、Chen Li、Li Sun、Sen Su 通讯作者:Sen Su(论文署名信息未给出完整机构映射) 💡 毒舌点评 ILL 把“人耳听不见但模型能感知”的低频输入明确为 LALM 的安全风险,并用黑盒通用波形在六个模型上验证了可迁移的破坏效果;DRG 的条件重录防御也有工程直觉。但攻击只在数字混音中评估,没有 over-the-air 实测,DRG 仅建模两类分布且要求用户重复录音,频移、调制变化和实时交互下的鲁棒性仍未证明。 ...

2026-08-11 · 更新于 2026-09-04 · 1 min · 173 words