StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios

📄 失真缠在一起时,谁来决定先修什么、用什么修 英文题目:StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios 一句话:真实语音常是噪声混响多人说话耦合且修法因人而异,StrixAE 让多模态大模型先听诊再调度外部专家工具链,并以格式结构感知三路奖励做强化学习,在真实录音与个性化任务上取得局部最优但以级联误差与复现缺失为代价。 标签:#语音增强 | #音频大模型 | #强化学习 | #基准测试 评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.5/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Chenglin Wu:Xiamen University Junjie Wu:Xiamen University Jinhang Chen:Xiamen University Mingyang Chen:Xiamen University Zixu Lin:Xiamen University Jiabian Chen:Fuyao University of Science and TechnologyEqual contribution. Xinghao Ding:Xiamen University Xiaotong Tu:Xiamen University 💬 毒舌点评 把耦合失真增强重构为可执行工具链调度问题的工程直觉是对的,用格式与结构奖励约束幻觉也有针对性。短板是写作与证据链粗糙:强化学习算法在 APRL 与 GRPO-AE 之间摇摆,URGENT 表格出现四行完全相同的第三名,闭源基线命名与虚构感极强的大模型版本让人难以信任所谓全面最优。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 986 words

TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models

📄 会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒 英文题目:TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models 一句话:TAG-Bench 把时序音频定位从 30 秒单区间拉到 20 分钟一对多枚举,用 1750 条人工校验问答与并集 IoU/计数/格式三层度量揭示即使最强的 FireRedAudio 也仅 31.2 mIoU 且所有模型计数准确率不过 13.2% 的系统性短板。 标签:#音频理解 | #音频大模型 | #音频事件检测 | #基准测试 | #长音频处理 评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露 Xin Shu:机构信息未在 arXiv HTML 中可靠披露 Zengxi Li:机构信息未在 arXiv HTML 中可靠披露 Lei Xie:机构信息未在 arXiv HTML 中可靠披露 Xiangang Li:机构信息未在 arXiv HTML 中可靠披露 Jianwei Yu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频时序定位从 30 秒短片段与单区间检测拉到 20 分钟长音频与一对多枚举的真实痛点,并用 21 个系统的统一自由文本评测撕开了当前大音频语言模型连时间都说不清的遮羞布;短板是所有结论都建立在规则解析的混合度量上,数据与评测代码承诺尚未兑现,且 1750 条查询在 8 个子集上的诊断粒度与统计效力仍显单薄。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1668 words

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

📄 长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起 英文题目:Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning 一句话:针对长段落音频字幕同时要求长片段、长文本与逐字转录保真的结构性缺口,论文用音频锚定问答统一检验数据、训练与推理三阶段,并以层间曲率抑制迟滞坍缩,在保持开源骨干不变的前提下把字幕的下游可用性推到接近闭源旗舰的水平。 标签:#音频字幕生成 #SFT #音频理解 #音频大模型 #数据集 评分:6.8/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fengji Ma:The Hong Kong University of Science and Technology (Guangzhou) Yan Rong:The Hong Kong University of Science and Technology (Guangzhou) Xu Li:机构信息未在 arXiv HTML 中可靠披露 Chen Zhang:Kling Team, Kuaishou Technology Pengfei Wan:Kling Team, Kuaishou Technology Li Liu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频锚定问答(audio-grounded question answering)这一单一验证原语贯穿数据、训练、推理三阶段,并用层间曲率捕捉迟滞坍缩这一可验证的幻觉信号,思路比单纯堆数据更干净。短板是核心数据管线完全依赖 Gemini 3.1 Pro 这一闭源黑盒自检,成本与可复现性存疑,且 Late-Layer Semantic-Entropy Collapse 的理论刻画仍停留在现象描述与二阶差分启发式层面,缺乏形式化假设与边界分析。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1068 words

SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

📄 把混音师的耳朵写成奖励:SPHERE 如何让 3B 音频语言模型学会摆位 英文题目:SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards 一句话:针对多轨到双耳上混需同时兼顾居中、展宽与电平平衡的难题,SPHERE 把混音经验蒸馏为六维可验证奖励并以过滤监督加分组相对策略优化训练 Qwen2.5-Omni 3B,在 MedleyDB 上以 4.98 总分超越 Gemini 2.5 Pro 教师并获 76.8% 人耳偏好,代价是奖励仍为参数几何统计且受 32k 上下文限制。 标签:#音乐生成 #强化学习 #音频大模型 #参数高效微调 评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Zixun Guo:Meta Reality Labs, USA;Queen Mary University of London, UK Calvin Murdock:Meta Reality Labs, USA Sanjeel Parekh:Meta Reality Labs, USA W Owen Brimijoin:Meta Reality Labs, USA Simon Dixon:Queen Mary University of London, UK Joshua Reiss:Queen Mary University of London, UK Ishwarya Ananthabhotla:Meta Reality Labs, USA 💬 毒舌点评 把混音师经验蒸馏成6维可验证奖励并用拒绝采样监督微调(Rejection Sampling Supervised Fine-Tuning, RS-SFT)+ 分组相对策略优化(Group Relative Policy Optimization, GRPO)让3B学生超越Gemini 2.5 Pro教师,防奖励欺骗(reward hacking)的互斥景观设计尤为扎实;短板是奖励全靠参数几何与电平统计、未经头相关传输函数(Head-Related Transfer Function, HRTF)渲染后的双耳声学校验,客观评测与优化目标同为Sphere存在循环论证,且外部盲听仅10轨10名专家、难以支撑泛化主张。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1478 words

Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation

📄 波形有用,不等于必须调用生成式音频模型 英文题目:Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation 一句话:论文把已知闭集任务的音频大模型评测重构为保留转录、调用本地编码器或调用生成式模型的受控决策,用匹配的无调用选择器做决定性消融,在 VocalSound 上以 12.5% 调用率取得 0.925 准确率却与 0.921 的无调用选择器无显著差异,揭示声学证据的价值与生成式调用的必要性是两回事。 标签:#音频分类 #音频大模型 #模型评估 #基准测试 评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Mengzhe Geng:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把音频大模型评测从笼统的音频优于文本准确率对比,拆解为可审计的调用决策问题,并用匹配的无调用选择器做严格对照,结论克制且对部署有现实警示。短板是核心证据高度依赖 VocalSound 单一已知闭集任务的小样本划分,外推性与统计功效均有限,且未提供代码与生成模型置信度等关键复现要素,提示词敏感性也让结论的稳定性打折。 📌 核心摘要 论文针对已知闭集任务中音频大模型评测混淆声学证据价值与生成式音频调用必要性的问题,提出生成式调用审计框架,将评测重构为在保留转录标签、使用本地编码器证据与调用生成式音频模型之间的受控决策。方法核心是构建转录优先与编码器优先的路由策略以及基于 L2 正则化逻辑回归的正确性全选择器,并以移除所有生成动作但保持相同训练与选择协议的匹配无调用选择器作为决定性消融。实验在 VocalSound 上显示转录基线仅 0.296 而有监督编码器已达 0.85 左右,全选择器以 12.5% 调用率取得 0.925 准确率,与无调用选择器的 0.921 几乎无差异,配对差异 0.004 且 95% 置信区间 [-0.025,0.033] 包含 0,经 Holm 校正后仅 Full 对 WavLM 的优势保持显著。该结果边界清晰:仅适用于已知闭集标签决策,不涉及开放对话、指令跟随或通用音频推理,且结论依赖开发集标签可用的有监督编码器对照与锁定的行划分。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 843 words

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

📄 当文字说得太漂亮,声音却在摇头:如何让模型听出言外之意 英文题目:When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue 一句话:论文把“只看文字就能答对”的捷径变成可测量的陷阱,用 333 道冲突题与 168 道一致题的 ContraTalk 检验模型是否真的听见了声音,并用把韵律与情感转成可检索文本卡片的 Audio Twin 把冲突准确率从 47.7% 拉到 50.5%、把陷阱选择率压到 29.4%,代价是在小模型上会扰动原本正确的文字判断。 标签:#语音交互 #音频大模型 #基准测试 #数据集 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yen-Ju Lu:机构信息未在 arXiv HTML 中可靠披露 Yuzhe Wang:机构信息未在 arXiv HTML 中可靠披露 Yaohan Guan:机构信息未在 arXiv HTML 中可靠披露 Xiluo He:机构信息未在 arXiv HTML 中可靠披露 Jiarui Hai:Center for Language and Speech Processing, Johns Hopkins University Mingrui Liang:机构信息未在 arXiv HTML 中可靠披露 Kaavya Chaparala:机构信息未在 arXiv HTML 中可靠披露 Thomas Thebaud:机构信息未在 arXiv HTML 中可靠披露 Laureano Moro-Velazquez:机构信息未在 arXiv HTML 中可靠披露 Najim Dehak:机构信息未在 arXiv HTML 中可靠披露 Jesus Villalba:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语音对话中长期被文本捷径掩盖的跨模态分歧形式化为可测的冲突与一致双分支基准,并用可审计的文本化声学证据卡把玄学融合变成可检索的证据仲裁。短板是 501 题仅源自 117 段 Seamless Interaction 对话且依赖提示词与大语言模型生成问题,Audio Twin 本质仍是手工规则离散化韵律与情感特征的检索增强,对抗性提升有限且一致集上小模型被声学证据带偏。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 992 words

Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace

📄 别把中层热图当读心术:音频 LLM 的工作空间究竟替谁完成了推理 英文题目:Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace 一句话:这篇论文最有价值的不是把中层 readout 拟人化,而是用只换波形的控制、层带对照和干预实验把可读概念收束为可证伪命题:声音驱动信息在中段最容易脱离文字先验被识别,并在输出层之前已被系统使用。 标签:#音频理解 #音频大模型 #多模态模型 #可解释性 #模型评估 评分:6.6/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.4/1.5 💬 毒舌点评 它真正做对的是没有把单张漂亮热图当结论。waveform-swap 先按住文字先验,Table 2 再区分可分性与 raw 增益,最后以 patching 接上 motor 前已被使用的证据;这条从可读到归因再到干预的路径,给音频解释性提供了实验科学的起点。 但这张地图不是监控器。logit lens 是近似读出,Nixon/caption 个案不能替代大规模对齐,patching 也不能把因果功劳独给 workspace。没有代码、成本、真实代理行为或安全任务;把中层最能和文字先验分开升级成系统可被可靠读心,会比作者自己的结论走得远得多。 📌 核心摘要 先把“读心”降格:中层词必须经得起声音与因果两道追问 这篇论文最有价值的不是把中层 readout 拟人化,而是用只换波形的控制、层带对照和干预实验把可读概念收束为可证伪命题:声音驱动信息在中段最容易脱离文字先验被识别,并在输出层之前已被系统使用。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 732 words

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

📄 MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning 标签:#音频理解 #元学习 #音频大模型 #少样本 #低资源 8.0/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #元学习 | #音频大模型 #少样本 | arxiv 👥 作者与机构 第一作者:Haolong Zheng(University of Illinois Urbana-Champaign) 通讯作者:正文未明确标注 作者列表:Haolong Zheng、Siyin Wang、Zengrui Jin、Mark Hasegawa-Johnson(机构:University of Illinois Urbana-Champaign;Tsinghua University) ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 728 words

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

📄 MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models 标签:#音频质量评估 #音频大模型 #基准测试 #模型评估 #音频理解 8.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5 🔥 8.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音频质量评估 | #音频大模型 | #基准测试 #模型评估 | arxiv 👥 作者与机构 第一作者:Yize Li(Northeastern University) 通讯作者:正文未明确标注 作者列表:Yize Li、Ningyuan Yang、Sile Yin、Sindhuja Thogarrati、Sung-En Chang、Andrew C. Singer、Xue Lin、Chuan-Che Huang、Shuo Zhang(机构:Northeastern University;Bose Corporation;Stony Brook University) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 575 words

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

📄 Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering 标签:#音频理解 #LoRA #后训练 #强化学习 #音频大模型 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.3/10 | 前25% | 文档类型:应用研究 | 评分置信度:中 | #音频理解 | #LoRA | #后训练 #强化学习 | arxiv 👥 作者与机构 第一作者:Weiteng Hu(正文提取未提供可核验机构信息) 通讯作者:正文未明确标注 作者列表:Weiteng Hu、Yin Cao、Jun Yang(机构:正文提取未提供可核验机构信息) 💡 毒舌点评 这篇工作的价值在于给出清楚反例:相同任务适配对 Qwen 有益,却让零样本更强的 MOSS 显著退化;LoRA 缩放只是廉价校准,不是普遍提升定律。结构化证据奖励很有启发,但下一步必须用独立测试集和音频反事实审计 grounding,并报告 5 次投票的成本,才能把 61.05% 转化为稳健方法结论。 ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 487 words