论文解读

NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages

这篇论文旨在解决非洲低资源语言在语音翻译(S2ST和S2TT)研究中面临的高质量、多口音平行语音数据严重匮乏的核心瓶颈。为此,作者构建了**NaijaS2ST**数据集,涵盖豪萨语、伊博语、约鲁巴语和尼日利亚皮钦语与英语的平行语音,每种语言约50小时,捕获了真实的说话者与口音多样性。基于此数据集,论

 · 更新于 2026-09-25 · 约 9 分钟 · 4148 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 是一个旨在统一理解、推理、生成与行动的全模态大语言模型。它**解决**了现有模型在实时交互、长上下文音视频处理、流式语音生成稳定性以及多语言支持等方面的局限性。**方法上**,它基于Thinker-Talker架构,引入了Hybrid MoE以提升效率,采用显式时间戳替代稀

 · 更新于 2026-09-25 · 约 12 分钟 · 5592 字 阅读 →
论文解读

TinyMU: A Compact Audio-Language Model for Music Understanding

本文针对现有大型音频语言模型(LALM)参数庞大(数十亿级)、训练推理成本高、难以部署在边缘设备的问题,提出了 TinyMU——一个仅有 229M 参数的紧凑音乐语言模型。为此,作者构建了 MusicSkills-3.5M 数据集,包含 350 万个涵盖多选、二元判断和开放式格式的音乐问答样本,结合

 · 更新于 2026-09-25 · 约 9 分钟 · 4133 字 阅读 →
论文解读

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务上能力不足且依赖昂贵闭源数据的问题。作者提出了一个名为**Audio-Cogito**的全开源解决方案,其核心是**Cogito-Pip

 · 更新于 2026-09-25 · 约 10 分钟 · 4834 字 阅读 →
论文解读

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

这篇论文旨在解决当前全模态大模型在音视频不一致性理解能力上缺乏系统性评估的问题。现有基准要么只关注音视频对齐事件,要么局限于检测深度伪造中的低级伪影,无法评估模型对长视频中语义级矛盾的理解。为此,作者

 · 更新于 2026-09-25 · 约 12 分钟 · 5790 字 阅读 →
论文解读

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

这篇论文旨在解决当前音频大语言模型(AudioLLMs)在细粒度声学感知任务上表现不佳的核心问题。作者指出,主流的以自动语音识别(ASR)为中心的训练范式,通过将音频映射到纯文本转录,系统性地丢弃了副

 · 更新于 2026-09-25 · 约 10 分钟 · 4974 字 阅读 →
论文解读

Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection

这篇论文揭示了针对音频大语言模型(LALM)的一种新型安全威胁:**上下文无关且不可感知的音频提示注入攻击**。攻击者仅需篡改输入音频数据(如会议录音、音乐片段),即可在用户不知情的情况下,劫持模型行

 · 更新于 2026-09-25 · 约 14 分钟 · 6905 字 阅读 →
论文解读

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

本文旨在解决大型音频语言模型在复杂音频场景中因感知错误导致的推理失败问题。受听觉场景分析启发,作者提出了一个感知接地的混合推理框架。首先,他们构建了一个名为PAQA的新数据集,通过层次化解耦策略(区分

 · 更新于 2026-09-25 · 约 13 分钟 · 6065 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

本文提出了MoshiRAG,这是首个集成检索增强生成功能的全双工语音语言模型。**要解决的问题**是全双工语音模型在保持实时交互性的同时,事实准确性不足的挑战。**核心方法**是基于Moshi模型,设

 · 更新于 2026-09-25 · 约 11 分钟 · 5300 字 阅读 →
论文解读

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

本文旨在解决大型音频语言模型在**细粒度音频事件时间定位**上的不足。现有模型因训练数据缺乏精确时间戳、基准测试过于简单,导致在长音频中定位短暂事件(“大海捞针”)时表现不可靠。为此,作者提出了**S

 · 更新于 2026-09-25 · 约 11 分钟 · 5348 字 阅读 →
论文解读

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

这篇论文旨在解决大型音频语言模型(LALM)在细粒度时间感知(如精确定位声音事件的起止时间)上的不足。作者提出了**TimePro-RL**框架,其核心是两步走策略:首先,提出**音频侧时间提示(AS

 · 更新于 2026-09-25 · 约 10 分钟 · 4592 字 阅读 →
论文解读

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

这篇论文深入探讨了在端到端音频语言模型中,将视觉信息融入音频分词器时普遍存在的“理解提升但重建质量下降”的核心矛盾。作者通过系统性实验,揭示了三个关键发现:融合位置(在量化前还是量化后)至关重要;在离

 · 更新于 2026-09-25 · 约 10 分钟 · 4838 字 阅读 →