论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4909 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4410 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4842 字 阅读 →
论文解读

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3626 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇技术报告全面介绍了Qwen3.5-Omni,一个能够统一理解与生成文本、图像、音频和音视频内容的全模态大语言模型。**要解决的问题**是现有模型在实时交互、跨模态推理和自主智能体行为方面的局限性。**采用的方法**是基于“思考者-说话者”架构,引入了多项关键创新:1)思考者和说话者均采用混合注意

 · 更新于 2026-09-25 · 约 12 分钟 · 5641 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

这篇论文旨在解决大语言模型在歌词到旋律生成任务中,通过监督微调(SFT)训练出的模型常产生音乐上不可行(如节奏怪异、音域超限)的“约束违反”问题。**核心贡献**是提出了一套无需人工标注、基于规则约束的自动化对齐框架。**关键方法**分为三步:首先对预训练LLM进行SFT以获得基础生成能力;其次,利

 · 更新于 2026-09-25 · 约 10 分钟 · 4941 字 阅读 →
论文解读

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)缺乏显式、高质量推理能力的问题。现有方法要么受限于监督数据的质量,要么使用粗糙的奖励,导致生成的思维链形式良好但缺乏声学依据。作者提出了**Audio-DeepThinker**框架,其核心贡献有三:1)设计了一种**混合推理相似度奖励**,结合LLM评

 · 更新于 2026-09-25 · 约 11 分钟 · 5355 字 阅读 →
论文解读

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

本文旨在解决多模态大模型在音视频联合推理任务上缺乏高质量训练数据的核心挑战。**核心贡献**是提出了AVRT框架,通过组合单模态专家模型的能力来合成多模态推理数据。**关键方法**分为两步:1)**数据生成**:使用专门的视觉教师(Kimi-VL-Thinking)和音频教师(Audio Flami

 · 更新于 2026-09-25 · 约 13 分钟 · 6166 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

本文针对卫星、水下通信等超低比特率(200bps)场景下,传统神经语音编解码器因优化重建质量而牺牲可懂度的问题,提出了ClariCodec。其核心方法是将编码器的量化过程重新定义为一个随机策略,并利用强化学习(RL),以词错率(WER)作为奖励信号对编码器进行微调,而冻结解码器等声学重建管线。实验表

 · 更新于 2026-09-25 · 约 8 分钟 · 3918 字 阅读 →
论文解读

MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora

这篇论文旨在解决零样本语音模仿任务中高质量平行训练数据稀缺的核心瓶颈。传统方法要么依赖复杂的解耦架构,要么使用合成语音作为训练目标,导致输出质量受限于合成系统的能力。作者提出了一种名为 **MimicLM** 的新框架,其核心创新在于**“角色交换”的数据构建策略**:使用TTS生成的语音作为**训

 · 更新于 2026-09-25 · 约 10 分钟 · 4878 字 阅读 →
论文解读

NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR

本文提出了NIM4-ASR,一个面向生产环境的高效、鲁棒且可定制的实时语音识别框架。该工作旨在解决现有LLM-based ASR在实际部署中的三大挑战:1) 轻量化模型性能严重下降(有限的向下扩展性);2) 在声学挑战条件下产生幻觉;3) 缺乏生产就绪的热词定制机制。为此,作者提出了一套原则性的多阶

 · 更新于 2026-09-25 · 约 10 分钟 · 4907 字 阅读 →
论文解读

SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

本文旨在解决对话系统中情感识别(ERC)与情感表达能力受限于高质量标注数据稀缺且静态的问题。**核心贡献**是提出了一个心理学动机的自我进化框架 **SELF-EMO**。**关键方法**是构建一个角色扮演的自博弈范式,使模型同时充当“情绪识别者”和“对话响应者”,并通过一个“生成-筛选-重用”的数

 · 更新于 2026-09-25 · 约 8 分钟 · 3893 字 阅读 →
论文解读

Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction

本文旨在解决音频-视觉导航(AVN)智能体在未见环境和未闻声音类别下泛化能力差的核心问题。作者指出,现有方法性能下降主要源于两个因素:一是音频表征混淆了语义与空间信息,导致对未闻声��定位不准;二是强化学习策略过拟合于训练环境的动态和布局。为此,本文提出了一个名为BDATP的即插即用框架。在感知层面

 · 更新于 2026-09-25 · 约 11 分钟 · 5221 字 阅读 →
论文解读

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

本论文针对音频-视觉导航(AVN)中目标空间意图模糊、视觉特征缺乏听觉条件引导两大问题,提出了 Spatial-Aware Conditioned Fusion(SACF)框架。该框架首先设计了 Spatially Discretized Localization Descriptor(SDLD),

 · 更新于 2026-09-25 · 约 10 分钟 · 4579 字 阅读 →
论文解读

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

这篇论文旨在解决当前音频大语言模型(AudioLLMs)在细粒度声学感知任务上表现不佳的核心问题。作者指出,主流的以自动语音识别(ASR)为中心的训练范式,通过将音频映射到纯文本转录,系统性地丢弃了副

 · 更新于 2026-09-25 · 约 10 分钟 · 4974 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

这篇论文旨在解决卫星、水下等极端带宽受限场景下(如200bps)语音通信清晰度严重下降的问题。传统编解码器以波形重建为目标,在超低比特率下会将宝贵的比特分配给不必要的声学细节,而非核心语义信息。为此,

 · 更新于 2026-09-25 · 约 11 分钟 · 5506 字 阅读 →
论文解读

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

本文旨在解决全双工语音对话模型(SDMs)实现类人交互的核心挑战。现有自动化评估指标流于表面(如统计行为或预测时机准确率),无法为强化学习提供可靠的奖励信号,而人工评估成本高昂且难以扩展。为此,作者提

 · 更新于 2026-09-25 · 约 12 分钟 · 5601 字 阅读 →
论文解读

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

本文旨在解决大型音频语言模型在复杂音频场景中因感知错误导致的推理失败问题。受听觉场景分析启发,作者提出了一个感知接地的混合推理框架。首先,他们构建了一个名为PAQA的新数据集,通过层次化解耦策略(区分

 · 更新于 2026-09-25 · 约 13 分钟 · 6065 字 阅读 →
论文解读

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

这篇论文旨在解决大型音频语言模型(LALM)在细粒度时间感知(如精确定位声音事件的起止时间)上的不足。作者提出了**TimePro-RL**框架,其核心是两步走策略:首先,提出**音频侧时间提示(AS

 · 更新于 2026-09-25 · 约 10 分钟 · 4592 字 阅读 →
论文解读

WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

这篇论文旨在解决端到端语音对话模型在智能(IQ)和表达力(EQ)上难以同时提升的核心挑战。作者发现,直接对混合文本-语音序列应用统一的偏好优化(如DPO、GRPO)会导致问题:稀疏的偏好信号被淹没在密

 · 更新于 2026-09-25 · 约 11 分钟 · 5245 字 阅读 →