每日研究速递

语音/音乐/音频论文速递 2026-04-25

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 6 分钟 · 2986 字 阅读 →
论文解读

Materialistic RIR: Material Conditioned Realistic RIR Generation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5449 字 阅读 →
论文解读

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

语音情感识别 | 6.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5670 字 阅读 →
论文解读

Sema: Semantic Transport for Real-Time Multimodal Agents

实时处理 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4888 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-24

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 59 分钟 · 29279 字 阅读 →
论文解读

ATIR: Towards Audio-Text Interleaved Contextual Retrieval

这篇论文旨在解决现有音频-文本检索方法无法处理查询和文档中音频与文本交错出现(如多轮对话、混合输入)的局限性。为此,作者定义了音频-文本交错上下文检索(ATIR)任务,并构建了一个包含约8.8万对样本的大规模基准。为解决直接应用多模态大语言模型(MLLM)时音频token冗余导致的效率和精度问题,论

 · 更新于 2026-09-06 · 约 9 分钟 · 4361 字 阅读 →
论文解读

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

1. **问题**:当前多模态大模型在音乐符号处理(Omnimodal Notation Processing, ONP)领域存在严重缺陷:研究碎片化、模型存在严重的符号偏差(偏向五线谱)、且普遍依赖不可靠的“LLM-as-a-Judge”评估方法,掩盖了模型在音乐理论推理上的系统性失败。 2.

 · 更新于 2026-09-06 · 约 9 分钟 · 4149 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇论文介绍了Qwen3.5-Omni,一个支持文本、图像、音频和音频-视频输入的全模态大语言模型。为解决现有模型在实时交互、跨模态推理和工具使用上的不足,其核心方法是采用“Thinker-Talker”架构,并引入混合专家(MoE)设计以提升效率。与前代相比,主要创新在于:1)模型规模扩展至数千亿

 · 更新于 2026-09-06 · 约 10 分钟 · 4857 字 阅读 →
论文解读

APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track

这篇论文报告了APRVOS系统,一个专为MEVIS_Audio(音频条件下的指代视频对象分割)任务设计的冠军方案。**要解决的问题**是传统文本指代分割模型无法直接处理包含噪声、不完整且可能描述视频中不存在物体的语音输入。**采用的方法**是一个四阶段流水线:首先使用VibeVoice-ASR将语音

 · 更新于 2026-09-06 · 约 9 分钟 · 4115 字 阅读 →
论文解读

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

这篇论文首次系统研究了良性(无害)音频数据微调对音频大模型安全对齐的破坏作用。**要解决的问题**是:用户出于提升模型性能目的进行的常规微调,是否会无意中破坏模型的安全防护?**方法**上,作者提出了一个基于嵌入空间邻近度的过滤框架,从语义、声学及混合维度,选择性地用与有害内容在表示空间上相近的良性

 · 更新于 2026-09-06 · 约 8 分钟 · 3751 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 44 分钟 · 21691 字 阅读 →
论文解读

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

本文旨在解决多模态大模型在音视频联合推理任务上缺乏高质量训练数据的核心挑战。**核心贡献**是提出了AVRT框架,通过组合单模态专家模型的能力来合成多模态推理数据。**关键方法**分为两步:1)**数据生成**:使用专门的视觉教师(Kimi-VL-Thinking)和音频教师(Audio Flami

 · 更新于 2026-09-06 · 约 13 分钟 · 6166 字 阅读 →
论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

本文提出**FLiP**,一种**因子化线性投影模型**,旨在**理解并解释**多语言、多模态句子嵌入空间(如SONAR, LaBSE, Gemini)。核心思想是将嵌入空间的解释转化为一个**线性关键词提取任务**:通过一个简单的线性投影,从句子嵌入向量中恢复出构成该句子的词汇。实验表明,训练良好

 · 更新于 2026-09-06 · 约 8 分钟 · 3724 字 阅读 →
论文解读

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

本文旨在解决训练共情语音聊天机器人时面临的**共情语音数据稀缺、模型泛化能力弱、以及微调导致LLM通用能力退化**三大难题。作者提出了**FreezeEmpath**,一种高效的端到端训练框架。其核心方法是**冻结基础LLM**,采用**语义-情感解耦编码策略**,通过独立的语义适配器和情感提取器从

 · 更新于 2026-09-06 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

这篇论文旨在解决当前音频-文本检索模型在**真实、多样化用户查询**下性能下降的问题。作者指出,现有基准测试(如AudioCaps, Clotho)依赖描述性标题式查询,与真实世界中简短、多变的搜索行为(如问题、命令、关键词、排除性查询)存在巨大差距。为此,论文提出了两大核心贡献:1) **Omni

 · 更新于 2026-09-06 · 约 9 分钟 · 4160 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

本文针对现有视频到音乐(V2M)生成模型缺乏对创作者风格、主题等细粒度意图控制的问题,提出了Video-Robin,一个结合文本提示的视频配乐框架。其核心方法是将生成过程解耦为两个阶段:首先,一个多模态自回归规划头(AR-Head)整合视频帧和文本提示,通过语义语言模型、有限标量量化(FSQ)和残差

 · 更新于 2026-09-06 · 约 11 分钟 · 5422 字 阅读 →
论文解读

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

本文旨在解决从单向“独白”式虚拟人生成迈向自然“全双工”交互式生成的核心挑战。**核心问题**在于,现有方法要么因严格的帧对齐而反应僵硬,要么因引入全局注意力而破坏唇同步。**关键方法**是提出一个基于多头高斯核(MHGK)的统一注意力架构,该机制通过为不同的注意力头分配从窄到宽的高斯分布感受野,使

 · 更新于 2026-09-06 · 约 11 分钟 · 5110 字 阅读 →
论文解读

Hierarchical Codec Diffusion for Video-to-Speech Generation

本论文针对 Video-to-Speech(VTS)生成中视觉-语音模态信息不对称的问题,提出现有方法忽略了语音从粗粒度语义到细粒度韵律的层次结构,导致视觉条件无法与语音表示精准对齐。为此,作者提出 HiCoDiT(Hierarchical Codec Diffusion Transformer),

 · 更新于 2026-09-06 · 约 12 分钟 · 5676 字 阅读 →
论文解读

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,

 · 更新于 2026-09-06 · 约 11 分钟 · 5095 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 是一个旨在统一理解、推理、生成与行动的全模态大语言模型。它**解决**了现有模型在实时交互、长上下文音视频处理、流式语音生成稳定性以及多语言支持等方面的局限性。**方法上**,它基于Thinker-Talker架构,引入了Hybrid MoE以提升效率,采用显式时间戳替代稀

 · 更新于 2026-09-06 · 约 12 分钟 · 5592 字 阅读 →