论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4244 字 阅读 →
论文解读

β-AVSDNET: A Novel End-To-End Neural Network Architecture For Audio-Visual Speaker Diarization

说话人分离 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5853 字 阅读 →
论文解读

All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4036 字 阅读 →
论文解读

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

跨模态 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4377 字 阅读 →
论文解读

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

音频大模型 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5044 字 阅读 →
论文解读

Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3585 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20102 字 阅读 →
论文解读

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

机器人技能学习 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3742 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-25

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 6 分钟 · 2986 字 阅读 →
论文解读

Materialistic RIR: Material Conditioned Realistic RIR Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5449 字 阅读 →
论文解读

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

语音情感识别 | 6.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5670 字 阅读 →
论文解读

Sema: Semantic Transport for Real-Time Multimodal Agents

实时处理 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4888 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-24

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 59 分钟 · 29279 字 阅读 →
论文解读

ATIR: Towards Audio-Text Interleaved Contextual Retrieval

这篇论文旨在解决现有音频-文本检索方法无法处理查询和文档中音频与文本交错出现(如多轮对话、混合输入)的局限性。为此,作者定义了音频-文本交错上下文检索(ATIR)任务,并构建了一个包含约8.8万对样本的大规模基准。为解决直接应用多模态大语言模型(MLLM)时音频token冗余导致的效率和精度问题,论

 · 更新于 2026-09-25 · 约 9 分钟 · 4361 字 阅读 →
论文解读

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

1. **问题**:当前多模态大模型在音乐符号处理(Omnimodal Notation Processing, ONP)领域存在严重缺陷:研究碎片化、模型存在严重的符号偏差(偏向五线谱)、且普遍依赖不可靠的“LLM-as-a-Judge”评估方法,掩盖了模型在音乐理论推理上的系统性失败。 2.

 · 更新于 2026-09-25 · 约 9 分钟 · 4149 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇论文介绍了Qwen3.5-Omni,一个支持文本、图像、音频和音频-视频输入的全模态大语言模型。为解决现有模型在实时交互、跨模态推理和工具使用上的不足,其核心方法是采用“Thinker-Talker”架构,并引入混合专家(MoE)设计以提升效率。与前代相比,主要创新在于:1)模型规模扩展至数千亿

 · 更新于 2026-09-25 · 约 10 分钟 · 4857 字 阅读 →
论文解读

APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track

这篇论文报告了APRVOS系统,一个专为MEVIS_Audio(音频条件下的指代视频对象分割)任务设计的冠军方案。**要解决的问题**是传统文本指代分割模型无法直接处理包含噪声、不完整且可能描述视频中不存在物体的语音输入。**采用的方法**是一个四阶段流水线:首先使用VibeVoice-ASR将语音

 · 更新于 2026-09-25 · 约 9 分钟 · 4115 字 阅读 →
论文解读

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

这篇论文首次系统研究了良性(无害)音频数据微调对音频大模型安全对齐的破坏作用。**要解决的问题**是:用户出于提升模型性能目的进行的常规微调,是否会无意中破坏模型的安全防护?**方法**上,作者提出了一个基于嵌入空间邻近度的过滤框架,从语义、声学及混合维度,选择性地用与有害内容在表示空间上相近的良性

 · 更新于 2026-09-25 · 约 8 分钟 · 3751 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 44 分钟 · 21691 字 阅读 →
论文解读

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

本文旨在解决多模态大模型在音视频联合推理任务上缺乏高质量训练数据的核心挑战。**核心贡献**是提出了AVRT框架,通过组合单模态专家模型的能力来合成多模态推理数据。**关键方法**分为两步:1)**数据生成**:使用专门的视觉教师(Kimi-VL-Thinking)和音频教师(Audio Flami

 · 更新于 2026-09-25 · 约 13 分钟 · 6166 字 阅读 →