论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

本文提出**FLiP**,一种**因子化线性投影模型**,旨在**理解并解释**多语言、多模态句子嵌入空间(如SONAR, LaBSE, Gemini)。核心思想是将嵌入空间的解释转化为一个**线性关键词提取任务**:通过一个简单的线性投影,从句子嵌入向量中恢复出构成该句子的词汇。实验表明,训练良好

 · 更新于 2026-09-25 · 约 8 分钟 · 3724 字 阅读 →
论文解读

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

本文旨在解决训练共情语音聊天机器人时面临的**共情语音数据稀缺、模型泛化能力弱、以及微调导致LLM通用能力退化**三大难题。作者提出了**FreezeEmpath**,一种高效的端到端训练框架。其核心方法是**冻结基础LLM**,采用**语义-情感解耦编码策略**,通过独立的语义适配器和情感提取器从

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

这篇论文旨在解决当前音频-文本检索模型在**真实、多样化用户查询**下性能下降的问题。作者指出,现有基准测试(如AudioCaps, Clotho)依赖描述性标题式查询,与真实世界中简短、多变的搜索行为(如问题、命令、关键词、排除性查询)存在巨大差距。为此,论文提出了两大核心贡献:1) **Omni

 · 更新于 2026-09-25 · 约 9 分钟 · 4160 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

本文针对现有视频到音乐(V2M)生成模型缺乏对创作者风格、主题等细粒度意图控制的问题,提出了Video-Robin,一个结合文本提示的视频配乐框架。其核心方法是将生成过程解耦为两个阶段:首先,一个多模态自回归规划头(AR-Head)整合视频帧和文本提示,通过语义语言模型、有限标量量化(FSQ)和残差

 · 更新于 2026-09-25 · 约 11 分钟 · 5422 字 阅读 →
论文解读

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

本文旨在解决从单向“独白”式虚拟人生成迈向自然“全双工”交互式生成的核心挑战。**核心问题**在于,现有方法要么因严格的帧对齐而反应僵硬,要么因引入全局注意力而破坏唇同步。**关键方法**是提出一个基于多头高斯核(MHGK)的统一注意力架构,该机制通过为不同的注意力头分配从窄到宽的高斯分布感受野,使

 · 更新于 2026-09-25 · 约 11 分钟 · 5110 字 阅读 →
论文解读

Hierarchical Codec Diffusion for Video-to-Speech Generation

本论文针对 Video-to-Speech(VTS)生成中视觉-语音模态信息不对称的问题,提出现有方法忽略了语音从粗粒度语义到细粒度韵律的层次结构,导致视觉条件无法与语音表示精准对齐。为此,作者提出 HiCoDiT(Hierarchical Codec Diffusion Transformer),

 · 更新于 2026-09-25 · 约 12 分钟 · 5676 字 阅读 →
论文解读

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,

 · 更新于 2026-09-25 · 约 11 分钟 · 5095 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 是一个旨在统一理解、推理、生成与行动的全模态大语言模型。它**解决**了现有模型在实时交互、长上下文音视频处理、流式语音生成稳定性以及多语言支持等方面的局限性。**方法上**,它基于Thinker-Talker架构,引入了Hybrid MoE以提升效率,采用显式时间戳替代稀

 · 更新于 2026-09-25 · 约 12 分钟 · 5592 字 阅读 →
论文解读

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

本论文针对音频-视觉导航(AVN)中目标空间意图模糊、视觉特征缺乏听觉条件引导两大问题,提出了 Spatial-Aware Conditioned Fusion(SACF)框架。该框架首先设计了 Spatially Discretized Localization Descriptor(SDLD),

 · 更新于 2026-09-25 · 约 10 分钟 · 4579 字 阅读 →
论文解读

The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction

本研究探讨了在企业财报电话会议中,副语言声学特征(音高、抖动、停顿等)对预测灾难性股价下跌的效用。作者基于MAEC数据集,提取了两种模态的特征:文本端使用FinBERT计算脚本化开场白与即兴Q&A之间的情感极性差异(Sentiment Delta),音频端提取临床语音压力标记的方差特征(音高方差、抖

 · 更新于 2026-09-25 · 约 12 分钟 · 5556 字 阅读 →
论文解读

TinyMU: A Compact Audio-Language Model for Music Understanding

本文针对现有大型音频语言模型(LALM)参数庞大(数十亿级)、训练推理成本高、难以部署在边缘设备的问题,提出了 TinyMU——一个仅有 229M 参数的紧凑音乐语言模型。为此,作者构建了 MusicSkills-3.5M 数据集,包含 350 万个涵盖多选、二元判断和开放式格式的音乐问答样本,结合

 · 更新于 2026-09-25 · 约 9 分钟 · 4133 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-20

共分析 24 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 50 分钟 · 24566 字 阅读 →
论文解读

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务上能力不足且依赖昂贵闭源数据的问题。作者提出了一个名为**Audio-Cogito**的全开源解决方案,其核心是**Cogito-Pip

 · 更新于 2026-09-25 · 约 10 分钟 · 4834 字 阅读 →
论文解读

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

这篇论文旨在解决当前全模态大模型在音视频不一致性理解能力上缺乏系统性评估的问题。现有基准要么只关注音视频对齐事件,要么局限于检测深度伪造中的低级伪影,无法评估模型对长视频中语义级矛盾的理解。为此,作者

 · 更新于 2026-09-25 · 约 12 分钟 · 5790 字 阅读 →
论文解读

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

本文提出了ControlFoley,一个统一且可控的视频到音频生成框架,旨在解决现有方法在跨模态冲突下文本控制力弱、以及参考音频控制中音色与时间信息纠缠的问题。其核心贡献包括:1)提出联合视觉编码范式

 · 更新于 2026-09-25 · 约 13 分钟 · 6198 字 阅读 →
论文解读

Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery

这篇论文提出了一个名为 **Geo2Sound** 的新任务和框架,旨在从卫星图像生成地理上一致且逼真的声音景观。**要解决的问题**是现有图像到音频模型在处理自上而下的卫星视图时面临三大挑战:缺乏结

 · 更新于 2026-09-25 · 约 13 分钟 · 6095 字 阅读 →
论文解读

Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection

这篇论文揭示了针对音频大语言模型(LALM)的一种新型安全威胁:**上下文无关且不可感知的音频提示注入攻击**。攻击者仅需篡改输入音频数据(如会议录音、音乐片段),即可在用户不知情的情况下,劫持模型行

 · 更新于 2026-09-25 · 约 14 分钟 · 6905 字 阅读 →
论文解读

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

本文针对现有音视频(AV)生成模型中存在的运动不真实、声音与运动事件不同步、声音强度与运动强度不匹配等问题,提出了Tora3框架。其核心创新在于**将物体轨迹视为连接视觉与听觉模态的共享运动学先验**

 · 更新于 2026-09-25 · 约 12 分钟 · 5774 字 阅读 →
论文解读

WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

这篇论文旨在解决端到端语音对话模型在智能(IQ)和表达力(EQ)上难以同时提升的核心挑战。作者发现,直接对混合文本-语音序列应用统一的偏好优化(如DPO、GRPO)会导致问题:稀疏的偏好信号被淹没在密

 · 更新于 2026-09-25 · 约 11 分钟 · 5245 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-19

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 94 分钟 · 46668 字 阅读 →