论文解读

Spatial-CLAP: Learning Spatially-Aware Audio–Text Embeddings for Multi-Source Conditions

空间音频 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4905 字 阅读 →
论文解读

StereoFoley: Object-Aware Stereo Audio Generation from Video

音频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3564 字 阅读 →
论文解读

TextlessRAG: End-to-End Visual Document RAG by Speech without Text

语音问答 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4218 字 阅读 →
论文解读

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3637 字 阅读 →
论文解读

Towards Multi-View Hierarchical Video-to-Piano Generation with MIDI Guidance

音乐生成 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4459 字 阅读 →
论文解读

UVT-LM: Unifying Visual and Tactile Perception with Language Model

跨模态 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4823 字 阅读 →
论文解读

Visual Keys to Symphonies: Latent Diffusion for Multi-Scene Video-to-Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5068 字 阅读 →
论文解读

VMSP: Video-to-Music Generation with Two-Stage Alignment and Synthesis

音乐生成 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4643 字 阅读 →
论文解读

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4322 字 阅读 →
论文解读

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

跨模态 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4377 字 阅读 →
论文解读

Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4499 字 阅读 →
论文解读

Sema: Semantic Transport for Real-Time Multimodal Agents

实时处理 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4888 字 阅读 →
论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

这篇论文旨在解决对多语言、多模态句子嵌入(如SONAR, LaBSE)的可解释性问题。核心方法是提出一种称为因子化线性投影(FLiP)的模型,通过将嵌入向量线性投影到词汇表空间来提取关键词,以此作为理解嵌入内容的代理任务。与之前非因子化的线性探测方法(如LiP)和SpLiCE相比,FLiP在关键词提

 · 更新于 2026-09-24 · 约 8 分钟 · 4001 字 阅读 →
论文解读

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

1. **问题**:当前多模态大模型在音乐符号处理(Omnimodal Notation Processing, ONP)领域存在严重缺陷:研究碎片化、模型存在严重的符号偏差(偏向五线谱)、且普遍依赖不可靠的“LLM-as-a-Judge”评估方法,掩盖了模型在音乐理论推理上的系统性失败。 2.

 · 更新于 2026-09-24 · 约 9 分钟 · 4149 字 阅读 →
论文解读

Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features

这篇论文旨在为无声言语接口(SSI)选择更优的中间表示目标。研究系统比较了发音特征(SPARC)和传统的音素独热编码,在预测表面肌电(sEMG)信号包络上的表现。核心发现是:1)在出声、默语和次发声三种模式下,SPARC特征的编码准确性均显著优于音素特征;2)出声和默语模式的编码性能相当,次发声模式

 · 更新于 2026-09-24 · 约 8 分钟 · 3920 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

这篇论文旨在解决大语言模型在歌词到旋律生成任务中,通过监督微调(SFT)训练出的模型常产生音乐上不可行(如节奏怪异、音域超限)的“约束违反”问题。**核心贡献**是提出了一套无需人工标注、基于规则约束的自动化对齐框架。**关键方法**分为三步:首先对预训练LLM进行SFT以获得基础生成能力;其次,利

 · 更新于 2026-09-24 · 约 10 分钟 · 4941 字 阅读 →
论文解读

Hierarchical Codec Diffusion for Video-to-Speech Generation

本论文针对 Video-to-Speech(VTS)生成中视觉-语音模态信息不对称的问题,提出现有方法忽略了语音从粗粒度语义到细粒度韵律的层次结构,导致视觉条件无法与语音表示精准对齐。为此,作者提出 HiCoDiT(Hierarchical Codec Diffusion Transformer),

 · 更新于 2026-09-24 · 约 12 分钟 · 5676 字 阅读 →
论文解读

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,

 · 更新于 2026-09-24 · 约 11 分钟 · 5095 字 阅读 →
论文解读

The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction

本研究探讨了在企业财报电话会议中,副语言声学特征(音高、抖动、停顿等)对预测灾难性股价下跌的效用。作者基于MAEC数据集,提取了两种模态的特征:文本端使用FinBERT计算脚本化开场白与即兴Q&A之间的情感极性差异(Sentiment Delta),音频端提取临床语音压力标记的方差特征(音高方差、抖

 · 更新于 2026-09-24 · 约 12 分钟 · 5556 字 阅读 →