论文解读

Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

语音交互 | 6.7/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7653 字 阅读 →
论文解读

V-LynX: Token Interface Alignment for Video+X LLMs

音视频问答 | 7.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5123 字 阅读 →
论文解读

VIBE: Disentangling Social Dynamics via Kinematics-Informed Variational Inference for Behavioral Emotion

VIBE: Disentangling Social Dynamics via Kinematics-Informed Variational Inference for Behavioral Emotion

 · 更新于 2026-09-06 · 约 14 分钟 · 6801 字 阅读 →
论文解读

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

音视频问答 | 7.3/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9623 字 阅读 →
论文解读

VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio

音频检索 | 8.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6711 字 阅读 →
论文解读

WaveSSM: Multiscale State-Space Models for Non-stationary Signal Attention

音频分类 | 4.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5772 字 阅读 →
论文解读

Zero-Shot Rankability: Revealing Latent Ordinal Structure in Multimodal Large Language Models via Language

音视频理解 | 6.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6730 字 阅读 →
论文解读

A global predicted-fMRI drive signal from TRIBE does not predict YouTube replay heatmaps

音视频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7749 字 阅读 →
论文解读

A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification

音频分类 | 4.9/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7182 字 阅读 →
论文解读

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation

语音合成 | 6.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6302 字 阅读 →
论文解读

Audio-Based Understanding of Audiobook Narration Appeal

语音属性识别 | 6.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6486 字 阅读 →
论文解读

Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR

语音识别 | 6.4/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8399 字 阅读 →
论文解读

CNN Models for Microphone Array Covariance Matrix Upsampling and Acoustic Imaging

声源定位 | 5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5193 字 阅读 →
论文解读

Cross Domain Few-Shot Class-Incremental Audio Classification Via Adversarial Contrastive Learning

音频分类 | 7.4/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5131 字 阅读 →
论文解读

Decomposer: Learning to Decompile Symbolic Music to Programs

音乐理解 | 8.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5948 字 阅读 →
论文解读

DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning

音频分类 | 4.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8158 字 阅读 →
论文解读

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

语音交互 | 7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5177 字 阅读 →
论文解读

Few-Shot Open-Set Audio Classification Using Attention Information-Fused Prototypes

音频分类 | 6.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9043 字 阅读 →
论文解读

From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages

语音识别 | 4.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6918 字 阅读 →
论文解读

H-SAGE: Holistic Speaker-Aware Guided Experts for MoE-based Multi-Talker ASR

语音识别 | 6.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5995 字 阅读 →