论文解读

Unified Audio Intelligence Without Regressing on Text Intelligence

音频交互 | 6.8/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3294 字 阅读 →
论文解读

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

音视频理解 | 4.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6505 字 阅读 →
论文解读

Wan-Streamer v0.2: Higher Resolution, Same Latency

音视频交互 | 5.4/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5455 字 阅读 →
论文解读

Weakly Guided and Autoregressive Beamformer Parameterization for Generalizable Moving Speaker Extraction in Higher-Order Ambisonics

语音分离 | 4.3/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4977 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-07

共分析 58 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 176 分钟 · 87928 字 阅读 →
论文解读

VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval

音视频交互 | 6.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6871 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-06

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 3 分钟 · 1340 字 阅读 →
论文解读

A global predicted-fMRI drive signal from TRIBE does not predict YouTube replay heatmaps

音视频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7749 字 阅读 →
论文解读

A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification

音频分类 | 4.9/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7182 字 阅读 →
论文解读

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation

语音合成 | 6.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6302 字 阅读 →
论文解读

Audio-Based Understanding of Audiobook Narration Appeal

语音属性识别 | 6.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6486 字 阅读 →
论文解读

Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR

语音识别 | 6.4/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8399 字 阅读 →
论文解读

CNN Models for Microphone Array Covariance Matrix Upsampling and Acoustic Imaging

声源定位 | 5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5193 字 阅读 →
论文解读

Cross Domain Few-Shot Class-Incremental Audio Classification Via Adversarial Contrastive Learning

音频分类 | 7.4/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5131 字 阅读 →
论文解读

Decomposer: Learning to Decompile Symbolic Music to Programs

音乐理解 | 8.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5948 字 阅读 →
论文解读

DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning

音频分类 | 4.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8158 字 阅读 →
论文解读

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

语音交互 | 7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5177 字 阅读 →
论文解读

Few-Shot Open-Set Audio Classification Using Attention Information-Fused Prototypes

音频分类 | 6.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9043 字 阅读 →
论文解读

From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages

语音识别 | 4.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6918 字 阅读 →
论文解读

H-SAGE: Holistic Speaker-Aware Guided Experts for MoE-based Multi-Talker ASR

语音识别 | 6.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5995 字 阅读 →