论文解读

A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

音乐生成 | 6.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5326 字 阅读 →
论文解读

Adaptive Perturbation Selection for Contrastive Audio Decoding

音频理解 | 5.3/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11109 字 阅读 →
论文解读

AmbiDrop: Ambisonics-Based Array-Agnostic Neural Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7486 字 阅读 →
论文解读

Automatic Detection of Stress from Speech in the Trier Social Stress Test

语音情感识别 | 7.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7439 字 阅读 →
论文解读

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

音视频理解 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5320 字 阅读 →
论文解读

Disentangling Speaker and Language Effects in Cross-Lingual Speaker Verification for Iberian Languages

说话人验证 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5518 字 阅读 →
论文解读

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

语音属性识别 | 6.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7248 字 阅读 →
论文解读

Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis

语音合成 | 7.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5062 字 阅读 →
论文解读

Evaluating Pretrained Music Embeddings for Cross-Performance Jazz Standard Recognition

音乐检索 | 5.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5189 字 阅读 →
论文解读

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

音频理解 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5115 字 阅读 →
论文解读

MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization

MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization

 · 更新于 2026-09-06 · 约 14 分钟 · 6684 字 阅读 →
论文解读

NPUsper: Eliminating Redundant Computation for Real-Time Whisper on Mobile NPUs

语音识别 | 9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7898 字 阅读 →
论文解读

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

音频理解 | 7.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8254 字 阅读 →
论文解读

Positive-Incentive Noise Predictor for Adversarial Purification in Speaker Verification

说话人验证 | 7.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7906 字 阅读 →
论文解读

Speech Playground: An Interactive Tool for Speech Analysis and Comparison

Speech Playground: An Interactive Tool for Speech Analysis and Comparison

 · 更新于 2026-09-06 · 约 10 分钟 · 4998 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 49 分钟 · 24050 字 阅读 →
论文解读

A Fair and Transparent Framework for Speech-Based Depression Detection: Balancing Interpretability and Performance

语音情感识别 | 7.4/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8609 字 阅读 →
论文解读

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

生成模型 | 7.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8817 字 阅读 →
论文解读

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5802 字 阅读 →
论文解读

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

音频检索 | 7.4/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5356 字 阅读 →