论文解读

Hidden-Domain Routing for All-Type Audio Deepfake Detection

领域适应 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6135 字 阅读 →
论文解读

Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8227 字 阅读 →
论文解读

JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5563 字 阅读 →
论文解读

P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

音频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5961 字 阅读 →
论文解读

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

说话人验证 | 6.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5438 字 阅读 →
论文解读

REIMU: Efficient Heterogeneous Hierarchical Reasoning for SSL-Based Speech Deepfake Detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5558 字 阅读 →
论文解读

SCOPE: Entanglement Frontier Escape for Source-Free Class Unlearning

说话人验证 | 6.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6134 字 阅读 →
论文解读

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

音乐转录 | 6.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5561 字 阅读 →
论文解读

SGAD: A State-Guided Adaptive Decision Framework for Robust EEG-Based Auditory Attention Switch Decoding

Transformer | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6385 字 阅读 →
论文解读

Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art

RNN | 5.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5389 字 阅读 →
论文解读

The Role of Disfluencies in Speech Translation

语音翻译 | 6.4/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10618 字 阅读 →
论文解读

Uncertainty-Aware Crossmodal Fusion for Classification of Animal Behavior

音频分类 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7297 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-04

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 114 分钟 · 56637 字 阅读 →
论文解读

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

音频理解 | 7.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7773 字 阅读 →
论文解读

Do Music Foundation Models Embed Pitch in Helical Structure?

音乐理解 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6831 字 阅读 →
论文解读

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

音视频语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9385 字 阅读 →
论文解读

Exploring Efficient Waveform Diffusion Models for Foley Sound Generation

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6173 字 阅读 →
论文解读

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

音视频理解 | 7.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7441 字 阅读 →
论文解读

Learning to Predict Performance-induced Emotion Differences in Classical Piano Music

数据集 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5773 字 阅读 →
论文解读

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

语音交互 | 6.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5540 字 阅读 →