论文解读

SCOPE: Entanglement Frontier Escape for Source-Free Class Unlearning

说话人验证 | 6.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6134 字 阅读 →
论文解读

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

音乐转录 | 6.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5561 字 阅读 →
论文解读

SGAD: A State-Guided Adaptive Decision Framework for Robust EEG-Based Auditory Attention Switch Decoding

Transformer | 6.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6385 字 阅读 →
论文解读

SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces

语音识别 | 8.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5919 字 阅读 →
论文解读

Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art

RNN | 5.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5389 字 阅读 →
论文解读

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

音频生成 | 7.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7166 字 阅读 →
论文解读

The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders

语音属性识别 | 7.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6369 字 阅读 →
论文解读

The Role of Disfluencies in Speech Translation

语音翻译 | 6.4/10

 · 更新于 2026-09-06 · 约 22 分钟 · 10618 字 阅读 →
论文解读

Uncertainty-Aware Crossmodal Fusion for Classification of Animal Behavior

音频分类 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7297 字 阅读 →
论文解读

UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations

音乐理解 | 5.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7767 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-04

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 114 分钟 · 56637 字 阅读 →
论文解读

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

音频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7773 字 阅读 →
论文解读

Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil

语音伪造检测 | 7.7/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7303 字 阅读 →
论文解读

Do Music Foundation Models Embed Pitch in Helical Structure?

音乐理解 | 8.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6831 字 阅读 →
论文解读

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

音视频语音识别 | 7.4/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9385 字 阅读 →
论文解读

Exploring Efficient Waveform Diffusion Models for Foley Sound Generation

音频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6173 字 阅读 →
论文解读

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

音视频理解 | 7.9/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7441 字 阅读 →
论文解读

Learning to Predict Performance-induced Emotion Differences in Classical Piano Music

数据集 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5773 字 阅读 →
论文解读

Leveraging Beam Search Information for Confidence Estimation in E2E ASR

语音识别 | 6.3/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7632 字 阅读 →
论文解读

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

语音交互 | 6.1/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5540 字 阅读 →