论文解读

Improving the performance of an ASV system using hybrid speech features

说话人验证 | 5.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6562 字 阅读 →
论文解读

Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?

语音交互 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6484 字 阅读 →
论文解读

Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness

音频水印 | 6.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7234 字 阅读 →
论文解读

SCoPE: Shift-Aware Speaker-Conditioned Priors for Emotion Recognition in Conversations

语音情感识别 | 6.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7064 字 阅读 →
论文解读

TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation

语音分离 | 6.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5695 字 阅读 →
论文解读

Toward Interpretable Speech Deepfake Detection using Artifact-Specific Experts and Calibrated Detection Scores

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8363 字 阅读 →
论文解读

Word meaning co-determines vowel-inherent spectral change. A corpus-based investigation of conversational Mandarin

语音属性识别 | 5.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7278 字 阅读 →
论文解读

X^3-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

音频理解 | 7.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8383 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-24

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28385 字 阅读 →
论文解读

A Diagnostic Evaluation Framework for AI-Generated Cover Songs Using Music-Theoretic and Acoustic Features

音频质量评估 | 8.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7289 字 阅读 →
论文解读

Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

音频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7635 字 阅读 →
论文解读

Black-Box Optimization for Identifying and Inverting Audio Dynamic Range Control Effects

音频理解 | 4.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7076 字 阅读 →
论文解读

Cross-Subject Semantic Decoding with Shared-Space Alignment for Generalized Neural Representation Learning

语音交互 | 6.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6689 字 阅读 →
论文解读

Improved Monitoring of Honey bee Colony Strength via Audio IoT Sensors, Modulation Tensorgrams and Recurrent Neural Networks

音频事件检测 | 6.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9763 字 阅读 →
论文解读

Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R

音频理解 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8024 字 阅读 →
论文解读

Learning the Arabic Dialect Continuum as a Continuous Space: A Regression Approach to Speaker Origin Prediction

Transformer | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8084 字 阅读 →
论文解读

Multimodal Speaker Verification as a Threat to Speaker Anonymization

说话人验证 | 9.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7725 字 阅读 →
论文解读

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

音视频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10082 字 阅读 →
论文解读

RIME: Enabling Large-Scale Agentic Post-Production

大语言模型 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6524 字 阅读 →
论文解读

RPPNet: Perceptually-Grouped Rhythm-Pitch Primitives for Long-Term Structure Melody Generation via Boundary-Aware Modeling

音乐生成 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5701 字 阅读 →