论文解读

ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

语音编码 | 7.7/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9038 字 阅读 →
论文解读

SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

音视频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 25 分钟 · 12060 字 阅读 →
论文解读

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

音视频理解 | 7.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7118 字 阅读 →
论文解读

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

音频生成 | 7.6/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9341 字 阅读 →
论文解读

Speaker Role and Language Diarization for Analyzing Multilingual Interviews for Language Proficiency of Older Adults

说话人日志 | 6.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6762 字 阅读 →
论文解读

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

语音识别 | 7.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8512 字 阅读 →
论文解读

Steering dense music retrieval with open-vocabulary concept discovery

音乐检索 | 7.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6289 字 阅读 →
论文解读

Structured Phonological Representations for Audio-Articulatory rtMRI Speech Classification

语音属性识别 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6013 字 阅读 →
论文解读

The Voiceprint Fallacy: Why Voices Are Not Unique Biometric Imprints

说话人验证 | 6.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6330 字 阅读 →
论文解读

VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

音乐生成 | 7.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7116 字 阅读 →
论文解读

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

音频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6697 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-11

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 114 分钟 · 56810 字 阅读 →
论文解读

Assessing AI-generated music detection in real-world broadcast monitoring

音频伪造检测 | 6.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6180 字 阅读 →
论文解读

Beyond Call and Response: Modelling Reciprocal Coordination in Human-AI Vocal Ensembles

歌唱生成 | 5.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5433 字 阅读 →
论文解读

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

语音增强 | 6.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5920 字 阅读 →
论文解读

Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

语音情感识别 | 6.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6811 字 阅读 →
论文解读

Frame-Level Pansori Mode Classification with Complementary Audio Representations

音乐理解 | 7.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6284 字 阅读 →
论文解读

From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music

音乐理解 | 5.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7605 字 阅读 →
论文解读

How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures

音频伪造检测 | 8.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6888 字 阅读 →
论文解读

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

语音识别 | 6.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7355 字 阅读 →