论文解读

Numerical and perceptual validity of synthetic Head-Related Transfer Functions at scale

声源定位 | 7.6/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8223 字 阅读 →
论文解读

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

音频编码 | 6.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6157 字 阅读 →
论文解读

Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

音频分类 | 7.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7842 字 阅读 →
论文解读

Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement

音视频语音分离 | 6.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5443 字 阅读 →
论文解读

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

音视频生成 | 6.8/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8158 字 阅读 →
论文解读

Sonifying I2S Transport Signals to Detect Transmission Faults

音频分类 | 5.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6274 字 阅读 →
论文解读

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

语音编码 | 6.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6303 字 阅读 →
论文解读

The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7035 字 阅读 →
论文解读

Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis

语音识别 | 5.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6794 字 阅读 →
论文解读

Using the Mimi codec for metalinguistic representations

语音编码 | 4.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5440 字 阅读 →
论文解读

What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models

音乐理解 | 7.7/10

 · 更新于 2026-09-06 · 约 16 分钟 · 8007 字 阅读 →
论文解读

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

音视频生成 | 6.2/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8252 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 129 分钟 · 64264 字 阅读 →
论文解读

Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels

音频事件检测 | 6.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5205 字 阅读 →
论文解读

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

音频生成 | 6.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6421 字 阅读 →
论文解读

Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP

音乐生成 | 5.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6931 字 阅读 →
论文解读

AT-ADD: All-Type Audio Deepfake Detection Challenge Summary

音频伪造检测 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7256 字 阅读 →
论文解读

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

音视频生成 | 6.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7021 字 阅读 →
论文解读

Exploring ESC Winners with Nested Diagrams

音乐理解 | 5.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5779 字 阅读 →
论文解读

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

音乐理解 | 7.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6497 字 阅读 →