论文解读

Etude: Piano Cover Generation with a Three-Stage Approach — Extract, Structuralize, and Decode

音乐生成 | 7.0/10

 · 更新于 2026-09-15 · 约 10 分钟 · 4983 字 阅读 →
论文解读

EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding

音频生成 | 8.0/10

 · 更新于 2026-09-15 · 约 11 分钟 · 5305 字 阅读 →
论文解读

Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations

模型评估 | 7.0/10

 · 更新于 2026-09-15 · 约 8 分钟 · 3876 字 阅读 →
论文解读

Evaluating Compositional Structure in Audio Representations

模型评估 | 7.0/10

 · 更新于 2026-09-15 · 约 9 分钟 · 4315 字 阅读 →
论文解读

Evaluating Disentangled Representations for Controllable Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-15 · 约 8 分钟 · 4005 字 阅读 →
论文解读

Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech

语音情感识别 | 7.5/10

 · 更新于 2026-09-15 · 约 7 分钟 · 3322 字 阅读 →
论文解读

Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics

音乐信息检索 | 8.0/10

 · 更新于 2026-09-15 · 约 9 分钟 · 4473 字 阅读 →
论文解读

Evaluating Pretrained Speech Embedding Systems for Dysarthria Detection Across Heterogenous Datasets

语音生物标志物 | 7.5/10

 · 更新于 2026-09-15 · 约 8 分钟 · 3927 字 阅读 →
论文解读

Event Classification by Physics-Informed Inpainting for Distributed Multichannel Acoustic Sensor with Partially Degraded Channels

音频事件检测 | 8.0/10

 · 更新于 2026-09-15 · 约 7 分钟 · 3506 字 阅读 →
论文解读

Exploring Fine-Tuning Of Large Audio Language Models For Spoken Language Understanding Under Limited Speech Data

语音理解 | 8.0/10

 · 更新于 2026-09-15 · 约 8 分钟 · 3549 字 阅读 →
论文解读

Exploring How Audio Effects Alter Emotion with Foundation Models

音乐理解 | 7.0/10

 · 更新于 2026-09-15 · 约 9 分钟 · 4321 字 阅读 →
论文解读

Exploring Resolution-Wise Shared Attention in Hybrid Mamba-U-Nets for Improved Cross-Corpus Speech Enhancement

语音增强 | 8.0/10

 · 更新于 2026-09-15 · 约 11 分钟 · 5267 字 阅读 →
论文解读

Exploring SSL Discrete Tokens for Multilingual Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-15 · 约 11 分钟 · 5356 字 阅读 →
论文解读

Expressive Voice Conversion with Controllable Emotional Intensity

语音转换 | 7.5/10

 · 更新于 2026-09-15 · 约 12 分钟 · 5587 字 阅读 →
论文解读

Exterior Sound Field Estimation Based on Physics-Constrained Kernel

空间音频 | 6.5/10

 · 更新于 2026-09-15 · 约 9 分钟 · 4065 字 阅读 →
论文解读

FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec

语音转换 | 8.0/10

 · 更新于 2026-09-15 · 约 9 分钟 · 4319 字 阅读 →
论文解读

Face-Voice Association with Inductive Bias for Maximum Class Separation

说话人验证 | 7.0/10

 · 更新于 2026-09-15 · 约 10 分钟 · 4756 字 阅读 →
论文解读

Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform

语音伪造检测 | 7.0/10

 · 更新于 2026-09-15 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Fast-ULCNet: A Fast and Ultra Low Complexity Network for Single-Channel Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-15 · 约 8 分钟 · 3534 字 阅读 →
论文解读

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

音频问答 | 7.0/10

 · 更新于 2026-09-15 · 约 9 分钟 · 4320 字 阅读 →