论文解读

Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4068 字 阅读 →
论文解读

Equipping Large Language Model with Directional Speech Understanding Capabilities

语音识别 语音翻译 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4467 字 阅读 →
论文解读

Erasing Your Voice Before it’s Heard: Training-Free Speaker Unlearning for Zero-Shot Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5260 字 阅读 →
论文解读

Estimating Hand-Related Features from Speech Using Machine Learning

语音生物标志物 | 5.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3195 字 阅读 →
论文解读

Estimating Respiratory Effort from Nocturnal Breathing Sounds for Obstructive Sleep Apnoea Screening

音频分类 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3681 字 阅读 →
论文解读

Etude: Piano Cover Generation with a Three-Stage Approach — Extract, Structuralize, and Decode

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4983 字 阅读 →
论文解读

EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5305 字 阅读 →
论文解读

Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations

模型评估 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3876 字 阅读 →
论文解读

Evaluating Compositional Structure in Audio Representations

模型评估 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4315 字 阅读 →
论文解读

Evaluating Disentangled Representations for Controllable Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 4005 字 阅读 →
论文解读

Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3322 字 阅读 →
论文解读

Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4473 字 阅读 →
论文解读

Evaluating Pretrained Speech Embedding Systems for Dysarthria Detection Across Heterogenous Datasets

语音生物标志物 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3927 字 阅读 →
论文解读

Event Classification by Physics-Informed Inpainting for Distributed Multichannel Acoustic Sensor with Partially Degraded Channels

音频事件检测 | 8.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3506 字 阅读 →
论文解读

Exploring Fine-Tuning Of Large Audio Language Models For Spoken Language Understanding Under Limited Speech Data

语音理解 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3549 字 阅读 →
论文解读

Exploring How Audio Effects Alter Emotion with Foundation Models

音乐理解 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4321 字 阅读 →
论文解读

Exploring Resolution-Wise Shared Attention in Hybrid Mamba-U-Nets for Improved Cross-Corpus Speech Enhancement

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5267 字 阅读 →
论文解读

Exploring SSL Discrete Tokens for Multilingual Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5356 字 阅读 →
论文解读

Expressive Voice Conversion with Controllable Emotional Intensity

语音转换 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5587 字 阅读 →
论文解读

Exterior Sound Field Estimation Based on Physics-Constrained Kernel

空间音频 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4065 字 阅读 →