论文解读

CosyAccent: Duration-Controllable Accent Normalization using Source-Synthesis Training Data

语音转换 | 7.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5037 字 阅读 →
论文解读

CTC-DID: CTC-Based Arabic Dialect Identification for Streaming Applications

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4764 字 阅读 →
论文解读

Diff-vs: Efficient Audio-Aware Diffusion U-Net for Vocals Separation

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Direct Simultaneous Translation Activation for Large Audio-Language Models

语音翻译 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4476 字 阅读 →
论文解读

Disentangling Physiology from Fidelity: Latent-Guided Diffusion Models for Cross-Modal Cardiac Synthesis

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5351 字 阅读 →
论文解读

Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch

音乐源分离 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4275 字 阅读 →
论文解读

DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment

歌唱语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4870 字 阅读 →
论文解读

Efficient Depression Detection from Speech via Language-Independent Prompt-Driven Reprogramming

语音生物标志物 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4393 字 阅读 →
论文解读

EMG-to-Speech with Fewer Channels

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4171 字 阅读 →
论文解读

Empowering Multimodal Respiratory Sound Classification with Counterfactual Adversarial Debiasing for Out-of-Distribution Robustness

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4255 字 阅读 →
论文解读

Enhancing Dialogue-Related Speech Tasks with Generated Spoken Dialogues

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4549 字 阅读 →
论文解读

Enhancing Noise Robustness for Neural Speech Codecs Through Resource-Efficient Progressive Quantization Perturbation Simulation

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4043 字 阅读 →
论文解读

Expressive Voice Conversion with Controllable Emotional Intensity

语音转换 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5587 字 阅读 →
论文解读

Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4224 字 阅读 →
论文解读

FDCNet: Frequency Domain Channel Attention and Convolution for Lipreading

视觉语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4228 字 阅读 →
论文解读

Fine-Tuning Bigvgan-V2 for Robust Musical Tuning Preservation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3887 字 阅读 →
论文解读

Generating Moving 3d Soundscapes with Latent Diffusion Models

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4816 字 阅读 →
论文解读

Improving Audio Event Recognition with Consistency Regularization

音频事件检测 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4143 字 阅读 →
论文解读

Improving Binaural Distance Estimation in Reverberant Rooms Through Contrastive And Multi-Task Learning

声源定位 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4718 字 阅读 →
论文解读

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word level timestamp predictions

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4573 字 阅读 →