论文解读

Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5297 字 阅读 →
论文解读

VBx for End-to-End Neural and Clustering-Based Diarization

说话人分离 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4816 字 阅读 →
论文解读

VChangeCodec: An Ultra Low-Complexity Neural Speech Codec with Built-In Voice Changer for Customized Real-Time Communication

语音转换 语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5237 字 阅读 →
论文解读

Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4896 字 阅读 →
论文解读

Vib2Sound: Separation Of Multimodal Sound Sources

语音分离 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4522 字 阅读 →
论文解读

Vioptt: Violin Technique-Aware Transcription from Synthetic Data Augmentation

音乐信息检索 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4985 字 阅读 →
论文解读

Virtual Consistency for Audio Editing

音乐生成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4718 字 阅读 →
论文解读

Visual Keys to Symphonies: Latent Diffusion for Multi-Scene Video-to-Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5068 字 阅读 →
论文解读

ViTex: Visual Texture Control for Multi-Track Symbolic Music Generation via Discrete Diffusion Models

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3841 字 阅读 →
论文解读

VividTalker: A Modular Framework for Expressive 3D Talking Avatars with Controllable Gaze and Blink

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5244 字 阅读 →
论文解读

VM-UNSSOR: Unsupervised Neural Speech Separation Enhanced by Higher-SNR Virtual Microphone Arrays

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4787 字 阅读 →
论文解读

VMSP: Video-to-Music Generation with Two-Stage Alignment and Synthesis

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4643 字 阅读 →
论文解读

Vocalnet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction

语音对话系统 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3960 字 阅读 →
论文解读

Voting-Based Pitch Estimation with Temporal and Frequential Alignment and Correlation Aware Selection

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5178 字 阅读 →
论文解读

VoxMorph: Scalable Zero-Shot Voice Identity Morphing via Disentangled Embeddings

语音克隆 | 9.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5242 字 阅读 →
论文解读

VoXtream: Full-Stream Text-To-Speech With Extremely Low Latency

语音合成 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6227 字 阅读 →
论文解读

VT-Heads: Voice Cloning and Talking Head Generation from Text Based on V-DiT

视频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3563 字 阅读 →
论文解读

WAV2LEV: Predicting Levenshtein Edit Operation Sequences For Fine-Grained Estimation of Automatic Speech Recognition Error

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Wave-Trainer-Fit: Neural Vocoder With Trainable Prior And Fixed-Point Iteration Towards High-Quality Speech Generation From SSL Features

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5135 字 阅读 →
论文解读

Wavenext 2: Convnext-Based Fast Neural Vocoders with Residual Denoising and Sub-Modeling for Gan And Diffusion Models

语音合成 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4717 字 阅读 →