论文解读

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4265 字 阅读 →
论文解读

Qastanet: A DNN-Based Quality Metric for Spatial Audio

空间音频 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4668 字 阅读 →
论文解读

QE-XVC: Zero-Shot Cross-Lingual Voice Conversion via Query-Enhancement and Conditional Flow Matching

语音转换 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4561 字 阅读 →
论文解读

QFOCUS: Controllable Synthesis for Automated Speech Stress Editing to Deliver Human-Like Emphatic Intent

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1766 字 阅读 →
论文解读

Quality Assessment of Noisy and Enhanced Speech with Limited Data: UWB-NTIS System for Voicemos 2024

语音质量评估 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5174 字 阅读 →
论文解读

Quantifying Speaker Embedding Phonological Rule Interactions in Accented Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4134 字 阅读 →
论文解读

Random Matrix-Driven Graph Representation Learning For Bioacoustic Recognition

生物声学 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4382 字 阅读 →
论文解读

Ranking The Impact of Contextual Specialization in Neural Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4252 字 阅读 →
论文解读

RAP: Real-Time Audio-Driven Portrait Animation with Video Diffusion Transformer

音视频 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5050 字 阅读 →
论文解读

RASD-SR: A Robust Anomalous Sound Detection Framework with Score Recalibration

异常声音检测 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5155 字 阅读 →
论文解读

Rationale-Guided Learning for Multimodal Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4768 字 阅读 →
论文解读

RCAL: Reinforced Cross-Modal Alignment for Multimodal Sentiment Analysis with Sparse Visual Frames

多模态模型 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4562 字 阅读 →
论文解读

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5113 字 阅读 →
论文解读

Real-Time Streaming MEL Vocoding with Generative Flow Matching

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4120 字 阅读 →
论文解读

Reasoning Driven Captions to Assist Noise Robust Speech Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4690 字 阅读 →
论文解读

ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4275 字 阅读 →
论文解读

Reconstruction of Spherical Sound Source Radiation Characteristics with Graph Signal Processing

空间音频 | 7.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3232 字 阅读 →
论文解读

Recovering Performance in Speech Emotion Recognition from Discrete Tokens Via Multi-Layer Fusion and Paralinguistic Feature Integration

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4949 字 阅读 →
论文解读

Reducing Prompt Sensitivity in LLM-Based Speech Recognition Through Learnable Projection

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4818 字 阅读 →
论文解读

Reference Microphone Selection for Guided Source Separation Based on The Normalized L-P Norm

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3975 字 阅读 →