论文解读

Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4229 字 阅读 →
论文解读

Leveraging Multiple Speech Enhancers for Non-Intrusive Intelligibility Prediction for Hearing-Impaired Listeners

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5540 字 阅读 →
论文解读

Leveraging Text-to-Speech and Voice Conversion as Data Augmentation for Alzheimer's Disease Detection from Spontaneous Speech

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5134 字 阅读 →
论文解读

Lingometer: On-Device Personal Speech Word Counting System

语音活动检测 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5825 字 阅读 →
论文解读

Localizing Speech Deepfakes Beyond Transitions via Segment-Aware Learning

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4261 字 阅读 →
论文解读

LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3037 字 阅读 →
论文解读

Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation

说话人日志 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4023 字 阅读 →
论文解读

用带噪混合当高噪声步监督:Mix2Morph 如何把加法叠加训练成可控的声音注入

📄 用带噪混合当高噪声步监督:Mix2Morph 如何把加法叠加训练成可控的声音注入 会议论文 ID:conference:icassp:2026:icassp-arnumber:11460386

 · 更新于 2026-09-25 · 约 16 分钟 · 7807 字 阅读 →
论文解读

Multimodal Fusion-Based IPCLIP Network for Mixed Reality Surgical Assistance

多模态模型 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3263 字 阅读 →
论文解读

On deepfake voice detection - It’s all in the presentation

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4174 字 阅读 →
论文解读

PAC: Pronunciation-Aware Contextualized Large Language Model-Based Automatic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4114 字 阅读 →
论文解读

PC-MCL: Patient-Consistent Multi-Cycle Learning with Multi-Label Bias Correction for Respiratory Sound Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 5005 字 阅读 →
论文解读

Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction

视觉语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Proficiency-Aware Adaptation and Data Augmentation for Robust L2 ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3992 字 阅读 →
论文解读

PromptSep: Generative Audio Separation Via Multimodal Prompting

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3891 字 阅读 →
论文解读

Quantifying Speaker Embedding Phonological Rule Interactions in Accented Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4134 字 阅读 →
论文解读

Refgen: Reference-Guided Synthetic Data Generation for Anomalous Sound Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3682 字 阅读 →
论文解读

Robust Accent Identification via Voice Conversion and Non-Timbral Embeddings

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3282 字 阅读 →
论文解读

RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4067 字 阅读 →
论文解读

SA-SSL-MOS: Self-Supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment

语音质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5780 字 阅读 →