论文解读

Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages

语音识别 | 7.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3966 字 阅读 →
论文解读

Towards Real-Time Generative Speech Restoration with Flow-Matching

语音增强 | 6.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4390 字 阅读 →
论文解读

Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER

语音识别 | 9.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4930 字 阅读 →
论文解读

Tpeformer: Temporal Patch Embedding Transformer

语音情感识别 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4746 字 阅读 →
论文解读

Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio

说话人分离 | 9.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4925 字 阅读 →
论文解读

Training Dynamics-Aware Multi-Factor Curriculum Learning for Target Speaker Extraction

语音分离 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4427 字 阅读 →
论文解读

Training Flow Matching Models with Reliable Labels via Self-Purification

语音合成 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4189 字 阅读 →
论文解读

Training-Free Inference-Time Scaling for Audio Source Separation

语音增强 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3556 字 阅读 →
论文解读

Training-Free Multimodal Guidance for Video to Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4470 字 阅读 →
论文解读

Transfer Learning for Paediatric Sleep Apnoea Detection using Physiology-Guided Acoustic Models

音频分类 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4463 字 阅读 →
论文解读

Transferable Audio Lottery Tickets: Gradient Accumulation for Extreme Sparsity

音频分类 | 7.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3873 字 阅读 →
论文解读

Tri-Attention Fusion: Joint Temporal-Spectral and Bidirectional Modeling for Speech Spoofing Detection

语音伪造检测 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5146 字 阅读 →
论文解读

Triad: Tri-Head with Auxiliary Duplicating Permutation Invariant Training for Multi-Task Sound Event Localization and Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4020 字 阅读 →
论文解读

Triage Knowledge Distillation for Speaker Verification

说话人验证 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4613 字 阅读 →
论文解读

TTA: Transcribe, Translate and Alignment for Cross-Lingual Speech Representation

语音识别 | 7.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5261 字 阅读 →
论文解读

TVP-UNet: Threshold Variance Penalty U-Net for Voice Activity Detection in Dysarthric Speech

语音活动检测 | 7.0/10

 · 更新于 2026-09-16 · 约 7 分钟 · 3256 字 阅读 →
论文解读

Two-Stage Language Model Framework for Acoustic Echo Cancellation

语音增强 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4401 字 阅读 →
论文解读

UJCodec: An End-to-end Unet-Style Codec for Joint Speech Compression and Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4672 字 阅读 →
论文解读

UMA-SPLIT: Unimodal Aggregation for Both English and Mandarin Non-Autoregressive Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3808 字 阅读 →
论文解读

UMV: A Mixture-Of-Experts Vision Transformer with Multi-Spectrogram Fusion for Underwater Ship Noise Classification

音频分类 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4212 字 阅读 →