论文解读

FinHuBERT: Hierarchical Feature Imitating Networks for Low-Resource Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4221 字 阅读 →
论文解读

FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation

语音编码 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5230 字 阅读 →
论文解读

From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4405 字 阅读 →
论文解读

H-nnPBFDAF: Hierarchical Neural Network Partitioned Block Frequency Domain Adaptive Filter with Novel Block Activation Probability

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4613 字 阅读 →
论文解读

HCGAN: Harmonic-Coupled Generative Adversarial Network for Speech Super-Resolution in Low-Bandwidth Scenarios

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4284 字 阅读 →
论文解读

How Far Do SSL Speech Models Listen for Tone? Temporal Focus of Tone Representation under Low-Resource Transfer

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3861 字 阅读 →
论文解读

Hybrid Pruning: In-Situ Compression of Self-Supervised Speech Models for Speaker Verification and Anti-Spoofing

说话人验证 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4788 字 阅读 →
论文解读

Improving Audio Event Recognition with Consistency Regularization

音频事件检测 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4143 字 阅读 →
论文解读

Leveraging Diffusion U-Net Features for Predominant Instrument Recognition

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3908 字 阅读 →
论文解读

Lightweight and Perceptually-Guided Voice Conversion for Electro-Laryngeal Speech

语音转换 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6301 字 阅读 →
论文解读

Lingometer: On-Device Personal Speech Word Counting System

语音活动检测 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5825 字 阅读 →
论文解读

LLM-Based Post-ASR Error Correction for Disordered Speech

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5031 字 阅读 →
论文解读

LOTUSDIS: A Thai Far-Field Meeting Corpus for Robust Conversational ASR

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3735 字 阅读 →
论文解读

Low-Resource Speech-Based Early Alzheimers Detection via Cross-Lingual and Few-Shot Transfer Learning

语音生物标志物 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4145 字 阅读 →
论文解读

LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3037 字 阅读 →
论文解读

Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3909 字 阅读 →
论文解读

Mixtures of Lightweight Articulatory Experts for Multilingual Asr

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3929 字 阅读 →
论文解读

Multilingual Supervised Pretraining with Lm-Assisted Decoding for Visual Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3573 字 阅读 →
论文解读

Neuromamba: Adaptive Frequency Filtering with a Pyramid Mamba for sEEG-driven Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5962 字 阅读 →
论文解读

One Model–Three Tasks: Discovering a Shared Winning Ticket for Low-Complexity Audio Intelligence

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3730 字 阅读 →