论文解读

Group Relative Policy Optimization for Text-to-Speech with Large Language Models

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4330 字 阅读 →
论文解读

How Far Do SSL Speech Models Listen for Tone? Temporal Focus of Tone Representation under Low-Resource Transfer

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3861 字 阅读 →
论文解读

Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5611 字 阅读 →
论文解读

Improving Contextual Asr Via Multi-Grained Fusion With Large Language Models

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3976 字 阅读 →
论文解读

Influence of Clean Speech Characteristics on Speech Enhancement Performance

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4057 字 阅读 →
论文解读

保留高维 XLS-R 特征时单层 KAN 能否以更少参数替代复杂后端

📄 保留高维 XLS-R 特征时单层 KAN 能否以更少参数替代复杂后端 会议论文 ID:conference:icassp:2026:icassp-arnumber:11460320

 · 更新于 2026-09-25 · 约 18 分钟 · 8894 字 阅读 →
论文解读

Korean aegyo speech shows systematic F1 increase to signal childlike qualities

语音情感识别 | 6.0/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2463 字 阅读 →
论文解读

Language-Infused Retrieval-Augmented CTC with Adaptive Soft-Hard Gating for Robust Code-Switching ASR

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3170 字 阅读 →
论文解读

LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models Using in-the-wild Data

语音识别 语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5574 字 阅读 →
论文解读

Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

Leveraging Whisper Embeddings For Audio-Based Lyrics Matching

音乐信息检索 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4853 字 阅读 →
论文解读

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

基准测试 | 7.8/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3975 字 阅读 →
论文解读

Low-Resource Speech-Based Early Alzheimers Detection via Cross-Lingual and Few-Shot Transfer Learning

语音生物标志物 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4145 字 阅读 →
论文解读

Mixtures of Lightweight Articulatory Experts for Multilingual Asr

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3929 字 阅读 →
论文解读

MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-Token Prediction

语音翻译 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5619 字 阅读 →
论文解读

Multilingual Supervised Pretraining with Lm-Assisted Decoding for Visual Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3573 字 阅读 →
论文解读

Natural Language to Spatial Audio Parameters: Lightweight Deterministic Rendering for Creative Authoring

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →
论文解读

NCF-TTS: Enhancing Flow Matching Based Text-To-Speech with Neighborhood Consistency Flow

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4168 字 阅读 →
论文解读

nGPT as a Scalable Architecture for Speech Recognition and Translation

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5927 字 阅读 →
论文解读

PAC: Pronunciation-Aware Contextualized Large Language Model-Based Automatic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4114 字 阅读 →