论文解读

Integrating Speaker Embeddings and LLM-Derived Semantic Representations for Streaming Speaker Diarization

说话人分离 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8207 字 阅读 →
论文解读

K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4671 字 阅读 →
论文解读

LAMB: LLM-Based Audio Captioning with Modality Gap Bridging Via Cauchy-Schwarz Divergence

音频描述 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4276 字 阅读 →
论文解读

LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models Using in-the-wild Data

语音识别 语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5574 字 阅读 →
论文解读

Leveraging Segment-Level Speech Representations for LLM-Based Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5225 字 阅读 →
论文解读

LLM-Based Post-ASR Error Correction for Disordered Speech

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5031 字 阅读 →
论文解读

MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5811 字 阅读 →
论文解读

MCF: Text LLMS for Multimodal Emotional Causality

情感分析 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4895 字 阅读 →
论文解读

Medical ASR Enhancement by Domain-Specific Reinforcement Fine-Tuning

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4017 字 阅读 →
论文解读

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4303 字 阅读 →
论文解读

Modeling Both Intra- And Inter-Utterance Variability for Conversational Emotion Recognition

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4447 字 阅读 →
论文解读

OMNI-AVSR: Towards Unified Multimodal Speech Recognition With Large Language Models

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4649 字 阅读 →
论文解读

OV-INSTRUCTTTS: Towards Open-Vocabulary Instruct Text-to-Speech

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5743 字 阅读 →
论文解读

PAC: Pronunciation-Aware Contextualized Large Language Model-Based Automatic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4114 字 阅读 →
论文解读

PhoenixDSR: Phoneme-Guided and LLM-Enhanced Dysarthric Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5876 字 阅读 →
论文解读

Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction

视觉语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5224 字 阅读 →
论文解读

PROST-LLM: Progressively Enhancing the Speech-to-Speech Translation Capability in LLMs

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5541 字 阅读 →
论文解读

Relative Time Intervals Representation For Word-Level Timestamping With Masked Training

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4823 字 阅读 →
论文解读

Rethinking Music Captioning with Music Metadata LLMS

音乐理解 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5562 字 阅读 →
论文解读

RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4067 字 阅读 →