论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4222 字 阅读 →
论文解读

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4175 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5875 字 阅读 →
论文解读

A cross-species neural foundation model for end-to-end speech decoding

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5641 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4107 字 阅读 →
论文解读

Confident and Adaptive Generative Speech Recognition via Risk Control

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5063 字 阅读 →
论文解读

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4981 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音大模型 | 8.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5696 字 阅读 →
论文解读

Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5369 字 阅读 →
论文解读

Scaling Speech Tokenizers with Diffusion Autoencoders

语音分词 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4954 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4797 字 阅读 →
论文解读

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

语音分词 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4686 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5309 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4392 字 阅读 →
论文解读

BUT System Description for CHiME-9 MCoRec Challenge

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5308 字 阅读 →
论文解读

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

说话人识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4581 字 阅读 →
论文解读

Few-Shot Accent Synthesis for ASR with LLM-Guided Phoneme Editing

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5168 字 阅读 →
论文解读

HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3963 字 阅读 →
论文解读

Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4560 字 阅读 →