论文解读

Slot Filling as a Reasoning Task for Speechllms

槽填充 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4747 字 阅读 →
论文解读

Speaker Anonymisation for Speech-Based Suicide Risk Detection

语音匿名化 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3992 字 阅读 →
论文解读

SpeechMapper: Speech-To-Text Embedding Projector for LLMs

语音大模型 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5397 字 阅读 →
论文解读

SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5250 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4640 字 阅读 →
论文解读

Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4706 字 阅读 →
论文解读

StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4238 字 阅读 →
论文解读

T-Cache: Fast Inference For Masked Generative Transformer-Based TTS Via Prompt-Aware Feature Caching

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4509 字 阅读 →
论文解读

Target-Speaker LLM-ASR with Speaker-Aware Speech Encoder

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4444 字 阅读 →
论文解读

TASU: Text-only Alignment for Speech Understanding

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4344 字 阅读 →
论文解读

TICL: Text-Embedding KNN for Speech in-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4710 字 阅读 →
论文解读

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6217 字 阅读 →
论文解读

Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio

说话人分离 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4925 字 阅读 →
论文解读

Two-Stage Language Model Framework for Acoustic Echo Cancellation

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4401 字 阅读 →
论文解读

UJCodec: An End-to-end Unet-Style Codec for Joint Speech Compression and Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4672 字 阅读 →
论文解读

Understanding Textual Capability Degradation in Speech LLMS via Parameter Importance Analysis

语音问答 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5549 字 阅读 →
论文解读

Vocalnet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3960 字 阅读 →
论文解读

WAV2LEV: Predicting Levenshtein Edit Operation Sequences For Fine-Grained Estimation of Automatic Speech Recognition Error

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Whisper-MLA: Reducing GPU Memory Consumption of ASR Models Based on MHA2MLA Conversion

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4484 字 阅读 →
论文解读

Whisper-QF: Leveraging Dual Cross-Attention Q-Former for Speech Emotion Recognition With Multi-Task Learning

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5139 字 阅读 →