论文解读

SEP-ST: Incorporating Speech Entity Prompt Into Large Language Models for Speech Translation

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3975 字 阅读 →
论文解读

SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4626 字 阅读 →
论文解读

SPAM: Style Prompt Adherence Metric for Prompt-Based TTS

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4628 字 阅读 →
论文解读

SpeechMapper: Speech-To-Text Embedding Projector for LLMs

语音大模型 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5397 字 阅读 →
论文解读

Still Thinking or Stopped Talking? Dialogue Silence Intention Classification Using Multimodal Large Language Model

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3789 字 阅读 →
论文解读

Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent

对抗样本 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4288 字 阅读 →
论文解读

Synthetic Data Domain Adaptation for ASR via LLM-Based Text and Phonetic Respelling Augmentation

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4965 字 阅读 →
论文解读

TAG: Structured Temporal Audio Generation via LLM-Guided Manual Scription and Control

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4086 字 阅读 →
论文解读

Target-Speaker LLM-ASR with Speaker-Aware Speech Encoder

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4444 字 阅读 →
论文解读

Test-Time Scaling for Auditory Cognition in Audio Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4888 字 阅读 →
论文解读

Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3668 字 阅读 →
论文解读

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3637 字 阅读 →
论文解读

Thinking While Listening: Simple Test Time Scaling for Audio Classification

音频分类 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4620 字 阅读 →
论文解读

Towards Distance-Aware Synthetic Audio Mixtures for Universal Sound Separation

语音分离 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3929 字 阅读 →
论文解读

Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3966 字 阅读 →
论文解读

Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4930 字 阅读 →
论文解读

UVT-LM: Unifying Visual and Tactile Perception with Language Model

跨模态 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4823 字 阅读 →
论文解读

Whisper: Courtside Edition - Enhancing ASR Performance through LLM-Driven Context Generation

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3477 字 阅读 →
论文解读

Z-Scores: A Metric for Linguistically Assessing Disfluency Removal

模型评估 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4710 字 阅读 →
论文解读

All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4036 字 阅读 →