论文解读

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

大语言模型 | 7.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4882 字 阅读 →
论文解读

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

多模态模型 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6481 字 阅读 →
论文解读

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

音频问答 | 7.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4791 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-15

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 72 分钟 · 35999 字 阅读 →
论文解读

Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5831 字 阅读 →
论文解读

Ontology Memory-Augmented ASR Correction for Long Text-Speech Interleaved Conversations

语音识别 | 9.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6360 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38140 字 阅读 →
论文解读

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

语音合成 | 5.2/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4836 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-11

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 99 分钟 · 49581 字 阅读 →
论文解读

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5701 字 阅读 →
论文解读

Phoneme-First Prediction for LLM-Based Speech Recognition

语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6037 字 阅读 →
论文解读

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

多模态模型 | 9.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5947 字 阅读 →
论文解读

TRADE: Transducer-Augmented Decoder for Speech LLM

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5157 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-10

共分析 45 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 126 分钟 · 62690 字 阅读 →
论文解读

A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

大语言模型 | 10/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7516 字 阅读 →
论文解读

Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding

音乐生成 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5101 字 阅读 →
论文解读

Towards Event-Robust Acoustic Scene Classification

数据增强 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4996 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 108 分钟 · 53770 字 阅读 →
论文解读

Efficient Punctuation Restoration via Weighted Lookahead Scoring Method for Streaming ASR Systems

大语言模型 | 6.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4987 字 阅读 →
论文解读

Exploring LLMs for South Asian Music Understanding and Generation

音乐生成 | 7.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5025 字 阅读 →