论文解读

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

音频检索 | 7.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5356 字 阅读 →
论文解读

ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models

音频分类 | 7.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6499 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-01

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 50963 字 阅读 →
论文解读

How to Leverage Synthetic Speech for LLM-Based ASR Systems?

语音识别 | 8.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7623 字 阅读 →
论文解读

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

参数高效微调 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4940 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-30

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 51078 字 阅读 →
论文解读

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

语音合成 | 6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4968 字 阅读 →
论文解读

Listening Like a Judge: A Music-Aware Framework for Automatic Singing Performance Evaluation

歌唱评估 | 8.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7529 字 阅读 →
论文解读

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4420 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 55 分钟 · 27448 字 阅读 →
论文解读

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4856 字 阅读 →
论文解读

Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection

语音伪造检测 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5991 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-25

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38268 字 阅读 →
论文解读

video-SALMONN-R\(^3\): Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

多模态模型 | 8.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5751 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-24

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 98 分钟 · 48791 字 阅读 →
论文解读

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5481 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11361 字 阅读 →
论文解读

Gradient-Based Learning of Parametric Engine Sound Representations for Real-Time Resynthesis and Tuning on Embedded Systems

参数高效微调 | 7.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4491 字 阅读 →
论文解读

Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering

音频问答 | 6.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 5003 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3142 字 阅读 →