论文解读

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5153 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-23

共分析 83 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 224 分钟 · 112108 字 阅读 →
论文解读

FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6654 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-19

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 110 分钟 · 54842 字 阅读 →
论文解读

Constraining to Generalize: Subspace Tuning for Few-shot Generalization of Audio-Language Models

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7536 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 105 分钟 · 52107 字 阅读 →
论文解读

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5868 字 阅读 →
论文解读

Learning task-specific subspaces via interventional post-training of speech foundation models

自监督学习 | 6.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10293 字 阅读 →
论文解读

Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5858 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-17

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 94 分钟 · 46631 字 阅读 →
论文解读

Confidence Score Guided Incremental and Speaker Adaptive Pseudo-Labeling for Semi-Supervised Elderly Speech Recognition

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6027 字 阅读 →
论文解读

Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6816 字 阅读 →
论文解读

MambAdapter: Lightweight Mamba-Based Adapters for Parameter-Efficient Transfer Learning in Speech and Audio

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4872 字 阅读 →
论文解读

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

多模态模型 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6481 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-16

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 168 分钟 · 83790 字 阅读 →
论文解读

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

语音翻译 | 8.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6061 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38140 字 阅读 →
论文解读

AuRA: Internalizing Audio Understanding into LLMs as LoRA

语音问答 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3100 字 阅读 →
论文解读

GC-LoRA: Gated Convolutional LoRA for Parameter-Efficient Acoustic Adaptation

语音识别 | 7.6/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4079 字 阅读 →