论文解读

FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval

参数高效微调 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6667 字 阅读 →
论文解读

GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6599 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-05

共分析 47 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 127 分钟 · 63374 字 阅读 →
论文解读

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

语音识别 | 10/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6280 字 阅读 →
论文解读

Video2LoRA: Parametric Video Internalization for Vision-Language Models

参数高效微调 | 7.5/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2262 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-04

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 60 分钟 · 29896 字 阅读 →
论文解读

Logit Distillation on Manifolds: Mapping by Learning

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6262 字 阅读 →
论文解读

MoDAl: Self-Supervised Neural Modality Discovery via Decorrelation for Speech Neuroprosthesis

自监督学习 | 6.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5302 字 阅读 →
论文解读

SegTune: Structured and Fine-Grained Control for Song Generation

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6788 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-03

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 123 分钟 · 61249 字 阅读 →
论文解读

Parameter-efficient Dual-encoder Architecture with Differentiable Choquet Integral Fusion for Underwater Acoustic Classification

音频分类 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5654 字 阅读 →
论文解读

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1679 字 阅读 →
论文解读

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

语音合成 | 9.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5542 字 阅读 →
论文解读

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

语音识别 | 8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5632 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-02

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 104 分钟 · 51914 字 阅读 →
论文解读

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5495 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-30

共分析 6 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 17 分钟 · 8127 字 阅读 →
论文解读

ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

语音识别 | 8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5167 字 阅读 →
论文解读

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5633 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-29

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28306 字 阅读 →