论文解读

给声音装上刻度:TEMPO 如何让大音频语言模型学会报时

音频事件检测 | 7.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12370 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 151 分钟 · 75584 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 54 分钟 · 26637 字 阅读 →
论文解读

Preference Optimization for Non-Verbal Vocalization Synthesis

语音合成 | 7.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6013 字 阅读 →
论文解读

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

音频理解 | 8.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5275 字 阅读 →
论文解读

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

音频字幕生成 | 7.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8571 字 阅读 →
论文解读

ARENA: Automated Red-Teaming for Large Audio Language Models

音频理解 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7088 字 阅读 →
论文解读

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

音视频生成 | 7.4/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4241 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-07

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28125 字 阅读 →
论文解读

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

音频理解 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6060 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-05

共分析 32 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 93 分钟 · 46258 字 阅读 →
论文解读

OPOD: On-Policy Omni Distillation

多模态模型 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6936 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-24

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28385 字 阅读 →
论文解读

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

音频生成 | 8.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8443 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-14

共分析 53 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 186 分钟 · 92760 字 阅读 →
论文解读

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5163 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 41962 字 阅读 →
论文解读

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7969 字 阅读 →
论文解读

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

语音属性识别 | 8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6346 字 阅读 →
论文解读

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

音视频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7777 字 阅读 →