每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 72 分钟 · 35908 字 阅读 →
论文解读

When Vision Speaks for Sound

音视频 | 7.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9514 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-20

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 82 分钟 · 40963 字 阅读 →
论文解读

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

语音情感识别 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4850 字 阅读 →
论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4810 字 阅读 →
论文解读

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

音频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 24 分钟 · 12017 字 阅读 →
论文解读

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

情感识别 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4542 字 阅读 →
论文解读

Direct Preference Optimization For Speech Autoregressive Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4779 字 阅读 →
论文解读

PROST-LLM: Progressively Enhancing the Speech-to-Speech Translation Capability in LLMs

语音翻译 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5541 字 阅读 →