论文解读

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

音乐生成 | 9.4/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1658 字 阅读 →
论文解读

Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering

多模态模型 | 5.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6119 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-30

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 102 分钟 · 51078 字 阅读 →
论文解读

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

语音识别 | 5.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6247 字 阅读 →
论文解读

MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

多模态模型 | 7.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5909 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-29

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 46 分钟 · 22697 字 阅读 →
论文解读

CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents

音频分离 | 7.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5663 字 阅读 →
论文解读

Listening Like a Judge: A Music-Aware Framework for Automatic Singing Performance Evaluation

歌唱评估 | 8.8/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7529 字 阅读 →
论文解读

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

扩散模型 | 8.9/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7367 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 55 分钟 · 27448 字 阅读 →
论文解读

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

语音识别 | 5.8/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4856 字 阅读 →
论文解读

Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4894 字 阅读 →
论文解读

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

语音翻译 | 7.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6956 字 阅读 →
论文解读

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

语音合成 | 7.2/10

 · 更新于 2026-09-06 · 约 3 分钟 · 1135 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-25

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 77 分钟 · 38268 字 阅读 →
论文解读

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6034 字 阅读 →
论文解读

Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4879 字 阅读 →
论文解读

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

多模态模型 | 8.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6088 字 阅读 →
论文解读

NeuroSonic: Conditional Flow Matching for EEG-to-Speech Reconstruction

语音生成 | 7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6037 字 阅读 →
论文解读

video-SALMONN-R\(^3\): Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

多模态模型 | 8.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5751 字 阅读 →