论文解读

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12718 字 阅读 →
论文解读

KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5494 字 阅读 →
论文解读

GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6599 字 阅读 →
论文解读

SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

语音情感识别 | 6.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5860 字 阅读 →
论文解读

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7367 字 阅读 →
论文解读

Cosmos 3: Omnimodal World Models for Physical AI

音频生成 | 10/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8607 字 阅读 →
论文解读

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6820 字 阅读 →
论文解读

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

强化学习 | 7.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5961 字 阅读 →
论文解读

SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue

语音合成 | 8.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8091 字 阅读 →
论文解读

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs

强化学习 | 9.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6317 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-30

共分析 6 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 17 分钟 · 8127 字 阅读 →
论文解读

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5633 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-29

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28306 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7769 字 阅读 →
论文解读

Learning When to Think While Listening in Large Audio-Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2186 字 阅读 →
论文解读

LongCat-Video-Avatar 1.5 Technical Report

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7471 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6277 字 阅读 →
论文解读

Toward Native Multimodal Modeling: A Roadmap

多模态模型 | 10/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4994 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-26

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 34648 字 阅读 →
论文解读

StepAudio 2.5 Technical Report

统一音频模型 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6187 字 阅读 →