论文解读

AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

多模态模型 | 7/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7267 字 阅读 →
论文解读

Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

语音识别 | 5.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4920 字 阅读 →
论文解读

Dynamic Interaction-Aware and Causality-Disentangled Framework for Multimodal Sentiment Analysis

多模态模型 | 7.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 6012 字 阅读 →
论文解读

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

音乐生成 | 7.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6236 字 阅读 →
论文解读

MOSS-Audio Technical Report

语音识别 | 9.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5940 字 阅读 →
论文解读

Multimodal Music Recommendation System using LLMs

音乐推荐 | 10/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7397 字 阅读 →
论文解读

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1679 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-02

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 104 分钟 · 51914 字 阅读 →
论文解读

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

语音翻译 | 7.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5915 字 阅读 →
论文解读

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

语音合成 | 9.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6263 字 阅读 →
论文解读

Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5959 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

自回归模型 | 6.5/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8023 字 阅读 →
论文解读

UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

语音合成 | 10/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7690 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-01

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 73 分钟 · 36167 字 阅读 →
论文解读

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5495 字 阅读 →
论文解读

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs

强化学习 | 9.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6317 字 阅读 →
论文解读

Raon-Speech Technical Report

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5464 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-30

共分析 6 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 17 分钟 · 8127 字 阅读 →
论文解读

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5475 字 阅读 →
论文解读

Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation

多模态模型 | 8.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6155 字 阅读 →