论文解读

End-to-end Listen, Look, Speak and Act

语音对话系统 | 8.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6653 字 阅读 →
论文解读

Adaptive Task-Incremental Learning For Underwater Acoustic Recognition Based on Mixture-of-Experts Adapter

水下声学目标识别 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4274 字 阅读 →
论文解读

Dual-Perspective Multimodal Sentiment Analysis with MoE Fusion: Representation Learning via Semantic Resonance and Divergence

多模态情感分析 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4367 字 阅读 →
论文解读

Improving Multimodal Brain Encoding Model with Dynamic Subject-Awareness Routing

脑信号编码 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5527 字 阅读 →
论文解读

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

多模态模型 | 8.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6861 字 阅读 →
论文解读

Selective Hub Fusion with Modality-Heterogeneous Experts for Multimodal Emotion Recognition

多模态模型 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4869 字 阅读 →
论文解读

SURE: Synergistic Uncertainty-Aware Reasoning for Multimodal Emotion Recognition in Conversations

语音情感识别 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4997 字 阅读 →
论文解读

SwitchCodec: Adaptive Residual-Expert Sparse Quantization for High-Fidelity Neural Audio Coding

音频生成 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5387 字 阅读 →
论文解读

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

这篇论文旨在解决语音到语音翻译(S2ST)系统普遍丢失源语音中非语言声音(如笑声、哭声)和情感信息的问题,这严重影响了跨语言交流的自然度和准确性。为此,作者提出了三项核心贡献:首先,设计了一个可扩展的自动化数据合成管道,用于生成大规模、高质量的英中富有表现力S2ST平行语料,克服了训练数据稀缺的瓶颈

 · 更新于 2026-09-24 · 约 11 分钟 · 5030 字 阅读 →