论文解读

CAPS: A Cascaded Reconstruction Model to Power Saving in Hearables Using Sub-Nyquist Sampling with Bandwidth Extension

语音增强 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7493 字 阅读 →
论文解读

Multimodal Speaker Verification as a Threat to Speaker Anonymization

说话人验证 | 9.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7725 字 阅读 →
论文解读

The Giant Hippocampus: From Structural Monoculture to a System of Systems

音频理解 | 6.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5018 字 阅读 →
论文解读

Validating the Single Item Kawaii Measure

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8270 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-23

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 34984 字 阅读 →
论文解读

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

语音情感识别 | 5.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6251 字 阅读 →
论文解读

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

音频检索 | 8.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8119 字 阅读 →
论文解读

EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation

语音情感识别 | 5.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7242 字 阅读 →
论文解读

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

音频生成 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6266 字 阅读 →
论文解读

Modeling turn-taking with distant viewing: investigating silence thresholds in human and AI-generated discourse

音视频 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6168 字 阅读 →
论文解读

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

音频理解 | 9.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7986 字 阅读 →
论文解读

Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7627 字 阅读 →
论文解读

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

语音情感识别 | 5.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7032 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-21

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 118 分钟 · 58810 字 阅读 →
论文解读

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

音视频理解 | 6.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7850 字 阅读 →
论文解读

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8526 字 阅读 →
论文解读

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

音视频理解 | 5.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7410 字 阅读 →
论文解读

Constrained Hebbian Learning Supports Efficient Representational Allocation under Structural Constraints

音视频理解 | 6.7/10

 · 更新于 2026-09-25 · 约 29 分钟 · 14475 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-20

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 52 分钟 · 25690 字 阅读 →
论文解读

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

音频检索 | 6.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7023 字 阅读 →