论文解读

Conan-embedding-v3: Fusing Modality-Specific Models for Omni-Modal Embedding

音频检索 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5579 字 阅读 →
论文解读

Cross-Modal Masking for Robust Silent Speech Synthesis Using sEMG and Lipreading

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7716 字 阅读 →
论文解读

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

多模态模型 | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5464 字 阅读 →
论文解读

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

语音合成 | 9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6999 字 阅读 →
论文解读

Liberating LLM Capabilities in Full-Duplex Speech Models

多模态模型 | 8.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8443 字 阅读 →
论文解读

Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention

自监督学习 | 7.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6004 字 阅读 →
论文解读

Paediatric-HGNN: A Hybrid Heterogeneous Graph Neural Network for Detecting Disfluency in Children's Speech via Multiscale Acoustic Fusion

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7186 字 阅读 →
论文解读

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

音频生成 | 7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5816 字 阅读 →
论文解读

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

多模态模型 | 6.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6186 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-09

共分析 48 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 141 分钟 · 70154 字 阅读 →
论文解读

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

语音情感识别 | 7.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5285 字 阅读 →
论文解读

Assessing True Generalisability of Audio-Visual Speech Recognisers

语音识别 | 9.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6841 字 阅读 →
论文解读

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12718 字 阅读 →
论文解读

FIGMA: Towards FIne-Grained Music retrievAl

对比学习 | 7.2/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4878 字 阅读 →
论文解读

Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

语音识别 | 9.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5472 字 阅读 →
论文解读

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

多模态模型 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5591 字 阅读 →
论文解读

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

多模态模型 | 7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5850 字 阅读 →
论文解读

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

多模态模型 | 6.4/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3789 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 108 分钟 · 53770 字 阅读 →
论文解读

Automatic Labelling of Speech Translation Errors

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4750 字 阅读 →