论文解读

COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

音频检索 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5159 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-29

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28306 字 阅读 →
论文解读

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5387 字 阅读 →
论文解读

OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation

音频检索 | 9.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5784 字 阅读 →
论文解读

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4782 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-28

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 42014 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6556 字 阅读 →
论文解读

MERIT: Learning Disentangled Music Representations for Audio Similarity

音频检索 | 9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5351 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-27

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 121 分钟 · 60546 字 阅读 →
论文解读

RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching

语音合成 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6377 字 阅读 →
论文解读

DASM: Domain-Aware Sharpness Minimization for Multi-Domain Voice Stream Steganalysis

音频隐写分析 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6558 字 阅读 →
论文解读

Speech Quality Embeddings for Improved Detection and Classification of Degradations in Speech Signals

语音质量评估 | 5.8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9969 字 阅读 →
论文解读

DASM: Domain-Aware Sharpness Minimization for Multi-Domain Voice Stream Steganalysis

语音伪造检测 | 7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7015 字 阅读 →
论文解读

EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection

音频深度伪造检测 | 7.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8115 字 阅读 →
论文解读

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

多模态模型 | 8.6/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10221 字 阅读 →
论文解读

SAME: A Semantically-Aligned Music Autoencoder

音频编码 | 8.5/10

 · 更新于 2026-09-25 · 约 26 分钟 · 13010 字 阅读 →
论文解读

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

音视频分割 | 7.2/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11356 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-17

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 9 分钟 · 4469 字 阅读 →
论文解读

AudioMosaic: Contrastive Masked Audio Representation Learning

音频分类 | 7.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7392 字 阅读 →
论文解读

Bypassing Direct Reconstruction: Speech Detection from MEG via Large-Scale Audio Retrieval

语音活动检测 | 7.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9877 字 阅读 →