论文解读

RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

对比学习 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6068 字 阅读 →
论文解读

A Comparative Study of Pre-trained Speech Encoders and Training Objectives for Large-Scale Indic Spoken Language Identification

自监督学习 | 8.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4667 字 阅读 →
论文解读

Probing Token Spaces under Generator Shift in AI-Generated Music Detection

音频编码 | 9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6007 字 阅读 →
论文解读

Your U-Net Dereverberation Model is Secretly an RIR Encoder

对比学习 | 8.3/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4101 字 阅读 →
论文解读

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5503 字 阅读 →
论文解读

DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

扩散模型 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6540 字 阅读 →
论文解读

FIGMA: Towards FIne-Grained Music retrievAl

对比学习 | 7.2/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4878 字 阅读 →
论文解读

FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval

参数高效微调 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6667 字 阅读 →
论文解读

Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition

语音情感识别 | 8.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5728 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-05

共分析 47 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 127 分钟 · 63374 字 阅读 →
论文解读

Channel-Oriented Design for EEG-to-Music Reconstruction

音乐生成 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4877 字 阅读 →
论文解读

CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

语音编码 | 8.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7045 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-04

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 60 分钟 · 29896 字 阅读 →
论文解读

MoDAl: Self-Supervised Neural Modality Discovery via Decorrelation for Speech Neuroprosthesis

自监督学习 | 6.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5302 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-03

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 123 分钟 · 61249 字 阅读 →
论文解读

Dynamic Interaction-Aware and Causality-Disentangled Framework for Multimodal Sentiment Analysis

多模态模型 | 7.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6012 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-02

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 104 分钟 · 51914 字 阅读 →
论文解读

几何主导下如何减出材料:GaMi 的跨模态相减式解耦

针对几何变化压制材料特征的问题,GaMi 用共位毫米波与声学的共享几何一致性做对齐-校准-相减解耦,并以样本间对比抑制残差,在 20 类材料上以 95.2% 的总体准确率显著优于单模态基线,代价是需双模态同步采集与多目标联合训练。

 · 更新于 2026-09-25 · 约 23 分钟 · 11269 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

自回归模型 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8023 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-01

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 73 分钟 · 36167 字 阅读 →