论文解读

Audio-Visual Intelligence in Large Foundation Models

跨模态 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4580 字 阅读 →
论文解读

Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM

语音大模型 | 8.0/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14118 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

音频分类 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4468 字 阅读 →
论文解读

VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models

音乐转录 | 7.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10272 字 阅读 →
论文解读

Deepfake Audio Detection Using Self-supervised Fusion Representations

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4110 字 阅读 →
论文解读

Learning Generalizable Action Representations via Pre-training AEMG

生物声学 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5844 字 阅读 →
论文解读

Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection

语音生物标志物 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5797 字 阅读 →
论文解读

Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5630 字 阅读 →
论文解读

MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention

音乐生成 | 7.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5860 字 阅读 →
论文解读

Spoken Language Identification with Pre-trained Models and Margin Loss

说话人识别 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3725 字 阅读 →
论文解读

Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4081 字 阅读 →
论文解读

Alethia: A Foundational Encoder for Voice Deepfakes

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4189 字 阅读 →
论文解读

Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?

音乐生成 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4931 字 阅读 →
论文解读

AVEX: What Matters for Animal Vocalization Encoding

生物声学 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5485 字 阅读 →
论文解读

Data-Centric Lessons To Improve Speech-Language Pretraining

语音问答 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4090 字 阅读 →
论文解读

Discovering and Steering Interpretable Concepts in Large Generative Music Models

音乐生成 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4454 字 阅读 →
论文解读

From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings

音频分类 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6394 字 阅读 →
论文解读

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4836 字 阅读 →
论文解读

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

音乐理解 | 7.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3318 字 阅读 →
论文解读

Hierarchical Semantic-Acoustic Modeling via Semi-Discrete Residual Representations for Expressive End-to-End Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9658 字 阅读 →