论文解读

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

音视频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7731 字 阅读 →
论文解读

OPOD: On-Policy Omni Distillation

多模态模型 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6936 字 阅读 →
论文解读

X^3-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

音频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8383 字 阅读 →
论文解读

Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8461 字 阅读 →
论文解读

Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models

说话人验证 | 7.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8389 字 阅读 →
论文解读

Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

音视频理解 | 5.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5753 字 阅读 →
论文解读

NABEATs: Noise-Aware Audio Representation Learning

音频理解 | 6.7/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8604 字 阅读 →
论文解读

Pseudo-label distillation for discriminative anomalous sound detection

音频事件检测 | 9.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7353 字 阅读 →
论文解读

Data-driven Video Codec with Implicit Neural Representations

音频编码 | 5.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6797 字 阅读 →
论文解读

From Prediction to Collaboration: Interactive Symbolic Music Analysis

音乐理解 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6028 字 阅读 →
论文解读

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6817 字 阅读 →
论文解读

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9170 字 阅读 →
论文解读

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

语音情感识别 | 6.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8349 字 阅读 →
论文解读

Text-Independent Speaker Verification Using Discrete Audio Tokens

说话人验证 | 5.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7091 字 阅读 →
论文解读

\(C^3\)ASD: Multi-Level Consistency-Driven Representation Learning

音视频理解 | 7.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7018 字 阅读 →
论文解读

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

音频字幕生成 | 6.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7179 字 阅读 →
论文解读

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

语音识别 | 7.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6159 字 阅读 →
论文解读

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

语音编码 | 7.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5637 字 阅读 →
论文解读

Alethia: a Foundational Encoder for Voice Deepfakes

语音伪造检测 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6803 字 阅读 →
论文解读

Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion

音乐检索 | 4.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7918 字 阅读 →