论文解读

Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression

音视频事件检测 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5068 字 阅读 →
论文解读

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6971 字 阅读 →
论文解读

Closing the Gap Between Text and Speech Understanding in LLMs

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8119 字 阅读 →
论文解读

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

语音分离 | 9.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5833 字 阅读 →
论文解读

Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression

音视频 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4449 字 阅读 →
论文解读

ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6023 字 阅读 →
论文解读

A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)

语音分离 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5194 字 阅读 →
论文解读

Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis

发音错误检测 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6451 字 阅读 →
论文解读

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5319 字 阅读 →
论文解读

One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech

语音克隆 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4425 字 阅读 →
论文解读

Advancing Speech Summarization in Multi-Modal LLMs with Reinforcement Learning

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4272 字 阅读 →
论文解读

AFT: An Exemplar-Free Class Incremental Learning Method for Environmental Sound Classification

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4408 字 阅读 →
论文解读

AMBER2: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4014 字 阅读 →
论文解读

APKD: Aligned And Paced Knowledge Distillation Towards Lightweight Heterogeneous Multimodal Emotion Recognition

情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3585 字 阅读 →
论文解读

Attention-Weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied To Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5893 字 阅读 →
论文解读

Attentive Masked Self-Distillation for Respiratory Sound Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4934 字 阅读 →
论文解读

AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4987 字 阅读 →
论文解读

Cross-Architecture Knowledge Distillation of WavLM for Lightweight Speaker Verification

说话人验证 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6123 字 阅读 →
论文解读

Cross-Modal Knowledge Distillation for Speech Large Language Models

语音大模型 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3931 字 阅读 →
论文解读

Curriculum Learning with Contrastive Loss for Lightweight Speaker Verification

说话人验证 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4588 字 阅读 →