论文解读

SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4626 字 阅读 →
论文解读

SpeechCT-CLIP: Distilling Text-Image Knowledge to Speech for Voice-Native Multimodal CT Analysis

医疗AI | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4415 字 阅读 →
论文解读

STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5581 字 阅读 →
论文解读

Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization Via Neural Audio Codec and Language Models

语音匿名化 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5467 字 阅读 →
论文解读

Target-Speaker LLM-ASR with Speaker-Aware Speech Encoder

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4444 字 阅读 →
论文解读

Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4812 字 阅读 →
论文解读

Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-Wise Distillation

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3417 字 阅读 →
论文解读

Teaching the Teachers: Boosting Unsupervised Domain Adaptation In Speech Recognition By Ensemble Update

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4428 字 阅读 →
论文解读

Temporal Distillation for Music Representation Learning

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

The Impact of Audio Watermarking on Audio Anti-Spoofing Countermeasures

音频深度伪造检测 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4839 字 阅读 →
论文解读

The Synergistic Role of Audio and Large Video-Language Model in Source-Free Video Domain Adaptation

领域适应 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4434 字 阅读 →
论文解读

Triage Knowledge Distillation for Speaker Verification

说话人验证 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4613 字 阅读 →
论文解读

What the student learns in knowledge distillation: A subspace view and evidence on Convolutional Recurrent Network

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4287 字 阅读 →
论文解读

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5626 字 阅读 →
论文解读

Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis

发音错误检测 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6458 字 阅读 →
论文解读

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

本文针对现有语音合成系统在生成角色驱动、情感丰富的语音时难以同时保持角色身份一致性和情感表达准确性的问题,提出了ATRIE框架。其核心是**Persona-Prosody Dual-Track (P2-DT) 架构**,将语音生成解耦为静态的**音色轨道**(通过标量量化保持身份锚点)和动态的**韵

 · 更新于 2026-09-25 · 约 11 分钟 · 5414 字 阅读 →
论文解读

ArtifactNet: Detecting AI-Generated Music via Forensic Residual Physics

这篇论文旨在解决AI生成音乐检测中普遍存在的泛化能力差的问题。当前主流方法(如CLAM、SpecTTTra)通过学习AI音乐的声音特征,在面对未见过的生成器时性能急剧下降。作者提出了一个核心假设:当前主流AI音乐生成器(如Suno, Udio)都依赖神经音频编解码器(如EnCodec)的残差矢量量化

 · 更新于 2026-09-25 · 约 10 分钟 · 4777 字 阅读 →
论文解读

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

本文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务中能力不足、推理过程不透明的问题。**核心贡献**是提出了一个名为 **Audio-Cogito** 的完全开源解决方案,其核心是一个四阶段的自动化数据构建管道 **Cogito-Pipe**,用于生成高质量、多样化的音频推理链(CoT)数

 · 更新于 2026-09-25 · 约 9 分钟 · 4337 字 阅读 →
论文解读

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

本文旨在解决多模态大模型在音视频联合推理任务上缺乏高质量训练数据的核心挑战。**核心贡献**是提出了AVRT框架,通过组合单模态专家模型的能力来合成多模态推理数据。**关键方法**分为两步:1)**数据生成**:使用专门的视觉教师(Kimi-VL-Thinking)和音频教师(Audio Flami

 · 更新于 2026-09-25 · 约 13 分钟 · 6166 字 阅读 →