SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
语音合成 | 7.5/10
语音合成 | 7.5/10
医疗AI | 7.5/10
语音识别 | 8.0/10
语音匿名化 | 7.0/10
语音识别 | 8.8/10
音视频 | 7.0/10
音频问答 | 7.0/10
语音识别 | 7.0/10
音乐信息检索 | 7.5/10
音频深度伪造检测 | 8.5/10
领域适应 | 7.0/10
说话人验证 | 7.5/10
语音增强 | 6.5/10
音视频 | 8.5/10
发音错误检测 | 8.5/10
语音合成 | 7.0/10
本文针对现有语音合成系统在生成角色驱动、情感丰富的语音时难以同时保持角色身份一致性和情感表达准确性的问题,提出了ATRIE框架。其核心是**Persona-Prosody Dual-Track (P2-DT) 架构**,将语音生成解耦为静态的**音色轨道**(通过标量量化保持身份锚点)和动态的**韵
这篇论文旨在解决AI生成音乐检测中普遍存在的泛化能力差的问题。当前主流方法(如CLAM、SpecTTTra)通过学习AI音乐的声音特征,在面对未见过的生成器时性能急剧下降。作者提出了一个核心假设:当前主流AI音乐生成器(如Suno, Udio)都依赖神经音频编解码器(如EnCodec)的残差矢量量化
本文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务中能力不足、推理过程不透明的问题。**核心贡献**是提出了一个名为 **Audio-Cogito** 的完全开源解决方案,其核心是一个四阶段的自动化数据构建管道 **Cogito-Pipe**,用于生成高质量、多样化的音频推理链(CoT)数
本文旨在解决多模态大模型在音视频联合推理任务上缺乏高质量训练数据的核心挑战。**核心贡献**是提出了AVRT框架,通过组合单模态专家模型的能力来合成多模态推理数据。**关键方法**分为两步:1)**数据生成**:使用专门的视觉教师(Kimi-VL-Thinking)和音频教师(Audio Flami