VividTalker: A Modular Framework for Expressive 3D Talking Avatars with Controllable Gaze and Blink
语音合成 | 7.5/10
语音合成 | 7.5/10
语音克隆 | 9.0/10
语音合成 | 8.5/10
语音合成 | 7.0/10
语音合成 | 9.0/10
模型评估 | 7.0/10
语音克隆 | 6.5/10
语音合成 | 7.0/10
语音合成 | 7.5/10
语音质量评估 | 7.5/10
音频生成 | 8.5/10
语音合成 | 7.5/10
共分析 2 篇语音/AI 论文
语音合成 | 7.0/10
语音合成 | 7.5/10
语音合成 | 7.5/10
这篇论文介绍了Qwen3.5-Omni,一个支持文本、图像、音频和音频-视频输入的全模态大语言模型。为解决现有模型在实时交互、跨模态推理和工具使用上的不足,其核心方法是采用“Thinker-Talker”架构,并引入混合专家(MoE)设计以提升效率。与前代相比,主要创新在于:1)模型规模扩展至数千亿
1. **问题**:现有大型音频语言模型在副语言(如情绪、语气、音色)生成与理解能力上的评估存在特征覆盖不全、评估方法主观且不可扩展的问题。 2. **方法**:提出了SpeechParaling-Bench,一个包含1000余个中英平行语音查询、覆盖超过100个细粒度副语言特征的综合基准。基准
1. **问题**:现有基于离散token的TTS模型,其“粗到细”的生成范式主要体现在从语义token到声学token的转换,而对语音固有的时间动态(temporal dynamics)缺乏显式建模。 2. **方法核心**:提出Chain-of-Details (CoD)框架,将语音生成分解为多
本文针对现有语音合成系统在生成角色驱动、情感丰富的语音时难以同时保持角色身份一致性和情感表达准确性的问题,提出了ATRIE框架。其核心是**Persona-Prosody Dual-Track (P2-DT) 架构**,将语音生成解耦为静态的**音色轨道**(通过标量量化保持身份锚点)和动态的**韵