Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
语音合成 | 7.0/10
语音合成 | 7.0/10
语音识别 | 7.0/10
音频分类 | 6.5/10
语音克隆 | 9.0/10
语音合成 | 8.5/10
音频检索 | 8.0/10
语音生成 | 7.0/10
语音克隆 | 6.5/10
语音合成 | 7.0/10
发音错误检测 | 8.5/10
语音合成 | 7.5/10
共分析 2 篇语音/AI 论文
语音合成 | 7.5/10
1. **问题**:零样本语音转换需要同时实现高质量的说话人特征迁移和低延迟的流式推理,这是一个尚未很好解决的挑战。 2. **方法核心**:提出X-VC系统,在预训练的SAC语音编解码器的潜在空间中进行一步转换。核心是一个双条件声学转换器,它联合处理源语音的编解码器潜在表示和目标参考语音的帧级梅尔
本文针对现有语音合成系统在生成角色驱动、情感丰富的语音时难以同时保持角色身份一致性和情感表达准确性的问题,提出了ATRIE框架。其核心是**Persona-Prosody Dual-Track (P2-DT) 架构**,将语音生成解耦为静态的**音色轨道**(通过标量量化保持身份锚点)和动态的**韵
本文针对现有语音编辑方法依赖任务特定训练、未编辑区域时间一致性差的问题,提出了AST(Adaptive, Seamless, and Training-free),一种基于预训练AM-FM(自回归-流匹配)范式TTS模型的精确语音编辑框架。AST首先通过逆Euler ODE求解器将原始语音反演至潜空
本文旨在解决音频-视觉导航(AVN)智能体在未见环境和未闻声音类别下泛化能力差的核心问题。作者指出,现有方法性能下降主要源于两个因素:一是音频表征混淆了语义与空间信息,导致对未闻声��定位不准;二是强化学习策略过拟合于训练环境的动态和布局。为此,本文提出了一个名为BDATP的即插即用框架。在感知层面
本论文针对 Video-to-Speech(VTS)生成中视觉-语音模态信息不对称的问题,提出现有方法忽略了语音从粗粒度语义到细粒度韵律的层次结构,导致视觉条件无法与语音表示精准对齐。为此,作者提出 HiCoDiT(Hierarchical Codec Diffusion Transformer),
本文旨在解决零样本呼吸音频分类中“一刀切”的推理计算浪费问题。为此,提出了TRIAGE框架,这是一个三层自适应推理管道:第一层(Tier-L)进行快速的标签-文本相似度匹配;若置信度不足则升级至第二层
这篇论文旨在解决零样本语音转换中**高保真说话人迁移**与**低延迟流式推理**难以兼得的核心挑战。作者提出了**X-VC**系统,其核心创新在于**在预训练神经编解码器(SAC)的潜在空间中进行一步