不用改 vocoder 结构,只换条件特征:群延迟乘积谱能否替代梅尔谱
该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。
该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。
针对多人交互中只建模说话或只建模双人的不足,PolySLGen 用过去全组语音与动作为条件联合生成目标人的文本、语音风格、身体动作和说话状态分,证据是动作与说话状态预测上优于多个基线,代价是推理约 5 帧每秒且说话状态预测仍困难。
论文以 96 个语言的类比成功率与声码器重合成声学测量为证据,说明自监督语音模型以线性方向编码音系特征并以向量尺度连续控制实现程度,但合成效果仍受声码器与上下文切分条件限制。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
ControlAudio 把定时可控与可懂语音生成拆成文本、定时、音素三级条件,用结构化提示、三阶段训练和两段采样实现统一控制,在 AudioCondition 与 AC-Filtered 上提升时间精度与可懂度,代价是更依赖标注与仿真数据的分布假设和更长的多阶段训练。
该文把声码器从条件生成改写为从梅尔退化观测恢复目标谱的两步优化,用可学习伪逆做初始化加分频大核卷积注意力做深层先验,在 3.89M 参数下报告了优于 112M 量级基线与流匹配基线的质量,同时代价是仍需 GAN 判别器训练与多损失调参。
针对语音共情对话中副语言信息易被转写或早压缩削弱的问题,ES4R 在编码前用轮内与轮间注意力构建情感上下文再做语音引导的语义融合与能量引导的语音合成,在 AvaMERG 上语义一致性最优但多样性指标未占优且合成风格集合有限。
论文追问在人类语音上训练的情感理解能否直接用于合成语音,通过跨数据集、跨判别式与生成式模型、跨 TTS 与 S2S 合成的系统评测,显示人类与合成之间存在约 38 个百分点的识别差距,且主要代价来自语音 token 预测阶段的表示偏移与生成式模型的文本主导偏置。
针对文本大模型向语音统一理解与生成迁移时模态鸿沟大、单一种词元难以兼顾语义与声学的问题,该文提出理解驱动分词器与双词元建模并用约 4500 小时数据验证,理解与生成可相互促进,但细粒度声学保留与翻译类任务仍有代价与边界。
针对梅尔声码器黑盒预测丢失频谱细节与相位包裹难监督的问题,SCNet 用低频子带先验耦合到逆变换主干并以幅度加权相位损失训练,在域内与跨说话人测试及 CosyVoice 合成中报告更高质量,但合成速度不及 Vocos 且通用音频能力待验证。
针对菲律宾语重音需靠句子上下文消歧但句子级音素标注稀缺的问题,该研究用 Wiktionary 词典加 LLM 辅助管线合成句子级弱监督数据微调 CharsiuG2P 初始化的 ByT5,在 1173 句人工校对集上把音素错误率从约 19.74% 降到约 0.54%、字符错误率降到约 2.50%,代价是 malumi 类与非标准词仍易错且大合成集增益主要体现在 …
AuK 用自然语言指令加可选音频统一五类语音任务,以多模态大语言模型语义条件、联合训练的音频变分自编码器声学潜变量和混合整流流 Transformer 为核心,在约 3.03 billion 指令音频实例与 1.95 million 小时监督上经生成预热、联合预训练、编辑偏好优化与生成强化学习取得零样本与指令合成及通用编辑的领先结果,并以 4 步无分类器自由 …
针对全双工对话需要保留轮转、重叠与反馈时序但真实录音纠缠不清的问题,ConversationalVoice 用质量校验的分离、词面固定的重建与上下文约束的扩展三阶段产出共享格式的双轨数据,并在自动评估中保持 0.983 至 0.991 的同说话人相似度与正向区分度,同时以重建提升预测音质而扩展维持相近交互密度。
TASTE2 把每个文本词元配一个连续音频隐变量使序列长度严格等于文本,用 56.3% 对 57.3% 保留 98.2% 文本问答能力并以 0.060 秒停下响应用户打断,代价是流畅接话需 1.207 秒、部署首音频 2701 毫秒且显式副语言控制不稳定。
EffVOC 用因果卷积加 LSTM 的上采样声码器从幅度谱或 Mel 系数直接重建宽带与全频带波形,在 20 毫秒算法延迟下宽带 MOS 达到 4.17 与 4.15、全频带达到 4.14 与 4.11,代价是更高帧率带来的计算量与对短窗高重叠的依赖。
针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。
该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。
论文把合成前 delivery 决策做成带源引用的结构化说话计划,用确定性校验器检查引用合法性与单线索局部性,在 32 种子 100 例 full100 对照中去掉源记录使引用必需分数下降 0.488,而 7B 局部性修复在源键留出下恢复槽位准确率与局部性。
语音合成 | 7.5/10