每日研究速递
aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
HQ-SVC 针对无目标说话人数据、无微调的零样本歌声转换,用冻结的解耦编解码同时取内容与音色特征,再经 EVA 模块融合音高能量并用 DDSP 加扩散两级重建 44.1 kHz 梅尔谱,在不足 80 小时数据与单张消费级 GPU 条件下取得比大资源基线更高的自然度与音高准确性,代价是音色相似度客观指标未全面领先且重建引入可接受的发音音高误差。
针对扩散音频超分一次采样方差大、关键属性易丢失的问题,论文用冻结 AudioSR 加验证器打分与随机/零阶搜索选优,在 4 kHz 到 24 kHz 语音上报告最高约 9.70% 美学、15.20% 词错误率与 46.98% 频谱距离改善,代价是 120 路候选的成倍推理开销与单验证器过拟合风险。
音频超分辨 | 8.2/10