ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
针对零样本语音合成模型被微调、剪枝、量化与蒸馏后仍可经黑盒接口验明归属的问题,TTS-Guard 以双空间关键说话人对选择加课程化影子模型优化构造参考音频扰动,并在五个主流系统上报告平均单查询指纹成功率 96.4%、误报率 5.8%,代价是验证需 20 到 40 次查询且蒸馏与强自适应擦除仍会明显拉低成功率。
PACE 针对非平行口音转换,用冻结 WavLM 上的口音预测子空间更新加检索融合实现推理时可调的转换强度,默认点以 16.0% 词错误率和 39.0% 分类器准确率优于复现基线,代价是说话人相似度降到 0.583。
论文在匹配数据与匹配生成设置下比较纯语音、语音文本与纯文本模型,显示内部文本流大幅降低生成困惑度但说话人相似度和预测质量偏向纯语音模型,且联合模型能逼近大得多数据规模纯语音模型的语义水平。
论文用六个语料的成对偏好任务检验无参考语音质量分,发现有瑕疵时接近人类上限而双干净时跌到随机,最强证据是干净端单分数与时长基线持平,而域内校准复合与等权复合分别在评测和奖励端缓解但仍远离上限。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
论文比较北美英语人类与 Parler-TTS 在陈述句和极性问句中实现对比性焦点的声学线索,发现人类按句型反转 F0 策略而合成语音跨句型高度一致,且在语速与强度上整体偏离人类,最强证据来自贝叶斯逻辑回归的 95% 可信区间方向差异,代价是强度在人类数据中受录音变异掩盖而未能复现经典效应。
论文要解决从文本生成法语 LfPC/提示语编码的教学工具缺失问题,选择把生成引擎与语言规则分离并暴露三步可核对流程,其证据是已验证的生成引擎与用户测试过的界面,而代价是美式英语长元音三维动作在二维显示上尚未优化。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对梅尔谱缺相位信息导致相位一对多难学的问题,PhaseGAN 用插值加 ICCRN 先恢复幅度谱再用 R3-GAN 生成相位谱,在 LJSpeech 上报告 UTMOS 4.238 等最优感知指标,代价是两阶段分别训练且推理仍需 6.42G 量级计算。
该研究以保留原说话人听感为前提替换语音中的敏感词,对比直接波形剪贴与经神经编解码器重建的插入路径以及克隆嗓音与合成语境的选择,用自然度、可懂度和信号质量自动指标报告编解码器路径更优,其中自然度倾向于带原句嵌入的编解码器与克隆嗓音,而信号质量倾向于通用嗓音与孤立词合成。
论文把法语 WavLM 到波形的重建作为连续语音转换的前置步骤,对比只用谱损失与加入多周期多尺度对抗监督的 HiFi-GAN vocodeur,并在 15 个未见说话人样本上用谱、感知和基频指标验证对抗监督带来一致增益,同时以可学习的层融合分析各层贡献。
该研究以一句爱尔兰语男声合成中性句为基线,只按真人情感录音改造嗓音源参数并叠加语速与共振峰,用全局、重音局部与组合三类刺激做听辨,发现组合识别率最高而高激活情感区分更清晰,低激活情感则互相混淆。
VoixTenue 把触屏纵向画线与手机俯仰横滚倾角映射为 Pink Trombone 的基频与强度,在 E2-E5 三组八度内以约 60 Hz 更新实现全机端实时嗓音合成,代价是触屏模式暂缺力度控制而倾角模式音高精度较低且未经被试实验验证。
针对离散语音 token 到梅尔谱的低延迟合成问题,论文用梅尔空间重参数化的平均流把 2 到 3 步推理的声学目标直接化,并用层选择的分块掩码把每包计算限定在滑动窗内,代价是需要未来块的前视延迟和多步细化开销。
针对几何直拖难以产生平滑非线性双元音轨迹的问题,论文用二维弹簧-质量-阻尼器把键盘输入映射为作用力再耦合 Pink Trombone 合成, pilot 显示曲线轨迹的弯曲能量由 1191.1 降到 211.6 而直线定位精度基本相当,代价是样本仅为作者且未做统计检验。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对 F0 可控声码器在大规模多说话人训练和噪声下是否仍可控的问题,论文用概率潜变量替代确定性特征并以重合成谱误差做数据筛选,报告显示筛选能阻止错误数据拖累训练、上移 F0 时清浊判断更准而下移与高频区仍有挑战、噪声下优于基线,但筛选阈值仍需人工设定。