一句之内换情绪又变语速:不训练模型只改推理时条件访问
针对一句内多情绪与多语速控制问题,TED-TTS 选择冻结预训练自回归语音合成模型、只在推理时重组条件可见性与终止控制,消融表显示完整方案在过渡平滑与说话人一致性上优于去掉对齐或局部调速的变体,但局部加速仍带来实时因子上升的代价。
针对一句内多情绪与多语速控制问题,TED-TTS 选择冻结预训练自回归语音合成模型、只在推理时重组条件可见性与终止控制,消融表显示完整方案在过渡平滑与说话人一致性上优于去掉对齐或局部调速的变体,但局部加速仍带来实时因子上升的代价。
针对统一大音频语言模型偏向平滑上下文而漏掉短暂声学线索的问题,论文提出只在推理时对比原始与时域模糊音频的对数几率并做门控稀疏修正,在 MMAU 上 Qwen2.5-Omni 平均达 73.2%,代价是每样本多一次慢路径预填充前向与双路解码缓存。
论文把同时语音翻译拆成停顿切分与离线多模态大模型增量翻译,用等待块数与每轮生成上限控制延迟,在开发集上以五折交叉验证显示优于级联基线,但大模型推理开销与误差累积仍是代价。
针对 Whisper 类模型在噪声与口音下置信度不可靠的问题,论文用可学习解码器提示加温度采样产生候选并以 CLAP 音频文本相似度做奖励做单样本强化更新,在 LibriSpeech 加噪与 L2-Arctic 上把平均词错误率降到 28.64% 与 28.21%,代价是每次推理需多轮采样打分并在样本后恢复参数。
针对全模态大模型中音频视觉联合预测不可靠融合的问题,论文提出免训练的冲突感知解码 CAD,用潜在冲突量与任务空间可干预性决定是否把联合分支权重转给单模态分支,在 Qwen2.5-Omni-7B 上把 CMM 整体准确率提到 85.0% 与 AVHBench 提到 84.1%,代价是每步要跑四个分支并依赖人工阈值。
针对 Stable Audio Open 的 VAE 潜空间可解码音高类别这一可验证性质,论文用冻结的微型卷积探针在去噪后 40% 窗口内以 RMS 归一化梯度轻推潜变量,在 27 次配对试验中将旋律一致性从 0.112 提升至 0.274 且未报告音质代价。
针对 Whisper 在无语音输入上生成流畅幻觉文本的问题,论文用无语音校准集估计解码器幻觉子空间并在推理时做低秩投影以提升无语音概率,门控版本在保留语音识别的同时把非语音幻觉率大幅降低。
针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。
声源定位 | 8.8/10
语音增强 | 6.2/10
音视频理解 | 7.1/10
音频修复 | 7.0/10
语音合成 | 7.8/10
语音合成 | 7.2/10
音乐理解 | 5.5/10
音频分类 | 6.8/10
语音识别 | 8.2/10
语音伪造检测 | 6.5/10
语音识别 | 6.7/10
音频事件检测 | 7.3/10