jep-2026 论文深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对大模型预测高码率语音 token 难、表达性数据难对齐的问题,Kraken 用 25 Hz 单层 VQ 低码率 token 加 LLM 与声码器双路源语音条件,在 150k 小时多任务数据上实现可复述的端到端语音到语音翻译,并在 FLEURS 与 CVSS 上保留说话人与韵律,代价是音频质量指标弱于用理想参考音色的大模型。
针对梅尔谱缺相位信息导致相位一对多难学的问题,PhaseGAN 用插值加 ICCRN 先恢复幅度谱再用 R3-GAN 生成相位谱,在 LJSpeech 上报告 UTMOS 4.238 等最优感知指标,代价是两阶段分别训练且推理仍需 6.42G 量级计算。
论文把法语 WavLM 到波形的重建作为连续语音转换的前置步骤,对比只用谱损失与加入多周期多尺度对抗监督的 HiFi-GAN vocodeur,并在 15 个未见说话人样本上用谱、感知和基频指标验证对抗监督带来一致增益,同时以可学习的层融合分析各层贡献。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对广义零样本声事件分类中未见类被大量判为已见类的问题,论文用属性条件 GAN 生成未见类隐特征训练分类器,再以类级分布外检测做分流与概率融合,在 RWCP-SSD 上把调和平均从 36.2 提高到 78.7,代价是类级检测器数量与阈值调节成本增加。
针对事件相机记录的语音致振恢复语音的问题,论文提出两阶段振动到语音模型 EV2A,用 8 个 8×8 感兴趣区域做视觉前端加语音增强端到端训练,在真实薯片袋振动数据上相对事件版视觉麦克风降低词错误率 0.48 但仍保留金属感与表示损失等代价。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
CIS-BWE 针对带限语音缺失高频的问题,用双流 ConformerNeXt 生成器并行恢复幅度和相位,再用李雅普诺夫与去趋势涨落两类混沌判别器约束非线性动态,在 VCTK 与 MLS 上以约一半生成参数取得更优感知质量,代价是训练期李雅普诺夫特征计算使单轮训练时间明显增加。
该文把声码器从条件生成改写为从梅尔退化观测恢复目标谱的两步优化,用可学习伪逆做初始化加分频大核卷积注意力做深层先验,在 3.89M 参数下报告了优于 112M 量级基线与流匹配基线的质量,同时代价是仍需 GAN 判别器训练与多损失调参。
针对每秒仅 25 个 token 重建 24 kHz 波形时语义丢失与高频失真问题,论文用条件流匹配迭代生成波形并以分层表示对齐与稠密单层量化组织语义和声学信息,最强证据是 8 层 RVQ 对照与频带误差表显示的语义保持与高频改善,代价是四步 ODE 采样与大规模 Transformer 解码器的推理开销。
该文针对仅混淆音色后韵律节奏仍会泄露身份的问题,用离散语音单元加时长预测与单元声码器同时改写音色与节奏,在非音色攻击下半知情评估取得相对 32% 的提升,代价是词错误率上升到 7% 量级且自然度轻微下降。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对 1.5 kbps 下多层残差量化误差累积与单码本语义稀疏问题,SACodec 用冻结 mHuBERT 语义锚定加 SimVQ 残差激活的非对称双量化,在 LibriTTS 与 LJSpeech 上取得接近真值的主观重建分并保留语义,代价是仍限于英语朗读语料与两路量化结构。
针对梅尔声码器黑盒预测丢失频谱细节与相位包裹难监督的问题,SCNet 用低频子带先验耦合到逆变换主干并以幅度加权相位损失训练,在域内与跨说话人测试及 CosyVoice 合成中报告更高质量,但合成速度不及 Vocos 且通用音频能力待验证。
论文把音频水印威胁从删除与伪造推进到再嵌入伪造消息并劫持归属的覆盖攻击,在 AudioSeal、Timbre、WavMark 上按白盒、灰盒、黑盒验证了接近 100% 的原水印失效率,代价是暴力堆叠会让信噪比明显下降而查询筛选能省下一半以上训练开销。
EffVOC 用因果卷积加 LSTM 的上采样声码器从幅度谱或 Mel 系数直接重建宽带与全频带波形,在 20 毫秒算法延迟下宽带 MOS 达到 4.17 与 4.15、全频带达到 4.14 与 4.11,代价是更高帧率带来的计算量与对短窗高重叠的依赖。
论文把 RIR 压缩从通用音频重建转向房间结构约束,用 EnCodec 单码本加 EDC 与局部能量加混响语音监督,在 375 bps 上把 T60 误差降到 1.14 s、ViSQOL 做到 4.11,但 46.875 bps 时容量明显不够。
DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。