每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

低码率单层量化加双路源语音条件:Kraken 如何让大模型直接说译文

针对大模型预测高码率语音 token 难、表达性数据难对齐的问题,Kraken 用 25 Hz 单层 VQ 低码率 token 加 LLM 与声码器双路源语音条件,在 150k 小时多任务数据上实现可复述的端到端语音到语音翻译,并在 FLEURS 与 CVSS 上保留说话人与韵律,代价是音频质量指标弱于用理想参考音色的大模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9381 字 阅读 →
论文解读

先补幅度再造相位:PhaseGAN 用两套办法解耦声码器重建

针对梅尔谱缺相位信息导致相位一对多难学的问题,PhaseGAN 用插值加 ICCRN 先恢复幅度谱再用 R3-GAN 生成相位谱,在 LJSpeech 上报告 UTMOS 4.238 等最优感知指标,代价是两阶段分别训练且推理仍需 6.42G 量级计算。

 · 更新于 2026-09-24 · 约 16 分钟 · 7916 字 阅读 →
论文解读

先把法语语音从 WavLM 还原出来:层选择与对抗监督决定重建上限

论文把法语 WavLM 到波形的重建作为连续语音转换的前置步骤,对比只用谱损失与加入多周期多尺度对抗监督的 HiFi-GAN vocodeur,并在 15 个未见说话人样本上用谱、感知和基频指标验证对抗监督带来一致增益,同时以可学习的层融合分析各层贡献。

 · 更新于 2026-09-24 · 约 18 分钟 · 8797 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

未见声音总被判成熟悉声音:用属性生成补数据,再用分布检测先分流

针对广义零样本声事件分类中未见类被大量判为已见类的问题,论文用属性条件 GAN 生成未见类隐特征训练分类器,再以类级分布外检测做分流与概率融合,在 RWCP-SSD 上把调和平均从 36.2 提高到 78.7,代价是类级检测器数量与阈值调节成本增加。

 · 更新于 2026-09-24 · 约 15 分钟 · 7495 字 阅读 →
论文解读

只用 64 个像素点的振动,能恢复出可懂的语音吗

针对事件相机记录的语音致振恢复语音的问题,论文提出两阶段振动到语音模型 EV2A,用 8 个 8×8 感兴趣区域做视觉前端加语音增强端到端训练,在真实薯片袋振动数据上相对事件版视觉麦克风降低词错误率 0.48 但仍保留金属感与表示损失等代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9755 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

用混沌判别器补高频:CIS-BWE 为何同时做幅度与相位双流

CIS-BWE 针对带限语音缺失高频的问题,用双流 ConformerNeXt 生成器并行恢复幅度和相位,再用李雅普诺夫与去趋势涨落两类混沌判别器约束非线性动态,在 VCTK 与 MLS 上以约一半生成参数取得更优感知质量,代价是训练期李雅普诺夫特征计算使单轮训练时间明显增加。

 · 更新于 2026-09-24 · 约 20 分钟 · 9703 字 阅读 →
论文解读

把梅尔谱看成退化:先线性找回谱结构再用大核修复细节

该文把声码器从条件生成改写为从梅尔退化观测恢复目标谱的两步优化,用可学习伪逆做初始化加分频大核卷积注意力做深层先验,在 3.89M 参数下报告了优于 112M 量级基线与流匹配基线的质量,同时代价是仍需 GAN 判别器训练与多损失调参。

 · 更新于 2026-09-24 · 约 20 分钟 · 9968 字 阅读 →
论文解读

极低码率下保住语义再重建波形:FlowTokenizer 的分层对齐与单层稠密量化

针对每秒仅 25 个 token 重建 24 kHz 波形时语义丢失与高频失真问题,论文用条件流匹配迭代生成波形并以分层表示对齐与稠密单层量化组织语义和声学信息,最强证据是 8 层 RVQ 对照与频带误差表显示的语义保持与高频改善,代价是四步 ODE 采样与大规模 Transformer 解码器的推理开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9967 字 阅读 →
论文解读

只换音色不够:用离散单元同时改写节奏的匿名化

该文针对仅混淆音色后韵律节奏仍会泄露身份的问题,用离散语音单元加时长预测与单元声码器同时改写音色与节奏,在非音色攻击下半知情评估取得相对 32% 的提升,代价是词错误率上升到 7% 量级且自然度轻微下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8068 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

低码率下保真与语义难两全:非对称双量化如何分开处理内容与细节

针对 1.5 kbps 下多层残差量化误差累积与单码本语义稀疏问题,SACodec 用冻结 mHuBERT 语义锚定加 SimVQ 残差激活的非对称双量化,在 LibriTTS 与 LJSpeech 上取得接近真值的主观重建分并保留语义,代价是仍限于英语朗读语料与两路量化结构。

 · 更新于 2026-09-24 · 约 18 分钟 · 8761 字 阅读 →
论文解读

给黑盒声码器加先验:低频子带引导与按能量加权的相位监督

针对梅尔声码器黑盒预测丢失频谱细节与相位包裹难监督的问题,SCNet 用低频子带先验耦合到逆变换主干并以幅度加权相位损失训练,在域内与跨说话人测试及 CosyVoice 合成中报告更高质量,但合成速度不及 Vocos 且通用音频能力待验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8539 字 阅读 →
论文解读

再嵌入一次就换主人:神经音频水印为何挡不住覆盖攻击

论文把音频水印威胁从删除与伪造推进到再嵌入伪造消息并劫持归属的覆盖攻击,在 AudioSeal、Timbre、WavMark 上按白盒、灰盒、黑盒验证了接近 100% 的原水印失效率,代价是暴力堆叠会让信噪比明显下降而查询筛选能省下一半以上训练开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9480 字 阅读 →
论文解读

无相位也能低延迟重建语音:EffVOC 把窗长钉在 20 毫秒

EffVOC 用因果卷积加 LSTM 的上采样声码器从幅度谱或 Mel 系数直接重建宽带与全频带波形,在 20 毫秒算法延迟下宽带 MOS 达到 4.17 与 4.15、全频带达到 4.14 与 4.11,代价是更高帧率带来的计算量与对短窗高重叠的依赖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8255 字 阅读 →
论文解读

压住衰减曲线才能压住房间:375 bps 下的 RIR 神经压缩

论文把 RIR 压缩从通用音频重建转向房间结构约束,用 EnCodec 单码本加 EDC 与局部能量加混响语音监督,在 375 bps 上把 T60 误差降到 1.14 s、ViSQOL 做到 4.11,但 46.875 bps 时容量明显不够。

 · 更新于 2026-09-24 · 约 19 分钟 · 9031 字 阅读 →
论文解读

生成用短时谱、判别用对数谱:DSME 为何把预测与判别分开

DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。

 · 更新于 2026-09-24 · 约 19 分钟 · 9394 字 阅读 →