论文解读

把逐帧检索换成一步速度场:在 WavLM 空间学习 kNN 传输

该研究用条件流匹配网络回归 kNN 生成的源到伪目标位移,以交叉注意力与 FiLM 注入目标说话人条件并比较三条高斯路径,在 LibriSpeech 上以单步推理改善可懂度与估计质量,代价是目标说话人验证相似度低于 kNN 与音素幻觉器。

 · 约 14 分钟 · 6862 字 阅读 →
论文解读

原型挤在一处时,零样本换声为何更难泛化到没见过的说话人

论文研究角间隔 ECAPA-TDNN 分类器原型在单位超球面上的集中与有效维度坍缩问题,用铰链式 Riesz 对数能量与参与率最大化两项直接作用于原型的正则改善覆盖,并在 Fast-VGAN 零样本换声上以 WER 从 6.54% 到 5.97%、相似度从 0.65 到 0.69、UTMOSv2 从 2.47 到 2.70 为证据显示鲁棒性提升,而说话人识别 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10639 字 阅读 →
论文解读

不训练生成器,只做部分编辑:PACE 在冻结表征里权衡口音与保留

PACE 针对非平行口音转换,用冻结 WavLM 上的口音预测子空间更新加检索融合实现推理时可调的转换强度,默认点以 16.0% 词错误率和 39.0% 分类器准确率优于复现基线,代价是说话人相似度降到 0.583。

 · 更新于 2026-09-24 · 约 17 分钟 · 8397 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

转换来的嗄声能当真病人用吗:Seed-VC 扩增的临床可信度检验

该研究用 Seed-VC 把健康对照的持续元音转换成癌与良性黏膜病变的嗄声并请专家做 GRBAS 与四级可信度评定,结果显示转换声不总被判为人工但仍可被感知且常规声学差值解释不了,提示先别直接拿去训练分类器。

 · 更新于 2026-09-24 · 约 20 分钟 · 9532 字 阅读 →
论文解读

先抹掉再贴上:用颤音匹配把齐奏混音藏成一个声源

该文研究齐奏混音中不同颤音模式暴露多声源的问题,提出先抑制目标颤音再从源信号迁移频率调制与分谐波幅度调制加残差谱包络调制的方法,以声谱图示例和同命运变换分离失效为证据,代价是尚无听音实验与客观分离指标量化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8865 字 阅读 →
论文解读

把做乐器的扩散模型拿去换嗓:统一条件如何同时管住音高、音素与演唱者

论文把多乐器音乐合成的注意力扩散模型改造为语音与歌声转换,用音素后验、基频与演唱者嵌入做条件,在自然度与演唱者相似度上追平专用转换模型,但音素保真下降且加入器乐数据会拉低人声质量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8901 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把合成语音调到输入端:MimicLM 用真录音做目标的声音模仿

针对并行三元组稀缺与合成目标封顶质量的问题,MimicLM 把 TTS 合成语音做源、真录音做目标并配合交错文本建模与偏好对齐,在保持音色口音情感相似度可比的同时提升自然度,代价是仍需大规模合成过滤与两阶段训练且真实输入词错率高于纯音色转换。

 · 更新于 2026-09-24 · 约 17 分钟 · 8421 字 阅读 →
论文解读

把主唱和和声分开:VocalRep 用角色一致性重做人声表示

针对双轨分离把主唱与和声混为一轨导致的下游含混问题,VocalRep 用全局身份条件加排序约束做三轨分离,在保持可比分离分的同时以更干净的主唱提升歌声转换可懂度与音高稳定性和唇同步精度,代价是求和比较时累积误差与多人主唱假设受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8832 字 阅读 →
论文解读

把病理性语音拉回正常编码:EA-VAE 用三处对齐做重构

针对构音障碍语音与正常语音特征空间差异大的问题,EA-VAE 只用变分自编码器加嵌入对齐、分布对齐和时长对齐做重构,在 UASpeech 上把平均词错误率降到 62.19% 并取得平均 MOS 4.48,代价是仍需平行语料预训练与波形级时间拉伸来保证帧数条件。

 · 更新于 2026-09-24 · 约 22 分钟 · 10883 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

低资源 TTS 要换声不要换口音:多语言训练跨语言迁移为何更稳

该文在 nêhiyawêwin 与 SENĆOTEN 上比较推理时改风格嵌入、现成 SeedVC 与英数据多语言训练三路线,报告带语言嵌入的多语言训练匿名化最稳,而无语言嵌入与 SeedVC 分别付出英语口音与质量下降代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7665 字 阅读 →
论文解读

低资源下保住音高与细节:HQ-SVC 用解耦编解码加两级合成做零样本歌声转换

HQ-SVC 针对无目标说话人数据、无微调的零样本歌声转换,用冻结的解耦编解码同时取内容与音色特征,再经 EVA 模块融合音高能量并用 DDSP 加扩散两级重建 44.1 kHz 梅尔谱,在不足 80 小时数据与单张消费级 GPU 条件下取得比大资源基线更高的自然度与音高准确性,代价是音色相似度客观指标未全面领先且重建引入可接受的发音音高误差。

 · 更新于 2026-09-24 · 约 20 分钟 · 9818 字 阅读 →
论文解读

把内容音色情感拆干净再拼回去:MF-Speech 的提纯与细粒度指挥

针对语音内容音色情感纠缠与控制粗糙问题,MF-Speech 用三流编码器提纯离散因子再用动态融合与分层风格归一化组合生成,在多因子组合任务上报告 WER 为 4.67% 与 SECS 为 0.5685,但重建自然度与部分解耦指标仍有代价与边界。

 · 更新于 2026-09-24 · 约 19 分钟 · 9399 字 阅读 →
论文解读

把伦巴德效应拆成三层:说话人、音素与帧如何各管一摊

针对正常到伦巴德语音转换中风格与说话人、内容纠缠的问题,ProLombard 用对齐说话人编码、音素级去风格与再注入、VQ 中值下采样三层结构建模,在中英文数据上提升了可懂度和伦巴德相似度,代价是推理仍需目标噪声等级且与真实伦巴德仍有差距。

 · 更新于 2026-09-24 · 约 24 分钟 · 11554 字 阅读 →
论文解读

并行相加代替串行求余:PACodec 如何用小码本做低码率语音编码

PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。

 · 更新于 2026-09-24 · 约 19 分钟 · 9436 字 阅读 →