论文解读

先猜五维再对波形:可微合成与粒子群如何把板混响参数推到近乎完全恢复

任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9470 字 阅读 →
论文解读

深度冗余时做减法:用浅层对齐让伪造语音检测走得更远

针对 Transformer 伪造语音检测器深层冗余且域外泛化差的问题,论文用 XLS-R 加 1 到 4 层 MTLA 分类器并以角距离把浅层向末层对齐,在 19LA 训练、多域评测下以 479.11K 分类器参数取得域外增益,但过强对齐与过深堆叠仍会退化。

 · 更新于 2026-09-24 · 约 20 分钟 · 9858 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-12

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 79 分钟 · 39128 字 阅读 →
论文解读

以关键姿态为动机:MotivDance 如何把细粒度文本钉到音乐节拍上再补间成舞

针对只有音乐输入而缺乏动机控制的问题,MotivDance 用文本生成关键姿态作动机、自适应定位到音乐节拍再做扩散补间,在 AIST++ 稀疏关键帧上取得 FIDk 64.36 与关键帧误差 0.1211,但无关键帧时节拍对齐仍弱于部分基线。

 · 更新于 2026-09-24 · 约 22 分钟 · 10641 字 阅读 →
论文解读

先学走再学舞:用掩码动作先验统筹音乐、体裁与姿态的可编辑舞蹈合成

针对音乐舞蹈需同时逼真、对拍、多样、物理合理且可编辑的问题,论文以文本到动作掩码模型为先验并外挂音乐塔与姿态塔,在 FineDance 上把运动质量与多样性推高并实现快速推理,但节拍对齐并未登顶且依赖渐进训练与推理优化协同。

 · 更新于 2026-09-24 · 约 17 分钟 · 8179 字 阅读 →
论文解读

把海豚叫声当连续向量做渐进式对齐:高斯核替代离散打分的多序列比对

针对海豚发声时长伸缩与连续频谱难以直接比较的问题,论文将 ClustalW 的离散替换得分改为高斯核平均相似度并配合微调 Whisper 的 128 维嵌入做渐进式多序列比对,在成体攻击与幼体游戏攻击两类精细策展数据上以间隙结构与列方差等指标验证了对齐能恢复同步化爆脉冲等时序母题,但代价是领域适配与早停阈值仍需人工校准且过度拉伸会稀释时间分辨率。

 · 更新于 2026-09-24 · 约 29 分钟 · 14278 字 阅读 →
论文解读

混合一致性约束下为何需要多输入多输出的迭代精炼

针对混合一致性要求下单步回归难以迭代纠错的问题,论文将任意分离模型扩展为多输入多输出并配合投影与递增加权损失实现多轮互精炼,在 MUSDB18-HQ 上以 BS-RoFormer 与 SCNet 为骨干取得一致提升,但判别器与生成式扰动的收益依赖配置且迭代带来线性计算开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9669 字 阅读 →
论文解读

当所有声部都是人声:用主唱音素对齐区分主唱与伴唱的分离路径

针对六声部无伴奏合唱中主唱与伴唱音色高度相似、时域重叠的分离难题,论文在 BS-RoFormer 主干中以帧级主唱音素对齐经 FiLM 逐层调制中间表示,并在 jaCappella 上以理想对齐条件验证其对 Vo 与 Other 两路 SI-SDRi 的提升及随音素重叠度变化的增益边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9708 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 93 分钟 · 46170 字 阅读 →
论文解读

加了编解码器训练就掉音质:CRAW 用注意力、掩蔽与纠错把两者拉回平衡

CRAW 针对神经编解码器与去噪重合成导致后处理水印失效的问题,用加宽失真训练加注意力池化加推理时感知掩蔽加重复纠错码,在保持 PESQ 约 4.0 的同时把编解码器与去噪下的检测 F1 拉回 0.8 以上,代价是掩蔽带来约 150 ms 的额外推理延迟。

 · 更新于 2026-09-24 · 约 19 分钟 · 9217 字 阅读 →
论文解读

生成用短时谱、判别用对数谱:DSME 为何把预测与判别分开

DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。

 · 更新于 2026-09-24 · 约 19 分钟 · 9394 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19562 字 阅读 →
论文解读

先分好组再混音:为什么两阶段不是技巧,而是分工

音乐生成 | 7.0/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9703 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24532 字 阅读 →
论文解读

不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer

音乐转录 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11036 字 阅读 →
论文解读

相位不再复用:当 Transformer 学会看懂复数谱图

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11532 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34077 字 阅读 →
论文解读

用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型

音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10477 字 阅读 →
论文解读

议会里的声音政治学:当情感、犹豫与重音在四种斯拉夫语中分道扬镳

语音情感识别 | 5.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11892 字 阅读 →
论文解读

相位越不准,幅度越要背锅:用频带加权把流式增强从过衰减里拉回来

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10215 字 阅读 →