跑调的人声如何借伴奏找回调:MIDIBack 的联合符号建模
MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。
MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。
针对全双工语音对话持续暴露声学通道的问题,论文用掩蔽阈值约束的不可闻扰动形式化劫持、静默与越狱三类攻击,并以码本几何与掩蔽匹配的潜变量平滑加一致性训练把劫持从 91.7% 降到 8.3%,代价是 UTMOS 相对下降 2.3% 且认证半径只到 0.616 的保底水平。
针对离散词元依赖单一编码器切分的问题,该文把三个固定自监督编码器当作同一句话的多种分词器来训练一个共享大语言模型解码器,在保持单编码器推理成本下把 WavLM 视角做到 LibriSpeech 干净集 3.30% 与其他集 8.13%,再用三路 ROVER 投票做到 3.03% 和 7.38%,代价是训练量变为三倍且泛化仍受限。
论文在事件决定声音、外观只影响视频的结构因果模型下证明并验证共享隐变量仍学颜色等视觉捷径,而对 nuisance 做反事实不变干预才能恢复因果预测,代价是需要已知且可增强的 nuisance 并在分布内付出小额误差。
DFD-Lab 把数据集适配、配对片段表示、检测器接口与实验配置分开,用 FakeAVCeleb 训练、过滤后的 Deepfake-Eval-2024 外部测试三类融合实现,最一致的证据是 JPEG50 训练增强把外部 AUROC 从 0.504、0.538、0.458 分别提升到 0.691、0.605、0.570,但三者准确率同时从 …
针对约旦方言标注语音稀缺问题,论文用 Wav2Vec 2.0 自监督表示做起点,再以五轮噪声学生训练迭代利用未标注与增强语音,在 12.5 小时标注加五批各 2.5 小时未标注条件下把词错误率降到 51%,代价是多轮大模型迭代需要双卡 83 小时级训练开销。
针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …
该文针对采样识别中人工合成对难以模仿真实制作变换的问题,提出在真实采样对上全监督训练的 SIE 模型与训练配方,并在三个基准上报告优于前最优的结果,同时用对照实验说明数据替换与架构配方各自的贡献与代价。
针对日语无切分与多音字难题,该研究用词典格子约束候选、用字符级语境打分选择路径,并用大模型标注约两百多万句训练,常用汉字读音基准上报告 99.62% 目标词准确率,代价是专有名词与数字归一化仍需外挂模块。
论文把只检测持续在场主讲人的前景语音检测形式化为免注册逐帧二分类,用前景标签不变加竞争说话人混合的自动监督 recipe 让轻量流式 Mamba 在受控混合与真实远场上压低背景误报,同时在常规检测上保持可用,代价是目标不再占优与强语音形掩蔽下召回下降。
该研究把 8 类独奏谱面图像转成 bootleg score 词序列做文本分类,用无标注语言模型预训练把 RoBERTa 片段准确率从 34.5% 提升到 42.9%,再用移调式训练与测试增强推到 58.8%,代价是长片段整页推理退化和大偏移抹掉音域线索。
在 3100 段 31 类无人机音频上,论文系统比较卷积与 Transformer 架构加全量微调与四种参数高效微调,最强证据是 EfficientNet-B7 批归一化微调加三倍增强取得最高验证精度且只训练极小比例参数,而轻量卷积在精度与训练效率上普遍优于 Transformer。
针对推理时拿不到参考音频文本的跨语言克隆问题,该文用预训练 F5-TTS 合成同说话人提示做监督微调并配合静音鲁棒语速预测器,在 LibriSpeech-PC 上 WER 为 2.014% 且相似度提升,代价是自然度小幅下降。
为在指定文本位置可靠生成 16 类非言语发声,该工作用连续隐变量 DiTAR 加专用标签与停顿判别建模,以双语预训练加针对性合成与频率重采样补长尾,再用解码参数搜索与五选一多指标选样提升鲁棒性,最终以双语加权 62.786 获 Track 2 总分第一,代价是额外推理计算与英文控制仍待加强。
针对音频频谱变换器被 SpecAugment 零值块拖慢训练的问题,该文把掩码对齐到切块网格并只合并全零块,在 Balanced AudioSet 上 r 从 0 增至 100 时吞吐从 43.3 提至 49.3 samples/sec 而 mAP 维持 34.07 到 34.08,代价是可合并比例受掩码块数量上限约束。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
该研究用 Seed-VC 把健康对照的持续元音转换成癌与良性黏膜病变的嗄声并请专家做 GRBAS 与四级可信度评定,结果显示转换声不总被判为人工但仍可被感知且常规声学差值解释不了,提示先别直接拿去训练分类器。