微调变好还是碰巧配对:同一配方换个预训练 checkpoint 就不再是最优
论文在三个语音分类任务上用九个预训练实例比较八种微调配方,发现统计上不差于最优的顶组身份随 checkpoint 而变,多随机种子还会双向翻转激活成败,因此小幅领先更像实例与种子相关的唤醒匹配而非普遍更高的性能上限。
论文在三个语音分类任务上用九个预训练实例比较八种微调配方,发现统计上不差于最优的顶组身份随 checkpoint 而变,多随机种子还会双向翻转激活成败,因此小幅领先更像实例与种子相关的唤醒匹配而非普遍更高的性能上限。
针对日语书面与口语风格差异导致语音大模型输出不适合语音合成的问题,该研究用直接偏好优化做口语风格对齐,在 SpokenElyza 上相对提升约 18% 而书面任务 Elyza 仅相对下降约 5%。
针对自监督预训练偏重语音内容而忽视局部伪造痕迹的问题,该文提出混帧扰动加帧级监督的中间后训练阶段,在 ASVspoof5 上以无增强单模型取得 4.50% 等错误率,并在 ASVspoof2021 上把 LA 与 DF 差距压缩到 0.16 个百分点,代价是需要额外调拼接比例与 LoRA 位置。
针对塞音嗓音起始时间、闭塞时长与有无爆破三项细粒度标注问题,wav2VOT 把 wav2vec2 改成 1 毫秒帧分类器,先在日语 CSJ-C 大规模训练再向英语多语料微调,在未见数据上与 AutoVOT 相当、微调后显著提升,但小样本微调在录音差异大的语料上会暂时损伤性能。
共分析 34 篇语音/AI 论文
针对 6 月龄到 8 岁儿童音素识别难、标注少的问题,论文整理 TinyVox 并在儿童日常长录音预训练的 BabyHuBERT 上做带 20 秒上下文的 CTC 微调,验证集降到 43.5% 左右的音素错误率,测试集达 42.1% 且替代错误多留在大类内,代价仍是绝对错误率高且依赖粗粒度聚合才显出发育趋势。
针对可解释语音质量评估只给平均意见分而说不清噪声、失真与时间位置的问题,该文用校准加分组相对策略优化的两段后训练改造 Audio Flamingo 3,在 QualiSpeech 上以 0.71 平均 PCC 和 0.76 的 MOS PCC 达到最优,代价是需解冻音频编码器并依赖预定义伪影分类。
针对田野语言建档转写瓶颈,论文提出免代码的 ELAN 到微调再到切分转写流水线 Easper,并在三种瓦努阿图语言上以会话为单位比较五种排序策略,显示优先词汇重复的策略早期字符错误率更低,但干净录音并非无用且结论受语料规模限制。
针对印度语语音克隆掉词慢且部署重的问题,该工作用 10 秒参考音生成合成语料并经四阶段过滤后微调带双位置说话人条件的 FastSpeech2,在印地语等四种语言上把可懂度和自然度做上去,同时把推理加速 53 倍,代价是说话人相似度略低于直接以参考音为条件的基线。
针对嗓音质量语用功能难于快速假设与验证的问题,论文用微调的 VoiceQualityVC 加 Streamlit 交互界面实现词级嘶哑、气息、鼻音调节,以约 17 小时 20 分高表现力语料和 45k 步微调为代价换来可直接对比的刺激生成能力。
针对 Efik 数据稀缺与声调易错问题,研究用约 3 小时 2632 句单人语料微调 VITS、MMS-TTS、SpeechT5 和 Orpheus-TTS 四种模型,母语者评测显示 MMS-TTS 以 3.80±0.63 居首且长文本更稳,但声调与特殊音素问题仍未解决。
针对语音伪造检测泛化差且缺可解释推理的问题,该文用 4 万条人类标注的伪造线索做思维链监督,在 SALMONN 上做二分类与推理联合微调,最强证据是 Test-1-HL 上 EER 从 15.7% 降到 13.2%,代价是推理质量提升小且对高保真未见合成器仍吃力。
针对大音频语言模型音频序列过长导致逐词元解码延迟高的问题,论文用只改监督微调数据的半自回归块并行加模态感知的动态截断,在保持质量的同时报告最高 3.42 倍的每步词元加速,但语音合成任务加速更保守且资源当前不可用。
该研究针对孟加拉语会话缺少轮次结束标注问题,用播客音频加说话人日志加语言模型初标加人工全检构建 35374 条语料,并用 Whisper 编码器加多尺度池化做二分类,在 319 条异源平衡测试集上达到 84.33% 准确率,代价是误报率升至 23.75%。
针对阿联酋阿拉伯语口语与标准语差异大、已有语料多为标准语或埃及黎凡特方言的问题,Hamsa 构建 11 小时人工转写对话语料并用统一超参数微调多语识别模型,最强证据是 Whisper-v2 词错误率从 42.25% 降到 24.46%、字错误率从 71.91% 降到 8.27%,代价是规模仍小、说话人未严格隔离且原始音频暂只提供转写与采集脚本。
针对阿拉伯语发音评估缺乏临床对齐工具的问题,Harf-Speech 用标准音素生成加微调语音转音素加对齐加权评分的模块化路线,在 40 句三位专家评分上达到与专家均分 0.791 皮尔逊相关,代价是临床样本小且依赖微调后的音素识别精度。
针对口语实现与书面形式多对多映射带来的转写不一致问题,论文用输出国际音标与正字法的语音转文本模型加以后续大语言模型做双文本规范化,在英语文本规范化与韩语牙科语料上报告了大幅误差下降,但英语评测依赖合成语音这一受控条件是主要代价与边界。
论文研究仅用一句自然语音做音色参考的个性化电子喉语音转换,对比伪目标训练与级联两条路线,报告最佳特征级级联加有监督微调在 SER 降到 59.65%、相似度到 0.84,代价是需要 240 对平行数据构造伪监督与额外的微调步骤。
论文把每次停顿后的说与不说做成二分类预测,用三域 12 万标注点证明八个大模型零样本都不行,再用带推理蒸馏的有监督微调把平衡准确率提高至多 23 个百分点,代价是仍需文本上下文与标注监督且未验证实时多模态部署。
针对正式语料与日常口语失配导致波斯语识别与翻译退化的问题,论文构建 36.77 小时口语优先的非正式平行语料 T-PID 并做针对性文本规范,再在该语料上微调 Whisper 与 Wav2Vec2-BERT 和 NLLB-200,在 T-PID 及正式集上同时降低词错误率并提升 BLEU,代价是英文译文主要由机器生成加抽检、附着词等细节未统一且资源当前不可用 …