希腊语歌声转写:规模放大适配效果,小模型靠翻译正则,大模型靠两阶段专注
该研究把希腊音频数据集扩展为片段对齐的歌词转写基准,在同一协议下对比 Whisper 三种规模与转写翻译配比及先语音后歌声的两阶段适配,报告 Large-v3 两阶段词错误率 27.2%,代价是翻译辅助只在小容量模型上为正且增强与复调训练均未获益。
该研究把希腊音频数据集扩展为片段对齐的歌词转写基准,在同一协议下对比 Whisper 三种规模与转写翻译配比及先语音后歌声的两阶段适配,报告 Large-v3 两阶段词错误率 27.2%,代价是翻译辅助只在小容量模型上为正且增强与复调训练均未获益。
该研究在 2000 句共享英语-约鲁巴语码切换集上对比 6 个专用语音识别系统与 5 个音频语言模型,报告 Parakeet 与 Kimi-Audio 总词错率几乎相同但后者在切换边界显著更好,代价是约鲁巴语词错误普遍超过 97% 且生成式模型存在提示依赖的过度生成。
针对喙鲸回声定位点击序列中因转向或停叫造成的长检测空缺,论文用基于置信传播的多目标跟踪先产生碎片轨迹,再经平滑与拼接补全连续轨迹,在仿真与 5 段真实数据上以 GOSPA 总误差下降为证据,但拼接同时抬高了定位与虚假目标误差。
该文针对泰语、越南语、斯瓦希里语和印尼语构造六类复杂文本诊断集,用内容一致性、语言一致性和生成稳定性三维指标比较 OmniVoice、VoxCPM2 和 MMS-TTS,发现数字日期与混写输入带来最集中的内容与时长失效,而轻量文本风险分与内容错误呈中等正相关但几乎不能预测语言混淆。
论文诊断单池逐层裁剪在语音大模型中的跨组件预算崩溃,提出双池 α-split 在保持联合灵敏度与全局 DP 保证不变下恢复可用词错误率,并以编码器 4.47 倍等效噪声换取语言模型仅 2.6% 开销。
针对重复扩展使时长只改变出现位置而不改变表示取值的问题,该文把音素加时间通道作控制路径并用神经向量场求解受控微分方程产生连续隐状态,在情感语音上以单层每步一音素取得宏观 Spearman 排序相关 0.53 高于微调基线 0.08,但绝对校准与感知质量仍随情绪和分辨率变化。
针对标准 LZ 压缩倾向于整段拷贝训练数据的问题,该文用限制每棵树训练数据量来缩短平均序列长度、用多步不回根来加长平均序列长度,并在 MAESTRO 约 200 小时钢琴 MIDI 音高数据上验证了控制方向,代价是省略节奏导致机械感与长序列带来的逐字拷贝风险仍需抄袭检测来界定。
针对短停顿标注松紧不一致会抬高日志误差率并掩盖真实模型误差的问题,论文保留标准 DER 不变并将其精确拆分为停顿归因部分与残余核心部分,最强证据是合成变换只把填充归为停顿而插入与移位仍留在核心,代价是核心误差不能单独优化且跨不同松紧参考不可直接比较。
论文把多通道回放检测定义为按声学环境逐个学习的域增量问题,用 ReMASC 全部 24 种顺序对比朴素微调、EWC、GPM 与任务专用波束形成器,最强证据是 TSB 显著降低平均错误率但未减少遗忘,而最后出现的环境主导最终性能。
针对人听希望去噪干净而识别前端怕语音失真的问题,论文用源条件与额外标记两类提示扩展统一分离模型并按提示切换标准损失与正则损失,英日噪声实验显示识别分支降低了词错误率与字错误率而高质量分支保持了重建质量,代价是识别分支牺牲客观质量且仍未超过推理期混合基线。
针对单通道双人语音分离,eConv-TasNet 在保留编码器解码器基础上以组级早分离替代逐单元分离并以指数加权跨组聚合替代全量求和,在多基准上提升分离质量并降低参数与延迟,代价是峰值精度仍低于大参数 Transformer 路线。
该文把说话人身份当作一阶模式,把表征聚类当作刻画网络认法 的二阶模式,用单链接聚类发现、用语义匹配解释、用基于梯度代价外推的新方法判定未见语音归属,报告显示路径完整度从百分之十一点六八升至百分之三十四点一九,原子语义召回从零点五一一九升至零点五六六九,但国籍召回仍明显偏低。
该文用 14 维说话人一致构音特征比较 VCTK 苏格兰、英格兰、爱尔兰口音,以 DTW 对齐达到 99% 分类准确并以最优传输扩展到非平行语料,但 OT 需要约 7.5 分钟语音和上百聚类点才稳定。
论文用真实法语对话构造 CALLFC-FDB 与 MEDIA-FDB 并复用 FDB v1.0 四类任务,显示基于语音活动的计时指标跨语言基本稳定,而用户打断评分等内容指标在语言失配时明显下降,人-人对话则说明一味优化指标会损失自然度。
该文在 FSD50K 与 AudioSet 上以 30 类起步加 4 个 5 类增量任务比较冻结、蒸馏与核级可塑性调制,报告显示冻住卷积特征并只微调动态分类头遗忘最小而核级约束反而更不稳定,但新类学习能力仍低于联合训练。
该文把求载波复音以产生目标二次差频谱的问题转成学习失真函数连续近似逆,用齐次结构加课程式训练换来可实时插值的合成器,代价是重建误差略高于随机牛顿迭代。
论文用同一轻量三流分类器穷举声学、韵律、文本七种组合,发现声学加韵律在相同训练下取得最平衡的准确与延迟,而加入文本只增加抢话误报且不能提升性能。
针对看图说话中词汇语义与发音 timing 互补但贡献不均的问题,LAPE 以大语言模型文本表示为锚,把停顿与拖长写进转写并做事件保持组块与门控融合,在 ADReSS 与 ADReSSo 的五折与留一被试评估中均取得最高准确率,代价是依赖词时间戳与多路语音特征的完整流水线。
论文把带噪标注起点建模为真实起点加偏移并用期望最大化估计数据集级均值来校正起始偏差,同时用对角状态空间模型 S4VAD 实现流式低延迟检测,在合成朗读混合与真实电影语音上报告了更低的起始偏差与延迟分布尾部,但结论依赖参考模型质量与有界独立噪声等假设且本次无可用代码资源。
论文针对开放式情绪推理中多面幻觉难评估、粗粒度缓解顾此失彼的问题,提出六面 EHR 评估与免训练 HMER 框架,在 19 个模型上显示幻觉普遍存在,而 HMER 在多数据集上降低总体幻觉率并保持情绪预测准确率,代价是迭代评估带来额外 token 与延迟。