冷启动可用与少样本高精度的分野:域不变韵律与自监督表示的跨域语音钓鱼检测对比
在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。
在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。
针对 GMAW 角焊缝中难以实时发现的五类内部缺陷,论文用 16 帧图像与梅尔声谱的 3D 时序融合加跨块注意力将多模态 F1 提升至 0.99,并以 GradCAM 与 t-SNE 定位每类缺陷的图像关键区与更优模态,代价仅增加 0.1 GFLOPs。
在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。
为解决全模态大模型在图文声三路互斥时把模态偏置与证据形式偏置混为一谈的问题,Tri-PvP 以 8000 样本的四条件匹配反事实与五模型对照揭示视觉主导且视听在感知与命题上不对称,并以早期线性可分与对比解码仅部分缓解且引入文本残余为代价验证偏置的表征根源。
音频分类 | 6.7/10
音频分类 | 5.9/10
音频分类 | 7.0/10
音频分类 | 5.7/10
音频分类 | 7.8/10
语音识别 | 6.8/10
音频分类 | 5.5/10
音频分类 | 8.1/10
音频分类 | 6.0/10
音频分类 | 5.1/10
语音识别 | 8.3/10
音频伪造检测 | 5.8/10
音频分类 | 7.2/10
音频分类 | 8.8/10
音频分类 | 10.0/10
音频分类 | 6.7/10