论文解读

冷启动可用与少样本高精度的分野:域不变韵律与自监督表示的跨域语音钓鱼检测对比

在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。

 · 更新于 2026-09-24 · 约 20 分钟 · 9577 字 阅读 →
论文解读

在熔池时序中找缺陷:多模态时序注意力如何把 GMAW 角焊缝的隐蔽缺陷检出率推到 0.99

针对 GMAW 角焊缝中难以实时发现的五类内部缺陷,论文用 16 帧图像与梅尔声谱的 3D 时序融合加跨块注意力将多模态 F1 提升至 0.99,并以 GradCAM 与 t-SNE 定位每类缺陷的图像关键区与更优模态,代价仅增加 0.1 GFLOPs。

 · 更新于 2026-09-24 · 约 21 分钟 · 10031 字 阅读 →
论文解读

冻结表征上分离对比损失与正确配对的语义精炼

在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。

 · 更新于 2026-09-24 · 约 23 分钟 · 11277 字 阅读 →
论文解读

Tri-PvP:用感知与命题的正交冲突把模态偏置从证据形式偏置中剥离

为解决全模态大模型在图文声三路互斥时把模态偏置与证据形式偏置混为一谈的问题,Tri-PvP 以 8000 样本的四条件匹配反事实与五模型对照揭示视觉主导且视听在感知与命题上不对称,并以早期线性可分与对比解码仅部分缓解且引入文本残余为代价验证偏置的表征根源。

 · 更新于 2026-09-24 · 约 25 分钟 · 12503 字 阅读 →
论文解读

先听见,再分清:两级级联如何把稀有虎鲸从海噪里捞出来

音频分类 | 6.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9076 字 阅读 →
论文解读

关掉麦克风不行,擦掉人声才行:助老监听的隐私防火墙

音频分类 | 5.9/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12221 字 阅读 →
论文解读

越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索

音频分类 | 7.0/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11424 字 阅读 →
论文解读

别只看频谱长什么样:用 19 维力学视角重写环境声音的描述方式

音频分类 | 5.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9991 字 阅读 →
论文解读

没有配对报告时,如何让呼吸声自己找到临床语义?

音频分类 | 7.8/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11049 字 阅读 →
论文解读

用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输

语音识别 | 6.8/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12869 字 阅读 →
论文解读

把咳嗽声拆开:用高斯对齐让模型忘记敏感属性

音频分类 | 5.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10348 字 阅读 →
论文解读

在只有 204 个婴儿的世界里,为什么 97.9% 的准确率不值得庆祝

音频分类 | 8.1/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10819 字 阅读 →
论文解读

波形有用,不等于必须调用生成式音频模型

音频分类 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8679 字 阅读 →
论文解读

在茶树里听见白蚁:当 81.5% 的准确率比 98% 更诚实

音频分类 | 5.1/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11553 字 阅读 →
论文解读

先别让模型开口:当语音大模型需要学会拒绝

语音识别 | 8.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7960 字 阅读 →
论文解读

别只听响度:为什么 AI 炸点声会在“尾巴”里露馅

音频伪造检测 | 5.8/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8682 字 阅读 →
论文解读

别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5815 字 阅读 →
论文解读

一条咳嗽模型的跨国体检:高分为何更像设备在说话

音频分类 | 8.8/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5492 字 阅读 →
论文解读

PolyChirp: Multi-Species Birdsong Classification Using TinyML on Low-Power Acoustic Sensors

音频分类 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4900 字 阅读 →
论文解读

ChiroEcho: extending automated bat vocalisation classification beyond the learned taxonomy

音频分类 | 6.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5454 字 阅读 →