论文解读
跨航次重识别为何难:去重门控与原始波形选择性核的诚实评估
论文将水下舰船识别形式化为开放集跨航次重识别,用航次级音频裁决去重与源纯画廊堵住录音复用捷径,提出原始波形 4 尺度选择性核编码器 SKANN 并在 40 船 IARA 画廊上显示 rank-1 仅 0.25 且去重本身就抹掉 16 至 21 个点的虚高。
论文将水下舰船识别形式化为开放集跨航次重识别,用航次级音频裁决去重与源纯画廊堵住录音复用捷径,提出原始波形 4 尺度选择性核编码器 SKANN 并在 40 船 IARA 画廊上显示 rank-1 仅 0.25 且去重本身就抹掉 16 至 21 个点的虚高。
论文在 22 名口吃儿童的 44 段朗读与访谈音频上用儿童专属摘要与三类蕴含判断对比端到端音频语言模型与 Whisper 与 Granite 转录后接文本大模型的级联基线,发现端到端能生成流畅且纯净的摘要但忠实度偏低且蕴含判断普遍偏向肯定类,口吃密度升高与成人干扰会进一步拉低保真度与矛盾类准确率。
该文把语音客服审计对象定为固定服务事实下的完整服务事件,用七道验证门和六类指标区分最终结果与过程负担,并以全合成退款实例说明方法,全程不报告真系统比较结果。
论文用 50 首带真分轨的歌曲检验 4 代分离模型,显示 onset 位置随 SDR 变好而变准,但攻击斜率与动态包络的失真与 SDR 几乎无关,且固定片段的渲染会随输入长度漂移。
在同一模型上以 7 轮 WHO 脚本对比音频与纯文本,音频在诱发轮出现更短更快更低更轻且不更温暖的韵律漂移,文本转录审计会漏检而高风险自伤脚本的模态差异最集中。
论文把幻觉拆为接地失效的必要条件与流畅编造的充分条件,用跳层因果干预定位到编码器最后 1-2 块为接地可恢复边界,并以有效秩压缩、透镜可读性与字形探针收敛作几何与可读性佐证,但干预本身只产生乱码或重复而非流畅幻觉。
语音识别 | 6.8/10
音频事件检测 | 8.5/10
基准测试 | 8.1/10
语音摘要 | 7.2/10
多模态模型评估 | 5.5/10
深度伪造检测 | 6.5/10
音频深度伪造检测 | 7.0/10