论文解读

跨航次重识别为何难:去重门控与原始波形选择性核的诚实评估

论文将水下舰船识别形式化为开放集跨航次重识别,用航次级音频裁决去重与源纯画廊堵住录音复用捷径,提出原始波形 4 尺度选择性核编码器 SKANN 并在 40 船 IARA 画廊上显示 rank-1 仅 0.25 且去重本身就抹掉 16 至 21 个点的虚高。

 · 更新于 2026-09-24 · 约 20 分钟 · 10002 字 阅读 →
论文解读

口吃与成人插话并存时,音频语言模型为何流畅却不忠实

论文在 22 名口吃儿童的 44 段朗读与访谈音频上用儿童专属摘要与三类蕴含判断对比端到端音频语言模型与 Whisper 与 Granite 转录后接文本大模型的级联基线,发现端到端能生成流畅且纯净的摘要但忠实度偏低且蕴含判断普遍偏向肯定类,口吃密度升高与成人干扰会进一步拉低保真度与矛盾类准确率。

 · 更新于 2026-09-24 · 约 24 分钟 · 11807 字 阅读 →
论文解读

终点相同不等于负担相同:语音客服审计为何要先过验证门

该文把语音客服审计对象定为固定服务事实下的完整服务事件,用七道验证门和六类指标区分最终结果与过程负担,并以全合成退款实例说明方法,全程不报告真系统比较结果。

 · 更新于 2026-09-24 · 约 17 分钟 · 8354 字 阅读 →
论文解读

SDR 相同的鼓声,听感位置却不同:分离模型如何重塑攻击与动态

论文用 50 首带真分轨的歌曲检验 4 代分离模型,显示 onset 位置随 SDR 变好而变准,但攻击斜率与动态包络的失真与 SDR 几乎无关,且固定片段的渲染会随输入长度漂移。

 · 更新于 2026-09-24 · 约 18 分钟 · 8813 字 阅读 →
论文解读

语音不只是文字的喇叭:温暖介导伤害为何必须同时审听觉与文本

在同一模型上以 7 轮 WHO 脚本对比音频与纯文本,音频在诱发轮出现更短更快更低更轻且不更温暖的韵律漂移,文本转录审计会漏检而高风险自伤脚本的模态差异最集中。

 · 更新于 2026-09-24 · 约 20 分钟 · 9684 字 阅读 →
论文解读

终端一两层决定是否接地:对 ASR 幻觉必要条件的因果定位

论文把幻觉拆为接地失效的必要条件与流畅编造的充分条件,用跳层因果干预定位到编码器最后 1-2 块为接地可恢复边界,并以有效秩压缩、透镜可读性与字形探针收敛作几何与可读性佐证,但干预本身只产生乱码或重复而非流畅幻觉。

 · 更新于 2026-09-24 · 约 24 分钟 · 11668 字 阅读 →
论文解读

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

语音识别 | 6.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7727 字 阅读 →
论文解读

Executable Boundary Contracts for Sound Event Traces

音频事件检测 | 8.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9595 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 8.1/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9524 字 阅读 →
论文解读

Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

语音摘要 | 7.2/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11227 字 阅读 →
论文解读

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

多模态模型评估 | 5.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9061 字 阅读 →
论文解读

The Deepfakes We Missed: We Built Detectors for a Threat That Didn't Arrive

深度伪造检测 | 6.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7431 字 阅读 →
论文解读

Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4636 字 阅读 →