论文解读

并行解耦全局与局部:E-Branchformer 在音频伪造检测中的可复述设计

针对语音伪造检测中自监督表示难以同时捕捉长程与短程线索的问题,论文用并行全局注意力与局部卷积分支加解耦类令牌与 DWConv-SE 融合的 E-Branchformer,在 ASVspoof 2021 LA/DF 与 ITW 上取得 0.88%/1.85%/6.30% EER 并在 ASVspoof 5 上取得 5.44% EER,代价是四层编码器与细粒度融 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7822 字 阅读 →
论文解读

冻结表征上分离对比损失与正确配对的语义精炼

在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。

 · 更新于 2026-09-24 · 约 23 分钟 · 11277 字 阅读 →
论文解读

语义不够:语音平均意见分预测为何还需要声学保真度

论文在 BVCC 训练、在 SOMOS 与 BC2019 零样本评测自监督、纯声学与统一编解码表示;融合语义和声学的部分模型有较好表现,但优劣随冻结或微调、数据集及评分或排序指标而变化,跨语种也有例外,不能据此宣布某一表示类别普遍最优。

 · 更新于 2026-09-24 · 约 19 分钟 · 9134 字 阅读 →
论文解读

说话人一换就失准:用更强的判别器逼编码器减少说话人线索

针对未见说话人上情感识别易受说话人差异干扰的问题,论文用 wav2vec 2.0 做编码器、ECAPA-TDNN 做说话人判别器并以熵最大化做对抗,在 IEMOCAP 测试集报告 60.63% UA,代价是交替训练更复杂且存在原文内部数字不一致与未验证的跨库边界。

 · 更新于 2026-09-24 · 约 17 分钟 · 8271 字 阅读 →
论文解读

从听见一个词到认出一个词:LibriBrain100 如何把词分类与跨人泛化变成可比的竞赛

论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。

 · 更新于 2026-09-24 · 约 20 分钟 · 9708 字 阅读 →
论文解读

复述一句就能听出你来过:微调语音如何记住嗓音与录音

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12861 字 阅读 →
论文解读

越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索

音频分类 | 7.0/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11424 字 阅读 →
论文解读

听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验

语音伪造检测 | 7.4/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13039 字 阅读 →
论文解读

没有配对报告时,如何让呼吸声自己找到临床语义?

音频分类 | 7.8/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11049 字 阅读 →
论文解读

类型未知时如何判真假:用两套耳朵听同一段音频

音频伪造检测 | 6.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11814 字 阅读 →
论文解读

用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型

音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10477 字 阅读 →
论文解读

在只有 204 个婴儿的世界里,为什么 97.9% 的准确率不值得庆祝

音频分类 | 8.1/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10819 字 阅读 →
论文解读

当一句“右转航向 150”必须找到那架飞机:语音与轨迹如何在同一个地图上相遇

对比学习 | 7.5/10

 · 更新于 2026-09-24 · 约 32 分钟 · 15572 字 阅读 →
论文解读

只给顺序不给时间:用会遗忘的节奏记忆补上塔布拉转录的弱监督缺口

音乐转录 | 6.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11985 字 阅读 →
论文解读

效果是效果,声音是声音:当表征必须同时记住与忘记内容

音频检索 | 8.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 9008 字 阅读 →
论文解读

没有金标准时,怎么判断对齐切得准不准

语音识别 | 9.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8803 字 阅读 →
论文解读

口音的长尾,为什么让无监督语音表示最先露怯?

语音编码 | 5.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8018 字 阅读 →
论文解读

当 AI 自己给艺术分类:28 个簇与 6 个人类标签的错位

音视频理解 | 4.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9446 字 阅读 →
论文解读

不训练模型,只靠对齐:用图像把英文单词钉到印地语语音里

音频检索 | 7.3/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9174 字 阅读 →
论文解读

Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery

音频理解 | 8.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6292 字 阅读 →