论文解读

干净集打平、噪声下才拉开差距:SwinV2 与 AST 的蚊种对数加权融合

该研究以六类蚊种图像加 5 秒翅振音频为输入,用 SwinV2 与音频频谱变换器分别输出类别对数再做可学习加权融合,在干净集上融合准确率为 97.8 未超过单模态,而在图像与音频双侧加噪后融合仅下降 4.66 个百分点的代价是需要配对双模态输入与联合微调。

 · 更新于 2026-09-24 · 约 16 分钟 · 7551 字 阅读 →
论文解读

干净高分守不住转码:音频来源归属的编解码压力实测

该文在两个闭集溯源任务上冻结支撑区做前瞻性单阶段编解码压力测量,显示干净 Macro-F1 超 0.97 的表示仍可单点损失超 50 点且损失随条件与表示剧烈变化,而预注册的匹配保真度比较因无共同支撑不可估计。

 · 更新于 2026-09-24 · 约 20 分钟 · 9590 字 阅读 →
论文解读

噪声越大越要看嘴型:AV-STE 在冻结对话模型前修复语义口令

针对全双工语音对话在背景噪声和重叠说话下语义口令损坏的问题,AV-STE 用流式视听编码器加噪声自适应融合在冻结 Moshi 之前恢复第一码本语义口令,同数据集多人干扰下 GPT-4o 连贯性平均从 1.42 提到 1.91,代价是干净语音存在口令失配且依赖可靠唇部视频。

 · 更新于 2026-09-24 · 约 22 分钟 · 10743 字 阅读 →
论文解读

音频幻觉为何总说“有”:用静默对照与首步门控校正肯定偏差的 TAD

针对二元音频问答中模型因语言先验而虚报存在的幻觉,TAD 以静默音频为对照做对比解码并仅在首步用音频增益门控惩罚肯定词,在 AudioCaps-Hallucination 与 Clotho-AQA 上提升拒绝能力但在部分设置下以精度与准确率下降为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9866 字 阅读 →
论文解读

无语音却有文本:用门控低秩投影在解码器表示层抑制 Whisper 幻觉

针对 Whisper 在无语音输入上生成流畅幻觉文本的问题,论文用无语音校准集估计解码器幻觉子空间并在推理时做低秩投影以提升无语音概率,门控版本在保留语音识别的同时把非语音幻觉率大幅降低。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

声调与词义打架时,语音情感识别为何崩溃:TWIN-SER 基准与 DAS 解耦融合

论文针对语调情感与字面语义冲突时主流语音情感识别显著退化的问题,提出解耦声学与语义双通路并做高能量筛选与查询融合的 DAS 框架,在 378 条高冲突 TWIN-SER 上取得 59.38% 加权准确率的最好结果,代价是零样本通用集上不及大预训练模型且小样本恐惧与厌恶类仍难分。

 · 更新于 2026-09-24 · 约 20 分钟 · 9838 字 阅读 →
论文解读

终端一两层决定是否接地:对 ASR 幻觉必要条件的因果定位

论文把幻觉拆为接地失效的必要条件与流畅编造的充分条件,用跳层因果干预定位到编码器最后 1-2 块为接地可恢复边界,并以有效秩压缩、透镜可读性与字形探针收敛作几何与可读性佐证,但干预本身只产生乱码或重复而非流畅幻觉。

 · 更新于 2026-09-24 · 约 24 分钟 · 11668 字 阅读 →
论文解读

加了编解码器训练就掉音质:CRAW 用注意力、掩蔽与纠错把两者拉回平衡

CRAW 针对神经编解码器与去噪重合成导致后处理水印失效的问题,用加宽失真训练加注意力池化加推理时感知掩蔽加重复纠错码,在保持 PESQ 约 4.0 的同时把编解码器与去噪下的检测 F1 拉回 0.8 以上,代价是掩蔽带来约 150 ms 的额外推理延迟。

 · 更新于 2026-09-24 · 约 19 分钟 · 9217 字 阅读 →
论文解读

集中改四秒不等于识别器给全曲:MIDI-SAG 和弦条件传播的配对校准

在固定音轨、种子、上下文与评分窗下,中央 4 秒三全音破坏比完整 CNN-CRF 回放引发更大的伴奏特征偏移,而同时匹配改变支撑与关系构成的合成画像最接近回放响应,但它只缩小条件响应距离,不代表音质提升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7968 字 阅读 →
论文解读

失配时只听一条语音:用干净先验把增强输出推向高密度区

针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。

 · 更新于 2026-09-24 · 约 19 分钟 · 9429 字 阅读 →
论文解读

耳塞在震动什么:骨导语音的低频直线与单轴传感器的容差

语音增强 | 6.3/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10402 字 阅读 →
论文解读

当嵌入不再确定:把不确定性从打分一路带到校准的后端闭环

说话人验证 | 7.8/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11936 字 阅读 →
论文解读

越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索

音频分类 | 7.0/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11424 字 阅读 →
论文解读

听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验

语音伪造检测 | 7.4/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13039 字 阅读 →
论文解读

不改脸只改声:把保护藏进人耳听不见的掩蔽阴影

语音合成 | 4.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11558 字 阅读 →
论文解读

把 2M 维坐标压到一条曲线上:BOGE 如何用物理先验与贝叶斯优化校准水下柔性阵

声源定位 | 5.7/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12536 字 阅读 →
论文解读

给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录

语音识别 | 7.8/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11082 字 阅读 →
论文解读

口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开

语音识别 | 6.9/10

 · 更新于 2026-09-24 · 约 22 分钟 · 11019 字 阅读 →
论文解读

提示词动了,词错误率为什么不动:一次生产级口述史转录的预注册阴性消融

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11646 字 阅读 →
论文解读

干净本身成了开关:当语音增强的理想输出反噬自身

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10275 字 阅读 →