论文解读

多而不杂才有用:用来源与生成器多样性重组语音伪造检测训练数据

该文研究未见伪造方法下的泛化问题,选择先量化来源与生成器多样性的扩展规律再做异构数据混合,用 12k 小时 DOSS 加权训练在公开集和商用 API 集上超过 74k 小时基线,但大 Nc 与极端温度仍会退化且多语覆盖有限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9633 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

伪造语音检测为何在实验室外失灵:把非语音当捷径的诊断框架

论文把声纹伪造检测的跨库崩溃拆成捷径依赖与域偏移两类失败,用有向图加受控声学干预证明非语音结构是主捷径,而针对性增强能解耦但要付出域内代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9257 字 阅读 →
论文解读

只会说还不够:复杂文本如何暴露低资源多语语音合成的系统性失效

该文针对泰语、越南语、斯瓦希里语和印尼语构造六类复杂文本诊断集,用内容一致性、语言一致性和生成稳定性三维指标比较 OmniVoice、VoxCPM2 和 MMS-TTS,发现数字日期与混写输入带来最集中的内容与时长失效,而轻量文本风险分与内容错误呈中等正相关但几乎不能预测语言混淆。

 · 更新于 2026-09-24 · 约 26 分钟 · 12570 字 阅读 →
论文解读

退化信道复制了伪造痕迹:混合域适应如何挽回检测失效

针对三种真实退化信道下 11 种零样本克隆把验证错误率推高且预训练检测接近失效的问题,论文用混合标准库与域内退化语音的微调把已知攻击检测恢复到低错误率并改善部分未知攻击,代价是高保真未知攻击与小模型遗忘仍未解决。

 · 更新于 2026-09-24 · 约 21 分钟 · 10485 字 阅读 →
论文解读

不重训识别器:在语言向量空间里把失真推回干净流形

针对噪声混响等导致语言向量漂移的问题,该文冻结语种识别器并在其输出向量上学习流匹配变换,用五语种失真配对实验把 ECAPA 整体准确率从 0.6900 提升到 0.8672,代价是推理需 50 步常微分方程求解且法语等个别情形仍弱于波形前端。

 · 更新于 2026-09-24 · 约 17 分钟 · 8373 字 阅读 →
论文解读

在嵌入空间做生成式后端:FM-SEE 如何把教师嵌入推向干净分布

针对声学失配下说话人嵌入漂移问题,论文用条件流匹配在嵌入空间学习从高斯噪声到干净教师嵌入的映射,并用多次采样估计目标分数均值做分数归一化,在七个数据集上平均相对降低等错率约 17%,代价是推理需多步常微分方程求解且在干净匹配条件下几乎无增益。

 · 更新于 2026-09-24 · 约 18 分钟 · 8885 字 阅读 →
论文解读

把预训练语音模型改成高层专家分工:抗伪造要在保留表示的前提下做稀疏扩容

针对未见合成方法泛化难的问题,论文把 WavLM-Large 部分高层的前馈块替换为多专家并用门控做整句选路,在 14 个评测集上把宏平均等错率从 5.46% 降到 4.81%,代价是参数增至 329M 且需全量微调。

 · 更新于 2026-09-24 · 约 19 分钟 · 9258 字 阅读 →
论文解读

增强把分类变难之后,损失与采样如何跟上:速度扰动与混合增强的协同

论文研究说话人识别中速度扰动和混合拼接增强如何加大训练难度,提出用杰弗里斯损失约束非目标分布并用面向近邻的混合采样供给局部样本,在多组失配评估上报告稳健性方向,同时显示单阶段联合多种增强会使判别过难而分数融合更稳妥。

 · 更新于 2026-09-24 · 约 21 分钟 · 10207 字 阅读 →
论文解读

在各向异性主成分平面里小角度旋转:无须训练的盲语音水印

针对生成语音溯源需要的盲检测水印问题,论文选择在预训练编解码器隐空间做密钥控制的正交小旋转,最强证据是跨数据集干净条件下正确密钥可检而错误密钥回到随机猜测,主要代价是高通滤波下检测下降且仅做客观质量估计。

 · 更新于 2026-09-24 · 约 20 分钟 · 9845 字 阅读 →
论文解读

噪声下转写为何失效:把语音识别改写为语义引导的重建

针对噪声导致语言结构坍塌与语义模糊,论文提出 Speech-MLM 用频谱视觉结构、复述文本语义与门控跨模态融合做重建,在多噪声集上报告词错误率与语义相似度同步提升,但多分支带来推理开销与复述质量依赖。

 · 更新于 2026-09-24 · 约 20 分钟 · 9629 字 阅读 →
论文解读

同一骨干跑通检测与分类:MEGConformer 靠归一化弥合保留集偏移

该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
论文解读

总体学好了不等于每种攻击都学好:高影响攻击的主导与课程缓解

该文在 ASVspoof 2019 上用省略敏感性与熵损失诊断出 A1 与 A4 等高影响攻击,再用先学低影响后适配高影响的重放课程把跨数据集总体 EER 明显压低,代价是两阶段训练与四项正则的额外复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8779 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

同骨干双模态检索:OEA 以统一编码换文本理解与排除能力

OEA 用冻结多模态大模型加 LoRA 统一编码文本与音频,在文本到音频上与 M2D-CLAP 接近,在文本到文本与硬负例排除上明显占优,代价是更大的显存与离线音频编码开销。

 · 更新于 2026-09-24 · 约 16 分钟 · 7775 字 阅读 →
论文解读

2 比特是膝点:说话人确认中量化误差从哪里来、如何翻转判决

该文用均匀 K 均值量化感知训练在 ResNet-36 与 ResNet-200 上定位 2 比特为主要退化区间,以分数漂移与阈值附近有害翻转解释退化,并用 2/3/4 比特校准级联在接近 FP32 性能下降低平均计算代价,但三模型常驻带来内存代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10370 字 阅读 →
论文解读

合成语音的情感为何听得清却认不准:语音情感识别的合成域失效

论文追问在人类语音上训练的情感理解能否直接用于合成语音,通过跨数据集、跨判别式与生成式模型、跨 TTS 与 S2S 合成的系统评测,显示人类与合成之间存在约 38 个百分点的识别差距,且主要代价来自语音 token 预测阶段的表示偏移与生成式模型的文本主导偏置。

 · 更新于 2026-09-24 · 约 19 分钟 · 9120 字 阅读 →
论文解读

余弦已很强时为何还要 PLDA:联合微调对齐嵌入与打分的防欺骗说话人确认

该文以 ECAPA-TDNN 嵌入为基础比较余弦与多种 PLDA 后端,提出嵌入提取器与判别式 PLDA 端到端联合微调,在 VoxCeleb1 上联合模型取得 PLDA 类最优而余弦仍保持最佳区分性,在 ASVspoof2019 上余弦的 a-DCF 最优而联合模型是 PLDA 类中最优,代价是流程更复杂且 t-DCF 未见统计显著优势。

 · 更新于 2026-09-24 · 约 16 分钟 · 7583 字 阅读 →
论文解读

不改伪标签,在参数空间里纠正伪标签:Pseudo2Real 的跨口音修正向量

针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →