论文解读

不是越不像越好:把遗忘相似度锚定到陌生人水平的说话人遗忘

针对零样本语音合成中退出说话人仍可被画廊检索重新识别的问题,GUARD 在冻结主干上用门控加逐层激活 steering 并以生成后奖励把遗忘相似度推向人群冒名者水平,在 CosyVoice2 上把遗忘相似度从 0.541 降到 0.103、150 人画廊重识别从 73.5% 降到 0.5%,代价是保留集与可懂度基本不变但新增门控与奖励调参依赖。

 · 约 18 分钟 · 8712 字 阅读 →
论文解读

说话人向量为何按性别国籍分层:用单链接聚类与匹配打开黑盒

该文用单链接层次聚类分析说话人向量是否形成层次结构,再以总体匹配与一一匹配加诊断性分数解释性别国籍与身份语义,最强证据是身份与性别接近完全对齐而部分国籍组合匹配明显偏低且可归因到精度不足。

 · 更新于 2026-09-24 · 约 15 分钟 · 7308 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

对齐到文本之后,说话人信息去哪了:残差、层权重与注意力权重的三路核查

论文追问句级语音语义向量是否还残留可用的说话人信息,用与各自对齐几何一致的音频减文本残差做无监督聚类检验,并用冻结编码器的说话人分割层权重与帧级注意力分布定位信息位置,最强证据是按句聚类准确率仍高达 0 点 96 以上而按说话人聚类接近随机,代价是该结论只在朗读平行语料与特定分割流程下成立。

 · 更新于 2026-09-24 · 约 21 分钟 · 10092 字 阅读 →
论文解读

说话人向量记得是谁,却也记住了房间:噪声、混响与修复如何重塑嵌入空间

该研究以 LibriTTS 子集与 LibriTTS-R 对照比较 X-Vector 与 ECAPA-TDNN 在加噪、混响、加静音与神经声码器重建下的嵌入空间结构,报告 ECAPA-TDNN 更稳健但强混响与音频修复仍使类间可分性与最近说话人分类明显下降,而 X-Vector 对环境伪影更敏感。

 · 更新于 2026-09-24 · 约 17 分钟 · 8298 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只用语音活动判断和谁在交谈:多人轮替如何变成可计算的对齐分数

针对助听器要在多人同场中判断助听器用户想和谁交谈的问题,论文提出只用每人二值语音活动流的多人贝叶斯最小重叠间隙框架,用会话对齐分数刻画群体轮替,并在真实 2、3、4 人对话上分别报告 97.1%、90.1% 和 90.4% 的平均伙伴识别准确率,代价是需要数十秒到数百秒的积分窗口才能观察到充分轮替。

 · 更新于 2026-09-24 · 约 18 分钟 · 8690 字 阅读 →
论文解读

从原始音视频算起:用参考锚定身份再推理社交指向

论文提出只用原始音视频判断最后说话人在跟谁说话的 Omni-MMSI 任务,并用参考引导的工具抽取加两步思维链推理的 Omni-MMSI-R 解决身份归属难题,在 Ego4D 和 YouTube 上取得报告的最优准确率,代价是需手工构建参考对和过滤生成推理标注。

 · 更新于 2026-09-24 · 约 19 分钟 · 9246 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

网络先认说话人,聚类再认网络的认法:二阶模式识别如何判定未见语音

该文把说话人身份当作一阶模式,把表征聚类当作刻画网络认法 的二阶模式,用单链接聚类发现、用语义匹配解释、用基于梯度代价外推的新方法判定未见语音归属,报告显示路径完整度从百分之十一点六八升至百分之三十四点一九,原子语义召回从零点五一一九升至零点五六六九,但国籍召回仍明显偏低。

 · 更新于 2026-09-24 · 约 19 分钟 · 9366 字 阅读 →
论文解读

整句重复又帧内粘连:MelTrim 先按声音粗筛再按梯度细剪做语音分类剪枝

针对语音分类中整句之间与句子内部同时冗余的问题,MelTrim 先用声学特征聚类做整句粗筛,再用冻结判别模型梯度范数做帧级细剪,在极小子集上取得明显精度优势,但选择本身带来一次性开销且当前只验证单一声学模态。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

多人对话先找对说话人,再把文本的情绪理解教给声音和画面

该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。

 · 更新于 2026-09-24 · 约 17 分钟 · 8365 字 阅读 →
论文解读

不加噪声也能留后门:用整体起伏的频率与响度曲线触发说话人识别

针对闭集说话人识别的投毒后门问题,论文用时域上的频率调制与幅度调制构造全局平滑触发,在中毒率 0.05 等条件下报告数字与物理场景的高攻击成功率,同时保持良性准确率下降有限,但干净标签等更难设置的性能明显走弱。

 · 更新于 2026-09-24 · 约 21 分钟 · 10473 字 阅读 →
论文解读

把“谁何时说了什么”一次生成:SpeakerLM 如何统一日志与识别并兼容注册条件

针对级联式说话人日志与识别中误差传递与重叠语音难处理的问题,SpeakerLM 用音频编码器加投影器接入大语言模型的端到端多模态方案,在约 7638.95 小时数据下主指标超越最强级联基线,但小数据与仿真失配时仍明显落后。

 · 更新于 2026-09-24 · 约 18 分钟 · 8705 字 阅读 →
论文解读

AMR: Adaptive Modality Routing for Multimodal Polyglot Speaker Identification

说话人识别 | 7.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6161 字 阅读 →
论文解读

DG^VoiC: Speaker Clustering for Fraud Investigation under Real Call-Centre Conditions

说话人识别 | 5.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4463 字 阅读 →
论文解读

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

说话人识别 | 6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5549 字 阅读 →