SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
📄 抹掉谁在说话,才能听清他什么心情 英文题目:SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training 一句话:针对跨说话人情感泛化难的问题,SISER 用 wav2vec 2.0 做表示、用 ECAPA-TDNN 做强判别器并以熵最大化逼均匀后验,在 IEMOCAP 上取得测试 UA 60.63%,代价是仅单语料验证且部分折出现退化。 标签:#语音情感识别 | #对抗训练 | #说话人验证 | #自监督学习 评分:6.5/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Eunseo Choi:机构信息未在 arXiv HTML 中可靠披露 Hyunku Kang:机构信息未在 arXiv HTML 中可靠披露 Chanwoo Kim:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把说话人验证领域的强判别器拿来做对抗压力源的想法直观有效,消融也确实指向判别器容量是关键变量。硬伤是全文证据锁死在 IEMOCAP 单语料上,且验证集与测试集口径、前后文数字多处打架,让所谓说话人不变更像特定划分下的拟合红利而非可外推结论。 ...