HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

📄 HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition 标签:#多任务学习 #多模态模型 #模型集成 #音视频 #音频理解 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.5/1.5 ✅ 7.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频 | #多任务学习 | #多模态模型 #模型集成 | arxiv 👥 作者与机构 第一作者:Aleksei Bakin 通讯作者:Andrey V. Savchenko (av savchenko@hse.ru) 作者列表:Aleksei Bakin(Sber AI Lab, Moscow, Russia / HSE University, Laboratory of Algorithms and Technologies for Network Analysis, Nizhny Novgorod, Russia)、Andrey V. Savchenko(Central University, Moscow, Russia) 💡 毒舌点评 这篇论文堪称竞赛驱动型工程研究的模范生,它用“冻结主干、精调后处理”的哲学,在ABAW-11挑战赛中打出了极其高效且可复现的成绩单。其系统化地验证了,在有限数据和资源下,投资于预测校准(平滑、偏差、阈值)和智能融合,其收益可能超过盲目增大骨干模型。然而,这种“调参炼丹术”的胜利,掩盖了方法学内核的薄弱:所有后处理技术(高斯平滑、坐标搜索阈值)均为经典技巧的组合,缺乏对“为何有效”的理论洞察或数据驱动发现。论文的结论声称“可媲美更重的端到端方法”,但在MTL任务上,其验证集分数(1.56)并未超越ABAW-7冠军Netease Fuxi(1.53)在相同验证集上的结果,且对比的基线是过时的ConvNeXt,而非最新SOTA;影响力也仅限于ABAW竞赛的窄众圈子,对更广阔的音频/语音研究领域几乎没有方法论层面的启发。 ...

2026-07-15 · 更新于 2026-08-14 · 4 min · 669 words

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

📄 Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video 标签:#模型集成 #音频理解 #Transformer #模型评估 9.0/10 | 创新 1.2/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 9.0/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:高 | #模型集成 | #Transformer | #音频理解 #模型评估 | arxiv 👥 作者与机构 第一作者:Vikas Kumar (Indian Institute of Science Education and Research Bhopal, India) 通讯作者:未说明 (论文中未明确标注通讯作者) 作者列表:Vikas Kumar (Indian Institute of Science Education and Research Bhopal, India), Aditya Mishra (Indian Institute of Science Education and Research Bhopal, India), Haroon R. Lone (Indian Institute of Science Education and Research Bhopal, India) 💡 毒舌点评 本文最大的贡献在于其诚实的工程复现精神和对“校准大于架构”这一实践洞察的深刻揭示。ASR-erased time 特征的挖掘体现了对数据特性的敏锐观察。然而,论文标题和摘要都强调“video”中的矛盾犹豫识别,但实验结果雄辩地证明其视觉通道几乎完全无效,系统实质上是一个“以语言为中心”的情感识别器。这使得其在“多模态融合”这一核心方法论上的贡献大打折扣,更像是一份优秀的单模态系统工程报告附带了一些无效的模态尝试。 ...

2026-07-14 · 更新于 2026-08-14 · 3 min · 460 words

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

📄 Best-of-N TTS Evaluation is Confounded by ASR Family Alignment 标签:#语音质量评估 #模型集成 #语音合成 #模型评估 #音频理解 6.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音质量评估 | #模型集成 | #语音合成 #模型评估 | arxiv 👥 作者与机构 第一作者:Taehyung Yu(未说明) 通讯作者:未说明 作者列表:Taehyung Yu(未说明)、Seongjae Kang(未说明) 💡 毒舌点评 本文敏锐地发现并系统性地量化了Best-of-N TTS评估中一个被长期忽视的“幽灵”——ASR验证器与评估器的家族对齐会严重扭曲比较结论,为该领域提了一个非常及时且重要的醒。然而,其核心实验仅在一个数据集(LibriSpeech-PC)和一个TTS模型(F5-TTS)上进行,使得这个重要发现的普适性打上了问号,说服力被限制在了“特定案例”而非“领域定律”。 📌 核心摘要 本文旨在解决零样本文本到语音(TTS)系统评估中的一个潜在混淆问题:当使用Best-of-N(BoN)推理来选择最佳语音候选时,用于评分和选择的自动语音识别(ASR)验证器(verifier)与最终的评估器(evaluator)若属于同一模型家族(如均为Whisper系),会产生系统性优势,导致评估结果失真。作者通过在LibriSpeech-PC测试集上对F5-TTS进行多评估器交叉验证实验发现,不同ASR家族的评估器对同一组BoN候选的排名会完全反转,同家族配对的验证器-评估器组合能利用的“神谕”头 room(oracle headroom)是跨家族组合的2-3倍。核心方法创新在于提出了两种跨家族排名集成(rank-averaging和conjunctive max-rank)策略来选择候选。实验结果表明,跨家族集成在N=10时达到了最低的平均词错误率(WER)1.61%,相比F5-TTS基线相对降低了12%,且在所有评估器下均无显著退化。论文的实际意义在于强烈建议TTS领域采用跨评估器三角验证作为默认报告实践。主要局限性在于实验仅基于一个TTS骨干模型和一个测试集,结论的普适性有待验证。 ...

2026-07-10 · 更新于 2026-08-14 · 3 min · 618 words

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

📄 SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits 标签:#多模态模型 #模型集成 #可解释性 #语音情感识别 #音频理解 7.7/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音情感识别 | #模型集成 | #多模态模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Adis Alihodzic(波斯尼亚和黑塞哥维那萨拉热窝大学理学院数学与计算机科学系) 通讯作者:未说明 作者列表:Adis Alihodzic(波斯尼亚和黑塞哥维那萨拉热窝大学理学院数学与计算机科学系)、Selma Skopljakovic Hubljar(未说明) 💡 毒舌点评 这篇论文诚实且聚焦,它没有声称提出了革命性的新架构,而是像一位严谨的实验员,对SHAP特征归因在专家融合中的关键作用进行了细致入微的拆解和验证。其核心贡献——揭示并形式化了不同SHAP归约方式(均值、中位数、求和)对融合性能的决定性影响——具有明确的方法论价值,为基于归因的门控系统设计提供了清晰指导。然而,论文的核心宣称“自适应融合”与实验结果存在根本矛盾:诊断分析表明,性能最优的sum-abs门控实际上并未实现丰富的逐样本路由,而是退化为了对三模态专家的固定主导。这使得该方法更像一个“基于归因的重要性评估与固定权重选择器”,其理论动机(样本级自适应)被实验结果所削弱,限制了其在动态场景下的应用潜力。 ...

2026-07-10 · 更新于 2026-08-14 · 3 min · 498 words

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

📄 SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits 标签:#多模态模型 #可解释性 #模型集成 4.5/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.3/1.5 📝 4.5/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #多模态模型 | #模型集成 | #可解释性 | arxiv 👥 作者与机构 第一作者:Adis Alihodzic(Department of Mathematical and Computer Sciences, Faculty of Science, University of Sarajevo, Sarajevo, Bosnia and Herzegovina) 第二作者:Selma Skopljakovic Hubljar(论文中未明确标注所属机构) 通讯作者:未明确标注(Adis Alihodzic 的大学邮箱 adis.alihodzic@pmf.unsa.ba 排在首位) 💡 毒舌点评 论文对SHAP归约规则(mean/median/sum-abs)如何影响跨模态专家门控权重的洞察是清晰且有价值的,其系统性消融设计(三种归约 × 三种面部聚合器 × 多种专家池配置)是本文最大的亮点。然而,核心方法sum-abs XGAF在MELD上仅"逼近"朴素早期融合(差0.35个百分点,无统计显著差异),在CMU-MOSEI上仅微弱超越(+0.34个百分点),且缺乏与任何现代神经融合基线(TFN、MulT、MISA等)的直接对比——这意味着我们无法判断"逼近早期融合"这一结论的含金量究竟有多高。更关键的是,诊断分析揭示sum-abs门控实质上退化为跨模态专家(特别是三模态专家)的固定主导,而非论文标题所暗示的"自适应"逐样本路由。整篇论文的核心贡献因此沦为"如何用事后解释工具复现早期融合性能"的方法论实验报告,而非真正具有超越性的融合策略。 ...

2026-07-10 · 更新于 2026-08-14 · 4 min · 731 words

UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition

📄 UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition #语音识别 #模型集成 7.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | #语音识别 | #模型集成 | arxiv 👥 作者与机构 第一作者:Jinjie Fu(University of Science and Technology of China, NERC-SLIP) 通讯作者:未说明 作者列表:Jinjie Fu、Hang Chen、Wu Guo、Zhijun Zhang、Kuiliang Li、Peng Gao(均来自 University of Science and Technology of China, NERC-SLIP) 💡 毒舌点评 本文将信号层偶然不确定性作为上下文注入贝叶斯门控网络,在极具挑战的真实多说话人场景中实现了可观的 WER 下降,融合与解码的联合设计具有明显洞察。然而,实验完全依赖单一预训练主干 AV-HuBERT 且仅在两个数据集上验证,缺乏与其他显式不确定性基线的深入对比,且 UBG-Net 自身未提供任何代码或权重,使得“SOTA”宣称的可复现性存疑。 ...

2026-07-09 · 更新于 2026-08-14 · 3 min · 596 words

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

📄 CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling #语音识别 #模型集成 #数据集 #数据清洗 #低资源 7.2/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | #语音识别 | #模型集成 | #数据集 #数据清洗 | arxiv 👥 作者与机构 第一作者:Haolong Zheng(University of Illinois Urbana-Champaign) 通讯作者:Mark A. Hasegawa-Johnson(University of Illinois Urbana-Champaign) 作者列表:Haolong Zheng(UIUC)、Yuanzhuo Hu(CUHK, Shenzhen)、Xinyu Liang(CUHK, Shenzhen)、Vishal Sunder(IBM Research)、Dancheng Liu(University at Buffalo, SUNY)、Jinjun Xiong(University at Buffalo, SUNY)、Samuel Thomas(IBM Research)、Brian Kingsbury(IBM Research)、Zhizheng Wu(CUHK, Shenzhen)、Mark A. Hasegawa-Johnson(UIUC) 💡 毒舌点评 这篇论文把一个务实的工程问题解决得相当漂亮:用多模型集成投票替代脆弱的单系统对齐,把那个乱糟糟的 CHILDES 时间戳修到可用水平,并且大方地放出了数据和代码。不过方法本身的创新深度有限,本质上是对齐+投票的组合拳,缺少对组件或超参数的深入消融分析,实验部分更像是产品交付报告而非严格的研究验证,微调实验关键细节的缺失让复现性打了折扣。 ...

2026-07-07 · 更新于 2026-08-14 · 3 min · 599 words

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

📄 Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026 #语音识别 #语音合成 #语音翻译 #多模态模型 #数据增强 #参数高效微调 #模型集成 10/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 10/10 | 前10% | #语音识别 | #数据增强 | #语音合成 #语音翻译 | arxiv 👥 作者与机构 Enes Yavuz Ugan, Maike Züfle, Yuka Ko, Supriti Sinhamahapatra, Fabian Retkowski, Seymanur Akti, Jan Niehues, Alexander Waibel 1 Karlsruhe Institute of Technology (KIT) 2 Carnegie Mellon University ...

2026-06-04 · 更新于 2026-08-14 · 3 min · 569 words