从贴标签到写病程:用情绪—认知描述统一多模态心理健康评估
针对分类法缺解释、纯文本大模型漏掉表情语调的问题,该研究提出情绪—认知协同多模态描述任务并用双路 BridgeNet 加 LLaMA 生成描述,在 MMDA 上描述指标领先且生成的画像把抑郁焦虑辅助判断的准确率平均提升超 12 个百分点,代价是两阶段训练与自动标注依赖人工清洗。
针对分类法缺解释、纯文本大模型漏掉表情语调的问题,该研究提出情绪—认知协同多模态描述任务并用双路 BridgeNet 加 LLaMA 生成描述,在 MMDA 上描述指标领先且生成的画像把抑郁焦虑辅助判断的准确率平均提升超 12 个百分点,代价是两阶段训练与自动标注依赖人工清洗。
针对音乐舞蹈需同时逼真、对拍、多样、物理合理且可编辑的问题,论文以文本到动作掩码模型为先验并外挂音乐塔与姿态塔,在 FineDance 上把运动质量与多样性推高并实现快速推理,但节拍对齐并未登顶且依赖渐进训练与推理优化协同。
针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。
该研究在统一的以大语言模型为中心的语音语言模型框架下比较耦合与解耦语音分词器并引入多词元预测与说话人感知建模,最强证据是 12 倍压缩下词错误率从 6.07 降到 3.01 且合成成功率保持 100%,代价是主观质量指标 UTMOS 随压缩略有下降且高压缩更依赖说话人嵌入。
针对视觉存在但音频缺失的不对称输入,论文用 AV-ConfuseBench 暴露视觉主导误判,并用 RL-CoMM 的两阶段强化协作把 Qwen2.5-Omni-3B 的问答与幻觉指标提升 10 到 30 个百分点,代价是只在有限样本上做在线策略优化并依赖外部音频推理与嵌入裁判。
针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。
该研究以六类蚊种图像加 5 秒翅振音频为输入,用 SwinV2 与音频频谱变换器分别输出类别对数再做可学习加权融合,在干净集上融合准确率为 97.8 未超过单模态,而在图像与音频双侧加噪后融合仅下降 4.66 个百分点的代价是需要配对双模态输入与联合微调。
论文把音频水印威胁从删除与伪造推进到再嵌入伪造消息并劫持归属的覆盖攻击,在 AudioSeal、Timbre、WavMark 上按白盒、灰盒、黑盒验证了接近 100% 的原水印失效率,代价是暴力堆叠会让信噪比明显下降而查询筛选能省下一半以上训练开销。