PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue
📄 PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue #语音合成 #语音识别 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.1/10 | 前25% | #语音合成 | #语音识别 | arxiv 👥 作者与机构 Wen Zhang, Xiaocui Yang, Zhuoyue Gao, Daling Shi, Yifei Feng, Daling Wang, Yifei Zhang。隶属于东北大学计算机科学与工程学院。 💡 毒舌点评 这篇工作试图用多智能体框架解决共情语音对话这个“老大难”问题,方向是好的。但就像一个组装精良却忘了拧紧螺丝的机器,理论框架看起来挺完整,可细节经不起推敲。那个拍脑袋定权重的“确定性分数”,简直是对“科学计算”四个字的侮辱。实验倒是把所有能拿的指标都拿上了,但缺少最硬核的声学评估,就像评价一个歌手只看他写了多少词,却从不听他唱得怎么样。最要命的是,声称“可解释”,但各模块间的“协调”机制描述得像黑话,这“多智能体”的协作到底有多智能,恐怕连作者自己都说不清。 📌 核心摘要 本文提出PRISM,一个用于共情语音对话的多智能体框架。该框架将语音感知、对话管理和语音合成分解为专门模块(Perceiver, Manager, Responder, Vocalizer),并通过引入“韵律到语言”转换机制,将低级声学线索转化为LLM可处理的文本描述,从而增强共情推理的可控性与稳定性。此外,框架支持按需调用外部知识工具。在AvaMERG数据集上的实验表明,PRISM在多个自动指标和人工评估上优于多种基线模型。 ...