Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering
📄 Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering #多模态模型 5.3/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.3/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 📝 5.3/10 | 后50% | #多模态模型 | #多模态模型 | arxiv 👥 作者与机构 Rahul Khedar, Mayank Malhotra, Avinash Karn, Mouli V, Prakhar Mehrotra PayPal AI 💡 毒舌点评 这篇论文画了一张很大的饼,承诺了一个能自动化产品演示并支持实时语音问答的完整系统。架构设计看起来很聪明,把UI探索和代码分析结合,还搞了个“预演练”来修复定位问题,听起来像是解决工业界演示痛苦的灵丹妙药。然而,最关键的实验部分却像是匆匆交了一份初稿。作者精心设计了一套包含10个指标、6类应用的基准测试协议,然后……就没然后了。我们只拿到了几个内部应用和一个公开应用(Excalidraw)的案例研究,而且连这个案例研究的数据都支离破碎。更糟糕的是,他们既没有验证“跨模态融合”到底有多大用,也没有测试“预演练循环”是否真的比没有它更好。整个系统的核心价值——生成高质量的演示——根本没有被客观量化。这就像一个厨师精心设计了菜谱和厨房设备,却只端上来几道没熟的试吃品,并坚称正式大餐很快会上。 📌 核心摘要 本文提出了Rhetor,一个多智能体系统,用于生成可预演练的实时Web产品演示,并支持实时语音问答。系统以运行的Web应用及其源代码仓库为输入,输出一个经过预演练的演示脚本,包含与浏览器操作同步的旁白,并通过同源反向代理在客户端浏览器中实时运行。其核心贡献是:1) 一个跨模态特征表示,融合UI探索和代码分析结果,为特性分配离散的焦点层级;2) 一个受约束的脚本生成器,确保所有动作仅引用探索时观察到的UI元素,并通过优先级顺序的多策略语义定位器执行;3) 一个“预演练-再呈现”循环,包含显式的收敛判定和优雅降级机制;4) 一个运行时同步不变量,通过服务器-客户端握手,将每个浏览器操作绑定到其对应旁白段的音频结束时刻,从而消除字级偏移。论文定义了一个由10个指标、6类应用组成的基准测试协议,并在一个包含四个部署应用(包括公开应用Excalidraw)的初步案例研究中验证了系统能端到端执行,并展示了预演练修复循环在某些情况下能驱动成功率达到收敛。 ...