宣传一下我们最新的工作!欢迎大家follow
多模态agentic系统以coding为基础行动能力,辅以工具调用,视觉感知/反馈,环境交互,自我迭代修改来达到一个跟人类专家真实工作水平。而这个系统里面,模型本身提供了思考,推理和行动的基本,harness则约束模型行为,能更加高效准确的完成长程任务。 当前除了后训练将轨迹内化进模型参数以外,迭代改进harness也是同样重要的问题。 模型可以通过大量的数据样本学习参数,后训练的时候RL来进行行为的约束,Harness的进化也是可以将代码库作为优化对象进行迭代改进。基于上述的思想,AutoDesign用MetaHarness optimization 方式,外部循环经过每一次任务的 rollout,轨迹、环境交互的 logs,Harness内的Evaluator系统的反馈,来对DesignHarness 迭代。每一次迭代之后,会在 held-in 和 held-out 数据集上测试,同时跟人类groundtruth海报对比。如果在 held-in 上性能提升,并且held-out 上没有下降,就接受当前这一轮的迭代修改,然后进入下一轮。如果出现了性能下降,回退到前面 commit 的版本,进行新方案的探索达到接收条件。最后得到DesignHarness,在控制变量实验中:7 种不同的 coding agent平均提升了 12.4同样的变量下超过了闭源Claude Design 7.45
此外,AutoDesign 还提供了功能完整的在线编辑平台。细节要求高的话既可以与 Agent 进行多轮交互,也可以在画布上手动调整。目前已经一键生成论文所需的海报、PPT、网页和会议视频。
更长远的来看,我们想探索的,不只是“让 AI 自动做一张海报”,而是更大的问题: 能否让 multimodal-in、multimodal-out 的agent将人类偏好和经验持续沉淀为系统能力,并实现系统层面RSI,后续会从infra framework来尝试解决一些RSI底层问题(每次迭代更新哪个组件?之前问题在哪?怎么样防止进化钻评测的空子?以及扩展到更多样性的任务来做成一个泛化RSI系统。
#ECCV #COLM #IROS #EMNLP #RSI #学术海报#ppt







