昊梵体育网

LoopArena:AI 指挥 AI 写代码

当大家都在用 SWE-bench 测AI 能不能搞定一个 bug时,有一批人已经转向了一个更管理岗的问题:让一个 AI 去指挥另一个 AI 写代码,结果会怎样?

Loop Engineering在成为 coding agent 的新范式,开发者不再手写每一条 prompt,而是设计一个循环:监控进度、分配任务、跑校验、决定下一步。但这里藏着一个致命的评测盲区:一次端到端跑成功或失败,你根本分不清是循环指挥得好,还是写代码的 AI 本身强

阿里巴巴 DreamX 团队发布的 LoopArena,就是为了拆开这个问题。LoopArena 的核心设计很干净:一个被评测的模型当 Controller(指挥官)不碰代码、没有任何编码工具,只读一份结构化的运行摘要(Evidence Packet),然后决定 Worker(干活的编码智能体)下一步干什么、要不要验证、何时收工。而 Worker、运行环境、预算、评测器全部固定。

换句话说:整个实验里唯一的变量,是指挥官的指挥能力。这是第一次把模型当经理这个角色,变成可以直接评测、直接对比、直接复现的研究对象。

三个核心发现:
1. 全任务成功率天花板只有 24.69%。 GPT-5.5 当指挥官也只到及格线边缘,Claude Opus 4.8 是 20.99%,Qwen 是 23.46%
2. 每轮机械重申任务目标的固定控制策略,在短任务片断上确实有用(成功率 39.5%→46.9%),但一到完整长任务就完全失效(18.5% = 18.5%)
3. 同样的模型在 "四选一下一步该干嘛" 的单选题上能拿到 88% 的高分,落到真实长任务里照样拉胯

如果你在做多智能体、Agent 产品、或者任何评测体系,这篇论文值得读(正文放在附件啦,欢迎自取)
#大模型 #LoopEngineering教程 #大模型评测#大模型评测集