昊梵体育网

阿里国际的Accio团队开源了RealReplicaBench,专门考核AI智能

阿里国际的Accio团队开源了RealReplicaBench,专门考核AI智能体能不能独立干完商务活。

它不考问答,而是让AI自己操作浏览器、命令行和API,把整套工作流程走完才算数。

测试集一共107个任务,包括53个命令行任务、28个浏览器任务、16个文件任务和10个API任务。

其中65个任务只需读文字就能做,22个任务必须看懂截图才能完成,专门为难纯文本模型。

每个任务都跑在全新容器里,由验证器逐项检查结果,全部通过才计成功。

测试场景是本地模拟的Shopify店铺、Freightos订舱和阿里巴巴商品发布系统,不需要真实账号。

榜单上最强的Claude Opus 5,在Accio框架下通过了66个任务,成功率61.7%。

同一个模型换到OpenClaw框架,通过60个任务,成功率56.1%,平均每个任务耗12.7分钟。

也就是说,如今最聪明的模型,仍有接近四成的商务任务完不成。

跑这套评测需要Python 3.11和Docker环境。

项目提供实时更新的在线排行榜,也接受开发者提交自家模型免费评测。

想验证AI能不能真干活,用它跑一遍就知道了。
阿里AI全球化 企业级AI平台