Artificial Analysis的大模型榜单更新——
新榜单里,Claude Fable 5.1和GPT-6 Astra并列第一,都拿到53分。
别看它们分数相同,但平均每项任务成本分别是3.26美元和7.63美元,GPT-6 Astra低了57%。
后面是Claude Opus 5(51分)、Claude Fable 5(50分)、Muse Spark 1.3(48分),GPT-5.6 Sol(47分)。
开源权重模型中,GLM-5.3和Kimi K3表现最好,都是44分,距离第一名还有9分。之后是GLM-5.3-Flash的42分、Qwen3.8 2.4T A95B的40分,以及DeepSeek V4 Pro 0813的36分。
这次改榜,进一步减少了单纯“做题”的比重,更关注AI能不能把实际工作做完。
同时,私有测试的权重也从40%提高到了45%,降低模型针对公开题库刷榜的可能。
Terminal-Bench任务更难了,主要测试AI通过终端完成软件工程、机器学习、科学、运维等复杂工作的能力。
另一个是加入AutomationBench-AA,测试AI处理真实业务工作流的能力,如对接Gmail、Slack、Salesforce、Jira等应用。#GPT6 #Astra #Fable #Claude #大模型 #AI
