Opus 5.5 和 GPT-6 Sol 打得头破血流。
结果我看完今天的数据,最想说的是:
你们可能都盯错模型了。
真正值得警惕的,是 Luna。🌙
今天三个模型一起把 AI 圈炸了:
👑 Opus 5.5:$4 / $20
⚔️ GPT-6 Sol:$2 / $10
🌙 GPT-6 Luna:$0.1 / $0.5
(每百万 Token 输入 / 输出 API 价格)
也就是说:
Luna 比 Sol 便宜 20 倍。
然后离谱的来了👇
官方 DeepSWE 1.1:
Sol Max:68.8%
Luna Max:66.6%
只差 2.2 个百分点。
注意,我不是说 Luna = Sol。
真正恐怖的是:
以前我们在研究「哪个模型最强」。
现在更该研究:
什么任务,根本不配用最强模型?
一个 Agent 跑 100 个任务,
可能 80 个 Luna 就能干,
15 个升级 Sol,
最后 5 个再扔给 Opus。
这时候模型能力差 10%,
系统成本可能差一个数量级。
🔥 所以我今天最想抄走的不是 Benchmark,而是这个路由规则:
「默认 Luna。
出现以下任一情况升级 Sol:
① 连续失败 2 次
② 涉及跨模块修改
③ 验收结果存在歧义
④ 需要复杂推理/架构决策
Sol 仍失败,再升级 Opus。
升级时必须携带:失败日志、修改记录、已排除假设。」
别再让 Opus 干 Luna 都嫌简单的活。
2026 年模型战争真正的下半场,
可能已经不是「谁最聪明」。
而是:
谁能让最便宜的模型,解决最多的问题。
三个模型今天都很强。
但 Luna 可能才是那个来掀桌子的。🌚
#ai #大模型 #chatgpt #科技
