日本电视台报道世界最新AI排名,两位主持人表情有些沉重
1. Terminal Bench2.1 综合测试
1. GPT-5.6 Sol:88.8(美国)
2. Opus-4.8:84.6(美国)
3. Kimi K3:84.3(中国)
4. Fable 5:83.4(美国)
5. GPT-5.5:83.4(美国)
6. GLM-5.2:82.7(中国)
2. Program Bench 代码编程测试
1. Kimi K3:77.8(中国)
2. GPT-5.6 Sol:77.6(美国)
3. Fable 5:71.9(美国)
4. Opus-4.8:70.9(美国)
5. GPT-5.5:70.8(美国)
6. GLM-5.2:63.7(中国)
3. SWE Marathon 软件工程实战测试
1. Kimi K3:42(中国)
2. Opus-4.8:40(美国)
3. GPT-5.6 Sol:39(美国)
4. Fable 5:35(美国)
5. GPT-5.5:14(美国)
6. GLM-5.2:13(中国)
