#华尔街实测8款Agent:千问办公95分第一#Agent竞争的本质不是模型,是Harness 🏆
华尔街投行杰富瑞首次系统实测8款中美主流AI Agent,设置5项真实办公任务:基于多份文件完成年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT、基于参考图片生成营销海报。
结果显示:阿里千问办公95分排名第一,是唯一在所有维度均获90分以上的Agent;Claude Cowork 94分第二,OpenAI Codex 92分第三,Kimi Work 86分,豆包77分。
→ 千问办公模型智能分只排第四,但“隐含Harness分”位居首位→ 同一Claude模型换不同Harness,Terminal-Bench得分从58.0%到76.4%,相差18.4个百分点→ Agent竞争正从个人办公转向企业级场景,工作流和生态协同是核心壁垒
颠覆了“模型越强Agent越好”的直觉——工程能力比模型参数更重要。选Agent不能只看模型排行榜,要看Harness质量。
不是参数,是工程。
#华尔街实测8款Agent:千问办公95分第一#Agent竞争的本质不是模型,是Harness 🏆 华尔街投行杰富瑞首次系统实测8款中美主流AI Agent,设置5项真实办公任务:基于多份文件完成年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT、基于参考图片生
阅读:0
点赞:0