我在WorkBuddy里用Hy3写东西,总觉不如DeepSeek顺手。刚开源的Hy4 preview能补短板吗?扒了一圈数据说点实在的。
先看Hy3弱在哪。它295B总参、21B激活、256K上下文,办公整合和Agent能力不弱,ClawEval 68.5分仅次于Claude Opus 4.8。
但一到内容生成就露怯,实测续写《三体》风格科幻,文风保守、比喻贫乏,被Qwen3.6甩开。代码也平庸,DeepSWE只有28分,MathArena 38.7分不到GPT-5.5一半。说白了,专家全堆在办公、工具调用上,缺"创意表达"这根筋。
Hy4 preview就是冲着补齐这些来的。参数翻到770B/49B,上下文从256K拉到1M,12项基准全超Hy3。
最猛的是DeepSWE从28分直接翻倍到64.3,Terminal Bench 2.1拿下85.4分,追平Claude Opus 5。
腾讯163名专家盲测203个工程任务,Hy4均分2.99略高于GLM-5.3和Kimi K3。实测生成650行待办App,配色注释一次给全,Hy3那种丢三落四少了。
但我要泼盆冷水。Hy4这代的钱和算力全砸在代码、长文档、Agent上了,官方公布的全是工程向跑分,没一项文风、创意的硬数据,而写东西好不好恰恰最难用跑分衡量,得靠人读。
发布当天第三方独立实测为零,全是腾讯自述口径。它的已知问题还写着"会过度思考、自我验证",说白了容易啰嗦、反应慢。何况价格贵了4倍,输入6元对1元。
WorkBuddy里Hy4已经能选,限时免费到9月10日,Hy3免费期也延到9月30日。我建议别信发布会数字,免费期内拿你平时最常干的活——写方案、改文案、长文档总结——各跑两周看手感和成本。模型像人,跑分是体检报告,好不好用得上手才知道。
你会把Hy4切过来实测两周吗?还是觉得免费的Hy3够用了?
秋日生活打卡季workbuddy使用心得 Agent ai办公 腾讯混元
