KimiK3测评我用了一天,简单测试。发现会跑很长时间,3小时做了一个改进版的视频
我比较关注聊天的表现。这个基本不耗多少token。以前聊天不会等很久,K3明显等待时间长了,会搜索思考不少东西。这个应该是性能提升的表现,做题深思熟虑。如果嫌慢可以切到K2.6。
关键是,现在K3可以直接在聊天里开完全的agent任务,还开虚拟机环境大搞!以前聊天是不会这样的。
我昨天聊天破了一个纪录,3小时才给出一个结果!是让它做一个视频,第一版全是静态图片展示、加语音文字合成视频,已经时间挺长了。我不满意,说应该给动态视频,它就花了三小时去找视频片段合成,还写代码模拟曲线上涨,折腾了不少动作。最后出来还是一般,这个不重要,就一句话,没有优化。
关键是,聊天自然启动agent,独立干活3小时。感觉打开了干活流程,它里面错误了很多次,都自己恢复去想办法。所以这就是agent用token爆炸的原因,能连续自己干活。当然这个视频合成没有用太多token,主要是等待各种工具干活,检查结果。如果是编程活,那就会很多token。
所以,现在中国开源大模型,也和美国头部大模型一样,能自己实际干活了。干12小时完全正常,不停开发测试,迭代改进,效果真可以了。美国大模型没有秘密了。如何让大模型长时间持续干活,很不简单,现在中国公司也可以了。
