昊梵体育网

我们被问到为什么 Cline 与像 DeepSeek 这样的开源权重模型配合得更

我们被问到为什么 Cline 与像 DeepSeek 这样的开源权重模型配合得更好,而不是其他 harnesses,我们想分享一些细节(更多内容见下面的博客)。

我们的内部评估显示,许多开源权重模型如 DeepSeek、GLM 和 Kimi 都经过 RL 训练,以花费更多 token 来验证它们的工作:运行测试、检查构建、在完成前重新阅读差异。我们相信这就是它们能够缩小与闭源模型性能差距的原因。

与此同时,闭源模型及其 harnesses 倾向于优化效率和更少的 token(这在大量补贴订阅计划时是有道理的)。

因此,我们在构建 Cline harness 时有意让模型按照它被训练的方式工作。在开源权重定价下,这种内置的偏执行为燃烧额外 token 来验证工作,能以更少的钱获得显著更好的结果。

在我们的基准测试运行中,我们看到仅通过让模型充分利用其 RL 训练的更改,就比竞争性 harnesses 获得了约 20% 的提升。