昊梵体育网

DeepSeek V4 Flash不换模型,只靠「自验证」反超Fable 5

把成功率拉到与Fable5相近水平,DeepSeek自验证单任务成本约0.11美元,不到后者的十分之一。

一个连自己都会答错的大模型,开始自己给自己挑答案了。

DeepSeekV4Flash在Terminal-Bench2.1上对每个任务采样5条候选轨迹,自验证后的系统成功率达到88%,超过ClaudeFable5。

没有额外接入更强的GPT或Claude,生成和验证用的都是DeepSeekV4Flash。

把成功率拉到与Fable5相近的水平,DeepSeek自验证单任务成本约0.11美元,Fable5则约1.3美元,成本不到后者的十分之一。

在这组实验里,多采样几次后,正确解往往已经出现在候选中,真正拉开差距的是能不能把它选出来。

这组新实验来自斯坦福、UCBerkeley和NVIDIAResearch团队此前提出的LLM-as-a-Verifier。它通过更细粒度的验证和排序,从Agent的多次尝试中筛选更可靠的结果。

项目主页:

https://llm-as-a-verifier.com/

论文地址:

代码地址:

https://github.com/llm-as-a-verifier/llm-as-a-verifier

API地址:

https://llm-as-a-verifier.com/docs/

DeepSeekV4Flash的自验证实验

这组结果来自项目8月14日发布的v0.2.0更新,其中新增了DeepSeekV4Flash验证支持和Terminal-Bench2.1自验证基准。

从项目整体设计看,LLM-as-a-Verifier不只用于测试时扩展,验证信号还可以用于进度跟踪和强化学习。

〓LLM-as-a-Verifier框架概览

实验中,每个任务预先由DeepSeekV4Flash生成5条mini-swe-agent执行轨迹。Best-of-3使用其中前3条,Best-of-5使用全部5条。

DeepSeekV4Flash同时负责给候选轨迹打分,LLM-as-a-Verifier据此完成排序和选择,整个过程不需要再训练一个专门的验证模型。

效果并不只是小幅涨点。Best-of-3将成功率从79.4%提到86.5%,Best-of-5则把78.7%直接推到88.0%。

放到Terminal-Bench2.1的成本—性能图里,差距更加直观。

〓DeepSeekV4Flash自验证的成本与任务成功率

DeepSeek一侧使用DeepSeekV4FlashMax,成本按当时的OpenRouter定价计算。GPT-5.6和Claude系列基线则沿用GPT-5.6技术报告中的结果。

上述成绩是系统级结果。DeepSeek一侧加入了多次采样和LLM-as-a-Verifier,Fable5一侧使用ClaudeCode,因此不能直接视为两个基础模型在相同条件下的单次横评。

〓DeepSeekV4Flash自验证结果

项目还公开了这组实验的候选执行轨迹,以及Best-of-3、Best-of-5对应的复现脚本。

Best-of-5还有一个更关键的数字,Oracle(理想选择上限)达到96.6%。

它说明,对大量任务来说,5条候选里已经至少出现了一条成功轨迹。模型能够生成正确解,但验证器还没有把它们全部找出来。

原论文进一步汇总了Terminal-BenchV2排行榜中不同模型和Agent配置产生的执行轨迹,理想选择器下的任务覆盖率最高达到98.9%。

〓候选覆盖率与评分概率分布

连续验证如何区分候选轨迹?

同一模型自验证并非让模型直接判断自己是否答对,而是先得到更细粒度的验证分数,再据此排序多个候选轨迹。

常见的LLM-as-a-Judge评估方式直接输出离散分数。两条质量不同的长执行轨迹,很可能同时得到4分或5分,离散评分无法继续区分二者。

原论文在Terminal-BenchV2上测得,单次离散评分的平局率达到26.7%。

LLM-as-a-Verifier不只读取最终分数,而是保留各个评分token的概率分布,再通过概率加权得到连续验证分数。

即使两个候选最终都输出4分,只要模型对不同评分档位的置信分布不同,仍然能够进一步拉开差距。

框架还进一步使用更细的评分粒度,并通过重复评估降低单次判断的波动,同时将整体评价拆成多个维度分别判断。

〓验证扩展的三个维度

面对更多候选,框架使用ProbabilisticPivotTournament(PPT,概率枢轴锦标赛)进行排序,将完整的两两比较降至。

〓概率枢轴锦标赛的候选筛选流程

自验证的测试时扩展

低成本也不只来自模型价格。这次更新还专门优化了验证阶段的前缀缓存,Terminal-Bench2.1上缓存命中率从5.2%提升到78.4%,未缓存输入成本也随之大幅下降。

测试时预算可以有不同的分配方式。选择更强的模型、增加采样次数,或把更多计算投入候选验证和选择,都会改变整套系统的成本—性能权衡。

5次采样的实际结果距离96.6%的理想选择上限仍有明显差距。

下一步最直接的提升空间,就在把现有候选选得更准。