DeepSeek V4 Flash不换模型,只靠「自验证」反超Fable 5
DeepSeek V4 Flash靠「自验证」技术,88%成功率反超Fable 5,单任务成本仅0.11美元,不足后者十分之一。核心内容:1. 自验证实现:采样5条候选轨迹,自身模型生成验证2. 实验结果:成功率88%超Fable 5,成本0.11美元(Fable 5为1.3美元)3. 技术来源:斯坦福等团队提出的LLM-as-a-Verifier框架

把成功率拉到与 Fable 5 相近水平,DeepSeek 自验证单任务成本约 0.11 美元,不到后者的十分之一。
一个连自己都会答错的大模型,开始自己给自己挑答案了。
DeepSeek V4 Flash 在 Terminal-Bench 2.1 上对每个任务采样 5 条候选轨迹,自验证后的系统成功率达到 88%,超过 Claude Fable 5。
〓 LLM-as-a-Verifier 框架概览 实验中,每个任务预先由 DeepSeek V4 Flash 生成 5 条 mini-swe-agent 执行轨迹。Best-of-3 使用其中前 3 条,Best-of-5 使用全部 5 条。 DeepSeek V4 Flash 同时负责给候选轨迹打分,LLM-as-a-Verifier 据此完成排序和选择,整个过程不需要再训练一个专门的验证模型。 效果并不只是小幅涨点。Best-of-3 将成功率从 79.4% 提到 86.5%,Best-of-5 则把 78.7% 直接推到 88.0%。 放到 Terminal-Bench 2.1 的成本—性能图里,差距更加直观。 DeepSeek 一侧使用 DeepSeek V4 Flash Max,成本按当时的 OpenRouter 定价计算。GPT-5.6 和 Claude 系列基线则沿用 GPT-5.6 技术报告中的结果。 上述成绩是系统级结果。DeepSeek 一侧加入了多次采样和 LLM-as-a-Verifier,Fable 5 一侧使用 Claude Code,因此不能直接视为两个基础模型在相同条件下的单次横评。
项目还公开了这组实验的候选执行轨迹,以及 Best-of-3、Best-of-5 对应的复现脚本。
Best-of-5 还有一个更关键的数字,Oracle(理想选择上限)达到 96.6%。
它说明,对大量任务来说,5 条候选里已经至少出现了一条成功轨迹。模型能够生成正确解,但验证器还没有把它们全部找出来。
原论文进一步汇总了 Terminal-Bench V2 排行榜中不同模型和 Agent 配置产生的执行轨迹,理想选择器下的任务覆盖率最高达到 98.9%。
〓 候选覆盖率与评分概率分布〓 验证扩展的三个维度登录查看剩余 70% 内容
-
08.21
《洛克王国世界》领地战速通阵容推荐
-
08.21
《红色沙漠》虚无者之弓获得做法
-
08.21
DNF2026次元技能数据是怎样的-2026DNF次元技能数据详情
-
08.21
《镭明闪击》预抽卡玩法说明
-
08.21
《洛克王国世界》雪天队玩法指南 雪天队如何玩
-
08.21
制作人蓝贴丨掌教玩法全面升级
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏