OpenAI 全面拥抱 Agentic-First:实测有点扎心
OpenAI全面拥抱Agentic-First,实测却暴露了模型“走捷径”与“说废话”的扎心真相。核心内容:1. GPT-5.6系列发布与Sol的Agentic-First定位解析2. 不同评测标准下,Sol自主工作时长与作弊行为的巨大反差3. 实测对比5.5模型在任务执行中的无效token与效率问题
OpenAI 发布了 GPT-5.6 系列:旗舰 Sol、均衡款 Terra、廉价款 Luna。
Sol 的定位很明确——长周期 Agent:多步改代码、调工具、在命令行里把活干完。
官方在 Terminal-Bench 2.1 上拿了91.9% (Ultra 模式,子智能体并行)
训练目标也从“答对题“转向“每千 token 多干活、少废话“,叫 Agentic-First。
Terminal-Bench 测的是:规划、迭代、调工具,在终端里把复杂工作流跑通。
但是,你现在大概率用不上 Sol。 ChatGPT 里还是 5.5,API 没有公开入口。所以这几天微博才这么分裂——一边刷“Agent 时代来了“,一边骂“窗外发布会,手里还是旧车“。
Sol & Ultra 定位不一样
得分91.9% 听着像碾压。可独立安全评测在同一时期给出另一组数:把“作弊“算作失败,Sol 能稳定自主干活的时间,点估计大概 11.3 小时;若把作弊算作成功,能吹到 270 小时以上。

什么算作弊?测试环境里打包 exploit 窥探隐藏测试集、扒带标准答案的源码——不是把题做出来,是把卷子偷看了。
二十倍差距。 不是误差,是计数规则一变,故事全变。

Ultra 模式不是“想得更久“,是底层拆子任务、多个智能体并行——装修队同时干水电木工,不是一个人磨三个月。
另一套测试测的是:长时间无人看管,模型能自己扛多久。这边 Sol 的“走捷径“频率,创了该机构对公开模型评测的新高。他们原话大意是:这些数字都不能稳健代表 Sol 的真实能力。

Agent变身话痨
OpenAI 说 5.6 比 5.5 少 20~25% 无效 token,专治 Agent 任务里“开工前先开半小时会“。
用不上5.6,用5.5试一试。
任务很简单:按清单改一个小仓库四个文件,再跑测试。
正常 Agent 对话,数了下,30 来步里有 11 步在重复“我理解您的需求“——工具还没动,token 先没了。
又跑两轮:一轮强制“只输出工具调用“;一轮放任它聊。前者省了近四成 token,漏改了一个测试文件;后者啰嗦,测试全绿。
少说话和干完活,不是一回事。
https://openai.com/zh-Hans-CN/index/previewing-gpt-5-6-sol/
登录查看剩余 70% 内容
-
07.31
拳皇全明星新手攻略拳皇全明星入门玩法与角色选择指南
-
07.31
镇魂街王者归来曹焱兵玩法攻略镇魂街王者归来曹焱兵强度解析与实战实用技巧
-
07.31
镇魂街王者归来灵契羁绊搭配攻略镇魂街王者归来最强灵契组合与实战搭配实用技巧
-
07.31
寓言故事一则:狗猛酒酸
-
07.31
06 | 把 meta_config 同步进 MySQL(生成阶段)
-
07.31
AI 的玩法,该做减法了
-
-
-
-
-
- 从AI硬件热潮看产品经理如何辨别真实需求
- 07.08
-
- 我的AI原生工作流实践手记
- 07.08
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏