AI学习吧
📍 源码七号站 开源解码 GPT-5.6 三兄弟 Sol / Terra / Luna 全拆解:新命名逻辑、跑分实测、三档定价,以及它和 Claude Fable 5 到底谁更能打

GPT-5.6 三兄弟 Sol / Terra / Luna 全拆解:新命名逻辑、跑分实测、三档定价,以及它和 Claude Fable 5 到底谁更能打

摘要:OpenAI 推出 GPT-5.6 三档模型:Sol(旗舰,价格仅为 Claude Fable 5 一半)、Terra(中端主力)、Luna(轻快低价),并改革命名体系,数字代表代际、天体名代表能力档位;模型在 Agent 长任务、编程 Agent 综合性能上占优,但硬核代码修复仍落后 Claude Fable 5 近 15 分;同日发布 ChatGPT Work(办公 Agent)、ChatGPT Sites(一键部署网页)及整合 Codex 的全新桌面应用,将“提问→执行→交付”流程统一;新增 max 与 ultra 推理开关,分别用于深度与并行任务;建议按任务难度选档,做好权限管理,守住合规底线。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。

快速摘要

先把结论摆在最前面:OpenAI 这次一口气把 GPT-5.6 拆成了三档——Sol 是旗舰、Terra 是中端主力、Luna 是最便宜最快的一档,而且顺手改掉了沿用多年的命名习惯:数字(5.6)只代表"第几代",Sol / Terra / Luna 才代表"能力档位"。旗舰 Sol 的价格是输入每百万 token 5 美元、输出 30 美元,差不多是 Claude Fable 5 的一半;官方还特别强调它在 Agent 编程上"省了约 54% 的 token"。跑分层面,Sol 在 Agent 长任务、电脑与浏览器操作、编程 Agent 综合分上明显占优;但在最硬核的 SWE-Bench Pro 代码修复任务上,它仍被 Claude Fable 5 / Mythos 5 拉开将近 15 分,第三方的"模型智能"总榜上 Fable 5 也还领先 1 分左右。所以真实情况不是谁碾压谁,而是"各有主场"。

除了模型,OpenAI 同一天还端出了三样东西:ChatGPT Work(办公 Agent)、ChatGPT Sites(一句话把成果部署成网站)以及把 Codex 并进去的全新桌面应用,等于把"提问 → 执行 → 交付成品"塞进了同一个壳里。这篇我会把新命名、三档定价、跑分实测、两个新推理开关(max 与 ultra)、前端 Vibe Coding 表现、产品侧的三件套,以及"普通人和开发者分别该怎么选"全部拆开讲清楚。想看完整拆解,往下翻。

温馨提示:AI 模型的定价和跑分变动非常快,下文中的价格、分数均为写稿时的近似行情,请以各官方定价页与官方评测表的实时数据为准。文中涉及的都是境外厂商提供的模型服务,国内用户在使用境外大模型时,需遵守国内网络与内容管理相关规定。

一、先看全局:这次深夜上线,其实是"一次发四个东西"

如果只盯着"GPT-5.6 发布"这一句话,很容易低估这次更新的分量。我自己把当天的信息捋了一遍,发现这根本不是"上了个新模型"那么简单,而是一次典型的"憋大招式"集中发布:一个新模型家族,外加三个产品。

先说模型这条线。GPT-5.6 不是一个模型,而是一个三口之家:Sol、Terra、Luna。它们同代同源,但定位完全不同——Sol 负责最难的活儿,Terra 负责日常主力,Luna 负责走量提速。这三个名字后面我会专门开一章讲,因为它背后藏着 OpenAI 在命名上的一次思路转弯。

再说产品这条线。跟模型一起落地的还有三件套:

  • ChatGPT Work:一个真正意义上的"办公 Agent",你给它一个目标,它会自己跨着你连上的各种 App 和文件去干活,把长任务拆成小步骤,最后交回来的不是聊天记录,而是做好的表格、幻灯片、文档甚至可分享的网页应用。
  • 全新的桌面应用:OpenAI 把原来独立的 Codex 应用并进了新的 ChatGPT 桌面端,从此 Chat、Work、Codex 三种模式住在同一个窗口里。这里要纠正一个流传的说法——被改名叫 ChatGPT Classic 的是"旧版桌面应用",而不是合并后的新应用;新应用就叫 ChatGPT。
  • ChatGPT Sites:在对话里说一句话,就能把你刚做出来的东西直接部署成一个可访问的网页,链接甩给同事朋友就行,目前是公测阶段。

这三样东西合在一起,其实就是 OpenAI 一直想做的那件事:把"从提问、到执行、再到产出成品"的全流程,收进一个桌面端里完成。它不再满足于当一个"回答问题的聊天框",而是想变成一个"能替你把活儿干完并交付"的工作台。

顺带提一句版本节奏:官方同时宣布 GPT-5.4 会在稍后(写稿时的说法是 7 月 23 日)退役,而上一代的 GPT-5.5 系列还会继续保留一段时间。所以如果你的老流水线还挂在 5.4 上,这段时间要留意迁移。

莫潇羽这里先给个总的判断:这次发布真正的看点,是 OpenAI 把"模型能力"和"产品形态"两条线同时往前推了一大步,尤其是在"办公 Agent"这个方向上,明显是想抢在对手前面把"真实办公场景"这块地圈下来。至于模型本身到底强不强、跟 Claude Fable 5 谁更能打,我们后面用跑分和实测一项一项对。


二、先搞懂新命名:Sol、Terra、Luna 到底是什么逻辑

很多人第一眼看到 Sol、Terra、Luna,会以为这是三个孤立的新模型,其实不是。这是 OpenAI 借着 GPT-5.6 顺手做的一次命名改革,理解它对后面选型很关键,所以我单独拎出来讲。

2.1 拆开看:数字管"第几代",名字管"哪一档"

先用一句白话解释清楚这套新规则:数字(5.6)代表这是第几代模型,Sol / Terra / Luna 这三个名字代表能力档位。

过去 OpenAI 的命名一直有点乱,什么 mini、nano、Instant 混着来,普通人根本分不清谁新谁旧、谁强谁弱。就拿"Instant"来说,它本意是想表达"最新的底层模型",结果这个词既不体现代际也不体现能力,越用越绕。

新规则把这件事拆干净了:

  • 代际由数字承担。5.6 就是第 5.6 代,下一代可能是 5.7、6.0,一目了然。
  • 档位由三个天体名承担。Sol(太阳)是旗舰,Terra(大地)是均衡主力,Luna(月亮)是轻快低价的一档。

这样做最大的好处,是每个档位可以按自己的节奏各自进化。比如以后旗舰 Sol 更新了,中端 Terra 不一定要跟着一起改;开发者在代码里只要写一次路由逻辑,之后换代直接在"代际"这一层做替换,业务逻辑基本不用重写。对要长期维护系统的团队来说,这是实打实省心的改动。

2.2 三兄弟各自的定位

我把三者的定位整理成一张表,方便你对号入座:

档位

中文直觉

主打场景

一句话总结

Sol

太阳(最强)

前沿推理、复杂大型代码库、长周期 Agent 任务、科研与安全研究

最难的活儿交给它,天花板最高,单价也最贵

Terra

大地(均衡)

日常交互、日常 Agent 编程、通用办公

默认主力,官方说性能对标上一代 GPT-5.5,但便宜一半左右

Luna

月亮(轻快)

摘要、起草、高并发自动化

又快又省,能力不弱,成本最低

这里有个容易被忽略的细节:档位顺序不总是等于跑分顺序。在某些具体评测里,"更低档"的 Luna 反而会超过"更高档"的 Terra。这说明档位更多是按"综合定位 + 价格"来划分的,而不是在每一个单项上都严格从高到低排。后面讲跑分时我会举到具体例子。

2.3 为什么这套命名值得夸一句

我个人是比较认可这次改名的。做技术内容这几年,我最烦的就是给读者解释"这堆后缀到底谁比谁新",每次都要画个图。新命名把"代际"和"能力档"这两件本来就该分开的事拆开,逻辑上更干净,用户心智负担更轻。

当然,名字取得再漂亮,最终还是要看东西好不好用。接下来我们就从最直观的"价格"开始,一档一档算清楚这次到底"香不香"。


三、三档定价与成本账:这次为什么被说"很有杀伤力"

聊 AI 模型,绕不开钱。尤其是现在,几乎每家企业在上 AI 之前都会先算一笔账:花这些钱,换回来的价值到底值不值。GPT-5.6 这次的定价,恰恰是它最有攻击性的一手。

3.1 三档价格一次看清

先把三档的官方定价列出来(按每百万 token 计):

档位

输入价

输出价

定位

Sol

5 美元

30 美元

旗舰

Terra

2.5 美元

15 美元

中端

Luna

1 美元

6 美元

低价高速

为了让你有个横向参照,我把同期几个关注度高的模型价格也放进来对比(同样按每百万 token 计,均为写稿时的近似值):

模型

输入价

输出价

备注

GPT-5.6 Sol

5 美元

30 美元

OpenAI 旗舰

Claude Fable 5

10 美元

50 美元

Anthropic 通用旗舰

Claude Opus 4.8

5 美元

25 美元

Anthropic 上一代旗舰

看出门道了吗?旗舰对旗舰,Sol 的价格差不多是 Claude Fable 5 的一半。 输入端一个 5 美元一个 10 美元,输出端一个 30 美元一个 50 美元。对于要大规模跑任务的团队来说,这个价差乘上每天几千万甚至上亿的 token 消耗,就是实打实的成本差距。

3.2 比价格更狠的,是"token 效率"

单看单价还不够。真正决定你账单的,是"跑完同一件事要烧多少 token"。这一点上,OpenAI 这次主打的卖点就是省 token

官方给出的说法是:在 Agent 编程这类任务上,Sol 的 token 效率比上一代提升了约 54%。换句话说,同样一个编程任务,它可能用更少的 token 就跑完了。单价便宜一截,消耗还更省一截,两个因素叠加,最终账单的差距会被进一步放大。

我用一段伪代码,把这个"综合成本"的算法直观化一下,方便你理解为什么不能只看单价:

# 真实成本,不是只看单价,而是"单价 × 消耗量"
实际花费 = 输入token数 × 输入单价 + 输出token数 × 输出单价

# 举个通用化的示意例子(数字为虚构,仅用于说明逻辑):
# 假设同一个任务
#   A 模型:单价高、但话痨,token 烧得多
#   B 模型:单价低、且简洁,token 烧得少
# 最终 B 的账单可能只有 A 的三分之一甚至更低

所以当有人说"这个模型比那个贵一倍"时,先别急着下结论——要把 token 消耗量一起算进去,才是公平的比较。这也是为什么在一些第三方的"综合成本"统计里,GPT-5.6 Sol 的实际消耗成本,甚至比上一代的 GPT-5.5 高推理档还要更低。

3.3 到底要不要为旗舰买单:一个通用化的算账思路

很多人纠结的其实是这个问题:日常活儿用中端够了,但遇到"看起来有点难"的任务,要不要咬牙上旗舰?我给一个通用化、虚构化的算账思路,帮你把这件事想清楚(下面数字纯属示意,只讲逻辑)。

假设你有一批任务,其中八成是简单活儿、两成是复杂活儿。一种极端做法是"全程上旗舰、图省心",另一种是"简单活儿用中低档、只把复杂那两成交给旗舰"。你会发现,第二种做法的综合账单,往往只有第一种的一小部分,而最终产出质量却几乎不受影响——因为那八成简单活儿,本来就不需要旗舰的火力。

这套思路落到实践里,就是按任务分流:不要用一个模型档位去覆盖所有场景,而是搭一个简单的路由——先判断任务难度,简单的走便宜档,复杂的才升级到旗舰。多花点心思做分流,省下来的往往是一大笔持续性的开销。

我自己的做法是:默认全部先走中端跑一遍,把跑得不够好的那部分单独拎出来,再有针对性地升档或加推理强度。先分流、再加料,比"一刀切上旗舰"要划算得多,也比"一刀切用便宜档、结果质量翻车"要稳得多。

3.4 缓存计费的小变化,别踩坑

还有一个偏技术、但对高频调用的开发者很重要的细节:GPT-5.6 改了提示缓存(prompt caching,简单说就是把重复的上下文缓存起来复用、省钱)的计费方式。

  • 支持显式设置缓存断点,缓存的最短存活时间是 30 分钟。
  • 从 GPT-5.6 这一代开始,缓存写入会按未缓存输入价的 1.25 倍收费;而缓存读取仍然享受九折那档的缓存折扣(也就是省 90%)。

对偶尔调用的普通用户,这条基本无感。但如果你在做那种"同一大段系统提示反复喂"的应用,缓存写入涨价这件事得提前算进成本模型里,别到月底看账单才发现和预期对不上。

3.5 莫潇羽的小结

这一节的结论其实很清楚:GPT-5.6 这次的定价策略,核心就是"用更低的单价 + 更省的 token"去打性价比这张牌。对预算敏感、又要大规模跑任务的团队,它的吸引力是真实存在的。

但要提醒一句:便宜不等于万能。下一节我们进跑分,你会看到它在有些硬核任务上其实还有明显短板,"省钱"和"够强"之间怎么权衡,得结合你自己的具体场景来定。价格这种东西变动也快,上面都是写稿时的近似情况,真要决策请以官方定价页的实时数据为准。


四、跑分拆解·上篇:Agent 长任务、代码与电脑操作

跑分这块我分两章讲。上篇先看"提升最明显"的几个方向:Agent 长任务、编程、以及电脑和浏览器操作。下篇再看安全、工具调用,以及它藏不住的短板。

先说一句方法论上的提醒:厂商自己公布的跑分,通常是在自家的评测框架里、按较高推理强度、多次取平均跑出来的,而竞品的数字往往来自各自不同的设置。所以这些分数能看出"大方向",但不同模型之间的精确差距,并不是严格意义上的同台竞技。真要上生产,最靠谱的还是拿你自己的真实任务去实测一遍。

4.1 Agent 长任务:这是升级的重头戏

有一个叫 Agents' Last Exam 的评测,专门考模型能不能扛住"跨越几十个领域的长周期专业工作流"——通俗点说,就是那种要连续干好几步、中间还会用各种工具的复杂长任务。

在这一项上,Sol 刷出了一个新高(写稿时官方给的数字在 53 分上下),相比上一代是一次很清晰的跃升。这背后其实呼应了整个行业的趋势:大家比拼的重点,正在从"单轮问答答得好不好",转向"能不能独立扛住一个要干几个小时的长任务"。

我自己的体感是,长任务能力这东西,短问答里根本感受不到差距;但一旦你把一个需要几十步、来回调工具的活儿丢给它,模型稳不稳、会不会中途跑偏,差距立刻就出来了。这也是 GPT-5.6 这次重点打磨的地方。

4.2 编程:Agent 编程综合分上去了,但硬核修复仍是短板

代码方面要分两面看,因为它恰好体现了 GPT-5.6"有长板也有短板"的特点。

先说亮的一面。 在 Terminal-Bench 2.1 这个偏"终端里干实际活儿"的评测上,Sol 拿到了不错的成绩,开启后面会讲的 ultra 模式后还能再往上冲一截。在第三方 Artificial Analysis 的编程 Agent 综合榜(Coding Agent Index)上,Sol 更是登顶,领先 Claude Fable 5 约 3 分。也就是说,论"编程 Agent 的综合表现",这一代 GPT 确实站到了很靠前的位置。

再说短的一面。 有个叫 SWE-Bench Pro 的评测,专门考模型能不能在没有外部帮助的情况下,去真实的 GitHub 仓库里解决那种硬核的软件工程问题。这一项上,Sol 从上一代的水平提升到了 64.6%,进步是有的——但同期 Claude Fable 5 / Mythos 5 的成绩在 80% 上下,双方差了将近 15 分。

这个差距不小,说明在最硬核的"真实工程修复"这条赛道上,GPT-5.6 相比 Claude 的旗舰仍有明显距离。所以如果你的活儿就是那种"啃老旧大仓库、修复真实 bug"的重工程活,光看"编程 Agent 综合分领先"就下单,可能会踩坑。

我把编程这块的两面性画成一张简单的对比图,帮你记住结论:

graph TD
    A[GPT-5.6 编程能力] --> B[长板: Agent 综合表现]
    A --> C[短板: 硬核真实工程修复]
    B --> B1[Terminal-Bench 表现好]
    B --> B2[编程 Agent 综合榜登顶]
    C --> C1[SWE-Bench Pro 约 64.6%]
    C --> C2[被 Fable 5/Mythos 5 拉开近 15 分]

4.3 电脑与浏览器操作:这次进步最猛的一块

如果说哪块提升最"肉眼可见",那一定是电脑操作和浏览器操作。

在考"模拟真实电脑桌面操作"的 OSWorld 上,这一代的分数从上一代的四十几提升到了六十几;在考"浏览器里查资料、完成任务"的 BrowseComp 上,也从八十四左右一路涨到了九十以上。

这个升级方向其实很有指向性——它几乎就是为 OpenAI 这次重点想推的 ChatGPT Work 做的铺垫。你想想,一个"办公 Agent"要真正替你干活,最核心的能力是什么?就是能像人一样去操作电脑、点开浏览器、在各个 App 之间穿梭。电脑和浏览器操作能力这一大跳,正是这套办公 Agent 能落地的地基。

莫潇羽这里给个提醒:电脑操作能力变强是好事,但也意味着你要更认真地对待"授权边界"——让一个 Agent 去操作你的真实文件和账号,权限给到哪、哪些动作需要人工确认,这些在正式用起来之前一定要设清楚。这一点我在第九章讲 ChatGPT Work 时会再展开。


五、跑分拆解·下篇:安全审计、工具调用与它的短板

5.1 网络安全类任务:能力升了,安全阀也拧紧了

先说清楚定位:这里说的"网络安全能力",指的是安全研究、漏洞审计、补丁开发、防御测试这类合规用途,而不是教人干坏事。业界拿来衡量这类能力的评测(比如 ExploitBench、ExploitGym 等),本质上是在考"模型能不能辅助做漏洞研究和防御工作"。

在这几项上,GPT-5.6 三兄弟随着推理强度提高,安全类能力都有明显进步。OpenAI 的说法是,Sol 在某些安全评测上,能用大约三分之一的输出 token,做到跟一个尚未公开发布的更强模型相当的水平——也就是"又强又省"。

但这里有个关键点值得展开:能力越强,风险越大,所以两家头部厂商都在这块拧紧了安全阀。

  • OpenAI 这边,明确说 GPT-5.6 Sol 配了它"迄今最稳健的一套安全栈",专门针对高风险活动、敏感网络安全请求、以及反复滥用做了加固,并且在发布前花了好几周做对抗测试。它的目标是:既要保住代码审计、漏洞研究、补丁开发、安全教育、防御测试这些正当用途,又要让那些被禁止的攻击性用途变得更难、更不确定、更容易被发现。
  • Anthropic 那边思路更"分身":它把同一个底层模型拆成了两个产品——面向大众的 Claude Fable 5,和放开部分安全限制、只给受信任伙伴的 Claude Mythos 5。Fable 5 不会直接拒绝敏感请求,而是有一套分类器在盯着每一次会话,一旦识别到高风险的网络安全、生物化学或"蒸馏"(指试图套取模型能力去训练竞品)类请求,就把这次请求悄悄转交给更保守的 Claude Opus 4.8 来回答,并会告诉用户"这次换了个模型答"。官方说这种转交平均发生在不到 5% 的会话里。

我为什么要把这段讲清楚?因为这恰恰反映了当下前沿模型的一个共同处境:能力已经强到必须给它套上"缰绳"的地步了。 对普通读者来说,这其实是好事——说明厂商在能力狂奔的同时,也在认真做风控。

这里也补一句合规提醒:这类安全能力必须用在授权范围内的防御、审计与研究场景。国内用户如果要接触境外厂商的这类服务,需遵守国内网络与内容管理相关规定,任何未经授权的攻击性使用都是违法违规的,这条底线不能碰。

5.2 工具调用:档位顺序在这里"翻车"了

前面第二章我埋过一个伏笔:档位顺序不总等于跑分顺序。工具调用(tool use)这块就是最典型的例子。

在一个叫 Toolathlon 的工具使用评测上,出现了两个有意思的现象:

  • 一是跨厂商看,Sol 的成绩并没有领先,反而是 Claude Fable 5 在这一项上更高。
  • 二是在 OpenAI 自家三兄弟内部,更便宜的 Luna 居然在这一项上反超了定位更高的 Terra,把档位顺序给"倒挂"了。

这再次印证了那句话:别迷信"档位越高就一定项项更强"。具体到某个单项能力,一定要看那一项的实测,而不是想当然。

5.3 长上下文:Luna 这一档要留个心眼

还有一个偏工程的细节,做长文档、长上下文应用的朋友要注意:在一个考"超长上下文里精准找信息"的评测(OpenAI MRCR v2,多针版)上,最便宜的 Luna 在超长区间(大约 256K 到 512K,以及 512K 到 1M 这两段)表现掉得比较明显,跌到了四成出头。

结论很实用:如果你的任务要在几十万甚至上百万 token 里精准捞信息,那省钱的 Luna 可能不是最佳选择,该上更高档位就别抠这点成本,否则捞不准信息反而更亏。

5.4 一张表看懂"它强在哪、弱在哪"

我把上下两篇的跑分结论浓缩成一张表,方便你收藏:

能力方向

GPT-5.6 表现

一句话建议

Agent 长任务

明显升级,刷出新高

长周期复杂任务可优先考虑

编程 Agent 综合

综合榜登顶,领先 Fable 5 约 3 分

日常 Agent 编程很能打

硬核真实工程修复

约 64.6%,被 Fable 5 拉开近 15 分

重工程修复慎选,建议实测

电脑/浏览器操作

进步最猛,为办公 Agent 铺路

桌面自动化场景是强项

安全审计(防御向)

随推理增强明显提升,安全阀拧紧

仅限授权合规用途

工具调用

未领先,Fable 5 更强

重工具编排场景要对比

超长上下文

Luna 档掉分明显

长文档别用最低档


六、GPT-5.6 对 Claude Fable 5:第三方视角下的"平手局"

前面各项都拆过了,这一章我们把镜头拉远,用第三方相对中立的视角,正面回答那个所有人都关心的问题:GPT-5.6 和 Claude Fable 5,到底谁更强?

6.1 先看两家官方各自的侧重

只看两家自己公布的跑分,能明显感觉到"各有侧重":

  • GPT-5.6 更占优的地方:Agent 长任务、编程 Agent 综合、以及成本效率。它这次主打的就是"又强又省又能干长活"。
  • Claude Fable 5 更强的地方:最硬核的代码修复(SWE-Bench Pro 那一档),以及部分高难度任务。它走的是"把最难的活儿啃下来"这条路。

6.2 再看第三方相对中立的榜单

比起厂商自说自话,第三方评测机构 Artificial Analysis 的结果更值得参考。综合来看是这么个局面:

  • 模型智能总榜:Claude Fable 5 依然排第一,GPT-5.6 紧随其后,差距大约在 1 分左右。也就是说,论"综合智能",Fable 5 还守着头名,但优势非常微弱。
  • 编程 Agent 综合榜:反过来,OpenAI 这边(Codex 配 Sol)以约 3 分的优势,超过了 Claude 这边(Claude Code 配 Fable 5)。论"编程 Agent 的落地表现",GPT-5.6 这套组合拳更胜一筹。

一个第一名微弱领先,一个反超三分,你就能理解为什么我说这是一场"平手局"了。谁高谁低,真的要看你具体跑的是什么任务。

我用一张对照表把这场"平手局"讲透:

对比维度

更占优的一方

说明

综合模型智能

Claude Fable 5(领先约 1 分)

优势微弱,仍守头名

编程 Agent 落地

GPT-5.6(Codex+Sol 领先约 3 分)

综合编程 Agent 表现更好

硬核真实工程修复

Claude Fable 5(领先近 15 分)

SWE-Bench Pro 差距明显

旗舰单价

GPT-5.6 Sol(约为 Fable 5 一半)

成本优势清晰

工具调用

Claude Fable 5

Toolathlon 上更强

长任务扛得住

两者都强,各有胜负

建议按具体工作流实测

6.3 别忘了 Fable 5 的一段"波折"

聊 Claude Fable 5,有段背景值得补充,也能帮你理解这场竞争的节奏。Fable 5 是今年 6 月 9 日首发的;但仅仅几天后,因为要配合美国商务部的出口管制,Anthropic 在 6 月 12 日暂停了相关访问,直到 6 月 30 日管制被解除,7 月 1 日恢复访问。这里要特别说清楚,免得造成误解:这只是中间短暂"消失"过一小段时间,如今 Fable 5 早已恢复正常,可在 Claude 平台、Claude.ai、Claude Code、Claude Cowork 等入口照常使用,本文写稿时它处于可用状态。之所以提这段插曲,是因为它能帮你理解各家产品节奏是如何被挤到同一个时间窗口的,而不是说这个模型现在不能用了。

这段插曲加上 Fable 5 本周刚转向按用量付费的定价方式,再叠加 GPT-5.6 这次公开发售,等于是把几家的产品节奏挤到了同一个时间窗口里。对开发者来说,这反而是件好事——你现在面对的是一个"充分竞争"的市场,可以更冷静地按"哪个模型适合哪类任务、成本各是多少"来做选择,而不是盲目追新。

6.4 为什么这种"你追我赶"对用户是好事

再多说两句这场竞争的节奏。过去一年,你能明显感觉到几家头部厂商的发布越来越像"接力赛"——这家刚上新,那家隔几天就把更强或更便宜的版本推出来,热度经常一天一换。就在 GPT-5.6 上线前后,前脚还有别家新模型受宠一天,后脚就被新的话题盖过去了。

这种高频迭代,站在使用者角度其实非常划算。它带来的直接结果是三件事:能力在涨、价格在降、可选项在变多。 一年前要上百次反复调教才能勉强做出来的东西,现在可能一句话就"一次成型";一年前贵得离谱的旗舰级能力,现在半价甚至更低就能用上。

但热闹归热闹,我的建议一直没变:别被"今天谁又刷新纪录"的节奏牵着走。 模型每周都在变,真正稳定、值得你投入时间去打磨的,是把工作流搭好、把评估标准立起来。工具是流水的,方法论才是铁打的。你只要守住"拿真实任务验证、按场景选型、算综合成本、守合规底线"这几条,谁当第一其实都不影响你把活儿干好。

6.5 莫潇羽的判断

我的结论是:这一代 GPT 和 Claude 的旗舰,已经打到了"分不出绝对高下、只能分主场"的阶段。 谁也没有对谁形成碾压。

对使用者来说,这其实是最舒服的局面:与其纠结"哪个是宇宙最强",不如老老实实拿自己的真实任务,去两边各跑一遍,用结果说话。这句话我在这篇里会反复强调,因为它是我做技术选型这么多年,踩过坑之后总结出的最实在的一条。


七、两个新推理开关:max 和 ultra 到底该怎么用

GPT-5.6 这次除了模型分档,还给旗舰 Sol 配了两个新的推理控制开关:max reasoning(最大推理)和 ultra mode(超级模式)。这俩名字听着挺唬人,但理解起来其实不难,用对了能明显影响效果和成本,所以单开一章讲清楚。

7.1 max:让它"想得更久"

先说 max。你可以把它理解成"允许模型在一条思路上想得更久、更深"。平时模型为了效率,思考会有个度;开了 max,它会在单条推理链上延长深思的时间,把更多算力投到"想清楚"这件事上。

什么时候用它? 遇到那种一步错步步错、需要缜密推演的硬核难题——复杂算法、多约束的推理题、要反复校验的分析——开 max 往往能换来更靠谱的结果。代价是更慢、更贵,因为它烧的推理 token 更多。

什么时候别用? 那种简单直接、答案一眼能定的活儿,开 max 就是浪费钱,纯属杀鸡用牛刀。

7.2 ultra:让它"分身多开、并行干活"

ultra 就更有意思了,它不是"想得更久",而是"人手更多"。

它的机制是这样的:开启 ultra 后,Sol 会把你的请求拆解开,同时开出好几个"子智能体"(subagent)并行去干,而且这些分身之间被训练成能在任务过程中互相协调、彼此配合,而不是各干各的、最后草草拼在一起。等于是把"一个人埋头做"变成了"一个小组分工协作"。

这套"多开分身"的思路,效果在评测里是能看到的。但要说清楚一个关键限定:这种提升是"特定评测里"的表现,并不代表开了 ultra 在所有任务上都能带来同等幅度的增益。 举个已核实的例子——在 Terminal-Bench 2.1 这个评测上,开了 ultra 的 Sol(约 91.9%)明显高过普通 Sol(约 88.8%),这是目前能看到的、比较干净地证明"多分身协作确实有用"的证据之一。不过换一个评测、换一类任务,增益幅度可能大不相同,甚至在某些简单场景下几乎看不出差别。所以别把"某个评测涨了 3 个点"直接外推成"我的任务也会稳涨 3 个点",具体还得拿你自己的活儿去实测。

用一张流程图对比一下这两种模式的差别:

graph LR
    subgraph max模式
    U1[一个请求] --> R1[单条推理链<br/>想得更久更深] --> O1[更稳的答案]
    end
    subgraph ultra模式
    U2[一个请求] --> S1[子智能体A]
    U2 --> S2[子智能体B]
    U2 --> S3[子智能体C]
    S1 --> M[互相协调后汇总]
    S2 --> M
    S3 --> M
    M --> O2[更快搞定复杂任务]
    end

7.3 谁能用、在哪用

这两个开关的可用范围,跟你的套餐和使用入口有关(以下为写稿时的规则,具体以官方后台为准):

  • max:在 ChatGPT Work 和 Codex 里,所有能用上 GPT-5.6 的用户都能在设置里打开它。
  • ultra:在 ChatGPT Work 里,面向较高档的付费用户(Pro、Enterprise)开放;在 Codex 里,则是较低门槛(Plus 及以上)就能用。
  • API 侧:多智能体能力先以测试版(beta)形式放在 Responses API 里,允许模型在一次请
🔒
🔒 该内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
注册用户
注册用户
可见 70%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥9.9
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数1289 篇
昨日发布2 篇
本月发布0 篇
建站时间408 天
🔍 搜索
📅 日历
« 2026 » « 09 »
 123456
78910111213
14151617181920
21222324252627
282930    
站长微语

联系站长

微信:165255185
AIGC 技术社区
致力于解码 AI前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码
仍在路上

那些寒夜里追赶过的方向

那些冷眼下没放弃的理想

一篇一篇写到现在

仍在路上

"不羁放纵爱自由"

—— 致敬 Beyond
持续创作中 莫潇羽 · 源码七号站