作者:莫潇羽@源码七号站(www.fuyuan7.com) | 原创首发,转载请注明出处
快速摘要
2026 年 4 月 22 日凌晨,OpenAI 的 Codex 编码工具因内部测试环境(Staging / Dogfooding)被误推至生产环境,导致一份尚未发布的"幽灵模型菜单"在少数 ChatGPT Pro 用户的下拉列表中短暂曝光,前后大约 47 分钟。被抓到的名字包括:gpt-5.5、oai-2.1、arcanine(风速狗)、glacier-alpha 及其两个变体 glacier-alpha-block-cy3 / cy4,社交平台上还提到了一款主攻生命科学的 heisenberg(海森堡)。 核心结论可以拎出三条——
- GPT-5.5 的官方 tooltip 被明确写成"Latest frontier agentic coding model"(最新前沿智能体编码模型),意味着 OpenAI 下一代旗舰并不是对话机器人,而是直接面向"自主干活"的 Agent。
- Glacier 系列的描述是"Intelligence that moves continents",命名风格脱离了 GPT / o 系列的惯例,结合奥特曼近期在斯坦福 TreeHacks 上关于"后 Transformer 架构"的表态,外界普遍怀疑 Glacier 可能承载着新架构的实验。
- 这次事件在技术上不是模型权重泄露,而是前端模型选择器的 UI 级曝光——也就是说,谁都没有拿到模型本身,但 OpenAI 藏在台面下的产品线已经被抖出来了一大截。
本文会把事件经过、技术原理、每个模型的具体含义、奥特曼的"自加速飞轮"逻辑、Codex CLI 的上手方式、以及对国内开发者的启示一次说透,往下看有更详细的拆解。全篇对小白友好,尽量不堆术语。
写这篇文章的时候,Codex 菜单里的幽灵模型已经消失了一天多。但互联网有记忆,录屏、截图、镜像页面都还在,社交平台上讨论热度反而比事件当天更高。本文以一名长期观察 AI 基础设施的从业者视角,把这次事件的前因、过程、技术细节、战略含义、对国内开发者的实操建议一次说完,希望看完之后你对"GPT-5.5 到底是什么""OpenAI 接下来要做什么""我作为开发者该怎么应对"这三个问题有一个结构化的答案。莫潇羽@源码七号站保留对本文内容的持续更新权,后续如果 OpenAI 有新的官方回应或者产品发布,会在源码七号站原文下追加更新。
一、事件回放:凌晨的下拉菜单,藏着一整条生产线
北京时间 4 月 22 日凌晨,不少订阅了 ChatGPT Pro、同时在用 Codex 的开发者突然发现:点开 Codex CLI / Desktop 里的模型选择下拉框时,熟悉的那几个模型(gpt-5.4、gpt-5.4-mini、gpt-5.2-codex 之类)后面多了一整坨从没见过的条目。
最先截图并在 Reddit 的 r/singularity 和 r/OpenAI 两个板块曝光的用户 ID 是 @marmaduke091。他把下拉菜单完整录了一段视频,画面里,模型列表按顺序列出的是这样一组东西——
gpt-5.5 (current)—— Latest frontier agentic coding modeloai-2.1—— Latest frontier agentic coding modelgpt-5.4—— Latest frontier agentic coding modelgpt-5.2-codex—— Frontier agentic coding modelarcanine—— Frontier model with legendary appetite for starchesglacier-alpha—— intelligence that moves continentsglacier-alpha-block-cy3—— ice-cold intelligenceglacier-alpha-block-cy4—— ice-cold intelligence
这份列表后来被搬上了 Hacker News 的讨论区,帖子 ID 是 47858903,也有人把截图扔进了 Imgur。视频和截图一出,技术社区几乎是秒炸的状态。
在极客圈里,"Pro 账号才能看到的菜单"这句话本身就很敏感——这意味着漏出来的条目不是随便的测试账户能摸到的内容,而是 OpenAI 内部工程师正在灰度跑的真东西。菜单从出现到被打补丁消失,前后估计不到一个小时,但视频已经在 X(推特)、Reddit、Hacker News、微信技术群里四处转发,并且被镜像到了若干不会被原站删帖影响的地方。
莫潇羽@源码七号站在第一时间跟着几位海外开发者扒了过程,结合多方交叉比对,可以确认这不是孤立的段子,而是一次真实的基础设施级"前端渗漏"。
二、事故原理:Staging 为什么会被推到 Production
要理解这次事件的技术本质,得先搞清楚一家大型 AI 公司的几套运行环境是怎么切分的。
一个成熟的 SaaS/AI 团队,代码和模型在上线之前通常要经过至少三层环境——
- Development(开发环境):工程师本地或者共享的开发机,用来写代码、跑最基础的单测。
- Staging(预发布环境) 或 Dogfooding(内部试吃环境):上线之前的最后一道防线。Staging 的数据和代码结构会尽量和生产对齐,但流量来自内部;Dogfooding 则更进一步,直接让自己公司的员工在"真用"的场景下吃狗粮,暴露体验问题。
- Production(生产环境):面向所有付费和免费用户的正式线。
整个 AI 行业的迭代速度堪比飙车,OpenAI 本身又在狂招人、狂扩编,Codex CLI 这种工具链最近几周光是 GitHub 上的 release 就更新了好几轮(莫潇羽在查公开仓库时看到,4 月 20 日前后 openai/codex 仓库里已经合了上百个 PR,其中还包含一个修模型菜单弹窗的 #18154 fix: model menu pop)。在这种节奏下,最容易出问题的不是模型本身,而是配置下发——也就是哪个模型在哪个环境里对谁可见的那一份配置。
这次事故的推测路径大概是这样——
- 内部研发环境中,工程师为了方便自己调试,会在模型选择器里列出所有在训、在调、在灰度的模型。
- 某次发布或者配置变更时,"前端模型列表接口"所指向的配置源头,意外地从内部环境的配置仓库被读到了生产环境。
- 前端没有额外做"仅员工可见"的二次过滤,于是这份完整菜单跟着 Pro 账号的登录态一起被推给了真实用户。
- 不到一小时内,OpenAI 的 SRE 把路由回滚或者配置改掉,菜单恢复正常,但录屏早就出去了。
这种事故在行业里不算新鲜,国内的大厂也出过类似的"灰度配置串库"。不过对于 AI 领域来说,它的杀伤力比普通 SaaS 要大得多——因为模型的代号就是路线图本身。名字、描述、后缀,每一个字段都会被外界逐字解读。
小知识:在大厂的内部灰度体系里,有一种常见的做法叫 "feature flag + 用户分桶"。正常情况下,即使某个新模型被写进配置,前端也会通过一个开关来判断当前登录用户是不是"白名单",只有在白名单里才会渲染出来。这次的故障点,大概率出在白名单服务没来得及同步上线,或者白名单表自身被清空了。
这件事对基础设施工程师是个经典案例。 回看事故链,至少有三个防线可以阻断它,但全都失守了——
- 配置分离:内部菜单和用户菜单应该来自两个不同的配置命名空间,即使配置推错了,前端也应该按命名空间过滤。
- 服务端权限网关:即便前端错误渲染出了模型列表,后端 API 在接到
gpt-5.5这类未开放模型的请求时,应该返回403 Forbidden,而不是直接走到推理层。 - 客户端灰度开关:用户 UI 应该有一层额外的"白名单校验",即使服务端都放行,没在白名单里的用户也看不到新选项。
三道防线都失守,才让菜单真的弹到了用户眼前。对于任何一家搞 SaaS 的团队来说,这次事件值得作为内部的安全事故案例来讲——哪怕你不是 OpenAI 规模,类似的事故在功能灰度、A/B 测试、计费套餐变更里会反复发生。
一个容易被忽略的细节:Codex CLI 在本地会把模型列表缓存下来。这意味着即使 OpenAI 在服务端把菜单打回去了,那些在事故窗口内启动过 Codex 的用户,本地的缓存里可能还残留着一份完整菜单。这种"缓存级泄露"通常很难彻底清理,除非官方强制推送一次客户端更新去清空缓存。
三、八个名字里的信息量:一个一个拆给你看
接下来进入重头戏。光是知道有哪些模型还不够,我们要看 tooltip、看命名风格、看后缀,把每一个模型背后的意图尽量还原出来。
3.1 GPT-5.5 / oai-2.1:真正的主角
菜单最上面有两个用同一句 tooltip 标注的模型——gpt-5.5 (current) 和 oai-2.1,描述都是:
Latest frontier agentic coding model.
翻译过来就是"最新前沿智能体编码模型"。这里面有两个关键词必须拎出来讲。
第一个关键词是 agentic(智能体)。 过去几年,OpenAI 对自家旗舰模型的定位都叫 "language model"(语言模型)、"reasoning model"(推理模型)或者 "multimodal model"(多模态模型)。agentic 这个词出现在最前沿模型的 tooltip 里,信号非常强——它意味着官方在描述 5.5 时,第一优先级不是"对话得多像人",而是"能不能自己干活"。
在 Codex 的产品语境下,"干活"是有具体含义的:接到一条自然语言需求之后,模型要能自己规划步骤、读懂既有代码库、调用终端工具、跑测试、改 bug、提交 PR,中途不需要反复回头问用户。也就是大家常说的"一条指令 → 一个完整提交"的自动化路径。
第二个关键词是 frontier(前沿)。 OpenAI 内部对模型有一套非常讲究的标签体系:frontier 通常指的是那一代里综合能力最顶的大模型,区别于 mini(小模型)、nano(更小)或 codex-spark(面向即时编码的轻量版本)。GPT-5.5 被标到 frontier 级,说明它在内部的定位就是 GPT-5.x 这条线的最新旗舰。
那 oai-2.1 又是什么? 这个编号很值得玩味。它没有按 GPT 的命名序列(GPT-5.5)走,而是用了一个完全独立的版本号格式 oai-2.1。结合同一条 tooltip,莫潇羽@源码七号站个人倾向于把它理解成内部版本号或者另一条分支的旗舰——很可能 gpt-5.5 是对外用的产品名,oai-2.1 是工程内部用的版本号,又或者是同代旗舰的另一个细调分支。从 2.1 这个小数点可以看出,内部至少已经过去了 2.0、2.1 两个大版本迭代,成熟度比外界想象得要高。
有用户利用菜单还没关闭的短暂窗口真的点进去试了一下。 据 PiunikaWeb、WindowsReport 等海外媒体整理的一线反馈:一位开发者让 GPT-5.5 处理一个卡了他四个小时的前端 Bug,模型在大约三分钟内给出了修复方案;另一位开发者让它用 HTML + Tailwind CSS 做一个高端着陆页,反馈是"现在看起来是真的会做设计了";还有人凭感觉给出的数字是前端渲染任务提速 3–4 倍、token 使用更省。
这些反馈当然都是小样本、不能当权威 benchmark 来看。但至少有一点可以确认:5.5 不是小迭代,是真正的主线升级。
回顾一下 GPT-5.x 这条产品线的历史节点,你就更能理解 5.5 的定位——
- GPT-5.0(2025 年中):首次把推理能力(o 系列血脉)和对话能力(GPT 主线)融合到同一个模型里,终结了用户在两个家族之间来回切换的痛苦。
- GPT-5.1(2025 年末):引入更长的上下文窗口(部分场景到 1M tokens),并强化了多模态输入(图像 + 文本 + 文件)的协同。
- GPT-5.2-Codex(2026 年初):面向编码场景的细调版本,是 Codex 初期的主力。
- GPT-5.3-Codex-Spark(2026 年初):极低延迟的即时编码响应版本,专门针对在 IDE 里打字级别的交互。
- GPT-5.4 / 5.4 Pro / 5.4 Mini(2026 年 3 月):把 Codex 相关能力拉回主线,强化 reasoning、tool use 和 agentic workflow,是当下 Codex 的默认推荐。
- GPT-5.5(预计 2026 年 Q2):按 tooltip 看,agentic coding 能力的新巅峰。从反馈来看,它不是 5.4 的小升级,更像是 5.x 家族的"集大成者"。
如果你是一位跟踪 AI 工具链的技术决策者,需要建立一个心智模型:5.x 家族的目标是把"reasoning 的深度 × agentic 的广度 × 多模态的通用"三件事做到极致,而 5.5 就是这个方向目前已知最靠前的一站。
3.2 Arcanine(风速狗):看起来像玩梗,其实有来头
第五个条目叫 arcanine,对应 tooltip:
Frontier model with legendary appetite for starches.
翻成中文大致是:"一个对淀粉有传奇般胃口的前沿模型"。
Arcanine 是宝可梦系列里的一只传说级火系神兽,中文译名"风速狗"。这个名字被拎出来当模型代号本身就非常跳脱,tooltip 里那句"对淀粉有传奇般胃口"更是把玩梗气质拉满。
但就算是梗,也有几个点值得拆。
- 标签是 frontier(前沿),不是 preview 或 experimental。 这说明 OpenAI 并没有把它当成玩具,它在内部的定位和 GPT-5.5 是同一级别。
- "legendary appetite for starches" 这句 tooltip 可能不是随便写的。在 AI 圈里,"starch"(淀粉)有时候会被用作一种比喻——代表密集、同质、低营养密度的输入语料(想象一下把一大桶白米饭倒进模型嘴里)。如果这个解读成立,Arcanine 可能是一个专门用来啃"高密度同质数据"的模型,比如海量代码、海量日志、海量样板文本。
- 命名风格的切换 本身就是个信号。OpenAI 以前的模型命名要么按世代编号(GPT-4、GPT-5)、要么按推理能力(o1、o3),现在开始用宝可梦、冰川这些意象词,说明内部在做架构/能力探索的时候,已经不想被原有命名体系束缚住了。
海外媒体 Startup Fortune 的报道里还提到一种更激进的说法:有人在事故窗口里抓到的会话元数据中,看到一个内部编号为 Arcanine 的模型同时出现在 Glacier-alpha 框架的运行栈上。这意味着——Arcanine 可能不是独立模型,而是一个跑在 Glacier 框架上的模型实例。这一条暂时没有官方证据,仅供参考。
3.3 Glacier-alpha 系列:最令人浮想联翩的那一组
重头戏来了。菜单里占了三条的冰川系列,分别是——
glacier-alpha—— intelligence that moves continents(足以撼动大陆的智慧)glacier-alpha-block-cy3—— ice-cold intelligence(冰冷的智慧)glacier-alpha-block-cy4—— ice-cold intelligence(冰冷的智慧)
几个信息点值得放到放大镜下看——
第一,alpha 这个后缀在软件行业里是非常标准的用词,对应的是早期内测,一般意味着尚未稳定、正在做基础架构调试。和 GPT 系列那种"拿出来就能打"的正式模型不同,glacier-alpha 透出的气息是"我们在试一个新东西"。
第二,"intelligence that moves continents"(足以撼动大陆的智慧)这句描述太过气势磅礴,和 OpenAI 平时在产品里一贯的克制文案风格不太一样。技术团队愿意在内部菜单里给一个模型写这种宣言式的描述,通常只有两种情况:要么这玩意儿他们自己也觉得炸,要么这只是开发期间的内部幽默。结合当前的技术节点,第一种可能性并不低。
第三,block-cy3 / block-cy4 这两个变体后缀非常耐人寻味。block 在 AI 架构里几乎是一个基本单位——Transformer 的一个 block 包含自注意力层、前馈层、残差连接等。cy 是什么无人知晓,各路开发者提出的猜测至少有几种——
cy可能是 cycle(循环)的缩写,暗示某种周期性计算单元;cy可能是 compute year 或 compute cycle 的内部缩写;cy可能是某位研究员 / 项目经理的名字缩写(AI 团队内部用 PM 首字母做代号是常见操作);cy也可能是 cryogenic / crystal 这类和"冰川"意象匹配的后缀,纯粹延续命名主题。
无论是哪种,一个确定的事情是——glacier-alpha 不是单个模型,而是一个可以拼接的基础框架,不同的 block 变体代表了不同的组合方式。
第四,这次事件和奥特曼六周前的公开表态形成了对应关系。 关于这一点我单开一节来讲。
补充一条值得留意的背景:从 2024 年底到 2026 年初,学术界在"非 Transformer"方向上其实一直在发力——
- SSM(State Space Models)路线:以 Mamba、Mamba-2 为代表。核心思路是用状态空间模型取代自注意力机制,在长序列上的计算复杂度从 O(n²) 降到接近 O(n)。
- 线性注意力变种:包括 Linear Attention、Performer、Retentive Network 等。共同目标是把注意力机制的瓶颈拆掉。
- RWKV 路线:一种"看起来像 RNN、训练起来像 Transformer"的混合架构,在小参数量下展现出了意外的性价比。
- Mixture of Experts(专家混合)路线:严格来说不是替代 Transformer,而是在同一架构里"只激活一部分参数",达到实际参数量和计算量的解耦。GPT-4 和 Gemini 2.5 都已经在大量使用这种做法。
Glacier 用"block"作为变体后缀,非常契合这种"多路线并行、各自组装"的研发范式。如果 OpenAI 真的在内部跑一套可以自由组装不同注意力模块 / 状态模块的"架构乐高",那就合理解释了为什么同一个 glacier-alpha 下还要再区分 cy3、cy4 这些小版本——它们可能对应不同的 block 组合配方。
莫潇羽@源码七号站倾向于这样的解读:Glacier 是一个承载"后 Transformer 架构实验"的开发框架,而不是一个具体的产品模型。它的存在意义,更像是 OpenAI 内部的"下一代模型工厂"的雏形。
3.4 Heisenberg(海森堡):杀向生命科学的那张底牌
Heisenberg 这个模型最早是在 Coaley Peak、deepinsightai.io 等几家海外行业媒体的盘点中被提到的,tooltip 被记录为:
Latest frontier life science research model.(最新前沿生命科学研究模型)
即使它不一定出现在每位用户看到的主菜单上,也被视为这次泄露名单的一部分。几条背景可以解释它的意义——
- 海森堡本人是量子力学奠基人,以不确定性原理传世。在流行文化里,这个名字也因为《绝命毒师》成为一种"化学 / 生命科学"的文化符号。OpenAI 选这个名字,显然是故意往"硬科学"的方向靠。
- 生命科学一直是 DeepMind 的主场。AlphaFold 系列在蛋白质结构预测上已经做到了标杆级别。OpenAI 用一个独立代号推一条生命科学专用产品线,等于是在正面宣战。
- 行业里有一个更大的潮流在同步进行——AI 正在从纯数字世界向物理/生命世界渗透。贝佐斯投资的 Prometheus 在做"物理经济 AI",Periodic Labs 用 AI 加速化学合成,Anthropic 也在生物化学安全测评上投入了不小的资源。海森堡的出现,某种程度上说明 OpenAI 也把生命科学当成了下一块战略高地。
把这四条合起来看,OpenAI 的产品版图已经不止是 ChatGPT + API 这么简单了——它有主力旗舰(GPT-5.5 / oai-2.1),有前沿架构实验(Glacier-alpha),有垂直科研方向(Heisenberg),还有不拘一格的辅助型前沿模型(Arcanine)。这是一个典型的"多头同时推进"的研发阵型。
四、"智能体编码模型"到底是什么:一个直给小白的解释
GPT-5.5 最关键的定语是 "agentic coding model",这六个字如果真要讲透,得从最早的编程辅助工具讲起。
AI 写代码这件事,过去几年经历了三代形态——
- 第一代:代码补全。 GitHub Copilot 1.0 时期,主要能力就是"你写一半,它给你补全几行"。它不理解项目结构,也不会主动执行任何命令,本质上就是个高级自动补全。
- 第二代:对话式助手。 ChatGPT + 代码模式的时代,你在聊天框里贴代码、问问题,模型回答你,但执行仍然需要你自己来。调试过程高度依赖人力的来回搬运。
- 第三代:智能体(Agent)。 也就是现在 Codex 主打的方向。你对它说一句"帮我把登录功能加上 OAuth 支持,测试通过后提一个 PR",模型会自己规划要改哪几个文件、自己执行终端命令、自己跑单测、自己写提交信息,中途只在关键权限决策上询问你。
从 OpenAI 公开的 Codex 官方文档(https://developers.openai.com/codex)可以看到,现阶段 Codex 的核心卖点已经不是"能写代码",而是"能执行任务":内置 worktree、云端沙箱、skills 机制、自动化任务(Automations)、并发子 agent……全都围绕"自主工作"展开。
GPT-5.5 被标为 agentic coding model,相当于在这个第三代方向上再进一步。 结合一线开发者反馈的"3 分钟解决 4 小时 Bug""前端渲染提速 3-4 倍"这种体感,可以推测它在几个维度上都有增强——
- 长链路任务的连贯性:能把一个需求拆成十几步去推进,而不是在第 4 步就"失忆"。
- 工具调用的稳定性:少一些"跑偏"的终端命令、少一些"自作主张改权限"的惊悚时刻。
- token 效率:同样的任务量,模型的"胡思乱想"更少,实际产出的"有效代码 / 总消耗"比值更高。
- 前端审美在线:这次被反馈最多的点就是做 UI、做落地页特别好看。这背后可能是训练数据里加了大量优质前端作品,也可能是加了一个视觉审美的评价模型在循环里当老师。
如果你是刚接触 AI 编程的小白,我用一句通俗的话帮你记住这件事——过去的 AI 是"很会讲代码",现在的 agentic 模型是"直接替你干工"。
4.1 agentic coding 对比表
下面这张对比表,把过去几年代码辅助工具的演进浓缩成几个关键维度,方便你建立整体印象——
|
维度 |
一代:代码补全 |
二代:对话助手 |
三代:智能体 Agent |
|
典型代表 |
Copilot 1.0 |
ChatGPT 对话写代码 |
Codex、Cursor Agent、Claude Code |
|
输入形态 |
你写到哪补到哪 |
你贴代码问问题 |
你说一句需求 |
|
模型是否执行命令 |
不执行 |
不执行 |
直接执行 |
|
项目上下文 |
不理解 |
靠你手动贴 |
自己读文件、跑索引 |
|
任务链路 |
单行 / 几行 |
单个函数 / 单个文件 |
跨多个文件、跨多个步骤 |
|
工具调用 |
无 |
极少 |
终端、Git、测试、HTTP 调用全部可用 |
|
人的角色 |
敲键盘为主 |
中间搬运工 |
审查员 + 决策者 |
一条常见的误解要澄清——很多人以为"agentic 模型 = 完全无人值守",其实不是。agentic 的本质是"模型主动推进,人在关键节点审批"。一个负责的 agent 在涉及权限、写入生产数据库、删除文件之类的敏感操作之前,通常会主动停下来等用户确认。
4.2 智能体的三个常见"翻车点"
从过去半年的实际使用看,agentic 编码工具最容易在下面三个地方掉链子——
- 长链路"失忆":任务走到第 7 步的时候,模型忘了第 2 步的约束。这种问题的本质是"规划层和执行层的脱节",GPT-5.5 被强调 agentic 很大概率就是在这个维度上继续优化。
- 权限过度开放:模型自作主张装依赖、改配置、跑迁移脚本。解决办法是把 AGENTS.md 写得足够具体,同时把沙箱策略打开。
- 工具调用不稳定:模型偶尔会把
git checkout -- file写成git checkout file,把rm -rf直接怼到根目录。这类风险必须通过外部的 lint、CI、权限隔离来兜底,而不能完全依赖模型"自己想清楚"。
知道这三个常见坑,你在用任何 agentic 工具的时候都能省下大量 debug 时间。
五、奥特曼的"自加速飞轮":六周前就埋好的伏笔
要把这次事件放进更大的叙事里看,绕不开 Sam Altman 在 2026 年 2 月斯坦福 TreeHacks 活动上那场演讲。
当时他对着一屋子大二学生,讲了一段后来被到处引用的话——
I bet there is another new architecture to find that is gonna be as big of a gain as transformers were over LSTMs. And I think you finally have models that are smart enough to help do that kind of research.
意思是:我打赌未来还会出现一种全新的底层架构,它带来的性能跃迁不会亚于当年 Transformer 对 LSTM 的碾压;而现在,我们终于拥有了足够聪明的模型,可以帮我们去做这种级别的研究。
这句话被各路媒体拎出来反复咀嚼,原因很简单——
- 说这话的人正是 Transformer 的最大受益者。 GPT 系列、ChatGPT、Codex,全都是 Transformer 架构长出来的果实。吃着这棵树的果子的人,亲口给这棵树宣判"寿命快到了",震撼程度可想而知。
- 他把话题从"堆算力"明确导向了"换架构"。 过去两年整个行业主流路径就是"多塞 GPU、多喂数据、做更大的 Transformer"。奥特曼这句话等于在说:我们已经看到前方那堵墙了,光堆料是撞不过去的。
- 他认为工具已经就位。 也就是当前这一代模型已经聪明到可以作为科学家的助手,帮研究员去找下一代架构。
这套逻辑如果跑起来,会形成一个非常可怕的自加速飞轮——
更强的模型 ──→ 更快找到新架构 ──→ 新架构训出更强的模型 ──→ ...
▲ │
└──────────────────────────────────────────────────────────┘
也就是说,AI 不再只是一个研究对象,它开始主动参与对自己的改造。奥特曼在公开文章《The Gentle Singularity》和那次 TreeHacks 演讲里,都把 2026 年定义为"AI 能够加速 AI 研究本身"的元年。
把这条逻辑和这次的泄露名单放到一起——
gpt-5.5和oai-2.1代表的是 Transformer 血脉上的旗舰级延续:新的数据、新的训练流程、更强的 agentic 能力,但架构仍在同一家族。glacier-alpha系列代表的则可能是另一条赛道。如果 cy3 / cy4 这种 block 后缀暗示着模块化的非 Transformer 组件,那么它就是奥特曼在 TreeHacks 上打的那个"赌"的具体实验。heisenberg则是在让 AI 反哺科研这件事上给出一个更垂直的切面——让前沿模型直接去帮研究员做生命科学的探索。
说得更直白一点,这次名单几乎是把奥特曼前后两个月公开说过的话用产品原型的方式一次性摆上台面。莫潇羽@源码七号站的第一反应是:这未必是他们主动想暴露的,但巧合感强到有点诡异。
"自加速"真的靠谱吗? 这件事在学术圈里有激烈争论。批评方(以 Gary Marcus 为代表)认为——
- 现在的模型距离"真正做新颖科学研究"还有本质性差距,模仿已有研究模式容易,提出真正的原创假设很难。
- 奥特曼的说法是"bet(打赌)",不是"announcement(宣布)"——他只是表达了直觉,而不是已经看到了答案。
- 大公司明确说"需要新架构"但同时依然在用老架构狂堆 GPU,这种表态和行动的错位,说明架构级突破还没真正走到台前。
支持方则给出了几个值得认真对待的反驳——
- 即便当前模型不能独立提出完全原创的架构,也能大幅压缩候选空间。过去研究员需要一个人花几个月排除的方向,现在可以用模型在几天里批量评估。
- 实验自动化已经是现实。结合 AI 控制的实验管线,整个"假设 → 实验 → 反馈"的循环速度比几年前快了数个量级。
- 一旦"AI 帮 AI 做研究"这个循环的增益哪怕只是每次 10%,复利效应下 20-30 次迭代就是质变。
莫潇羽@源码七号站的看法是:这个飞轮不一定转得像奥特曼说的那么快,但它一定在转。对开发者来说,重要的不是争论"哪一天会发生质变",而是保持对新架构、新训练范式、新工具链的敏感度——哪怕今天还是 Transformer 的天下,明天的模型底座可能已经换了皮。
六、OpenAI 的"深水产品线":远比外界以为的庞大
从这次泄露名单往深处看,你会发现 OpenAI 其实早就不是"一家做聊天机器人的公司"了。
台面上外界熟悉的产品有——
- ChatGPT 系列(Free / Plus / Pro / Team / Enterprise / Edu)
- API 平台(GPT-4o、GPT-5.4、GPT-5.4 Pro、GPT-5.4 Mini 等)
- Codex 生态(Codex CLI、Codex Desktop、Codex Web、Codex for VS Code / JetBrains / Slack)
- ChatGPT Images 系列(刚在 4 月 21 日更新到 Images 2.0)
- 辅助 SDK(Agents SDK、MCP 协议集成等)
台面下,从这次泄露加上过往的行业报道,至少可以列出以下几条并行产品线——
- 主力旗舰线:GPT-5.5 / oai-2.1,agentic coding 级别的通用旗舰。
- 架构实验线:Glacier-alpha 系列及 cy 后缀变体,疑似在探索后 Transformer 方向。
- 生命科学线:Heisenberg,对标 AlphaFold 的"AI for Science"赛道。
- 特种前沿线:Arcanine,定位暂不清楚,但被标为 frontier 级别。
- 轻量研究线:GPT-5.3-Codex-Spark,面向"近乎实时"的交互式编码,已经对 Pro 订阅开放研究预览。
再加上 Images 2.0、Atlas 浏览器、Sky 软件收购带来的 Agentic Computer Use、以及 Codex 的 Skills / Automations / Chronicle 等功能层,OpenAI 实际上是一个"五六条线同时推进的 AI 工厂"。
对应的现象就是:ChatGPT 主站看起来一个月没更新,但开发者工具链每周都有新东西掉出来。 这也是为什么越来越多的国内技术观察者开始把目光从 ChatGPT 主站挪到 Codex、API 文档和 openai/codex 这种 GitHub 仓库去——真正的信号源,早就不在主站首页了。
从 OpenAI 的产品矩阵可以读出几件事——
- 分层供给策略已经成型:免费用户、Plus、Pro、Business、Enterprise 各层拿到的模型组合明显不同。泄露名单里多次提到"Pro 账号才看得到",说明 OpenAI 在把最前沿能力优先放给付费意愿最高的群体。
- 从"通用大模型"走向"场景化产品:Codex 不再只是一个"能写代码的 ChatGPT",而是一整套包含 Worktree、Skills、Automations、Chronicle、Atlas 浏览器的自动化工作台。Images 2.0 也不再是"文生图玩具",而是一个具备 reasoning 能力的设计助手。
- 垂直科研产品开始抬头:Heisenberg 只是冰山一角。据 Coaley Peak 等行业媒体提到的名字,还有一款内部代号
GPT-Rosalind的模型在流传,疑似针对 DNA/蛋白质方向——Rosalind Franklin 是 DNA 结构研究的先驱,这个命名几乎就是明牌。 - 在推理和训练两端同时布新:对外发布的是推理侧产品,对内正在探索的是训练侧架构(Glacier)。两条线如果在某个时间点合流,新架构会以最低成本替换掉现有的旗舰。
对站在外面看的人来说,理解这个矩阵比单独追某个模型名字更重要——因为你看到的永远是冰山一角。
七、Codex CLI 快速上手:小白也能跑的版本
既然话题绕不开 Codex,这里用一节把 Codex CLI 的基础用法讲一下,方便没接触过的朋友快速搭个环境。(注意:这套工具对国内网络的访问条件有一定要求,需要你自己保证网络可达。)
7.1 前置条件
- macOS 或 Linux(Windows 也支持,但官方文档明确说 Windows 目前是 experimental,推荐在 WSL2 里跑)
- Node.js 18 或更高版本
- 一个可用的 ChatGPT 账户(Plus 及以上包含 Codex 访问权限),或者一个 OpenAI API Key
7.2 安装
官方给的安装方式很干脆,通过 npm 全局装一下就行——
# 使用 npm 全局安装
npm i -g @openai/codex
# 或者在 macOS 上用 Homebrew
brew install --cask codex
如果你更习惯从 GitHub 下二进制文件,也可以去 openai/codex 仓库的 Releases 页面,选对应平台的 binary,下载后改名为 codex 放到 PATH 里即可。
7.3 第一次启动
装完直接在终端里敲——
codex
第一次运行会弹出登录提示,你有两个选择——
- 用 ChatGPT 账户登录(推荐,直接继承你的订阅权益)
- 用 API Key 登录(适合已经在用 API 做其他集成的同学)
7.4 挑模型
Codex 支持在 CLI 会话里动态切换模型。默认模型是 gpt-5.4;如果你想换,用 /model 命令即可——
# 在 Codex 会话里
/model gpt-5.4-mini
--model 参数也可以在 codex exec 这类非交互模式里用:
codex exec --model gpt-5.4 "帮我把 utils/date.ts 里的时区处理改成 dayjs"
7.5 配置文件
Codex CLI 的配置文件在 ~/.codex/config.toml,你可以在里面做更细的设定,比如默认模型、默认工作目录、MCP 服务、沙箱策略等。一个非常基础的示例——
# ~/.codex/config.toml
model = "gpt-5.4"
# 让 Codex 在多文件改动前先问一下再动手
ask_before_write = true
# 注册一个 MCP 服务,让 Codex 可以调用本地文档检索
[mcp_servers.local-docs]
command = "node"
args = ["./scripts/local-docs-mcp.js"]
7.6 AGENTS.md:告诉模型"本项目的规矩"
这是 Codex 里一个小而美的机制。你在仓库根目录放一个 AGENTS.md,里面写清楚这个项目的约定,Codex 每次启动都会先把这份文件读进上下文。一个例子——
# AGENTS.md
## 本仓库的工作约定
- 任何 JS 改动之后都跑一遍 `npm test`
- 依赖优先用 pnpm,不要引入新的 yarn lock
- 新增第三方依赖前先在 PR 描述里说明理由
- 所有新文件保持 UTF-8 编码,统一用 LF 换行
这种"让 AI 先看团队规矩再动手"的模式,会极大减少那种"模型替你装了 23 个依赖还顺手改了 tsconfig"的惊悚场景。
7.7 一个最小的 agentic 工作流 demo
你可以用下面这种一行命令跑一个最小的"自主编码"流程,感受一下 agentic 的味道——
codex exec "分析当前仓库的 README,给 docs/ 目录下补一篇《快速开始》文档。\
写完后用 markdownlint 检查格式,通过了再列出这次修改涉及的文件清单。"
Codex 会自己读 README、自己写 md 文件、自己跑 lint、自己汇总清单。这就是"agentic coding"在日常工作里最贴地的样子。
7.8 子代理(Subagent)并行
Codex CLI 里有一个叫 "subagent" 的机制,允许主 agent 把一个大任务拆分成多个子任务,交给并行运行的子 agent 去处理。用法很简单——你在对话里直接提出"并行做几件事"的请求,或者在配置文件里声明子 agent 的角色——
# ~/.codex/config.toml
[[agents]]
nam