快速摘要
2026年3月17日,OpenAI 正式发布了 GPT-5.4 mini 和 GPT-5.4 nano 两款轻量级模型。GPT-5.4 mini 在 SWE-Bench Pro 编码基准上达到 54.4%(旗舰版 GPT-5.4 为 57.7%),在计算机使用基准 OSWorld-Verified 上拿到 72.1%(旗舰版 75.0%),运行速度是上一代 GPT-5 mini 的 2 倍以上。API 定价方面,mini 输出仅为旗舰版的三分之一,nano 更是低至十二分之一。这意味着对开发者和技术团队而言,"又快又准又便宜"不再是一句口号,而是已经落地的工程现实。 往下看,莫潇羽@源码七号站 将为你做更详细的技术拆解、基准对比、使用场景分析和 API 实操指南。
一、背景回顾:GPT-5.4 家族的完整版图
要理解 mini 和 nano 的定位,先得看清整个 GPT-5.4 家族的全貌。
2026年3月初,OpenAI 发布了 GPT-5.4 旗舰版(也叫 GPT-5.4 Thinking),这是 OpenAI 迄今为止最强大的通用模型,拥有高达 105 万 token 的上下文窗口、原生计算机使用能力、以及统一了此前 Codex 和 GPT 两条产品线的综合架构。紧接着不到两周,GPT-5.4 mini 和 nano 就登场了。
整个 GPT-5.4 家族目前包含四个层级:
- GPT-5.4 Pro:面向极端复杂任务的顶配版本,API 定价为输入 30 美元/百万 token、输出 180 美元/百万 token,上下文窗口 105 万 token。
- GPT-5.4(标准版/Thinking):旗舰通用模型,输入 2.5 美元/百万 token、输出 15 美元/百万 token,上下文窗口 105 万 token。
- GPT-5.4 mini:本文主角之一,输入 0.75 美元/百万 token、输出 4.5 美元/百万 token,上下文窗口 40 万 token。
- GPT-5.4 nano:本文另一主角,输入 0.2 美元/百万 token、输出 1.25 美元/百万 token,上下文窗口 40 万 token。
莫潇羽@源码七号站(www.fuyuan7.com)在第一时间拿到了这两款模型的详细数据,接下来的内容会从技术原理、基准测试、实际使用场景和 API 接入等多个维度进行拆解,力求让每一位开发者和技术爱好者都能看明白、用得上。
二、核心技术原理:小模型为什么能逼近大模型?
很多朋友的第一个疑问是:一个"缩小版"的模型,怎么可能在性能上逼近体积大得多的旗舰版?这背后涉及几个关键技术方向。
2.1 知识蒸馏(Knowledge Distillation)
知识蒸馏是当前轻量级模型能力飙升的最核心技术之一。简单来说,就是让一个"大模型(教师模型)"把自己学到的知识和推理模式,通过特殊的训练方式"教"给一个"小模型(学生模型)"。这个过程不是简单地复制参数,而是让小模型学会大模型的"思维方式"——包括如何分解问题、如何选择工具、如何组织输出。
GPT-5.4 mini 正是通过对旗舰版 GPT-5.4 的深度蒸馏训练得来的。OpenAI 官方在介绍中明确使用了"distills GPT-5.4's strengths into a smaller, more efficient model"的表述,这说明 mini 并不是简单地砍掉参数,而是经过了精心设计的蒸馏流程。
知识蒸馏的效果在最近一年的进化速度非常惊人。举个直观的例子:GPT-5.4 nano 在 SWE-Bench Pro 上的得分是 52.4%,而上一代的 GPT-5 mini(注意,这是上一代的"中号"模型)只有 45.7%。也就是说,这一代最小号的 nano,在代码能力上已经碾压了上一代的中号选手。
2.2 推理效率优化
除了蒸馏之外,GPT-5.4 mini 和 nano 还在推理效率上做了大量优化。OpenAI 表示 mini 的运行速度是上一代 GPT-5 mini 的 2 倍以上。这里的"速度提升"并不是单纯靠缩小模型实现的,还涉及到推理引擎层面的优化,包括但不限于:更高效的注意力计算机制、优化的 KV 缓存策略、以及针对特定任务类型(如工具调用、代码生成)的推理路径优化。
对于开发者来说,速度提升的实际意义非常直接。在构建编码助手、自动化 Agent 等需要频繁交互的应用时,每一次请求的延迟都会直接影响用户体验。当一个编码助手需要 45 秒才能修改三行代码时,用户很难接受;但如果同样的任务只需要几秒钟就能完成,使用体验就会完全不同。
2.3 多模态能力的保留与取舍
GPT-5.4 mini 继承了旗舰版的多模态能力,支持文本和图像输入。这意味着它可以"看"截图、理解 UI 界面、解析图表。但 nano 在这方面做了更多取舍——它仍然支持基础的图像理解,但在复杂的视觉推理任务(比如操作电脑桌面)上的表现明显弱于 mini。
这种取舍体现了一个重要的设计哲学:不同层级的模型,应该服务于不同复杂度的任务。Nano 的设计目标是"分类、数据提取、排序"这类结构化任务,而不是"理解一个信息密集的桌面截图并做出操作决策"。
2.4 工具搜索机制(Tool Search):让小模型更高效地调用工具
GPT-5.4 家族引入了一个新的技术机制——工具搜索(Tool Search),这对 mini 和 nano 的实际使用效率影响很大,值得单独拿出来说。
在以往的模型版本中,如果你在 API 请求中注册了大量的工具(也就是 Function Calling 中的函数定义),所有这些工具的完整定义都会被塞进每次请求的上下文中。假设你注册了 50 个工具,每个工具的定义平均占 200 个 token,那每次请求光工具定义就要吃掉 10000 个 token——这不仅增加了成本,还挤占了有限的上下文空间,导致模型能处理的实际内容减少。
工具搜索机制改变了这一点。在启用工具搜索之后,模型不再一次性加载所有工具的完整定义,而是先接收一个轻量级的工具列表(只包含名称和简要描述),然后在实际需要使用某个工具时,再动态查找该工具的完整定义。这类似于人类查阅工具手册——你不需要把整本手册背下来,只需要知道有哪些工具可用,需要时再翻到对应的页面。
OpenAI 在 250 个 MCP Atlas 测试任务上进行了对比实验:启用工具搜索后,总体 token 使用量减少了 47%,而准确率完全没有下降。这个数据对于使用 mini 和 nano 的开发者来说意义重大——因为轻量级模型的上下文窗口本来就比旗舰版小(40 万 vs 105 万),能节省的每一个 token 都直接转化为可以放入更多实际内容的空间。
2.5 上下文窗口的工程细节
GPT-5.4 mini 和 nano 都拥有 40 万 token 的上下文窗口。虽然比旗舰版的 105 万 token 小不少,但 40 万 token 在实际使用中已经非常宽裕——这大约相当于一本 30 万字的中文书籍,或者一个中等规模的代码库。
这里有一个经常被忽略的技术细节:推理 token(reasoning tokens)虽然不会在 API 响应中直接返回,但它们仍然占用模型的上下文窗口空间,并且会按照输出 token 的价格计费。这意味着在使用 mini 处理复杂推理任务时,实际可用的上下文空间会比 40 万 token 少一些,具体取决于模型在推理过程中"思考"了多长时间。开发者在设计应用时需要为推理 token 预留一定的空间裕量。
另外,GPT-5.4 家族的最大输出长度为 128K token,这个限制在 mini 和 nano 上同样适用。对于需要生成超长输出的场景(比如生成完整的技术文档或大型代码文件),可能需要设计分段生成的策略。
三、基准测试全面拆解:数字背后的真实含义
基准测试是理解模型能力最直观的方式。但很多人看到一串数字就头大,不知道这些指标到底意味着什么。下面莫潇羽@源码七号站 逐个帮你拆解。
3.1 编码能力:SWE-Bench Pro
SWE-Bench Pro 是目前衡量大模型"真实编码能力"的硬核基准之一。它不是让模型做填空题或写算法练习,而是直接把 GitHub 上的真实软件 Bug 丢给模型,让它自己定位问题并修复。这些 Bug 来自真实的开源项目,涉及各种编程语言和框架,难度和复杂度远超一般的编程面试题。
各模型在 SWE-Bench Pro 上的表现对比如下(推理努力等级设为 high):
|
模型 |
SWE-Bench Pro 得分 |
|
GPT-5.4(旗舰版) |
57.7% |
|
GPT-5.4 mini |
54.4% |
|
GPT-5.4 nano |
52.4% |
|
GPT-5 mini(上一代) |
45.7% |
关键解读:GPT-5.4 mini 与旗舰版的差距仅有 3.3 个百分点,这个差距在实际使用中几乎难以感知。对于大多数编码任务——比如定向代码修改、前端页面生成、调试循环、代码库检索——mini 已经完全够用。而 nano 虽然最小,但 52.4% 的得分比上一代 GPT-5 mini 还高出近 7 个百分点,这说明蒸馏技术在过去几个月的进化速度非常惊人。
3.2 终端操作能力:Terminal-Bench 2.0
Terminal-Bench 2.0 测试的是模型在命令行环境中的操作能力。相比 SWE-Bench Pro 更侧重于"在终端中解决问题"的能力,包括文件操作、脚本编写、系统调试等。
|
模型 |
Terminal-Bench 2.0 得分 |
|
GPT-5.4 mini |
60.0% |
|
GPT-5.4 nano |
46.3% |
|
GPT-5 mini(上一代) |
38.2% |
这组数据的跨代提升幅度更大。GPT-5.4 mini 相比上一代 GPT-5 mini 提升了约 57%,这不是小幅迭代,而是质的飞跃。
3.3 科学推理能力:GPQA Diamond
GPQA Diamond 是一个博士级别的科学推理基准,涵盖物理、化学、生物等多个学科的高难度问题。这个基准测试的是模型的"深层理解与推理"能力,而非简单的知识检索。
|
模型 |
GPQA Diamond 得分 |
|
GPT-5.4(旗舰版) |
约 93% |
|
GPT-5.4 mini |
88% |
|
GPT-5 mini(上一代) |
81.6% |
GPT-5.4 mini 在博士级推理上与旗舰版仅差约 5 个百分点,这意味着绝大多数需要"深度思考"的场景,mini 都能胜任。
3.4 工具调用能力:Toolathlon 与 τ2-bench
工具调用是 AI Agent 应用中至关重要的能力。一个真正能"干活"的模型,不仅要能生成文本,还要能正确地调用 API、组合多步骤工具链、按正确的顺序执行复杂任务。
Toolathlon 测试的是模型在复杂工具链中的综合表现:
|
模型 |
Toolathlon 得分 |
|
GPT-5.4 mini |
42.9% |
|
GPT-5 mini(上一代) |
26.9% |
提升幅度接近 60%,这对于构建 Agent 应用的开发者来说意义重大。
τ2-bench 是电信行业的专用基准,测试模型在行业场景中处理客户问题、调用行业工具的能力:
|
模型 |
τ2-bench 得分 |
|
GPT-5.4(旗舰版) |
98.9% |
|
GPT-5.4 mini |
93.4% |
|
GPT-5 mini(上一代) |
74.1% |
mini 在这个行业基准上几乎追平了旗舰版,而且大幅甩开了上一代。
此外,在 MCP Atlas 工具调用基准上,GPT-5.4 mini 拿到 57.7%,GPT-5 mini 只有 47.6%。这些数字汇总起来传递了一个清晰的信号:GPT-5.4 mini 不是一个"缩小版的聪明模型",而是一个真正能在生产环境中独立完成复杂任务链的执行者。
3.5 计算机使用能力:OSWorld-Verified
这可能是最令人意外的一组数据。
OSWorld-Verified 测试的是模型"像人一样使用电脑"的能力——看屏幕截图、理解 UI 元素、定位按钮和输入框、做出正确的操作决策。这是构建桌面自动化 Agent 的核心能力。
|
模型 |
OSWorld-Verified 得分 |
|
GPT-5.4(旗舰版) |
75.0% |
|
GPT-5.4 mini |
72.1% |
|
人类基线 |
72.4% |
|
GPT-5 mini(上一代) |
42.0% |
|
GPT-5.4 nano |
39.0% |
GPT-5.4 mini 的得分不仅逼近旗舰版,甚至与人类基线持平。这意味着一个为速度和成本优化的轻量级模型,在"看屏幕干活"这件事上,已经和人类水平不相上下。而上一代 GPT-5 mini 只有 42.0%,一代之间计算机使用能力几乎翻了一倍。
值得注意的是,nano 在这项测试中只拿到 39.0%,甚至略低于上一代 GPT-5 mini。这说明计算机使用对模型的视觉推理能力有很高的门槛要求,不是单纯缩小模型就能保住的。mini 和 nano 之间在这个维度上存在一道清晰的能力断层。
3.6 多模态推理:MMMUPro
MMMUPro(含 Python 工具)测试的是结合视觉信息和数学/代码工具进行推理的综合能力:
|
模型 |
MMMUPro 得分 |
|
GPT-5.4(旗舰版) |
81.5% |
|
GPT-5.4 mini |
78.0% |
差距同样很小,说明 mini 在处理需要"看图做题"的复杂任务时同样靠谱。
3.7 长上下文处理:mini 的短板
当然,mini 不是没有弱点。在长上下文处理上,mini 和旗舰版的差距比其他维度明显得多。
OpenAI MRCR v2 测试在 64K-128K 窗口下的 8 针搜索任务中:
|
模型 |
64K-128K 得分 |
128K-256K 得分 |
|
GPT-5.4(旗舰版) |
86.0% |
79.3% |
|
GPT-5.4 mini |
47.7% |
33.6% |
差距接近 40 个百分点。Graphwalks 系列测试也呈现类似趋势——在父节点追踪任务上,GPT-5.4 拿到 89.8%,mini 只有 71.5%。
这说明在需要对超长文本进行精确信息检索和逻辑追踪的场景下,mini 的能力上限还是显著低于旗舰版。对于需要处理大规模文档分析、长对话记忆保持等任务的场景,GPT-5.4 旗舰版仍然是不可替代的选择。
不过这也恰好印证了产品分层的逻辑:不同的任务,用不同的模型。mini 不需要在每个维度都追平旗舰,它只需要在自己主攻的方向——速度、编码、工具调用、计算机使用——做到足够好就行。
四、定价与性价比深度分析
成本是开发者选择模型时最现实的考量之一。下面是 GPT-5.4 家族的完整定价对比(单位:美元/百万 token):
|
模型 |
输入价格 |
输出价格 |
上下文窗口 |
|
GPT-5.4 Pro |
$30.00 |
$180.00 |
105万 |
|
GPT-5.4(标准版) |
$2.50 |
$15.00 |
105万 |
|
GPT-5.4 mini |
$0.75 |
$4.50 |
40万 |
|
GPT-5.4 nano |
$0.20 |
$1.25 |
40万 |
再来看跨代对比(与上一代 GPT-5 系列对比):
|
模型 |
输入价格 |
输出价格 |
|
GPT-5 mini(上一代) |
$0.25 |
$2.00 |
|
GPT-5.4 mini(新一代) |
$0.75 |
$4.50 |
|
GPT-5 nano(上一代) |
$0.05 |
$0.40 |
|
GPT-5.4 nano(新一代) |
$0.20 |
$1.25 |
这里有一个需要注意的细节:GPT-5.4 mini 和 nano 相比上一代同级别模型,单价其实是上涨的——mini 的输入价格涨了约 3 倍,nano 涨了约 4 倍。但考虑到性能的巨大提升(编码能力提升近 9 个百分点、计算机使用能力几乎翻倍、工具调用提升 60%),综合"性能/价格比"其实是大幅提高的。
更关键的是与旗舰版的对比。GPT-5.4 mini 的输出价格是旗舰版的约 1/3,nano 的输出价格是旗舰版的约 1/12。在 Codex 平台中,mini 只消耗 GPT-5.4 配额的 30%,也就是说同样的预算可以跑大约三倍多的 mini 任务。
我们来做一个具体的成本测算。假设你的应用每月生成 2 亿个输出 token(这在生产环境中是一个相当常见的规模):
- 使用 GPT-5.4 旗舰版:200M × $15/1M = $3,000/月
- 使用 GPT-5.4 mini:200M × $4.5/1M = $900/月
- 使用 GPT-5.4 nano:200M × $1.25/1M = $250/月
差距非常直观。对于那些不需要旗舰级推理深度的高频任务,选择 mini 或 nano 可以大幅降低运营成本。
需要特别提醒的是,以上只是纯 token 消耗的费用。在实际生产环境中,如果你使用了网络搜索(Web Search)功能,每次工具调用还会产生额外的费用(按每千次调用计费),搜索返回的内容 token 也会按输入 token 的费率计费。另外,如果使用了计算机使用(Computer Use)功能,同样会有额外的工具调用费用。因此在做成本预估时,建议把工具调用的开销也纳入考量,特别是对于 Agent 类应用——这类应用通常会频繁调用各种工具,工具费用可能占到总成本的相当比例。
还有一个容易被忽略的省钱技巧:OpenAI 的 Batch API 提供标准价格 50% 的折扣。如果你有大量不需要实时响应的批量处理任务(比如每天固定时间批量处理用户评论、批量生成报告摘要等),用 nano + Batch API 的组合可以把单位成本压到极低的水平。以 nano 的 Batch API 价格估算,输入大约只需 $0.10/百万 token,输出约 $0.625/百万 token,对于大规模数据处理场景来说非常有竞争力。
五、子智能体架构:大模型指挥,小模型执行
这次发布中最值得关注的技术趋势,不是某个具体的模型有多强,而是 OpenAI 正在系统性地推动一种新的架构范式——子智能体(Subagent)架构。
5.1 什么是子智能体架构?
传统的 AI 应用架构通常是"单一模型处理一切"——所有任务,无论简单还是复杂,都扔给同一个模型。这种做法简单但低效,就像让公司的 CEO 既做战略规划又亲自处理每一封邮件。
子智能体架构的思路完全不同:
- 旗舰模型(如 GPT-5.4)负责规划、协调和最终决策,是整个系统的"总指挥"。
- 中量级模型(如 GPT-5.4 mini)作为"执行团队",负责搜索代码库、审查大型文件、处理支持文档等具体任务。
- 轻量级模型(如 GPT-5.4 nano)是"助理",处理分类、数据提取、排序等琐碎但高频的工作。
这套架构的核心逻辑是:不是所有任务都需要"满功率思考",很多任务只需要"快速完成"。让不同层级的模型各司其职,整体效率远高于"一个模型包打天下"。
5.2 在 Codex 中的落地实践
这套架构在 OpenAI 的 Codex 平台中已经落地了。具体的运作方式是:
开发者可以让 GPT-5.4 制定整体方案(比如分析一个 Bug 的根因、规划修复路径),然后自动调度 mini 子智能体去并行执行各个子任务(比如搜索相关代码、审查受影响的文件、生成修复代码)。整个过程中,旗舰模型只在需要"做判断"的关键节点介入,大量的执行工作都交给了更快更便宜的 mini。
从 API 调用的角度来看,这种分层调度的实现并不复杂。你可以在代码中根据任务类型动态路由到不同的模型。下面是一个简化的 Python 示例,展示了如何实现基于任务复杂度的模型路由:
import openai
# 定义不同层级的模型
MODELS = {
"planning": "gpt-5.4", # 旗舰版负责规划
"execution": "gpt-5.4-mini", # mini 负责执行
"classification": "gpt-5.4-nano" # nano 负责分类
}
def route_task(task_type, prompt, **kwargs):
"""根据任务类型路由到不同的模型"""
model = MODELS.get(task_type, "gpt-5.4-mini")
response = openai.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
**kwargs
)
return response.choices[0].message.content
# 示例:一个复杂的代码修复工作流
def fix_bug_workflow(bug_description, codebase_context):
# 第一步:用旗舰模型分析问题并制定计划
plan = route_task(
"planning",
f"分析以下 Bug 并制定修复计划:\n{bug_description}\n\n代码上下文:\n{codebase_context}"
)
# 第二步:用 nano 对涉及的文件进行分类
file_classification = route_task(
"classification",
f"根据以下修复计划,对代码库中的文件进行优先级分类:\n{plan}"
)
# 第三步:用 mini 执行具体的代码修改
fix_result = route_task(
"execution",
f"根据以下计划执行代码修复:\n{plan}\n\n需要修改的文件:\n{file_classification}"
)
return fix_result
5.3 为什么这种架构是趋势?
子智能体架构不是 OpenAI 的独家发明,但 GPT-5.4 mini 和 nano 的发布让这种架构变得更加实用。原因很简单:当小模型在关键能力上(编码、工具调用、计算机使用)逼近旗舰版时,把执行工作交给小模型的"代价"就变得极低——你几乎不会损失质量,但能大幅节省成本和时间。
Notion 的 AI 工程负责人 Abhisek Modi 在测试后指出,GPT-5.4 mini 在专注编辑和格式化任务上的精度甚至超过了上一代更大的模型,而且更小的模型现在可以可靠地进行 Agent 工具调用——这种能力此前主要局限于更昂贵的慢速模型。这意味着构建更灵活的应用内 Agent 的大门已经打开了。
5.4 子智能体架构的设计原则
如果你打算在自己的项目中实践子智能体架构,莫潇羽@源码七号站建议遵循以下几个设计原则:
原则一:明确任务的分类标准。 在拆分任务之前,你需要先定义清楚什么样的任务应该由旗舰模型处理、什么样的任务可以交给 mini、什么样的任务适合 nano。一般来说,需要跨多个维度进行综合判断的任务(比如系统架构设计、复杂 Bug 根因分析)适合旗舰模型;需要执行具体操作但仍有一定复杂度的任务(比如代码修改、文件审查、界面操作)适合 mini;而结构化程度高、复杂度低的任务(比如分类、提取、格式转换)适合 nano。
原则二:设计清晰的任务接口。 旗舰模型把任务"委派"给 mini 子智能体时,需要通过清晰定义的接口来传递任务描述和上下文信息。这个接口应该包含:任务的具体描述、所需的输入数据、期望的输出格式、以及任何约束条件。接口设计得越清晰,子智能体执行的准确率就越高。
原则三:建立结果验证机制。 子智能体返回的结果不应该被无条件信任。建议在关键路径上设计验证步骤——可以是由旗舰模型对子智能体的输出做二次审核,也可以是通过规则引擎或单元测试来自动验证输出的正确性。这种"执行-验证"的循环可以显著提升整体系统的可靠性。
原则四:做好并发控制和错误隔离。 多个子智能体并行执行时,需要考虑并发控制的问题。如果某个子智能体执行失败,不应该导致整个任务流程崩溃。建议为每个子任务设置独立的超时和重试机制,并在编排层面做好错误隔离——一个子任务的失败只影响它自己负责的部分,不会波及其他子任务。
六、可用渠道与接入方式详解
GPT-5.4 mini 和 nano 的接入渠道如下:
6.1 GPT-5.4 mini 的接入渠道
API 接入:通过 OpenAI 的开发者 API 直接调用,模型名称为 gpt-5.4-mini。支持文本和图像输入、工具使用、函数调用、网络搜索、文件搜索、计算机使用等全套能力。上下文窗口 40 万 token。
Codex 平台:在 Codex 的应用、CLI、IDE 扩展和 Web 端均可使用。在 Codex 中使用 mini 只消耗旗舰版 GPT-5.4 配额的 30%。Codex 还支持自动将不需要深度推理的子任务委派给 mini 子智能体。
ChatGPT:免费用户和 Go 用户可以通过菜单中的"Thinking"功能使用 GPT-5.4 mini。对于付费用户(Plus、Team、Pro 等),当 GPT-5.4 Thinking 的使用额度耗尽时,mini 会自动作为降级备选方案接续服务。
Microsoft Foundry:GPT-5.4 mini 也可以在微软的 Foundry 平台上部署和评估。
6.2 GPT-5.4 nano 的接入渠道
仅限 API:GPT-5.4 nano 目前只能通过 OpenAI 的 API 调用,模型名称为 gpt-5.4-nano。不可用于 ChatGPT 消费端和 Codex。这个限制说明 OpenAI 将 nano 定位为纯粹的"开发者基础设施",而非面向消费者的产品。
6.3 API 调用示例
下面是一个使用 Python 调用 GPT-5.4 mini 的基础示例,莫潇羽@源码七号站为你整理了完整的调用流程:
from openai import OpenAI
client = OpenAI()
# 基础文本调用
response = client.chat.completions.create(
model="gpt-5.4-mini",
messages=[
{
"role": "system",
"content": "你是一个专业的代码审查助手。"
},
{
"role": "user",
"content": "请审查以下 Python 函数,指出潜在的问题并给出改进建议。"
}
],
reasoning_effort="high" # 可选:none, low, medium, high
)
print(response.choices[0].message.content)
带图像输入的调用(用于计算机使用场景):
import base64
from openai import OpenAI
client = OpenAI()
# 读取屏幕截图
with open("screenshot.png", "rb") as f:
image_data = base64.standard_b64encode(f.read()).decode("utf-8")
response = client.chat.completions.create(
model="gpt-5.4-mini",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": "请分析这个界面截图,告诉我如何找到设置按钮并修改语言选项。"
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{image_data}"
}
}
]
}
]
)
print(response.choices[0].message.content)
带工具调用(Function Calling)的示例:
from openai import OpenAI
import json
client = OpenAI()
# 定义工具
tools = [
{
"type": "function",
"function": {
"name": "search_codebase",
"description": "在代码库中搜索与指定关键词相关的文件和函数",
"parameters": {
"type": "object",
"properties": {
"query": {
"type": "string",
"description": "搜索关键词"
},
"file_type": {
"type": "string",
"description": "文件类型过滤,如 .py, .js, .ts"
}
},
"required": ["query"]
}
}
}
]
response = client.chat.completions.create(
model="gpt-5.4-mini",
messages=[
{
"role": "user",
"content": "帮我在代码库中找到所有与用户认证相关的 Python 文件。"
}
],
tools=tools,
tool_choice="auto"
)
# 处理工具调用
if response.choices[0].message.tool_calls:
for tool_call in response.choices[0].message.tool_calls:
print(f"调用工具:{tool_call.function.name}")
print(f"参数:{tool_call.function.arguments}")
七、实战场景分析:什么时候该用哪个模型?
理解了各模型的能力和定价之后,最实际的问题就是:在具体的业务场景中,应该选择哪个模型?
以下是莫潇羽@源码七号站根据官方数据和社区反馈整理的选型建议(本文首发于 www.fuyuan7.com,转载请注明出处):
7.1 适合 GPT-5.4 mini 的场景
- 编码助手:定向代码修改、前端页面生成、调试循环、代码库导航。mini 在这些场景上的表现与旗舰版接近,但速度快一倍、成本低到三分之一。
- AI Agent 的执行层:在子智能体架构中,mini 是理想的"执行者"角色。搜索代码库、审查大型文件、处理支持文档、执行标准化的多步骤任务。
- 桌面自动化:mini 在 OSWorld-Verified 上的 72.1% 得分说明它完全有能力解析信息密集的 UI 截图并做出正确操作。适合构建需要"看屏幕干活"的 Agent。在实际应用中,这种能力可以用于自动填写表单、在不同软件之间搬运数据、自动化测试流程中的 UI 操作等场景。OpenAI 此前也透露了将 Codex 进化为"控制计算机"工具的愿景——未来用户可能通过手机远程启动和管理桌面自动化任务,而 mini 正是驱动这类场景的理想引擎。
- 实时多模态应用:需要快速处理图像+文本的场景,比如拍照识别产品、实时解析图表等。
- ChatGPT 风格的对话应用:对于大多数日常对话和问答需求,mini 的质量已经非常够用。
7.2 适合 GPT-5.4 nano 的场景
- 高频分类任务:邮件分类、意图识别、情感分析等。这类任务结构化程度高、复杂度低,nano 的速度和成本优势最为突出。在一个日均处理百万级请求的客服系统中,仅分类环节就可能产生巨量的 API 调用。使用 nano 而非 mini 来处理这一环节,每月可以节省可观的运营支出。
- 数据提取与结构化:从非结构化文本中提取关键信息、实体识别、表格信息提取等。例如从海量的合同文档中自动提取关键条款、从新闻文章中提取人名/地名/事件等结构化信息。nano 在这类任务上的表现足够好,而且极低的单次调用成本使得大规模批量处理成为可能。
- 排序与推荐:对候选项进行排序、打分,适合搜索结果重排、推荐系统等场景。
- 轻量级编码子任务:在大规模系统中充当代码格式化、简单代码片段生成、代码风格检查等辅助角色。
- 实时流式处理:在需要极低延迟和极高吞吐量的流水线中,nano 是合适的选择。
7.3 仍然需要 GPT-5.4 旗舰版的场景
- 超长文档分析:当你需要在 10 万 token 以上的文本中进行精确信息检索时,mini 的长上下文表现明显不够。
- 复杂的系统级设计决策:需要综合考虑多个维度、进行深层推理的任务,比如架构设计、策略规划。
- 最高精度需求:在错误成本极高的场景(比如核心业务逻辑的自动化),旗舰版的额外 3-5 个百分点的准确率差距可能很关键。
- 长对话记忆保持:需要在超长对话中保持一致性和准确性的场景。
7.4 选型决策流程建议
为了帮助开发者快速做出选型决策,这里提供一个简单的决策流程(基于莫潇羽@源码七号站的实践经验总结):
任务是否需要处理超过 10 万 token 的上下文?
├── 是 → GPT-5.4 旗舰版
└── 否 → 任务是否需要复杂的视觉推理或桌面操作?
├── 是 → GPT-5.4 mini
└── 否 → 任务是否需要多步骤推理或工具调用?
├── 是 → GPT-5.4 mini
└── 否 → 任务是否是高频的分类/提取/排序?
├── 是 → GPT-5.4 nano
└── 否 → GPT-5.4 mini(通用默认选择)
八、与其他模型的横向对比
GPT-5.4 mini 和 nano 并不是市场上唯一的选择。在选型时,了解它们与其他厂商同级别模型的差异也很重要。
8.1 定价层面的市场格局
从 API 定价来看,GPT-5.4 nano 的输入价格($0.20/百万 token)甚至比 Google 的 Gemini 3.1 Flash-Lite 还要便宜,这使它成为当前市场上性价比很高的轻量级选择之一。但与此同时,如果和上一代 GPT-5 mini($0.25 输入/$2.00 输出)以及 GPT-5 nano($0.05 输入/$0.40 输出)进行纵向对比,GPT-5.4 这一代的小模型其实都经历了不同程度的"价格上涨"——mini 的输入价格涨了 3 倍,nano 涨了 4 倍。
这种价格上涨意味着什么?在莫潇羽@源码七号站(www.fuyuan7.com)看来,这反映了一个行业趋势:随着小模型的能力快速提升,它们正在蚕食旗舰模型的市场空间。厂商需要通过调整小模型的定价来维持自身的产品梯队合理性。毕竟,如果 mini 只需要旗舰版 1/10 的价格就能提供 95% 的能力,那旗舰版的商业价值就很难维持了。
8.2 编码能力的跨厂商对比
在编码能力上,GPT-5.4 mini 的 SWE-Bench Pro 54.4% 的成绩意味着它在真实代码修复任务上处于前列。虽然不同厂商的测试条件可能有差异,但这个分数足以说明 mini 级别模型的编码能力已经今非昔比。需要注意的是,SWE-Bench Pro 的测试环境和评判标准可能因实施方不同而存在微妙差异。OpenAI 的测试使用了 "high" 级别的推理努力参数,这在实际应用中可能不是所有开发者的默认设置。
不同的编码基准测试侧重点也不同。SWE-Bench Pro 更强调在大型真实项目中定位和修复 Bug 的能力,而 Terminal-Bench 2.0 更关注命令行操作能力,HumanEval 则侧重于算法题的解题能力。开发者在做选型时,应该根据自己的实际使用场景来选择最相关的基准进行参考,而不是只看某一个指标。
8.3 行业用户的真实反馈
Hebbia 的 CTO Aabhas Sharma 在内测后给出的评价颇具参考价值:GPT-5.4 mini 在多项输出任务和引用召回率上,以更低的成本匹配甚至超越了同级别的竞品模型,甚至在源引用准确性上优于体积更大的 GPT-5.4 旗舰版。这说明在某些特定维度上,小模型经过精调后确实有可能超过大模型——因为小模型的输出通常更加简洁和聚焦,反而在引用准确性这类需要"精准"而非"全面"的指标上更有优势。
Perplexity 的副 CTO Jerry Ma 在测试两款模型后也表示,mini 展现了强劲的推理能力,而 nano 在实时对话工作流中表现出色——响应迅速且高效。这与 OpenAI 对两款模型的定位完全一致:mini 是"全能执行者",nano 是"极速响应器"。
Notion 的 AI 工程负责人 Ab