AI学习吧
📍 源码七号站 开源解码 Grok 4.5 深度拆解:不争跑分第一、却靠效率和成本掀桌,这台编码大模型到底强在哪

Grok 4.5 深度拆解:不争跑分第一、却靠效率和成本掀桌,这台编码大模型到底强在哪

摘要:Grok 4.5不是最聪明的大模型,但可能是性价比之王:每秒80 Token,每百万Token输入仅2美元、输出6美元,完成同一工程题消耗的Token只有顶尖对手的四分之一,成本仅为Fable 5的四分之一。它在真实修复和长任务耐力上挤进第一梯队,但在审美和最硬核难题上仍有明显短板。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。

快速摘要

先给只想要结论的朋友一句话:Grok 4.5 不是当下最聪明的大模型,但很可能是"单位成本能买到多少智能"这件事上最划算的那一个。 它由 xAI(现已并入 SpaceX 体系,对外常写作 SpaceXAI)与代码编辑器 Cursor 联合训练,2026 年 7 月 8 日正式对外开放。核心卖点不是屠榜,而是三件事叠在一起:推理速度约每秒 80 个 Token、完成同一道工程题所用的 Token 只有对手的零头(官方给的对比是四点二分之一)、以及每百万 Token 输入 2 美元、输出 6 美元的"骨折价"。在几个主流工程榜单上,它稳稳挤进第一梯队,能打平 GPT-5.5、部分场景越过上一代旗舰,但离真正的天花板 Claude Fable 5 还有一段明显距离。

我自己把公开资料和官方数据都翻了一遍,感受很清楚:这是一台为"干活"而不是为"考试"设计的模型。如果你在意的是长时间、多步骤、要反复调用工具的真实工程活儿,它的性价比确实很凶。但如果你追的是审美、追的是硬核难题的解题上限,它还不够看。下面这篇长文,我会把它的训练方法、逐条成绩、真正的成本账、能力边界、以及几个必须泼的冷水,一次性拆干净,最后再补上国内开发者最该关心的合规视角。

想看完整拆解,往下翻。


一、先把话说清楚:Grok 4.5 这次到底发布了什么

这两天 AI 圈很热闹。OpenAI 前脚官宣新旗舰 GPT-5.6 Sol,Musk 后脚就把 Grok 4.5 端了上来,两家几乎是同一天交卷,连 Anthropic 都被卷得把自家的 Claude Fable 5 相关节奏往后压了压。热闹归热闹,我们还是把 Grok 4.5 这条主线捋清楚。

为什么这个时间点值得多看两眼?因为它不是一次孤立的产品更新,而是一次"三方同框"的正面交锋:OpenAI、Anthropic、xAI 几乎在同一周把各自的牌摊了出来。三家的打法还各不一样——一家继续冲智能上限,一家守着"最强"的招牌,一家干脆换个维度、拿成本和效率来掀桌。对旁观者来说,这种同框最有价值的地方,是它逼着每一家都把自己的定位说清楚:你到底想卖"最聪明",还是想卖"最划算"?Grok 4.5 的答案,写在它的定价表里,也写在 Musk 那句"快得多"里。

先说它的身份。Grok 4.5 是 xAI 与 SpaceX 完成合并、又收购了 Cursor 之后,对外交出的第一张真正意义上的"王牌"。按公开信息,SpaceX 在今年 2 月以换股方式吸收了 xAI,合并后的实体估值被外媒描述为万亿美元量级;而 Cursor——那个很多前端和全栈开发者天天挂在屏幕上的 AI 代码编辑器——则是被以约 600 亿美元的规模收入囊中。所以你会看到官方口径里频繁出现"SpaceXAI 与 Cursor 强强联手"这样的措辞,这不是营销辞令,背后是实打实的资本动作和数据资产整合。

它的定位也很直白:一台专为编码、智能体(Agent)和"知识工作"而生的模型。注意"知识工作"这个词——官方特意强调,这是他们第一款"不只为软件工程而造"的模型,把法律、金融、数据分析、Office 文档处理这些白领日常也圈了进来。换句话说,它想抢的不只是程序员的活儿,而是所有"坐在电脑前用脑子挣饭吃"的人的活儿。

莫潇羽@源码七号站 这里给它下一个更精炼的判断:Grok 4.5 走的是"能力先冲进第一梯队,价格再狠狠压到地板"的打法。Musk 自己在社交平台上说得相当实在——按他们内部评估,Grok 4.5 大致相当于上一代的 Opus 4.7,但快得多。这句话信息量很大:它没有吹自己是最强,而是承认"能力大概是别人上一代旗舰的水平",然后用速度和成本把这句"稍逊"翻译成"更划算"。这是一种很清醒的市场卡位。

为了让你对它的"体格"有个概念,先摆几个关键规格:

维度

Grok 4.5 的情况

底座架构

V9 基础模型,约 1.5 万亿参数,混合专家(MoE)结构

训练算力

数以万计的英伟达 GB300 GPU,跑在 Colossus 超算集群里

上下文窗口

当前为 50 万 Token(约合三十多万个英文词)

推理速度

约每秒 80 个 Token,官方称"比 flash 类小模型还快"

输入价格

每百万 Token 2 美元(缓存命中仅 0.5 美元)

输出价格

每百万 Token 6 美元

开放渠道

Grok Build、Cursor(全套餐位)、官方 API 控制台

一个注意点

目前欧盟地区暂未上线,官方目标是 7 月中旬补齐

这里我要特意纠正一个正在网上流传的说法:有文章写"Grok 4.5 下周上下文升级到 100 万 Token"。这是 Musk 的一句预告,不是现状。截至发稿,它的上下文窗口是 50 万 Token,而且超过 20 万 Token 的请求会进入更高的计价档位——也就是说,长上下文不是白送的,用得越长、单价越贵。我把这点单独拎出来,是因为做预算的时候,这一条会直接影响你的账单,别被"100 万"的标题带偏了。

(顺带一提,术语解释给新手:所谓"上下文窗口",你可以理解成模型一次能"读进眼里并记住"的文字总量。窗口越大,越能一口气吞下整个代码仓库或一整份长文档,而不用切成小块喂。)

再帮你把几个容易搞混的名字理一理,免得看别处报道被绕晕。你会看到"xAI""SpaceXAI""SpaceX"这几个词混着用:xAI 是 Musk 原本做大模型的公司,今年并入 SpaceX 体系之后,官方对外常把这个合并实体写作 SpaceXAI,本质上还是同一拨人在做 Grok。而 Cursor,是被这个体系收购的代码编辑器团队,负责把"真实开发数据"这块拼图补上。至于产品侧,你可能会碰到 Grok Build(跑智能体和自动化的框架)、Grok 4.5(这次的主角模型)、以及 grok.com(面向大众的入口)这几个名字——它们分别对应"框架、模型、入口"三个层面,别当成三个不相干的东西。把这层关系捋清楚,再去读任何一篇相关报道,你都不容易被术语绕进去。

二、它是怎么"炼"出来的:GB300、Cursor 数据与"单 Token 智能"

一个模型强不强,光看结果不够,得看它是被怎么"喂"大的。Grok 4.5 的训练路径,恰恰是我觉得这次最有嚼头的部分——因为它把"堆算力"和"抠数据"这两件事,做出了不太一样的侧重。

2.1 算力只是入场券

先说硬件。Grok 4.5 是在数以万计的英伟达 GB300 GPU 上、一次超大规模训练跑出来的,这些卡放在 Memphis 的 Colossus 超算里,整个集群的 GPU 规模据报道已经在二十万量级,还在往百万级扩。听起来很唬人,但我想提醒一句:在今天这个阶段,堆卡只是入场券,不是胜负手。同一梯队里坐在 Grok 4.5 上面的那几家,手里的算力未必比它多,成绩却更靠前。所以真正拉开差距的,从来不是"谁的卡多",而是"谁把卡用得更聪明"。

2.2 真正下死功夫的地方是数据

xAI 这次把力气压在了数据工程上。官方的说法是,他们对海量语料做了魔鬼级的过滤、去重和质量打分,尽量保证灌进模型的每一口,都是高信息密度的专业内容,而不是从互联网上一把捞来的噪声。

这套思路里最关键的一环,是 Cursor 的加入。Grok 4.5 的训练数据里,喂进了数以万亿计的 Cursor 交互数据。这批数据的特别之处在于:它记录的不是"代码长什么样"这种静态语料,而是"真实开发者是怎么和代码库、和工具、和 AI 一起写代码的"——包括调试过程、多文件改动的差异、以及开发者一次次纠正 AI 的动作。

这两类数据的差别,我打个比方你就懂了。传统代码语料像是"给你一本写好的菜谱大全",你能学会每道菜的成品长啥样;而 Cursor 的会话数据,更像是"让你站在后厨旁边,看厨师怎么颠勺、怎么尝咸淡、怎么把糊了的菜救回来"。学前者,你会背菜谱;学后者,你才真正学会做饭。这也是为什么官方敢说它擅长"长时间、多步骤、跨多个代码仓库"的真实工程活儿。

2.3 押注一个很少被挂在嘴边的指标

在强化学习(RL)阶段,xAI 把重心压在了一个不太常被大厂拿出来说的指标上——单 Token 智能度(per-token intelligence)。翻成大白话就是:不比"话说得多漂亮",只比"每吐一个字,含金量有多高"。

这个取向直接决定了它后面那套"又省又快"的杀手锏(第五章会详细算账)。RL 训练覆盖了数十万个任务,绝大多数集中在多步骤软件工程和其他技术性工作上,用自动化和模型打分相结合的方式来评判对错。它的训练栈还是为高度异步设计的——智能体可以连续跑上好几个小时,模型一边干活一边继续学,几万块 GPU 上的训练一刻不停。结果就是,它不只是"会做题",更能在长达数小时的长任务里,扛住多步骤的复杂工程。

我把这套"数据飞轮"画成一张图,方便你一眼看懂它是怎么自我强化的:

flowchart LR
    A[真实开发者<br/>在 Cursor 里写代码] --> B[会话数据<br/>调试/多文件改动/人工纠正]
    B --> C[数据清洗<br/>去重·质量打分·领域筛选]
    C --> D[强化学习<br/>押注单 Token 智能]
    D --> E[Grok 4.5<br/>异步长任务训练栈]
    E --> F[更强的模型<br/>回到 Cursor 服务开发者]
    F --> A

这张图的关键在最后那条回路:模型服务开发者 → 产生新的真实交互 → 又变成训练数据。谁掌握了这条闭环,谁就掌握了持续变强的燃料。而 Cursor 恰好把"训练数据、模型、分发渠道"三样东西都攥在了同一只手里——这既是它的护城河,也是后面我会提到的、监管层可能会盯上的地方。

这里插一句给新手的白话解释:强化学习(RL) 你可以理解成"让模型不断做题、然后根据做得对不对来奖励或惩罚它",做多了它就慢慢学会了什么是"好答案";混合专家(MoE) 则是说模型内部其实养了一堆"专科医生",来了任务只叫醒相关的那几个专家干活,而不是让全体一起上——这样既省算力又快。

2.4 这套打法真正的启示

把训练这一段捋完,我最想留给你的不是几个技术名词,而是一条更朴素的判断:这一代模型的胜负,正在从"谁的模型更大"转向"谁的训练数据更贴近真实工作、谁的训练循环转得更快"。 Grok 4.5 的三板斧——真实开发数据、单 Token 智能、异步长任务训练栈——本质上都在回答同一个问题:怎么让模型学会"像真人一样干活",而不只是"像考生一样答题"。

这个转向对国内做应用和做微调的团队很有参考价值。你未必有几万块 GB300,但"用真实业务交互数据构建数据飞轮""按完成任务而非按答对题目来评估模型"这些思路,是完全可以在小规模上复刻的。工具是别人的,方法论可以是你的——这也是我一直觉得,看这类发布不该只盯着跑分,更该扒它背后那套可迁移的做事逻辑。

三、成绩单逐条拆解:稳进第一梯队,但没坐上铁王座

聊完出身,来看硬碰硬的成绩。我把官方在发布页放出的几条核心工程榜单,连同竞品数据一起整理成一张大表——先看全局,再逐条点评。需要提前说明:这些数字目前基本都是厂商自评(vendor-reported),独立第三方复现还没大面积出来,所以下面的成绩你应该读成"厂商口径下的相对位置",而不是盖棺定论的绝对真理。这一点很重要,第七章我会专门展开。

榜单

Grok 4.5

同台竞品(节选)

Grok 4.5 的位置

Terminal Bench 2.1

83.3%

Fable 5 84.3%/GPT-5.5 83.4%/Opus 4.8 78.9%

咬得极紧,和 GPT-5.5 只差 0.1

SWE Bench Pro

64.7%

Fable 5 80.4%/Opus 4.8 69.2%/Opus 4.7 64.3%/GPT-5.5 58.6%

越过上一代 Opus,反超 GPT-5.5,但离 Fable 5 差一大截

DeepSWE 1.0

62.0%

Fable 5 66.1%/GPT-5.5 64.3%/Opus 4.8 55.8%

压过 Opus 4.8,紧咬 GPT-5.5

DeepSWE 1.1

53%

Fable 5 70%/GPT-5.5 67%/Opus 4.8 59%

明显掉队,五个里排第四

SWE Marathon(pass@1)

29.0%

Opus 4.8 26.0%/Fable 5 24.0%/Opus 4.7 16.0%

这一项它反而拿了第一

(术语给新手补一句:这些榜单说白了都是"给模型出真实的软件工程题,看它能修好多少个 Bug、跑通多少个任务"。名字里的 SWE 就是 Software Engineering 的缩写,Terminal Bench 考的是在真实命令行终端里执行、调试、跑命令的能力。)

3.1 终端和真实工程修复:接近顶尖

它最亮的地方是 Terminal Bench 2.1 的 83.3%,几乎和 GPT-5.5 的 83.4% 打平,只比榜首 Fable 5 的 84.3% 低一个点。这说明它在真实终端环境里执行任务、调命令、修工程问题的手感很稳。

SWE Bench Pro 这一项要单独说说,因为网上有些标题党把它写成"反超 Opus 4.7、豪取第一",容易误导。真实情况是:Grok 4.5 拿到 64.7%,确实越过了上一代旗舰 Opus 4.7(64.3%)、也反超了 GPT-5.5(58.6%),这值得肯定;但它明显低于当代 Opus 4.8 的 69.2%,更远远够不着 Fable 5 的 80.4%。所以严谨的说法是"挤进前列、但不是最强",而不是"登顶"。莫潇羽@源码七号站 一向的态度是:跑分这东西,读的时候一定要连着竞品一起看,单拎一个数字出来吹,很容易变成烟花。

3.2 更难的题目上,短板露了出来

DeepSWE 这一对榜单,把它的天花板照得比较清楚。DeepSWE 1.0 上它拿 62.0%,压过了 Opus 4.8(55.8%),咬住了 GPT-5.5(64.3%),表现体面。但到了更新、更难的 DeepSWE 1.1,它只有 53%,被 GPT-5.5(67%)和 Fable 5(70%)甩开一大截,连 Opus 4.8(59%)都没追上,五个模型里排到第四。

这说明什么?说明它在"常规难度、讲效率"的场景里很能打,但一旦题目难度和复杂度往上抬,和真正的第一梯队顶尖选手之间,还是有一道看得见的坎。

3.3 一个反直觉的亮点

不过 SWE Marathon 这一项挺有意思——它反而拿了第一(29.0%),压过了 Opus 4.8(26.0%)和 Fable 5(24.0%)。SWE Marathon 顾名思义,考的是"马拉松式"的超长任务:不是解一道题,而是要在很长的链条里持续推进、不崩盘。这恰好对应了它训练时"异步长任务"的设计取向。换句话说,它未必是最聪明的那个,但在"耐力型"的长活儿上,反而有独到之处。

3.4 放到"梯队格局"里看,它站哪一档

单看一个模型的分数容易没概念,把它扔进当前的整体格局里,位置感就清楚了。眼下这一档大致可以这么排:最顶上是 Anthropic 的 Claude Fable 5,几乎在这次官方放出的每一条榜单上都领跑;紧随其后是 Opus 4.8 和 GPT-5.5/GPT-5.6 这一档当代旗舰;Grok 4.5 稳稳卡在"仅次于前两家"的第三集团靠前位置,和 GPT-5.5 常常咬得很紧,时不时能越过上一代的 Opus 4.7;再往下,才是各家的开源权重模型和更早的版本。

难得的是,它这一步跨得很实。相比上一代 Grok 4.3,它在第三方综合智能指数上一口气涨了 16 分,这不是小修小补,而是实打实的代际跃迁。你可以粗略地这么理解它的进化轨迹:

xAI 近几代的大致卡位(示意,非精确刻度)
Grok 4.3   第二梯队中段    ——  能用,但离前排有差距
Grok 4.5   第一梯队靠后    ——  能和当代旗舰同台,且成本极低
(传闻中的下一代)  目标继续上探  ——  Musk 已放话"下月阶跃"

所以看 Grok 4.5,不能只盯着"它没拿第一"这一点,更要看它用一代的时间,把自己从"陪跑"抬到了"能上桌打牌",而且是带着成本优势上桌的。这个进步速度,才是真正让对手睡不着觉的东西。

把这几条串起来看,Grok 4.5 的画像就出来了:它是一个很强的全能型编码智能体,终端和常规工程修复接近顶尖,长任务耐力突出,但在最硬核的高难度真实工程题上,还打不过 Fable 5 和当代 Opus。 一句话——稳,但不封顶。

四、第三方视角:把厂商滤镜摘掉之后

厂商自评听个响就行,我更看重独立第三方怎么打分。这次评测机构 Artificial Analysis 的报告出得很快,我把关键结论提炼一下。

4.1 智能综合分:第四名

在 Artificial Analysis 的智能综合指数(Intelligence Index)上,Grok 4.5 拿了 54 分,排在第四,前面只有 Fable 5、GPT-5.5 和 Opus 4.8。相比上一代 Grok 4.3,它一口气提升了 16 分,把 xAI 一举送进了"仅次于 OpenAI 和 Anthropic"的位置,并且压过了所有开源权重模型,也包括谷歌的 Gemini 系列。

对比一下它的进步幅度,你能更直观地感受到这次迭代的分量:

Artificial Analysis 智能综合指数(越高越好)
Grok 4.3  ██████████████████            38 分
Grok 4.5  ██████████████████████████    54 分   ↑ 16 分

(说明:上面这个条形是我为了直观示意手绘的比例,具体分值以官方评测页为准。)

4.2 当"编码智能体"用,它性价比爆表

真正让它出圈的是成本效率。在 Artificial Analysis 的编码智能体指数(Coding Agent Index)上,Grok 4.5 在自家 Grok Build 框架里拿到 76 分,与 GPT-5.5 在 Codex 里的表现相当,只略低于 Fable 5 在 Claude Code 里的成绩——但成本低得离谱。

我把第三方实测的"每完成一个任务要花多少钱"列成表,这一栏才是真正扎心的地方:

模型(对应框架)

编码智能体指数得分

每任务成本

完成任务消耗 Token

Fable 5(Claude Code)

略高于 76

约 11.80 美元

约 720 万

GPT-5.5(Codex)

与 76 相当

约 5.07 美元

约 620 万

Grok 4.5(Grok Build)

76

约 2.49 美元

约 190 万

看到没?同样一档的活儿,Grok 4.5 用的 Token 是对手的零头,每任务花的钱不到 Fable 5 的四分之一、GPT-5.5 的一半。 Artificial Analysis 给它的评语是:它牢牢站在"性能对成本"的帕累托前沿上——用大白话说,就是在"花同样的钱能买到多少智能"这条曲线上,它把点画到了别人够不着的位置。

4.3 其它几个亮眼的单项

零散但值得记的几笔:在 GDPval-AA v2(一个衡量真实世界智能体知识工作的榜单)上,它排第四,Elo 分 1543,卡在 Opus 4.8(1600)和 GLM-5.2(1513)之间;在 τ³-Banking(金融场景)上,它拿到 33% 的最高分,甚至压过了 GPT-5.5 的 31%;在 Harvey 的法律智能体基准测试中,官方称它排到了第一。这也印证了它"不只为软件工程而造"的口号——法律、金融这些白领活儿,它确实伸手进去了。

这里得给新手解释一下"智能体知识工作"到底难在哪,不然你可能觉得"不就是回答问题嘛"。传统的问答,是一问一答,模型说完就完事了。而智能体(Agent)任务,是让模型自己规划、自己动手、自己调工具、自己检查、错了再来——比如"读完这个代码仓库,找出性能瓶颈,改好并跑通测试",它得连续做上几十步,中间任何一步崩了,整个任务就废了。GDPval 这类榜单考的正是这种"真实世界里、要自主干很久才能交付"的活儿。Grok 4.5 能在这类榜单上稳居前四、还带着巨大的成本优势,含金量其实比一道单点的解题分要高——因为它证明的是"扛得住长链条、还扛得便宜",这恰恰是企业真正掏钱买单的地方。

不过第四章我也得留个尾巴:Artificial Analysis 同时观察到一个不太妙的现象——Grok 4.5 在知识准确率提升(从 Grok 4.3 的 35% 涨到 52%)的同时,幻觉率也跟着飙了上去(从 25% 涨到 54%)。这是个很典型的规律:模型越大、知道得越多,往往也越"自信",哪怕是它其实不知道的东西,也敢一本正经地编。这条我放到第七章的"冷水"里再细说。

五、真正的杀手锏:又快、又省、又便宜

前面铺垫这么多,现在到了 Grok 4.5 最狠的地方。它的暴击不在跑分栏,而藏在速度、效率、价格这三个字里。这三样单独拎出来都不算稀奇,但叠在一起,就构成了一套"逼所有人重新算账"的组合拳。我一样一样拆。

5.1 速度:约每秒 80 个 Token

它的推理速度高达约 80 TPS(每秒 Token 数),官方原话是"比 flash 类小模型还快"。TPS 这个指标对普通聊天可能感知不强,但对智能体场景是刚需——因为智能体干活时要连续吐大量 Token、反复调用工具,慢一点,整条链路的"墙上时钟时间"就会被拖得很长。速度快,意味着同样一个 Agent 循环,你等的时间明显更短。

一个被反复演示的例子是:一句提示词,它就用 Three.js 写出了一个太阳系 3D 模拟器,支持时间加速、八大行星轨道运动,连 HUD 面板都做得像模像样。这类"一句话出成品"的演示,之所以观感好,一半靠模型聪明,另一半就靠这个速度撑着——你几乎是看着它"实时长出来"的。

5.2 效率:完成同一道题,Token 只有对手的零头

这才是官方最想让你记住的数字。在 SWE Bench Pro 任务里,Grok 4.5 平均只输出约 15954 个 Token 就把问题解决了;而 Opus 4.8 做同一批活,平均要吐约 67020 个 Token。

一除就知道:四点二倍。 Grok 4.5 用了不到对手四分之一的 Token,把同一道工程题做完了。官方更笼统的说法是"大约 2 倍于同类顶尖模型的 Token 效率,用不到一半的步数解决问题"。

为什么这件事这么重要?因为在智能体时代,你的账单不是按"问几个问题"算的,而是按"消耗多少 Token"算的。一个智能体自己跑上几分钟甚至几小时,读代码、调工具、反复自我迭代,Token 是海量吞噬的。这时候"每完成一个任务要烧多少 Token",直接决定了你的成本天花板。

我写一小段伪代码,帮你把这笔账算得更直观一点:

# 一道 SWE Bench Pro 任务的"单任务成本"粗算(仅示意)
def cost_per_task(out_tokens, price_per_million_output):
    return out_tokens / 1_000_000 * price_per_million_output

# Grok 4.5:约 15954 个输出 Token,输出单价 6 美元/百万
grok  = cost_per_task(15954, 6)     # ≈ 0.096 美元

# Opus 4.8:约 67020 个输出 Token,输出单价 25 美元/百万
opus  = cost_per_task(67020, 25)    # ≈ 1.676 美元

print(round(opus / grok, 1))        # ≈ 17 倍量级的单任务输出成本差

(这段只是示意,真实成本还要叠加输入 Token、缓存、工具调用等,但方向不会变:低单价 × 少 Token,两个折扣一叠,单任务成本被打到脚踝。 提醒一句,大模型的价格和计费规则变动非常快,上面都是写稿时的近似口径,请以官方定价页面的实时数据为准。)

5.3 价格:把成本打到骨折

价格表更是直给。我把这一档几个主流模型的 API 定价并排放一起,你自己感受落差:

模型

输入(每百万 Token)

输出(每百万 Token)

Grok 4.5

2 美元(缓存命中约 0.5 美元)

6 美元

Opus 4.8

5 美元

25 美元

GPT-5.6 Sol

5 美元

30 美元

Fable 5

10 美元

50 美元

光看输出单价,Grok 4.5 就只有 Opus 4.8 的四分之一、Fable 5 的九分之一。再叠加前面那个"少烧四点二倍 Token"的效率,两个折扣相乘,单位活儿的真实成本差距,会被拉到一个夸张的量级。

几个价格上的细节也顺手交代清楚,免得你踩坑:

  • 有个更快的"高级/优先"变体:在 Cursor 里,Grok 4.5 有一档"fast"版本,定价约输入 4 美元、输出 18 美元。注意,它买的是优先服务队列(更快被排到、更低延迟),底层还是同一套模型权重,不是另一个更强的模型,别理解错了。
  • 超长上下文另算钱:超过 20 万 Token 的请求会进更高计价档,长上下文不是白送的。
  • 还有个更小的兄弟型号:面向纯编码的 grok-build-0.1,定价更低(大致输入 1 美元、缓存 0.2 美元、输出 2 美元),适合把成本压到极限的高频场景。
  • 批处理和缓存:官方对缓存命中和批处理通常有额外折扣,高频重复上下文的场景,缓存这一项能再省一大截。

5.4 举个具体场景,把账算给你看

光说"便宜"太抽象,我编一个通用化、虚构化的场景,帮你把这笔账落地(数字纯属示意,别当真实报价)。假设一个小团队天天用智能体跑代码修复类任务,一个月要处理一万个这样的任务:

指标(示意)

用 Grok 4.5

用某当代顶级模型

单任务平均输出 Token

约 1.6 万

约 6.7 万

输出单价(每百万 Token)

6 美元

25 美元

单任务输出成本

约 0.10 美元

约 1.68 美元

一万个任务的输出成本

约 1000 美元

约 16800 美元

你看,光是"输出"这一项,量一铺开,差距就从"每任务一块多美元"滚成了"每月一万多美元"的鸿沟。这还没算它更快的速度省下的时间成本。这就是为什么我一直强调:在智能体时代,真正决定账单的不是单价,而是"单价 × 每任务 Token 消耗"这个乘积。 一个模型只要在这两项上都占便宜,量越大,它的优势就越是指数级地放大。

再强调一次,上面的表格是示意性的通用测算,真实场景还要叠加输入 Token、工具调用、缓存命中率、任务失败重试等一堆变量,且各家定价变动很快,务必以官方实时口径为准。但方向是确定的:它把"跑得起大规模智能体"这件事的门槛,实实在在地压低了。

5.5 把三个数字叠在一起

速度、效率、价格,三样单看都不算颠覆,但叠在一起,结论就一句话:在"单位时间、单位成本能买到多少智能"这件事上,Grok 4.5 目前就是那个性价比之王。 它不跟你比谁最聪明,它跟你比"同样一笔预算,谁能多干几倍的活"。对于要把智能体铺开、按量付费、天天烧 Token 的团队来说,这套账一算,很多人是真的要重新掂量一下手里的模型选型了。

莫潇羽@源码七号站 的看法是:这其实是 Musk 一贯的打法——不一定拿最强的牌,但一定要把牌桌掀了,逼对手陪你打一场消耗战。当智能开始像电力一样按度计费,比拼的就不再是"谁家灯泡最亮",而是"谁能让电又便宜又稳"。

六、能力边界:从写代码到 Office 与法律,也有翻车的地方

一台号称"不只为软件工程而造"的模型,边界到底铺到哪儿?我把公开演示和实测反馈梳理了一遍,好的坏的都给你摆出来,不做选择性陈述。

6.1 它能干的活儿,比你想的宽

先说亮的。除了前面那个 Three.js 太阳系,还有几类被反复验证的能力:

  • 一句话出完整前端:在单个 HTML 文件里,它能轻松搞定一个高端 SaaS 落地页,样式、交互、布局都在线。
  • 一句话出小游戏:像素风的"我的世界"式小游戏、以及功能相对齐全的完整小游戏,都有开发者用它跑出来过。
  • 应用内直接出设计稿:有演示显示它在应用内不到一分钟就完成了一整套 2D 加 3D 的设计方案。
  • Office 与知识工作:官方为 Word、PowerPoint、Excel 都上了插件,Grok Build 能直接拼 Excel 模型、做 PPT、写 Word 文档,还能把网页调研的数据拉进多表格的 Excel 里。
  • 法律智能体:前面提过,它在 Harvey 的法律智能体基准上被官方标为第一。

把这些连起来看,它想覆盖的是"一个坐在电脑前的知识工作者,一天到晚要用到的那些活儿"——写代码只是其中一块。

我特别想展开说说"知识工作"这块,因为这才是它区别于纯编码模型的野心所在。它宣称能在大型代码库里游走、能扛住"跨多个仓库、上百个技能、多种工具"的长任务——翻译成人话,就是那种专业工程师日常面对的、乱糟糟的、多文件多依赖的真实工程现场,而不是教科书里干干净净的小题目。再往外一圈,它把手伸进了表格建模、幻灯片制作、文档撰写,甚至合同审阅这类白领日常。你可以粗略地把

🔒
🔒 该内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
注册用户
注册用户
可见 70%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥9.9
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布2 篇
文章总数1289 篇
昨日发布0 篇
本月发布67 篇
建站时间407 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站长微语

联系站长

微信:165255185
AIGC 技术社区
致力于解码 AI前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码
仍在路上

那些寒夜里追赶过的方向

那些冷眼下没放弃的理想

一篇一篇写到现在

仍在路上

"不羁放纵爱自由"

—— 致敬 Beyond
持续创作中 莫潇羽 · 源码七号站