AI学习吧
📍 源码七号站 开源解码 Claude Opus 5 深度拆解:性能几乎追平旗舰,但普通人为什么大概率用不上?

Claude Opus 5 深度拆解:性能几乎追平旗舰,但普通人为什么大概率用不上?

摘要:Claude Opus 5 发布:半价逼近旗舰 Fable 5 的“次旗舰”,跑分多项反超,定价与上代持平。核心强项在长程 Agent、代码调试、电脑操作与 3D 生成,自测意识让交付质量极高,但 Token 消耗更大,日常写作等普通场景增量有限。别迷信“半价”账单,先拆任务再选模型。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 莫潇羽@源码七号站(www.fuyuan7.com 撰写,转载请注明出处。文中所有观点均基于个人学习实践与公开资料整理,仅作交流参考,不构成任何投资、经营或采购建议。

快速摘要(想看完整拆解,往下翻)

一句话结论:Claude Opus 5 是 Anthropic 在 2026 年 7 月 24 日发布的新模型,官方定位是"用一半的价格逼近旗舰 Fable 5 的智能水平",跑分上确实接近,但对绝大多数普通用户来说,你花钱买到的那一部分能力,日常工作里很难触发。

三条最值得记住的信息:

  • 定价延续 Opus 4.8:每百万输入 Token 5 美元、输出 25 美元,和上一代持平;Fast 模式速度约为普通模式的 2.5 倍,单价翻倍。
  • 跑分位置:Frontier-Bench v0.1 拿到 43.3%,直接超过 Fable 5 的 33.7%;ARC-AGI 3 拿到 30.2%,约为第二名的近 4 倍;但 SWE-bench Pro 稍落后 Mythos 5 与 Fable 5 不到 1 个百分点。
  • 真实体验:Opus 5 会做饱和式自测,交付质量高,但完成同一个任务消耗的 Token 明显更多,综合成本对个人用户不一定便宜。

关于 Opus 5 到底强不强、你要不要为它买单,我下面会分九个部分把话讲透:从这次发布的背景,到官方跑分的翻译、Token 消耗账本、真正吃得下这份算力的场景,再到国产替代和我自己的模型分工策略。想看完整拆解,往下翻。

温馨提示:境外大模型服务在国内使用需遵守国内网络与内容管理相关规定,本文仅对模型能力做客观评述,不引导任何绕过网络管理的行为。文中涉及价格、跑分等数据变动很快,均以写稿当日的公开资料为准,请以官方定价页面和评测平台的实时数据为准。

一、这次发布为什么值得单独拆一次

1.1 一条低调推特,信息密度并不低

早上刷屏之前,我以为是又一个"半年小升级",翻完官方推文和博客之后立刻改变了想法。这次 Anthropic 的姿态非常克制,没有开发布会,没有一堆花哨的展示视频,就是一条推特配几张跑分表:"以大约一半的成本,达到接近旗舰 Fable 5 的性能水平"

坦白说,这种"自家新品打自家旧旗舰"的路数,我在国产手机圈见得太多了,看多了就会习惯性提高警惕:一是要看新品到底在哪些指标上追平了旗舰、又在哪些指标上被留了一手;二是要看单价便宜,是不是被使用中的其它成本抵消了。

Opus 5 的关键信息我先按对个人用户最相关的顺序列一遍:

  • 定价:输入 5 美元/百万 Token、输出 25 美元/百万 Token,和上一代 Opus 4.8 完全相同。
  • 上下文窗口:官方给到 1M Token 级别,长文本处理进入"整本书塞进去"的规模。
  • Fast 模式:速度约 2.5 倍,单价翻倍,用来抢那些对首字延迟敏感的实时场景。
  • 平台定位:在 Claude Max 里成为默认模型,在 Claude Pro 里成为可选的最强档。
  • Effort 档位:从 low、medium、high 到 max effort,可以按任务难度手动切换"思考深度"。

在我看来,最值得单独拎出来说的是 Effort 档位这个设计。以前的模型要不"永远燃烧",要不"永远节省",用户没法在同一个模型里做区分。Opus 5 直接把"思考深度"变成一个开关,简单请求走低档、复杂 Agent 任务走高档,账单结构一下子清晰了很多。这个改动对开发者非常友好,对普通用户则意味着:如果你的产品/工具没有暴露这个档位,你可能一直被默认在了并不省钱的中高档上。

1.2 两个月内四款新模型,节奏正在变形

从 Mythos 5、Fable 5、Sonnet 5,到今天的 Opus 5,Anthropic 在两个月内推了四款主力模型。以往一年一次"大版本"的节奏,被压缩成"季度一次大动作、月度一次小动作"。这背后其实是市场结构的变化:

  • 企业客户不再愿意为"顶级智能"付无限的溢价,他们要"够用+可预测的账单"。
  • 训练 - 推理 - 应用之间的分工越来越细,同一个模型家族要覆盖不同价格档。
  • 竞争对手一波接一波:GPT-5.6 Sol、Gemini 3.1 Pro、Kimi K3、DeepSeek V4,都在同一个季度里更新。

Opus 5 的定位其实就是踩在这个缝隙里:不是最强,但要成为"每天真正被跑起来的那一个"。它不再和自家 Fable 5 抢"最聪明"的名头,而是抢"跑起来最划算"的位置。这个策略很像国产手机里的"次旗舰"打法,做出来的产品单看不惊艳,但组合到主流用户手里最合适。

1.3 我的第一印象:数据漂亮,但要看你要用它做什么

我(莫潇羽@源码七号站)自己第一时间做了三件事:一是把官方跑分表逐行对着 Opus 4.8、Fable 5、GPT-5.6 Sol 看了一遍;二是翻了知乎、B 站、X(原推特)上已有的实测反馈;三是对着我自己的工作流问自己一句话:"如果我今天必须为它买单,哪个环节会因为它变得更好?"

答案有点残酷:如果你的工作主要是写文案、做剪辑脚本、做知识梳理、日常问答,Opus 5 提供的增量非常有限。它真正的增量集中在长程 Agent、复杂代码调试、电脑操作类任务、以及一部分 3D/前端生成上。这部分内容我在第五章会展开细讲。

顺手做一张对照小表,先给你一个整体感觉:

维度

Opus 5

Fable 5(旗舰)

Opus 4.8(上代)

输入价格

5 美元/百万 Token

10 美元/百万 Token

5 美元/百万 Token

输出价格

25 美元/百万 Token

50 美元/百万 Token

25 美元/百万 Token

上下文窗口

1M Token

1M Token

200K Token

Frontier-Bench v0.1

43.3%

33.7%

约 18.9%

ARC-AGI 3

30.2%

约 7.8%

约 1.5%

CursorBench 3.2(max)

距 Fable 5 峰值 0.5% 以内

峰值

明显落后

定位

日常主力

极限旗舰

前代主力

看完这张表你大概就能理解,为什么我说"跑分很漂亮"但"日常增量有限":漂亮的地方基本都集中在 Agent、代码这一类"高强度"任务上,而这些任务恰好不是大多数普通用户每天在做的事。


二、把官方数据翻译成人话:Opus 5 到底强在哪

跑分表看多了容易糊,我用"钱、脑、手"三个维度重新翻译一遍,这样即便你不看基准测试也能听得懂。

2.1 钱:定价体系里的"半价旗舰"是怎么算出来的

先把定价说清楚,避免后面反复解释:

Claude Opus 5 定价(写稿当日)
- 输入:5 美元 / 百万 Token
- 输出:25 美元 / 百万 Token
- Fast 模式:速度约 2.5 倍,单价约为普通模式的 2 倍
- 上下文窗口:1M Token

Claude Fable 5 定价(对比参考)
- 输入:10 美元 / 百万 Token
- 输出:50 美元 / 百万 Token

结论:Opus 5 单价约为 Fable 5 的 50%。

Anthropic 官方说"半价旗舰"的口径就是从这里来的:单价对齐 Opus 4.8,性能追齐 Fable 5,等于同价位内跳了一整代

我要提醒的是:单价便宜,只是账单的其中一个变量。账单 = 单价 × 消耗 Token 数。如果 Opus 5 完成同一个任务需要消耗更多 Token,"半价"的说法就会被削弱一部分。这一点我在第四章会展开成一节专门讲。

对普通用户而言,如果你走 Claude Pro 或 Max 订阅,Opus 5 已经成为默认或最强档,账单其实不太用你操心;如果你走 API,就要认真算这笔账。用一句话概括:"半价"是个正确的市场语言,但不是一个可以直接抄进你 Excel 里的数字。

2.2 脑:跑分逐项拆解,一次看清 Opus 5 的能力地图

官方一共公布了近十项跑分,我挑几项对普通用户和知识工作者最有参考价值的展开讲。

第一项,Frontier-Bench v0.1,考察 Agent 化的终端编程能力。Opus 5 拿到 43.3%,比 Fable 5 的 33.7% 还高出接近 10 个百分点,比 Opus 4.8 的成绩几乎翻倍。这项跑分翻译成人话就是:"你能不能扔给它一个真实项目,让它自己在命令行里查文件、装依赖、跑测试、修 Bug"。Opus 5 在这一项上确实是当前公开模型中的第一梯队。

第二项,ARC-AGI 3,考察"没见过的新问题"求解能力。Opus 5 拿到 30.2%,第二名 GPT-5.6 Sol 只有约 7.8%,差了将近 4 倍。ARC-AGI 3 是 François Chollet 主导设计的一套基准,专门针对"训练时没见过"的题型,用来避免模型靠记忆刷分。这项跑分说明 Opus 5 在通用推理上出现了一次比较明显的架构级提升,不只是"多喂了点数据"。

第三项,CursorBench 3.2,考察代码编辑与协同能力。在最高努力模式下,Opus 5 距离 Fable 5 的峰值分数不到 0.5 个百分点,成本却只有 Fable 5 的一半左右。也就是说,如果你是重度写代码的用户,Opus 5 已经足够替代 Fable 5

第四项,OSWorld 2.0,考察电脑操作(Computer Use)能力。Opus 5 拿到约 70.6%,超过 Fable 5 的最好成绩,成本只有大约三分之一。这项跑分和一类新兴的应用场景直接绑定:让模型在真实的操作系统里点鼠标、填表单、跑流程。你如果做 RPA(机器人流程自动化)、内部管理系统的自动化任务,这里的提升是实打实的。

第五项,GDPval-AA v2,考察真实经济价值任务。Opus 5 拿到约 1861 的 Elo 分数,直接领先 Fable 5 和 GPT-5.6 Sol,是这项基准里当前公开模型的头名。这项跑分覆盖分析、写作、综合、报告生成等知识工作者最常见的输出,是我个人比较重视的一项。

再补几项相对次要但值得知道的:

  • HLE(人类最后的考试):Opus 5 约 64.7%,位列第一档,比同价位模型高出不少。
  • AutomationBench(Zapier 自动化榜):Opus 5 通过率约 26%,同成本下大约是"第二名的 1.5 倍",Zapier CEO 的原话是"没多花 Token 就登顶了"。
  • SWE-bench Pro:Opus 5 稍稍落后 Mythos 5 和 Fable 5 不到 1 个百分点,比上一代 Opus 4.8 的 69.2% 上了一整个台阶。

我把这些放到一张能力雷达式的对照表里,方便你一眼看全局:

能力方向

Opus 5 相对水位

日常触发频率(普通用户视角)

Agent 化编程

顶级

通用新问题推理

顶级

代码编辑

接近顶级

电脑操作类任务

顶级

知识工作综合输出

顶级

长文档理解

上游

数学与形式推理

上游

生物/化学等科研

上游

极低

这张表你可能会看半天:能力顶级的方向,普通用户日常几乎用不到;日常用得到的方向,Opus 5 虽然也强,但和上一代、以及同档的其它模型差距并没有那么夸张。这就引出下一节:那个让 Opus 5 特别"贵"的能力,其实是"自测意识"。

2.3 手:Opus 5 的"深思熟虑+主动"意味着什么

Anthropic 官方给 Opus 5 的定位是"deliberate and proactive",中文可以翻成"深思熟虑并且主动"。这不是一句营销话术,而是对模型行为方式的具体描述。

深思熟虑指的是:模型会先检查自己的假设,把不确定的点显式列出来,然后再决定要不要继续。主动指的是:模型会自己搭建验证条件,比如自己写测试脚本、自己截图对比、自己起一个模拟器把结果跑一遍。发现错了会主动继续改,而不是等你回一句"你写错了"再返工。

这在实际使用里最直接的表现,就是知乎上有人总结过的一段话:Opus 5 在前端和客户端项目里,会"对照原始需求每个功能点逐一截图确认";在后端项目里,会"为每个功能点编写详细用例,整个工程测试点超过 1000 个"。

我用一段伪代码把它"内心 OS"的循环画出来给你看,可能比一堆形容词直观:

while task_not_done:
    plan = 分解任务与可能的失败点
    result = 执行当前步骤
    if 我对结果不完全确定:
        写一个针对性的自测(截图 / 单元测试 / 边界用例)
        跑一遍
        if 自测失败:
            回到 plan,修正假设
    if 全部子任务通过并且自测都过:
        task_not_done = False

输出:交付物 + 自测报告

代价是什么?非常直接:同一个任务,Token 消耗明显高于以往任何一代。当模型开始主动写测试、跑测试、截图比对、循环修正,输入输出的字符量就会成倍上涨。综合成本高不高,就变成了下一章要仔细算的账。


三、跑分之外:Opus 5 与自家兄弟的真实关系

跑分我们已经翻译完了,接下来聊一个更有意思的问题:Opus 5 和 Fable 5 是不是一个东西? 答案是明确的:不是。而且理解这两者的分工,比看跑分本身重要得多。

3.1 Opus 5 和 Fable 5 的定位差异,其实很微妙

先说结论:Fable 5 是"极限旗舰",Opus 5 是"能被日常跑起来的次旗舰"。这不是我自己拍脑袋分的,而是从官方基准表和访谈里读出来的:

  • Anthropic 明确说 Fable 5 仍然是"能力最全面的模型",是他们内部体系里的天花板。
  • Opus 5 的口径是"接近前沿智能,但价格是一半",从来没说自己超越 Fable 5。
  • 两者的上下文窗口都是 1M Token,跑起来的接口几乎一致,可以理解成同一台车的两种发动机。

但请你注意这句话里最关键的两个字:接近。接近不是持平,也不是超越。你要真的把它们放到"能不能一直连轴跑"的场景里对比,才能感受到差异。

我自己更愿意用一个粗糙但有用的比喻:Fable 5 更像那种可以持续加班到凌晨的资深工程师,你交给它一件需要连续折腾八小时的复杂事情,它能一直保持水准;Opus 5 更像一个能做出漂亮结果、但需要合理排期的高级工程师,短平快的任务里效率极高,但真要它连续跑很久,仍然会看得出体力上限。

这不是我一个人的判断。从 Anthropic 官方对 Opus 5 的表述里也能看出来:他们承认 Opus 5 "在长周期、自主研究类任务上仍有局限,Mythos 5 依然更强"。这句话背后就是"次旗舰"三个字。

3.2 Opus 5 的强项在哪,Fable 5 的强项又在哪

我把官方跑分表里两者直接可比的项目挑出来,分成三类:

第一类,Opus 5 领先 Fable 5 的项目。

项目

Opus 5

Fable 5

差距

Frontier-Bench v0.1(Agent 编程)

43.3%

33.7%

领先 9.6 分

ARC-AGI 3(新问题推理)

30.2%

约 7.8%

领先约 22 分

GDPval-AA v2(真实经济任务)

约 1861

约 1740 上下

领先约 100+ 分

OSWorld 2.0(电脑操作)

70.6%

约 65%

领先约 5 分

AutomationBench(Zapier 自动化)

约 26%

约 17%

领先约 9 分

第二类,Opus 5 和 Fable 5 接近持平的项目。

  • CursorBench 3.2:Opus 5 在最高努力模式下距离 Fable 5 峰值不到 0.5 个百分点。
  • BrowseComp:Opus 5 约 90.8%,与 Fable 5 差距在 1 到 2 分内。
  • MMMU-Pro:视觉理解上两者差距非常小。

第三类,Fable 5 仍然明显领先或独占的项目。

  • 复杂法律推理与长程法条应用。
  • 医疗健康类的长文推断(HealthBench Professional 上,Fable 5 高于 Opus 5 若干分)。
  • 高强度、超长时间的自主研究任务。
  • 深度形式化数学与证明。

看到这个分布,你就能理解一件事:Opus 5 是一个"往软件工程、Agent、办公自动化方向"做过定向优化的模型,它在这些方向上不仅追平了 Fable 5,甚至在部分项目上超越了;但在"更基础的推理、法律、医疗"这些方向上,Fable 5 依然更值得信赖。

这也说明一句话:"最新"不等于"最强"。买模型和买手机一样,参数表要按你的使用场景去读,而不是按发布时间去读。

3.3 官方图表里那些没说破的信息

我(莫潇羽@源码七号站)习惯把大厂的图表当成一份"密码本"来看。有几个细节,你一开始不会注意到,但看多了就明白:

信息一:那些"输给 Fable 5"的项目,往往是模型能力的地基。推理、法律、医疗,都是需要长链路稳定性的能力,是所有其它能力的地基。地基有优势的一方,往往在实际使用中的稳定性更好,只是这种优势不容易在短 Demo 里看出来。

信息二:Opus 5 赢下来的项目,多数带有"操作"和"闭环"的属性。Agent 编程、电脑操作、自动化流程,本质都是"给它一个目标,让它自己反复试到成功"。Opus 5 的自测意识让它在这类任务里能"稳稳跑完",而不是"跑到一半掉线"。

信息三:Fable 5 的"存在感"其实在下降。同一家公司里,如果次旗舰能拿下 7 项跑分、旗舰只拿 4 项,那旗舰的存在意义就要重新论证。这也是为什么很多海外分析师直接说"日常大部分工作用 Opus 5,只有最硬核的自主任务用 Fable 5"。

信息四:Zero Data Retention(零数据保留)是个隐藏加分项。Opus 5 支持 API 层面的零数据保留,Fable 5 目前还需要 30 天保留。这一点对企业客户,尤其是有合规审计需求的行业客户,重要性远高于跑分。

给你一段能背下来的记忆口诀:"跑分看方向、地基看稳定、账单看 Token、合规看保留"。这四句话我在自己做技术选型时几乎每次都会念一遍。


四、Token 消耗才是核心变量:为什么"半价"未必等于账单减半

到了最实用的一节。跑分和定位都聊完了,我们必须回答那个真正决定你要不要用它的问题:"这个月账单会不会因为切到 Opus 5 就便宜下来?"

4.1 单价便宜 ≠ 账单便宜

我先把公式明明白白写出来,避免和你玩文字游戏:

单次任务成本 = 输入 Token 数 × 输入单价 + 输出 Token 数 × 输出单价

举例说明(数字仅为示意,请以官方定价页面的实时数据为准):
情境 A:Opus 5 完成一个任务
  输入 100,000 Token × 5 美元 / 百万 = 0.5 美元
  输出  30,000 Token × 25 美元 / 百万 = 0.75 美元
  单次总成本 ≈ 1.25 美元

情境 B:Fable 5 完成同一个任务
  输入  50,000 Token × 10 美元 / 百万 = 0.5 美元
  输出  15,000 Token × 50 美元 / 百万 = 0.75 美元
  单次总成本 ≈ 1.25 美元

看到没?在这个假设下,两者最后的账单几乎一样。Opus 5 的"半价"是在"完成同样任务、消耗同样 Token"的前提下才成立的,而这个前提在实际使用里未必总是成立。

Opus 5 的自测意识越强、跑测试越多、截图越多,输入输出 Token 就越多。跑测试要读代码,截图要生成图像描述,反复修正要多轮对话,这些都是钱。

4.2 网友实测里出现的两种极端案例

我翻了 X、B 站、知乎、36 氪上能找到的实测反馈,大概能分成两个极端:

极端一:Token 消耗小幅上升,但因单价低,综合账单反而更便宜。这一派的典型代表是"我的世界复刻"这一类前端/3D 生成任务。有个海外博主晒了 Opus 5 生成的龙卷风、攻城车、可探索 3D 住宅等 Demo,成本 - 效果比很好看。他给出的数字是 Opus 5 和 Fable 5 的 Token 消耗接近,但因为单价便宜,最终账单降了。

极端二:Token 消耗剧烈上升,"半价"完全被吃掉甚至倒挂。这一派的代表案例是某些带物理效果的复杂 3D 演示——一次生成里模型要反复计算受力、反复调整参数、反复自测画面。有海外用户吐槽说"三条 prompt 就把额度用光了",国内也有 B 站 UP 主晒过"三轮实测两百多块"的账单截图。这类场景下"半价"的说法基本失效,甚至比 Fable 5 更贵。

导致这种差异的一个隐藏原因是:Opus 5 会根据它对任务复杂度的判断,自己决定要不要拉高 Effort 档位。你给了它一个看似简单的 prompt,但如果它认为"这件事需要认真想想",它就会主动进入高档,Token 消耗随之翻几倍。这也是为什么很多用户觉得"我明明只问了一句话,怎么账单这么高"。解决办法是在 prompt 里显式声明"请用最低档处理",或者在 API 调用时把档位固定住,别让它自己发挥。

为什么会出现这种两极分化?我自己复盘下来,主要有三个变量:

  • 任务类型:短平快的输出,Opus 5 优势明显;越是需要模型反复自测、反复修正的任务,Token 消耗涨得越快。
  • Effort 档位:低档任务里 Opus 5 非常省,最高档任务里就"火力全开",Token 用量差距能有好几倍。
  • 是否有代码执行环境:接了代码执行、浏览器、文件系统的场景,模型会自己触发很多次调用,账单跳得快。

4.3 我给知识工作者的一个简单成本估算方法

如果你是一个内容作者、独立开发者、小工作室的运营者,你不需要专门做压测,只要记住下面这套"三步估算法":

第一步,把任务分成三类

任务类型

典型场景

建议档位

短平快

起标题、写摘要、改文案、翻译

Low 或默认

中等

写公众号长文、写代码模块、做数据分析

Medium

高强度

长文章一次成稿、复杂项目 Agent、跨系统 RPA

High 或 Max

第二步,估算平均 Token 用量

  • 短平快任务,一般输入 2000 到 5000 Token,输出 1000 到 3000 Token。
  • 中等任务,一般输入 10000 到 30000 Token,输出 3000 到 10000 Token。
  • 高强度任务,可以直接翻十倍甚至更多。

第三步,算月度上限

月度粗估 = 单次估算 × 日均次数 × 30

举例:
每天 5 次公众号长文写作(中等任务)
输入 20000 × 5 美元 / 百万 = 0.1 美元
输出  6000 × 25 美元 / 百万 = 0.15 美元
单次约 0.25 美元
每天 5 次 = 1.25 美元
每月 30 天 ≈ 37.5 美元

(价格变动很快,此为写稿时的近似行情,请以官方实时数据为准)

按这个粗估法,一个普通的中文自媒体作者,主用 Opus 5 处理长文写作,一个月的 API 账单大概在几十到一百多美元。这就是"半价旗舰"的实际含义:不是"零成本旗舰",是"账单从很难承担变成还能承担"

如果你走的是 Claude Pro 或 Max 订阅,账单结构不一样,但配额是有的。我建议你在实际用的时候,专门记录一下"哪些任务让你飞快跑掉配额",然后把它们改成用更便宜的模型去做。


五、Opus 5 在什么场景下值得花钱

前面聊了那么多,我们必须落到一个具体问题上:什么样的活儿交给 Opus 5,你是"付出即回报",什么样的活儿交给它就是"烧钱不见效"。这一节我按场景分四类展开,每一类我都会给一个"值不值"的直白判断。

5.1 长程 Agent 与自动化任务:这才是 Opus 5 的主场

如果你有一个需要模型"跑完一整套流程"的任务,Opus 5 值得直接上。举几个我自己认可的典型场景:

  • 从原始客户数据表出发,自动清洗、打标签、跑分群、生成运营策略、写出对应的沟通话术。
  • 从一个 GitHub Issue 出发,自动拉分支、写补丁、跑测试、通过后自动 PR。
  • 从一份客户健康度报表出发,自动识别流失风险、生成一份可以直接发送的挽留邮件草稿。

这些场景的共同点是:任务链条长、需要模型在中途做判断和修正、成败取决于"跑完全流程"而不是"某一步很聪明"。Opus 5 在 AutomationBench、Frontier-Bench、OSWorld 上碾压对手,本质就是这一类能力的体现。

我个人的判断:如果你在做 Agent 应用开发,Opus 5 现在是最不容易掉链子的选项之一。它比 Fable 5 便宜,比 Sonnet 5 更稳,跑长任务不容易出现"走到一半忘了自己在干嘛"的情况。

5.2 编程与代码调试:接近 Fable 5、账单只有一半

对严肃写代码的人来说,Opus 5 的性价比非常突出。总结一下我自己的观感:

  • 一次性写出的代码质量:比上一代 Opus 4.8 明显提升,但和 Fable 5 差距不大。
  • 调试与根因分析:进步幅度是这一代最明显的地方。Cognition(Devin 的团队)在 FrontierCode 1.1 上的评估是"接近 Fable 级"。
  • 对存量代码的理解:1M 上下文窗口意味着你可以把一整个中型仓库直接扔进去,让它做全局改造。
  • 主动写测试:这个我在第二章已经讲了,落到工程里就是"交付时的 Bug 明显更少"。

代价还是那句话:Token 消耗高、跑一次时间也不短。它更像一个愿意花时间把事情干对的工程师,而不是一个追求"抢答"的实习生。

给你一条实用建议:如果你在使用 Claude Code、Cursor 这种把 Opus 5 接进 IDE 的工具,可以把简单任务(改错别字、加注释、格式化)挪到便宜的模型上,把 Opus 5 留给"跨文件的大改造""复杂 Bug 定位""需要写测试的功能开发"。这样账单能省下一大截,效果几乎不下降。

顺手多分享一个我踩过的坑:Opus 5 上下文窗口给到了 1M,但不代表你就该把所有能塞的都塞进去。塞得太多会让模型的注意力分散、Token 消耗成倍上涨、响应速度变慢。我的做法是先做一遍"上下文压缩"——把不相关的目录、无关的历史对话、不影响判断的日志剔掉,再喂给它。同样的任务,压缩之后的 Token 消耗常常只有原来的三分之一到一半,输出质量反而更高。

5.3 3D、游戏原型、可视化生成:Demo 场景是它的高光

Opus 5 发布之后,X 上刷屏最快的是 3D 相关的 Demo。一位海外开发者用它做了一个类似"我的世界"的沙盒原型,从敲砖块到攻击反馈都做出来了,视觉细节接近原版八九成。还有攻城车、龙卷风、可探索的 3D 住宅等等。

这些 Demo 之所以能刷屏,是因为它们同时命中了三个能力:

  • 空间与几何理解:模型能想清楚"一个物体如果这样摆,从这个角度看会是什么样"。
  • 代码到画面的映射:模型能把描述翻译成 Three.js、Babylon.js 或 WebGL 的代码。
  • 主动自测:模型会自己跑起来看效果,不满意会主动改。

我要提醒的一点是:Demo 场景 ≠ 生产场景。如果你只是做原型演示、投标 Demo、给客户预览一个大概的可视化效果,Opus 5 非常适合,一晚上能做出很惊艳的东西。但真要把它做进正式的游戏项目、正式的工业可视化,还是要人写代码、模型只做辅助。

顺带说一句关于 AI 生成 3D 场景/视频的合规提示:在国内自媒体平台发布 AI 生成或深度加工的内容时,多数平台都要求显著标注"AI 生成"或"内容由 AI 辅助创作",这是合规刚性要求,别为了传播效果偷懒不标。涉及影视素材、AI 声音克隆、名人形象等场景,还要格外注意版权与人格权相关的规定,商用素材务必取得正版授权。

5.4 电脑操作类任务:一个正在被打开的新入口

OSWorld 2.0 这项跑分背后的应用方向是"计算机使用(Computer Use)",简单说就是"让模型看着屏幕,自己动鼠标键盘"。这类应用现在还比较新,但会变成企业内部效率工具里的重要一环。典型场景包括:

  • 自动填内部管理系统里的表单。
  • 自动跑一个跨多个 SaaS 工具的数据同步流程。
  • 自动完成一份多人协作模板里的字段。

Opus 5 在这一类任务上做到了"用 Fable 5 三分之一的成本,超过它的最好成绩"。对企业客户来说,这类能力就是账单杀手:RPA 的成本被打下来一大截

对个人用户来说,短期内你不太会直接用到这项能力,但它意味着一件事:未来一到两年,你现在手工做的很多重复劳动,都会被 Agent + Computer Use 的组合替代。这不是危言耸听,而是从跑分曲线里就能读出来的趋势。

对你的启示是:别再花时间把自己练成"点鼠标最快的人"。任何重复性的电脑操作,只要有明确输入输出,都会被 Agent 覆盖。你真正应该练的,是那种"需要判断、需要审美、需要经验"的能力——什么该做、什么先做、什么值得做深,这些才是模型现在还不擅长的地方,也是你未来最有护

🔒
该内容仅对更高等级社区用户开放
请谨慎解锁时效性强且发布日期较早的文章
单篇解锁后若未显示全文请刷新页面
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
注册用户
注册用户
可见 70%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥9.9
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数1314 篇
昨日发布7 篇
本月发布25 篇
建站时间419 天
🔍 搜索
📅 日历
« 2026 » « 09 »
 123456
78910111213
14151617181920
21222324252627
282930    
站长微语

联系站长

QQ:2805463528
AIGC 技术社区
致力于解码 AI前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长QQ二维码
AI交流群
AI交流群
仍在路上

那些寒夜里追赶过的方向

那些冷眼下没放弃的理想

一篇一篇写到现在

仍在路上

"不羁放纵爱自由"

—— 致敬 Beyond
持续创作中 莫潇羽 · 源码七号站