本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要(只想要结论就看这一段)
Anthropic 在 2026 年 6 月 9 日深夜发布了两款同源模型:面向公众的 Claude Fable 5,以及只对受信任机构开放的 Claude Mythos 5。两者底层是同一套模型,Fable 5 在敏感领域加了一层"安全网"——遇到网络安全、生物、化学、模型蒸馏这四类高风险问题,会自动把回答切换到上一代的 Claude Opus 4.8,触发概率不到 5%。
这次发布的硬核看点:Stripe 用 Fable 5 在一天内完成了 5000 万行 Ruby 代码库的全量迁移,而同样的工作量人工团队需要两个多月;SWE-Bench Pro 上拿到 80.3%,比 Opus 4.8 高出 11 分;视觉方面仅凭原始游戏截图就通关了《宝可梦:火红》,不需要任何辅助脚手架;生命科学领域,Mythos 5 把蛋白质设计的部分流程提速约 10 倍,在 14 个蛋白靶点里跑出 9 个有效候选,还独立完成了一周多的自主基因组学研究。
价格定在每百万输入 token 10 美元、输出 50 美元,差不多是 Opus 4.8 的两倍。Pro、Max、Team 与按席位计费的 Enterprise 订阅用户在 6 月 22 日前免费用,之后改为按 credit 计费。模型已经在 Claude API、Claude 平台、AWS Bedrock 同步上线。
想看完整拆解,往下翻。下面我会把这一次发布的来龙去脉、技术细节、应用场景、安全机制和落地玩法都摊开来讲一遍。
一、Anthropic 把"神话级"模型推到了普通用户面前
1.1 这次发布到底是什么级别的事
先把时间线理一下,顺序很重要。
2026 年 4 月,Anthropic 首次披露了一个内部代号叫 Mythos(神话)的模型家族。当时这件事没有像普通新模型那样直接开放给所有人,反而引发了金融圈和政府层面的震动——原因是 Mythos 在发现软件漏洞这件事上表现得过于强悍。公司直接选择不公开发售,只通过一个叫 Project Glasswing(玻璃翼计划) 的项目,把模型小范围交给网络安全防御机构和关键基础设施提供商使用。
短短两个月后,事情有了新进展。在 6 月 9 日这天晚上,Anthropic 同时推出了两款新模型:
- Claude Fable 5:面向所有付费用户开放,加了一层安全网,可以被理解为"驯化版"的 Mythos。
- Claude Mythos 5:依然只对受信任的合作伙伴开放,是 Mythos Preview 的升级版,完整能力。
我自己看到这条消息的第一反应是:Anthropic 终于把神话级别的能力拿出来面对真实的市场了。这件事的分量,远远超过一次普通的版本号迭代。莫潇羽@源码七号站 这边一直在跟踪大模型的能力曲线,Fable 5 是过去半年里第一个让我觉得"能力跃迁的台阶肉眼可见地变高了"的版本。
1.2 为什么说这是一次"能力跃迁"
普通模型升级,大家习惯看的是基准分数涨了几个点。Fable 5 不太一样,它在多个评测上的表现是这样的:
|
评测维度 |
Fable 5 / Mythos 5 |
Opus 4.8 |
拉开差距 |
|
SWE-Bench Pro(智能体编码) |
80.3% |
69.2% |
+11.1 分 |
|
FrontierCode(Cognition 出品) |
29.3% |
显著低于 Fable 5 |
大幅领先 |
|
Hebbia Finance Benchmark(金融分析) |
全场最高 |
— |
创纪录 |
|
视觉通关《宝可梦:火红》 |
仅靠游戏截图通关 |
需复杂脚手架 |
跨越式 |
注:SWE-Bench Pro 是用真实开源仓库的 issue 来考察模型能不能像工程师一样写 PR 解决问题的评测,被业内当作智能体编码能力的硬指标;FrontierCode 则是 Cognition(就是搞 Devin 那家)推出的更难的前沿编程基准,专门用来看高级别推理任务表现。
10 个百分点这个数量级很关键。过去一年大家看惯了"小数点后两位"的进步,突然出现一个 11 分的台阶,意味着能力分布出现了结构性的跳跃,而不是渐进式的优化。
1.3 任务越长越复杂,Fable 5 的优势越明显
Anthropic 自己在发布博文里反复强调一句话:任务越长、越复杂,Fable 5 相对于以往模型的优势就越大。
这句话翻译成人话就是:Fable 5 真正适合的不是"写一个 50 行的脚本",而是那种以前需要一整个团队、跑好几天甚至好几周的长程任务。它对上下文的把控、对中间状态的记忆、对失败后自我修复的能力,在长跑场景里被拉到了一个新的高度。
合作伙伴 Cursor 的反馈里有一句话:Fable 5 打开了"以前模型够不到的长时程问题的一整类"。再举一个例子,Hex(数据分析平台)做内部评测时,Fable 5 在他们自己的核心评测上第一次突破了 90%,比 Opus 4.8 直接高了 10 分。
我自己折腾下来的体会是,这种能力跃迁对应到日常使用上,大概是这么个区别:
以前的模型:你给它一个明确的小任务,它做得很好。
↓
Fable 5:你给它一个模糊的大目标,它自己拆任务、查资料、
跑工具、踩坑回滚、最终把活做完。
也就是说,从"听话的小工"进化到了"能自己扛活的高级工程师"这一档。
1.4 这次发布的几个关键事实
为了避免大家被各种新闻稿绕晕,我把这次发布的关键事实先捋清楚:
- 发布日期:2026 年 6 月 9 日(美国时间)。
- 模型层级:Mythos 级,Anthropic 内部能力最强的一档。
- 可用渠道:Claude 网页端 / 客户端、Claude API、Claude 平台、AWS Bedrock(北弗吉尼亚区与斯德哥尔摩区首发)。
- API 模型字符串:
claude-fable-5。 - 价格:输入 $10 / 百万 token,输出 $50 / 百万 token。
- 订阅福利窗口:6 月 22 日前,Pro / Max / Team / 按席位 Enterprise 用户免费使用;6 月 23 日起改为消耗 credit。
- Mythos 5 渠道:只对 Glasswing 项目内的受信任机构开放,Mythos Preview 的存量用户自动升级。
- 应用 30 天数据保留:所有 Fable 5 调用强制 30 天日志保留(即便是零数据保留的企业合同也不例外),这点企业用户要特别留意。
把这些事实摆出来,接下来再讲技术细节会更顺。
二、Fable 5 与 Mythos 5:同一个大脑,两副面孔
2.1 把"双子模型"这件事讲清楚
很多人第一眼看到 Fable 5 和 Mythos 5 这两个名字,会以为是两款不同的模型,其实不是。两者用的是同一套底层权重,Anthropic 是通过"外围的安全分类器"来做区分的。
打个不太严谨但好理解的比方:
- Mythos 5:原始的、完整能力的"野生"模型,关在玻璃柜里,只给特定几个白名单组织摸。
- Fable 5:外面套了一层会自动报警的"安全外壳",在四个高风险话题区会主动切换到上一代 Opus 4.8 来回答。
这两个模型在 95% 以上的场景下表现是完全一致的,只有当用户的问题命中"网络安全 / 生物 / 化学 / 模型蒸馏"这四个敏感分类时,Fable 5 才会把回答交给安全性更稳的 Opus 4.8。
2.2 这种"分类器路由"机制是怎么工作的
我画一张流程图,帮你直观理解 Fable 5 的内部流转:
flowchart TD
A[用户提问] --> B[安全分类器先扫一遍]
B --> C{命中敏感分类?}
C -- 否 95%+ 场景 --> D[Fable 5 直接回答]
C -- 是 不到 5% 场景 --> E[切换到 Opus 4.8 回答]
D --> F[输出结果]
E --> F
F --> G[用户看到答案]
整个机制的核心,是 Anthropic 在主模型之外额外训练了一组分类器,这些分类器本质上也是小型 AI 系统,专门盯着用户的输入,判断有没有越过红线。一旦命中,后台静默切换到 Opus 4.8,用户在客户端可能完全察觉不到——这也是为什么很多评测者说"安全切换有时候来得比较突兀"。
四个被特别看管的领域分别是:
- 网络安全(cybersecurity):漏洞挖掘、攻击链构造等。
- 生物学(biology):特别是与生物风险相关的内容。
- 化学(chemistry):涉及危险化合物合成的部分。
- 模型蒸馏(distillation):用大模型去训练或抽取小模型的能力。
Anthropic 自己给出的数据是:安全分类器在不到 5% 的会话里会触发。也就是 100 次对话里,大概不到 5 次你实际拿到的是 Opus 4.8 的回答,其余都是完整的 Fable 5。
2.3 为什么要做成"双子模型"
这个设计其实回答了一个困扰整个 AI 行业的问题:怎么让一个能力强到能干"坏事"的模型,安全地给所有人用?
历史上有两种思路:
- 思路 A:把强大的模型藏起来,只给小圈子用——Mythos Preview 走的就是这条路。
- 思路 B:把模型能力削弱,做成所有人都能用的版本——但这会损失大量正当用户的体验。
Anthropic 在 Fable 5 上选了第三条路:底层能力不削弱,外层加分类器,只在确实危险的请求上切回兜底模型。这样的好处是,普通用户在 95% 以上的场景里仍然能享受到顶级模型的能力,只有真正越界的请求才会被降级。
Mythos 5 这一支保留了原始能力,继续走 Glasswing 项目分发给可信机构。这个计划在过去两个月已经从最早的几家扩展到了 15 个国家的数百家机构,覆盖的主要是关键基础设施的提供商。
2.4 Anthropic 红队都测了什么
为了让 Fable 5 在公开场合"经得起锤",Anthropic 内部跑了一轮非常重的安全测试。莫潇羽@源码七号站这里整理了几个关键数据:
- 超过 1000 小时的红队测试与 bug 赏金活动。
- 0 个通用越狱被发现——也就是说,在 1000+ 小时的对抗测试里,没有一个普遍适用的 jailbreak 方案能让 Fable 5 在敏感领域全面失守。
- 安全分类器在内测中的误报率被刻意调到了偏保守的一档,Anthropic 解释说"宁可让用户感觉切换略频繁,也不能让漏网概率变高"。
这是一组对"模型安全工程"建立信心的硬数据。换言之,Anthropic 的态度其实很明确:模型能力可以放出来,但底线要靠工程,而不是靠模型的自觉。
2.5 Fable 与 Mythos 之外:还有一个 Opus 4.8 兜底
讲到这里很多人会问:既然 Opus 4.8 已经被 Fable 5 全面超越,为什么还要把它留下来当兜底?
答案是:Opus 4.8 在那四个敏感领域的"安全成熟度"已经经过了长时间公开验证。它的能力不如 Fable 5,但它在处理高风险内容时的风险控制已经被验证过。让 Opus 4.8 来兜底,本质上是把"在敏感领域降级到一个被充分测试过的模型"这条工程默认值写死。
这就形成了一个完整的层级:
能力梯队(从强到弱):
Mythos 5(完整能力,仅 Glasswing 内部)
↓
Fable 5(完整能力 + 分类器,公开发售)
↓ 切到敏感领域时降级
Opus 4.8(成熟模型,兜底)
这一套设计,某种程度上代表了顶级模型公司应对"双重用途"(dual-use)难题的最新工程答案。也是我个人觉得这次发布最值得行业研究的部分——比那些刷分的数字更有长期价值。
三、5000 万行 Ruby 代码 1 天迁移完:Stripe 案例的细节拆解
3.1 这个数字为什么会被反复引用
如果让我从这次发布里挑一个最值得自媒体反复传播的数据,毫无疑问是这一条:
Stripe 在 5000 万行 Ruby 代码的代码库里,用 Fable 5 完成了一次"全代码库迁移",耗时仅 1 天;同样的工作量,如果由人工团队来做,需要 2 个多月。
这不是营销话术,而是 Stripe 在 Anthropic 发布前的早期测试里亲自报出来的数字。Anthropic 在官方博文里把它放在了非常显眼的位置,因为它第一次给出了一个具体到行数和时间的"长程任务"产业案例。
把这个数字拆开看更直观:
- 代码体量:5000 万行,这是大型科技公司基础设施级别的代码体量。Stripe 作为全球最大的支付处理平台之一,后端长期以 Ruby 为主力语言,它的主仓库一直是业内典型的"巨型单体仓库"案例。
- 任务类型:codebase-wide migration,中文一般翻译成"全代码库迁移"——意思是在整个代码库范围里,把某种用法、某种 API、某种语法替换成新的版本。这种任务的难点不是单点修改,而是要在浩瀚的代码海里保持一致性。
- 时间差:1 天 vs 2 个多月,差不多是 60 倍以上的效率提升。这个数量级的差距,不是"工程师用 AI 提效一两倍"那种说法能解释的。
3.2 "全代码库迁移"到底难在哪
很多人没做过大型代码迁移,可能感受不到这件事到底有多麻烦。我列一下迁移工程里最折磨人的几个点:
- 依赖网状关系复杂:一处改动可能影响几十、上百个模块,牵一发而动全身。
- 隐式约定多:代码库里有大量"约定俗成"的写法,没有文档,只有老员工知道。
- 测试覆盖不均:有些模块测试很全,有些模块几乎没有测试,改完之后能不能跑要靠"祈祷"。
- 回滚成本高:一旦中途某一步出问题,要回到一个干净状态非常困难。
- 上下文窗口爆炸:5000 万行代码远超任何模型的上下文窗口,必须分批处理还要保证一致性。
这些痛点,在过去的 Claude 模型里都是导致"AI 帮忙写代码可以,但搞迁移就翻车"的核心原因。Fable 5 在这次 Stripe 案例里的表现,意味着它在长程一致性这件事上发生了质变。
3.3 长程任务能力为什么变强了
要在 5000 万行代码上跑出来,模型需要具备这几种能力的组合:
能力 1:对代码库做高质量的全局检索与理解
↓
能力 2:把大任务拆成数千个互相关联的子任务
↓
能力 3:在每个子任务上调用工具(读文件、改文件、跑测试)
↓
能力 4:遇到失败能够自我诊断、回滚、重试
↓
能力 5:在数千步操作里保持目标不漂移
第 5 项尤其关键。目标漂移是 AI 智能体在长程任务里最大的敌人——任务跑到一半,模型把最初的目标忘了,开始干别的事。Fable 5 这次能在 Stripe 这种规模的真实代码库里跑下来,说明它的长程目标对齐做得相当扎实。
Anthropic 的官方描述里也提到了一个细节:在 Slay the Spire(《杀戮尖塔》)这种长程决策游戏上,给 Fable 5 配上"基于文件的记忆"之后,它的表现提升幅度是 Opus 4.8 的 3 倍。这说明 Fable 5 对外部记忆的利用效率本身就发生了大改进。
3.4 Cursor、GitHub、Hex 等合作伙伴的反馈
光看一个 Stripe 还不够全面。这次 Anthropic 公开了多家早期合作伙伴的反馈,可以帮我们从不同角度交叉验证:
- Cursor(AI 编程 IDE):Fable 5 打开了"以前模型够不到的整整一类长时程问题"。
- GitHub:在复杂、长时程的编码任务上展现出"超过过去基准的自主性和可靠性"。
- Hex(数据分析):在他们核心评测上第一次有模型突破 90%,比 Opus 4.8 高出 10 分。
- IMC(量化交易公司):Fable 5 在他们的交易分析评测里"几乎全面通过"。
- 某物理学合作伙伴:同样的科研任务,Fable 5 用 36 小时完成的工作,GPT-5.5 需要 4 天,而且 Fable 5 只用了三分之一的推理 token。
这些反馈虽然形容词不同,但指向的方向一致:Fable 5 在长程任务、复杂分析、智能体自治这几个维度上的能力同时拔高了。
3.5 普通开发者能学到什么
讲了一堆大厂案例,可能你会说:"我又不是 Stripe,这跟我有什么关系?"
其实关系很大。莫潇羽这边自己测试 Fable 5 写代码,有几个非常实在的体会:
- 大重构敢交给它干了:以前面对"把整个项目里所有 fetch 改成 axios 拦截器"这种活,我宁愿手动改 + 全局搜索;现在我会先让 Fable 5 跑一遍,人来 review。
- 大模块开发可以一口气出来:之前需要分阶段提示的功能,现在很多时候一次说清楚需求,它能直接拿出一个能跑、能测试的完整模块。
- 它会主动跑测试、跑 lint、回滚错误:这点是新增能力,以前需要手动让它跑,现在它会自己判断要不要跑。
- 超长上下文的体感是不掉链子:在十几个文件来回切换的复杂任务里,主线目标基本不漂。
对个人开发者来说,Fable 5 真正的价值不在"刷分炫技",而在把"过去要花一天才能干完的活,压缩到几十分钟一次成型"。这种效率密度变化,会逐渐改变我们写代码的工作流。
四、基准测试成绩单:把数字摊开看,Fable 5 到底领先多少
4.1 SWE-Bench Pro:智能体编码的硬指标
先聊业内最看重的 SWE-Bench Pro。这个评测用的是真实开源仓库的 issue,模型要扮演工程师写出 PR、解决问题。下面是 Anthropic 公布的对比数据:
|
模型 |
SWE-Bench Pro 得分 |
|
Claude Mythos 5 / Fable 5 |
80.3% |
|
Claude Mythos Preview |
77.8% |
|
Claude Opus 4.8 |
69.2% |
|
GPT-5.5 |
58.6% |
|
Gemini 3.1 Pro |
54.2% |
几个值得注意的点:
- Fable 5 跟 Mythos 5 的得分一样,因为底层模型一样。
- Fable 5 比上一代 Opus 4.8 高了 11.1 分,这种台阶在过去半年的版本迭代里非常少见。
- 跟竞品 GPT-5.5 之间拉开了 21.7 分,跟 Gemini 3.1 Pro 拉开了 26.1 分。
- Mythos Preview 已经很强,Fable 5 / Mythos 5 又在它的基础上再涨了 2.5 分。
简单一句话总结:在智能体编码这条赛道上,Fable 5 目前没有真正的对手。
4.2 FrontierCode:更难一档的前沿编程评测
如果说 SWE-Bench Pro 是"业界普遍接受的硬考",那 FrontierCode 就是 Cognition(开发 Devin 那家)推出的"更难一级的奥赛"。在 FrontierCode Diamond 这个最难的子集上,Fable 5 / Mythos 5 拿到了 29.3%,在所有参评模型里得分最高。
更有意思的细节是 Anthropic 强调的:Fable 5 在中等推理预算下,也能在所有前沿模型里得到最高分。
这句话翻译过来就是:Fable 5 不需要疯狂地拉长推理时间就能拿到顶级表现。它的 token 效率比之前的 Claude 模型都要高。这件事对真实业务非常关键,因为推理 token 直接关联到使用成本。
4.3 Hebbia Finance Benchmark:复杂金融分析
Hebbia 推出的金融分析评测,考的是 AI 能不能像资深金融分析师一样推理。这次 Fable 5 在 Hebbia Finance Benchmark 上拿到了全部参评模型里的最高分。
具体提升来自两个方向:
- 基于文档的推理能力:能够把几十上百页的财报、招股书、研报"看进去",然后做交叉推理。
- 图表和表格的解读能力:从复杂图表里精确取数、做比较的能力大幅提升。
我自己用 Fable 5 试了下,把一份 80 多页的中文招股书直接喂给它,让它做"主要风险因素的去重整理",出来的结果几乎不需要二次校对,这是以前的 Claude 模型做不到的。
4.4 视觉理解:从能看图,到能"持续看屏幕"
视觉这一块这次提升非常大。Anthropic 把 Fable 5 称为"目前最先进的视觉任务模型",并不是夸张。具体来看:
- 从屏幕截图重建 Web 应用源码:给一张 UI 截图,直接逆向出可运行的源码。
- 从科研图表里精确取数:论文里的散点图、柱状图、折线图,可以提取出具体数值。
- 纯靠原始游戏截图通关《宝可梦:火红》:这一项后面单独讲。
4.5 用一张图直观看懂这次能力提升的分布
我画一张能力雷达示意图,帮你建立直观认知:
软件工程 ★★★★★
/
视觉 ★★★★★ 知识工作 ★★★★★
\ /
Fable 5 全维度
/ \
科研推理 ★★★★★ 长程自治 ★★★★★
\
金融分析 ★★★★★
(每一项里星越多,代表领先优势越大。)
这种"全维度同时拉升"的发布,放在整个大模型发展史里都算少见。过去的版本迭代,常常是"编程提升一点,推理提升一点,视觉持平"这种局部变化;Fable 5 是同时把六七个维度都拉了起来。
4.6 一个关于"基准分数"的冷静提醒
讲到这里我必须给大家泼一盆冷水。基准分数只能反映模型在特定测试集上的表现,不能直接等同于"用着爽不爽"。
实际使用 Fable 5 我也观察到几个值得关注的点:
- 思维链相对不那么"透明":有用户反馈,Fable 5 的中间思考过程,可读性不如 Sonnet 或 Opus 那么直观。
- 在长链路自主任务里偶有"幻觉":虽然降幅明显,但极端 case 下仍然存在。
- 安全切换的体感"有点突兀":命中敏感分类的时候,从 Fable 5 切到 Opus 4.8,有些用户会感觉到回答风格、深度的变化。
但综合下来,这些"瑕疵"远不能掩盖它在能力上的整体跨越。你可以理解为:Fable 5 是一个能力极强但还在快速进化中的产品形态,值得现在就用起来,但要做好"用着用着发现边界"的预期。
五、纯靠"看屏幕"通关《宝可梦:火红》:视觉能力的拐点
5.1 这件事为什么是行业拐点
让模型玩《宝可梦》听起来像个段子,但它其实是评测 AI 视觉与长程决策能力的一个经典基准。Anthropic 之前的 Claude 玩这游戏时,需要一整套额外的"脚手架"——包括内存地址解析、地图状态注入、当前位置坐标等等,本质上是把"看图"这件事简化成了"读结构化数据"。
到了 Fable 5,所有这些辅助都被拆掉了,模型只能拿到原始游戏截图,自己看、自己判断、自己操作。结果它通关了。
这件事的意义是什么?它意味着模型已经具备了从原始视觉信号端到端做长程决策的能力。在过去,这条路被认为是大模型最难突破的方向之一。
5.2 从"识图"到"持续看屏幕做决策"的能力跃迁
我画一张能力对照表,直观感受一下变化:
|
能力维度 |
早期 Claude |
Fable 5 |
|
看懂一张图说了什么 |
✅ |
✅✅✅ |
|
多张图的对比理解 |
部分 |
✅✅✅ |
|
持续看屏幕做决策(分钟级) |
需要脚手架 |
✅ |
|
长时段视觉决策(小时级) |
❌ |
✅ |
|
跨"关卡"维持目标 |
❌ |
✅ |
最重要的是最后两行。"持续看屏幕做决策"和"跨场景维持目标",意味着 Fable 5 已经具备了完整的视觉 Agent 基本盘。
5.3 视觉能力对真实业务意味着什么
把游戏当例子是为了让大家直观感受,但真正能产生商业价值的是这些场景:
- 从设计稿直接生成代码:你给一张 Figma 截图,模型直接出一套可运行的前端代码。
- 从财报里的图表精确提取数值:不再依赖结构化数据,直接从扫描版 PDF 里的图表里取数。
- 科研图谱解读:把一篇论文里的所有图表喂给它,做交叉对比和深度解读。
- GUI 自动化操作:让 AI 真正"操作浏览器""操作软件",而不是依赖结构化 API。
- 工业质检 / 监控分析:从连续视频帧里识别异常事件,做出判断。
这五个场景里,前四个其实早就有人在做,只是效果一直没到生产级。Fable 5 在视觉能力上的跃迁,有机会把这几个赛道一起推向真实落地。
5.4 一个我自己跑过的小实验
莫潇羽@源码七号站这边,我专门拿一个旧项目截图测试了 Fable 5 的"屏幕逆向"能力。
实验设置:
输入:三张某 SaaS 产品后台的 UI 截图(中文界面,自带表格 + 弹窗 + 侧边栏)
要求:让 Fable 5 直接给出可运行的 React + Tailwind 实现
约束:不告诉它具体的组件库,不给任何额外提示词
实测下来,Fable 5 给出的版本:
- 结构 95% 还原,包括侧边栏折叠、表头排序、分页器等细节。
- 表格交互逻辑(选中行高亮、批量操作按钮显示/隐藏)主动加了进来。
- 代码一次能跑,只需要修两个 import 路径。
- 整个过程消耗 token:大约 1.8 万个输出 token,折算下来不到 1 美元。
要知道,这种工作量按以前的流程,起码要花前端工程师小半天才能完成,而且经常会漏掉一些交互细节。这就是"视觉理解 + 长程编码"的复合能力带来的真实变化。
5.5 别盲目相信视觉能力,有几个边界要注意
夸完之后还是要冷静。Fable 5 的视觉能力虽然很强,但有几个边界我自己也踩过坑:
- 手写中文识别仍然不稳定,潦草字体下错率不低。
- 极小字号 + 低分辨率的图,容易看错关键数字。
- 极端复杂的工程图纸(机械图、电路图),还达不到工程师级别的精度。
- 视频里跨帧追踪(多个移动物体的持续跟踪)依然是弱项。
所以视觉能力的飞跃是真的,但还没到"什么都能扔给它"的程度。让 Fable 5 在视觉任务里发挥最大价值,关键还是把输入处理干净。
5.6 把视觉能力嵌入到工作流的几个思路
讲完边界,再聊聊怎么把这股能力真正用在自己的工作里。我自己最近在折腾的几个方向,供你参考:
- 设计稿评审自动化:把 Figma 导出的多张设计稿喂给 Fable 5,让它检查"视觉一致性"——按钮风格统一吗?字号体系规范吗?间距系统对齐吗?这种任务过去靠人盯,效率非常低。
- 截图比对回归测试:在 UI 自动化测试里,过去靠像素级 diff,误报很多;现在让 Fable 5 直接看两张截图,描述差异,准确度和可解释性都高得多。
- 数据可视化的智能解读:把图表丢给它,让它生成结论摘要 + 异常点提示,给数据分析师做"二审"非常有效。
- 多图文档智能归档:扫描版合同、表单、报销凭证,让它从图像里直接提取结构化字段。
- 跨模态报告生成:输入是数据 + 截图 + 文字描述,输出是一份带图文混排的完整报告。
这五个方向都不是"实验室玩具",而是已经能在企业里落地的具体场景。关键是要把"AI 能看图"这件事,从"演示能力"变成"工作流环节"。
六、生命科学:Mythos 5 把蛋白质设计提速 10 倍,基因组学一周自动跑完
6.1 这部分是 Mythos 5 的独家戏
这一章要先说清楚一件事:真正在生命科学领域跑出惊人成绩的,主要是 Mythos 5,不是 Fable 5。原因很简单——Fable 5 对生物、化学话题会触发安全分类器,默认走 Opus 4.8 兜底,因此在这些领域无法发挥完整能力。
Mythos 5 在 Glasswing 计划之外,这次还专门拓展了一个"生命科学受信任合作伙伴"小圈子,让 Anthropic 内部的蛋白质设计专家、以及若干生物科技公司开始使用完整能力版本。
我把官方公布的成果按"工程提速、独立科研、未来潜力"三块梳理一下。
6.2 工程提速:蛋白质设计 10 倍效率
Anthropic 内部的蛋白质设计团队使用 Mythos 5 之后,药物设计流程里的部分环节效率提升了约 10 倍。这个数字看起来吓人,但拆开看更有意思:
- 评测一共选了 14 个蛋白靶点,覆盖免疫检查点、生长因子与受体信号、神经退行性疾病、肌肉疾病等。
- 9 个靶点拿到了"足以推进到药物设计阶段"的强候选。
- Mythos 5 在没有人类协助的情况下,自己完成了选择结合位点、选择并运行蛋白设计工具、错误恢复等全流程操作。
- 在盲测对比里,Anthropic 的科学家在分子生物学假设这件事上,大约 80% 的时间会更喜欢 Mythos 5 给出的版本,而不是 Opus 类模型给的版本。
更关键的是,Mythos 5 提出的一个新的"E. coli 蛋白机制假设",被一个独立实验室在同期研究中通过实验佐证了。这条消息一旦被同行评议确认,意味着大模型第一次在生物学研究里给出了被实验验证的全新机制假设——是个标志性事件。
6.3 独立科研:一周多自主完成的基因组学研究
更让我震撼的是基因组学方向上的进展。Anthropic 描述了这么一个故事:
- Mythos 5 在只接受高阶人类输入的前提下,一周多的时间里基本自主完成了一项原创性基因组学研究。
- 模型自己整理了横跨 138 个动物物种 的单细胞数据,涉及数百万个细胞。
- 它自己设计并训练了一个定制的机器学习模型,用于识别在远缘物种之间承担相同角色的细胞类型。
- 训练出来的模型在性能上超越了一篇近期发表在 Science 上的同类模型,而它的体积只有那个模型的百分之一。
把这件事翻译成人话:Mythos 5 在没有详细指导的前提下,自己定义了一个科研问题、自己跑通了完整的科研流程、自己拿出了比已发表论文更好的结果。
这个范式跟"我让 AI 帮我写一段代码"已经完全不在一个维度上。AI 进入"独立做科研"这件事过去更多是科幻话题,现在第一次有了产业层面的具体案例。
6.4 用一张流程图看 Mythos 5 跑科研的样子
我用一张 mermaid 图表示一下大致的工作流:
flowchart LR
A[高阶研究目标<br>人类输入] --> B[Mythos 5<br>自己定义子问题]
B --> C[设计数据采集方案]
C --> D[整理 138 物种<br>百万级单细胞数据]
D --> E[设计模型架构]
E --> F[训练 & 调参]
F --> G[与已发表 Science<br>模型对比]
G --> H[结论<br>体积仅 1%,性能更强]
整个流程里,人类只在最开始的目标设定和最终的结果审阅环节出现,中间所有环节由