Anthropic 昨天(6 月 9 日)发布了 Claude Fable 5,同时发布的还有面向安全机构的 Mythos 5。这不是一次普通的模型升级——他们把 Mythos 级别的能力装上了安全限制,向所有开发者开放了。
Fable 5 是目前 Anthropic 公开可用的最强模型。几乎所有基准测试 SOTA——软件工程、知识工作、视觉、科研,四个维度全面领先。和之前 Claude 模型比,任务越长越复杂,优势越大。定价 $10/百万输入 token,$50/百万输出 token,不到 Mythos Preview 的一半。
Mythos 5 和 Fable 5 同一个底层模型,但在某些领域解除了安全限制,通过 Project Glasswing 提供给网络安全防御团队。Anthropic 说 Mythos 5 拥有"全球最强的网络安全能力"。
这篇文章从开发者角度聊聊:Fable 5 到底强在哪,安全限制意味着什么,以及怎么把 Claude Code 用好。
软件工程:从月到天
最让人兴奋的数据来自 Stripe。早期测试中,Fable 5 对一个 5000 万行 Ruby 代码库做了一次跨仓库迁移——一天完成,按人工估算需要整个团队两个多月。
这不是 demo 级别的小项目——是真实生产代码库上的重构。
Cursor CEO Michael Truell:"Fable 5 是 CursorBench 上的 SOTA 模型。它打开了一整类此前模型无法企及的长周期问题。"
GitHub CPO Mario Rodriguez 说得更远:"它指向了一个开发者可以把越来越宏大的工作交给 Agent,并信任整个软件生命周期产出的未来。"
Cognition(Devin 的开发者)Scott Wu 给了 FrontierCode 最高分——"擅长长周期推理,开箱即用泛化到不熟悉的工具。"
Replit CTO Fabian Hedin:"一年前需要一百个 prompt 的应用,现在它一次完成。"
几个具体信号:
第一,Fable 5 不是靠堆算力拿分的。在 Cognition FrontierCode 中等算力预算下就拿了最高分,比之前的模型更 token-efficient。这意味着不仅更强,还更便宜地强。
第二,长周期自主执行是真正的跨越。Bolt CEO:"最高算力下 Fable 5 会反思和验证自己的工作——这是让高度自主操作成为可能的关键。"Canva CTO:"在更少的轮次内完成更强的工程能力,处理复杂多 Agent 工作流。"
第三,它能理解意图而不只是指令。"理解构建者的意图,而不是他们打出的字"——这点我在实测中体会最深。以前的模型你需要精确描述每一步,Fable 5 更像一个能理解大方向的高级工程师。
Hebbia 的测试也印证了这一点:Fable 5 是第一个在他们的核心分析基准上突破 90% 的模型,比 Opus 高了 10 个点。"在最困难的问题上,它表现出强大的判断力和对细微差别的关注。"
IMC 的反馈:"Fable 5 几乎全面通过了我们的交易分析评估——事实查询、概念推理、根因分析、期望值分析。全是高分。"
在知识工作领域,Fable 5 在 Hebbia 金融基准测试中得分最高,文档推理、图表解读、问题解决全面大幅领先。
另一个有意思的数据来自法律领域。Anthropic 的客户反馈,在盲审中 Fable 5 的法律文档修订质量匹配甚至超过了他们当前使用的模型。这不只是编程——任何需要深度阅读、理解和修改复杂文档的工作,Fable 5 都在逼近甚至超越人类专家的水平。
在实际使用中,Fable 5 的 token 效率是最容易被忽略的优势。Cognition 的评测里,中等算力预算下就超越了全算力的其他模型。这意味着你在 Claude Code 里跑一个长任务,不仅结果更好,消耗的 API 额度也更少——单次任务成本可能比 Opus 4.8 还低。
安全枷锁:5% 的代价
Fable 5 最特别的地方不是能力,而是发布方式:把 Mythos 级模型关进安全笼子再放出来。
Anthropic 给它套上了安全限制:某些查询会被重定向到次强模型 Opus 4.8 回答。官方说触发率约 5%,坦承"为了快速安全地发布,保守地调整了限制——有时会误拦无害请求"。
这就是 HN 上那篇《If Claude Fable stops helping you, you'll never know》吐槽的点:你永远分不清它是真帮不了还是被拦住了。
我理解这个设计。Mythos 级别的模型在网络安全等领域有真实风险。站在开发者角度,当你让 Fable 5 处理一个复杂任务,中途突然收到 Opus 4.8 级别的回复,体验确实割裂。
不过实际用下来,这个 5% 在我这是偏低的。下午大约 20 个会话,没有一次触发。可能我的任务类型不在审查范围。对大多数日常开发任务,你大概率感觉不到限制的存在。
如果你需要完整能力——比如做安全研究——Mythos 5 通过 Project Glasswing 可用,目前只对部分机构开放,后续会扩展可信访问计划。
三个跨越:视觉、记忆、科学推理
视觉理解。Fable 5 不需要辅助工具,纯靠原始游戏截图玩通了 Pokémon FireRed。之前的 Claude 模型需要一个复杂的 harness 提供地图、导航、游戏状态信息才能玩。这背后是真实的视觉推理能力:从复杂科学图表提取精确数据,仅凭截图重建 web app 源代码。对于需要做 UI 逆向、设计稿转代码、无障碍测试的开发者来说,这个能力会直接改变工作流。Anthropic 还展示了一个更夸张的例子:Fable 5 从零搭建了一个完整的太阳系模拟器——从物理学第一性原理推导行星轨道运动,用代码实现并用它预测日食。全程没有参考代码,只有物理公式和视觉推理。
长期记忆。在数百万 token 上下文中保持专注,且利用自己写的笔记改进输出。玩《Slay the Spire》时给它持久化文件内存,性能提升是 Opus 4.8 的三倍,通关最终幕的概率也是三倍。在编程场景下这意味着它能记住整个项目上下文,不会在长任务中途失忆。对于维护大型代码库的开发者来说,这意味着你可以把一个跨多个文件的特性开发交给它,不用担心它在第 50 个文件时忘了第 1 个文件的设计意图。Fable 5 还在 Factorio(即时策略工厂建造游戏)中自主建造了一个自动化工厂,展示了在复杂、持续决策环境中的规划能力。
科学推理。这个离多数开发者较远,但值得提:Mythos 5 产生了首个持续输出新颖科学假设的能力。双盲对比中科学家 80% 的时间更偏好 Mythos 的分子生物学假设。它自主组装了 138 个物种的数百万单细胞数据,训练的自定义 ML 模型比《Science》近期论文更好,参数少 100 倍。其中一个假设已被独立实验室证实。在药物设计方面,Mythos 5 将某些流程加速约 10 倍,14 个蛋白靶点中有 9 个产出了强候选药物,正在跟进研究。
Claude Code 怎么用才不浪费
模型越来越强,但 Claude Code 的体验取决于你怎么配置它。
AGENTS.md 比以往任何时候都重要。Fable 5 能处理更长周期任务,但它需要你的项目上下文。一份好的 AGENTS.md 应该告诉模型三件事:
代码规范——命名惯例、格式化规则、lint 配置。
项目结构——目录布局、模块职责、依赖关系。
测试策略——框架选择、覆盖率要求、运行方式。
举个例子。我的一个 TypeScript 项目里,AGENTS.md 约 40 行,包含了 ESLint 规则清单、Vitest 测试命令、monorepo 的 workspaces 边界、以及"函数超过 50 行必须拆"这类团队约定。Fable 5 用这些上下文后,产出的代码在第一次审查时就接近可合并状态,不再需要来回纠正格式和结构问题。
MCP server 是必要的补充。模型再强也不能直接访问数据库、文件系统、CI/CD。至少配置这几个核心 MCP:
文件系统操作——读项目文件、写输出到正确位置。
Git 操作——查看 diff、创建分支、提交代码。
终端执行——运行测试套件、构建命令、lint 检查。
技术栈特定工具——数据库 schema 查询、API 文档检索、包管理器操作。
社区有句话说得对——"别再裸用 Claude Code 了"。没有 AGENTS.md 和 MCP 的 Claude Code,就像一个天才工程师被关在没有网络的房间,只能靠 prompt 描述猜测你的项目长什么样。
一个具体的 Loop Engineering 工作流:我把 Claude Code 配置成"先读 AGENTS.md → 读相关代码 → 提方案 → 等我确认 → 执行 → 跑测试 → 自查结果"的循环。每一步都写入持久化笔记,这样即使任务被打断或者安全限制触发、模型切回 Opus 4.8,上下文也不会丢。Fable 5 在利用笔记方面比 Opus 强三倍——这不是理论数字,是实测出来的差距。
任务拆分仍然需要人来做。Fable 5 擅长执行清晰目标的深度任务。把一个模糊需求拆成几个独立可验证的子任务,这个能力比模型本身更重要。我的习惯:需求出来后花 10 分钟拆成 3-5 个 checkpoints,每个有明确成功标准,然后逐个交给模型。
竞争格局:谁在追赶
这次发布让 Claude 在几个关键维度稳住了领先。FrontierCode 评测中 Fable 5 在中等算力下就超越了其他前沿模型。在 Hebbia 金融基准上也是独一档的表现。Cognition 的 Scott Wu 说得很直接:"最高分。"
GPT-5.5 在某些任务上仍需要更长的推理时间才能达到类似水平——有客户反馈 Fable 5 用三分之一的推理 token 就接近了 GPT-5.5 四天的产出。物理学前沿研究场景下的对比尤其明显。
但竞争远没结束。OpenAI 申请 IPO 的消息今天也在发酵,Anthropic IPO 前的"秀肌肉"意图明显。两家都在抢开发者生态——Cursor、GitHub、Replit、Bolt 的测试反馈全被放进了 Anthropic 官方公告,这不是偶然。
对开发者来说,竞争是好事。模型更强、更便宜、生态更丰富。比较好的策略是不押注单一平台——Fable 5 很强,但 GPT-5.5 的多模态和工具调用有各自优势。在 Claude Code 和 Codex 之间按任务类型切换,可能是未来一段时间的合理状态。另外 DeepSeek V4 和 GLM-5.1 本周也有新动作——有开发者分享了用 DeepSeek V4 + draw.io 替代 GPT-Image2 做架构图的实践,效果出乎意料的好。模型层的竞争在加速,受益的是我们这些每天在终端里写代码的人。
我的看法
这次发布有几个明确信号。
Agent 编程从辅助走向部分替代。Stripe 一个月变一天的案例不是 demo,是生产系统。当模型能把跨仓库迁移压缩到这种程度,该思考的不是"AI 能不能写代码",而是"代码审查、架构决策、系统设计里,人的不可替代性在哪"。模型越来越擅长执行,人的判断力、产品 sense、对用户需求的理解反而更稀缺。这不是危言耸听——Cursor、Bolt、Replit 的反馈都指向同一个方向:模型在接管越来越多的具体执行,而人的角色在向更高层次的决策和判断迁移。
安全限制会成为常态而非例外。Fable 5 的 5% 误拦是开始。未来更强模型都会有类似甚至更严格的机制。对开发者来说,需要学会在限制下工作——就像已经习惯了 API rate limit、token 窗口、上下文长度这些约束。把它当成系统特性,不是缺陷。
MCP 和 AGENTS.md 会从"可选"变成"必备"。模型能力越强,地基工作越关键——模型能做的事情更多,一步走偏的代价也更大。花一小时写好 AGENTS.md 和配置好 MCP,收益能覆盖后面一百个小时的开发。
Fable 5 不是终点,也不是第一个"改变一切"的模型——这几年我们已经听过太多次了。但它确实把一些之前只在论文和闭门演示里存在的能力,放到了你我的终端里。
如果你还没试过,值得花一个下午跑自己的真实任务。不是 benchmark,不是你见过一百次的 Todo App,就是你日常的工作——修那个拖了三天的 bug,重构那个不敢动的模块,写那篇一直没时间整理的架构文档。你可能会像我一样,在某个瞬间被它的判断力惊到,然后开始认真思考自己的技能栈下一步该往哪走。
这不是营销话术。这是今天下午真实发生的事。
浙公网安备 33010602011771号