Claude Fable 5.1 全面解析:基准测试、改进、价格与速度
Claude Fable 5.1 在 7 类主流基准上的完整成绩,与 Fable 5、Opus 5、GPT-5.6 Sol 逐项比较,并说明 5.1 的长任务、工具调用、缓存费用、速度、套餐限制和迁移变化。

Claude Fable 5.1 已于 2026 年 9 月 1 日正式发布。先说结论:它不是面向普通问答的常规模型升级,而是为长时间编程、复杂研究、跨应用工具调用和无人值守 Agent准备的高成本旗舰模型。在 Anthropic 公布的 7 类主流基准中,Fable 5.1 全部超过 Fable 5;但它的 API 单价仍是 Opus 5 的两倍,官方也把相对延迟标为“较慢”。
如果你的任务只是改一个文件、写一段短文或回答普通问题,Anthropic 仍建议从 Opus 5 开始。Fable 5.1 更适合普通模型在高 effort 下仍无法稳定完成的长链路任务。本文把官方发布数据、各基准的含义、5.1 的具体改进、价格、速度和迁移限制放在一起,避免只看一张“谁赢了”的跑分图。
一张表看懂 Fable 5.1 的规格
| 项目 | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| 上下文窗口 | 1M token | 1M token | 1M token |
| 最大输出 | 128K token | 128K token | 128K token |
| 输入价格 | $10 / MTok | $5 / MTok | $2 / MTok |
| 输出价格 | $50 / MTok | $25 / MTok | $10 / MTok |
| 相对延迟 | 较慢 | 中等 | 快 |
| Thinking | Adaptive,始终开启 | Adaptive | Adaptive |
| 默认 effort | High | High | High |
| 可靠知识截止 | 2026 年 6 月 | 2026 年 5 月 | 2026 年 1 月 |
这里的“较慢”来自 Anthropic 模型目录,表示相对延迟等级,不是固定的每秒 token 数。实际完成一个任务要多久,还取决于 effort、工具调用轮数、缓存命中率、上下文长度和失败重试次数。
Fable 5.1 主流基准测试完整表格
下表直接采用 Anthropic 2026 年 9 月 1 日发布页中的主表。为了避免误读,百分比、GDPval-AA 原始分数、OSWorld 的 partial/strict,以及 HLE 的有工具/无工具结果都分开列出。每个基准保留英文正式名称,并在下一行给出中文名称;其他语言版本也会在英文名下面显示对应语言译名。
| 能力 | 基准 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 相比 Fable 5 |
|---|---|---|---|---|---|---|
| 智能体科学研究 | Terminal-Bench-Science 0.1 智能体科学研究终端基准 |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 个百分点 |
| 智能体终端编程 | Terminal-Bench 4.0 智能体终端编程基准 |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 个百分点 |
| 专业知识工作 | GDPval-AA v2 真实经济价值专业任务基准 |
1853 | 1723 | 1824 | 1711 | +130 分 |
| 电脑操作 | OSWorld 2.0 — Partial 真实电脑操作基准:部分完成分 |
77.9% | 72.9% | 75.4% | — | +5.0 个百分点 |
| 电脑操作 | OSWorld 2.0 — Strict 真实电脑操作基准:严格完成率 |
41.7% | 36.1% | 39.6% | — | +5.6 个百分点 |
| 多学科推理 | Humanity's Last Exam — No tools 人类最后的考试:不使用工具 |
60.9% | 57.8% | 56.6% | — | +3.1 个百分点 |
| 多学科推理 | Humanity's Last Exam — With tools 人类最后的考试:使用工具 |
65.0% | 63.8% | 63.6% | — | +1.2 个百分点 |
| 商业工作流 | AutomationBench 跨应用商业自动化工作流基准 |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 个百分点 |
| 智能体编程 | CursorBench 3.2.0 真实多文件编程任务基准 |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 个百分点 |
— 表示 Anthropic 的这张主表没有提供对应成绩,不代表该模型无法完成任务。Terminal-Bench 4.0 中,限制更少、仅向可信计划开放的 Mythos 5.1 得分为 60.9%;本文聚焦普通用户可用的 Fable 5.1,不把 Mythos 的成绩混入 Fable 列。
Terminal-Bench-Science 0.1 测什么
Terminal-Bench-Science 0.1 包含生命科学、物理科学、地球科学、数学和工程学五大领域的 70 个真实研究工作流。任务不是选择题,而是要求 Agent 在终端里完成数据分析、统计推断、模拟、优化、定理证明、图像重建或科学机器学习,并用可复现测试检查产物。
Fable 5.1 的 52.6% 对比官方复现实验中的 Fable 5 24.7%,提高 27.9 个百分点,是整张表里最明显的跃升。但官方同时标注每个模型约 ±3.5–4.5 个百分点的标准误差,不能把小数点后一位当成绝对精确排名。
Terminal-Bench 4.0 与 CursorBench 3.2.0 测什么
Terminal-Bench 让 Agent 在真实终端环境处理复杂任务,重点看它能否理解环境、调用工具、修改文件并最终通过验证。Fable 5.1 得到 55.8%,比 Fable 5 高 13.8 个百分点,也超过 Opus 5 的 52.3%。
CursorBench 3.2 来自真实 Cursor 会话中的模糊、多文件任务,3.2 版增加了指令遵循和高级工具使用问题。Fable 5.1 Max 得到 73.4%,领先幅度没有 Terminal-Bench-Science 那么夸张,但它平均每个任务使用 72,060 token、成本 $9.64;Fable 5 Max 是 103,525 token、$17.32。这里更值得关注的是完成同类任务时的 token 和成本下降,而不是 2.9 个百分点本身。
GDPval-AA v2 测什么
GDPval-AA v2 使用 220 个由行业专业人士设计的任务,覆盖 44 种职业和 9 个行业,用来评估模型处理真实、具有经济价值的知识工作的能力。它的 1853 是综合评分,不是 1853%。这项结果说明 Fable 5.1 在专业文档、分析和交付物上超过 Fable 5,也小幅超过 Opus 5。
OSWorld 2.0 为什么有两个分数
OSWorld 2.0 包含 108 个长链路电脑操作工作流,每项任务的人类完成时间中位数约 1.6 小时。Partial 会根据多个检查点给部分完成分;Strict 只有完整达到目标才算成功。
所以 Fable 5.1 的 77.9% partial 和 41.7% strict 并不矛盾:它经常能完成大部分步骤,但仍有一部分任务没能端到端收尾。这也提醒我们,电脑 Agent 的“看起来一直在操作”不等于任务已经成功。
Humanity's Last Exam 测什么
Humanity's Last Exam 由 Center for AI Safety 与 Scale AI 创建,包含 2,500 道跨学科、专家级、难以靠简单检索回答的问题。Fable 5.1 在无工具条件下比 Fable 5 高 3.1 个百分点,允许工具后只高 1.2 个百分点。它确实更强,但不是所有基准都出现翻倍增长。
AutomationBench 测什么
AutomationBench 检查 Agent 能否跨 CRM、邮箱、日历、消息和项目管理等模拟 SaaS 工具,完成销售、营销、运营、客服、财务和人事工作流。Fable 5.1 从 17.1% 提高到 31.4%,相对提升约 84%,说明 5.1 在多应用状态管理和长步骤执行上有实质进步;但 31.4% 也说明这类无人值守业务自动化仍远未解决。
Fable 5.1 相比 Fable 5 改进了什么
1. 长时间任务更不容易走捷径
Anthropic 把 Fable 5.1 定位为长时间 Agent 模型:先规划,再使用工具,失败后恢复,验证结果,并主动汇报进度。它更强调修复根因,而不是为了尽快让单个测试变绿而做局部绕过。官方列出的目标场景包括跨代码库功能、代码审查、性能优化、多日自主会话、研究、文档、表格和幻灯片。
2. 低 effort 也能接近前代高成本结果
Fable 5.1 新增按消息调整 effort 的能力。官方成本曲线显示,Low 或 Medium effort 在一些任务上可以达到或超过 Fable 5,同时降低 token 和费用。Claude Code 默认使用 High effort;Claude.ai 与 Cowork 默认 Medium,比较模型时必须先确认 effort,不能把不同档位的结果直接放在一起。
3. 工具调用之间可以显示可读进度
API 新增 display: "updates" 测试能力,让模型在工具调用之间给出面向用户的进度更新。对于跑几小时的任务,这比只看到工具卡不断出现更容易判断它正在做什么、是否偏离目标。
4. 写作、视觉验证和自测更完整
官方称 5.1 会主动编写测试验证自己的修改,并利用视觉能力对照设计目标检查输出。合作方评价也集中在更简洁的进度、更完整地回答多部分问题、跨多个服务追踪调用链,以及长时间运行后仍能保持可读性。这些是定性反馈,不应当冒充统一基准结论。
5. 安全拦截更精确,但没有消失
Fable 5.1 的网络安全防护误报比 Fable 5 发布时减少约 60%,基础生物和医学问题触发降级的频率降低约 85%。它现在可以用于发现软件漏洞,但渗透测试、生成利用代码、二进制漏洞扫描等双重用途任务仍可能被路由到 Opus。被路由后不会按 Fable 价格收费。
6. 新增内容来源标记
Fable 5.1 引入 content provenance。生成文本可能带有统计水印,可通过 Anthropic 的内容检查工具进行验证。它不会在正文里加可见标记,但对于内容平台、教育和企业审计来说,是需要提前了解的新行为。
Fable 5.1 费用怎么计算
| 计费项 | Fable 5.1 价格 | 与 Fable 5 对比 |
|---|---|---|
| 输入 | $10 / 100 万 token | 相同 |
| 输出 | $50 / 100 万 token | 相同 |
| 5 分钟缓存写入 | $12.50 / 100 万 token | 相同档位 |
| 1 小时缓存写入 | $20 / 100 万 token | 相同档位 |
| 缓存读取 | $0.25 / 100 万 token | 降低 75% |
| Batch API | 输入、输出价格的 50% | 按 Batch 规则 |
假设一次长任务累计读取 1000 万缓存 token、产生 20 万新输入 token 和 5 万输出 token,不考虑缓存写入:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00同样 1000 万缓存读取在 Fable 5 上约为 $10,单这一项就相差 $7.50。Anthropic 据此估算,典型按 token 计费任务的实际成本可降低约 25%,高度 Agent 化、频繁复用长上下文的任务最多约降低 45%。这不是 API 标价整体降价,而是缓存命中越多,节省越明显。
订阅用户不一定直接享受 API 缓存降价
Max 与 Team/Enterprise 的 premium seat 可以把每周额度的最多 50% 用于 Fable 模型;Pro 和标准席位则从一开始使用 usage credits。具体消耗显示以账号中的 Usage 页面为准。缓存读取降价主要是按 token 计费场景的变化,不能把 API 的 75% 缓存降价直接换算成“Max 套餐多用四倍”。
Fable 5.1 到底快不快
答案是:单轮响应偏慢,但复杂任务的总完成时间可能更短。
- Anthropic 的模型目录把 Fable 5.1 标为
Slower,Opus 5 为Moderate,Sonnet 5 为Fast。 - Claude Code 默认 High effort,天然会比 Low 或 Medium 使用更多推理时间。
- Every 在自己的工作负载中称 Fable 5.1 大约比 Opus 5 快两倍、token 少一半;这是合作方的特定测试,不是通用速度保证。
- CursorBench 中,Fable 5.1 Max 平均 70 步、72,060 token;Fable 5 Max 同为 72 步但用了 103,525 token。5.1 的优势更像“少走弯路、少消耗 token”,不一定表现为首字更快。
因此,聊天、短代码和频繁交互优先选 Sonnet 5 或 Opus 5;跨代码库排错、长研究和需要自行验证的无人值守任务,再考虑 Fable 5.1。
升级到 Fable 5.1 前必须处理的兼容变化
Claude Code 至少升级到 2.1.250
Anthropic 的套餐与可用性说明要求 Claude Code 2.1.250 或更高版本。看不到 Fable 5.1 时,先检查:
claude --version然后按 Claude Code 官方升级方式更新,再重新启动会话。Fable 5.1 的 API 模型 ID 是:
claude-fable-5-1Forced tool use 可能直接报错
如果请求强制模型调用某个工具,Fable 5.1 可能返回错误。迁移前应检查 tool_choice 和自建 Agent 的强制工具流程,不要假设 Fable 5 的行为完全兼容。
Thinking blocks 不能随意跨模型复用
较早模型不能读取 Fable 5.1 的 thinking blocks。切换模型时,应让 SDK 按官方规则处理这些区块,而不是原样塞给另一个模型。
修改旧历史可能导致 400
对 2026 年 8 月 31 日以后创建的新 API 账号,thinking blocks 只在生成它们的原始对话前缀下有效。修改 system、tools 或较早消息后再重放 thinking blocks,可能返回 400。官方建议保持历史 append-only;需要压缩时,用一条新摘要替换整段旧历史,不要一边修改旧轮次一边保留原 thinking blocks。详细模式见 Fable 5.1 提示与迁移指南。
什么时候应该选 Fable 5.1
适合:
- 跨多个仓库、服务或应用的长任务;
- 需要运行数小时并自行恢复失败的 Agent;
- 科学研究、复杂数据分析和多阶段专业交付物;
- 难以复现的系统问题、性能优化和根因排查;
- 需要大量复用长上下文,缓存读取占比高的 API 工作负载。
不适合:
- 简单聊天、短文或单文件小修改;
- 对首字延迟高度敏感的实时交互;
- 预算固定,却没有缓存复用的高输出任务;
- 无法接受默认 30 天安全监控数据保留、且不符合企业例外条件的场景;
- 希望所有网络安全或生命科学请求都不触发降级的工作流。
长任务如何远程查看
Fable 5.1 的价值往往出现在数小时甚至多日任务里,但这不意味着人必须一直守在开发机前。先在本机 Claude Code 2.1.250+ 中确认 Fable 5.1 可用,再通过 PandaNpc Agent 从浏览器、桌面端或手机查看同一台开发机上的 Claude Code 会话、处理交互和继续下达指令。
这里改变的是控制入口,代码、工具和构建仍在你的开发机上运行。可以先阅读Claude Code 远程访问指南和手机连接 Claude Code 教程,确认远程链路后再交给 Fable 5.1 跑长任务。
常见问题
Fable 5.1 比 Fable 5 强多少?
不同任务差异很大。Terminal-Bench-Science 提高 27.9 个百分点,AutomationBench 提高 14.3 个百分点;HLE 使用工具时只提高 1.2 个百分点。不能用单个最大增幅代表所有任务。
Fable 5.1 比 Opus 5 快吗?
官方相对延迟表中 Fable 5.1 是“较慢”,Opus 5 是“中等”。部分合作方在完整任务上观察到 Fable 5.1 更快,因为它使用更少 token、返工更少。这两种结论衡量的不是同一件事。
Fable 5.1 比 GPT-5.6 Sol 更适合编程吗?
Anthropic 发布表中 Fable 5.1 在 Terminal-Bench-Science、Terminal-Bench、AutomationBench 和 CursorBench 上更高;但不同模型使用不同 Agent harness、effort、工具和价格,不能据此断言所有真实仓库都由 Fable 获胜。可以参考 GPT-5.6 Sol 1M 上下文配置教程,再用自己的代表性任务做 A/B 测试。
为什么 Fable 5.1 会突然切换成 Opus?
部分网络安全和生命科学请求会被 safeguards 路由给 Opus。模型切换不一定是故障;Anthropic 表示这类被路由的请求不会按 Fable 价格收费。
Fable 5.1 有水印吗?
有统计性的 content provenance 机制,但不会在文字表面添加可见标签。它与图片角落里的可见水印不是一回事。
总结
Claude Fable 5.1 最明显的进步集中在科学研究、终端任务和跨应用商业工作流:它更能持续执行、恢复失败、验证结果,也通过更便宜的缓存读取降低了长任务成本。但它仍然价格高、单轮延迟偏慢,并带来 thinking blocks、强制工具调用和历史编辑方面的兼容变化。
选择它的正确问题不是“它是不是跑分第一”,而是:你的任务是否足够长、足够复杂,失败和返工的成本是否高到值得使用 Fable 5.1。如果答案是否定的,从 Opus 5 或 Sonnet 5 开始通常更合适。
相关文章

Codex 开启 GPT-5.6 Sol 1M 上下文:3 行 config.toml 配置教程
GPT-5.6 Sol 官方支持 105 万 token 上下文。只需在 Codex 的 config.toml 顶部加入 3 行配置,即可按 100 万窗口运行,并在约 90 万 token 时自动压缩历史。附永久配置、单次命令、验证与成本提醒。
阅读全文 →
Claude Code Remote Control 怎么用?手机远程控制、官方限制与替代方案(2026)
Claude Code Remote Control 怎么开启?本文给出 claude remote-control、claude --remote-control 和 /remote-control 三种官方用法,说明手机与浏览器连接、账号要求、验证方法和常见报错,并比较自定义模型、Codex、多机器场景下的 PandaNpc 方案。
阅读全文 →
手机连 Claude Code:iOS 上随时查看会话与审批工具
本文面向开发者,分享用手机连 Claude Code 的最佳实践。通过 PandaNpc iOS app 实时查看会话、审批工具调用并回应提问,借助 pandapaw 和 iOS Live Activity 实现高效远程操控,提升编码灵活性。
阅读全文 →