Claude Fable 5.1 全面解析:基準測試、改進、價格與速度
Claude Fable 5.1 於 7 類主流基準上的完整成績,與 Fable 5、Opus 5、GPT-5.6 Sol 逐項比較,並說明 5.1 的長任務、工具調用、緩存費用、速度、套餐限制及遷移變化。

Claude Fable 5.1 已於 2026 年 9 月 1 日正式發佈。先說結論:它不是面向普通問答的常規模型升級,而是為長時間編程、複雜研究、跨應用工具調用和無人值守 Agent準備的高成本旗艦模型。在 Anthropic 公佈的 7 類主流基準中,Fable 5.1 全部超過 Fable 5;但它的 API 單價仍是 Opus 5 的兩倍,官方也把相對延遲標為「較慢」。
如果你的任務只是改一個檔案、寫一段短文或回答普通問題,Anthropic 仍建議從 Opus 5 開始。Fable 5.1 更適合普通模型在高 effort 下仍無法穩定完成的長鏈路任務。本文把官方發佈數據、各基準的含義、5.1 的具體改進、價格、速度和遷移限制放在一起,避免只看一張「誰贏了」的跑分圖。
一張表看懂 Fable 5.1 的規格
| 項目 | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| 上下文窗口 | 1M token | 1M token | 1M token |
| 最大輸出 | 128K token | 128K token | 128K token |
| 輸入價格 | $10 / MTok | $5 / MTok | $2 / MTok |
| 輸出價格 | $50 / MTok | $25 / MTok | $10 / MTok |
| 相對延遲 | 較慢 | 中等 | 快 |
| Thinking | Adaptive,始終開啟 | Adaptive | Adaptive |
| 預設 effort | High | High | High |
| 可靠知識截止 | 2026 年 6 月 | 2026 年 5 月 | 2026 年 1 月 |
這裡的「較慢」來自 Anthropic 模型目錄,表示相對延遲等級,不是固定的每秒 token 數。實際完成一個任務要多久,還取決於 effort、工具調用輪數、緩存命中率、上下文長度和失敗重試次數。
Fable 5.1 主流基準測試完整表格
下表直接採用 Anthropic 2026 年 9 月 1 日發佈頁中的主表。為了避免誤讀,百分比、GDPval-AA 原始分數、OSWorld 的 partial/strict,以及 HLE 的有工具/無工具結果都分開列出。每個基準保留英文正式名稱,並在下一行給出中文名稱;其他語言版本也會在英文名下面顯示對應語言譯名。
| 能力 | 基準 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 相比 Fable 5 |
|---|---|---|---|---|---|---|
| 智能體科學研究 | Terminal-Bench-Science 0.1 智能體科學研究終端基準 |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 個百分點 |
| 智能體終端編程 | Terminal-Bench 4.0 智能體終端編程基準 |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 個百分點 |
| 專業知識工作 | GDPval-AA v2 真實經濟價值專業任務基準 |
1853 | 1723 | 1824 | 1711 | +130 分 |
| 電腦操作 | OSWorld 2.0 — Partial 真實電腦操作基準:部分完成分 |
77.9% | 72.9% | 75.4% | — | +5.0 個百分點 |
| 電腦操作 | OSWorld 2.0 — Strict 真實電腦操作基準:嚴格完成率 |
41.7% | 36.1% | 39.6% | — | +5.6 個百分點 |
| 多學科推理 | Humanity's Last Exam — No tools 人類最後的考試:不使用工具 |
60.9% | 57.8% | 56.6% | — | +3.1 個百分點 |
| 多學科推理 | Humanity's Last Exam — With tools 人類最後的考試:使用工具 |
65.0% | 63.8% | 63.6% | — | +1.2 個百分點 |
| 商業工作流 | AutomationBench 跨應用商業自動化工作流基準 |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 個百分點 |
| 智能體編程 | CursorBench 3.2.0 真實多檔案編程任務基準 |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 個百分點 |
— 表示 Anthropic 的這張主表沒有提供對應成績,不代表該模型無法完成任務。Terminal-Bench 4.0 中,限制更少、僅向可信計劃開放的 Mythos 5.1 得分為 60.9%;本文聚焦普通用戶可用的 Fable 5.1,不把 Mythos 的成績混入 Fable 列。
Terminal-Bench-Science 0.1 測甚麼
Terminal-Bench-Science 0.1 包含生命科學、物理科學、地球科學、數學和工程學五大領域的 70 個真實研究工作流。任務不是選擇題,而是要求 Agent 在終端裏完成數據分析、統計推斷、模擬、優化、定理證明、圖像重建或科學機器學習,並用可重現測試檢查產物。
Fable 5.1 的 52.6% 對比官方重現實驗中的 Fable 5 24.7%,提高 27.9 個百分點,是整張表裏最明顯的躍升。但官方同時標註每個模型約 ±3.5–4.5 個百分點的標準誤差,不能把小數點後一位當成絕對精確排名。
Terminal-Bench 4.0 與 CursorBench 3.2.0 測甚麼
Terminal-Bench 讓 Agent 在真實終端環境處理複雜任務,重點看它能否理解環境、調用工具、修改檔案並最終通過驗證。Fable 5.1 得到 55.8%,比 Fable 5 高 13.8 個百分點,也超過 Opus 5 的 52.3%。
CursorBench 3.2 來自真實 Cursor 會話中的模糊、多檔案任務,3.2 版增加了指令遵循和高級工具使用問題。Fable 5.1 Max 得到 73.4%,領先幅度沒有 Terminal-Bench-Science 那麼誇張,但它平均每個任務使用 72,060 token、成本 $9.64;Fable 5 Max 是 103,525 token、$17.32。這裏更值得關注的是完成同類任務時的 token 和成本下降,而不是 2.9 個百分點本身。
GDPval-AA v2 測甚麼
GDPval-AA v2 使用 220 個由行業專業人士設計的任務,覆蓋 44 種職業和 9 個行業,用來評估模型處理真實、具有經濟價值的知識工作的能力。它的 1853 是綜合評分,不是 1853%。這項結果說明 Fable 5.1 在專業文件、分析和交付物上超過 Fable 5,也小幅超過 Opus 5。
OSWorld 2.0 為甚麼有兩個分數
OSWorld 2.0 包含 108 個長鏈路電腦操作工作流,每項任務的人類完成時間中位數約 1.6 小時。Partial 會根據多個檢查點給部分完成分;Strict 只有完整達到目標才算成功。
所以 Fable 5.1 的 77.9% partial 和 41.7% strict 並不矛盾:它經常能完成大部分步驟,但仍有一部分任務沒能端到端收尾。這也提醒我們,電腦 Agent 的「看起來一直在操作」不等於任務已經成功。
Humanity's Last Exam 測甚麼
Humanity's Last Exam 由 Center for AI Safety 與 Scale AI 創建,包含 2,500 道跨學科、專家級、難以靠簡單檢索回答的問題。Fable 5.1 在無工具條件下比 Fable 5 高 3.1 個百分點,允許工具後只高 1.2 個百分點。它確實更強,但不是所有基準都出現翻倍增長。
AutomationBench 測甚麼
AutomationBench 檢查 Agent 能否跨 CRM、郵箱、日曆、訊息和項目管理等模擬 SaaS 工具,完成銷售、營銷、運營、客服、財務和人事工作流。Fable 5.1 從 17.1% 提高到 31.4%,相對提升約 84%,說明 5.1 在多應用狀態管理和長步驟執行上有實質進步;但 31.4% 也說明這類無人值守業務自動化仍遠未解決。
Fable 5.1 相比 Fable 5 改進了甚麼
1. 長時間任務更不容易走捷徑
Anthropic 把 Fable 5.1 定位為長時間 Agent 模型:先規劃,再使用工具,失敗後恢復,驗證結果,並主動匯報進度。它更強調修復根因,而不是為了盡快讓單個測試變綠而做局部繞過。官方列出的目標場景包括跨程式碼庫功能、程式碼審查、性能優化、多日自主會話、研究、文件、表格和簡報。
2. 低 effort 也能接近前代高成本結果
Fable 5.1 新增按訊息調整 effort 的能力。官方成本曲線顯示,Low 或 Medium effort 在一些任務上可以達到或超過 Fable 5,同時降低 token 和費用。Claude Code 預設使用 High effort;Claude.ai 與 Cowork 預設 Medium,比較模型時必須先確認 effort,不能把不同檔位的結果直接放在一起。
3. 工具調用之間可以顯示可讀進度
API 新增 display: "updates" 測試能力,讓模型在工具調用之間給出面向用戶的進度更新。對於跑幾小時的任務,這比只看到工具卡不斷出現更容易判斷它正在做甚麼、是否偏離目標。
4. 寫作、視覺驗證和自測更完整
官方稱 5.1 會主動編寫測試驗證自己的修改,並利用視覺能力對照設計目標檢查輸出。合作方評價也集中在更簡潔的進度、更完整地回答多部分問題、跨多個服務追蹤調用鏈,以及長時間運行後仍能保持可讀性。這些是定性反饋,不應當冒充統一基準結論。
5. 安全攔截更精確,但沒有消失
Fable 5.1 的網絡安全防護誤報比 Fable 5 發佈時減少約 60%,基礎生物和醫學問題觸發降級的頻率降低約 85%。它現在可以用於發現軟件漏洞,但滲透測試、生成利用程式碼、二進制漏洞掃描等雙重用途任務仍可能被路由到 Opus。被路由後不會按 Fable 價格收費。
6. 新增內容來源標記
Fable 5.1 引入 content provenance。生成文本可能帶有統計水印,可通過 Anthropic 的內容檢查工具進行驗證。它不會在正文裏加可見標記,但對於內容平台、教育和企業審計來說,是需要提前了解的新行為。
Fable 5.1 費用怎麼計算
| 計費項 | Fable 5.1 價格 | 與 Fable 5 對比 |
|---|---|---|
| 輸入 | $10 / 100 萬 token | 相同 |
| 輸出 | $50 / 100 萬 token | 相同 |
| 5 分鐘緩存寫入 | $12.50 / 100 萬 token | 相同檔位 |
| 1 小時緩存寫入 | $20 / 100 萬 token | 相同檔位 |
| 緩存讀取 | $0.25 / 100 萬 token | 降低 75% |
| Batch API | 輸入、輸出價格的 50% | 按 Batch 規則 |
假設一次長任務累計讀取 1000 萬緩存 token、產生 20 萬新輸入 token 和 5 萬輸出 token,不考慮緩存寫入:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00同樣 1000 萬緩存讀取在 Fable 5 上約為 $10,單這一項就相差 $7.50。Anthropic 據此估算,典型按 token 計費任務的實際成本可降低約 25%,高度 Agent 化、頻繁複用長上下文的任務最多約降低 45%。這不是 API 標價整體降價,而是緩存命中越多,節省越明顯。
訂閱用戶不一定直接享受 API 緩存降價
Max 與 Team/Enterprise 的 premium seat 可以把每週額度的最多 50% 用於 Fable 模型;Pro 和標準席位則從一開始使用 usage credits。具體消耗顯示以帳號中的 Usage 頁面為準。緩存讀取降價主要是按 token 計費場景的變化,不能把 API 的 75% 緩存降價直接換算成「Max 套餐多用四倍」。
Fable 5.1 到底快不快
答案是:單輪響應偏慢,但複雜任務的總完成時間可能更短。
- Anthropic 的模型目錄把 Fable 5.1 標為
Slower,Opus 5 為Moderate,Sonnet 5 為Fast。 - Claude Code 預設 High effort,天然會比 Low 或 Medium 使用更多推理時間。
- Every 在自己的工作負載中稱 Fable 5.1 大約比 Opus 5 快兩倍、token 少一半;這是合作方的特定測試,不是通用速度保證。
- CursorBench 中,Fable 5.1 Max 平均 70 步、72,060 token;Fable 5 Max 同為 72 步但用了 103,525 token。5.1 的優勢更像「少走彎路、少消耗 token」,不一定表現為首字更快。
因此,聊天、短程式碼和頻繁互動優先選 Sonnet 5 或 Opus 5;跨程式碼庫除錯、長研究和需要自行驗證的無人值守任務,再考慮 Fable 5.1。
升級到 Fable 5.1 前必須處理的兼容變化
Claude Code 至少升級到 2.1.250
Anthropic 的套餐與可用性說明要求 Claude Code 2.1.250 或更高版本。看不到 Fable 5.1 時,先檢查:
claude --version然後按 Claude Code 官方升級方式更新,再重新啟動會話。Fable 5.1 的 API 模型 ID 是:
claude-fable-5-1Forced tool use 可能直接報錯
如果請求強制模型調用某個工具,Fable 5.1 可能返回錯誤。遷移前應檢查 tool_choice 和自建 Agent 的強制工具流程,不要假設 Fable 5 的行為完全兼容。
Thinking blocks 不能隨意跨模型複用
較早模型不能讀取 Fable 5.1 的 thinking blocks。切換模型時,應讓 SDK 按官方規則處理這些區塊,而不是原樣塞給另一個模型。
修改舊歷史可能導致 400
對 2026 年 8 月 31 日以後創建的新 API 帳號,thinking blocks 只在生成它們的原始對話前綴下有效。修改 system、tools 或較早訊息後再重放 thinking blocks,可能返回 400。官方建議保持歷史 append-only;需要壓縮時,用一條新摘要替換整段舊歷史,不要一邊修改舊輪次一邊保留原 thinking blocks。詳細做法見 Fable 5.1 提示與遷移指南。
甚麼時候應該選 Fable 5.1
適合:
- 跨多個儲存庫、服務或應用的長任務;
- 需要運行數小時並自行恢復失敗的 Agent;
- 科學研究、複雜數據分析和多階段專業交付物;
- 難以重現的系統問題、性能優化和根因排查;
- 需要大量複用長上下文,緩存讀取佔比高的 API 工作負載。
不適合:
- 簡單聊天、短文或單一檔案的小修改;
- 對首字延遲高度敏感的實時互動;
- 預算固定,卻沒有緩存複用的高輸出任務;
- 無法接受預設 30 天安全監控數據保留、且不符合企業例外條件的場景;
- 希望所有網絡安全或生命科學請求都不觸發降級的工作流。
長任務如何遠端查看
Fable 5.1 的價值往往出現在數小時甚至多日任務裏,但這不意味著人必須一直守在開發機前。先在本機 Claude Code 2.1.250+ 中確認 Fable 5.1 可用,再通過 PandaNpc Agent 從瀏覽器、桌面端或手機查看同一台開發機上的 Claude Code 會話、處理互動和繼續下達指令。
這裏改變的是控制入口,程式碼、工具和構建仍在你的開發機上運行。可以先閱讀 Claude Code 遠端訪問指南和手機連接 Claude Code 教學,確認遠端鏈路後再交給 Fable 5.1 跑長任務。
常見問題
Fable 5.1 比 Fable 5 強多少?
不同任務差異很大。Terminal-Bench-Science 提高 27.9 個百分點,AutomationBench 提高 14.3 個百分點;HLE 使用工具時只提高 1.2 個百分點。不能用單個最大增幅代表所有任務。
Fable 5.1 比 Opus 5 快嗎?
官方相對延遲表中 Fable 5.1 是「較慢」,Opus 5 是「中等」。部分合作方在完整任務上觀察到 Fable 5.1 更快,因為它使用更少 token、返工更少。這兩種結論衡量的不是同一件事。
Fable 5.1 比 GPT-5.6 Sol 更適合編程嗎?
Anthropic 發佈表中 Fable 5.1 在 Terminal-Bench-Science、Terminal-Bench、AutomationBench 和 CursorBench 上更高;但不同模型使用不同 Agent harness、effort、工具和價格,不能據此斷言所有真實儲存庫都由 Fable 獲勝。可以參考 GPT-5.6 Sol 1M 上下文配置教學,再用自己的代表性任務做 A/B 測試。
為甚麼 Fable 5.1 會突然切換成 Opus?
部分網絡安全和生命科學請求會被 safeguards 路由給 Opus。模型切換不一定是故障;Anthropic 表示這類被路由的請求不會按 Fable 價格收費。
Fable 5.1 有水印嗎?
有統計性的 content provenance 機制,但不會在文字表面添加可見標籤。它與圖片角落裏的可見水印不是一回事。
總結
Claude Fable 5.1 最明顯的進步集中在科學研究、終端任務和跨應用商業工作流:它更能持續執行、恢復失敗、驗證結果,也通過更便宜的緩存讀取降低了長任務成本。但它仍然價格高、單輪延遲偏慢,並帶來 thinking blocks、強制工具調用和歷史編輯方面的兼容變化。
選擇它的正確問題不是「它是不是跑分第一」,而是:你的任務是否足夠長、足夠複雜,失敗和返工的成本是否高到值得使用 Fable 5.1。如果答案是否定的,從 Opus 5 或 Sonnet 5 開始通常更合適。
相關指南

Codex 開啟 GPT-5.6 Sol 1M 上下文:3 行 `config.toml` 配置教學
GPT-5.6 Sol 官方支援 105 萬 token 上下文。只需在 Codex 的 config.toml 頂部加入 3 行配置,即可按 100 萬視窗運行,並在約 90 萬 token 時自動壓縮歷史。附永久配置、單次命令、驗證與成本提醒。
閱讀文章 →
Claude Code Remote Control 怎麼用?手機遠端控制、官方限制與替代方案(2026)
Claude Code Remote Control 怎麼開啟?本文提供 claude remote-control、claude --remote-control 和 /remote-control 三種官方用法,說明手機與瀏覽器連接、帳號要求、驗證方法和常見報錯,並比較自訂模型、Codex、多機器場景下的 PandaNpc 方案。
閱讀文章 →
手機連 Claude Code:iOS 上隨時查看會話與審批工具
本文面向開發者,分享用手機連 Claude Code 的最佳實踐。透過 PandaNpc iOS app 實時查看會話、審批工具調用並回應提問,借助 pandapaw 和 iOS Live Activity 實現高效遠程操控,提升編碼靈活性。
閱讀文章 →