Claude Fable 5.1 徹底解説:ベンチマーク、改善点、価格と速度

Claude Fable 5.1 の7つの主要ベンチマークにおける完全なスコアを、Fable 5、Opus 5、GPT-5.6 Sol と項目別に比較し、5.1 の長いタスク、ツール呼び出し、キャッシュ費用、速度、プラン制限、移行の変更についても説明する。

PandaNpc初公開日
Claude Fable 5.1 徹底解説:ベンチマーク、改善点、価格と速度

Claude Fable 5.1 は 2026 年 9 月 1 日に正式にリリースされました。先に結論を言うと、これは一般的な Q&A を想定した通常のモデルアップグレードではなく、長時間のプログラミング、複雑な研究、アプリ間のツール呼び出し、無人エージェントのために用意された高コストなフラッグシップモデルです。Anthropic が公開した 7 カテゴリの主要ベンチマークで、Fable 5.1 はすべて Fable 5 を上回っています。ただし、API 単価は依然として Opus 5 の 2 倍であり、公式も相対レイテンシを「遅い」としています。

タスクが単にファイルを 1 つ修正する、短い文章を書く、または一般的な質問に答えるだけなら、Anthropic は依然として Opus 5 から始めることを推奨しています。Fable 5.1 が適しているのは、通常のモデルでは高 effort でも安定して完了できない、長大なタスクです。本記事では、公式発表データ、各ベンチマークの意味、5.1 の具体的な改善点、価格、速度、移行時の制限をまとめて提示し、「どちらが勝ったか」だけのスコア比較グラフに惑わされないようにします。

1 つの表でわかる Fable 5.1 のスペック

項目 Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
コンテキストウィンドウ 1M token 1M token 1M token
最大出力 128K token 128K token 128K token
入力価格 $10 / MTok $5 / MTok $2 / MTok
出力価格 $50 / MTok $25 / MTok $10 / MTok
相対レイテンシ 遅い 中程度 速い
Thinking Adaptive(常時オン) Adaptive Adaptive
デフォルト effort High High High
信頼できる知識のカットオフ 2026年6月 2026年5月 2026年1月

ここでの「遅い」は Anthropic モデルカタログ に基づくもので、相対的なレイテンシの等級を示しており、固定された 1 秒あたりの token 数を示すものではありません。実際に 1 つのタスクを完了するまでの時間は、effort、ツール呼び出しのラウンド数、キャッシュヒット率、コンテキストの長さ、失敗時の再試行回数にも依存します。

計画から検証までの長時間エージェントワークフローにおける Fable 5.1
Fable 5.1 が対象とするのは一度きりの回答ではなく、計画・実行・復旧・検証・報告を継続的に行う長時間タスクです。

Fable 5.1 の主要ベンチマーク完全一覧

以下の表は、Anthropic が 2026 年 9 月 1 日に公開したリリースページのメインテーブルを直接採用したものです。誤読を避けるため、パーセンテージ、GDPval-AA の素点、OSWorld の partial/strict、HLE のツールあり・ツールなしの結果をそれぞれ分けて掲載しています。各ベンチマークは英語の正式名称を残し、その次の行に日本語名を記載しています。他の言語バージョンでも、英語名の下に対応する言語の訳名が表示されます。

能力 ベンチマーク Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol Fable 5 と比較した 5.1
エージェント科学研究 Terminal-Bench-Science 0.1
エージェント科学研究ターミナルベンチマーク
52.6% 24.7% 29.0% 22.4% +27.9 ポイント
エージェントターミナルプログラミング Terminal-Bench 4.0
エージェントターミナルプログラミングベンチマーク
55.8% 42.0% 52.3% 37.3% +13.8 ポイント
専門知識業務 GDPval-AA v2
実際の経済的価値を持つ専門タスクのベンチマーク
1853 1723 1824 1711 +130 ポイント
コンピュータ操作 OSWorld 2.0 — Partial
実際のコンピュータ操作ベンチマーク:部分完了スコア
77.9% 72.9% 75.4% — +5.0 ポイント
コンピュータ操作 OSWorld 2.0 — Strict
実際のコンピュータ操作ベンチマーク:厳密完了率
41.7% 36.1% 39.6% — +5.6 ポイント
学際的推論 Humanity's Last Exam — No tools
人類最後の試験:ツールなし
60.9% 57.8% 56.6% — +3.1 ポイント
学際的推論 Humanity's Last Exam — With tools
人類最後の試験:ツールあり
65.0% 63.8% 63.6% — +1.2 ポイント
ビジネスワークフロー AutomationBench
アプリ間のビジネス自動化ワークフローベンチマーク
31.4% 17.1% 26.9% 19.6% +14.3 ポイント
エージェントプログラミング CursorBench 3.2.0
実際の複数ファイルプログラミングタスクのベンチマーク
73.4% 70.5% 70.0% 67.2% +2.9 ポイント

— は、Anthropic のこのメインテーブルに対応するスコアが提供されていないことを示し、そのモデルがタスクを完了できないことを意味するわけではありません。Terminal-Bench 4.0 では、制限が少なく信頼できるプランのみに公開されている Mythos 5.1 が 60.9% を獲得しています。本記事は一般ユーザーが利用できる Fable 5.1 に焦点を当てており、Mythos のスコアを Fable の列に混ぜることはしません。

Terminal-Bench-Science 0.1 は何を測るのか

Terminal-Bench-Science 0.1 は、生命科学、物理科学、地球科学、数学、工学の 5 つの主要分野にわたる 70 の実際の研究ワークフローで構成されています。タスクは選択式問題ではなく、エージェントがターミナル上でデータ分析、統計的推論、シミュレーション、最適化、定理証明、画像再構成、科学向け機械学習を実行し、再現可能なテストで成果物を検証することが求められます。

Fable 5.1 の 52.6% は、公式の再現実験における Fable 5 の 24.7% と比較して 27.9 ポイントの向上であり、この表全体で最も顕著なジャンプです。ただし、公式は各モデルについて約 ±3.5〜4.5 パーセンテージポイントの標準誤差を明記しており、小数点以下 1 桁を絶対的に正確な順位とみなすことはできません。

Terminal-Bench 4.0 と CursorBench 3.2.0 は何を測るのか

Terminal-Bench は、エージェントが実際のターミナル環境で複雑なタスクを処理し、環境を理解し、ツールを呼び出し、ファイルを変更し、最終的に検証を通過できるかを重視します。Fable 5.1 は 55.8% を獲得し、Fable 5 より 13.8 ポイント高く、Opus 5 の 52.3% も上回りました。

CursorBench 3.2 は、実際の Cursor セッションにおける曖昧で複数ファイルにわたるタスクを基にしており、バージョン 3.2 では指示追従と高度なツール使用に関する問題が追加されています。Fable 5.1 Max は 73.4% を獲得し、そのリード幅は Terminal-Bench-Science ほど劇的ではありませんが、タスクあたり平均 72,060 token、コストは $9.64 です。Fable 5 Max は 103,525 token、$17.32 でした。ここで注目すべきは、同じ種類のタスクを完了する際の token とコストの削減であり、2.9 ポイントそのものではありません。

GDPval-AA v2 は何を測るのか

GDPval-AA v2 は、業界の専門家によって設計された 220 のタスク(44 の職業と 9 の業界をカバー)を使用し、モデルが現実の経済的価値のある知識業務を処理する能力を評価します。その 1853 は総合スコアであり、1853% ではありません。この結果は、Fable 5.1 が専門文書、分析、成果物において Fable 5 を上回り、Opus 5 もわずかに上回ることを示しています。

OSWorld 2.0 のスコアがなぜ 2 つあるのか

OSWorld 2.0 には、108 の長時間・多段階のコンピュータ操作ワークフローが含まれており、各タスクの人間による完了時間の中央値は約 1.6 時間です。Partial は複数のチェックポイントに基づいて部分完了スコアを与えます。Strict は、目標を完全に達成した場合のみ成功とみなされます。

したがって、Fable 5.1 の partial 77.9% と strict 41.7% は矛盾しません。多くの場合、ほとんどのステップは完了できるものの、一部のタスクはエンドツーエンドで完了に至っていない、ということです。これは、コンピュータエージェントが「ずっと操作しているように見える」ことが、タスクがすでに成功したことを意味するわけではないという注意喚起でもあります。

Humanity's Last Exam は何を測るのか

Humanity's Last Exam は Center for AI Safety と Scale AI によって作成され、学際的でエキスパートレベルの、単純な検索では答えにくい 2,500 問の問題が含まれています。Fable 5.1 はツールなしの条件では Fable 5 より 3.1 ポイント高く、ツールを許可した場合でも 1.2 ポイント高いだけです。確かにより強力ですが、すべてのベンチマークで倍増するような伸びが見られるわけではありません。

AutomationBench は何を測るのか

AutomationBench は、エージェントが CRM、メール、カレンダー、メッセージ、プロジェクト管理などの模擬 SaaS ツールを横断して、営業、マーケティング、運用、カスタマーサポート、財務、人事のワークフローを完了できるかを検証します。Fable 5.1 は 17.1% から 31.4% へ向上し、相対的な伸びは約 84% です。これは、5.1 が複数アプリにまたがる状態管理と長いステップの実行において実質的な進歩を遂げたことを示しています。ただし、31.4% という数字は、この種の無人でのビジネス自動化がまだ解決にはほど遠いことも示しています。

7 種類の主要ベンチマークにおける Fable 5.1 の能力カバレッジマトリックス
7 種類のベンチマークは、科学研究、ターミナルプログラミング、専門知識業務、コンピュータ操作、学際的推論、ビジネスプロセス、複数ファイルプログラミングをそれぞれカバーしています。

Fable 5.1 は Fable 5 と比べて何が改善されたのか

1. 長時間タスクで近道をしにくくなった

Anthropic は Fable 5.1 を長時間型エージェントモデルとして位置づけています。まず計画し、ツールを使用し、失敗から回復し、結果を検証し、進捗を能動的に報告します。特定のテストを早くグリーンにするための部分的な回避よりも、根本原因の修正を重視します。公式が挙げる対象シナリオには、コードベース横断の機能開発、コードレビュー、パフォーマンス最適化、数日にわたる自律セッション、研究、ドキュメント、スプレッドシート、スライドが含まれます。

2. 低 effort でも前世代の高コストな結果に迫れる

Fable 5.1 には、メッセージ単位で effort を調整する機能が追加されました。公式のコスト曲線によれば、Low または Medium の effort でも、一部のタスクでは Fable 5 に匹敵するかそれを上回る結果を達成しつつ、token とコストを削減できます。Claude Code はデフォルトで High effort を使用します。Claude.ai と Cowork はデフォルトで Medium です。モデルを比較する際は、まず effort を確認しなければならず、異なるレベルの結果をそのまま並べて比較してはいけません。

3. ツール呼び出しの合間に可読な進捗を表示できる

API には、display: "updates" という試験的な機能が追加され、モデルがツール呼び出しの合間にユーザー向けの進捗アップデートを提供できるようになりました。何時間も実行されるタスクでは、ツールのカードが次々と表示されるのを見るよりも、モデルが何をしているのか、目標から逸れていないかを判断しやすくなります。

4. 文章作成・視覚検証・自己テストがより充実

公式によると、5.1 は自身の変更を検証するテストを自ら作成し、視覚能力を利用して設計目標と照らし合わせて出力をチェックします。パートナーからの評価も、より簡潔な進捗報告、複数の部分からなる質問へのより完全な回答、複数のサービスにわたる呼び出しチェーンの追跡、長時間の実行後も読みやすさを維持できる点などに集中しています。これらは定性的なフィードバックであり、統一されたベンチマークの結論として扱うべきではありません。

5. 安全上のブロックはより正確になったが、なくなったわけではない

Fable 5.1 のサイバーセキュリティ保護における誤検出は、Fable 5 のリリース時より約 60% 減少し、基本的な生物学・医学の質問がグレードダウンを引き起こす頻度は約 85% 低下しました。現在はソフトウェアの脆弱性の発見に使用できますが、ペネトレーションテスト、エクスプロイトコードの生成、バイナリの脆弱性スキャンといったデュアルユースタスクは、依然として Opus にルーティングされる可能性があります。ルーティングされた場合、Fable の価格では請求されません。

6. コンテンツ来歴のマーキングを新規追加

Fable 5.1 は content provenance(コンテンツの来歴証明)を導入しました。生成されたテキストには統計的な透かしが含まれることがあり、Anthropic のコンテンツ検査ツールで検証できます。本文に目に見えるマークが追加されることはありませんが、コンテンツプラットフォーム、教育、企業監査にとっては、あらかじめ把握しておくべき新しい動作です。

前世代と比較した Fable 5.1 の 6 つの主要な改善点
5.1 の変化は、長時間タスク、低 effort での効率、進捗報告、自己検証、誤検出の減少、コンテンツ来歴のマーキングに集中しています。

Fable 5.1 の費用はどう計算されるのか

課金項目 Fable 5.1 の価格 Fable 5 との比較
入力 $10 / 100万 token 同じ
出力 $50 / 100万 token 同じ
5 分間キャッシュ書き込み $12.50 / 100万 token 同じ水準
1 時間キャッシュ書き込み $20 / 100万 token 同じ水準
キャッシュ読み取り $0.25 / 100万 token 75% 削減
Batch API 入力・出力価格の 50% Batch のルールに従う

1 回の長時間タスクで、キャッシュ token を累計 1,000万 読み取り、新しい入力 token を 20万、出力 token を 5万 生成すると仮定し、キャッシュ書き込みは考慮しない場合:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

同じ 1,000万 token のキャッシュ読み取りを Fable 5 で行うと約 $10 かかり、この項目だけで $7.50 の差が生じます。Anthropic はこれに基づき、一般的な token 課金タスクの実効コストは約 25% 削減でき、高度にエージェント化され長いコンテキストを頻繁に再利用するタスクでは最大約 45% 削減できると見積もっています。これは API の表示価格が全体的に下がったわけではなく、キャッシュヒットが多いほど節約効果が顕著になることを意味します。

サブスクリプションユーザーは API のキャッシュ値下げを必ずしも直接受けられない

Max、および Team/Enterprise の premium seat では、毎週の利用枠の最大 50% を Fable モデルに使用できます。一方、Pro と標準シートは当初から usage credits を消費します。具体的な消費量は、アカウント内の Usage ページの表示を基準にしてください。キャッシュ読み取りの値下げは、主に token 課金のシナリオにおける変更です。API の 75% キャッシュ値下げを、そのまま「Max プランが 4 倍使える」と換算することはできません。

Fable 5.1 の入力・出力・キャッシュの費用構成
Fable 5.1 の入力・出力の単価は変わらず、主な値下げはキャッシュ読み取りによるもので、長いコンテキストを再利用するほど恩恵が大きくなります。

Fable 5.1 は結局速いのか

答えは次のとおりです。単発の応答は遅めですが、複雑なタスクの総完了時間は短くなる可能性があります。

  • Anthropic のモデルカタログは Fable 5.1 を Slower、Opus 5 を Moderate、Sonnet 5 を Fast と分類しています。
  • Claude Code はデフォルトで High effort のため、Low や Medium よりも多くの推論時間を自然と使います。
  • Every は自社のワークロードにおいて、Fable 5.1 が Opus 5 より約 2 倍速く、token が半分であると報告しています。これはパートナー固有のテストであり、一般的な速度の保証ではありません。
  • CursorBench では、Fable 5.1 Max は平均 70 ステップ、72,060 token でした。Fable 5 Max も同じく 72 ステップでしたが、103,525 token を使用しました。5.1 の優位性は「遠回りが少なく、token の消費が少ない」というものであり、必ずしも最初の文字が返るまでの速度として現れるわけではありません。

したがって、チャット、短いコード、頻繁な対話には Sonnet 5 または Opus 5 を優先し、コードベース横断のデバッグ、長時間の研究、自己検証が必要な無人タスクでは、Fable 5.1 を検討してください。

Fable 5.1 にアップグレードする前に必ず対応すべき互換性の変更

Claude Code を最低でも 2.1.250 にアップグレードする

Anthropic のプランと利用可否の説明では、Claude Code 2.1.250 以降が必要です。Fable 5.1 が表示されない場合は、まず次を確認してください:

bash
claude --version

そのうえで Claude Code の公式アップグレード手順に従って更新し、セッションを再起動してください。Fable 5.1 の API モデル ID は次のとおりです:

text
claude-fable-5-1

Forced tool use が直接エラーを返す可能性がある

モデルに特定のツールの呼び出しを強制するリクエストを行うと、Fable 5.1 はエラーを返す可能性があります。移行前には tool_choice と、自作エージェントの強制ツール呼び出しフローを確認し、Fable 5 の動作と完全に互換性があると想定しないでください。

Thinking blocks はモデル間で安易に再利用できない

旧世代のモデルは Fable 5.1 の thinking blocks を読み取ることができません。モデルを切り替える際は、SDK に公式のルールに従ってこれらのブロックを処理させ、別のモデルにそのまま渡さないようにしてください。

過去の履歴を変更すると 400 エラーになる可能性がある

2026 年 8 月 31 日以降に作成された新しい API アカウントでは、thinking blocks は、それらが生成された元の会話プレフィックス内でのみ有効です。system、tools、またはより前のメッセージを変更してから thinking blocks を再生すると、400 エラーが返される可能性があります。公式は履歴を append-only(追記のみ)に保つことを推奨しています。圧縮が必要な場合は、新しい要約 1 つで古い履歴全体を置き換え、古いターンを変更しながら元の thinking blocks を保持しないでください。詳細な方法は Fable 5.1 のプロンプトと移行ガイド を参照してください。

どのようなときに Fable 5.1 を選ぶべきか

適している場合:

  • 複数のリポジトリ、サービス、またはアプリケーションにまたがる長時間タスク。
  • 数時間にわたって稼働し、失敗を自ら回復する必要があるエージェント。
  • 科学研究、複雑なデータ分析、多段階の専門的な成果物。
  • 再現が難しいシステム問題、パフォーマンス最適化、根本原因の調査。
  • 長いコンテキストを大量に再利用する必要があり、キャッシュ読み取りの割合が高い API ワークロード。

適さない場合:

  • 単純なチャット、短い文章、単一ファイルの小さな修正。
  • 最初の文字が返るまでのレイテンシに非常に敏感なリアルタイムの対話。
  • 予算が固定されているが、キャッシュを再利用できない高出力タスク。
  • デフォルトの 30 日間のセキュリティモニタリングデータ保持を受け入れられず、企業向け例外条件にも該当しないシナリオ。
  • すべてのサイバーセキュリティまたは生命科学関連のリクエストでグレードダウンが発生しないことを望むワークフロー。

長時間タスクをリモートで確認するには

Fable 5.1 の価値は、数時間から数日におよぶタスクで発揮されることが多いですが、だからといって常に開発マシンの前に張り付いている必要はありません。まずローカルの Claude Code 2.1.250+ で Fable 5.1 が利用可能であることを確認し、PandaNpc Agent を介して、ブラウザ、デスクトップ、またはスマートフォンから同じ開発マシン上の Claude Code セッションを表示し、インタラクションを処理し、追加の指示を送ることができます。

ここで変わるのは操作の入り口だけであり、コード、ツール、ビルドは引き続きお使いの開発マシン上で実行されます。先に Claude Code リモートアクセスガイド と スマートフォンで Claude Code に接続するチュートリアル を読み、リモートの接続経路を確認してから、Fable 5.1 に長時間タスクを任せることをおすすめします。

FAQ

Fable 5.1 は Fable 5 よりどれくらい強いのか?

タスクによって差は非常に大きいです。Terminal-Bench-Science では 27.9 ポイント向上し、AutomationBench では 14.3 ポイント向上しましたが、HLE ではツールを使用した場合にわずか 1.2 ポイントの向上にとどまりました。単一の最大の改善幅で、すべてのタスクを代表させることはできません。

Fable 5.1 は Opus 5 より速いですか?

公式の相対レイテンシ表では、Fable 5.1 は「遅い」、Opus 5 は「中程度」です。一部のパートナーは、タスク全体で見ると Fable 5.1 の方が速いと観察しています。使用する token が少なく、やり直しも少ないためです。この 2 つの結論は、同じものを測定しているわけではありません。

Fable 5.1 は GPT-5.6 Sol よりプログラミングに適していますか?

Anthropic の発表表では、Fable 5.1 は Terminal-Bench-Science、Terminal-Bench、AutomationBench、CursorBench でより高いスコアです。しかし、モデルによって使用する Agent harness、effort、ツール、価格は異なるため、これをもって実際のすべてのリポジトリで Fable が勝利すると断言することはできません。GPT-5.6 Sol 1M コンテキスト設定チュートリアル を参考にし、自身の代表的なタスクで A/B テストを行うとよいでしょう。

なぜ Fable 5.1 が突然 Opus に切り替わるのか?

一部のサイバーセキュリティおよび生命科学関連のリクエストは、safeguards によって Opus にルーティングされます。モデルの切り替えは必ずしも障害ではありません。Anthropic は、このようにルーティングされたリクエストは Fable の価格では請求されないと述べています。

Fable 5.1 には透かしがありますか?

統計的な content provenance のメカニズムは備わっていますが、テキストの表面に目に見えるラベルが追加されることはありません。画像の隅にあるような目に見える透かしとは別物です。

まとめ

Claude Fable 5.1 の最も顕著な進歩は、科学研究、ターミナルタスク、アプリ間のビジネスワークフローに集中しています。継続的な実行、失敗からの回復、結果の検証がより得意になり、より安価なキャッシュ読み取りによって長時間タスクのコストも削減しました。しかし、依然として価格が高く、単発のレイテンシは遅めであり、thinking blocks、強制ツール呼び出し、履歴編集に関する互換性の変更も伴います。

Fable 5.1 を選ぶ際の正しい問いは「ベンチマークで 1 位かどうか」ではなく、次のような問いです。あなたのタスクは十分に長く、十分に複雑か、そして失敗ややり直しのコストが Fable 5.1 を使う価値があるほど高いか。答えがノーであれば、通常は Opus 5 または Sonnet 5 から始める方が適切です。

Codex で GPT-5.6 Sol 1M コンテキストを有効化:3行の `config.toml` 設定チュートリアル

Codex で GPT-5.6 Sol 1M コンテキストを有効化:3行の `config.toml` 設定チュートリアル

GPT-5.6 Sol は公式に 105 万トークンのコンテキストをサポートしています。Codex の config.toml の先頭に 3 行の設定を追加するだけで、100 万ウィンドウで実行でき、約 90 万トークンで履歴が自動的に圧縮されます。永久設定、単発コマンド、検証、コストの注意事項が付属しています。

記事を読む →
Claude Code Remote Control の使い方:スマホからのリモート制御、公式制限と代替案(2026)

Claude Code Remote Control の使い方:スマホからのリモート制御、公式制限と代替案(2026)

Claude Code Remote Control はどうやって有効にするのか?この記事では、claude remote-control、claude --remote-control、/remote-control の3つの公式な使い方を紹介し、スマホとブラウザの接続、アカウント要件、認証方法、よくあるエラーについて説明します。また、カスタムモデル、Codex、複数マシン環境における PandaNpc ソリューションも比較します。

記事を読む →
スマホでClaude Codeに接続:iOSでいつでもセッション確認・承認ができるツール

スマホでClaude Codeに接続:iOSでいつでもセッション確認・承認ができるツール

この記事は開発者向けに、スマートフォンで Claude Code に接続するベストプラクティスを紹介します。PandaNpc iOS アプリを通じてセッションをリアルタイムで確認し、ツール呼び出しを承認して質問に応答し、pandapaw と iOS Live Activity を活用することで効率的なリモート操作を実現し、コーディングの柔軟性を向上させます。

記事を読む →