GPT-6 Astra vs Claude Fable 5.1:プログラミング、Agent、価格とベンチマーク比較

GPT-6 Astra と Claude Fable 5.1 はどちらも一般公開されており、いずれも100万トークンあたり入力10ドル・出力50ドルのフラッグシップモデルですが、プログラミング、コンピューター操作、長時間タスク、キャッシュコスト、コンテキストの面でそれぞれ一長一短があります。本稿では共通のベンチマークで項目ごとに比較し、タスクに応じたモデル選択の方法を示します。

PandaNpc初公開日 更新日
GPT-6 Astra vs Claude Fable 5.1:プログラミング、Agent、価格とベンチマーク比較

まず結論:GPT-6 Astra は共通ベンチマーク上でより強い汎用モデルであり、Claude Fable 5.1 は長時間の Agent、キャッシュコスト、Claude Code ワークフローにおいてより魅力的である。 タスクがターミナルでのプログラミング、コンピューター操作、数学、データベースマイグレーション、またはツール横断的な実行を中心とするなら、まず GPT-6 Astra を試すのがよい。Agent が数時間連続で実行されたり、大きな同じコンテキストを繰り返し大量に読み込んだりする場合、あるいはチームがすでに Claude Code を深く活用している場合は、Fable 5.1 のほうが適している可能性がある。

これは単純な「GPT-6 が何項目勝ったか」という話ではない。両モデルの API 入力・出力の公称価格はまったく同じだが、キャッシュ読み出しは4倍の差がある。また、各社が公表するベンチマークには、harness、effort、安全ポリシー、欠損データの差が存在する。本稿は 2026年9月5日 時点のものであり、公式に検証できるデータのみを比較し、直接比較できない箇所は個別に明示する。

一目でわかる GPT-6 Astra と Claude Fable 5.1

項目 GPT-6 Astra Claude Fable 5.1
公式上の位置づけ 最も困難なエンドツーエンドのタスク 高難度推論と長時間の Agent タスク
コンテキストウィンドウ 1,050,000 token 1,000,000 token
最大出力 128,000 token 128,000 token
API 入力価格 $10 / MTok $10 / MTok
API 出力価格 $50 / MTok $50 / MTok
キャッシュ読み出し $1 / MTok $0.25 / MTok
キャッシュ書き込み $12.50 / MTok 5分 $12.50 / MTok;1時間 $20 / MTok
Batch 標準価格の50% 入出力とも標準価格の50%
推論制御 low / medium / high / xhigh / max Adaptive thinking;メッセージ単位で effort を設定
確実な知識カットオフ 2026年4月30日 2026年6月
API モデル ID gpt-6-astra claude-fable-5-1
2026-09-05時点の提供状況 資格を満たす有料プラン、Codex と API で全面提供中 Claude API と主要クラウドプラットフォームで利用可能;Claude 有料プランで利用可能

仕様は OpenAI GPT-6 Astra モデルページと Anthropic Fable 5.1 モデルページによる。OpenAI はまた、入力が272K token を超えると、リクエスト全体の入力価格とキャッシュ価格が2倍、出力価格が1.5倍になることも明記している。したがって、「GPT-6 はコンテキストが5万多い」ことは、長大なタスクで必ずしも安くなることを意味しない。

GPT-6 Astra の段階的提供はすでに終了しているため、「誰が先にアクセス権を得られるか」はもはや両者の主な選択基準ではない。ここでの全面提供とは、資格を満たす有料プラン、Codex、API を指すにすぎない。Free/Go、Chat における GPT-6 Pro の権限、および制限付きのサイバーセキュリティ機能には依然として独立した境界がある。詳細は GPT-6 Astra の提供と安全に関する共有説明 を参照。

GPT-6 Astra と Claude Fable 5.1 の仕様、価格、現在の提供状況の比較
両者の基本の入出力価格は同じで、いずれも公開済み。Fable 5.1 のキャッシュ読み出しはより安く、GPT-6 Astra のコンテキストはやや大きい。

GPT-6 Astra vs Claude Fable 5.1 ベンチマーク比較

以下では、両者に結果があるか、欠落の理由を説明する価値がある指標のみを列挙する。成績は両社の公式発表資料による。太字は同じ行の高い方の値;— は発表表にデータがなかったことのみを示し、モデルが0点だったことを意味しない。

能力 ベンチマーク GPT-6 Astra Fable 5.1 リーダー
科学用ターミナル Terminal-Bench Science 64.6% 52.6% GPT-6 +12.0
高難度数学 FrontierMath Tier 4 97.6% 87.8% GPT-6 +9.8
科学QA GPQA Diamond 96.0% 93.7% GPT-6 +2.3
多分野推論 HLE(ツール使用) 57.2% 65.0% Fable +7.8
健康QA HealthBench Pro 63.4% 56.6% GPT-6 +6.8
ビジネ自動化 AutomationBench 41.4% 31.4% GPT-6 +100
CAD BenchCAD 95.9 84.3% GPT-6 +11.6
総合知能 AA Index 61.2 65.7 Fable +4.5
ターミナルプログラミング Terminal-Bench 4.0 57.7% 55.8% GPT-6 +1.9
ソフトウェアエンジニアリング DeepSWE v1.1 74.1% 67.4% GPT-6 +6.7
拡張プログラミング FrontierCode Ext. 64.5% 63.6% GPT-6 +0.9
標準プログラミング FrontierCode Main 53.3% 50.9% GPT-6 +2.4
データベースマイグレーション DB Migration 63.9% 57.8% GPT-6 +6.1
抽象推論 ARC-AGI-2 95.0% 90.0% GPT-6 +5.0
抽象推論 ARC-AGI-1 98.5% 97.5% GPT-6 +1.0

このデータは、次の3つの限定的な結論を支持する:

  1. GPT-6 Astra は、特に科学用ターミナル、数学、CAD、ビジネス自動化、データベースマイグレーションにおいて、より広い優位性を持つ。
  2. Fable 5.1 は全面的に劣っているわけではなく、HLE のツールモードと Artificial Analysis Intelligence Index でより高い。
  3. 2〜3パーセント未満の差は過度に解釈すべきではない。実行環境、サンプル、ツール、推論予算、ランダム性によって順位が変わることがある。

OpenAI の発表資料には Agents' Last Exam 59.3%、OSWorld 2.0 72.6%、ScreenSpot-Pro 92.7% も含まれるが、同じ表には Fable 5.1 の対応する値がないため、これらの行をもって Fable の敗北を宣言することはできない。逆に、Anthropic の発表ページにある CursorBench 3.2.0、GDPval-AA v2、OSWorld partial/strict も、別の設定を用いた OpenAI の数値と直接つなぎ合わせることはできない。

共通ベンチマークにおける GPT-6 Astra と Claude Fable 5.1 のリード領域
GPT-6 Astra はほとんどの共通指標でリードし、Fable 5.1 は HLE のツールモードと AA Intelligence Index でリードする。

プログラミング能力:GPT-6 のほうが強いが、差はタスク次第

「GPT-6 Astra と Fable 5.1 のどちらがプログラミングに向いているか」という問いに対して、公式の共通データは GPT-6 に有利だ。Terminal-Bench 4.0 で1.9ポイント、DeepSWE v1.1 で6.7、DB Migration で6.1高い。ScreenSpot-Pro、BenchCAD、Computer Use 関連の結果でのパフォーマンスも、コードを生成するだけでなく、実際のソフトウェアインターフェース内でタスクを完了するのが得意であることを示している。

しかし、異なるコーディングベンチマークは同じものを測定しているわけではない:

  • Terminal-Bench は、ターミナル内で環境を理解し、ファイルを変更し、検証を通過することに近い。
  • DeepSWE はソフトウェアエンジニアリングタスクに焦点を当てている。
  • FrontierCode は実際のエンジニアリング品質とマージ可能性をより重視する。
  • DB Migration はより狭いが実用的なデータベース変更タスクである。
  • Artificial Analysis Coding Agent Index は複数のエージェント型コーディング評価を統合したものであり、Fable 5.1 は一部の外部統合指標で依然として競争力を持つ。

したがって、小さな修正や単一ファイルの生成では、フラッグシップのベンチマークスコアだけでモデルを選ぶべきではない。本当に A/B テストすべきなのは、自分自身の代表的なタスクである。同じリポジトリ、同じ初期状態、同じツール権限、同じ受け入れテストで、成功率、人間の介入回数、総トークン数、総費用、完了時間をそれぞれ記録するのだ。

長時間の Agent:Fable 5.1 の優位性はベンチマークだけではない

Anthropic は Fable 5.1 を、数時間にわたって複数のアプリケーションをまたぐタスク向けのモデルとして明確に設計している。計画、ツール呼び出し、障害復旧、セルフテスト、可読性のある進捗を重視し、メッセージ単位で effort を調整できる。すでに Claude Code、Cowork、Claude API を中心にワークフローを構築しているチームにとって、これらの実行時動作は単一のベンチマークの数ポイントよりも重要かもしれない。

GPT-6 Astra もエンドツーエンドの Agent 向けであり、ウェブ検索、ファイル検索、コードインタープリター、ホステッド Shell、Computer Use、MCP、Skills、非同期ツール呼び出しに対応する。さらに、タスク実行中に追加要件を出したり、キャッシュプレフィックスを中断せずに推論強度を調整したりすることも可能だ。つまり、両者とも「ただのチャット」モデルではなく、違いはエージェントフレームワーク、エコシステム統合、コスト構造に現れる。

タスクが数時間実行される場合、PandaNpc Agent を通じてモバイル、ウェブ、デスクトップからローカルマシン上の Claude Code または Codex セッションを確認できる。モデルとツールは開発マシン上で実行されたままであり、リモートエントリは進捗の確認、権限の問題の処理、追加指示の送信のみを担当する。詳細は Claude Code と Codex の比較 を参照。

価格は同じなのに、実際の費用が大きく変わりうる理由

両モデルとも入力 $10/MTok、出力 $50/MTok で、一見タイトル価格だけを見るとコストは同じだと思われる。実際には少なくとも4つの変数がある:

  • キャッシュ読み出し: Fable 5.1 は $0.25/MTok、GPT-6 Astra は $1/MTok。
  • 長大な入力: GPT-6 は入力が272Kを超えると、リクエスト全体に倍率の課金が適用される。
  • 出力長: 出力はどちらも100万トークンあたり50ドルであり、やり直しや冗長な推論はすぐに費用を膨らませる。
  • タスク成功率: 一度で完了する高価なモデルは、3回再実行が必要な安価なモデルよりも節約になることがある。

タスクが1,000万のキャッシュトークンを読み取り、さらに20万の新規入力と5万の出力があり、キャッシュ書き込みは考慮しないとしよう:

費用 GPT-6 Astra Fable 5.1
キャッシュ読み出し $10.00 $2.50
新規入力 $2.00 $2.00
出力 $2.50 $2.50
合計 $14.50 $7.00

この例は「キャッシュ再利用が多いシナリオ」での価格差を示すだけで、Fable のすべてのタスクが半分のコストになるわけではない。タスクがキャッシュにほとんどヒットしない場合や、GPT-6 がより少ないステップで一度に完了する場合は、結果が逆転することもある。

GPT-6 Astra か Claude Fable 5.1 かを選ぶためのタスク決定木
提供範囲はもはや主要な障壁ではない。コンピューター操作とターミナル実行、または長いタスク・キャッシュ再利用・Claude Code エコシステムによって選択する。

安全ポリシーは実際の利用にどう影響するか

Fable 5.1 のサイバーセキュリティ、生物、化学に関するリクエストは safeguards を引き起こし、拒否されたり Opus モデルにルーティングされたりする可能性がある。Anthropic は、ルーティングされたリクエストは Fable の価格では請求されないと明言している。また、公式ベンチマークでも、一部のタスクは本番の安全ポリシー介入によって0点となったと注記されており、「拒否」と「基礎能力の不足」は同じではない。

GPT-6 Astra もより厳格な安全・アライメント機構を採用している。OpenAI は同モデルのサイバーセキュリティ能力を Critical と評価し、高リスク能力には Trusted Access、監視、段階的提供を設定している。一般的な開発、コードレビュー、防御的なセキュリティ業務は通常、高リスク能力には該当しないが、実際に実行できるかどうかはリクエストの内容、アカウント資格、ツール権限に依存する。

安全ベンチマークを「完了率」だけで見られないのもこのためだ。企業展開では、自動実行を許可するか、ツール権限を制限できるか、監査証跡を保持するか、データ保持ルールは何か、そしてグレードダウンが発生したときにアプリケーションが実際のモデルを正しく識別できるか、といった問題のほうが重要である。

GPT-6 Astra と Fable 5.1 はどう選ぶべきか

以下の場合は GPT-6 Astra を優先する:

  • 複雑なターミナルプログラミング、データベースマイグレーション、コンピューター操作、またはツール横断的な作業が中心である。
  • 数学、抽象推論、CAD、専門ソフトウェア操作の共通ベンチマークをより重視する。
  • OpenAI Responses API の非同期ツール、ホステッド Shell、Computer Use、MCP の組み合わせが必要である。
  • すでに公開されている Codex または OpenAI API で Astra を直接使いたいと考えており、272K 超の長い入力に倍率課金を織り込む用意がある。

以下の場合は Claude Fable 5.1 を優先する:

  • すでに Claude Code または Claude API を主ワークフローにしている。
  • タスクが長時間実行され、大きな同じコンテキストを繰り返し読み込む。
  • キャッシュ読み出しコスト、進捗の可読性、長いタスクの復旧をより重視する。
  • 自社の評価で、Fable がコードベースや専門文書のタスクでやり直しが少ないことが示されている。

両方にアクセス権がある場合、最も確実な方法は1つの総合チャンピオンに賭けることではなく、2層のルーティングを構築することだ。通常のタスクはまず比較的安価な Opus、Sonnet、GPT-5.6 系を使い、高価値・長連結のタスクだけを GPT-6 Astra または Fable 5.1 にアップグレードし、実測の成功率に応じて振り分けを続ける。

2つのモデルを公平に比較する方法

10〜30個の実際のタスクを用意し、各タスクで以下を固定することを推奨する:

  1. 同じコードとデータスナップショット。
  2. 同じツール、ネットワーク、ファイル権限。
  3. 等価な reasoning effort(一方は max、もう一方はデフォルトのまま、ではなく)。
  4. 同じ時間上限と費用上限。
  5. 自動テストまたは人間による盲検評価の基準。
  6. 少なくとも3回繰り返し実行し、一度きりの偶然の成功を安定した能力と見なさないこと。

最終的な表には、少なくとも完了率、初回通過率、人間の介入回数、総費用、所要時間、出力トークンを記録する。モデルが拒否、グレードダウン、権限不足を引き起こした場合は、理由を別途列挙し、一律に「できない」とみなさないこと。

FAQ(よくある質問)

GPT-6 Astra は Claude Fable 5.1 より強いですか?

現在公開されているほとんどの共通ベンチマークでは、GPT-6 Astra のほうが高い。特に科学用ターミナル、数学、CAD、自動化、データベースマイグレーションで顕著だ。ただし Fable 5.1 は HLE のツールモードと AA Intelligence Index でリードしており、実際のタスクは harness、effort、ツール、安全ポリシーの影響も受ける。

コードを書くのに適しているのはどちらのモデルですか?

GPT-6 Astra は共通のコーディングベンチマークで総じて優勢であり、ターミナル、データベース、ソフトウェア横断タスクに向いている。Fable 5.1 は長時間の自律的プログラミング、復旧、検証をより重視する。大規模プロジェクトでは、自社のコードベースで同じ条件の A/B テストを行うのが最善である。

両者の API 価格は同じですか?

基本の入力・出力価格は同じで、どちらも $10/MTok と $50/MTok である。ただし、Fable 5.1 のキャッシュ読み出しは $0.25/MTok であるのに対し、GPT-6 Astra は $1/MTok であり、GPT-6 は272K を超える入力で倍率課金にもなるため、実際のコストは同じとは限らない。

どちらのコンテキストが長いですか?

GPT-6 Astra は 1,050,000 token、Fable 5.1 は 1,000,000 token で、両者の最大出力はいずれも128K である。容量だけを見れば差は小さい。長大な入力の価格、検索品質、キャッシュヒット率のほうが通常は注目に値する。

GPT-6 Astra が表示されないのはなぜですか?

2026年9月5日時点で、GPT-6 Astra は資格を満たす有料プラン、Codex、API エントリで全面提供中である。それでも表示されない場合は、自分が Free/Go ではないか、ベースの Astra ではなく GPT-6 Pro を探していないか、ワークスペース管理者がこのモデルを許可しているか、クライアントの更新または再ログインが必要かを確認すべきだ。完全な境界は GPT-6 Astra の権限と共有に関する説明 を参照。

ベンダーのベンチマークをそのまま信じてよいですか?

スクリーニングのシグナルとしてはよいが、最終的な採用判断にはできない。まず、同じ行が同じタスクバージョン、ツール、推論予算、採点方式を使用しているかを確認し、その上で自分の代表的なワークロードを使って再測定する。

まとめ

GPT-6 Astra vs Claude Fable 5.1 の要点は、「どちらがあらゆるシナリオで賢いか」ではない。両モデルともすでに公開されている。GPT-6 はほとんどの共通ベンチマークでリードし、特にコンピューター操作、複雑なターミナル、数学、ツール横断的な実行に適している。Fable 5.1 は、より低いキャッシュ読み出しコスト、成熟した Claude ワークフロー、長時間 Agent の設計によって明確な優位性を残している。

ひとつのデフォルト推奨を挙げるなら:アクセス権があり、タスクが複雑な実行中心なら、まず GPT-6 Astra を試す。タスクが長いコンテキストを高度に再利用するか、すでに Claude Code に深く依存しているなら、まず Fable 5.1 を試す。 コストや信頼性に敏感なチームは、自社の成功率と成功タスクあたりのコストで最終判断を下すべきである。