GPT-6 Sol vs Claude Opus 5.5:価格、ベンチマークスコア、コーディングタスクでどう選ぶ?

一般的な API プログラミングタスクでは、まず GPT-6 Sol を試してください。複雑なタスクでは Claude Opus 5.5 と比較し、さらに高難度の選択肢として GPT-6 Astra と Claude Fable 5.1 を候補にしましょう。本記事では、4モデルの公式仕様、キャッシュと Batch の価格、同一条件の第三者ベンチマークを確認し、再計算可能な費用シナリオを5つ提供します。

PandaNpc初公開日
GPT-6 Sol vs Claude Opus 5.5:価格、ベンチマークスコア、コーディングタスクでどう選ぶ?

まず結論から: 一般的な API コーディングタスクでは、まず GPT-6 Sol を試すとよいでしょう。標準の入力/出力価格は 100万 token あたり $2/$10 で、いずれも Claude Opus 5.5 の半分です。Artificial Analysis(AA)の同一評価体系における最高設定では、Opus 5.5 の総合指数は 58、Sol は 48 です。両者は「同じ価格でより強い」という関係ではありません。まず自分のリポジトリのタスクで、一発合格率、ターン数、総 token、人手による手戻りを比較し、そのうえで Opus の高いスコアに対して料金を払うか決めましょう。より難しい長距離タスクでは GPT-6 Astra や Claude Fable 5.1 まで試せます。4モデルの単価と能力は同じ順序には並んでいません。

私たちは Codex と Claude Code をサポートする PandaNpc を運営しているため、製品の利用シナリオがあります。本記事では4モデルの同一問題実測を完了しておらず、以下の公開評価を当サイトの実測と偽ることもありません。価格はモデル API の費用を指し、ツールのサブスクリプション価格ではありません。資料は 2026年9月23日 時点で確認しており、通貨はすべて米ドルです。

4モデルの仕様:まず容量、出力、デフォルト設定を区別する

スマートフォンで読みやすいように、以下の表は OpenAI と Anthropic に分けています。「最大出力」は1回のレスポンス上限で、コンテキストは入力と出力を合計して利用できるウィンドウであり、毎回同じ長さを出力できるという意味ではありません。API モデル ID は、請求や評価設定の確認にそのまま使えます。

OpenAI 仕様 GPT-6 Sol GPT-6 Astra
API モデル ID gpt-6-sol gpt-6-astra
公式位置づけ コストと能力のバランス 最も複雑なエンドツーエンドタスク
コンテキストウィンドウ 1,050,000 token 1,050,000 token
1回の最大出力 128,000 token 128,000 token
入力/出力モダリティ テキスト、画像 → テキスト テキスト、画像 → テキスト
推論エフォート none / low / medium / high / xhigh / max low / medium / high / xhigh / max
デフォルトのエフォート medium 公式モデルページに記載なし
知識カットオフ 2026-04-20 2026-04-30
提供状況 API 利用可能 API 利用可能
API モデル ID
GPT-6 Sol
gpt-6-sol
GPT-6 Astra
gpt-6-astra
公式位置づけ
GPT-6 Sol
コストと能力のバランス
GPT-6 Astra
最も複雑なエンドツーエンドタスク
コンテキストウィンドウ
GPT-6 Sol
1,050,000 token
GPT-6 Astra
1,050,000 token
1回の最大出力
GPT-6 Sol
128,000 token
GPT-6 Astra
128,000 token
入力/出力モダリティ
GPT-6 Sol
テキスト、画像 → テキスト
GPT-6 Astra
テキスト、画像 → テキスト
推論エフォート
GPT-6 Sol
none / low / medium / high / xhigh / max
GPT-6 Astra
low / medium / high / xhigh / max
デフォルトのエフォート
GPT-6 Sol
medium
GPT-6 Astra
公式モデルページに記載なし
知識カットオフ
GPT-6 Sol
2026-04-20
GPT-6 Astra
2026-04-30
提供状況
GPT-6 Sol
API 利用可能
GPT-6 Astra
API 利用可能

データ:GPT-6 Sol 公式モデルページ、GPT-6 Astra 公式モデルページ。

Anthropic 仕様 Claude Opus 5.5 Claude Fable 5.1
API モデル ID claude-opus-5-5 claude-fable-5-1
公式位置づけ 長期的な agent コーディングと知識作業 より高難度の推論と長期的な agent 作業
コンテキストウィンドウ 1,000,000 token 1,000,000 token
1回の最大出力 128,000 token;Batch beta では 300,000 まで 128,000 token
入力/出力モダリティ テキスト、画像 → テキスト テキスト、画像 → テキスト
推論方式 adaptive thinking、常時有効 adaptive thinking、常時有効
デフォルトのエフォート medium high
知識カットオフ 2026-06 2026-06
提供状況 Claude API 利用可能 Claude API 利用可能
API モデル ID
Claude Opus 5.5
claude-opus-5-5
Claude Fable 5.1
claude-fable-5-1
公式位置づけ
Claude Opus 5.5
長期的な agent コーディングと知識作業
Claude Fable 5.1
より高難度の推論と長期的な agent 作業
コンテキストウィンドウ
Claude Opus 5.5
1,000,000 token
Claude Fable 5.1
1,000,000 token
1回の最大出力
Claude Opus 5.5
128,000 token;Batch beta では 300,000 まで
Claude Fable 5.1
128,000 token
入力/出力モダリティ
Claude Opus 5.5
テキスト、画像 → テキスト
Claude Fable 5.1
テキスト、画像 → テキスト
推論方式
Claude Opus 5.5
adaptive thinking、常時有効
Claude Fable 5.1
adaptive thinking、常時有効
デフォルトのエフォート
Claude Opus 5.5
medium
Claude Fable 5.1
high
知識カットオフ
Claude Opus 5.5
2026-06
Claude Fable 5.1
2026-06
提供状況
Claude Opus 5.5
Claude API 利用可能
Claude Fable 5.1
Claude API 利用可能

データ:Opus 5.5 公式モデルページ、Fable 5.1 公式モデルページ。Opus の 300K 出力は、指定された Batch beta と output-300k-2026-03-24 header にのみ適用され、通常の対話リクエストの上限ではありません。

4モデルの課金:通常入力、キャッシュ書き込み、キャッシュヒットは異なる token

以下の表はすべて100万 token あたりの米ドル価格で、対応する token カテゴリの単価です。通常入力には「キャッシュ書き込み費」は上乗せされません。書き込み価格が適用されるのは、初めてキャッシュに書き込まれる token だけです。キャッシュヒット後は読み取り価格で課金され、出力は別途課金されます。両社とも Batch の入力/出力に 50% 割引がありますが、Batch は非同期処理であり、即時フィードバックが必要なコーディング対話には向きません。

OpenAI 標準 API GPT-6 Sol GPT-6 Astra
通常入力 $2.00 $10.00
キャッシュ書き込み $2.50 $12.50
キャッシュ読み取り $0.20 $1.00
出力 $10.00 $50.00
Batch 入力/出力 $1.00 / $5.00 $5.00 / $25.00
入力が 272K を超える場合 リクエスト全体の入力およびキャッシュ費 ×2、出力費 ×1.5 リクエスト全体の入力およびキャッシュ費 ×2、出力費 ×1.5
通常入力
GPT-6 Sol
$2.00
GPT-6 Astra
$10.00
キャッシュ書き込み
GPT-6 Sol
$2.50
GPT-6 Astra
$12.50
キャッシュ読み取り
GPT-6 Sol
$0.20
GPT-6 Astra
$1.00
出力
GPT-6 Sol
$10.00
GPT-6 Astra
$50.00
Batch 入力/出力
GPT-6 Sol
$1.00 / $5.00
GPT-6 Astra
$5.00 / $25.00
入力が 272K を超える場合
GPT-6 Sol
リクエスト全体の入力およびキャッシュ費 ×2、出力費 ×1.5
GPT-6 Astra
リクエスト全体の入力およびキャッシュ費 ×2、出力費 ×1.5

出典:Sol、Astra、OpenAI 価格表、OpenAI キャッシュ説明。272 超えは超過分だけが値上げされるのではありません。ラインを超えるかどうかの課金は、キャッシュ関連入力を含むリクエスト全体の入力 token で計算されます。

Anthropic 標準 API Claude Opus 5.5 Claude Fable 5.1
通常入力 $4.00 $10.00
5分キャッシュ書き込み $5.00 $12.50
1時間キャッシュ書き込み $8.00 $20.00
キャッシュ読み取り $0.20 $0.25
出力 $20.00 $50.00
Batch 入力/出力 $2.00 / $10.00 $5.00 / $25.00
1M 長コンテキスト 標準単価、>200K の割増なし 標準単価、>200K の割増なし
通常入力
Claude Opus 5.5
$4.00
Claude Fable 5.1
$10.00
5分キャッシュ書き込み
Claude Opus 5.5
$5.00
Claude Fable 5.1
$12.50
1時間キャッシュ書き込み
Claude Opus 5.5
$8.00
Claude Fable 5.1
$20.00
キャッシュ読み取り
Claude Opus 5.5
$0.20
Claude Fable 5.1
$0.25
出力
Claude Opus 5.5
$20.00
Claude Fable 5.1
$50.00
Batch 入力/出力
Claude Opus 5.5
$2.00 / $10.00
Claude Fable 5.1
$5.00 / $25.00
1M 長コンテキスト
Claude Opus 5.5
標準単価、>200K の割増なし
Claude Fable 5.1
標準単価、>200K の割増なし

出典:Opus 5.5、Fable 5.1、Anthropic の価格と Batch/キャッシュ規則、長いコンテキストの説明。Anthropic は Batch とキャッシュ割引の併用を明確に認めています。キャッシュヒットには、対応する有効期間と同じプレフィックスの条件を満たす必要があります。

同一評価体系における4モデルの具体的なスコア

以下の表はすべて Artificial Analysis Intelligence Index v4.3.2 によるものです。テスト設定は GPT-6 Sol max、GPT-6 Astra max、Claude Opus 5.5 と Fable 5.1 はいずれも adaptive reasoning max effort で、default fallback を有効にしています。これらは4モデルのデフォルト設定ではありません。特に Opus のデフォルトは medium、Fable のデフォルトは high です。異なるモデルがどちらも max と表示されていても、実際の推論 token 使用量は異なります。AA はタスクと独自 harness を統一しているため、このテスト設定内で横比較できます。ベンダー発表のスコアをこの表に混ぜることはできません。リンク:Sol–Opus の元の比較、Astra–Fable の元の比較、AA の方法。

AA 総合とエンジニアリングタスク Sol Opus 5.5 Astra Fable 5.1
総合指数 v4.3.2(点) 48 58 53 53
Terminal-Bench 4.0(合格率) 44% 60% 59% 52%
AutomationBench-AA(成功率) 62% 70% 68% 59%
SciCode(合格率) 58% 67% 56% 63%
AA-LCR v1.1 長コンテキスト(合格率) 84% 85% 81% 85%
総合指数 v4.3.2(点)
Sol
48
Opus 5.5
58
Astra
53
Fable 5.1
53
Terminal-Bench 4.0(合格率)
Sol
44%
Opus 5.5
60%
Astra
59%
Fable 5.1
52%
AutomationBench-AA(成功率)
Sol
62%
Opus 5.5
70%
Astra
68%
Fable 5.1
59%
SciCode(合格率)
Sol
58%
Opus 5.5
67%
Astra
56%
Fable 5.1
63%
AA-LCR v1.1 長コンテキスト(合格率)
Sol
84%
Opus 5.5
85%
Astra
81%
Fable 5.1
85%

各行の数値の出典は、上記の2つの AA 同バージョンモデル比較ページと Astra–Fable ページです。たとえば AA 自身の Terminal-Bench 4.0 harness では、Opus 5.5 は Sol より 16 パーセントポイント高いですが、これは Anthropic 公式サイトの 66.4% と混ぜて計算することはできません。後者は実行設定が異なります。

AA 知識と専門タスク Sol Opus 5.5 Astra Fable 5.1
AA-Briefcase v1.1(Elo) 1483 1822 1569 1678
GDPval-AA v2.1(Elo) 1487 1846 1542 1735
Humanity's Last Exam(合格率) 48% 61% 55% 59%
GDP.pdf(全体合格率) 25% 26% 31% 26%
CritPt(合格率) 31% 32% 32% 30%
AA-Omniscience(指数スコア、パーセントではない) 27 46 43 43
AA-Briefcase v1.1(Elo)
Sol
1483
Opus 5.5
1822
Astra
1569
Fable 5.1
1678
GDPval-AA v2.1(Elo)
Sol
1487
Opus 5.5
1846
Astra
1542
Fable 5.1
1735
Humanity's Last Exam(合格率)
Sol
48%
Opus 5.5
61%
Astra
55%
Fable 5.1
59%
GDP.pdf(全体合格率)
Sol
25%
Opus 5.5
26%
Astra
31%
Fable 5.1
26%
CritPt(合格率)
Sol
31%
Opus 5.5
32%
Astra
32%
Fable 5.1
30%
AA-Omniscience(指数スコア、パーセントではない)
Sol
27
Opus 5.5
46
Astra
43
Fable 5.1
43

各行の数値の出典:AA Sol–Opus、AA Astra–Fable。1~2 パーセントポイントの小さな差は、確固たる勝敗として解釈すべきではありません。Elo、指数スコア、合格率も同じ単位ではありません。

AA テストコストと使用量 Sol Opus 5.5 Astra Fable 5.1
指数タスク1件あたりの平均コスト $1.06 $5.98 $3.26 $7.63
タスク1件あたりの平均出力 token 31K 119K 27K 78K
うち推論 token 21K 84K 17K 47K
指数タスク1件あたりの平均コスト
Sol
$1.06
Opus 5.5
$5.98
Astra
$3.26
Fable 5.1
$7.63
タスク1件あたりの平均出力 token
Sol
31K
Opus 5.5
119K
Astra
27K
Fable 5.1
78K
うち推論 token
Sol
21K
Opus 5.5
84K
Astra
17K
Fable 5.1
47K

出典は引き続き AA Sol–Opus および AA Astra–Fable です。タスクコストは AA テスト使用量の加重平均であり、あなたのリポジトリで「1つの要件を完了する」ための見積もりではありません。Opus の max 設定はより多くの出力と推論 token を消費します。これも、請求額の差が単価の差より大きくなる理由の1つです。

両社公式サイトのグラフ:それぞれの結論は検証できるが、同一条件の勝敗には組み合わせられない

OpenAI の DeepSWE v1.1 図では GPT-6 Sol max が 68.8%、図中の Claude Fable 5 の xhigh が 69.9% です。Opus 5.5 はありません。横軸はタスクあたりのコストで、対数目盛です。図中の Opus 5 も Opus 5.5 ではありません。これは Sol が OpenAI 公開の設定で上位モデルに近いコーディング agent スコアを持つことを示しますが、4モデル同一条件テストの代わりにはなりません。

OpenAI 公式 DeepSWE v1.1 図:GPT-6 Sol max は 68.8%、図に Opus 5.5 はない

図 1:OpenAI《Introducing GPT-6 Sol and Luna》“Coding”、2026-09-22。モデルと effort は凡例および原文脚注に準じます。完全な原図を開いて細かい文字を見る。

Anthropic の Terminal-Bench 4.0 図では Claude Opus 5.5 xhigh が 66.4% です。図中の GPT-6 Astra 57.9% は high を使用しており、GPT-6 Sol ではありません。曲線にはデフォルト effort の点もありますが、その位置を xhigh のスコアとして扱うことはできません。ここでのベンダー harness は AA 上の表の Terminal-Bench 4.0 とは異なり、66.4% から AA が Sol に与えた 44% を引くことはできません。

Anthropic 公式 Terminal-Bench 4.0 図:Opus 5.5 xhigh は 66.4%、図に GPT-6 Sol はない

図 2:Anthropic《Claude Opus 5.5》“Coding”、2026-09-22。横軸は試行あたりのコストで、対数目盛です。図示された設定、統計間、制限は原文を参照してください。完全原図を開いて細かい文字を見る。

また、ベンダーが方的に公表しており、直接引き算するべきではないスコアもあります。OpenAI は Solxhigh の AutomationBench 1.0.6 が **33.2%**、max の Agents' Last Exam V1 が **56.4%**、xhigh` の OSWorld 2.0 offline が 60.5% と報告しており、出典は同じ OpenAI リリースページ です。Anthropic は Opus 5.5 の FrontierCode v1.1 Main 54.4%、CursorBench 4.0 57.8%、GDPval-AA v2.1 1846 Elo、Humanity's Last Exam with tools 67.7% を報告しており、出典は同じ Anthropic リリースページ です。これらの項目は、バージョン、ツール、effort、harness が相手側と一致していることが確認されていないため、「どれだけリードしているか」は記載しません。未公表の4モデル同一条件の値は推測で補えません。

同じタスク量でいくらかかるか?再計算可能な5つの例

以下では、入力を通常、初回キャッシュ書き込み、以降のキャッシュ読み取りという相互排他的な3種類の token に分け、さらに出力を加えます。各行は1回のリクエストで、ツール呼び出し、プラットフォーム追加料金、追加ターンは含みません。出力はいずれも通常リクエストの 128K 上限未満です。価格は上記の公式価格で計算しているため、自分の usage ログに合わせて token 数を置き換えられます。

シナリオと token 使用量 Sol Opus 5.5 Astra Fable 5.1
A 通常:100K 新規入力 + 50K 出力 $0.70 $1.40 $3.50 $3.50
B 初回キャッシュ書き込み:200K 書き込み + 50K 新規入力 + 20K 出力 $0.80 $1.60(5m)/ $2.20(1h) $4.00 $4.00(5m)/ $5.50(1h)
C 以降のヒット:200K キャッシュ読み取り + 50K 新規入力 + 20K 出力 $0.34 $0.64 $1.70 $1.55
D A の Batch 非同期版:100K 新規入力 + 50K 出力 $0.35 $0.70 $1.75 $1.75
E 長い入力:300K 新規入力 + 20K 出力 $1.50 $1.60 $7.50 $4.00
A 通常:100K 新規入力 + 50K 出力
Sol
$0.70
Opus 5.5
$1.40
Astra
$3.50
Fable 5.1
$3.50
B 初回キャッシュ書き込み:200K 書き込み + 50K 新規入力 + 20K 出力
Sol
$0.80
Opus 5.5
$1.60(5m)/ $2.20(1h)
Astra
$4.00
Fable 5.1
$4.00(5m)/ $5.50(1h)
C 以降のヒット:200K キャッシュ読み取り + 50K 新規入力 + 20K 出力
Sol
$0.34
Opus 5.5
$0.64
Astra
$1.70
Fable 5.1
$1.55
D A の Batch 非同期版:100K 新規入力 + 50K 出力
Sol
$0.35
Opus 5.5
$0.70
Astra
$1.75
Fable 5.1
$1.75
E 長い入力:300K 新規入力 + 20K 出力
Sol
$1.50
Opus 5.5
$1.60
Astra
$7.50
Fable 5.1
$4.00

計算例:A の Sol = 0.1×$2 + 0.05×$10 = $0.70。B の Opus 5m = 0.2×$5 + 0.05×$4 + 0.02×$20 = $1.60;C の Opus = 0.2×$0.20 + 0.05×$4 + 0.02×$20 = $0.64。E の Sol は入力 300K がすでに 272K を超えているため、リクエスト全体を $4 入力、$15 出力で計算します。Astra は対応して $20/$75 です。Opus/Fable の 1M コンテキストは標準単価のままです。B と C は先に書き込み、後で読み取る別々のリクエストです。C ではキャッシュがまだ有効であることを確認する必要があります。OpenAI のキャッシュ保持期間と Anthropic の 5m/1h 課金メカニズムは異なるため、B の書き込み費を C の各リクエストに誤って加えてはいけません。根拠:OpenAI の2モデル価格、Anthropic の価格規則。

実際のコーディングワークフローに置く場合、どう分担するか?

Sol にはまず日常の反復作業を担当させる。 要件の分解、既存リポジトリの小さな変更、テストパッチ、バッチでレビューできる作業は、まず Sol に処理させ、その後でタスク成功率、手戻り回数、総 token を記録します。その低単価は、A~D のような 272K を超えない例で最も直接的に効きます。超長リクエストでは価格優位が小さくなります。

Opus 5.5 には、一度で収束しにくい agent タスクを担当させる。 AA の同一条件テストでは、総合、ターミナル、知識作業でより高いスコアを出していますが、max 設定ではタスク1件あたりの平均コストも明らかに高くなります。まずデフォルトの medium または実際に使う effort でローカルベースラインを作り、難しい問題で設定を上げるのがよいでしょう。AA の max の結果をデフォルト体験と見なしてはいけません。

Astra と Fable 5.1 は上位を探る設定です。 Astra は AA の AutomationBench-AA、Terminal-Bench 4.0、GDP.pdf で競争力のある成績を示し、Fable 5.1 は長期的な知識作業の一部指標でより強くなっていますが、両者とも $10/$50 の基本入力/出力価格は Sol より大幅に高いです。Fable のキャッシュ読み取りは $0.25 で、Astra の $1.00 より低くなっています。大きなプレフィックスを繰り返し読む場合、コスト順位が変わる可能性があります。高難度タスクでは、同じリポジトリ要件に対して4モデルの小サンプル検収を行い、「正常に完了しマージ可能なタスクのコスト」で選ぶことをおすすめします。単一のランキングスコアで選ばないでください。

PandaNpc では、Codex と Claude Code が利用可能な2つの Agent Engine です。入口を選ぶ際には、既存のサブスクリプションまたは API チャネル、ツール権限、リポジトリのコンテキスト、チームのレビュープロセスも考慮する必要があります。モデル API の価格を、ツールのサブスクリプション枠に直接換算することはできません。本記事で示しているのは公開仕様と評価であり、PandaNpc 内での4モデルの実測ランキングを主張するものではありません。

FAQ

Sol は必ず Opus 5.5 より半額ですか? 標準 API の入力・出力単価がそれぞれ半分であるだけです。272K を超える入力、キャッシュの書き込み・読み取り、実際の推論 token、ターン数、ツール費によって、タスク全体の請求額は変わります。上記シナリオ E では、両者の1回あたりの価格が $1.50 と $1.60 に近づいています。

公式の2つのコーディング図は、どちらが勝つかを証明できますか? できません。OpenAI の図には Opus 5.5 がなく、Anthropic の図には Sol がなく、ベンチマークと harness も異なります。4モデル同一条件の結果を見るには、AA v4.3.2 の固定設定表を参照してください。自分のツール選定を決めるには、自分のリポジトリタスクを再実行する必要があります。

キャッシュと Batch は併用できますか? Anthropic の価格ドキュメントは併用を明確に認めています。実際にキャッシュヒットするかは、プレフィックス、有効期間、リクエスト設定によります。OpenAI の2モデルの Batch は標準料金の 50% です。具体的な請求額は、対応する API 使用記録で確認してください。

GPT-6 Astra vs Claude Fable 5.1:プログラミング、Agent、価格とベンチマーク比較

GPT-6 Astra vs Claude Fable 5.1:プログラミング、Agent、価格とベンチマーク比較

GPT-6 Astra と Claude Fable 5.1 はどちらも一般公開されており、いずれも100万トークンあたり入力10ドル・出力50ドルのフラッグシップモデルですが、プログラミング、コンピューター操作、長時間タスク、キャッシュコスト、コンテキストの面でそれぞれ一長一短があります。本稿では共通のベンチマークで項目ごとに比較し、タスクに応じたモデル選択の方法を示します。

記事を読む →
Codex で GPT-5.6 Sol 1M コンテキストを有効化:3行の `config.toml` 設定チュートリアル

Codex で GPT-5.6 Sol 1M コンテキストを有効化:3行の `config.toml` 設定チュートリアル

GPT-5.6 Sol は公式に 105 万トークンのコンテキストをサポートしています。Codex の config.toml の先頭に 3 行の設定を追加するだけで、100 万ウィンドウで実行でき、約 90 万トークンで履歴が自動的に圧縮されます。永久設定、単発コマンド、検証、コストの注意事項が付属しています。

記事を読む →
Claude Fable 5.1 徹底解説:ベンチマーク、改善点、価格と速度

Claude Fable 5.1 徹底解説:ベンチマーク、改善点、価格と速度

Claude Fable 5.1 の7つの主要ベンチマークにおける完全なスコアを、Fable 5、Opus 5、GPT-5.6 Sol と項目別に比較し、5.1 の長いタスク、ツール呼び出し、キャッシュ費用、速度、プラン制限、移行の変更についても説明する。

記事を読む →