Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1 如何選擇?可用性、價格與適用場景對比
截至2026年9月30日,Gemini 4 Argon只限可信測試者使用,供應有限;已可選的GPT-6 Astra與Claude Fable 5.1應按任務與方案揀選,而API價格與訂閱費分開列示,以上根據官方公開資料整理,並非同一條件測試,亦不代表各地區均可使用。

資料核查:2026 年 9 月 30 日(UTC)。 PandaNpc 提供 AI Agent 服務,與模型選型相關。本文整理三間公司公開的資訊,並給出按任務選擇的建議;我們尚未取得 Gemini 4 Argon 的試用權限,沒有做三款模型的同條件實測。下文的「適合」指官方定位與目前可用性,不代表我們測出誰更強。
先講結論:今日就要用,先在 GPT-6 Astra 和 Claude Fable 5.1 之間按任務與現有方案選擇;Gemini 4 Argon 目前只向少量可信測試者開放,普通用戶仍未能將它當作隨時可選的第三項。 做跨軟件操作、複雜資料整理或高難度編程,可以先試 Astra;長期編程、反覆閱讀大型項目或複雜文件,可以先試 Fable 5.1。等 Argon 普遍開放後,再用相同任務比較實際完成質素與總開支。
先看能否使用:三款模型並不在同一條起跑線
| 模型 | 官方發佈日期 | 截至 9 月 30 日誰可使用 | 對一般讀者有何意義 |
|---|---|---|---|
| Gemini 4 Argon | 2026-09-30 | 先向 Google Fairwind 項目的可信網絡防禦者與測試者開放;開發者、企業及消費者的廣泛開放尚待後續階段 | 今日見到「已發佈」,不等於你的 Gemini 帳號或 API 已可以選擇 Argon |
| GPT-6 Astra | 2026-09-03 | 已向 ChatGPT 付費用戶及 API 用戶分階段推出,具體可用額度取決於方案和帳號 | 可以檢查自己的模型列表與使用額度,立即開始實際任務 |
| Claude Fable 5.1 | 2026-09-01 | Claude 付費方案及 Claude API 可用,但 Pro 等方案可能需要額外使用積分 | 先查方案的 Fable 使用規則,再決定是否升級或另付費 |
Google 的 Gemini 4 Argon 公告寫明目前屬小範圍開放,未來計劃由付費 API 用戶和 Google AI Ultra 訂閱者開始擴大;沒有公佈普通用戶可使用的確定日期。OpenAI 的 Astra 公告和Anthropic 的 Fable 5.1 說明分別說明現有開放範圍。這裡的 Astra 是 OpenAI 模型,不是 Google 的 Project Astra 研究項目。
參數對照:不要將「能讀多少」與「能寫多少」混為一談
輸入上下文窗口是一次可以交給模型多少資料;最大輸出是它一次最多可以生成多少內容。這兩個數字不能互換,也不能單憑數字判斷答案質素。以下均為 2026 年 9 月 30 日核到的具體型號資訊,而非 Gemini、GPT 或 Claude 全家族的通用規格。
| 參數 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| 輸入上下文窗口 | 正式上限未公佈 | 1,050,000 token | 1,000,000 token |
| 單次最大輸出 | Google 公告稱 1,000,000 token;普通用戶尚無法驗證 | 128,000 token | 128,000 token |
| 可交給模型的輸入 | 公告展示多模態與長影片理解,但完整 API 輸入類型清單未公佈 | 文字、圖片 | 文字、圖片 |
| 目前正式入口 | Fairwind 可信測試者;廣泛開放時間未公佈 | ChatGPT 付費帳號按推出進度與方案、OpenAI API | Claude 付費產品與 Claude API;Pro 等方案有額外積分條件 |
來源:Google 的 Gemini 4 Argon 公告、OpenAI 的 GPT-6 Astra 型號頁、Anthropic 的 Claude Fable 5.1 型號頁與Anthropic 的方案說明。Google 公告的「100 萬」說的是輸出上限,不能當成 Argon 已公佈「100 萬輸入上下文窗口」。Argon 的完整公開型號卡和普通用戶實測仍待發佈;表中「未公佈」不是「沒有這項能力」。
上表比較的是公開規格,不是性能勝負:可容納的內容越多,未必回答越準確。下表才是性能基準成績。
官方跑分對比:看具體任務,不要算「總冠軍」
Google DeepMind 在 Gemini 4 Argon 官方型號頁公佈了一張四模型跑分表。這裡只摘出本文討論的 Argon、GPT-6 Astra、Claude Fable 5.1 三列;原表還包括 Claude Opus 5.5。以下成績來自 2026 年 9 月 30 日 23:42 UTC 實際讀取到的 Google 官網頁面,由 Google 彙編,並非 PandaNpc 的同條件實測。除註明 F1、通過率或部分得分的行外,數值沿用原表百分比;每行只在這三款模型中把較高值加粗。「—」表示原表沒有可比成績,不是 0 分。
| 能力分組 | Benchmark(測試項目) | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| 知識工作 | Vals Index | 68.9% | 63.1% | 65.8% |
| 知識工作 | AutomationBench | 51.3% | 41.4% | 31.4% |
| 知識工作 | Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% |
| 知識工作 | Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 6.7% |
| 自動編程 | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% |
| 自動編程 | FrontierSWE v2 | 55.0% | 65.5% | 56.3% |
| 自動編程 | Vibe Code Bench | 91.9% | 89.6% | 90.3% |
| 自動編程 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% |
| 機器學習工程 | PostTrainBench | 45.3% | 44.3% | 40.2% |
| 科學與數學 | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% |
| 科學與數學 | LABBench 2 | 88.8% | 85.4% | 68.6% |
| 科學與數學 | RiemannBench | 76.0% | 72.0% | 65.6% |
| 長文本 | GraphWalks(≤128K,BFS F1) | 99.7% | 98.7% | 91.4% |
| 長文本 | GraphWalks(256K–1M,BFS F1) | 84.2% | 71.8% | 65.0% |
| 電腦操作 | Agent's Last Exam(通過率) | 39.5% | 34.2% | — |
| 電腦操作 | OSWorld-2.0(離線子集,部分得分) | 69.2% | 72.6% | — |
| 圖文理解 | Chartography | 71.6% | 71.0% | 46.2% |
| 影片理解 | LVBench | 91.7% | 87.5% | 79.7% |
| 防禦性安全 | CWE-bench v1 | 68.0% | 68.0% | 58.0% |
這張表怎樣用? 如果你做知識工作,可先看 Vals Index、Finance Agent;寫程式可同時看 DeepSWE、FrontierSWE 與 Terminal-bench,不要只挑一行:Argon 在 DeepSWE 領先,但 Astra 在 FrontierSWE 與 Terminal-bench 更高。做電腦操作要特別留意,Fable 在這張 Google 表中的兩行是缺失,不能因此說它不會操作電腦。CWE-bench 顯示 Argon 與 Astra 在三者中並列;這也不是對真實安全工作的保證。
測試口徑: Google 的評測方法說明寫明,Argon 的成績通常為單次嘗試、最高思考檔位;其他模型的數據多來自各供應商自報或公開榜單,也可能採用各自最高或可獲得的思考檔位。部分項目由 Google 自行跑,部分來自第三方,工具環境和取樣方法並非處處相同。例如 DeepSWE 與 Terminal-bench 的 Argon 成績是 Google 自測,其他模型用公開成績;LVBench 對不同模型抽取的影片幀數不同。GraphWalks 行用的是 BFS F1,OSWorld 行只代表離線子集的「部分得分」。不能跨行求平均、不能據此宣稱統一測試條件下的綜合第一。這份方法 PDF 的結果頁另寫「截至 2026 年 10 月」,與本文 9 月 30 日讀取到表格的時間不一致;具體評測完成日未能確認。本文僅轉錄當時官網可見的成績,不推斷評測何時完成,也不把它說成我們復現的結果。
價格如何比較:月費與 API 費用要分開
如果只想在聊天產品或編程工具中使用,先看訂閱與使用額度。美國公開價格中,ChatGPT Plus 為 $20/月,Pro 分為 $100、$200、$500/月等檔位;具體 Astra 用量隨方案和任務而變。OpenAI 的 ChatGPT Work/Codex 價格與用量說明明確提醒:API 每百萬 token 的報價不能拿來推算訂閱內可以完成多少任務。
Claude Pro 美國月付價為 $20,Max 由 $100/月起(Claude 官方價格表)。但「Pro 可以選 Fable 5.1」不表示 Fable 已包含在 Pro 常規額度內:Anthropic 的 Fable 方案規則說明,Pro 與 Team 標準席位使用 Fable 5.1 要走額外 usage credits;Max 與高級席位可在每週額度的一部分內使用。Google 尚未提供普通用戶使用 Argon 的實際訂閱價格或開放日期,不能將 Google AI Ultra 的現有月費當作「今日買 Argon」的報價。
如果透過 API 按使用量付費,下面才是可以用同一單位閱讀的標準文字報價。輸入指你交給模型閱讀的內容,輸出指它生成的回答。單位都是每 100 萬 token 的美元價格(token 是計費時拆分文字等內容的單位);表中的 Argon 是 Google 公佈的未來上線價格,不是我們今日已經支付的實測帳單。
| 模型 | 普通輸入 | 普通輸出 | 重複內容的快取讀取 | 狀態 |
|---|---|---|---|---|
| Gemini 4 Argon | 首發擬定 $2;優惠期後 $4 | 首發擬定 $10;優惠期後 $20 | Google 稱首發快取輸入按普通輸入價優惠 95%;具體上線規則待核 | 尚未廣泛開放 |
| GPT-6 Astra | $10 | $50 | $1 | 目前 API 標準價格 |
| Claude Fable 5.1 | $10 | $50 | $0.25 | 目前 API 標準價格 |
數據來自Google 的 Argon 發佈公告、OpenAI 的 Astra 模型價格頁及Anthropic 的 Fable 5.1 模型頁。價格不含額外工具、地區、速度檔位或平台差異;Astra 在單次輸入超過 272K token時,對整個請求的輸入與快取價格按 2 倍、輸出按 1.5 倍計價。快取價只適用於實際命中快取的內容,不能把整份任務都按快取價估算。即使 Argon 的擬定單價低於另外兩款,沒有同任務成功率與用量數據,也不能斷言它完成一個任務最便宜。

圖:AI 生成的計費口徑示意,不是產品帳單;訂閱月費不能與 API 單價混算。查看原尺寸圖(1672×941)。
按任務如何選擇?先用手頭上可用的模型
任務要跨多個軟件,或需要瀏覽網頁、操作介面並做複雜判斷:先試 GPT-6 Astra。 OpenAI 將電腦操作、瀏覽、高難度編程和專業文件列為它的重點能力。如果你已有合適的 ChatGPT 付費帳號或 API 權限,今日就可以將一個真實任務交給它,看結果是否達到要求。OpenAI 模型說明。
任務是持續數小時的編程、程式碼審查或大型文件工作:先試 Claude Fable 5.1。 Anthropic 將它定位於長時間自主任務、複雜編程與研究。已有 Claude Code 工作流的人可以先沿用熟悉的工具,但要先確認方案是否另扣使用積分;若每日要跑很多此類任務,再比較 Max 與 API 的真實成本。Anthropic 模型說明。
想嘗試 Gemini 4 Argon:先確認自己是否獲得官方存取權限。 Google 公佈的方向包括複雜編程、企業知識工作與防禦性安全任務,並給出擬定價格;這些值得關注,但還不能替代普通用戶的實測體驗。沒有權限時,不建議為了 Argon 的「預期更便宜」改變正在運行的工作流。Google 官方公告。
這些建議不是「模型擅長一類任務就只能做這一類」。如果三款將來都可用,最穩妥的選擇方法是:拿同一份真實任務,給相同的資料和驗收標準,分別記錄是否完成、人工返工、耗時與總費用。一次漂亮的示範或不同廠商各自的跑分,不能直接證明你的任務也會得到同樣結果。

圖:AI 生成的選擇路徑示意,先看帳號與地區可用性,再看任務需求,最後用自己的小任務驗證。圖中的「本文不進行任何對比測試」是指我們未自行運行同條件測試;上文跑分表是轉錄 Google 公佈的數據。查看原尺寸圖(1672×941)。
如果你的任務是讓兩個編程助手分工,可看Claude Code 與 Codex 協作教學;如果要將具體問題交給已登入的 ChatGPT Pro 頁面,可看Codex 和 Claude Code 向 ChatGPT Pro 求助教學。這兩篇介紹工作流操作,不表示 Gemini 4 Argon 已接入 PandaNpc。
常見問題(FAQ)
Gemini 4 Argon 已經正式發佈,為何我找不到?
「發佈」指 Google 公佈了模型並向有限範圍開放;官方公告尚未給出所有開發者和普通消費者的統一開放日期。先查看自己使用的 Gemini 產品與帳號的正式模型列表,不要將傳聞中的「Gemini 4 Pro」當作 Argon 的可用入口。
Astra 是 Google 的 Project Astra 嗎?
不是。本文的 GPT-6 Astra 是 OpenAI 的模型;Google Project Astra是另一項研究項目,不能混在三模型價格表中。
訂了 Claude Pro,就可以在方案額度內使用 Fable 5.1 嗎?
不一定。Anthropic 的現行方案說明表示,Pro 使用 Fable 5.1 需要 usage credits,而 Max 等部分方案可在限定的每週額度內使用。付款前先看自己的「使用量/積分」頁面。
可以直接根據上面的價格判定誰最划算嗎?
不能。API 表只比較標價;完成任務時還會受輸入長度、重複內容是否命中快取、工具費用、運行輪數和返工影響。尤其 Argon 尚未廣泛開放,無法給出我們自己的「每個成功任務成本」。
相關指南

GPT-6 Sol vs Claude Opus 5.5:價格、跑分與編程任務如何選擇?
一般 API 編程任務,先試 GPT-6 Sol;複雜任務可對比 Claude Opus 5.5,再將 GPT-6 Astra 同 Claude Fable 5.1 作為高難度選項。本文核對四個模型嘅官方規格、快取同 Batch 價格、同口徑第三方跑分,並提供五組可複算費用情境。
閱讀文章 →
Claude Code vs Codex:功能、遠端控制、權限與使用場景怎麼選(2026)
先說結論:重視深度終端、Hooks 和 Claude 生態,選 Claude Code;重視 ChatGPT 帳號、雲端任務和桌面多 Agent,選 Codex;要跨 Windows、macOS、Linux 與手機統一遙控兩者,選 PandaNpc。
閱讀文章 →
用 PandaNpc 讓 Codex 和 Claude Code 調用 ChatGPT Pro
在 PandaNpc 的 Codex 或 Claude Code 對話裡,可以把一個具體問題交給已登入的 ChatGPT Pro 網頁,回答會回到原對話。本文用英文介面截圖講清準備、開啟、派工、查看結果與自動傳送的選擇,並標明示範數據的範圍。
閱讀文章 →