GPT-6 Sol vs Claude Opus 5.5: Chọn theo giá, điểm số và tác vụ lập trình như thế nào?

Với các tác vụ lập trình API thông thường, hãy thử GPT-6 Sol trước; với tác vụ phức tạp, có thể so sánh Claude Opus 5.5, sau đó dùng GPT-6 Astra và Claude Fable 5.1 làm các lựa chọn cho độ khó cao. Bài viết này kiểm tra thông số chính thức của bốn mô hình, giá bộ nhớ đệm và Batch, điểm benchmark bên thứ ba cùng tiêu chuẩn, đồng thời cung cấp năm nhóm tình huống chi phí có thể tính lại.

PandaNpcLần đầu xuất bản
GPT-6 Sol vs Claude Opus 5.5: Chọn theo giá, điểm số và tác vụ lập trình như thế nào?

Xem kết luận trước: Với tác vụ lập trình API thông thường, có thể thử GPT-6 Sol trước. Giá đầu vào/đầu ra tiêu chuẩn là $2/$10 mỗi triệu token, đều bằng một nửa của Claude Opus 5.5; dưới cấu hình cao nhất của cùng hệ thống đánh giá Artificial Analysis (AA), chỉ số tổng hợp của Opus 5.5 là 58, còn Sol là 48. Hai mô hình không phải quan hệ “cùng giá thì mạnh hơn”: trước tiên hãy dùng tác vụ trong kho mã của chính bạn để so sánh tỷ lệ đạt trong một lần, số lượt, tổng token và việc làm lại thủ công, rồi mới quyết định có trả tiền cho thành tích cao hơn của Opus hay không. Với tác vụ dài hạn khó hơn, có thể cân nhắc GPT-6 Astra hoặc Claude Fable 5.1; đơn giá và năng lực của bốn mô hình không xếp theo cùng một thứ tự.

Chúng tôi vận hành PandaNpc hỗ trợ Codex và Claude Code, nên có bối cảnh sử dụng sản phẩm; bài viết này chưa hoàn thành thử nghiệm cùng đề cho bốn mô hình, và cũng không coi các đánh giá khai dưới đây là thử nghiệm của trang này. Giá là chi phí API mô hình, không phải giá đăng ký công cụ. Thông tin được kiểm tra vào ngày 23 tháng 9 năm 2026, đơn vị tiền tệ đều là USD.

Thông số của bốn mô hình: phân biệt dung lượng, đầu ra và mức mặc định trước

Để tiện đọc trên điện thoại, bảng dưới đây được nhóm theo OpenAI và Anthropic; “Đầu ra tối đa” là giới hạn mỗi lần phản hồi, còn ngữ cảnh là cửa sổ khả dụng tổng cộng của đầu vào và đầu ra, không có nghĩa là mỗi lần đều có thể xuất ra cùng độ dài. ID mô hình API có thể dùng trực tiếp để đối chiếu hóa đơn hoặc cấu hình đánh giá.

Thông số OpenAI GPT-6 Sol GPT-6 Astra
ID mô hình API gpt-6-sol gpt-6-astra
Định vị chính thức Cân bằng chi phí và năng lực Tác vụ đầu-cuối phức tạp nhất
Cửa sổ ngữ cảnh 1,050,000 token 1,050,000 token
Đầu ra tối đa mỗi lần 128,000 token 128,000 token
Phương thức đầu vào/đầu ra Văn bản, hình ảnh → văn bản Văn bản, hình ảnh → văn bản
Mức suy luận effort none / low / medium / high / xhigh / max low / medium / high / xhigh / max
effort mặc định medium Trang mô hình chính thức không ghi rõ
Cắt kiến thức 2026-04-20 2026-04-30
Trạng thái khả dụng API khả dụng API khả dụng
ID mô hình API
GPT-6 Sol
gpt-6-sol
GPT-6 Astra
gpt-6-astra
Định vị chính thức
GPT-6 Sol
Cân bằng chi phí và năng lực
GPT-6 Astra
Tác vụ đầu-cuối phức tạp nhất
Cửa sổ ngữ cảnh
GPT-6 Sol
1,050,000 token
GPT-6 Astra
1,050,000 token
Đầu ra tối đa mỗi lần
GPT-6 Sol
128,000 token
GPT-6 Astra
128,000 token
Phương thức đầu vào/đầu ra
GPT-6 Sol
Văn bản, hình ảnh → văn bản
GPT-6 Astra
Văn bản, hình ảnh → văn bản
Mức suy luận effort
GPT-6 Sol
none / low / medium / high / xhigh / max
GPT-6 Astra
low / medium / high / xhigh / max
effort mặc định
GPT-6 Sol
medium
GPT-6 Astra
Trang mô hình chính thức không ghi rõ
Cắt kiến thức
GPT-6 Sol
2026-04-20
GPT-6 Astra
2026-04-30
Trạng thái khả dụng
GPT-6 Sol
API khả dụng
GPT-6 Astra
API khả dụng

Dữ li: Trang mô hình chính thức GPT-6 Sol, Trang mô hình chính thức GPT-6 Astra.

Thông số Anthropic Claude Opus 5.5 Claude Fable 5.1
ID mô hình API claude-opus-5-5 claude-fable-5-1
Định vị chính thức Lập trình agentài hạn và công việc tri thức Công việc suy luận khó hơn và agent dài hạn
Cửa sổ ngữ cảnh 1,000,000 token 1,000,000 token
Đầu ra tối đa mỗi lần 128,000 token; Batch beta có thể lên tới 300,000 128,000 token
Phương thức đầu vào/đầu ra Văn bản, hình ảnh → văn bản Văn bản, hình ảnh → văn bản
Cách suy luận adaptive thinking, luôn bật adaptive thinking, luôn bật
effort mặc định medium high
Cắt kiến thức 2026-06 2026-06
Trạng thái khả dụng Claude API khả dụng Claude API khả dụng
ID mô hình API
Claude Opus 5.5
claude-opus-5-5
Claude Fable 5.1
claude-fable-5-1
Định vị chính thức
Claude Opus 5.5
Lập trình agentài hạn và công việc tri thức
Claude Fable 5.1
Công việc suy luận khó hơn và agent dài hạn
Cửa sổ ngữ cảnh
Claude Opus 5.5
1,000,000 token
Claude Fable 5.1
1,000,000 token
Đầu ra tối đa mỗi lần
Claude Opus 5.5
128,000 token; Batch beta có thể lên tới 300,000
Claude Fable 5.1
128,000 token
Phương thức đầu vào/đầu ra
Claude Opus 5.5
Văn bản, hình ảnh → văn bản
Claude Fable 5.1
Văn bản, hình ảnh → văn bản
Cách suy luận
Claude Opus 5.5
adaptive thinking, luôn bật
Claude Fable 5.1
adaptive thinking, luôn bật
effort mặc định
Claude Opus 5.5
medium
Claude Fable 5.1
high
Cắt kiến thức
Claude Opus 5.5
2026-06
Claude Fable 5.1
2026-06
Trạng thái khả dụng
Claude Opus 5.5
Claude API khả dụng
Claude Fable 5.1
Claude API khả dụng

Dữ liệu: Trang mô hình chính thức Opus 5.5, Trang mô hình chính thức Fable 5.1. Đầu ra 300K của Opus chỉ áp dụng cho Batch beta được chỉ định và header output-300k-2026-03-24, không phải giới hạn của yêu cầu tương tác thông thường.

Cách tính phí của bốn mô hình: đầu vào thường, ghi bộ nhớ đệm và trúng bộ nhớ đệm là các token khác nhau

Bảng dưới đây đều là giá USD mỗi triệu token, là đơn giá của loại token tương ứng. Đầu vào thường không cộng thêm “phí ghi bộ nhớ đệm”; chỉ token được ghi vào bộ nhớ đệm lần đầu mới dùng giá ghi. Sau khi trúng bộ nhớ đệm, tính theo giá đọc; đầu ra vẫn được tính riêng. Cả hai hãng đều có ưu đãi 50% cho đầu vào/đầu ra Batch, nhưng Batch là xử lý bất đồng bộ, không phù hợp với hội thoại lập trình cần phản hồi tức thì.

OpenAI API tiêu chuẩn GPT-6 Sol GPT-6 Astra
Đầu vào thường $2.00 $10.00
Ghi bộ nhớ đệm $2.50 $12.50
Đọc bộ nhớ đệm $0.20 $1.00
Đầu ra $10.00 $50.00
Đầu vào/đầu ra Batch $1.00 / $5.00 $5.00 / $25.00
Đầu vào vượt 272K toàn bộ yêu cầu phí đầu vào và bộ nhớ đệm ×2, phí đầu ra ×1.5 toàn bộ yêu cầu phí đầu vào và bộ nhớ đệm ×2, phí ra ×1.5
Đầu vào thường
GPT-6 Sol
$2.00
GPT-6 Astra
$10.00
Ghi bộ nhớ đệm
GPT-6 Sol
$2.50
GPT-6 Astra
$12.50
Đọc bộ nhớ đệm
GPT-6 Sol
$0.20
GPT-6 Astra
$1.00
Đầu ra
GPT-6 Sol
$10.00
GPT-6 Astra
$50.00
Đầu vào/đầu ra Batch
GPT-6 Sol
$1.00 / $5.00
GPT-6 Astra
$5.00 / $25.00
Đầu vào vượt 272K
GPT-6 Sol
toàn bộ yêu cầu phí đầu vào và bộ nhớ đệm ×2, phí đầu ra ×1.5
GPT-6 Astra
toàn bộ yêu cầu phí đầu vào và bộ nhớ đệm ×2, phí ra ×1.5

Nguồn: Sol, Astra, Bảng giá OpenAI, Giải thích bộ nhớ đệm OpenAI. Vượt 272K không phải chỉ tăng giá phần vượt; việc tính phí có vượt mốc hay không được tính theo token đầu vào của toàn bộ yêu cầu, bao gồm đầu vào liên quan đến bộ nhớ đệm.

Anthropic API tiêu chuẩn Claude Opus 5.5 Claude Fable 5.1
Đầu vào thường $4.00 $10.00
Ghi bộ nhớ đệm 5 phút $5.00 $12.50
Ghi bộ nhớ đệm 1 giờ $8.00 $20.00
Đọc bộ nhớ đệm $0.20 $0.25
Đầu ra $20.00 $50.00
Đầu vào/đầu ra Batch $2.00 / $10.00 $5.00 / $25.00
Ngữ cảnh dài 1M Đơn giá tiêu chuẩn, không có phụ phí >200K Đơn giá tiêu chuẩn, không có phụ phí >200K
Đầu vào thường
Claude Opus 5.5
$4.00
Claude Fable 5.1
$10.00
Ghi bộ nhớ đệm 5 phút
Claude Opus 5.5
$5.00
Claude Fable 5.1
$12.50
Ghi bộ nhớ đệm 1 giờ
Claude Opus 5.5
$8.00
Claude Fable 5.1
$20.00
Đọc bộ nhớ đệm
Claude Opus 5.5
$0.20
Claude Fable 5.1
$0.25
Đầu ra
Claude Opus 5.5
$20.00
Claude Fable 5.1
$50.00
Đầu vào/đầu ra Batch
Claude Opus 5.5
$2.00 / $10.00
Claude Fable 5.1
$5.00 / $25.00
Ngữ cảnh dài 1M
Claude Opus 5.5
Đơn giá tiêu chuẩn, không có phụ phí >200K
Claude Fable 5.1
Đơn giá tiêu chuẩn, không có phụ phí >200K

Nguồn: Opus 5.5, Fable 5.1, Quy tắc giá và Batch/bộ nhớ đệm của Anthropic, Giải thích ngữ cảnh dài. Anthropic cho phép rõ ràng cộng dồn ưu đãi Batch và bộ nhớ đệm; trúng bộ nhớ đệm phải đáp ứng thời hạn hiệu lực tương ứng và điều kiện cùng tiền tố.

Thành tích cụ thể của bốn mô hình trong cùng một hệ thống đánh giá

Bảng dưới đây đều đến từ Artificial Analysis Intelligence Index v4.3.2. Cấu hình thử nghiệm là GPT-6 Sol max, GPT-6 Astra max, Claude Opus 5.5 và Fable 5.1 đều dùng adaptive reasoning max effort và bật default fallback. Chúng không phải mức mặc định của bốn mô hình, đặc biệt Opus mặc định medium, Fable mặc định high; các mô hình khác nhau dù đều ghi max thì mức dùng token suy luận thực tế cũng khác nhau. AA thống nhất tác vụ và harness riêng, nên có thể xem kết quả theo chiều ngang trong cấu hình thử nghiệm đó; thành tích từ buổi ra mắt của hãng không được trộn vào bảng này. Liên kết: So sánh gốc Sol–Opus, So sánh gốc Astra–Fable, Phương pháp AA.

Tác vụ tổng hợp và kỹ thuật AA Sol Opus 5.5 Astra Fable 5.1
Chỉ số tổng hợp v4.3.2 (điểm) 48 58 53 53
Terminal-Bench 4.0 (tỷ lệ đạt) 44% 60% 59% 52%
AutomationBench-AA (tỷ lệ thành công) 62% 70% 68% 59%
SciCode (tỷ lệ đạt) 58% 67% 56% 63%
Ngữ cảnh dài AA-LCR v1.1 (tỷ lệ đạt) 84% 85% 81% 85%
Chỉ số tổng hợp v4.3.2 (điểm)
Sol
48
Opus 5.5
58
Astra
53
Fable 5.1
53
Terminal-Bench 4.0 (tỷ lệ đạt)
Sol
44%
Opus 5.5
60%
Astra
59%
Fable 5.1
52%
AutomationBench-AA (tỷ lệ thành công)
Sol
62%
Opus 5.5
70%
Astra
68%
Fable 5.1
59%
SciCode (tỷ lệ đạt)
Sol
58%
Opus 5.5
67%
Astra
56%
Fable 5.1
63%
Ngữ cảnh dài AA-LCR v1.1 (tỷ lệ đạt)
Sol
84%
Opus 5.5
85%
Astra
81%
Fable 5.1
85%

Nguồn số liệu từng dòng đều là hai trang so sánh mô hình cùng phiên bản AA ở trên AA Sol–Opus và trang Astra–Fable. Ví dụ trong harness Terminal-Bench 4.0 của chính AA, Opus 5.5 cao hơn Sol 16 điểm phần trăm; con số này không thể trộn với 66.4% trên trang chính thức Anthropic, vì thiết lập chạy khác nhau.

Tác vụ kiến thức và chuyên môn AA Sol Opus 5.5 Astra Fable 5.1
AA-Briefcase v1.1 (Elo) 1483 1822 1569 1678
GDPval-AA v2.1 (Elo) 1487 1846 1542 1735
Humanity's Last Exam (tỷ lệ đạt) 48% 61% 55% 59%
GDP.pdf (tỷ lệ đạt toàn bộ) 25% 26% 31% 26%
CritPt (tỷ lệ đạt) 31% 32% 32% 30%
AA-Omniscience (điểm chỉ số, không phải phần trăm) 27 46 43 43
AA-Briefcase v1.1 (Elo)
Sol
1483
Opus 5.5
1822
Astra
1569
Fable 5.1
1678
GDPval-AA v2.1 (Elo)
Sol
1487
Opus 5.5
1846
Astra
1542
Fable 5.1
1735
Humanity's Last Exam (tỷ lệ đạt)
Sol
48%
Opus 5.5
61%
Astra
55%
Fable 5.1
59%
GDP.pdf (tỷ lệ đạt toàn bộ)
Sol
25%
Opus 5.5
26%
Astra
31%
Fable 5.1
26%
CritPt (tỷ lệ đạt)
Sol
31%
Opus 5.5
32%
Astra
32%
Fable 5.1
30%
AA-Omniscience (điểm chỉ số, không phải phần trăm)
Sol
27
Opus 5.5
46
Astra
43
Fable 5.1
43

Nguồn số liệu từng dòng: AA Sol–Opus, AA Astra–Fable. Chênh lệch nhỏ 1–2 điểm phần trăm không nên được giải thích thành thắng thua vững chắc; Elo, điểm chỉ số và tỷ lệ đạt cũng không phải cùng một đơn vị.

Chi phí và mức sử dụng trong thử nghiệm AA Sol Opus 5.5 Astra Fable 5.1
Chi phí trung bình mỗi tác vụ chỉ số $1.06 $5.98 $3.26 $7.63
Token đầu ra trung bình mỗi tác vụ 31K 119K 27K 78K
Trong đó token suy luận 21K 84K 17K 47K
Chi phí trung bình mỗi tác vụ chỉ số
Sol
$1.06
Opus 5.5
$5.98
Astra
$3.26
Fable 5.1
$7.63
Token đầu ra trung bình mỗi tác vụ
Sol
31K
Opus 5.5
119K
Astra
27K
Fable 5.1
78K
Trong đó token suy luận
Sol
21K
Opus 5.5
84K
Astra
17K
Fable 5.1
47K

Nguồn vẫn là AA Sol–Opus và AA Astra–Fable. Chi phí tác vụ là trung bình có trọng số theo mức dùng trong thử nghiệm AA, không phải báo giá “hoàn thành một yêu cầu” trong kho mã của bạn. Cấu hình max của Opus tiêu thụ nhiều token đầu ra và suy luận hơn, đây cũng là một lý do khoảng cách hóa đơn lớn hơn khoảng cách đơn giá.

Biểu đồ trên trang chính thức của hai hãng: có thể xác nhận kết luận riêng, không thể ghép thành so sánh cùng sân

Biểu đồ DeepSWE v1.1 của OpenAI cho GPT-6 Sol max là 68.8%, trong hình Claude Fable 5 ở xhigh là 69.9%; không có Opus 5.5. Trục hoành là chi phí mỗi tác vụ, thang logarit. Trong hình Opus 5 cũng không phải Opus 5.5. Nó cho thấy Sol có thành tích agent lập trình gần mức mô hình cao cấp dưới thiết lập OpenAI công bố, nhưng không thể thay thế thử nghiệm cùng sân cho bốn mô hình.

Biểu đồ DeepSWE v1.1 chính thức của OpenAI: GPT-6 Sol max đạt 68.8%, trong không có Opus 5.5

Hình 1: OpenAI “Introducing-6 Sol and Luna” “Coding”, 2026-09-22. Mô hình và effort lấy theo chú th trong hình và chú thích gốc. Mở ảnh gốc đầy đ để xem chữ nhỏ.

Biểu đồ Terminal-Bench 4.0 của Anthropic cho Claude Opus 5.5 xhigh là 66.4%. Trong hình GPT-6 Astra 57.9% dùng high, không phải GPT-6 Sol. Đường cong còn có điểm ở effort mặc định, nhưng không thể coi vị trí đó là điểm xhigh. Harness của hãng ở đây khác với Terminal-Bench 4.0 trong bảng AA ở trên, không thể lấy 66.4% trừ đi 44% mà AA cho Sol.

Biểu đồ Terminal-Bench 4.0 chính thức của Anthropic: Opus 5.5 xhigh đạt 66.4%, trong hình không có GPT-6 Sol

Hình 2: Anthropic “Claude Opus 5.5” “Coding”, 2026-09-22. Trục hoành là chi phí mỗi lần thử, thang logarit; mức hiển thị, khoảng thống kê và giới hạn xem trong bài gốc. Mở ảnh gốc đầy đủ để xem chữ nhỏ.

Ngoài ra có những thành tích do một hãng công bố nhưng không nên trực tiếp trừ nhau: OpenAI báo cáo Sol xhigh trên AutomationBench 1.0.6 là 33.2%, max trên Agents' Last Exam V1 là 56.4%, xhigh trên OSWorld 2.0 offline là 60.5%, nguồn như trang công bố OpenAI; Anthropic báo cáo Opus 5.5 trên FrontierCode v1.1 Main là 54.4%, CursorBench 4.0 là 57.8%, GDPval-AA v2.1 là 1846 Elo, Humanity's Last Exam with tools là 67.7%, nguồn như trang công bố Anthropic. Phiên bản, công cụ, effort hoặc harness của các mục này chưa được chứng minh là giống bên còn lại, nên không liệt kê “dẫn trước bao nhiêu”. Các giá trị cùng chuẩn cho bốn mô hình chưa được công bố thì không thể đoán bù.

Cùng khối lượng tác vụ thì tốn bao nhiêu? Năm ví dụ có thể tính lại

Bảng dưới đây chia đầu vào thành ba loại token loại trừ lẫn nhau: thường, ghi bộ nhớ đệm lần đầu và đọc bộ nhớ đệm sau đó, rồi cộng đầu ra. Mỗi dòng đều là một yêu cầu, không gồm gọi công cụ, phụ phí nền tảng hoặc lượt bổ sung; đầu ra đều thấp hơn giới hạn 128K của yêu cầu thông thường. Giá được tính theo bảng giá chính thức ở trên, nên có thể thay số token theo log usage của chính bạn.

Kịch bản và mức dùng token Sol Opus 5.5 Astra Fable 5.1
A Thường: 100K đầu vào mới + 50K đầu ra $0.70 $1.40 $3.50 $3.50
B Ghi bộ nhớ đệm lần đầu: 200K ghi + 50K đầu vào mới + 20K đầu ra $0.80 $1.60 (5m) / $2.20 (1h) $4.00 $4.00 (5m) / $5.50 (1h)
C Trúng bộ nhớ đệm sau đó: 200K đọc bộ nhớ đệm + 50K đầu vào mới + 20K đầu ra $0.34 $0.64 $1.70 $1.55
D Bản Batch bất đồng bộ của A: 100K đầu vào mới + 50K đầu ra $0.35 $0.70 $1.75 $1.75
E Đầu vào dài: 300K đầu vào mới + 20K đầu ra $1.50 $1.60 $7.50 $4.00
A Thường: 100K đầu vào mới + 50K đầu ra
Sol
$0.70
Opus 5.5
$1.40
Astra
$3.50
Fable 5.1
$3.50
B Ghi bộ nhớ đệm lần đầu: 200K ghi + 50K đầu vào mới + 20K đầu ra
Sol
$0.80
Opus 5.5
$1.60 (5m) / $2.20 (1h)
Astra
$4.00
Fable 5.1
$4.00 (5m) / $5.50 (1h)
C Trúng bộ nhớ đệm sau đó: 200K đọc bộ nhớ đệm + 50K đầu vào mới + 20K đầu ra
Sol
$0.34
Opus 5.5
$0.64
Astra
$1.70
Fable 5.1
$1.55
D Bản Batch bất đồng bộ của A: 100K đầu vào mới + 50K đầu ra
Sol
$0.35
Opus 5.5
$0.70
Astra
$1.75
Fable 5.1
$1.75
E Đầu vào dài: 300K đầu vào mới + 20K đầu ra
Sol
$1.50
Opus 5.5
$1.60
Astra
$7.50
Fable 5.1
$4.00

Ví dụ tính toán: Sol của A = 0.1×$2 + 0.05×$10 = $0.70. Opus 5m của B = 0.2×$5 + 0.05×$4 + 0.02×$20 = $1.60; Opus của C = 0.2×$0.20 + 0.05×$4 + 0.02×$20 = $0.64. Đầu vào Sol của E 300K đã vượt 272K, cả lần tính theo $4 đầu vào, $15 đầu ra; Astra tương ứng $20/$75. Ngữ cảnh 1M của Opus/Fable giữ đơn giá tiêu chuẩn. B và C là các yêu cầu khác nhau, một ghi trước một đọc sau; C cần đảm bảo bộ nhớ đệm còn hiệu lực. Thời gian lưu bộ nhớ đệm của OpenAI khác cơ chế tính phí 5m/1h của Anthropic, không thể cộng nhầm phí ghi của B vào mỗi yêu cầu C. Căn cứ: Giá hai mô hình OpenAI, Quy tắc giá Anthropic.

Đưa vào quy trình lập trình thực tế, phân công thế nào?

Sol chạy lặp hằng ngày trước. Việc chia nhỏ yêu cầu, thay đổi nhỏ trong kho mã hiện có, vá kiểm thử và công việc có thể rà soát theo lô, hãy để Sol xử lý trước, rồi ghi lại tỷ lệ thành công của tác vụ, số lần làm lại và tổng token. Đơn giá thấp của nó trực tiếp nhất trong các ví dụ A–D chưa vượt 272K; lợi thế giá của yêu cầu siêu dài sẽ thu hẹp.

Opus 5.5 xử lý tác vụ agent khó hội tụ trong một lần. Thử nghiệm cùng sân của AA cho nó thành tích cao hơn ở tổng hợp, terminal và công việc kiến thức, nhưng chi phí trung bình mỗi tác vụ dưới cấu hình max cũng cao hơn rõ rệt. Có thể lập đường cơ sở cục bộ bằng medium mặc định hoặc effort bạn thực dùng trước, rồi nâng mức cho bài khó. Đừng coi kết quả max của AA là trải nghiệm mặc định.

Astra và Fable 5.1 là mức nâng cao. Astra có thành tích cạnh tranh trên AutomationBench-AA, Terminal-Bench 4.0 và GDP.pdf của AA; Fable 5.1 mạnh hơn ở một số chỉ số công việc kiến thức dài hạn, nhưng giá đầu vào/đầu ra cơ bản $10/$50 của cả hai cao hơn đáng kể so với Sol. Giá đọc bộ nhớ đệm của Fable là $0.25, thấp hơn $1.00 của Astra; nếu lặp lại đọc tiền tố lớn, thứ tự chi phí có thể thay đổi. Với tác vụ khó, nên nghiệm thu mẫu nhỏ bốn mô hình trên cùng yêu cầu trong kho mã, chọn theo “chi phí tác vụ hoàn thành thành công và có thể hợp nhất”, không chọn theo điểm của một bảng xếp hạng đơn lẻ.

Trong PandaNpc, Codex và Claude Code là hai Agent Engine khả dụng. Khi chọn lối vào, còn phải xem gói đăng ký hoặc kênh API bạn đã có, quyền công cụ, ngữ cảnh kho mã và quy trình rà soát của nhóm; báo giá API mô hình không thể quy đổi trực tiếp thành hạn mức đăng ký công cụ. Bài viết này trình bày thông số và đánh giá công khai không tuyên bố thứ hạng thực nghiệm của bốn mô hình trong PandaNpc.

Câu hỏi thường gặp (FAQ)

Sol có nhất định rẻ bằng một nửa Opus 5.5 không? Chỉ đơn giá đầu vào, đầu ra của API tiêu chuẩn là bằng một nửa. Đầu vào vượt 272K, ghi/đọc bộ nhớ đệm, token suy luận thực tế, số lượt và phí công cụ đều sẽ thay đổi hóa đơn của cả tác vụ. Kịch bản E ở trên đã kéo giá một lần của hai bên lại gần nhau còn $1.50 và $1.60.

Hai biểu đồ lập trình chính thức có chứng minh ai thắng không? Không. Biểu đồ OpenAI không có Opus 5.5, biểu đồ Anthropic không có Sol, benchmark và harness cũng khác. Muốn xem kết quả cùng sân của bốn mô hình, hãy xem bảng cấu hình cố định AA v4.3.2; muốn quyết định lựa chọn công cụ cho mình, hãy chạy lại tác vụ trong kho mã của bạn.

Bộ nhớ đệm và Batch có cộng dồn được không? Tài liệu giá của Anthropic hỗ trợ cộng dồn rõ ràng; thực tế có trúng bộ nhớ đệm hay không phụ thuộc vào tiền tố, thời hạn hiệu lực và thiết lập yêu cầu. Batch của hai mô hình OpenAI bằng 50% mức giá tiêu chuẩn; hóa đơn cụ thể hãy đối chiếu theo bản ghi sử dụng API tương ứng.

GPT-6 Astra vs Claude Fable 5.1: So sánh lập trình, Agent, giá cả và benchmark

GPT-6 Astra vs Claude Fable 5.1: So sánh lập trình, Agent, giá cả và benchmark

GPT-6 Astra và Claude Fable 5.1 đều đã được công khai sử dụng, và đều là các mô hình chủ lực với giá 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra, nhưng có những đánh đổi khác nhau về lập trình, thao tác máy tính, tác vụ dài hạn, chi phí cache và ngữ cảnh. Bài viết này so sánh từng hạng mục dựa trên tiêu chuẩn chung, đồng thời đưa ra phương pháp chọn mô hình theo từng loại tác vụ.

Đọc bài viết →
Codex bật ngữ cảnh GPT-5.6 Sol 1M: Hướng dẫn cấu hình 3 dòng `config.toml`

Codex bật ngữ cảnh GPT-5.6 Sol 1M: Hướng dẫn cấu hình 3 dòng `config.toml`

GPT-5.6 Sol chính thức hỗ trợ ngữ cảnh 1,05 triệu token. Chỉ cần thêm 3 dòng cấu hình vào đầu config.toml của Codex là có thể chạy với cửa sổ 1 triệu token và tự động nén lịch sử ở khoảng 900 nghìn token. Kèm theo cấu hình vĩnh viễn, lệnh một lần, xác minh và lưu ý về chi phí.

Đọc bài viết →
Phân tích toàn diện Claude Fable 5.1: điểm chuẩn, cải tiến, giá cả và tốc độ

Phân tích toàn diện Claude Fable 5.1: điểm chuẩn, cải tiến, giá cả và tốc độ

Kết quả đầy đủ của Claude Fable 5.1 trên 7 loại benchmark chính, so sánh từng hạng mục với Fable 5, Opus 5 và GPT-5.6 Sol, đồng thời giải thích các thay đổi của bản 5.1 về tác vụ dài hạn, gọi công cụ, chi phí cache, tốc độ, giới hạn gói và quá trình di chuyển (migration).

Đọc bài viết →