Claude Fable 5.1 เจาะลึกทุกมุม: เกณฑ์มาตรฐาน การปรับปรุง ราคา และความเร็ว

ผลคะแนนเต็มรูปแบบของ Claude Fable 5.1 บนเกณฑ์มาตรฐานหลัก 7 ประเภท เทียบรายการกับ Fable 5, Opus 5, GPT-5.6 Sol พร้อมอธิบายงานระยะยาว การเรียกใช้เครื่องมือ ค่าใช้จ่ายแคช ความเร็ว ข้อจำกัดของแพ็กเกจ และการเปลี่ยนแปลงการย้ายระบบของ 5.1

PandaNpcเผยแพร่ครั้งแรกเมื่อ
Claude Fable 5.1 เจาะลึกทุกมุม: เกณฑ์มาตรฐาน การปรับปรุง ราคา และความเร็ว

Claude Fable 5.1 เปิดตัวอย่างเป็นทางการเมื่อวันที่ 1 กันยายน 2026 ขอสรุปก่อนเลย: มันไม่ใช่การอัปเกรดโมเดลทั่วไปสำหรับการถามตอบทั่วไป แต่เป็นโมเดลเรือธงต้นทุนสูงที่เตรียมไว้สำหรับการเขียนโปรแกรมระยะยาว งานวิจัยที่ซับซ้อน การเรียกใช้เครื่องมือข้ามแอปพลิเคชัน และ Agent แบบไม่ต้องมีคนดูแล ในเกณฑ์มาตรฐานกระแสหลัก 7 ประเภทที่ Anthropic ประกาศ Fable 5.1 ทำคะแนนสูงกว่า Fable 5 ทั้งหมด แต่ราคาต่อหน่วยของ API ยังคงเป็นสองเท่าของ Opus 5 และทางการก็ระบุความหน่วงสัมพัทธ์ว่า "ค่อนข้างช้า"

หากงานของคุณเป็นเพียงการแก้ไฟล์เดียว เขียนข้อความสั้น ๆ หรือตอบคำถามทั่วไป Anthropic ยังแนะนำให้เริ่มจาก Opus 5 อยู่ดี Fable 5.1 เหมาะกับงานแบบ long-chain ที่โมเดลทั่วไปยังไม่สามารถทำสำเร็จได้อย่างเสถียรแม้จะใช้ effort สูง บทความนี้รวบรวมข้อมูลที่เผยแพร่อย่างเป็นทางการ ความหมายของเกณฑ์มาตรฐานแต่ละรายการ จุดปรับปรุงเฉพาะของ 5.1 ราคา ความเร็ว และข้อจำกัดในการย้ายมาใช้ไว้ด้วยกัน เพื่อไม่ให้เราดูเพียงภาพกราฟคะแนน "ใครชนะ" ภาพเดียว

สเปกของ Fable 5.1 ในตารางเดียว

รายการ Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
หน้าต่างบริบท 1M token 1M token 1M token
เอาต์พุตสูงสุด 128K token 128K token 128K token
ราคาอินพุต $10 / MTok $5 / MTok $2 / MTok
ราคาเอาต์พุต $50 / MTok $25 / MTok $10 / MTok
ความหน่วงสัมพัทธ์ ค่อนข้างช้า ปานกลาง เร็ว
Thinking Adaptive เปิดอยู่เสมอ Adaptive Adaptive
ค่า effort เริ่มต้น High High High
จุดตัดความรู้ที่น่าเชื่อถือ มิถุนายน 2026 พฤษภาคม 2026 มกราคม 2026

คำว่า "ค่อนข้างช้า" ในที่นี้มาจากสารบบโมเดลของ Anthropic หมายถึงระดับความหน่วงสัมพัทธ์ ไม่ใช่จำนวน token ต่อวินาทีที่ตายตัว เวลาจริงที่ใช้ทำงานหนึ่งให้เสร็จยังขึ้นอยู่กับ effort จำนวนรอบการเรียกใช้เครื่องมือ อัตราการ cache hit ความยาวของบริบท และจำนวนครั้งที่ลองใหม่หลังความล้มเหลว

เวิร์กโฟลว์ Agent ระยะยาวของ Fable 5.1 ตั้งแต่การวางแผนจนถึงการตรวจสอบ
Fable 5.1 ไม่ได้ออกแบบมาสำหรับการตอบแบบครั้งเดียวจบ แต่สำหรับงานระยะยาวที่ต้องวางแผน ดำเนินการ กู้คืน ตรวจสอบ และรายงานผลอย่างต่อเนื่อง

ตารางเกณฑ์มาตรฐานกระแสหลักของ Fable 5.1 ฉบับเต็ม

ตารางด้านล่างนำมาจากตารางหลักในหน้าประกาศของ Anthropic วันที่ 1 กันยายน 2026 โดยตรง เพื่อป้องกันการตีความผิด เปอร์เซ็นต์ คะแนนดิบของ GDPval-AA ผลลัพธ์แบบ partial/strict ของ OSWorld และผลลัพธ์แบบมีเครื่องมือ/ไม่มีเครื่องมือของ HLE จึงถูกแยกไว้คนละรายการ เกณฑ์มาตรฐานแต่ละตัวคงชื่อทางการภาษาอังกฤษไว้ และบรรทัดถัดไปเป็นชื่อภาษาไทย; เวอร์ชันภาษาอื่น ๆ ก็จะแสดงชื่อที่แปลแล้วใต้ชื่อภาษาอังกฤษในลักษณะเดียวกัน

ความสามารถ เกณฑ์มาตรฐาน Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol 5.1 เทียบกับ Fable 5
งานวิจัยวิทยาศาสตร์ของ Agent Terminal-Bench-Science 0.1
เกณฑ์มาตรฐานเทอร์มินัลสำหรับงานวิจัยวิทยาศาสตร์ของ Agent
52.6% 24.7% 29.0% 22.4% +27.9 จุดเปอร์เซ็นต์
การเขียนโปรแกรมเทอร์มินัลของ Agent Terminal-Bench 4.0
เกณฑ์มาตรฐานการเขียนโปรแกรมเทอร์มินัลของ Agent
55.8% 42.0% 52.3% 37.3% +13.8 จุดเปอร์เซ็นต์
งานความรู้เชิงวิชาชีพ GDPval-AA v2
เกณฑ์มาตรฐานงานวิชาชีพที่มีมูลค่าทางเศรษฐกิจจริง
1853 1723 1824 1711 +130 คะแนน
การใช้งานคอมพิวเตอร์ OSWorld 2.0 — Partial
เกณฑ์มาตรฐานการใช้งานคอมพิวเตอร์จริง: คะแนนความสำเร็จบางส่วน
77.9% 72.9% 75.4% — +5.0 จุดเปอร์เซ็นต์
การใช้งานคอมพิวเตอร์ OSWorld 2.0 — Strict
เกณฑ์มาตรฐานการใช้งานคอมพิวเตอร์จริง: อัตราสำเร็จแบบเคร่งครัด
41.7% 36.1% 39.6% — +5.6 จุดเปอร์เซ็นต์
การใช้เหตุผลข้ามสาขาวิชา Humanity's Last Exam — No tools
ข้อสอบสุดท้ายของมนุษยชาติ: ไม่ใช้เครื่องมือ
60.9% 57.8% 56.6% — +3.1 จุดเปอร์เซ็นต์
การใช้เหตุผลข้ามสาขาวิชา Humanity's Last Exam — With tools
ข้อสอบสุดท้ายของมนุษยชาติ: ใช้เครื่องมือ
65.0% 63.8% 63.6% — +1.2 จุดเปอร์เซ็นต์
เวิร์กโฟลว์ธุรกิจ AutomationBench
เกณฑ์มาตรฐานเวิร์กโฟลว์ธุรกิจอัตโนมัติข้ามแอปพลิเคชัน
31.4% 17.1% 26.9% 19.6% +14.3 จุดเปอร์เซ็นต์
การเขียนโปรแกรมของ Agent CursorBench 3.2.0
เกณฑ์มาตรฐานงานเขียนโปรแกรมหลายไฟล์จริง
73.4% 70.5% 70.0% 67.2% +2.9 จุดเปอร์เซ็นต์

เครื่องหมาย — หมายถึงตารางหลักของ Anthropic ไม่ได้ให้คะแนนในส่วนนี้ ไม่ได้แปลว่าโมเดลนั้นไม่สามารถทำงานดังกล่าวได้ ใน Terminal-Bench 4.0 นั้น Mythos 5.1 ซึ่งมีข้อจำกัดน้อยกว่าและเปิดให้เฉพาะโปรแกรมที่ได้รับความไว้วางใจ ได้คะแนน 60.9%; บทความนี้มุ่งเน้นที่ Fable 5.1 ซึ่งผู้ใช้ทั่วไปใช้งานได้ จึงไม่นำคะแนนของ Mythos ไปปนกับคอลัมน์ของ Fable

Terminal-Bench-Science 0.1 วัดอะไร

Terminal-Bench-Science 0.1 ประกอบด้วยเวิร์กโฟลว์งานวิจัยจริง 70 รายการในห้าสาขาหลัก ได้แก่ วิทยาศาสตร์ชีวภาพ วิทยาศาสตร์กายภาพ วิทยาศาสตร์โลก คณิตศาสตร์ และวิศวกรรมศาสตร์ งานเหล่านี้ไม่ใช่ข้อสอบปรนัย แต่ให้ Agent ทำงานวิเคราะห์ข้อมูล การอนุมานเชิงสถิติ การจำลองสถานการณ์ การหาค่าที่เหมาะสม การพิสูจน์ทฤษฎีบท การสร้างภาพใหม่ หรือ scientific machine learning ภายในเทอร์มินัลให้สำเร็จ และตรวจสอบผลลัพธ์ด้วยการทดสอบที่ทำซ้ำได้

52.6% ของ Fable 5.1 เทียบกับ 24.7% ของ Fable 5 ในการทดลองจำลองซ้ำอย่างเป็นทางการ เพิ่มขึ้น 27.9 จุดเปอร์เซ็นต์ ซึ่งเป็นการกระโดดขึ้นที่ชัดเจนที่สุดในตารางทั้งหมด แต่ทางการก็ระบุ standard error ไว้ราว ±3.5–4.5 จุดเปอร์เซ็นต์ต่อโมเดล เราจึงไม่ควรถือเอาตัวเลขหลังจุดทศนิยมหนึ่งตำแหน่งเป็นอันดับที่แม่นยำสมบูรณ์

Terminal-Bench 4.0 และ CursorBench 3.2.0 วัดอะไร

Terminal-Bench ให้ Agent ทำงานที่ซับซ้อนในสภาพแวดล้อมเทอร์มินัลจริง โดยโฟกัสว่ามันสามารถเข้าใจสภาพแวดล้อม เรียกใช้เครื่องมือ แก้ไขไฟล์ และผ่านการตรวจสอบในที่สุดได้หรือไม่ Fable 5.1 ทำได้ 55.8% สูงกว่า Fable 5 อยู่ 13.8 จุดเปอร์เซ็นต์ และยังสูงกว่า Opus 5 ที่ได้ 52.3% อีกด้วย

CursorBench 3.2 มาจากงานหลายไฟล์ที่มีความคลุมเครือในเซสชัน Cursor จริง เวอร์ชัน 3.2 เพิ่มโจทย์ด้านการทำตามคำสั่งและการใช้เครื่องมือขั้นสูง Fable 5.1 Max ได้ 73.4% โดยมีส่วนนำไม่มากเท่า Terminal-Bench-Science แต่โดยเฉลี่ยแต่ละงานใช้ 72,060 token และมีต้นทุน $9.64; ส่วน Fable 5 Max ใช้ 103,525 token และ $17.32 จุดที่ควรให้ความสนใจมากกว่าคือการลดลงของ token และต้นทุนเมื่อทำงานประเภทเดียวกันสำเร็จ ไม่ใช่ตัวเลข 2.9 จุดเปอร์เซ็นต์เอง

GDPval-AA v2 วัดอะไร

GDPval-AA v2 ใช้งาน 220 รายการที่ออกแบบโดยผู้เชี่ยวชาญในอุตสาหกรรม ครอบคลุม 44 อาชีพและ 9 อุตสาหกรรม เพื่อประเมินความสามารถของโมเดลในการรับมืองานความรู้จริงที่มีมูลค่าทางเศรษฐกิจ คะแนน 1853 ของมันคือคะแนนรวม ไม่ใช่ 1853% ผลลัพธ์นี้ชี้ให้เห็นว่า Fable 5.1 เหนือกว่า Fable 5 ในงานเอกสารวิชาชีพ การวิเคราะห์ และงานส่งมอบ และยังเหนือกว่า Opus 5 เล็กน้อย

ทำไม OSWorld 2.0 ถึงมีสองคะแนน

OSWorld 2.0 ประกอบด้วยเวิร์กโฟลว์การใช้งานคอมพิวเตอร์แบบ long-chain จำนวน 108 รายการ โดยเวลาที่มนุษย์ใช้ทำงานแต่ละงานสำเร็จมีค่ามัธยฐานประมาณ 1.6 ชั่วโมง Partial จะให้คะแนนความสำเร็จบางส่วนตาม checkpoint หลายจุด ส่วน Strict จะนับว่าสำเร็จก็ต่อเมื่อถึงเป้าหมายอย่างสมบูรณ์เท่านั้น

ดังนั้น 77.9% แบบ partial กับ 41.7% แบบ strict ของ Fable 5.1 จึงไม่ได้ขัดแย้งกัน: มันมักทำเกือบทุกขั้นตอนสำเร็จบ่อยครั้ง แต่ก็ยังมีงานบางส่วนที่ไม่สามารถปิดงานได้จนจบแบบ end-to-end นี่ยังเตือนเราด้วยว่า การที่ Agent ใช้งานคอมพิวเตอร์ "ดูเหมือนลงมือทำตลอดเวลา" ไม่ได้แปลว่างานสำเร็จแล้ว

Humanity's Last Exam วัดอะไร

Humanity's Last Exam สร้างขึ้นโดย Center for AI Safety และ Scale AI ประกอบด้วยคำถามระดับผู้เชี่ยวชาญข้ามสาขาวิชา 2,500 ข้อ ซึ่งตอบได้ยากด้วยการค้นหาง่าย ๆ Fable 5.1 สูงกว่า Fable 5 อยู่ 3.1 จุดเปอร์เซ็นต์ในเงื่อนไขที่ไม่มีเครื่องมือ แต่เมื่ออนุญาตให้ใช้เครื่องมือแล้วสูงกว่าอยู่เพียง 1.2 จุดเปอร์เซ็นต์ มันแข็งแกร่งขึ้นจริง แต่ไม่ใช่ทุกเกณฑ์มาตรฐานจะเพิ่มขึ้นเป็นเท่าตัว

AutomationBench วัดอะไร

AutomationBench ตรวจสอบว่า Agent สามารถทำงานเวิร์กโฟลว์ด้านการขาย การตลาด การดำเนินงาน การดูแลลูกค้า การเงิน และทรัพยากรบุคคล ข้ามเครื่องมือ SaaS จำลองอย่าง CRM อีเมล ปฏิทิน ระบบข้อความ และการจัดการโปรเจกต์ได้หรือไม่ Fable 5.1 เพิ่มขึ้นจาก 17.1% เป็น 31.4% คิดเป็นการปรับปรุงสัมพัทธ์ราว 84% ซึ่งแสดงว่า 5.1 มีความก้าวหน้าอย่างเป็นรูปธรรมในการจัดการสถานะข้ามแอปและการดำเนินการหลายขั้นตอน แต่ตัวเลข 31.4% ก็บอกเช่นกันว่างานอัตโนมัติทางธุรกิจแบบไร้คนดูแลประเภทนี้ยังห่างไกลจากการแก้ได้สำเร็จ

เมทริกซ์ความครอบคลุมความสามารถของ Fable 5.1 บนเกณฑ์มาตรฐานกระแสหลักเจ็ดประเภท
เกณฑ์มาตรฐานเจ็ดประเภทครอบคลุมการวิจัยวิทยาศาสตร์ การเขียนโปรแกรมเทอร์มินัล งานความรู้วิชาชีพ การใช้งานคอมพิวเตอร์ การใช้เหตุผลข้ามสาขา กระบวนการธุรกิจ และการเขียนโปรแกรมหลายไฟล์

Fable 5.1 ดีขึ้นจาก Fable 5 ตรงไหนบ้าง

1. งานระยะยาวมีแนวโน้มใช้ทางลัดน้อยลง

Anthropic วางตำแหน่ง Fable 5.1 เป็นโมเดล Agent ระยะยาว: วางแผนก่อน จากนั้นใช้เครื่องมือ กู้คืนเมื่อล้มเหลว ตรวจสอบผลลัพธ์ และรายงานความคืบหน้าอย่างจริงจัง มันเน้นการแก้ที่ต้นเหตุ (root cause) มากกว่าการเลี่ยงเฉพาะจุดเพื่อให้การทดสอบหนึ่ง ๆ ผ่านเป็นสีเขียวโดยเร็วที่สุด สถานการณ์เป้าหมายที่ทางการระบุไว้ครอบคลุมฟีเจอร์ข้ามโค้ดเบส การตรวจสอบโค้ด การปรับประสิทธิภาพ เซสชันอัตโนมัติหลายวัน งานวิจัย เอกสาร ตาราง และสไลด์

2. การใช้ effort ต่ำก็สามารถทำผลลัพธ์ใกล้เคียงกับรุ่นก่อนที่ใช้ต้นทุนสูงได้

Fable 5.1 เพิ่มความสามารถในการปรับ effort เป็นรายข้อความ เส้นต้นทุนอย่างเป็นทางการแสดงให้เห็นว่า effort ระดับ Low หรือ Medium สามารถทำผลลัพธ์ในบางงานได้เท่าหรือเกิน Fable 5 พร้อมกับลด token และค่าใช้จ่ายลง Claude Code ใช้ High effort เป็นค่าเริ่มต้น ส่วน Claude.ai และ Cowork ใช้ Medium เป็นค่าเริ่มต้น ดังนั้นเมื่อเปรียบเทียบโมเดลต้องตรวจสอบ effort ก่อนเสมอ อย่านำผลลัพธ์จากระดับที่ต่างกันมาเทียบกันตรง ๆ

3. แสดงความคืบหน้าที่อ่านเข้าใจได้ระหว่างการเรียกใช้เครื่องมือ

API เพิ่มความสามารถในขั้นทดลอง display: "updates" เพื่อให้โมเดลส่งอัปเดตความคืบหน้าสำหรับผู้ใช้ระหว่างการเรียกใช้เครื่องมือแต่ละครั้ง สำหรับงานที่ใช้เวลาหลายชั่วโมง วิธีนี้ช่วยให้ตัดสินได้ง่ายกว่าการเห็นแต่การ์ดเครื่องมือผุดขึ้นเรื่อย ๆ ว่าระบบกำลังทำอะไรอยู่ และกำลังออกนอกเป้าหมายหรือไม่

4. การเขียน การตรวจสอบด้วยภาพ และการทดสอบตัวเองสมบูรณ์ขึ้น

ทางการระบุว่า 5.1 จะเขียนเทสต์เพื่อตรวจสอบการแก้ไขของตัวเองอย่างจริงจัง และใช้ความสามารถด้านภาพตรวจสอบผลลัพธ์เทียบกับเป้าหมายการออกแบบ ความเห็นจากพาร์ตเนอร์ยังโฟกัสที่ความคืบหน้าที่กระชับขึ้น การตอบคำถามหลายส่วนได้ครบถ้วนขึ้น การติดตามสายการเรียกข้ามบริการหลายตัว และการคงความอ่านง่ายได้แม้ทำงานต่อเนื่องเป็นเวลานาน สิ่งเหล่านี้เป็นฟีดแบ็กเชิงคุณภาพ ไม่ควรถูกนำมาใช้แทนข้อสรุปจากเกณฑ์มาตรฐานเดียว

5. การสกัดกั้นด้านความปลอดภัยแม่นยำขึ้น แต่ไม่ได้หายไป

การแจ้งเตือน false positive จากการป้องกันความปลอดภัยไซเบอร์ของ Fable 5.1 ลดลงราว 60% เมื่อเทียบกับตอนที่ Fable 5 เปิดตัว และความถี่ที่คำถามพื้นฐานด้านชีววิทยาและการแพทย์ทำให้ถูกปรับลดระดับ (downgrade) ลดลงราว 85% ตอนนี้มันสามารถใช้ค้นหาช่องโหว่ซอฟต์แวร์ได้ แต่การทดสอบเจาะระบบ การสร้างโค้ดเอ็กซ์พลอยต์ การสแกนช่องโหว่แบบไบนารี ซึ่งเป็นงานแบบ dual-use อาจยังถูก Route ไปที่ Opus อยู่ เมื่อถูก Route แล้วจะไม่คิดเงินในราคา Fable

6. เพิ่มการติดฉลากแหล่งที่มาของเนื้อหา

Fable 5.1 นำ content provenance เข้ามาใช้ ข้อความที่สร้างขึ้นอาจมีลายน้ำเชิงสถิติ (statistical watermark) ซึ่งตรวจสอบได้ผ่านเครื่องมือตรวจสอบเนื้อหาของ Anthropic มันจะไม่เพิ่มเครื่องหมายที่มองเห็นได้ในเนื้อหาหลัก แต่สำหรับแพลตฟอร์มเนื้อหา การศึกษา และการตรวจสอบภายในองค์กร นี่คือพฤติกรรมใหม่ที่ควรทำความเข้าใจล่วงหน้า

การปรับปรุงหลักหกด้านของ Fable 5.1 เทียบกับรุ่นก่อน
การเปลี่ยนแปลงของ 5.1 เน้นที่งานระยะยาว ประสิทธิภาพของ effort ต่ำ การรายงานความคืบหน้า การตรวจสอบตัวเอง การแจ้งเตือนผิดที่น้อยลง และการติดฉลากแหล่งที่มาของเนื้อหา

ค่าใช้จ่ายของ Fable 5.1 คิดอย่างไร

รายการคิดเงิน ราคา Fable 5.1 เทียบกับ Fable 5
อินพุต $10 / ล้าน token เท่ากัน
เอาต์พุต $50 / ล้าน token เท่ากัน
เขียนแคช 5 นาที $12.50 / ล้าน token ระดับเดียวกัน
เขียนแคช 1 ชั่วโมง $20 / ล้าน token ระดับเดียวกัน
อ่านแคช $0.25 / ล้าน token ลดลง 75%
Batch API 50% ของราคาอินพุตและเอาต์พุต ตามกฎของ Batch

สมมติว่างานระยะยาวหนึ่งงานอ่าน cache token รวม 10 ล้าน token สร้างอินพุตใหม่ 2 แสน token และเอาต์พุต 5 หมื่น token โดยไม่นับการเขียนแคช:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

การอ่านแคช 10 ล้าน token แบบเดียวกันบน Fable 5 จะอยู่ที่ประมาณ $10 รายการเดียวนี้ก็ต่างกันถึง $7.50 แล้ว จากข้อมูลนี้ Anthropic ประเมินว่างานที่คิดเงินตาม token ทั่วไปจะมีต้นทุนจริงลดลงราว 25% ส่วนงานที่ใช้ Agent เข้มข้นและนำบริบทยาวกลับมาใช้ซ้ำบ่อย ๆ จะลดลงได้มากที่สุดราว 45% นี่ไม่ใช่การลดราคาป้ายของ API โดยรวม แต่คือยิ่ง cache hit มาก ยิ่งประหยัดได้ชัดเจน

ผู้ใช้แบบสมัครสมาชิกไม่จำเป็นต้องได้ส่วนลดแคชของ API โดยตรงเสมอไป

Max และ premium seat ของ Team/Enterprise สามารถใช้โควตารายสัปดาห์ได้สูงสุด 50% กับโมเดล Fable ส่วน Pro และซีตมาตรฐานจะเริ่มใช้ usage credits ตั้งแต่แรก ยอดการใช้ที่แน่นอนให้ยึดตามหน้า Usage ในบัญชีเป็นหลัก การลดราคาอ่านแคชส่วนใหญ่เป็นการเปลี่ยนแปลงในสถานการณ์คิดเงินตาม token เราไม่สามารถแปลงส่วนลดแคช 75% ของ API ไปเป็น "ใช้แพ็กเกจ Max ได้มากขึ้นสี่เท่า" ได้โดยตรง

โครงสร้างค่าใช้จ่ายอินพุต เอาต์พุต และแคชของ Fable 5.1
ราคาต่อหน่วยอินพุตและเอาต์พุตของ Fable 5.1 ไม่เปลี่ยนแปลง การลดราคาหลักมาจากการอ่านแคช ยิ่งนำบริบทยาวกลับมาใช้ซ้ำมากเท่าไร ยิ่งได้ประโยชน์มากขึ้นเท่านั้น

สรุปแล้ว Fable 5.1 เร็วหรือช้า

คำตอบคือ: การตอบสนองต่อรอบเดี่ยวค่อนข้างช้า แต่เวลาทั้งหมดที่ใช้ทำงานซับซ้อนให้เสร็จอาจสั้นกว่า

  • สารบบโมเดลของ Anthropic ระบุ Fable 5.1 เป็น Slower, Opus 5 เป็น Moderate และ Sonnet 5 เป็น Fast
  • Claude Code ใช้ High effort เป็นค่าเริ่มต้น ซึ่งย่อมใช้เวลา reasoning มากกว่า Low หรือ Medium โดยธรรมชาติ
  • Every กล่าวบนเวิร์กโหลดของตัวเองว่า Fable 5.1 เร็วราวสองเท่าของ Opus 5 และใช้ token น้อยกว่าครึ่ง; นี่เป็นการทดสอบเฉพาะของพาร์ตเนอร์ ไม่ใช่การการันตีความเร็วทั่วไป
  • ใน CursorBench Fable 5.1 Max เฉลี่ย 70 ขั้นตอน 72,060 token; ส่วน Fable 5 Max ใช้ 72 ขั้นตอนเท่ากันแต่ใช้ 103,525 token จุดแข็งของ 5.1 คล้ายกับ "เดินทางน้อยทางอ้อม ใช้ token น้อยลง" ซึ่งไม่จำเป็นต้องแสดงออกมาเป็นตัวอักษรแรกที่เร็วกว่า

ดังนั้น สำหรับการแชท โค้ดสั้น ๆ และการโต้ตอบที่ถี่ ให้เลือก Sonnet 5 หรือ Opus 5 ก่อน ส่วนการแก้บั๊กข้ามโค้ดเบส งานวิจัยยาว และงานไร้คนดูแลที่ต้องตรวจสอบตัวเอง ค่อยพิจารณา Fable 5.1

การเปลี่ยนแปลงความเข้ากันได้ที่ต้องจัดการก่อนอัปเกรดเป็น Fable 5.1

อัปเกรด Claude Code อย่างน้อยเป็น 2.1.250

คำอธิบายแพ็กเกจและความพร้อมใช้งานของ Anthropic กำหนดให้ใช้ Claude Code 2.1.250 ขึ้นไป หากมองไม่เห็น Fable 5.1 ให้ตรวจสอบก่อน:

bash
claude --version

จากนั้นอัปเดตตามวิธีการอัปเกรดอย่างเป็นทางการของ Claude Code แล้วเริ่มเซสชันใหม่ ID โมเดลของ Fable 5.1 ใน API คือ:

text
claude-fable-5-1

Forced tool use อาจคืน error ทันที

หากคำขอเป็นการบังคับให้โมเดลเรียกใช้เครื่องมือใดเครื่องมือหนึ่ง Fable 5.1 อาจคืนค่า error ออกมา ก่อนย้ายระบบควรตรวจสอบ tool_choice และขั้นตอนการบังคับใช้เครื่องมือของ Agent ที่สร้างขึ้นเอง และอย่าถือว่าพฤติกรรมของ Fable 5 จะเข้ากันได้อย่างสมบูรณ์

Thinking blocks ไม่สามารถนำไปใช้ข้ามโมเดลได้ตามอำเภอใจ

โมเดลรุ่นก่อนไม่สามารถอ่าน thinking blocks ของ Fable 5.1 ได้ เมื่อสลับโมเดล ควรให้ SDK จัดการบล็อกเหล่านี้ตามกฎของทางการ แทนที่จะส่งต่อไปให้อีกโมเดลหนึ่งโดยไม่แก้ไข

การแก้ไขประวัติเก่าอาจทำให้เกิด error 400

สำหรับบัญชี API ใหม่ที่สร้างหลังวันที่ 31 สิงหาคม 2026 thinking blocks จะใช้ได้ภายใต้ prefix ของบทสนทนาต้นฉบับที่มันถูกสร้างขึ้นเท่านั้น การแก้ไข system, tools หรือข้อความในช่วงแรก ๆ แล้วค่อยส่ง thinking blocks ซ้ำอาจได้ error 400 ทางการแนะนำให้เก็บประวัติแบบ append-only; เมื่อต้องบีบอัด ให้แทนที่ประวัติเก่าทั้งช่วงด้วยสรุปใหม่หนึ่งรายการ อย่าเก็บ thinking blocks เดิมไว้ระหว่างที่แก้ไขรอบเก่าไปด้วย ดูแนวทางโดยละเอียดเพิ่มเติมได้ที่คู่มือการเขียน prompt และการย้ายระบบของ Fable 5.1

ควรเลือก Fable 5.1 เมื่อใด

เหมาะสำหรับ:

  • งานระยะยาวที่ข้ามหลายรีโพซิทอรี บริการ หรือแอปพลิเคชัน;
  • Agent ที่ต้องรันหลายชั่วโมงและกู้คืนตัวเองเมื่อประสบความล้มเหลว;
  • การวิจัยวิทยาศาสตร์ การวิเคราะห์ข้อมูลที่ซับซ้อน และงานส่งมอบวิชาชีพหลายขั้นตอน;
  • ปัญหาระบบที่จำลองซ้ำได้ยาก การปรับประสิทธิภาพ และการไล่หาสาเหตุต้นตอ;
  • เวิร์กโหลด API ที่ต้องนำบริบทยาวกลับมาใช้ซ้ำเป็นจำนวนมากและมีสัดส่วนการอ่านแคชสูง

ไม่เหมาะสำหรับ:

  • การแชทง่าย ๆ ข้อความสั้น หรือการแก้ไขเล็กน้อยในไฟล์เดียว;
  • การโต้ตอบแบบเรียลไทม์ที่ไวต่อความหน่วงของตัวอักษรแรกมาก;
  • งานที่ให้เอาต์พุตสูงแต่งบประมาณจำกัดและไม่มีการใช้แคชซ้ำ;
  • สถานการณ์ที่ไม่ยอมรับการเก็บข้อมูลเฝ้าระวังความปลอดภัย 30 วันตามค่าเริ่มต้น และไม่เข้าเงื่อนไขข้อยกเว้นขององค์กร;
  • เวิร์กโฟลว์ที่ต้องการให้ทุกคำขอด้านความปลอดภัยไซเบอร์หรือวิทยาศาสตร์ชีวภาพไม่ trigger การปรับลดระดับ

ดูงานระยะยาวจากระยะไกลได้อย่างไร

คุณค่าของ Fable 5.1 มักปรากฏในงานที่ใช้เวลาหลายชั่วโมงหรือยาวเป็นหลายวัน แต่ไม่ได้หมายความว่าคนต้องนั่งเฝ้าเครื่องพัฒนา (development machine) ตลอดเวลา ขั้นแรกให้ยืนยันว่า Fable 5.1 พร้อมใช้งานใน Claude Code 2.1.250+ บนเครื่องตัวเองก่อน จากนั้นจึงดูเซสชัน Claude Code บนเครื่องพัฒนาเครื่องเดียวกัน โต้ตอบ และสั่งงานต่อได้ผ่าน PandaNpc Agent จากเบราว์เซอร์ เดสก์ท็อป หรือโทรศัพท์มือถือ

สิ่งที่เปลี่ยนไปคือช่องทางควบคุม ส่วนโค้ด เครื่องมือ และการ build ยังคงทำงานบนเครื่องพัฒนาของคุณอยู่ แนะนำให้อ่านคู่มือการเข้าถึง Claude Code จากระยะไกลและบทช่วยสอนการเชื่อมต่อ Claude Code ผ่านมือถือก่อน แล้วค่อยมอบงานระยะยาวให้ Fable 5.1 เมื่อยืนยันแล้วว่าเส้นทางรีโมตใช้งานได้

คำถามที่พบบ่อย (FAQ)

Fable 5.1 เก่งกว่า Fable 5 แค่ไหน?

ความแตกต่างกันมากตามประเภทงาน Terminal-Bench-Science เพิ่มขึ้น 27.9 จุดเปอร์เซ็นต์ AutomationBench เพิ่มขึ้น 14.3 จุดเปอร์เซ็นต์ ขณะที่ HLE เมื่อใช้เครื่องมือเพิ่มขึ้นเพียง 1.2 จุดเปอร์เซ็นต์ ไม่ควรใช้ตัวเลขเพิ่มสูงสุดเพียงค่าเดียวเป็นตัวแทนของทุกงาน

Fable 5.1 เร็วกว่า Opus 5 ไหม?

ในตารางความหน่วงสัมพัทธ์อย่างเป็นทางการ Fable 5.1 อยู่ในระดับ "ค่อนข้างช้า" ส่วน Opus 5 อยู่ที่ "ปานกลาง" พาร์ตเนอร์บางรายสังเกตว่า Fable 5.1 เร็วกว่าเมื่อวัดจากงานที่ทำเสร็จทั้งงาน เพราะมันใช้ token น้อยกว่าและทำงานซ้ำน้อยกว่า ข้อสรุปทั้งสองแบบวัดคนละสิ่งกัน

Fable 5.1 เหมาะกับการเขียนโปรแกรมมากกว่า GPT-5.6 Sol หรือไม่?

ในตารางประกาศของ Anthropic Fable 5.1 ทำคะแนนสูงกว่าใน Terminal-Bench-Science, Terminal-Bench, AutomationBench และ CursorBench แต่โมเดลแต่ละตัวใช้ Agent harness, effort, เครื่องมือ และราคาที่ต่างกัน จึงไม่อาจยืนยันจากข้อมูลนี้ได้ว่ารีโพซิทอรีจริงทั้งหมด Fable จะเป็นฝ่ายชนะ ดูบทช่วยสอนการกำหนดค่า GPT-5.6 Sol 1M contextประกอบได้ แล้วลอง A/B test ด้วยงานตัวแทนของคุณเอง

ทำไม Fable 5.1 ถึงสลับไปเป็น Opus กะทันหัน

คำขอบางรายการด้านความปลอดภัยไซเบอร์และวิทยาศาสตร์ชีวภาพจะถูก Route ไปที่ Opus โดย safeguards การสลับโมเดลไม่จำเป็นต้องเป็นความผิดปกติ; Anthropic ระบุว่าคำขอที่ถูก Route ประเภทนี้จะไม่คิดเงินในราคา Fable

Fable 5.1 มีลายน้ำไหม

มีกลไก content provenance เชิงสถิติ แต่จะไม่เพิ่มฉลากที่มองเห็นได้บนพื้นผิวของข้อความ มันคนละเรื่องกับลายน้ำแบบมองเห็นได้ตามมุมรูปภาพ

สรุป

ความก้าวหน้าที่ชัดเจนที่สุดของ Claude Fable 5.1 กระจุกตัวอยู่ที่งานวิจัยวิทยาศาสตร์ งานเทอร์มินัล และเวิร์กโฟลว์ธุรกิจข้ามแอป: มันสามารถทำงานต่อเนื่อง กู้คืนจากความล้มเหลว ตรวจสอบผลลัพธ์ได้ดีขึ้น และยังลดต้นทุนงานระยะยาวผ่านการอ่านแคชที่ถูกลง แต่มันก็ยังราคาสูง ความหน่วงต่อรอบช้ากว่า และนำการเปลี่ยนแปลงด้านความเข้ากันได้ในเรื่อง thinking blocks การบังคับเรียกใช้เครื่องมือ และการแก้ไขประวัติมาด้วย

คำถามที่ถูกต้องในการเลือกมันไม่ใช่ "มันเป็นที่หนึ่งในคะแนนหรือไม่" แต่คือ: งานของคุณยาวพอ ซับซ้อนพอ และต้นทุนของความล้มเหลวกับการทำงานซ้ำสูงพอที่จะคุ้มค่ากับการใช้ Fable 5.1 หรือไม่ หากคำตอบคือไม่ โดยทั่วไปการเริ่มจาก Opus 5 หรือ Sonnet 5 จะเหมาะสมกว่า

Codex เปิดใช้งาน GPT-5.6 Sol 1M บริบท: บทช่วยสอนการกำหนดค่า 3 บรรทัดใน `config.toml`

Codex เปิดใช้งาน GPT-5.6 Sol 1M บริบท: บทช่วยสอนการกำหนดค่า 3 บรรทัดใน `config.toml`

GPT-5.6 Sol รองรับบริบท 1.05 ล้าน token อย่างเป็นทางการ เพียงเพิ่มการกำหนดค่า 3 บรรทัดที่ด้านบนของ config.toml ของ Codex ก็สามารถรันด้วยหน้าต่าง 1 ล้าน และบีบอัดประวัติอัตโนมัติที่ประมาณ 9 แสน token พร้อมการกำหนดค่าแบบถาวร คำสั่งครั้งเดียว การตรวจสอบ และการแจ้งเตือนค่าใช้จ่าย

อ่านบทความ →
Claude Code Remote Control ใช้งานอย่างไร? ควบคุมระยะไกลจากมือถือ ข้อจำกัดอย่างเป็นทางการและทางเลือก (2026)

Claude Code Remote Control ใช้งานอย่างไร? ควบคุมระยะไกลจากมือถือ ข้อจำกัดอย่างเป็นทางการและทางเลือก (2026)

Claude Code Remote Control เปิดใช้งานอย่างไร? บทความนี้ให้วิธีใช้งานอย่างเป็นทางการสามแบบ: claude remote-control, claude --remote-control และ /remote-control อธิบายการเชื่อมต่อมือถือและเบราว์เซอร์ ข้อกำหนดบัญชี วิธีการยืนยันตัวตน และข้อผิดพลาดที่พบบ่อย พร้อมเปรียบเทียบโซลูชัน PandaNpc ในสถานการณ์โมเดลที่กำหนดเอง Codex และหลายเครื่อง

อ่านบทความ →
เชื่อมต่อมือถือกับ Claude Code: ดูเซสชันและอนุมัติเครื่องมือบน iOS ได้ทุกที่

เชื่อมต่อมือถือกับ Claude Code: ดูเซสชันและอนุมัติเครื่องมือบน iOS ได้ทุกที่

บทความนี้เขียนขึ้นสำหรับนักพัฒนา แนะนำแนวทางปฏิบัติที่ดีที่สุดในการเชื่อมต่อ Claude Code ผ่านโทรศัพท์มือถือ ใช้แอป PandaNpc บน iOS เพื่อดูเซสชันแบบเรียลไทม์ อนุมัติการเรียกใช้เครื่องมือ และตอบคำถาม พร้อมใช้ pandapaw และ iOS Live Activity เพื่อควบคุมระยะไกลอย่างมีประสิทธิภาพ เพิ่มความยืดหยุ่นในการเขียนโค้ด

อ่านบทความ →