Claude Fable 5.1: повний аналіз — бенчмарки, покращення, ціни та швидкість
Повні результати Claude Fable 5.1 за 7 основними категоріями бенчмарків, порівняння за пунктами з Fable 5, Opus 5, GPT-5.6 Sol, а також пояснення довгих завдань, викликів інструментів, витрат на кешування, швидкості, обмежень тарифних планів і змін міграції у 5.1.

Claude Fable 5.1 було офіційно випущено 1 вересня 2026 року. Одразу до висновку: це не звичайне оновлення моделі для загальних запитань і відповідей, а високовартісна флагманська модель, призначена для тривалого програмування, складних досліджень, викликів інструментів між застосунками та автономних агентів. У 7 основних категоріях бенчмарків, опублікованих Anthropic, Fable 5.1 перевершує Fable 5 у всіх; однак ціна її API удвічі вища, ніж в Opus 5, а відносну затримку офіційно позначено як «повільнішу».
Якщо ваше завдання — лише змінити один файл, написати короткий текст або відповісти на звичайне запитання, Anthropic усе ще радить починати з Opus 5. Fable 5.1 краще підходить для довгих багатокрокових завдань, які звичайні моделі не можуть стабільно виконати навіть із високим effort. Ця стаття зводить докупи офіційні дані запуску, значення кожного бенчмарка, конкретні покращення 5.1, ціни, швидкість та обмеження міграції, щоб ви не покладалися лише на один графік «хто переміг».
Уся специфікація Fable 5.1 в одній таблиці
| Параметр | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Контекстне вікно | 1 млн токенів | 1 млн токенів | 1 млн токенів |
| Максимальний вивід | 128K токенів | 128K токенів | 128K токенів |
| Ціна за вхідні токени | $10 / 1 млн токенів | $5 / 1 млн токенів | $2 / 1 млн токенів |
| Ціна за вихідні токени | $50 / 1 млн токенів | $25 / 1 млн токенів | $10 / 1 млн токенів |
| Відносна затримка | Повільніша | Помірна | Швидка |
| Thinking | Adaptive, завжди увімкнено | Adaptive | Adaptive |
| Стандартний effort | High | High | High |
| Достовірний зріз знань | червень 2026 | травень 2026 | січень 2026 |
Тут «повільніша» взято з каталогу моделей Anthropic — це рівень відносної затримки, а не фіксована кількість токенів за секунду. Скільки реально триватиме виконання завдання, залежить також від effort, кількості раундів викликів інструментів, частоти влучань у кеш, довжини контексту та кількості повторних спроб після помилок.
Повна таблиця основних бенчмарків Fable 5.1
У таблиці нижче безпосередньо використано головну таблицю зі сторінки запуску Anthropic від 1 вересня 2026 року. Щоб уникнути хибних тлумачень, відсотки, сирі бали GDPval-AA, результати partial/strict для OSWorld і результати HLE з інструментами та без інструментів наведено окремо. Кожен бенчмарк зберігає офіційну англійську назву, а в наступному рядку подано його українську назву.
| Категорія | Бенчмарк | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 проти Fable 5 |
|---|---|---|---|---|---|---|
| Агентні наукові дослідження | Terminal-Bench-Science 0.1 Термінальний бенчмарк для наукових досліджень агентів |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 в. п. |
| Агентне термінальне програмування | Terminal-Bench 4.0 Термінальний бенчмарк для програмування агентів |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 в. п. |
| Професійна розумова робота | GDPval-AA v2 Бенчмарк професійних завдань реальної економічної цінності |
1853 | 1723 | 1824 | 1711 | +130 балів |
| Керування комп'ютером | OSWorld 2.0 — Partial Бенчмарк керування комп'ютером: часткове виконання |
77.9% | 72.9% | 75.4% | — | +5.0 в. п. |
| Керування комп'ютером | OSWorld 2.0 — Strict Бенчмарк керування комп'ютером: суворий критерій |
41.7% | 36.1% | 39.6% | — | +5.6 в. п. |
| Багатодисциплінарні міркування | Humanity's Last Exam — No tools Останній іспит людства: без інструментів |
60.9% | 57.8% | 56.6% | — | +3.1 в. п. |
| Багатодисциплінарні міркування | Humanity's Last Exam — With tools Останній іспит людства: з інструментами |
65.0% | 63.8% | 63.6% | — | +1.2 в. п. |
| Бізнес-робочі процеси | AutomationBench Бенчмарк автоматизації бізнес-процесів між застосунками |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 в. п. |
| Агентне програмування | CursorBench 3.2.0 Бенчмарк реальних багатофайлових завдань програмування |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 в. п. |
— означає, що в головній таблиці Anthropic для відповідної моделі не наведено результату; це не означає, що модель не здатна виконати такі завдання. У Terminal-Bench 4.0 Mythos 5.1, яка має менше обмежень і доступна лише за довіреною програмою, отримала 60.9%; ця стаття зосереджена на загальнодоступній Fable 5.1, тож результати Mythos не змішуються з колонкою Fable.
Що вимірює Terminal-Bench-Science 0.1
Terminal-Bench-Science 0.1 містить 70 реальних науково-дослідницьких робочих процесів у п'яти галузях: науки про життя, фізичні науки, науки про Землю, математика та інженерія. Завдання — не тести з варіантами відповідей: агенту потрібно у терміналі виконати аналіз даних, статистичні висновки, симуляції, оптимізацію, доведення теорем, реконструкцію зображень або наукове машинне навчання, а потім перевірити результати відтворюваними тестами.
Результат Fable 5.1 — 52.6% проти 24.7% у Fable 5 в офіційних відтворюваних експериментах: приріст на 27.9 в. п., найбільший стрибок у всій таблиці. Однак офіційно для кожної моделі зазначено стандартну похибку приблизно ±3.5–4.5 в. п., тож не варто сприймати цифру після коми як абсолютно точний рейтинг.
Що вимірюють Terminal-Bench 4.0 та CursorBench 3.2.0
Terminal-Bench змушує агента працювати зі складними завданнями в реальному термінальному середовищі; головне — чи зможе він зрозуміти середовище, викликати інструменти, змінювати файли та зрештою пройти перевірку. Fable 5.1 отримала 55.8% — на 13.8 в. п. більше за Fable 5 і більше, ніж 52.3% в Opus 5.
CursorBench 3.2 використовує розмиті багатофайлові завдання з реальних сесій Cursor; у версії 3.2 додано завдання на дотримання інструкцій і просунуте використання інструментів. Fable 5.1 Max отримала 73.4% — відрив не такий вражаючий, як у Terminal-Bench-Science, проте в середньому вона витрачає 72 060 токенів і $9.64 на завдання, тоді як Fable 5 Max — 103 525 токенів і $17.32. Тут вартіша уваги економія токенів і коштів на виконанні аналогічних завдань, а не самі 2.9 в. п.
Що вимірює GDPval-AA v2
GDPval-AA v2 використовує 220 завдань, розроблених галузевими професіоналами, які охоплюють 44 професії та 9 галузей, щоб оцінити здатність моделі виконувати реальну інтелектуальну роботу з економічною цінністю. Показник 1853 — це комплексна оцінка, а не 1853%. Цей результат свідчить, що Fable 5.1 перевершує Fable 5 у професійних документах, аналізі та результатах роботи, а також дещо перевершує Opus 5.
Чому в OSWorld 2.0 два показники
OSWorld 2.0 містить 108 довгих робочих процесів керування комп'ютером; медіанний час виконання завдання людиною — приблизно 1.6 години. Partial нараховує часткові бали за кількома контрольними точками; Strict зараховує успіх лише за повного досягнення мети.
Тому 77.9% partial і 41.7% strict у Fable 5.1 не суперечать одне одному: модель часто виконує більшість кроків, але частину завдань не доводить до кінця наскрізно. Це також нагадує, що комп'ютерний агент, який «виглядає зайнятим», ще не означає успішного виконання завдання.
Що вимірює Humanity's Last Exam
Humanity's Last Exam створено Center for AI Safety та Scale AI: 2500 міждисциплінарних запитань експертного рівня, на які складно відповісти простим пошуком. Без інструментів Fable 5.1 вища за Fable 5 на 3.1 в. п., а з дозволеними інструментами — лише на 1.2 в. п. Вона справді сильніша, але не на всіх бенчмарках результати зростають удвічі.
Що вимірює AutomationBench
AutomationBench перевіряє, чи може агент виконувати робочі процеси продажів, маркетингу, операцій, підтримки клієнтів, фінансів і кадрів, працюючи з імітованими SaaS-інструментами: CRM, електронною поштою, календарем, повідомленнями та керуванням проєктами. Fable 5.1 зросла з 17.1% до 31.4% — відносне покращення приблизно на 84%, що свідчить про реальний прогрес 5.1 у керуванні станом між застосунками та виконанні довгих послідовностей кроків. Водночас 31.4% показує, що така автономна бізнес-автоматизація досі далека від розв'язання.
Що покращили у Fable 5.1 порівняно з Fable 5
1. Менше зрізаних кутів у довготривалих завданнях
Anthropic позиціонує Fable 5.1 як модель для довготривалих агентних завдань: спершу планування, потім використання інструментів, відновлення після збоїв, перевірка результатів і активне звітування про прогрес. Вона більше зосереджена на усуненні першопричини, а не на локальних обхідних шляхах, аби лише швидше «позеленити» один тест. Офіційні цільові сценарії охоплюють функції в межах кількох кодових баз, рев'ю коду, оптимізацію продуктивності, багатоденні автономні сесії, дослідження, документацію, таблиці та презентації.
2. Низький effort також може наближатися до дорогих результатів попереднього покоління
Fable 5.1 отримала здатність регулювати effort для окремих повідомлень. Офіційні криві вартості показують, що з effort Low або Medium на деяких завданнях вона досягає результатів Fable 5 або перевершує їх, витрачаючи менше токенів і коштів. Claude Code за замовчуванням використовує High effort; Claude.ai і Cowork за замовчуванням — Medium. Порівнюючи моделі, спершу обов'язково звірте effort: не можна ставити поруч результати з різних рівнів.
3. Між викликами інструментів може з'являтися зрозумілий прогрес
У API з'явилася експериментальна можливість display: "updates", яка дозволяє моделі показувати користувачеві оновлення прогресу між викликами інструментів. Для завдань, що тривають годинами, це дає змогу легше зрозуміти, що модель робить і чи не відхилилася від мети, ніж просто спостерігати за нескінченними картками інструментів.
4. Повніше написання, візуальна перевірка та самотестування
За словами розробників, 5.1 активно пише тести, щоб перевірити власні зміни, і використовує візуальні можливості для звірки виходу з дизайн-цілями. Відгуки партнерів також зосереджені на зрозумілішому прогресі, повніших відповідях на багаточастинні запитання, відстеженні ланцюжків викликів між кількома сервісами та збереженні читабельності після довгого виконання. Це якісні відгуки, і їх не варто видавати за узагальнені висновки бенчмарків.
5. Точніші захисні блокування — але вони не зникли
Частота хибних спрацювань захисних механізмів кібербезпеки у Fable 5.1 зменшилася приблизно на 60% порівняно з релізом Fable 5, а базові біологічні та медичні питання приблизно на 85% рідше спричиняють пониження рівня. Тепер її можна використовувати для пошуку вразливостей у ПЗ, але завдання подвійного призначення — як-от пентест, генерація експлойт-коду чи сканування бінарних вразливостей — досі можуть маршрутизуватися на Opus. Після маршрутизації оплата не стягується за цінами Fable.
6. Нова відмітка походження контенту
Fable 5.1 впроваджує content provenance. Згенерований текст може містити статистичний водяний знак, який можна перевірити інструментом перевірки контенту Anthropic. Він не додає видимих позначок у самому тексті, але для контентних платформ, освіти та корпоративних аудитів це нова поведінка, про яку варто знати заздалегідь.
Як розраховується вартість Fable 5.1
| Позиція тарифікації | Ціна Fable 5.1 | Порівняння з Fable 5 |
|---|---|---|
| Вхідні токени | $10 / 1 млн токенів | Без змін |
| Вихідні токени | $50 / 1 млн токенів | Без змін |
| Запис у кеш на 5 хвилин | $12.50 / 1 млн токенів | Той самий рівень |
| Запис у кеш на 1 годину | $20 / 1 млн токенів | Той самий рівень |
| Читання з кешу | $0.25 / 1 млн токенів | Зниження на 75% |
| Batch API | 50% ціни за вхідні та вихідні токени | За правилами Batch |
Припустімо, довге завдання сумарно читає 10 млн токенів з кешу, генерує 200 тис. нових вхідних токенів і 50 тис. вихідних токенів, без урахування запису в кеш:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00Ті самі 10 млн читань із кешу в Fable 5 коштували б приблизно $10, тож лише на цьому пункті різниця становить $7.50. На основі цього Anthropic оцінює, що фактична вартість типових завдань з оплатою за токени може знизитися приблизно на 25%, а для високоагентних завдань із частим повторним використанням довгого контексту — щонайбільше приблизно на 45%. Це не загальне зниження цін на API, а принцип: що більше влучань у кеш, то помітніша економія.
Підписники не обов'язково одразу отримують знижку API на кеш
Преміум-місця Max або Team/Enterprise можуть використовувати до 50% тижневої квоти для моделей Fable; Pro та стандартні місця з самого початку використовують usage credits. Точне споживання дивіться на сторінці Usage в обліковому записі. Зниження ціни на читання з кешу — це переважно зміна для сценаріїв з оплатою за токени, тож не варто прямо перераховувати знижку 75% на кеш в API у «Max дає вчетверо більше».
Наскільки швидкою насправді є Fable 5.1
Відповідь: поодинокі відповіді повільніші, але загальний час виконання складних завдань може бути коротшим.
- У каталозі моделей Anthropic Fable 5.1 позначено як
Slower, Opus 5 — якModerate, а Sonnet 5 — якFast. - Claude Code за замовчуванням використовує High effort, тож природно витрачає більше часу на міркування, ніж Low або Medium.
- На власних робочих навантаженнях Every повідомляє, що Fable 5.1 приблизно вдвічі швидша за Opus 5 і витрачає вдвічі менше токенів; це специфічний тест партнера, а не загальна гарантія швидкості.
- У CursorBench Fable 5.1 Max у середньому робить 70 кроків і витрачає 72 060 токенів; Fable 5 Max також робить 72 кроки, але використовує 103 525 токенів. Перевага 5.1 радше в тому, щоб «менше блукати й витрачати менше токенів», а не обов'язково у швидшій появі першого токена.
Тож для чату, короткого коду та частих інтерактивних дій насамперед обирайте Sonnet 5 або Opus 5; а для налагодження в межах кількох кодових баз, довгих досліджень і автономних завдань, які потребують самостійної перевірки, — тоді вже розглядайте Fable 5.1.
Зміни сумісності, які варто врахувати перед переходом на Fable 5.1
Оновіть Claude Code щонайменше до 2.1.250
У документації Anthropic про плани та доступність вимагається Claude Code 2.1.250 або новіша версія. Якщо Fable 5.1 не відображається, спершу перевірте:
claude --versionПотім оновіться офіційним способом Claude Code і перезапустіть сесію. ID моделі Fable 5.1 в API:
claude-fable-5-1Forced tool use може одразу повертати помилку
Якщо запит примусово вимагає від моделі викликати певний інструмент, Fable 5.1 може повернути помилку. Перед міграцією перевірте tool_choice і процеси примусового виклику інструментів у власних агентах; не припускайте, що поведінка Fable 5 повністю сумісна.
Thinking blocks не можна вільно переносити між моделями
Старіші моделі не можуть читати thinking blocks від Fable 5.1. Під час перемикання моделі дозвольте SDK обробляти ці блоки за офіційними правилами, а не передавайте їх іншій моделі як є.
Зміна старої історії може спричинити помилку 400
Для нових API-акаунтів, створених після 31 серпня 2026 року, thinking blocks дійсні лише в межах того початкового діалогового контексту, у якому їх було згенеровано. Якщо змінити system, tools або ранні повідомлення, а потім відтворити thinking blocks, API може повернути 400. Офіційна рекомендація — зберігати історію в режимі append-only; коли потрібно стиснути, замініть увесь старий фрагмент одним новим стислим підсумком, а не редагуйте старі повідомлення, зберігаючи оригінальні thinking blocks. Докладніше див. у посібнику з підказок і міграції Fable 5.1.
Коли варто обирати Fable 5.1
Підходить для:
- довгих завдань, що охоплюють кілька репозиторіїв, сервісів або застосунків;
- агентів, які працюють годинами й самостійно відновлюються після збоїв;
- наукових досліджень, складного аналізу даних і багатоетапних професійних результатів;
- важко відтворюваних системних проблем, оптимізації продуктивності та пошуку першопричин;
- API-навантажень, які інтенсивно повторно використовують довгий контекст із високою часткою читання з кешу.
Не підходить для:
- простого чату, коротких текстів або дрібних правок в одному файлі;
- інтерактиву реального часу, високочутливого до затримки першого токена;
- завдань з великим виходом за фіксованого бюджету, у яких немає повторного використання кешу;
- сценаріїв, де неприйнятне типове 30-денне зберігання даних моніторингу безпеки і які не підпадають під корпоративні винятки;
- робочих процесів, у яких очікується, що жоден запит із кібербезпеки чи наук про життя не спричинить пониження рівня.
Як віддалено стежити за довгими завданнями
Цінність Fable 5.1 найчастіше проявляється в завданнях, що тривають годинами або навіть днями, але це не означає, що людина мусить постійно сидіти за робочою машиною. Спочатку переконайтеся, що Fable 5.1 доступна в локальному Claude Code 2.1.250+, а потім переглядайте сесії Claude Code на тій самій машині, взаємодійте з ними та віддавайте нові команди через PandaNpc Agent із браузера, десктопа або телефона.
Змінюється лише точка доступу до керування: код, інструменти та збірки, як і раніше, виконуються на вашій машині. Спочатку прочитайте посібник із віддаленого доступу до Claude Code і урок про підключення Claude Code з телефона, і лише після підтвердження віддаленого з'єднання доручайте Fable 5.1 довгі завдання.
Часті запитання (FAQ)
Наскільки Fable 5.1 сильніша за Fable 5?
Різниця дуже залежить від завдання. Terminal-Bench-Science — +27.9 в. п., AutomationBench — +14.3 в. п., а HLE з використанням інструментів — лише +1.2 в. п. Не можна за одним найбільшим приростом судити про всі завдання.
Чи швидша Fable 5.1 за Opus 5?
В офіційній таблиці відносної затримки Fable 5.1 позначена як «повільніша», а Opus 5 — як «помірна». Деякі партнери на повних завданнях спостерігали, що Fable 5.1 швидша, оскільки використовує менше токенів і менше переробляє. Ці два висновки вимірюють не одне й те саме.
Чи краща Fable 5.1 за GPT-5.6 Sol для програмування?
У таблиці Anthropic Fable 5.1 вища в Terminal-Bench-Science, Terminal-Bench, AutomationBench і CursorBench; але різні моделі використовували різні агентні harness, effort, інструменти та ціни, тож із цього не можна робити висновок, що Fable перемагає на всіх реальних кодових базах. Ознайомтеся з уроком налаштування GPT-5.6 Sol із контекстом 1M і зробіть власне A/B-тестування на репрезентативних завданнях.
Чому Fable 5.1 раптом перемикається на Opus?
Частину запитів із кібербезпеки та наук про життя захисні механізми (safeguards) маршрутизують на Opus. Перемикання моделі не обов'язково означає збій; Anthropic повідомляє, що такі маршрутизовані запити не тарифікуються за цінами Fable.
Чи має Fable 5.1 водяний знак?
Так, існує статистичний механізм content provenance, але він не додає видимих позначок на поверхні тексту. Це не те саме, що видимий водяний знак у кутку зображення.
Підсумок
Найпомітніший прогрес Claude Fable 5.1 зосереджений у наукових дослідженнях, термінальних завданнях і міжзастосункових бізнес-процесах: модель краще виконує довгі послідовності, відновлюється після збоїв, перевіряє результати та знижує вартість довгих завдань завдяки дешевшому читанню з кешу. Водночас вона досі дорога, повільніша на окремих відповідях і несе зміни сумісності, пов'язані з thinking blocks, примусовими викликами інструментів і редагуванням історії.
Правильне запитання не «чи перша вона в рейтингах», а: чи достатньо довге й складне ваше завдання, і чи вартість збоїв і переробки настільки висока, що Fable 5.1 того варта. Якщо ні — зазвичай розумніше почати з Opus 5 або Sonnet 5.
Пов'язані посібники

Codex: увімкнення контексту 1M для GPT-5.6 Sol — посібник із налаштування за допомогою 3 рядків `config.toml`
GPT-5.6 Sol офіційно підтримує контекст у 1,05 млн токенів. Достатньо додати 3 рядки конфігурації у верхній частині config.toml у Codex, щоб запустити його з вікном у 1 млн токенів і автоматично стискати історію приблизно на 900 тисяч токенів. Додаються постійна конфігурація, одноразова команда, перевірка та нагадування про вартість.
Читати статтю →
Як користуватися Claude Code Remote Control? Віддалене керування з телефону, офіційні обмеження та альтернативи (2026)
Як увімкнути Claude Code Remote Control? У цій статті наведено три офіційні способи використання: claude remote-control, claude --remote-control і /remote-control. Пояснюються підключення телефону та браузера, вимоги до облікового запису, методи перевірки та поширені помилки. Також порівнюються рішення PandaNpc для сценаріїв із користувацькими моделями, Codex та багатомашинними розгортаннями.
Читати статтю →
Підключення телефона до Claude Code: інструмент iOS для перегляду сесій і затвердження в будь-який час
Ця стаття призначена для розробників і ділиться найкращими практиками підключення до Claude Code з мобільного телефону. За допомогою застосунку PandaNpc iOS можна в реальному часі переглядати сесії, затверджувати виклики інструментів та відповідати на запитання. Завдяки pandapaw та iOS Live Activity реалізується ефективне віддалене керування, що підвищує гнучкість кодування.
Читати статтю →