Claude Fable 5.1 — полный разбор: бенчмарки, улучшения, цена и скорость

Полные результаты Claude Fable 5.1 по 7 основным категориям бенчмарков, по пунктам сравнение с Fable 5, Opus 5 и GPT-5.6 Sol, а также описание длительных задач, вызова инструментов, стоимости кэша, скорости, ограничений тарифных планов и изменений миграции в версии 5.1.

PandaNpcВпервые опубликовано
Claude Fable 5.1 — полный разбор: бенчмарки, улучшения, цена и скорость

Claude Fable 5.1 официально вышел 1 сентября 2026 года. Сразу к сути: это не обычное обновление модели для повседневных вопросов и ответов, а дорогостоящая флагманская модель для длительного программирования, сложных исследований, кросс-приложенческих вызовов инструментов и автономных Agent. Во всех семи основных категориях бенчмарков, опубликованных Anthropic, Fable 5.1 превзошёл Fable 5; однако его цена за API по-прежнему вдвое выше, чем у Opus 5, а официальная относительная задержка помечена как «медленнее».

Если ваша задача — просто изменить один файл, написать короткий текст или ответить на обычный вопрос, Anthropic по-прежнему рекомендует начинать с Opus 5. Fable 5.1 лучше подходит для длинных цепочек задач, которые обычные модели не могут стабильно выполнить даже при высоком effort. В этой статье мы собрали вместе официальные данные релиза, смысл каждого бенчмарка, конкретные улучшения 5.1, цены, скорость и ограничения при миграции, чтобы вы не опирались только на одну «победную» таблицу бенчмарков.

Характеристики Fable 5.1 в одной таблице

Параметр Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
Контекстное окно 1M token 1M token 1M token
Максимальный вывод 128K token 128K token 128K token
Цена за ввод $10 / MTok $5 / MTok $2 / MTok
Цена за вывод $50 / MTok $25 / MTok $10 / MTok
Относительная задержка Медленнее Средняя Быстрая
Thinking Adaptive, всегда включён Adaptive Adaptive
Effort по умолчанию High High High
Надёжная дата отсечки знаний июнь 2026 май 2026 январь 2026

«Медленнее» здесь взято из каталога моделей Anthropic; это уровень относительной задержки, а не фиксированное число токенов в секунду. Сколько реально займёт выполнение задачи, зависит от effort, числа раундов вызова инструментов, доли попаданий в кэш, длины контекста и количества повторных попыток после сбоев.

Длительный рабочий процесс Agent на Fable 5.1 — от планирования до проверки
Fable 5.1 рассчитан не на одноразовые ответы, а на длительные задачи с постоянным планированием, выполнением, восстановлением, проверкой и отчётами.

Полная таблица основных бенчмарков Fable 5.1

Таблица ниже напрямую воспроизводит основную таблицу со страницы анонса Anthropic от 1 сентября 2026 года. Чтобы избежать неверных трактовок, проценты, исходные баллы GDPval-AA, результаты OSWorld в режимах partial/strict и результаты HLE с инструментами и без инструментов приведены раздельно. Для каждого бенчмарка сохранено официальное английское название, а под ним на следующей строке дан русский перевод; в других языковых версиях под английским названием также показывается соответствующий локализованный перевод.

| Область | Бенчмарк | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 против Fable 5 | |---|---:|---:|---:|---:|---:| | Агентные научные исследования | Terminal-Bench-Science 0.1
Терминальный бенчмарк агентных научных исследований | 52.6% | 24.7% | 29.0% | 22.4% | +27.9 п. п. | | Агентное программирование в терминале | Terminal-Bench 4.0
Бенчмарк агентного программирования в терминале | 55.8% | 42.0% | 52.3% | 37.3% | +13.8 п. п. | | Профессиональная интеллектуальная работа | GDPval-AA v2
Бенчмарк реальных профессиональных задач с экономической ценностью | 1853 | 1723 | 1824 | 1711 | +130 баллов | | Управление компьютером | OSWorld 2.0 — Partial
Бенчмарк реального управления компьютером: частичное выполнение | 77.9% | 72.9% | 75.4% | — | +5.0 п. п. | | Управление компьютером | OSWorld 2.0 — Strict
Бенчмарк реального управления компьютером: строгое выполнение | 41.7% | 36.1% | 39.6% | — | +5.6 п. п. | | Междисциплинарные рассуждения | Humanity's Last Exam — No tools
«Последний экзамен человечества»: без инструментов | 60.9% | 57.8% | 56.6% | — | +3.1 п. п. | | Междисциплинарные рассуждения | Humanity's Last Exam — With tools
«Последний экзамен человечества»: с инструментами | 65.0% | 63.8% | 63.6% | — | +1.2 п. п. | | Бизнес-процессы | AutomationBench
Бенчмарк кросс-приложенческой бизнес-автоматизации | 31.4% | 17.1% | 26.9% | 19.6% | +14.3 п. п. | | Агентное программирование | CursorBench 3.2.0
Бенчмарк реальных многофайловых задач программирования | 73.4% | 70.5% | 70.0% | 67.2% | +2.9 п. п. |

— означает, что в этой основной таблице Anthropic не привёл соответствующий результат, а не то, что модель не может выполнить задачу. В Terminal-Bench 4.0 Mythos 5.1, у которого меньше ограничений и который доступен только доверенным программам, получил 60.9%; эта статья сосредоточена на Fable 5.1, доступном обычным пользователям, и не смешивает результаты Mythos в колонку Fable.

Что измеряет Terminal-Bench-Science 0.1

Terminal-Bench-Science 0.1 содержит 70 реальных исследовательских рабочих процессов из пяти областей: науки о жизни, физические науки, науки о Земле, математика и инженерия. Задачи — это не вопросы с вариантами ответов: агенту нужно в терминале выполнить анализ данных, статистический вывод, симуляции, оптимизацию, доказательство теорем, реконструкцию изображений или научное машинное обучение, а затем проверить результаты с помощью воспроизводимых тестов.

52.6% у Fable 5.1 против 24.7% у Fable 5 в официальных воспроизводимых экспериментах — это рост на 27.9 процентного пункта, самый заметный скачок во всей таблице. Но официально для каждой модели указана стандартная ошибка около ±3.5–4.5 процентного пункта, поэтому нельзя считать цифру после запятой абсолютно точным местом в рейтинге.

Что измеряют Terminal-Bench 4.0 и CursorBench 3.2.0

Terminal-Bench предлагает агенту решать сложные задачи в реальной терминальной среде; главное — сможет ли он понять окружение, вызвать инструменты, изменить файлы и в итоге пройти проверку. Fable 5.1 получил 55.8% — это на 13.8 п. п. выше, чем у Fable 5, и выше, чем 52.3% у Opus 5.

CursorBench 3.2 состоит из нечётких многофайловых задач из реальных сессий Cursor; версия 3.2 добавила задания на следование инструкциям и продвинутое использование инструментов. Fable 5.1 Max получил 73.4% — преимущество не такое впечатляющее, как в Terminal-Bench-Science, но в среднем на задачу он тратит 72,060 token и $9.64, тогда как Fable 5 Max — 103,525 token и $17.32. Здесь важнее снижение расхода токенов и стоимости при выполнении аналогичных задач, чем сами 2.9 п. п.

Что измеряет GDPval-AA v2

GDPval-AA v2 использует 220 задач, разработанных отраслевыми профессионалами и охватывающих 44 профессии и 9 отраслей, чтобы оценить способность модели справляться с реальной интеллектуальной работой, имеющей экономическую ценность. Результат 1853 — это комплексная оценка, а не 1853%. Этот результат показывает, что Fable 5.1 превосходит Fable 5 в профессиональных документах, анализе и итоговых материалах, а также немного опережает Opus 5.

Почему у OSWorld 2.0 два показателя

OSWorld 2.0 содержит 108 длинных многошаговых рабочих процессов управления компьютером; медианное время выполнения задания человеком — около 1.6 часа. Режим Partial начисляет частичные баллы по нескольким контрольным точкам; режим Strict засчитывает успех только при полном достижении цели.

Поэтому 77.9% в режиме partial и 41.7% в режиме strict у Fable 5.1 не противоречат друг другу: модель часто выполняет большую часть шагов, но часть задач так и не доводит до конца. Это также напоминает: то, что компьютерный Agent «выглядит так, будто постоянно работает», ещё не значит, что задача выполнена успешно.

Что измеряет Humanity's Last Exam

Humanity's Last Exam создан Center for AI Safety совместно с Scale AI и содержит 2500 междисциплинарных вопросов экспертного уровня, на которые трудно ответить простым поиском. Без инструментов Fable 5.1 превосходит Fable 5 на 3.1 п. п., а с инструментами — только на 1.2 п. п. Он действительно сильнее, но не по всем бенчмаркам результаты выросли вдвое.

Что измеряет AutomationBench

AutomationBench проверяет, может ли агент выполнять рабочие процессы продаж, маркетинга, операционной деятельности, поддержки клиентов, финансов и HR в смоделированных SaaS-инструментах: CRM, почте, календаре, мессенджерах и системах управления проектами. Fable 5.1 вырос с 17.1% до 31.4%, то есть примерно на 84% в относительном выражении — это говорит о существенном прогрессе 5.1 в управлении состоянием множества приложений и выполнении длинных последовательностей шагов. Но и 31.4% показывают, что подобная автоматизация бизнес-процессов без участия человека всё ещё далека от решения.

Матрица покрытия возможностей Fable 5.1 по семи основным категориям бенчмарков
Семь категорий бенчмарков охватывают научные исследования, программирование в терминале, профессиональную интеллектуальную работу, управление компьютером, междисциплинарные рассуждения, бизнес-процессы и многофайловое программирование.

Что улучшилось в Fable 5.1 по сравнению с Fable 5

1. В длительных задачах меньше срезания углов

Anthropic позиционирует Fable 5.1 как модель для длительных агентских задач: сначала планирование, затем использование инструментов, восстановление после сбоев, проверка результатов и активные отчёты о прогрессе. Она делает больший акцент на устранении первопричины, а не на локальных обходных путях, лишь бы конкретный тест побыстрее стал зелёным. Официально перечисленные целевые сценарии включают работу с функциональностью в нескольких кодовых базах, ревью кода, оптимизацию производительности, многодневные автономные сессии, исследования, документацию, таблицы и презентации.

2. Низкий effort может приближаться к дорогим результатам предыдущего поколения

Fable 5.1 получил возможность настраивать effort по сообщениям. Официальные кривые затрат показывают, что при Low или Medium effort на некоторых задачах он достигает или превосходит Fable 5, одновременно снижая расход токенов и средств. Claude Code по умолчанию использует High effort; Claude.ai и Cowork — Medium. При сравнении моделей нужно сначала проверить effort: нельзя напрямую сопоставлять результаты с разных уровней.

3. Между вызовами инструментов можно показывать читаемый прогресс

API добавил тестовую возможность display: "updates": модель может выдавать пользователю обновления о прогрессе между вызовами инструментов. Для задач, которые выполняются часами, по таким обновлениям проще понять, что именно делает модель и не сбилась ли она с цели, чем если просто наблюдать, как одна за другой появляются карточки инструментов.

4. Полнее стали письмо, визуальная проверка и самотестирование

По заявлению Anthropic, 5.1 активно пишет тесты для проверки собственных изменений и использует визуальные возможности, чтобы сверять вывод с дизайн-целями. Отзывы партнёров тоже сходятся на том, что отчёты о прогрессе стали понятнее, ответы на многосоставные вопросы полнее, цепочки вызовов прослеживаются через несколько сервисов, а читаемость сохраняется даже после долгой работы. Это качественная обратная связь, и её не стоит выдавать за единый вывод бенчмарков.

5. Блокировки безопасности стали точнее, но не исчезли

Число ложных срабатываний защиты в области кибербезопасности у Fable 5.1 примерно на 60% ниже, чем при запуске Fable 5, а базовые биологические и медицинские вопросы стали примерно на 85% реже приводить к понижению уровня. Теперь модель можно использовать для поиска уязвимостей в ПО, но задачи двойного назначения — пентесты, генерация эксплоит-кода, сканирование бинарных уязвимостей — по-прежнему могут направляться в Opus. После такой маршрутизации оплата идёт не по цене Fable.

6. Появилась маркировка происхождения контента

Fable 5.1 вводит content provenance. Сгенерированный текст может содержать статистический водяной знак, который проверяется инструментом Anthropic для проверки контента. Никаких видимых меток в тексте не появляется, но для контентных платформ, образования и корпоративного аудита это новая особенность, о которой стоит знать заранее.

Шесть ключевых улучшений Fable 5.1 по сравнению с предыдущим поколением
Изменения в 5.1 сфокусированы на длительных задачах, эффективности при низком effort, отчётах о прогрессе, самопроверке, меньшем числе ложных срабатываний и маркировке происхождения контента.

Как рассчитывается стоимость Fable 5.1

Позиция Цена Fable 5.1 Сравнение с Fable 5
Ввод $10 / 1 млн token Без изменений
Вывод $50 / 1 млн token Без изменений
Запись в кэш на 5 минут $12.50 / 1 млн token Тот же уровень
Запись в кэш на 1 час $20 / 1 млн token Тот же уровень
Чтение из кэша $0.25 / 1 млн token Снижение на 75%
Batch API 50% от цены за ввод и вывод По правилам Batch

Предположим, что за одну длительную задачу накоплено 10 млн токенов чтения из кэша, 200 тыс. новых входных токенов и 50 тыс. выходных токенов, без учёта записи в кэш:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

Те же 10 млн чтений из кэша у Fable 5 стоили бы около $10, так что только на этом пункте разница составляет $7.50. Исходя из этого, Anthropic оценивает снижение реальной стоимости типичных задач с оплатой по токенам примерно в 25%, а для сильно агентных задач с частым переиспользованием длинного контекста — до 45%. Это не общее снижение ценника API, а правило: чем больше попаданий в кэш, тем заметнее экономия.

Подписчики не обязательно получают скидку на кэш API напрямую

Владельцы Max, а также premium-мест Team/Enterprise могут направлять на модели Fable до 50% недельной квоты; Pro и стандартные места с самого начала расходуют usage credits. Точный расход показывает страница Usage в аккаунте. Снижение стоимости чтения из кэша — это в первую очередь изменение для сценариев с оплатой по токенам: нельзя пересчитывать скидку 75% на кэш в API как «в тарифе Max можно использовать в четыре раза больше».

Структура стоимости ввода, вывода и кэша Fable 5.1
Цены за ввод и вывод у Fable 5.1 не изменились: основное снижение даёт чтение из кэша, и чем больше переиспользуется длинный контекст, тем выгоднее.

Насколько быстр Fable 5.1 на самом деле

Ответ: отдельные ответы медленнее, но общее время выполнения сложной задачи может быть меньше.

  • В каталоге моделей Anthropic Fable 5.1 помечен как Slower, Opus 5 — как Moderate, Sonnet 5 — как Fast.
  • Claude Code по умолчанию использует High effort, поэтому естественно тратит больше времени на рассуждения, чем при Low или Medium.
  • На своих рабочих нагрузках Every сообщает, что Fable 5.1 примерно вдвое быстрее Opus 5 и расходует вдвое меньше token; это специфичный тест партнёра, а не общая гарантия скорости.
  • В CursorBench Fable 5.1 Max в среднем проходит 70 шагов, используя 72,060 token; Fable 5 Max — те же 72 шага, но со 103,525 token. Преимущество 5.1 больше похоже на «меньше блужданий и меньше токенов», и оно не обязательно проявляется как более быстрый первый ответ.

Поэтому для чата, короткого кода и частого интерактива стоит предпочесть Sonnet 5 или Opus 5; а Fable 5.1 имеет смысл рассматривать для отладки в нескольких кодовых базах, длительных исследований и автономных задач, требующих самостоятельной проверки.

Изменения совместимости, которые нужно учесть перед переходом на Fable 5.1

Обновите Claude Code минимум до 2.1.250

В описании тарифов и доступности от Anthropic указано, что требуется Claude Code 2.1.250 или новее. Если Fable 5.1 не отображается, сначала проверьте:

bash
claude --version

Затем обновитесь официальным способом для Claude Code и перезапустите сессию. API model ID для Fable 5.1:

text
claude-fable-5-1

Принудительный вызов инструмента (forced tool use) может завершиться ошибкой

Если запрос принудительно требует, чтобы модель вызвала конкретный инструмент, Fable 5.1 может вернуть ошибку. Перед миграцией проверьте tool_choice и процессы принудительного вызова инструментов в собственных агентах; не предполагайте, что поведение Fable 5 полностью совместимо.

Thinking blocks нельзя свободно переносить между моделями

Более старые модели не могут читать thinking blocks от Fable 5.1. При переключении модели allow SDK обрабатывать эти блоки по официальным правилам, а не передавать их как есть другой модели.

Изменение старой истории может привести к ошибке 400

Для новых API-аккаунтов, созданных после 31 августа 2026 года, thinking blocks действительны только в том исходном префиксе диалога, в котором были созданы. Если изменить system, tools или более ранние сообщения, а затем воспроизвести thinking blocks, возможна ошибка 400. Официально рекомендуется хранить историю в режиме append-only; когда нужно сжать контекст, заменяйте всю старую историю одним новым саммари и не редактируйте старые раунды, сохраняя исходные thinking blocks. Подробный порядок действий — в руководстве по подсказкам и миграции Fable 5.1.

Когда стоит выбирать Fable 5.1

Подходит:

  • длинные задачи в нескольких репозиториях, сервисах или приложениях;
  • агенты, которые должны работать часами и самостоятельно восстанавливаться после сбоев;
  • научные исследования, сложный анализ данных и многоэтапные профессиональные результаты;
  • трудно воспроизводимые системные проблемы, оптимизация производительности и поиск первопричин;
  • API-нагрузки с интенсивным переиспользованием длинного контекста и высокой долей чтения из кэша.

Не подходит:

  • простой чат, короткие тексты или небольшие правки в одном файле;
  • интерактив в реальном времени, критичный к задержке первого ответа;
  • задачи с большим объёмом вывода при фиксированном бюджете и без переиспользования кэша;
  • сценарии, в которых неприемлемо хранение данных безопасности в течение 30 дней по умолчанию и которые не подпадают под корпоративные исключения;
  • рабочие процессы, в которых нужно, чтобы ни один запрос по кибербезопасности или наукам о жизни не приводил к понижению уровня.

Как удалённо наблюдать за длительными задачами

Ценность Fable 5.1 чаще всего проявляется в задачах, которые идут часами или даже днями, но это не значит, что человек должен постоянно сидеть за машиной разработки. Сначала убедитесь, что Fable 5.1 доступен в локальном Claude Code 2.1.250+, затем через PandaNpc Agent просматривайте сессии Claude Code на той же машине разработки, отвечайте на интерактивные запросы и отдавайте новые команды — из браузера, с десктопа или телефона.

Меняется только точка входа; код, инструменты и сборка по-прежнему выполняются на вашей машине разработки. Сначала прочитайте руководство по удалённому доступу к Claude Code и урок по подключению к Claude Code с телефона, убедитесь, что удалённая связь работает, и только потом запускайте на Fable 5.1 длительные задачи.

FAQ (часто задаваемые вопросы)

Насколько Fable 5.1 сильнее Fable 5?

Разница сильно зависит от задачи. Terminal-Bench-Science — плюс 27.9 процентного пункта, AutomationBench — плюс 14.3 п. п.; в HLE с инструментами прирост всего 1.2 п. п. Нельзя судить обо всех задачах по одному максимальному приросту.

Быстрее ли Fable 5.1, чем Opus 5?

В официальной таблице относительной задержки Fable 5.1 указан как «медленнее», а Opus 5 — как «средний». Некоторые партнёры на полных задачах наблюдают, что Fable 5.1 быстрее, потому что он тратит меньше token и реже переделывает работу. Эти два вывода измеряют разные вещи.

Подходит ли Fable 5.1 для программирования лучше, чем GPT-5.6 Sol?

В таблицах Anthropic Fable 5.1 выше в Terminal-Bench-Science, Terminal-Bench, AutomationBench и CursorBench; но у разных моделей разные агентные обвязки (harness), effort, инструменты и цены, поэтому на этом основании нельзя утверждать, что Fable побеждает во всех реальных репозиториях. Можно изучить гайд по настройке GPT-5.6 Sol с контекстом 1M и провести A/B-тест на своих репрезентативных задачах.

Почему Fable 5.1 внезапно переключается на Opus?

Часть запросов по кибербезопасности и наукам о жизни направляется в Opus защитными механизмами (safeguards). Переключение модели — не обязательно сбой; Anthropic сообщает, что такие перенаправленные запросы не тарифицируются по цене Fable.

Есть ли у Fable 5.1 водяной знак?

Да, это статистический механизм content provenance, но он не добавляет видимых меток на поверхность текста. Это не то же самое, что видимый водяной знак в углу изображения.

Итоги

Самый заметный прогресс Claude Fable 5.1 — в научных исследованиях, терминальных задачах и кросс-приложенческих бизнес-процессах: он лучше удерживает выполнение, восстанавливается после сбоев, проверяет результаты и за счёт более дешёвого чтения из кэша снижает стоимость длительных задач. Но он по-прежнему дорог, медлителен на уровне отдельных ответов и приносит изменения совместимости, связанные с thinking blocks, принудительным вызовом инструментов и редактированием истории.

Правильный вопрос при выборе — не «первый ли он в бенчмарках», а: достаточно ли длинна и сложна ваша задача и так ли высока цена сбоев и переделок, чтобы оправдать использование Fable 5.1. Если ответ отрицательный, обычно разумнее начинать с Opus 5 или Sonnet 5.

Codex: включаем GPT-5.6 Sol 1M контекст — руководство по настройке из 3 строк в `config.toml`

Codex: включаем GPT-5.6 Sol 1M контекст — руководство по настройке из 3 строк в `config.toml`

GPT-5.6 Sol официально поддерживает контекст в 1,05 млн токенов. Достаточно добавить 3 строки конфигурации в начало config.toml в Codex, чтобы работать с окном в 1 млн токенов и автоматически сжимать историю примерно при 900 тыс. токенов. Прилагаются постоянная конфигурация, разовая команда, проверка и напоминание о стоимости.

Читать статью →
Как использовать Claude Code Remote Control? Удалённое управление с телефона, официальные ограничения и альтернативы (2026)

Как использовать Claude Code Remote Control? Удалённое управление с телефона, официальные ограничения и альтернативы (2026)

Как включить Claude Code Remote Control? В этой статье описаны три официальных способа использования: claude remote-control, claude --remote-control и /remote-control, объясняется подключение телефона и браузера, требования к учётной записи, методы проверки и распространённые ошибки, а также сравниваются варианты PandaNpc в сценариях с пользовательской моделью, Codex и несколькими машинами.

Читать статью →
Подключение Claude Code с телефона: инструмент iOS для просмотра сессий и утверждения действий в любое время

Подключение Claude Code с телефона: инструмент iOS для просмотра сессий и утверждения действий в любое время

Эта статья предназначена для разработчиков и рассказывает о лучших практиках подключения к Claude Code с телефона. С помощью приложения PandaNpc iOS можно в реальном времени просматривать сеансы, одобрять вызовы инструментов и отвечать на вопросы, а благодаря pandapaw и iOS Live Activity обеспечивается эффективное удалённое управление, повышающее гибкость кодинга.

Читать статью →