Claude Fable 5.1: análise completa — benchmarks, melhorias, preço e velocidade

Resultados completos do Claude Fable 5.1 em 7 categorias de benchmarks principais, comparados item por item com Fable 5, Opus 5 e GPT-5.6 Sol, além de explicar as mudanças do 5.1 em tarefas longas, chamadas de ferramentas, custos de cache, velocidade, limites de planos e migração.

PandaNpcPrimeira publicação em
Claude Fable 5.1: análise completa — benchmarks, melhorias, preço e velocidade

O Claude Fable 5.1 foi lançado oficialmente em 1º de setembro de 2026. Vamos direto ao ponto: esta não é uma atualização comum de modelo para perguntas e respostas do dia a dia, mas sim um modelo principal de alto custo preparado para programação de longa duração, pesquisa complexa, chamadas de ferramentas entre aplicativos e Agents não supervisionados. Nos 7 tipos de benchmarks principais divulgados pela Anthropic, o Fable 5.1 supera o Fable 5 em todos; porém, o preço unitário da API ainda é o dobro do Opus 5, e a latência relativa também é oficialmente classificada como "mais lenta".

Se a sua tarefa é apenas corrigir um arquivo, escrever um texto curto ou responder perguntas comuns, a Anthropic ainda recomenda começar pelo Opus 5. O Fable 5.1 é mais adequado para tarefas de cadeia longa que modelos comuns ainda não conseguem concluir com estabilidade mesmo com effort alto. Este artigo reúne os dados do anúncio oficial, o significado de cada benchmark, as melhorias específicas do 5.1, preço, velocidade e limitações de migração, para que você não olhe apenas para uma tabela de "quem venceu".

Especificações do Fable 5.1 em uma tabela

Item Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
Janela de contexto 1M tokens 1M tokens 1M tokens
Saída máxima 128K tokens 128K tokens 128K tokens
Preço de entrada $10 / MTok $5 / MTok $2 / MTok
Preço de saída $50 / MTok $25 / MTok $10 / MTok
Latência relativa Mais lenta Moderada Rápida
Thinking Adaptive, sempre ativado Adaptive Adaptive
Effort padrão High High High
Corte de conhecimento confiável Junho de 2026 Maio de 2026 Janeiro de 2026

O "mais lenta" aqui vem do catálogo de modelos da Anthropic e indica um nível de latência relativa, não um número fixo de tokens por segundo. O tempo real para concluir uma tarefa também depende do effort, do número de rodadas de chamadas de ferramentas, da taxa de acerto de cache, do comprimento do contexto e das tentativas após falhas.

Fluxo de trabalho de agente de longo horizonte do Fable 5.1, do planejamento à verificação
O Fable 5.1 não é voltado para respostas únicas, mas para tarefas longas que exigem planejamento, execução, recuperação, verificação e reporte contínuos.

Tabela completa dos principais benchmarks do Fable 5.1

A tabela abaixo reproduz diretamente a tabela principal da página de lançamento da Anthropic de 1º de setembro de 2026. Para evitar interpretações equivocadas, as porcentagens, as pontuações brutas do GDPval-AA, os resultados partial/strict do OSWorld e os resultados com/sem ferramentas do HLE são listados separadamente. Cada benchmark mantém o nome oficial em inglês, com o nome em português na linha seguinte; outras versões em outros idiomas também exibem a tradução correspondente abaixo do nome em inglês.

Capacidade Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol 5.1 vs. Fable 5
Pesquisa científica com agente Terminal-Bench-Science 0.1
Benchmark de terminal para pesquisa científica com agente
52,6% 24,7% 29,0% 22,4% +27,9 pontos percentuais
Programação em terminal com agente Terminal-Bench 4.0
Benchmark de programação em terminal com agente
55,8% 42,0% 52,3% 37,3% +13,8 pontos percentuais
Trabalho profissional especializado GDPval-AA v2
Benchmark de tarefas profissionais com valor econômico real
1853 1723 1824 1711 +130 pontos
Operação de computador OSWorld 2.0 — Partial
Benchmark real de operação de computador: pontuação de conclusão parcial
77,9% 72,9% 75,4% — +5,0 pontos percentuais
Operação de computador OSWorld 2.0 — Strict
Benchmark real de operação de computador: taxa de conclusão estrita
41,7% 36,1% 39,6% — +5,6 pontos percentuais
Raciocínio multidisciplinar Humanity's Last Exam — No tools
O Último Exame da Humanidade: sem uso de ferramentas
60,9% 57,8% 56,6% — +3,1 pontos percentuais
Raciocínio multidisciplinar Humanity's Last Exam — With tools
O Último Exame da Humanidade: com uso de ferramentas
65,0% 63,8% 63,6% — +1,2 ponto percentual
Fluxo de trabalho comercial AutomationBench
Benchmark de fluxos de trabalho comerciais automatizados entre aplicativos
31,4% 17,1% 26,9% 19,6% +14,3 pontos percentuais
Programação com agente CursorBench 3.2.0
Benchmark real de tarefas de programação com múltiplos arquivos
73,4% 70,5% 70,0% 67,2% +2,9 pontos percentuais

— indica que a tabela principal da Anthropic não forneceu a respectiva pontuação, e não que o modelo não consegue realizar a tarefa. No Terminal-Bench 4.0, o Mythos 5.1, que tem menos restrições e é aberto apenas a programas confiáveis, obteve 60,9%; este artigo foca no Fable 5.1, disponível para usuários comuns, e não mistura os resultados do Mythos na coluna do Fable.

O que o Terminal-Bench-Science 0.1 mede

O Terminal-Bench-Science 0.1 contém 70 fluxos de trabalho reais de pesquisa em cinco grandes áreas: ciências da vida, ciências físicas, ciências da Terra, matemática e engenharia. As tarefas não são de múltipla escolha; elas exigem que o Agent conclua análise de dados, inferência estatística, simulação, otimização, prova de teoremas, reconstrução de imagens ou aprendizado de máquina científico no terminal, e verifique os resultados com testes reproduzíveis.

Os 52,6% do Fable 5.1, contra os 24,7% do Fable 5 nos experimentos oficiais de reprodução, representam um aumento de 27,9 pontos percentuais — o salto mais evidente de toda a tabela. No entanto, a divulgação oficial também aponta um erro padrão de cerca de ±3,5 a 4,5 pontos percentuais para cada modelo; não se deve tratar a primeira casa decimal como um ranking absolutamente preciso.

O que o Terminal-Bench 4.0 e o CursorBench 3.2.0 medem

O Terminal-Bench faz o Agent lidar com tarefas complexas em um ambiente de terminal real, com foco em verificar se ele consegue entender o ambiente, chamar ferramentas, modificar arquivos e, por fim, passar pela validação. O Fable 5.1 obteve 55,8%, ou seja, 13,8 pontos percentuais acima do Fable 5, superando também os 52,3% do Opus 5.

O CursorBench 3.2 é composto por tarefas ambíguas e com múltiplos arquivos extraídas de sessões reais do Cursor; a versão 3.2 adicionou problemas de seguir instruções e de uso avançado de ferramentas. O Fable 5.1 Max obteve 73,4% — a vantagem não é tão exagerada quanto no Terminal-Bench-Science —, mas ele usa em média 72.060 tokens por tarefa, a um custo de $9,64; o Fable 5 Max usa 103.525 tokens, a $17,32. O que merece mais atenção aqui é a redução de tokens e de custo ao concluir o mesmo tipo de tarefa, e não os 2,9 pontos percentuais em si.

O que o GDPval-AA v2 mede

O GDPval-AA v2 usa 220 tarefas criadas por profissionais da indústria, abrangendo 44 ocupações e 9 setores, para avaliar a capacidade dos modelos de lidar com trabalho de conhecimento real e com valor econômico. A pontuação 1853 é uma nota composta, não 1853%. Esse resultado mostra que o Fable 5.1 supera o Fable 5 em documentos profissionais, análises e entregáveis, e também fica ligeiramente acima do Opus 5.

Por que o OSWorld 2.0 tem duas pontuações

O OSWorld 2.0 contém 108 fluxos de trabalho de operação de computador de cadeia longa; o tempo mediano de conclusão humana de cada tarefa é de cerca de 1,6 hora. O Partial concede pontuação parcial com base em vários checkpoints; no Strict, somente atingir integralmente o objetivo conta como sucesso.

Portanto, os 77,9% em partial e os 41,7% em strict do Fable 5.1 não são contraditórios: ele frequentemente conclui a maior parte das etapas, mas ainda há uma parcela de tarefas que ele não termina de ponta a ponta. Isso também nos lembra que, para um Agent de computador, "parecer estar sempre operando" não significa que a tarefa foi concluída com sucesso.

O que o Humanity's Last Exam mede

O Humanity's Last Exam foi criado pelo Center for AI Safety e pela Scale AI e contém 2.500 perguntas interdisciplinares, de nível especialista, difíceis de responder com uma simples busca. Sem ferramentas, o Fable 5.1 fica 3,1 pontos percentuais acima do Fable 5; com o uso de ferramentas permitido, a vantagem é de apenas 1,2 ponto percentual. Ele é de fato mais forte, mas nem todos os benchmarks apresentam aumentos que dobram o resultado.

O que o AutomationBench mede

O AutomationBench verifica se o Agent consegue concluir fluxos de trabalho de vendas, marketing, operações, atendimento ao cliente, finanças e RH entre ferramentas SaaS simuladas, como CRM, e-mail, calendário, mensagens e gerenciamento de projetos. O Fable 5.1 subiu de 17,1% para 31,4%, um ganho relativo de cerca de 84%, o que indica um progresso real do 5.1 no gerenciamento de estado entre múltiplos aplicativos e na execução de etapas longas; mas os 31,4% também mostram que esse tipo de automação de negócios sem supervisão ainda está longe de ser resolvido.

Matriz de cobertura de capacidades do Fable 5.1 nos sete principais benchmarks
As sete categorias de benchmarks cobrem, respectivamente, pesquisa científica, programação em terminal, trabalho profissional especializado, operação de computador, raciocínio multidisciplinar, fluxos comerciais e programação com múltiplos arquivos.

O que o Fable 5.1 melhorou em relação ao Fable 5

1. Tarefas de longa duração são menos propensas a atalhos

A Anthropic posiciona o Fable 5.1 como um modelo Agent de longa duração: primeiro ele planeja, depois usa ferramentas, recupera-se de falhas, valida resultados e reporta o progresso proativamente. Ele enfatiza a correção da causa raiz, em vez de fazer contornos parciais apenas para deixar um teste específico verde o mais rápido possível. Os cenários-alvo listados oficialmente incluem funcionalidades entre repositórios de código, revisão de código, otimização de desempenho, sessões autônomas de vários dias, pesquisa, documentação, planilhas e apresentações.

2. Effort baixo também chega perto dos resultados de alto custo da geração anterior

O Fable 5.1 adiciona a capacidade de ajustar o effort por mensagem. As curvas de custo oficiais mostram que, com effort Low ou Medium, ele pode atingir ou superar o Fable 5 em algumas tarefas, ao mesmo tempo que reduz tokens e custos. O Claude Code usa High effort por padrão; o Claude.ai e o Cowork usam Medium por padrão. Ao comparar modelos, é preciso primeiro confirmar o effort — não se pode colocar lado a lado resultados de níveis diferentes.

3. Progresso legível entre chamadas de ferramentas

A API adiciona o recurso experimental display: "updates", permitindo que o modelo forneça atualizações de progresso voltadas ao usuário entre chamadas de ferramentas. Para tarefas que levam horas, isso torna mais fácil entender o que ele está fazendo e se está se desviando do objetivo, em vez de apenas ver cartões de ferramentas aparecendo sem parar.

4. Escrita, verificação visual e autoteste mais completos

Os oficiais afirmam que o 5.1 escreve ativamente testes para validar suas próprias alterações e usa capacidades visuais para conferir as saídas em relação aos objetivos de design. As avaliações de parceiros também se concentram em progresso mais conciso, respostas mais completas a perguntas de múltiplas partes, rastreamento de cadeias de chamadas entre vários serviços e manutenção da legibilidade após longos períodos de execução. Esses são feedbacks qualitativos e não devem se passar por conclusões uniformes de benchmarks.

5. Bloqueios de segurança mais precisos, mas não eliminados

Os falsos positivos das proteções de segurança cibernética do Fable 5.1 caíram cerca de 60% em relação ao lançamento do Fable 5, e a frequência com que perguntas básicas de biologia e medicina acionam rebaixamentos caiu cerca de 85%. Ele agora pode ser usado para encontrar vulnerabilidades de software, mas tarefas de uso duplo, como testes de penetração, geração de código de exploração e varredura de vulnerabilidades binárias, ainda podem ser roteadas para o Opus. Quando isso ocorre, a cobrança não segue o preço do Fable.

6. Novo recurso de marcação de procedência de conteúdo

O Fable 5.1 introduz content provenance. O texto gerado pode conter uma marca d'água estatística, verificável por meio da ferramenta de verificação de conteúdo da Anthropic. Ele não adiciona marcações visíveis ao corpo do texto, mas, para plataformas de conteúdo, educação e auditorias empresariais, é um novo comportamento que deve ser conhecido com antecedência.

Seis melhorias principais do Fable 5.1 em relação à geração anterior
As mudanças do 5.1 se concentram em tarefas longas, eficiência com effort baixo, reporte de progresso, autoverificação, menos falsos positivos e marcação da procedência do conteúdo.

Como os custos do Fable 5.1 são calculados

Item de cobrança Preço do Fable 5.1 Comparação com o Fable 5
Entrada $10 / milhão de tokens Igual
Saída $50 / milhão de tokens Igual
Gravação em cache de 5 minutos $12,50 / milhão de tokens Mesma faixa
Gravação em cache de 1 hora $20 / milhão de tokens Mesma faixa
Leitura de cache $0,25 / milhão de tokens Redução de 75%
Batch API 50% dos preços de entrada e saída Conforme as regras do Batch

Suponha que uma tarefa longa leia cumulativamente 10 milhões de tokens de cache, gere 200 mil tokens novos de entrada e 50 mil tokens de saída, sem considerar gravações em cache:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

Os mesmos 10 milhões de leituras de cache custariam cerca de $10 no Fable 5; só nesse item, a diferença é de $7,50. Com base nisso, a Anthropic estima que o custo real de tarefas típicas cobradas por token pode cair cerca de 25%, e, em tarefas altamente orientadas a Agents que reutilizam com frequência contextos longos, a redução pode chegar a cerca de 45%. Isso não é uma redução geral no preço de tabela da API, mas sim: quanto mais acertos de cache, mais evidente é a economia.

Assinantes não necessariamente aproveitam diretamente a redução do cache da API

Assentos premium do Max e do Team/Enterprise podem usar até 50% do limite semanal em modelos Fable; o Pro e os assentos padrão, por sua vez, usam usage credits desde o início. O consumo exibido prevalece conforme a página Usage da conta. A redução da leitura de cache é, principalmente, uma mudança para cenários de cobrança por token; não se deve converter diretamente os 75% de redução no cache da API em "quatro vezes mais uso no plano Max".

Estrutura de custos de entrada, saída e cache do Fable 5.1
Os preços unitários de entrada e saída do Fable 5.1 não mudaram; a principal redução vem da leitura de cache — quanto mais o contexto longo for reutilizado, maior o benefício.

Afinal, o Fable 5.1 é rápido?

A resposta é: a resposta de uma única rodada é mais lenta, mas o tempo total de conclusão de tarefas complexas pode ser menor.

  • O catálogo de modelos da Anthropic classifica o Fable 5.1 como Slower, o Opus 5 como Moderate e o Sonnet 5 como Fast.
  • O Claude Code usa High effort por padrão, o que naturalmente consome mais tempo de raciocínio do que Low ou Medium.
  • A Every afirma que, em suas próprias cargas de trabalho, o Fable 5.1 é cerca de duas vezes mais rápido que o Opus 5 e usa metade dos tokens; trata-se de um teste específico de um parceiro, não uma garantia geral de velocidade.
  • No CursorBench, o Fable 5.1 Max tem em média 70 etapas e 72.060 tokens; o Fable 5 Max também tem 72 etapas, mas usa 103.525 tokens. A vantagem do 5.1 é mais "desviar menos e consumir menos tokens", o que não se traduz necessariamente em uma primeira resposta mais rápida.

Portanto, para chat, código curto e interações frequentes, prefira o Sonnet 5 ou o Opus 5; para depuração entre repositórios de código, pesquisas longas e tarefas não supervisionadas que exigem autoverificação, considere o Fable 5.1.

Mudanças de compatibilidade que devem ser tratadas antes de migrar para o Fable 5.1

Atualize o Claude Code para pelo menos 2.1.250

A documentação de planos e disponibilidade da Anthropic exige o Claude Code 2.1.250 ou superior. Se o Fable 5.1 não aparecer, verifique primeiro:

bash
claude --version

Em seguida, atualize usando o método oficial de atualização do Claude Code e reinicie a sessão. O ID do modelo na API do Fable 5.1 é:

text
claude-fable-5-1

O forced tool use pode retornar erro diretamente

Se a solicitação forçar o modelo a chamar uma determinada ferramenta, o Fable 5.1 pode retornar um erro. Antes de migrar, verifique o tool_choice e o fluxo de ferramentas forçadas do seu Agent próprio; não presuma que o comportamento do Fable 5 seja totalmente compatível.

Thinking blocks não podem ser reutilizados livremente entre modelos

Modelos mais antigos não conseguem ler os thinking blocks do Fable 5.1. Ao alternar de modelo, deixe o SDK processar esses blocos de acordo com as regras oficiais, em vez de passá-los da mesma forma para outro modelo.

Modificar o histórico antigo pode resultar em erro 400

Para contas de API novas criadas após 31 de agosto de 2026, os thinking blocks só são válidos no prefixo original da conversa em que foram gerados. Reproduzir thinking blocks depois de modificar o system, as tools ou mensagens anteriores pode retornar 400. A recomendação oficial é manter o histórico no modo append-only; quando for necessário compactar, substitua todo o histórico antigo por um novo resumo — não altere turnos antigos mantendo os thinking blocks originais. Consulte o Guia de prompts e migração do Fable 5.1 para mais detalhes.

Quando escolher o Fable 5.1

É adequado para:

  • Tarefas longas entre vários repositórios, serviços ou aplicativos;
  • Agents que precisam rodar por horas e se recuperar sozinhos de falhas;
  • Pesquisa científica, análise de dados complexa e entregáveis profissionais em múltiplas etapas;
  • Problemas de sistema difíceis de reproduzir, otimização de desempenho e investigação de causa raiz;
  • Cargas de trabalho de API que exigem muita reutilização de contexto longo e têm alta proporção de leitura de cache.

Não é adequado para:

  • Chat simples, textos curtos ou pequenas alterações em um único arquivo;
  • Interações em tempo real altamente sensíveis à latência da primeira resposta;
  • Tarefas de alta saída com orçamento fixo, mas sem reutilização de cache;
  • Cenários em que não se pode aceitar a retenção padrão de 30 dias dos dados monitorados de segurança e que não se enquadram nas condições de exceção empresarial;
  • Fluxos de trabalho em que se espera que nenhuma solicitação de segurança cibernética ou ciências da vida acione rebaixamentos.

Como acompanhar tarefas longas remotamente

O valor do Fable 5.1 costuma aparecer em tarefas de várias horas ou até de vários dias, mas isso não significa que você precise ficar o tempo todo diante da máquina de desenvolvimento. Primeiro, confirme que o Fable 5.1 está disponível no Claude Code 2.1.250+ local; em seguida, use o PandaNpc Agent para visualizar as sessões do Claude Code na mesma máquina de desenvolvimento pelo navegador, desktop ou celular, responder a interações e continuar enviando instruções.

O que muda aqui é o ponto de acesso de controle; o código, as ferramentas e o build continuam rodando na sua máquina de desenvolvimento. Você pode ler primeiro o Guia de acesso remoto ao Claude Code e o Tutorial de conexão do Claude Code pelo celular e, depois de confirmar o link remoto, deixar o Fable 5.1 executar as tarefas longas.

Perguntas frequentes (FAQ)

Quanto o Fable 5.1 é mais forte que o Fable 5?

A diferença varia muito conforme a tarefa. No Terminal-Bench-Science, o aumento foi de 27,9 pontos percentuais; no AutomationBench, de 14,3 pontos percentuais; no HLE com ferramentas, o aumento foi de apenas 1,2 ponto percentual. Não se pode usar um único maior ganho para representar todas as tarefas.

O Fable 5.1 é mais rápido que o Opus 5?

Na tabela oficial de latência relativa, o Fable 5.1 é "mais lento" e o Opus 5 é "moderado". Alguns parceiros observaram que o Fable 5.1 é mais rápido em tarefas completas, porque usa menos tokens e refaz menos trabalho. Essas duas conclusões não medem a mesma coisa.

O Fable 5.1 é mais adequado para programação do que o GPT-5.6 Sol?

Na tabela de divulgação da Anthropic, o Fable 5.1 é mais alto no Terminal-Bench-Science, no Terminal-Bench, no AutomationBench e no CursorBench; mas, como diferentes modelos usam harnesses de Agent, efforts, ferramentas e preços distintos, não se pode afirmar com base nisso que o Fable vence em todos os repositórios reais. Você pode consultar o Tutorial de configuração de contexto de 1M do GPT-5.6 Sol e depois fazer um teste A/B com suas próprias tarefas representativas.

Por que o Fable 5.1 muda subitamente para o Opus?

Algumas solicitações de segurança cibernética e ciências da vida são roteadas para o Opus pelos safeguards. A troca de modelo não é necessariamente uma falha; a Anthropic afirma que essas solicitações roteadas não são cobradas pelo preço do Fable.

O Fable 5.1 tem marca d'água?

Sim, existe um mecanismo estatístico de content provenance, mas ele não adiciona rótulos visíveis à superfície do texto. Não é a mesma coisa que uma marca d'água visível no canto de uma imagem.

Resumo

Os avanços mais evidentes do Claude Fable 5.1 se concentram em pesquisa científica, tarefas de terminal e fluxos de trabalho comerciais entre aplicativos: ele consegue executar de forma mais contínua, recuperar-se de falhas, validar resultados e, ainda, reduzir o custo de tarefas longas com leituras de cache mais baratas. No entanto, ele continua caro, com latência mais lenta por rodada, e traz mudanças de compatibilidade relacionadas a thinking blocks, chamadas forçadas de ferramentas e edição de histórico.

A pergunta certa para escolhê-lo não é "ele é o primeiro no ranking?", mas sim: a sua tarefa é longa e complexa o bastante, e o custo de falhas e retrabalho é alto o suficiente para valer a pena usar o Fable 5.1? Se a resposta for não, geralmente é mais adequado começar com o Opus 5 ou o Sonnet 5.