Claude Fable 5.1: análise completa — benchmarks, melhorias, preço e velocidade
Resultados completos do Claude Fable 5.1 em 7 categorias de benchmarks principais, comparados item por item com Fable 5, Opus 5 e GPT-5.6 Sol, além de explicar as mudanças do 5.1 em tarefas longas, chamadas de ferramentas, custos de cache, velocidade, limites de planos e migração.

O Claude Fable 5.1 foi lançado oficialmente em 1º de setembro de 2026. Vamos direto ao ponto: esta não é uma atualização comum de modelo para perguntas e respostas do dia a dia, mas sim um modelo principal de alto custo preparado para programação de longa duração, pesquisa complexa, chamadas de ferramentas entre aplicativos e Agents não supervisionados. Nos 7 tipos de benchmarks principais divulgados pela Anthropic, o Fable 5.1 supera o Fable 5 em todos; porém, o preço unitário da API ainda é o dobro do Opus 5, e a latência relativa também é oficialmente classificada como "mais lenta".
Se a sua tarefa é apenas corrigir um arquivo, escrever um texto curto ou responder perguntas comuns, a Anthropic ainda recomenda começar pelo Opus 5. O Fable 5.1 é mais adequado para tarefas de cadeia longa que modelos comuns ainda não conseguem concluir com estabilidade mesmo com effort alto. Este artigo reúne os dados do anúncio oficial, o significado de cada benchmark, as melhorias específicas do 5.1, preço, velocidade e limitações de migração, para que você não olhe apenas para uma tabela de "quem venceu".
Especificações do Fable 5.1 em uma tabela
| Item | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Janela de contexto | 1M tokens | 1M tokens | 1M tokens |
| Saída máxima | 128K tokens | 128K tokens | 128K tokens |
| Preço de entrada | $10 / MTok | $5 / MTok | $2 / MTok |
| Preço de saída | $50 / MTok | $25 / MTok | $10 / MTok |
| Latência relativa | Mais lenta | Moderada | Rápida |
| Thinking | Adaptive, sempre ativado | Adaptive | Adaptive |
| Effort padrão | High | High | High |
| Corte de conhecimento confiável | Junho de 2026 | Maio de 2026 | Janeiro de 2026 |
O "mais lenta" aqui vem do catálogo de modelos da Anthropic e indica um nível de latência relativa, não um número fixo de tokens por segundo. O tempo real para concluir uma tarefa também depende do effort, do número de rodadas de chamadas de ferramentas, da taxa de acerto de cache, do comprimento do contexto e das tentativas após falhas.
Tabela completa dos principais benchmarks do Fable 5.1
A tabela abaixo reproduz diretamente a tabela principal da página de lançamento da Anthropic de 1º de setembro de 2026. Para evitar interpretações equivocadas, as porcentagens, as pontuações brutas do GDPval-AA, os resultados partial/strict do OSWorld e os resultados com/sem ferramentas do HLE são listados separadamente. Cada benchmark mantém o nome oficial em inglês, com o nome em português na linha seguinte; outras versões em outros idiomas também exibem a tradução correspondente abaixo do nome em inglês.
| Capacidade | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 vs. Fable 5 |
|---|---|---|---|---|---|---|
| Pesquisa científica com agente | Terminal-Bench-Science 0.1 Benchmark de terminal para pesquisa científica com agente |
52,6% | 24,7% | 29,0% | 22,4% | +27,9 pontos percentuais |
| Programação em terminal com agente | Terminal-Bench 4.0 Benchmark de programação em terminal com agente |
55,8% | 42,0% | 52,3% | 37,3% | +13,8 pontos percentuais |
| Trabalho profissional especializado | GDPval-AA v2 Benchmark de tarefas profissionais com valor econômico real |
1853 | 1723 | 1824 | 1711 | +130 pontos |
| Operação de computador | OSWorld 2.0 — Partial Benchmark real de operação de computador: pontuação de conclusão parcial |
77,9% | 72,9% | 75,4% | — | +5,0 pontos percentuais |
| Operação de computador | OSWorld 2.0 — Strict Benchmark real de operação de computador: taxa de conclusão estrita |
41,7% | 36,1% | 39,6% | — | +5,6 pontos percentuais |
| Raciocínio multidisciplinar | Humanity's Last Exam — No tools O Último Exame da Humanidade: sem uso de ferramentas |
60,9% | 57,8% | 56,6% | — | +3,1 pontos percentuais |
| Raciocínio multidisciplinar | Humanity's Last Exam — With tools O Último Exame da Humanidade: com uso de ferramentas |
65,0% | 63,8% | 63,6% | — | +1,2 ponto percentual |
| Fluxo de trabalho comercial | AutomationBench Benchmark de fluxos de trabalho comerciais automatizados entre aplicativos |
31,4% | 17,1% | 26,9% | 19,6% | +14,3 pontos percentuais |
| Programação com agente | CursorBench 3.2.0 Benchmark real de tarefas de programação com múltiplos arquivos |
73,4% | 70,5% | 70,0% | 67,2% | +2,9 pontos percentuais |
— indica que a tabela principal da Anthropic não forneceu a respectiva pontuação, e não que o modelo não consegue realizar a tarefa. No Terminal-Bench 4.0, o Mythos 5.1, que tem menos restrições e é aberto apenas a programas confiáveis, obteve 60,9%; este artigo foca no Fable 5.1, disponível para usuários comuns, e não mistura os resultados do Mythos na coluna do Fable.
O que o Terminal-Bench-Science 0.1 mede
O Terminal-Bench-Science 0.1 contém 70 fluxos de trabalho reais de pesquisa em cinco grandes áreas: ciências da vida, ciências físicas, ciências da Terra, matemática e engenharia. As tarefas não são de múltipla escolha; elas exigem que o Agent conclua análise de dados, inferência estatística, simulação, otimização, prova de teoremas, reconstrução de imagens ou aprendizado de máquina científico no terminal, e verifique os resultados com testes reproduzíveis.
Os 52,6% do Fable 5.1, contra os 24,7% do Fable 5 nos experimentos oficiais de reprodução, representam um aumento de 27,9 pontos percentuais — o salto mais evidente de toda a tabela. No entanto, a divulgação oficial também aponta um erro padrão de cerca de ±3,5 a 4,5 pontos percentuais para cada modelo; não se deve tratar a primeira casa decimal como um ranking absolutamente preciso.
O que o Terminal-Bench 4.0 e o CursorBench 3.2.0 medem
O Terminal-Bench faz o Agent lidar com tarefas complexas em um ambiente de terminal real, com foco em verificar se ele consegue entender o ambiente, chamar ferramentas, modificar arquivos e, por fim, passar pela validação. O Fable 5.1 obteve 55,8%, ou seja, 13,8 pontos percentuais acima do Fable 5, superando também os 52,3% do Opus 5.
O CursorBench 3.2 é composto por tarefas ambíguas e com múltiplos arquivos extraídas de sessões reais do Cursor; a versão 3.2 adicionou problemas de seguir instruções e de uso avançado de ferramentas. O Fable 5.1 Max obteve 73,4% — a vantagem não é tão exagerada quanto no Terminal-Bench-Science —, mas ele usa em média 72.060 tokens por tarefa, a um custo de $9,64; o Fable 5 Max usa 103.525 tokens, a $17,32. O que merece mais atenção aqui é a redução de tokens e de custo ao concluir o mesmo tipo de tarefa, e não os 2,9 pontos percentuais em si.
O que o GDPval-AA v2 mede
O GDPval-AA v2 usa 220 tarefas criadas por profissionais da indústria, abrangendo 44 ocupações e 9 setores, para avaliar a capacidade dos modelos de lidar com trabalho de conhecimento real e com valor econômico. A pontuação 1853 é uma nota composta, não 1853%. Esse resultado mostra que o Fable 5.1 supera o Fable 5 em documentos profissionais, análises e entregáveis, e também fica ligeiramente acima do Opus 5.
Por que o OSWorld 2.0 tem duas pontuações
O OSWorld 2.0 contém 108 fluxos de trabalho de operação de computador de cadeia longa; o tempo mediano de conclusão humana de cada tarefa é de cerca de 1,6 hora. O Partial concede pontuação parcial com base em vários checkpoints; no Strict, somente atingir integralmente o objetivo conta como sucesso.
Portanto, os 77,9% em partial e os 41,7% em strict do Fable 5.1 não são contraditórios: ele frequentemente conclui a maior parte das etapas, mas ainda há uma parcela de tarefas que ele não termina de ponta a ponta. Isso também nos lembra que, para um Agent de computador, "parecer estar sempre operando" não significa que a tarefa foi concluída com sucesso.
O que o Humanity's Last Exam mede
O Humanity's Last Exam foi criado pelo Center for AI Safety e pela Scale AI e contém 2.500 perguntas interdisciplinares, de nível especialista, difíceis de responder com uma simples busca. Sem ferramentas, o Fable 5.1 fica 3,1 pontos percentuais acima do Fable 5; com o uso de ferramentas permitido, a vantagem é de apenas 1,2 ponto percentual. Ele é de fato mais forte, mas nem todos os benchmarks apresentam aumentos que dobram o resultado.
O que o AutomationBench mede
O AutomationBench verifica se o Agent consegue concluir fluxos de trabalho de vendas, marketing, operações, atendimento ao cliente, finanças e RH entre ferramentas SaaS simuladas, como CRM, e-mail, calendário, mensagens e gerenciamento de projetos. O Fable 5.1 subiu de 17,1% para 31,4%, um ganho relativo de cerca de 84%, o que indica um progresso real do 5.1 no gerenciamento de estado entre múltiplos aplicativos e na execução de etapas longas; mas os 31,4% também mostram que esse tipo de automação de negócios sem supervisão ainda está longe de ser resolvido.
O que o Fable 5.1 melhorou em relação ao Fable 5
1. Tarefas de longa duração são menos propensas a atalhos
A Anthropic posiciona o Fable 5.1 como um modelo Agent de longa duração: primeiro ele planeja, depois usa ferramentas, recupera-se de falhas, valida resultados e reporta o progresso proativamente. Ele enfatiza a correção da causa raiz, em vez de fazer contornos parciais apenas para deixar um teste específico verde o mais rápido possível. Os cenários-alvo listados oficialmente incluem funcionalidades entre repositórios de código, revisão de código, otimização de desempenho, sessões autônomas de vários dias, pesquisa, documentação, planilhas e apresentações.
2. Effort baixo também chega perto dos resultados de alto custo da geração anterior
O Fable 5.1 adiciona a capacidade de ajustar o effort por mensagem. As curvas de custo oficiais mostram que, com effort Low ou Medium, ele pode atingir ou superar o Fable 5 em algumas tarefas, ao mesmo tempo que reduz tokens e custos. O Claude Code usa High effort por padrão; o Claude.ai e o Cowork usam Medium por padrão. Ao comparar modelos, é preciso primeiro confirmar o effort — não se pode colocar lado a lado resultados de níveis diferentes.
3. Progresso legível entre chamadas de ferramentas
A API adiciona o recurso experimental display: "updates", permitindo que o modelo forneça atualizações de progresso voltadas ao usuário entre chamadas de ferramentas. Para tarefas que levam horas, isso torna mais fácil entender o que ele está fazendo e se está se desviando do objetivo, em vez de apenas ver cartões de ferramentas aparecendo sem parar.
4. Escrita, verificação visual e autoteste mais completos
Os oficiais afirmam que o 5.1 escreve ativamente testes para validar suas próprias alterações e usa capacidades visuais para conferir as saídas em relação aos objetivos de design. As avaliações de parceiros também se concentram em progresso mais conciso, respostas mais completas a perguntas de múltiplas partes, rastreamento de cadeias de chamadas entre vários serviços e manutenção da legibilidade após longos períodos de execução. Esses são feedbacks qualitativos e não devem se passar por conclusões uniformes de benchmarks.
5. Bloqueios de segurança mais precisos, mas não eliminados
Os falsos positivos das proteções de segurança cibernética do Fable 5.1 caíram cerca de 60% em relação ao lançamento do Fable 5, e a frequência com que perguntas básicas de biologia e medicina acionam rebaixamentos caiu cerca de 85%. Ele agora pode ser usado para encontrar vulnerabilidades de software, mas tarefas de uso duplo, como testes de penetração, geração de código de exploração e varredura de vulnerabilidades binárias, ainda podem ser roteadas para o Opus. Quando isso ocorre, a cobrança não segue o preço do Fable.
6. Novo recurso de marcação de procedência de conteúdo
O Fable 5.1 introduz content provenance. O texto gerado pode conter uma marca d'água estatística, verificável por meio da ferramenta de verificação de conteúdo da Anthropic. Ele não adiciona marcações visíveis ao corpo do texto, mas, para plataformas de conteúdo, educação e auditorias empresariais, é um novo comportamento que deve ser conhecido com antecedência.
Como os custos do Fable 5.1 são calculados
| Item de cobrança | Preço do Fable 5.1 | Comparação com o Fable 5 |
|---|---|---|
| Entrada | $10 / milhão de tokens | Igual |
| Saída | $50 / milhão de tokens | Igual |
| Gravação em cache de 5 minutos | $12,50 / milhão de tokens | Mesma faixa |
| Gravação em cache de 1 hora | $20 / milhão de tokens | Mesma faixa |
| Leitura de cache | $0,25 / milhão de tokens | Redução de 75% |
| Batch API | 50% dos preços de entrada e saída | Conforme as regras do Batch |
Suponha que uma tarefa longa leia cumulativamente 10 milhões de tokens de cache, gere 200 mil tokens novos de entrada e 50 mil tokens de saída, sem considerar gravações em cache:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00Os mesmos 10 milhões de leituras de cache custariam cerca de $10 no Fable 5; só nesse item, a diferença é de $7,50. Com base nisso, a Anthropic estima que o custo real de tarefas típicas cobradas por token pode cair cerca de 25%, e, em tarefas altamente orientadas a Agents que reutilizam com frequência contextos longos, a redução pode chegar a cerca de 45%. Isso não é uma redução geral no preço de tabela da API, mas sim: quanto mais acertos de cache, mais evidente é a economia.
Assinantes não necessariamente aproveitam diretamente a redução do cache da API
Assentos premium do Max e do Team/Enterprise podem usar até 50% do limite semanal em modelos Fable; o Pro e os assentos padrão, por sua vez, usam usage credits desde o início. O consumo exibido prevalece conforme a página Usage da conta. A redução da leitura de cache é, principalmente, uma mudança para cenários de cobrança por token; não se deve converter diretamente os 75% de redução no cache da API em "quatro vezes mais uso no plano Max".
Afinal, o Fable 5.1 é rápido?
A resposta é: a resposta de uma única rodada é mais lenta, mas o tempo total de conclusão de tarefas complexas pode ser menor.
- O catálogo de modelos da Anthropic classifica o Fable 5.1 como
Slower, o Opus 5 comoModeratee o Sonnet 5 comoFast. - O Claude Code usa High effort por padrão, o que naturalmente consome mais tempo de raciocínio do que Low ou Medium.
- A Every afirma que, em suas próprias cargas de trabalho, o Fable 5.1 é cerca de duas vezes mais rápido que o Opus 5 e usa metade dos tokens; trata-se de um teste específico de um parceiro, não uma garantia geral de velocidade.
- No CursorBench, o Fable 5.1 Max tem em média 70 etapas e 72.060 tokens; o Fable 5 Max também tem 72 etapas, mas usa 103.525 tokens. A vantagem do 5.1 é mais "desviar menos e consumir menos tokens", o que não se traduz necessariamente em uma primeira resposta mais rápida.
Portanto, para chat, código curto e interações frequentes, prefira o Sonnet 5 ou o Opus 5; para depuração entre repositórios de código, pesquisas longas e tarefas não supervisionadas que exigem autoverificação, considere o Fable 5.1.
Mudanças de compatibilidade que devem ser tratadas antes de migrar para o Fable 5.1
Atualize o Claude Code para pelo menos 2.1.250
A documentação de planos e disponibilidade da Anthropic exige o Claude Code 2.1.250 ou superior. Se o Fable 5.1 não aparecer, verifique primeiro:
claude --versionEm seguida, atualize usando o método oficial de atualização do Claude Code e reinicie a sessão. O ID do modelo na API do Fable 5.1 é:
claude-fable-5-1O forced tool use pode retornar erro diretamente
Se a solicitação forçar o modelo a chamar uma determinada ferramenta, o Fable 5.1 pode retornar um erro. Antes de migrar, verifique o tool_choice e o fluxo de ferramentas forçadas do seu Agent próprio; não presuma que o comportamento do Fable 5 seja totalmente compatível.
Thinking blocks não podem ser reutilizados livremente entre modelos
Modelos mais antigos não conseguem ler os thinking blocks do Fable 5.1. Ao alternar de modelo, deixe o SDK processar esses blocos de acordo com as regras oficiais, em vez de passá-los da mesma forma para outro modelo.
Modificar o histórico antigo pode resultar em erro 400
Para contas de API novas criadas após 31 de agosto de 2026, os thinking blocks só são válidos no prefixo original da conversa em que foram gerados. Reproduzir thinking blocks depois de modificar o system, as tools ou mensagens anteriores pode retornar 400. A recomendação oficial é manter o histórico no modo append-only; quando for necessário compactar, substitua todo o histórico antigo por um novo resumo — não altere turnos antigos mantendo os thinking blocks originais. Consulte o Guia de prompts e migração do Fable 5.1 para mais detalhes.
Quando escolher o Fable 5.1
É adequado para:
- Tarefas longas entre vários repositórios, serviços ou aplicativos;
- Agents que precisam rodar por horas e se recuperar sozinhos de falhas;
- Pesquisa científica, análise de dados complexa e entregáveis profissionais em múltiplas etapas;
- Problemas de sistema difíceis de reproduzir, otimização de desempenho e investigação de causa raiz;
- Cargas de trabalho de API que exigem muita reutilização de contexto longo e têm alta proporção de leitura de cache.
Não é adequado para:
- Chat simples, textos curtos ou pequenas alterações em um único arquivo;
- Interações em tempo real altamente sensíveis à latência da primeira resposta;
- Tarefas de alta saída com orçamento fixo, mas sem reutilização de cache;
- Cenários em que não se pode aceitar a retenção padrão de 30 dias dos dados monitorados de segurança e que não se enquadram nas condições de exceção empresarial;
- Fluxos de trabalho em que se espera que nenhuma solicitação de segurança cibernética ou ciências da vida acione rebaixamentos.
Como acompanhar tarefas longas remotamente
O valor do Fable 5.1 costuma aparecer em tarefas de várias horas ou até de vários dias, mas isso não significa que você precise ficar o tempo todo diante da máquina de desenvolvimento. Primeiro, confirme que o Fable 5.1 está disponível no Claude Code 2.1.250+ local; em seguida, use o PandaNpc Agent para visualizar as sessões do Claude Code na mesma máquina de desenvolvimento pelo navegador, desktop ou celular, responder a interações e continuar enviando instruções.
O que muda aqui é o ponto de acesso de controle; o código, as ferramentas e o build continuam rodando na sua máquina de desenvolvimento. Você pode ler primeiro o Guia de acesso remoto ao Claude Code e o Tutorial de conexão do Claude Code pelo celular e, depois de confirmar o link remoto, deixar o Fable 5.1 executar as tarefas longas.
Perguntas frequentes (FAQ)
Quanto o Fable 5.1 é mais forte que o Fable 5?
A diferença varia muito conforme a tarefa. No Terminal-Bench-Science, o aumento foi de 27,9 pontos percentuais; no AutomationBench, de 14,3 pontos percentuais; no HLE com ferramentas, o aumento foi de apenas 1,2 ponto percentual. Não se pode usar um único maior ganho para representar todas as tarefas.
O Fable 5.1 é mais rápido que o Opus 5?
Na tabela oficial de latência relativa, o Fable 5.1 é "mais lento" e o Opus 5 é "moderado". Alguns parceiros observaram que o Fable 5.1 é mais rápido em tarefas completas, porque usa menos tokens e refaz menos trabalho. Essas duas conclusões não medem a mesma coisa.
O Fable 5.1 é mais adequado para programação do que o GPT-5.6 Sol?
Na tabela de divulgação da Anthropic, o Fable 5.1 é mais alto no Terminal-Bench-Science, no Terminal-Bench, no AutomationBench e no CursorBench; mas, como diferentes modelos usam harnesses de Agent, efforts, ferramentas e preços distintos, não se pode afirmar com base nisso que o Fable vence em todos os repositórios reais. Você pode consultar o Tutorial de configuração de contexto de 1M do GPT-5.6 Sol e depois fazer um teste A/B com suas próprias tarefas representativas.
Por que o Fable 5.1 muda subitamente para o Opus?
Algumas solicitações de segurança cibernética e ciências da vida são roteadas para o Opus pelos safeguards. A troca de modelo não é necessariamente uma falha; a Anthropic afirma que essas solicitações roteadas não são cobradas pelo preço do Fable.
O Fable 5.1 tem marca d'água?
Sim, existe um mecanismo estatístico de content provenance, mas ele não adiciona rótulos visíveis à superfície do texto. Não é a mesma coisa que uma marca d'água visível no canto de uma imagem.
Resumo
Os avanços mais evidentes do Claude Fable 5.1 se concentram em pesquisa científica, tarefas de terminal e fluxos de trabalho comerciais entre aplicativos: ele consegue executar de forma mais contínua, recuperar-se de falhas, validar resultados e, ainda, reduzir o custo de tarefas longas com leituras de cache mais baratas. No entanto, ele continua caro, com latência mais lenta por rodada, e traz mudanças de compatibilidade relacionadas a thinking blocks, chamadas forçadas de ferramentas e edição de histórico.
A pergunta certa para escolhê-lo não é "ele é o primeiro no ranking?", mas sim: a sua tarefa é longa e complexa o bastante, e o custo de falhas e retrabalho é alto o suficiente para valer a pena usar o Fable 5.1? Se a resposta for não, geralmente é mais adequado começar com o Opus 5 ou o Sonnet 5.
Guias relacionados

Tutorial de configuração do Codex para habilitar 1M de contexto no GPT-5.6 Sol: 3 linhas no `config.toml`
GPT-5.6 Sol suporta oficialmente contexto de 1,05 milhão de tokens. Basta adicionar 3 linhas de configuração no topo do config.toml do Codex para executar com janela de 1 milhão e compactar automaticamente o histórico em cerca de 900 mil tokens. Inclui configuração permanente, comando único, verificação e lembrete de custos.
Ler artigo →
Como usar o Claude Code Remote Control? Controle remoto pelo celular, limitações oficiais e alternativas (2026)
Como ativar o Claude Code Remote Control? Este artigo apresenta três usos oficiais: claude remote-control, claude --remote-control e /remote-control, explica a conexão entre celular e navegador, requisitos de conta, métodos de verificação e erros comuns, e compara a solução PandaNpc em cenários de modelos personalizados, Codex e múltiplas máquinas.
Ler artigo →
Conecte o celular ao Claude Code: visualize sessões e aprove ferramentas no iOS a qualquer momento
Este artigo é destinado a desenvolvedores, compartilhando as melhores práticas para conectar o Claude Code pelo celular. Por meio do app PandaNpc iOS, visualize sessões em tempo real, aprove chamadas de ferramentas e responda a perguntas. Com o pandapaw e o iOS Live Activity, realize controle remoto eficiente, aumentando a flexibilidade de codificação.
Ler artigo →