Claude Fable 5.1, análisis completo: benchmarks, mejoras, precio y velocidad
Resultados completos de Claude Fable 5.1 en siete categorías de benchmarks principales, con comparación detallada punto por punto contra Fable 5, Opus 5 y GPT-5.6 Sol, y explicación de las tareas largas, la invocación de herramientas, las tarifas de caché, la velocidad, las restricciones del plan y los cambios de migración de 5.1.

Claude Fable 5.1 se lanzó oficialmente el 1 de septiembre de 2026. Primero, la conclusión: no es una actualización habitual de modelo para preguntas y respuestas comunes, sino un modelo insignia de alto coste preparado para programación de larga duración, investigación compleja, llamadas a herramientas entre aplicaciones y agentes desatendidos. En las 7 categorías principales de benchmarks publicadas por Anthropic, Fable 5.1 supera a Fable 5 en todas; pero su precio unitario de API sigue siendo el doble que el de Opus 5, y la compañía también califica su latencia relativa como «más lenta».
Si tu tarea se limita a modificar un archivo, escribir un texto corto o responder preguntas ordinarias, Anthropic sigue recomendando empezar por Opus 5. Fable 5.1 es más adecuado para tareas de cadena larga que los modelos normales aún no consiguen completar de forma estable ni con un effort alto. Este artículo reúne los datos oficiales publicados, el significado de cada benchmark, las mejoras concretas de 5.1, el precio, la velocidad y las restricciones de migración, para no quedarse únicamente con una tabla de puntuaciones de «quién ganó».
Las especificaciones de Fable 5.1 en una tabla
| Característica | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|---|
| Ventana de contexto | 1M token | 1M token | 1M token |
| Salida máxima | 128K token | 128K token | 128K token |
| Precio de entrada | $10 / MTok | $5 / MTok | $2 / MTok |
| Precio de salida | $50 / MTok | $25 / MTok | $10 / MTok |
| Latencia relativa | Más lenta | Media | Rápida |
| Thinking | Adaptive, siempre activo | Adaptive | Adaptive |
| effort por defecto | High | High | High |
| Corte de conocimiento fiable | Junio de 2026 | Mayo de 2026 | Enero de 2026 |
El «más lenta» procede del catálogo de modelos de Anthropic e indica un grado de latencia relativa, no una cifra fija de tokens por segundo. Cuánto se tarda realmente en completar una tarea también depende del effort, del número de rondas de llamadas a herramientas, de la tasa de aciertos de caché, de la longitud del contexto y de los reintentos tras fallos.
Tabla completa de los benchmarks principales de Fable 5.1
La siguiente tabla adopta directamente la tabla principal de la página de publicación de Anthropic del 1 de septiembre de 2026. Para evitar malas lecturas, los porcentajes, la puntuación bruta de GDPval-AA, los resultados partial/strict de OSWorld y los resultados con herramientas/sin herramientas de HLE se muestran por separado. Cada benchmark conserva su nombre oficial en inglés y, en la línea siguiente, se ofrece su traducción; en las versiones en otros idiomas también aparece la traducción correspondiente debajo del nombre en inglés.
| Capacidad | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 5.1 frente a Fable 5 |
|---|---|---|---|---|---|---|
| Investigación científica con agentes | Terminal-Bench-Science 0.1 Benchmark de terminal para investigación científica con agentes |
52.6% | 24.7% | 29.0% | 22.4% | +27.9 puntos porcentuales |
| Programación en terminal con agentes | Terminal-Bench 4.0 Benchmark de programación en terminal con agentes |
55.8% | 42.0% | 52.3% | 37.3% | +13.8 puntos porcentuales |
| Trabajo de conocimiento especializado | GDPval-AA v2 Benchmark de tareas profesionales con valor económico real |
1853 | 1723 | 1824 | 1711 | +130 puntos |
| Operación de computadora | OSWorld 2.0 — Partial Benchmark de operación real de computadora: puntuación por finalización parcial |
77.9% | 72.9% | 75.4% | — | +5.0 puntos porcentuales |
| Operación de computadora | OSWorld 2.0 — Strict Benchmark de operación real de computadora: tasa de finalización estricta |
41.7% | 36.1% | 39.6% | — | +5.6 puntos porcentuales |
| Razonamiento multidisciplinar | Humanity's Last Exam — No tools El último examen de la humanidad: sin herramientas |
60.9% | 57.8% | 56.6% | — | +3.1 puntos porcentuales |
| Razonamiento multidisciplinar | Humanity's Last Exam — With tools El último examen de la humanidad: con herramientas |
65.0% | 63.8% | 63.6% | — | +1.2 puntos porcentuales |
| Flujos de trabajo empresariales | AutomationBench Benchmark de flujos de trabajo de automatización empresarial entre aplicaciones |
31.4% | 17.1% | 26.9% | 19.6% | +14.3 puntos porcentuales |
| Programación con agentes | CursorBench 3.2.0 Benchmark de tareas reales de programación multiarchivo |
73.4% | 70.5% | 70.0% | 67.2% | +2.9 puntos porcentuales |
— indica que la tabla principal de Anthropic no ofrece la puntuación correspondiente; no significa que el modelo no pueda completar la tarea. En Terminal-Bench 4.0, Mythos 5.1 —con menos restricciones y abierto solo al programa de confianza— obtuvo un 60.9%; este artículo se centra en Fable 5.1, que está disponible para los usuarios normales, y no mezcla los resultados de Mythos en la columna de Fable.
¿Qué mide Terminal-Bench-Science 0.1?
Terminal-Bench-Science 0.1 incluye 70 flujos de trabajo reales de investigación en cinco grandes áreas: ciencias de la vida, ciencias físicas, ciencias de la Tierra, matemáticas e ingeniería. No son preguntas de opción múltiple: se pide al agente que complete en la terminal análisis de datos, inferencia estadística, simulación, optimización, demostración de teoremas, reconstrucción de imágenes o aprendizaje automático científico, y que compruebe los resultados con pruebas reproducibles.
El 52.6% de Fable 5.1, frente al 24.7% de Fable 5 en los experimentos de reproducción oficiales, supone una subida de 27.9 puntos porcentuales, el salto más visible de toda la tabla. Aun así, la compañía indica un error estándar de aproximadamente ±3.5–4.5 puntos porcentuales para cada modelo, así que no hay que tratar el primer decimal como una clasificación absolutamente exacta.
¿Qué miden Terminal-Bench 4.0 y CursorBench 3.2.0?
Terminal-Bench hace que el agente trabaje en tareas complejas dentro de un terminal real y observa si es capaz de entender el entorno, invocar herramientas, modificar archivos y, finalmente, superar la verificación. Fable 5.1 logra un 55.8%, 13.8 puntos porcentuales más que Fable 5 y también por encima del 52.3% de Opus 5.
CursorBench 3.2 procede de tareas ambiguas y multiarchivo extraídas de sesiones reales de Cursor; la versión 3.2 añade problemas de seguimiento de instrucciones y de uso avanzado de herramientas. Fable 5.1 Max alcanza un 73.4%; la ventaja no es tan exagerada como en Terminal-Bench-Science, pero usa de media 72 060 token y cuesta $9.64 por tarea, mientras que Fable 5 Max usa 103 525 token y cuesta $17.32. Lo que merece más atención aquí es la caída de token y de coste al completar el mismo tipo de tarea, más que los 2.9 puntos porcentuales en sí.
¿Qué mide GDPval-AA v2?
GDPval-AA v2 emplea 220 tareas diseñadas por profesionales del sector, que cubren 44 ocupaciones y 9 industrias, para evaluar la capacidad del modelo de manejar trabajo de conocimiento real con valor económico. Su 1853 es una puntuación compuesta, no un 1853%. Este resultado indica que Fable 5.1 supera a Fable 5 en documentos profesionales, análisis y entregables, y que también supera ligeramente a Opus 5.
¿Por qué OSWorld 2.0 tiene dos puntuaciones?
OSWorld 2.0 contiene 108 flujos de trabajo de operación de computadora de cadena larga; el tiempo humano mediano para completar cada tarea es de aproximadamente 1.6 horas. Partial concede una puntuación parcial según varios puntos de control; Strict solo considera éxito el cumplimiento íntegro del objetivo.
Por tanto, el 77.9% de partial y el 41.7% de strict de Fable 5.1 no se contradicen: suele completar la mayor parte de los pasos, pero todavía hay tareas que no consigue terminar de extremo a extremo. También es un recordatorio de que un agente de computadora que «parece estar operando todo el rato» no equivale a que la tarea haya terminado con éxito.
¿Qué mide Humanity's Last Exam?
Humanity's Last Exam, creado por el Center for AI Safety y Scale AI, contiene 2500 preguntas interdisciplinarias de nivel experto difíciles de responder con una simple búsqueda. Fable 5.1 supera a Fable 5 en 3.1 puntos porcentuales sin herramientas, pero solo en 1.2 cuando se permiten herramientas. Es más capaz, sí, pero no en todos los benchmarks se duplica la mejora.
¿Qué mide AutomationBench?
AutomationBench comprueba si el agente es capaz de completar flujos de ventas, marketing, operaciones, atención al cliente, finanzas y recursos humanos a través de herramientas SaaS simuladas como CRM, correo, calendario, mensajería y gestión de proyectos. Fable 5.1 pasa del 17.1% al 31.4%, una mejora relativa de alrededor del 84%, lo que muestra un avance sustancial de 5.1 en la gestión de estado entre aplicaciones y en la ejecución de pasos largos; pero el 31.4% también indica que este tipo de automatización empresarial desatendida sigue sin estar resuelto.
Qué ha mejorado Fable 5.1 frente a Fable 5
1. En tareas largas es menos dado a los atajos
Anthropic posiciona Fable 5.1 como un modelo de agente de larga duración: primero planifica, después usa herramientas, se recupera de los fallos, verifica los resultados e informa del progreso por iniciativa propia. Pone más énfasis en corregir la causa raíz que en rodear el problema localmente para que una prueba suelta se ponga en verde cuanto antes. Los escenarios objetivo que enumera la compañía incluyen funcionalidades de varios repositorios, revisión de código, optimización de rendimiento, sesiones autónomas de varios días, investigación, documentos, hojas de cálculo y diapositivas.
2. Con effort bajo también puede acercarse a los resultados caros de la generación anterior
Fable 5.1 añade la capacidad de ajustar el effort por mensaje. Las curvas de coste oficiales muestran que, en algunas tareas, un effort Low o Medium puede igualar o superar a Fable 5 y, a la vez, gastar menos token y costar menos. Claude Code usa High effort por defecto; Claude.ai y Cowork usan Medium por defecto. Para comparar modelos hay que confirmar primero el effort; no se pueden yuxtaponer directamente resultados de niveles distintos.
3. Puede mostrar un progreso legible entre llamadas a herramientas
La API añade una capacidad en pruebas display: "updates", que permite al modelo mostrar al usuario actualizaciones de progreso entre llamadas a herramientas. En tareas que duran horas, esto permite hacerse una idea de qué está haciendo y si se está desviando del objetivo, mucho mejor que ver aparecer tarjetas de herramientas una tras otra.
4. Redacción, verificación visual y autoevaluación más completas
La compañía afirma que 5.1 escribe pruebas por iniciativa propia para verificar sus modificaciones y usa la visión para contrastar las salidas con el diseño previsto. Los comentarios de los socios también destacan un progreso más conciso, respuestas más completas a preguntas en varias partes, seguimiento de la cadena de llamadas a través de varios servicios y legibilidad sostenida tras ejecuciones largas. Son valoraciones cualitativas y no deben presentarse como una conclusión unificada de benchmarks.
5. Los bloqueos de seguridad son más precisos, pero no han desaparecido
Los falsos positivos de las protecciones de ciberseguridad de Fable 5.1 se reducen alrededor de un 60% frente al lanzamiento de Fable 5, y la frecuencia con la que las preguntas básicas de biología y medicina provocan una degradación baja cerca de un 85%. Ahora sirve para encontrar vulnerabilidades de software, pero las tareas de doble uso como el pentest, la generación de código de explotación o el escaneo de vulnerabilidades binarias todavía pueden enrutarse a Opus. Una vez enrutadas, no se facturan al precio de Fable.
6. Nueva marca de procedencia del contenido
Fable 5.1 introduce la procedencia del contenido (content provenance). El texto generado puede llevar una marca de agua estadística verificable con la herramienta de comprobación de contenido de Anthropic. No añade marcas visibles en el cuerpo del texto, pero para plataformas de contenido, educación y auditoría empresarial es un comportamiento nuevo que conviene conocer de antemano.
Cómo se calcula el coste de Fable 5.1
| Concepto de facturación | Precio de Fable 5.1 | Comparación con Fable 5 |
|---|---|---|
| Entrada | $10 / 1 millón de token | Igual |
| Salida | $50 / 1 millón de token | Igual |
| Escritura de caché de 5 minutos | $12.50 / 1 millón de token | Mismo nivel |
| Escritura de caché de 1 hora | $20 / 1 millón de token | Mismo nivel |
| Lectura de caché | $0.25 / 1 millón de token | 75% menos |
| Batch API | 50% del precio de entrada y salida | Según las reglas de Batch |
Supongamos que una tarea larga acumula 10 millones de token de caché leídos, 200 000 token de entrada nuevos y 50 000 token de salida, sin contar la escritura en caché:
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00La misma lectura de 10 millones de token de caché cuesta en Fable 5 unos $10, así que solo en este apartado la diferencia es de $7.50. Anthropic calcula a partir de esto que el coste real de las tareas típicas facturadas por token puede reducirse alrededor de un 25%, y hasta un 45% aproximadamente en tareas muy agénticas que reutilizan contextos largos con frecuencia. Esto no es una bajada general de los precios de lista de la API, sino que cuantos más aciertos de caché, mayor es el ahorro.
Los suscriptores no siempre disfrutan directamente de la rebaja de caché de la API
Los asientos premium de Max y Team/Enterprise pueden destinar hasta el 50% del cupo semanal a los modelos Fable; Pro y los asientos estándar usan usage credits desde el principio. El desglose concreto del consumo se rige por la página Usage de la cuenta. La rebaja de la lectura de caché afecta sobre todo a los escenarios de facturación por token; no se puede convertir directamente la rebaja del 75% de caché de la API en «cuatro veces más uso con el plan Max».
¿Es rápido Fable 5.1?
La respuesta: la respuesta de una sola ronda es más lenta, pero el tiempo total para completar tareas complejas puede ser más corto.
- El catálogo de modelos de Anthropic clasifica Fable 5.1 como
Slower, Opus 5 comoModeratey Sonnet 5 comoFast. - Claude Code usa High effort por defecto, así que de forma natural consume más tiempo de razonamiento que Low o Medium.
- Every afirma que, en su propia carga de trabajo, Fable 5.1 es unas dos veces más rápido que Opus 5 y usa la mitad de token; es una prueba específica de un socio, no una garantía general de velocidad.
- En CursorBench, Fable 5.1 Max promedia 70 pasos y 72 060 token; Fable 5 Max también da 72 pasos, pero consume 103 525 token. La ventaja de 5.1 se parece más a «menos rodeos y menos gasto de token»; no tiene por qué traducirse en una primera palabra más rápida.
Por tanto, para chat, código corto e interacciones frecuentes, prioriza Sonnet 5 u Opus 5; para depurar entre repositorios, investigaciones largas y tareas desatendidas que necesitan verificarse a sí mismas, plantéate Fable 5.1.
Cambios de compatibilidad que debes atender antes de actualizar a Fable 5.1
Actualiza Claude Code al menos a 2.1.250
La nota sobre planes y disponibilidad de Anthropic exige Claude Code 2.1.250 o superior. Si no ves Fable 5.1, comprueba primero:
claude --versionDespués actualiza siguiendo el método oficial de Claude Code y reinicia la sesión. El ID de modelo de API de Fable 5.1 es:
claude-fable-5-1El uso forzado de herramientas (forced tool use) puede devolver errores
Si la petición obliga al modelo a llamar a una herramienta concreta, Fable 5.1 puede devolver un error. Antes de migrar, revisa tool_choice y los flujos de forzado de herramientas de tus agentes; no des por hecho que el comportamiento de Fable 5 sea totalmente compatible.
Los thinking blocks no se pueden reutilizar libremente entre modelos
Los modelos más antiguos no pueden leer los thinking blocks de Fable 5.1. Al cambiar de modelo, deja que el SDK procese esos bloques según las reglas oficiales en lugar de pasarlos sin más a otro modelo.
Modificar el historial antiguo puede provocar un error 400
Para las cuentas de API nuevas creadas después del 31 de agosto de 2026, los thinking blocks solo son válidos dentro del prefijo de conversación original en el que se generaron. Si modificas system, tools o mensajes anteriores y luego reproduces los thinking blocks, es posible que obtengas un error 400. La recomendación oficial es mantener el historial como append-only (solo añadir); cuando necesites compactarlo, sustituye todo el historial antiguo por un resumen nuevo, sin modificar turnos antiguos mientras conservas los thinking blocks originales. Para el procedimiento detallado, consulta la guía de prompts y migración de Fable 5.1.
Cuándo deberías elegir Fable 5.1
Adecuado para:
- Tareas largas que atraviesan varios repositorios, servicios o aplicaciones.
- Agentes que necesitan ejecutarse durante horas y recuperarse por sí solos de los fallos.
- Investigación científica, análisis de datos complejos y entregables profesionales en varias fases.
- Problemas de sistema difíciles de reproducir, optimización del rendimiento y diagnóstico de causas raíz.
- Cargas de trabajo de API que necesitan reutilizar mucho contexto largo y con una proporción alta de lectura de caché.
No adecuado para:
- Chats sencillos, textos cortos o pequeños cambios en un solo archivo.
- Interacciones en tiempo real muy sensibles a la latencia de la primera palabra.
- Tareas de mucha salida con presupuesto fijo y sin reutilización de caché.
- Escenarios que no aceptan la retención predeterminada de 30 días de los datos de supervisión de seguridad y que no cumplen las condiciones de excepción empresarial.
- Flujos de trabajo que esperan que ninguna solicitud de ciberseguridad o de ciencias de la vida active una degradación.
Cómo consultar las tareas largas de forma remota
El valor de Fable 5.1 suele aparecer en tareas de varias horas o incluso de varios días, pero eso no significa que haya que quedarse pegado a la máquina de desarrollo. Primero confirma que Fable 5.1 está disponible en Claude Code 2.1.250+ local y después, a través de PandaNpc Agent, consulta desde el navegador, el escritorio o el móvil las sesiones de Claude Code de esa misma máquina de desarrollo, atiende las interacciones y sigue dando instrucciones.
Lo único que cambia es el punto de entrada del control; el código, las herramientas y las compilaciones siguen corriendo en tu máquina de desarrollo. Puedes leer antes la guía de acceso remoto a Claude Code y el tutorial para conectar Claude Code desde el móvil y, una vez confirmado el enlace remoto, encomendarle a Fable 5.1 las tareas largas.
FAQ
¿Cuánto mejor es Fable 5.1 que Fable 5?
La diferencia varía mucho según la tarea. En Terminal-Bench-Science mejora 27.9 puntos porcentuales y en AutomationBench, 14.3; en HLE con herramientas solo mejora 1.2 puntos porcentuales. No se puede tomar la mayor mejora aislada como representativa de todas las tareas.
¿Es Fable 5.1 más rápido que Opus 5?
En la tabla oficial de latencia relativa, Fable 5.1 es «más lenta» y Opus 5 «media». Algunos socios han observado que Fable 5.1 es más rápido en tareas completas porque consume menos token y requiere menos retrabajo. Estas dos conclusiones no miden lo mismo.
¿Es Fable 5.1 más adecuado que GPT-5.6 Sol para programar?
En la tabla de Anthropic, Fable 5.1 puntúa más alto en Terminal-Bench-Science, Terminal-Bench, AutomationBench y CursorBench. Pero los distintos modelos usan distintos harness de agente, effort, herramientas y precios, así que no se puede afirmar que Fable gane en todos los repositorios reales. Puedes consultar el tutorial de configuración de GPT-5.6 Sol con contexto de 1M y hacer tus propias pruebas A/B con tareas representativas.
¿Por qué Fable 5.1 cambia de repente a Opus?
Algunas solicitudes de ciberseguridad y de ciencias de la vida son enrutadas a Opus por las salvaguardas. El cambio de modelo no tiene por qué ser un fallo; Anthropic indica que esas solicitudes enrutadas no se facturan al precio de Fable.
¿Tiene marca de agua Fable 5.1?
Sí, con un mecanismo estadístico de procedencia del contenido (content provenance), pero no añade etiquetas visibles en la superficie del texto. No es lo mismo que una marca de agua visible en la esquina de una imagen.
Resumen
Los avances más claros de Claude Fable 5.1 se concentran en la investigación científica, las tareas de terminal y los flujos empresariales entre aplicaciones: es más capaz de ejecutarse de forma continuada, de recuperarse de los fallos y de verificar los resultados, y además reduce el coste de las tareas largas gracias a una lectura de caché más barata. Pero sigue siendo caro y con una latencia más lenta en cada ronda, y trae consigo cambios de compatibilidad en los thinking blocks, el uso forzado de herramientas y la edición del historial.
La pregunta correcta para elegirlo no es «¿es el primero en las puntuaciones?», sino: ¿tu tarea es lo bastante larga y compleja, y el coste de fallar y repetir es lo bastante alto como para que merezca la pena usar Fable 5.1? Si la respuesta es no, por lo general es más adecuado empezar por Opus 5 o Sonnet 5.
Guías relacionadas

Codex con contexto de 1M para GPT-5.6 Sol: tutorial de 3 líneas de configuración en `config.toml`
GPT-5.6 Sol es compatible oficialmente con un contexto de 1.05 millones de tokens. Solo necesita agregar 3 líneas de configuración en la parte superior del config.toml de Codex para ejecutarlo con una ventana de 1 millón y comprimir automáticamente el historial en alrededor de 900,000 tokens. Incluye configuración permanente, comando único, verificación y recordatorio de costos.
Leer artículo →
¿Cómo usar Claude Code Remote Control? Control remoto desde el móvil, limitaciones oficiales y alternativas (2026)
¿Cómo activar el Control remoto de Claude Code? Este artículo explica los tres usos oficiales: claude remote-control, claude --remote-control y /remote-control. Describe la conexión del teléfono con el navegador, los requisitos de la cuenta, los métodos de verificación y los errores frecuentes, y compara la solución PandaNpc en escenarios de modelos personalizados, Codex y múltiples máquinas.
Leer artículo →
Conecta Claude Code desde el móvil: consulta sesiones y aprueba acciones en cualquier momento con iOS
Este artículo está dirigido a desarrolladores y comparte las mejores prácticas para conectarse a Claude Code desde el móvil. Mediante la app PandaNpc iOS, puedes ver las sesiones en tiempo real, aprobar llamadas a herramientas y responder preguntas. Con pandapaw y iOS Live Activity, logras un control remoto eficiente, mejorando la flexibilidad de codificación.
Leer artículo →