TL;DR Claude Fable 5.1 es principalmente una mejora de ejecuciรณn agรฉntica. Sus mayores avances reportados aparecen en investigaciรณn cientรญfica, automatizaciรณn empresarial, codificaciรณn en terminal y otros flujos de trabajo que requieren planificaciรณn, uso de herramientas, verificaciรณn y recuperaciรณn a travรฉs de muchos pasos. Las mejoras son menores en razonamiento de respuesta cerrada y tareas mรกs cortas de codificaciรณn estilo IDE, por lo que la mejor decisiรณn de despliegue depende de la carga de trabajo mรกs que de un รบnico puntaje principal.
Puntos clave
- Fable 5.1 puntรบa 52.6% en Terminal-Bench-Science 0.1, mรกs del doble del 24.7% de Fable 5 en la evaluaciรณn de Anthropic.
- AutomationBench sube de 17.1% a 31.4%, mostrando una gran mejora en flujos de trabajo empresariales de extremo a extremo.
- Las ganancias son mรกs modestas en CursorBench y Humanityโs Last Exam asistido por herramientas, lo que sugiere que la versiรณn mejora la ejecuciรณn sostenida mรกs que todas las formas de razonamiento por igual.
- Fable 5.1 mantiene los mismos precios estรกndar por token que Fable 5, mientras que precios mรกs bajos de lectura de cachรฉ pueden reducir el costo efectivo de flujos agรฉnticos con mucho contexto.
- GPT-6 Astra es ahora la comparaciรณn mรกs actual de OpenAI, pero no fue incluido en la tabla de benchmarks del 1 de septiembre de Anthropic. Cualquier afirmaciรณn de rendimiento directo requiere una evaluaciรณn con el mismo arnรฉs.
Anthropic lanzรณ Claude Fable 5.1 el 1 de septiembre de 2026 para razonamiento exigente, agentes de largo horizonte, ingenierรญa de software, investigaciรณn y trabajo profesional basado en conocimiento. Claude Fable 5.1 tambiรฉn estรก disponible a travรฉs de CometAPI para desarrolladores que quieran evaluarlo junto con otros modelos de frontera mediante un endpoint unificado.
Los resultados principales son sรณlidos, pero la distribuciรณn de la mejora es mรกs informativa que el promedio. Fable 5.1 gana mรกs cuando un agente debe mantener un objetivo, interactuar con herramientas, recuperarse de errores y verificar un estado final. Este artรญculo se centra en lo que significan los resultados de los benchmarks, dรณnde el modelo aรบn se queda corto y cรณmo evaluarlo frente a alternativas mรกs nuevas.
Claude Fable 5.1 de un vistazo
Documentaciรณn del modelo de Anthropic especifica una ventana de contexto de 1 millรณn de tokens, salida mรกxima de 128K, entrada de texto e imagen, pensamiento adaptativo siempre activo y fecha de corte de conocimiento de junio de 2026. El ID del modelo en la API de Claude es claude-fable-5-1.
| Especificaciรณn oficial | Claude Fable 5.1 |
|---|---|
| Proveedor | Anthropic |
| Fecha de lanzamiento | 1 de septiembre de 2026 |
| ID del modelo | claude-fable-5-1 |
| Ventana de contexto | 1,000,000 tokens |
| Salida mรกxima | 128,000 tokens |
| Entrada / salida | Texto e imรกgenes โ texto |
| Pensamiento | Adaptativo, siempre activo |
| Esfuerzo predeterminado | Alto |
| Fecha de corte de conocimiento | Junio de 2026 |
| Precio de entrada de Anthropic | $10 / MTok |
| Precio de salida de Anthropic | $50 / MTok |
| Lectura de cachรฉ | $0.25 / MTok |
| Latencia comparativa | Mรกs lenta |
| Posicionamiento principal | Razonamiento exigente y trabajo agรฉntico de largo horizonte |
Los precios estรกndar de entrada y salida siguen siendo los mismos que en Fable 5, mientras que las lecturas de cachรฉ bajaron a $0.25 por millรณn de tokens. Fable 5.1 no tiene precios de tokens de entrada/salida mรกs bajos como titular. Su menor costo efectivo proviene principalmente de una reducciรณn del 75% en el precio de lectura de cachรฉ. Anthropic estima alrededor de un 25% menos de costo para cargas tรญpicas y hasta aproximadamente un 45% para cargas altamente agรฉnticas.
Eso importa porque un agente de larga duraciรณn reutiliza repetidamente el contexto del repositorio, instrucciones, definiciones de herramientas y estado previo. El costo por tarea completada puede mejorar incluso cuando los precios titulares de entrada y salida no cambian.
Anthropic tambiรฉn reporta 60.9% para Claude Mythos 5.1 en Terminal-Bench 4.0. Mythos 5.1 es una versiรณn desplegada por separado con salvaguardias diferentes y no debe tratarse como el puntaje de Fable 5.1 de disponibilidad general.
ยฟQuรฉ muestran los benchmarks de Claude Fable 5.1?
Los siguientes valores provienen de la evaluaciรณn de septiembre de 2026 de Anthropic. Describen una configuraciรณn de modelo y arnรฉs, no una propiedad inmutable del modelo.
| Benchmark | Quรฉ mide | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Investigaciรณn cientรญfica agรฉntica | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Codificaciรณn agรฉntica en terminal | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Trabajo profesional basado en conocimiento, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, parcial | Uso de ordenador de largo horizonte | 77.9% | 72.9% | 75.4% | โ |
| OSWorld 2.0, estricto | Tareas de ordenador completamente completadas | 41.7% | 36.1% | 39.6% | โ |
| Humanityโs Last Exam, sin herramientas | Razonamiento multidisciplinar experto | 60.9% | 57.8% | 56.6% | โ |
| Humanityโs Last Exam, con herramientas | Razonamiento experto con herramientas | 65.0% | 63.8% | 63.6% | โ |
| AutomationBench | Flujos de trabajo empresariales de extremo a extremo | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Codificaciรณn agรฉntica en IDE | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 supera a Fable 5 y Opus 5 en las nueve filas reportadas. Sus mayores ganancias generacionales ocurren en investigaciรณn cientรญfica, automatizaciรณn de flujos empresariales y codificaciรณn en terminal. Las diferencias menores en Humanityโs Last Exam y CursorBench son igualmente importantes porque muestran que la mejora no es uniforme en todas las cargas de trabajo.
ยฟDรณnde mejora mรกs Claude Fable 5.1?
Terminal-Bench-Science 0.1: el resultado destacado
Fable 5.1 puntรบa 52.6%, frente a 24.7% para Claude Fable 5, 29.0% para Claude Opus 5 y 22.4% para GPT-5.6 Sol en la ejecuciรณn de Anthropic. La gran brecha generacional de 27.9 puntos es mucho mayor que el error estรกndar por modelo reportado, mientras que brechas mรกs pequeรฑas โcomo la diferencia de 3.5 puntos de Fable 5.1 vs Opus 5 en Terminal-Bench 4.0โ deben interpretarse con mรกs cautela.
Terminal-Bench-Science evalรบa flujos completos de investigaciรณn en dominios cientรญficos y de ingenierรญa. Los agentes deben producir cรณdigo, anรกlisis, pruebas, simulaciones o productos de datos en lugar de simplemente responder preguntas aisladas. Anthropic informa un error estรกndar de aproximadamente ยฑ3.5โ4.5 puntos por modelo, por lo que las brechas pequeรฑas no deben interpretarse automรกticamente como diferencias significativas de capacidad.
Terminal-Bench 4.0: mayor codificaciรณn autรณnoma
Fable 5.1 alcanza 55.8%, por delante de Fable 5 con 42.0%, Opus 5 con 52.3% y GPT-5.6 Sol con 37.3%. La mejora de 13.8 puntos sobre Fable 5 es sustancial, mientras que la ventaja de 3.5 puntos sobre Opus 5 es comparativamente estrecha.
El benchmark sitรบa a los agentes en un entorno de ejecuciรณn, por lo que el รฉxito depende de navegar el entorno, cambiar cรณdigo y validar resultados. Dado que Terminal-Bench 4.0 utiliza un conjunto de tareas distinto de versiones anteriores, las puntuaciones deben compararse solo dentro de la misma versiรณn del benchmark.
AutomationBench: una gran ganancia con margen significativo
AutomationBench sube de 17.1% en Fable 5 a 31.4% en Fable 5.1. Es un aumento absoluto de 14.3 puntos, o aproximadamente una ganancia relativa del 84%.
El benchmark evalรบa flujos en ventas, marketing, operaciones, soporte, finanzas y RR. HH. comprobando el estado final del entorno. Esto lo convierte en una prueba รบtil de si un agente realmente completรณ un flujo en lugar de simplemente proponer las acciones correctas. La puntuaciรณn tambiรฉn revela la limitaciรณn restante: aproximadamente dos tercios de las tareas aรบn no fueron completadas bajo la configuraciรณn reportada por Anthropic.
CursorBench 3.2.0: una ganancia de codificaciรณn mรกs pequeรฑa
Fable 5.1 alcanza 73.4%, frente a 70.5% para Fable 5, 70.0% para Opus 5 y 67.2% para GPT-5.6 Sol. La ganancia sobre Fable 5 es de solo 2.9 puntos.
Por lo tanto, el lanzamiento parece menos transformador en tareas mรกs cortas de codificaciรณn estilo IDE que en flujos mรกs largos que involucran planificaciรณn, ejecuciรณn, verificaciรณn y recuperaciรณn. Los conjuntos de evaluaciรณn deberรญan incluir cambios a escala de repositorio y recuperaciรณn de pruebas fallidas en lugar de รบnicamente calidad de generaciรณn de cรณdigo.
OSWorld 2.0: el uso del ordenador sigue siendo difรญcil
Fable 5.1 puntรบa 77.9% con crรฉdito parcial y 41.7% bajo finalizaciรณn estricta. Opus 5 alcanza 75.4% y 39.6%, mientras que Fable 5 alcanza 72.9% y 36.1%.
La puntuaciรณn estricta es la seรฑal de producciรณn mรกs reveladora. Menos de la mitad de las tareas fueron completamente completadas, lo que demuestra que el progreso en uso del ordenador no elimina la necesidad de puntos de control, permisos, supervisiรณn y lรณgica de recuperaciรณn.
CursorBench y Humanityโs Last Exam: ganancias mรกs pequeรฑas
Fable 5.1 alcanza 73.4% en CursorBench 3.2.0, solo 2.9 puntos por encima de Fable 5. En Humanityโs Last Exam, gana 3.1 puntos sin herramientas y 1.2 puntos con herramientas.
Estas brechas mรกs estrechas apoyan la interpretaciรณn central: Fable 5.1 es mรกs transformador en flujos largos que implican planificaciรณn, ejecuciรณn, verificaciรณn y recuperaciรณn que en tareas de IDE mรกs cortas o razonamiento acadรฉmico de respuesta cerrada.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Respuesta corta: Fable 5.1 es la opciรณn mรกs fuerte en la tabla de benchmarks de largo horizonte publicada por Anthropic; Opus 5 es el punto de partida mรกs econรณmico cuando su brecha de rendimiento menor es aceptable; Fable 5 sigue siendo la referencia heredada; GPT-6 Astra requiere una prueba con el mismo arnรฉs antes de cualquier clasificaciรณn directa.
Fable 5.1 es una mejora generacional clara sobre Fable 5 en los benchmarks agรฉnticos de largo horizonte reportados por Anthropic. GPT-6 Astra es la comparaciรณn mรกs actual de OpenAI, pero se lanzรณ despuรฉs de la evaluaciรณn del 1 de septiembre de Anthropic y no fue incluido en el mismo arnรฉs de benchmark.
| Dimensiรณn | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Ventana de contexto | 1M tokens | 1M tokens | 1.05M tokens |
| Salida mรกxima | 128K | 128K | 128K |
| Entrada / salida estรกndar | $10 / $50 por MTok | $10 / $50 por MTok | $10 / $50 por MTok |
| Lectura de cachรฉ | $0.25 / MTok | $1 / MTok | Verificar tรฉrminos actuales del proveedor |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | No incluido en la tabla de lanzamiento de Anthropic |
| Terminal-Bench 4.0 | 55.8% | 42.0% | No incluido en la tabla de lanzamiento de Anthropic |
| AutomationBench | 31.4% | 17.1% | No incluido en la tabla de lanzamiento de Anthropic |
| Posicionamiento principal | Razonamiento exigente y agentes de largo horizonte | Base previa de la clase Fable | Trabajo profesional de extremo a extremo difรญcil |
Frente a Fable 5, Fable 5.1 muestra sus mayores ganancias medidas en investigaciรณn cientรญfica, automatizaciรณn empresarial y codificaciรณn en terminal, manteniendo los mismos precios estรกndar por token. Un menor precio de lectura de cachรฉ mejora aรบn mรกs la economรญa de agentes con contexto reutilizado.
Regla de selecciรณn: empezar con Opus 5 cuando el costo sea la prioridad, escalar a Fable 5.1 cuando la finalizaciรณn y recuperaciรณn de largo horizonte importen mรกs, mantener Fable 5 solo para cargas sensibles a compatibilidad y evaluar GPT-6 Astra en una prueba controlada con el mismo arnรฉs antes de adoptarlo en producciรณn.
ยฟCรณmo luce el rendimiento del benchmark por carga de trabajo?
| Capacidad | Resultado de Fable 5.1 | Cambio vs Fable 5 | Interpretaciรณn |
|---|---|---|---|
| Investigaciรณn cientรญfica agรฉntica | 52.6% | +27.9 pts | Ganancia muy grande |
| Automatizaciรณn de flujos empresariales | 31.4% | +14.3 pts | Ganancia muy grande |
| Codificaciรณn en terminal | 55.8% | +13.8 pts | Gran ganancia |
| Uso de ordenador, estricto | 41.7% | +5.6 pts | Ganancia moderada |
| Uso de ordenador, parcial | 77.9% | +5.0 pts | Ganancia moderada |
| Razonamiento experto, sin herramientas | 60.9% | +3.1 pts | Ganancia pequeรฑa |
| Codificaciรณn agรฉntica en IDE | 73.4% | +2.9 pts | Ganancia pequeรฑa |
| Razonamiento experto, con herramientas | 65.0% | +1.2 pts | Ganancia pequeรฑa |
| Trabajo profesional basado en conocimiento | 1853 Elo | +130 Elo | Fuerte, sensible a configuraciรณn |
El patrรณn es consistente: las mayores mejoras aparecen cuando el รฉxito depende de persistencia, planificaciรณn, interacciรณn con el entorno, uso de herramientas y recuperaciรณn en el tiempo.
ยฟQuรฉ no te dicen los benchmarks?
Las tablas de benchmarks comprimen el comportamiento en nรบmeros รบnicos. No prueban que los agentes autรณnomos estรฉn resueltos, y no predicen todas las cargas de trabajo de producciรณn.
- La tabla principal de comparaciรณn es ejecutada por el proveedor.
- Las configuraciones de esfuerzo afectan calidad, latencia y costo.
- Los benchmarks agรฉnticos miden el conjunto de modelo, arnรฉs, herramientas y permisos.
- Se habilitaron salvaguardias de producciรณn para Fable 5.1 y afectaron algunos resultados.
- Las versiones de los benchmarks cambian, por lo que los valores de diferentes lanzamientos de tareas pueden no ser comparables.
- AutomationBench permanece en 31.4%, mientras que OSWorld de finalizaciรณn estricta permanece en 41.7%; persisten tasas de fallo sustanciales.
Una evaluaciรณn prรกctica deberรญa usar puntuaciones pรบblicas para preseleccionar candidatos, reproducir una pequeรฑa comparaciรณn con ajustes idรฉnticos y luego probar el flujo de trabajo de producciรณn real.
ยฟEs Claude Fable 5.1 el mejor modelo de Claude?
Para mรกxima capacidad en trabajo difรญcil y de larga ejecuciรณn, la evidencia de benchmark hace un caso sรณlido para Claude Fable 5.1. Para todas las cargas de trabajo, no.
Anthropic lo tarifa a $10 por millรณn de tokens de entrada y $50 por millรณn de tokens de salida, frente a $5 y $25 para Opus 5. La prima se justifica solo cuando Fable 5.1 produce una mayor tasa de รฉxito, menos reintentos, menos tokens por tarea aceptada o suficiente reducciรณn en tiempo de revisiรณn humana.
Un menor precio de lectura de cachรฉ puede estrechar la brecha de costo efectivo para agentes. El costo por resultado aceptado es por tanto mรกs รบtil que el precio por token รบnicamente.
ยฟCรณmo deberรญas hacer benchmark a Claude Fable 5.1?
Tu evaluaciรณn deberรญa parecerse a la carga de producciรณn prevista.
- Codificaciรณn: probar incidencias completas y registrar aceptaciรณn de parches, pruebas aprobadas, reintentos, llamadas a herramientas, tiempo transcurrido y tiempo de correcciรณn humana.
- Investigaciรณn: evaluar calidad de las fuentes, precisiรณn factual, cobertura de evidencia, finalizaciรณn de subtareas y retenciรณn del objetivo en ejecuciones largas.
- Agentes empresariales: calificar el estado final del entorno en lugar de contar acciones correctas individualmente.
- Uso del ordenador: medir la recuperaciรณn de ventanas emergentes, pรกginas lentas, sesiones interrumpidas y estado de aplicaciรณn inconsistente.
- Comparaciรณn de modelos: mantener constantes prompts, arneses, herramientas, permisos, configuraciones de esfuerzo y reglas de puntuaciรณn.
- Economรญa: medir costo por tarea aceptada, no solo costo por token.
Conclusiรณn
La evidencia del benchmark sugiere que Fable 5.1 es mรกs valioso cuando una tarea requiere ejecuciรณn sostenida en lugar de una sola respuesta. Los casos de uso mรกs fuertes incluyen investigaciรณn cientรญfica, codificaciรณn autรณnoma, automatizaciรณn empresarial compleja y flujos con verificaciรณn y recuperaciรณn repetidas.
La evidencia no respalda superioridad universal. Brechas menores en varios benchmarks, tasas significativas de fallo en tareas estrictas de uso de ordenador y la ausencia de GPT-6 Astra en la tabla de lanzamiento de Anthropic refuerzan la necesidad de pruebas especรญficas por carga de trabajo.
Para usuarios de CometAPI, una regla prรกctica de despliegue es probar Fable 5.1 donde el รฉxito de largo horizonte pueda justificar inferencia premium, luego compararlo con Opus 5, GPT-5.6 Sol y GPT-6 Astra en las mismas tareas representativas antes de elegir una ruta de producciรณn.
Preguntas frecuentes
ยฟCuรกl es la puntuaciรณn de benchmark mรกs alta de Claude Fable 5.1?
Entre las mรฉtricas porcentuales reportadas por Anthropic, Fable 5.1 alcanza 77.9% con crรฉdito parcial en OSWorld 2.0 y 73.4% en CursorBench 3.2.0. Su mayor mejora generacional es Terminal-Bench-Science, con 52.6% frente a 24.7% para Fable 5.
ยฟCuรกnto mejor es Claude Fable 5.1 que Fable 5?
La ganancia varรญa drรกsticamente segรบn la carga: 27.9 puntos en Terminal-Bench-Science, 14.3 en AutomationBench y 13.8 en Terminal-Bench 4.0, pero solo 2.9 en CursorBench y 1.2 en Humanityโs Last Exam asistido por herramientas.
ยฟEs Claude Fable 5.1 mejor que Claude Opus 5?
Puntรบa mรกs alto en toda la tabla reportada por Anthropic, pero muchas brechas son pequeรฑas. Anthropic recomienda empezar con Opus 5 y escalar cuando se requiera capacidad adicional de largo horizonte.
ยฟClaude Fable 5.1 supera a GPT-5.6 Sol?
Anthropic reporta puntuaciones mรกs altas de Fable 5.1 en cinco mรฉtricas compartidas. Dado que son evaluaciones de competidores ejecutadas por el proveedor y las configuraciones varรญan, la conclusiรณn segura es que Fable 5.1 es altamente competitivo mรกs que universalmente superior.
ยฟLos resultados estรกn verificados de forma independiente?
Solo parcialmente. Varios benchmarks tienen tablas pรบblicas, pero esfuerzo, arnรฉs, comportamiento de fallback y versiones de tareas deben alinearse antes de comparar sus valores directamente con la ejecuciรณn de lanzamiento de Anthropic.
ยฟPara quรฉ es mejor Claude Fable 5.1?
Su perfil de benchmark es mรกs fuerte para investigaciรณn cientรญfica de larga duraciรณn, codificaciรณn autรณnoma, flujos agรฉnticos complejos, automatizaciรณn empresarial y tareas que requieren planificaciรณn, herramientas, verificaciรณn y recuperaciรณn.
ยฟCรณmo puedo acceder a Claude Fable 5.1?
Claude Fable 5.1 estรก listado en CometAPI con ID de modelo claude-fable-5-1. Un endpoint unificado facilita ejecutar la misma carga de evaluaciรณn en varios modelos antes de elegir una ruta de producciรณn.
