GPT Image 2.5 Sunburst and Flare are now live on CometAPI โ†’
technology/Investigaciรณn de CometAPI

Claude Fable 5.1 Pruebas de rendimiento: Lo que me dicen las puntuaciones

Explore las pruebas de referencia de Claude Fable 5.1, los principales avances, las limitaciones y las comparaciones con Fable 5, Opus 5, GPT-5.6 Sol y GPT-6 Astra.

CometAPI
Mia MarenEquipo de investigaciรณn de modelos de IA y API
Actualizado Sep 17, 2026 14 min de lectura
Claude Fable 5.1 Pruebas de rendimiento: Lo que me dicen las puntuaciones
Usa este patrรณn

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Claude Fable 5.1 es principalmente una mejora de ejecuciรณn agรฉntica. Sus mayores avances reportados aparecen en investigaciรณn cientรญfica, automatizaciรณn empresarial, codificaciรณn en terminal y otros flujos de trabajo que requieren planificaciรณn, uso de herramientas, verificaciรณn y recuperaciรณn a travรฉs de muchos pasos. Las mejoras son menores en razonamiento de respuesta cerrada y tareas mรกs cortas de codificaciรณn estilo IDE, por lo que la mejor decisiรณn de despliegue depende de la carga de trabajo mรกs que de un รบnico puntaje principal.

Puntos clave

  • Fable 5.1 puntรบa 52.6% en Terminal-Bench-Science 0.1, mรกs del doble del 24.7% de Fable 5 en la evaluaciรณn de Anthropic.
  • AutomationBench sube de 17.1% a 31.4%, mostrando una gran mejora en flujos de trabajo empresariales de extremo a extremo.
  • Las ganancias son mรกs modestas en CursorBench y Humanityโ€™s Last Exam asistido por herramientas, lo que sugiere que la versiรณn mejora la ejecuciรณn sostenida mรกs que todas las formas de razonamiento por igual.
  • Fable 5.1 mantiene los mismos precios estรกndar por token que Fable 5, mientras que precios mรกs bajos de lectura de cachรฉ pueden reducir el costo efectivo de flujos agรฉnticos con mucho contexto.
  • GPT-6 Astra es ahora la comparaciรณn mรกs actual de OpenAI, pero no fue incluido en la tabla de benchmarks del 1 de septiembre de Anthropic. Cualquier afirmaciรณn de rendimiento directo requiere una evaluaciรณn con el mismo arnรฉs.

Anthropic lanzรณ Claude Fable 5.1 el 1 de septiembre de 2026 para razonamiento exigente, agentes de largo horizonte, ingenierรญa de software, investigaciรณn y trabajo profesional basado en conocimiento. Claude Fable 5.1 tambiรฉn estรก disponible a travรฉs de CometAPI para desarrolladores que quieran evaluarlo junto con otros modelos de frontera mediante un endpoint unificado.

Los resultados principales son sรณlidos, pero la distribuciรณn de la mejora es mรกs informativa que el promedio. Fable 5.1 gana mรกs cuando un agente debe mantener un objetivo, interactuar con herramientas, recuperarse de errores y verificar un estado final. Este artรญculo se centra en lo que significan los resultados de los benchmarks, dรณnde el modelo aรบn se queda corto y cรณmo evaluarlo frente a alternativas mรกs nuevas.

Claude Fable 5.1 de un vistazo

Documentaciรณn del modelo de Anthropic especifica una ventana de contexto de 1 millรณn de tokens, salida mรกxima de 128K, entrada de texto e imagen, pensamiento adaptativo siempre activo y fecha de corte de conocimiento de junio de 2026. El ID del modelo en la API de Claude es claude-fable-5-1.

Especificaciรณn oficialClaude Fable 5.1
ProveedorAnthropic
Fecha de lanzamiento1 de septiembre de 2026
ID del modeloclaude-fable-5-1
Ventana de contexto1,000,000 tokens
Salida mรกxima128,000 tokens
Entrada / salidaTexto e imรกgenes โ†’ texto
PensamientoAdaptativo, siempre activo
Esfuerzo predeterminadoAlto
Fecha de corte de conocimientoJunio de 2026
Precio de entrada de Anthropic$10 / MTok
Precio de salida de Anthropic$50 / MTok
Lectura de cachรฉ$0.25 / MTok
Latencia comparativaMรกs lenta
Posicionamiento principalRazonamiento exigente y trabajo agรฉntico de largo horizonte

Los precios estรกndar de entrada y salida siguen siendo los mismos que en Fable 5, mientras que las lecturas de cachรฉ bajaron a $0.25 por millรณn de tokens. Fable 5.1 no tiene precios de tokens de entrada/salida mรกs bajos como titular. Su menor costo efectivo proviene principalmente de una reducciรณn del 75% en el precio de lectura de cachรฉ. Anthropic estima alrededor de un 25% menos de costo para cargas tรญpicas y hasta aproximadamente un 45% para cargas altamente agรฉnticas.

Eso importa porque un agente de larga duraciรณn reutiliza repetidamente el contexto del repositorio, instrucciones, definiciones de herramientas y estado previo. El costo por tarea completada puede mejorar incluso cuando los precios titulares de entrada y salida no cambian.

Anthropic tambiรฉn reporta 60.9% para Claude Mythos 5.1 en Terminal-Bench 4.0. Mythos 5.1 es una versiรณn desplegada por separado con salvaguardias diferentes y no debe tratarse como el puntaje de Fable 5.1 de disponibilidad general.

ยฟQuรฉ muestran los benchmarks de Claude Fable 5.1?

Los siguientes valores provienen de la evaluaciรณn de septiembre de 2026 de Anthropic. Describen una configuraciรณn de modelo y arnรฉs, no una propiedad inmutable del modelo.

BenchmarkQuรฉ mideFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Investigaciรณn cientรญfica agรฉntica52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Codificaciรณn agรฉntica en terminal55.8%42.0%52.3%37.3%
GDPval-AA v2Trabajo profesional basado en conocimiento, Elo1853172318241711
OSWorld 2.0, parcialUso de ordenador de largo horizonte77.9%72.9%75.4%โ€”
OSWorld 2.0, estrictoTareas de ordenador completamente completadas41.7%36.1%39.6%โ€”
Humanityโ€™s Last Exam, sin herramientasRazonamiento multidisciplinar experto60.9%57.8%56.6%โ€”
Humanityโ€™s Last Exam, con herramientasRazonamiento experto con herramientas65.0%63.8%63.6%โ€”
AutomationBenchFlujos de trabajo empresariales de extremo a extremo31.4%17.1%26.9%19.6%
CursorBench 3.2.0Codificaciรณn agรฉntica en IDE73.4%70.5%70.0%67.2%

Fable 5.1 supera a Fable 5 y Opus 5 en las nueve filas reportadas. Sus mayores ganancias generacionales ocurren en investigaciรณn cientรญfica, automatizaciรณn de flujos empresariales y codificaciรณn en terminal. Las diferencias menores en Humanityโ€™s Last Exam y CursorBench son igualmente importantes porque muestran que la mejora no es uniforme en todas las cargas de trabajo.

ยฟDรณnde mejora mรกs Claude Fable 5.1?

Terminal-Bench-Science 0.1: el resultado destacado

Fable 5.1 puntรบa 52.6%, frente a 24.7% para Claude Fable 5, 29.0% para Claude Opus 5 y 22.4% para GPT-5.6 Sol en la ejecuciรณn de Anthropic. La gran brecha generacional de 27.9 puntos es mucho mayor que el error estรกndar por modelo reportado, mientras que brechas mรกs pequeรฑas โ€”como la diferencia de 3.5 puntos de Fable 5.1 vs Opus 5 en Terminal-Bench 4.0โ€” deben interpretarse con mรกs cautela.

Terminal-Bench-Science evalรบa flujos completos de investigaciรณn en dominios cientรญficos y de ingenierรญa. Los agentes deben producir cรณdigo, anรกlisis, pruebas, simulaciones o productos de datos en lugar de simplemente responder preguntas aisladas. Anthropic informa un error estรกndar de aproximadamente ยฑ3.5โ€“4.5 puntos por modelo, por lo que las brechas pequeรฑas no deben interpretarse automรกticamente como diferencias significativas de capacidad.

Terminal-Bench 4.0: mayor codificaciรณn autรณnoma

Fable 5.1 alcanza 55.8%, por delante de Fable 5 con 42.0%, Opus 5 con 52.3% y GPT-5.6 Sol con 37.3%. La mejora de 13.8 puntos sobre Fable 5 es sustancial, mientras que la ventaja de 3.5 puntos sobre Opus 5 es comparativamente estrecha.

El benchmark sitรบa a los agentes en un entorno de ejecuciรณn, por lo que el รฉxito depende de navegar el entorno, cambiar cรณdigo y validar resultados. Dado que Terminal-Bench 4.0 utiliza un conjunto de tareas distinto de versiones anteriores, las puntuaciones deben compararse solo dentro de la misma versiรณn del benchmark.

AutomationBench: una gran ganancia con margen significativo

AutomationBench sube de 17.1% en Fable 5 a 31.4% en Fable 5.1. Es un aumento absoluto de 14.3 puntos, o aproximadamente una ganancia relativa del 84%.

El benchmark evalรบa flujos en ventas, marketing, operaciones, soporte, finanzas y RR. HH. comprobando el estado final del entorno. Esto lo convierte en una prueba รบtil de si un agente realmente completรณ un flujo en lugar de simplemente proponer las acciones correctas. La puntuaciรณn tambiรฉn revela la limitaciรณn restante: aproximadamente dos tercios de las tareas aรบn no fueron completadas bajo la configuraciรณn reportada por Anthropic.

CursorBench 3.2.0: una ganancia de codificaciรณn mรกs pequeรฑa

Fable 5.1 alcanza 73.4%, frente a 70.5% para Fable 5, 70.0% para Opus 5 y 67.2% para GPT-5.6 Sol. La ganancia sobre Fable 5 es de solo 2.9 puntos.

Por lo tanto, el lanzamiento parece menos transformador en tareas mรกs cortas de codificaciรณn estilo IDE que en flujos mรกs largos que involucran planificaciรณn, ejecuciรณn, verificaciรณn y recuperaciรณn. Los conjuntos de evaluaciรณn deberรญan incluir cambios a escala de repositorio y recuperaciรณn de pruebas fallidas en lugar de รบnicamente calidad de generaciรณn de cรณdigo.

OSWorld 2.0: el uso del ordenador sigue siendo difรญcil

Fable 5.1 puntรบa 77.9% con crรฉdito parcial y 41.7% bajo finalizaciรณn estricta. Opus 5 alcanza 75.4% y 39.6%, mientras que Fable 5 alcanza 72.9% y 36.1%.

La puntuaciรณn estricta es la seรฑal de producciรณn mรกs reveladora. Menos de la mitad de las tareas fueron completamente completadas, lo que demuestra que el progreso en uso del ordenador no elimina la necesidad de puntos de control, permisos, supervisiรณn y lรณgica de recuperaciรณn.

CursorBench y Humanityโ€™s Last Exam: ganancias mรกs pequeรฑas

Fable 5.1 alcanza 73.4% en CursorBench 3.2.0, solo 2.9 puntos por encima de Fable 5. En Humanityโ€™s Last Exam, gana 3.1 puntos sin herramientas y 1.2 puntos con herramientas.

Estas brechas mรกs estrechas apoyan la interpretaciรณn central: Fable 5.1 es mรกs transformador en flujos largos que implican planificaciรณn, ejecuciรณn, verificaciรณn y recuperaciรณn que en tareas de IDE mรกs cortas o razonamiento acadรฉmico de respuesta cerrada.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Respuesta corta: Fable 5.1 es la opciรณn mรกs fuerte en la tabla de benchmarks de largo horizonte publicada por Anthropic; Opus 5 es el punto de partida mรกs econรณmico cuando su brecha de rendimiento menor es aceptable; Fable 5 sigue siendo la referencia heredada; GPT-6 Astra requiere una prueba con el mismo arnรฉs antes de cualquier clasificaciรณn directa.

Fable 5.1 es una mejora generacional clara sobre Fable 5 en los benchmarks agรฉnticos de largo horizonte reportados por Anthropic. GPT-6 Astra es la comparaciรณn mรกs actual de OpenAI, pero se lanzรณ despuรฉs de la evaluaciรณn del 1 de septiembre de Anthropic y no fue incluido en el mismo arnรฉs de benchmark.

DimensiรณnClaude Fable 5.1Claude Fable 5GPT-6 Astra
Ventana de contexto1M tokens1M tokens1.05M tokens
Salida mรกxima128K128K128K
Entrada / salida estรกndar$10 / $50 por MTok$10 / $50 por MTok$10 / $50 por MTok
Lectura de cachรฉ$0.25 / MTok$1 / MTokVerificar tรฉrminos actuales del proveedor
Terminal-Bench-Science 0.152.6%24.7%No incluido en la tabla de lanzamiento de Anthropic
Terminal-Bench 4.055.8%42.0%No incluido en la tabla de lanzamiento de Anthropic
AutomationBench31.4%17.1%No incluido en la tabla de lanzamiento de Anthropic
Posicionamiento principalRazonamiento exigente y agentes de largo horizonteBase previa de la clase FableTrabajo profesional de extremo a extremo difรญcil

Frente a Fable 5, Fable 5.1 muestra sus mayores ganancias medidas en investigaciรณn cientรญfica, automatizaciรณn empresarial y codificaciรณn en terminal, manteniendo los mismos precios estรกndar por token. Un menor precio de lectura de cachรฉ mejora aรบn mรกs la economรญa de agentes con contexto reutilizado.

Regla de selecciรณn: empezar con Opus 5 cuando el costo sea la prioridad, escalar a Fable 5.1 cuando la finalizaciรณn y recuperaciรณn de largo horizonte importen mรกs, mantener Fable 5 solo para cargas sensibles a compatibilidad y evaluar GPT-6 Astra en una prueba controlada con el mismo arnรฉs antes de adoptarlo en producciรณn.

ยฟCรณmo luce el rendimiento del benchmark por carga de trabajo?

CapacidadResultado de Fable 5.1Cambio vs Fable 5Interpretaciรณn
Investigaciรณn cientรญfica agรฉntica52.6%+27.9 ptsGanancia muy grande
Automatizaciรณn de flujos empresariales31.4%+14.3 ptsGanancia muy grande
Codificaciรณn en terminal55.8%+13.8 ptsGran ganancia
Uso de ordenador, estricto41.7%+5.6 ptsGanancia moderada
Uso de ordenador, parcial77.9%+5.0 ptsGanancia moderada
Razonamiento experto, sin herramientas60.9%+3.1 ptsGanancia pequeรฑa
Codificaciรณn agรฉntica en IDE73.4%+2.9 ptsGanancia pequeรฑa
Razonamiento experto, con herramientas65.0%+1.2 ptsGanancia pequeรฑa
Trabajo profesional basado en conocimiento1853 Elo+130 EloFuerte, sensible a configuraciรณn

El patrรณn es consistente: las mayores mejoras aparecen cuando el รฉxito depende de persistencia, planificaciรณn, interacciรณn con el entorno, uso de herramientas y recuperaciรณn en el tiempo.

ยฟQuรฉ no te dicen los benchmarks?

Las tablas de benchmarks comprimen el comportamiento en nรบmeros รบnicos. No prueban que los agentes autรณnomos estรฉn resueltos, y no predicen todas las cargas de trabajo de producciรณn.

  • La tabla principal de comparaciรณn es ejecutada por el proveedor.
  • Las configuraciones de esfuerzo afectan calidad, latencia y costo.
  • Los benchmarks agรฉnticos miden el conjunto de modelo, arnรฉs, herramientas y permisos.
  • Se habilitaron salvaguardias de producciรณn para Fable 5.1 y afectaron algunos resultados.
  • Las versiones de los benchmarks cambian, por lo que los valores de diferentes lanzamientos de tareas pueden no ser comparables.
  • AutomationBench permanece en 31.4%, mientras que OSWorld de finalizaciรณn estricta permanece en 41.7%; persisten tasas de fallo sustanciales.

Una evaluaciรณn prรกctica deberรญa usar puntuaciones pรบblicas para preseleccionar candidatos, reproducir una pequeรฑa comparaciรณn con ajustes idรฉnticos y luego probar el flujo de trabajo de producciรณn real.

ยฟEs Claude Fable 5.1 el mejor modelo de Claude?

Para mรกxima capacidad en trabajo difรญcil y de larga ejecuciรณn, la evidencia de benchmark hace un caso sรณlido para Claude Fable 5.1. Para todas las cargas de trabajo, no.

Anthropic lo tarifa a $10 por millรณn de tokens de entrada y $50 por millรณn de tokens de salida, frente a $5 y $25 para Opus 5. La prima se justifica solo cuando Fable 5.1 produce una mayor tasa de รฉxito, menos reintentos, menos tokens por tarea aceptada o suficiente reducciรณn en tiempo de revisiรณn humana.

Un menor precio de lectura de cachรฉ puede estrechar la brecha de costo efectivo para agentes. El costo por resultado aceptado es por tanto mรกs รบtil que el precio por token รบnicamente.

ยฟCรณmo deberรญas hacer benchmark a Claude Fable 5.1?

Tu evaluaciรณn deberรญa parecerse a la carga de producciรณn prevista.

  • Codificaciรณn: probar incidencias completas y registrar aceptaciรณn de parches, pruebas aprobadas, reintentos, llamadas a herramientas, tiempo transcurrido y tiempo de correcciรณn humana.
  • Investigaciรณn: evaluar calidad de las fuentes, precisiรณn factual, cobertura de evidencia, finalizaciรณn de subtareas y retenciรณn del objetivo en ejecuciones largas.
  • Agentes empresariales: calificar el estado final del entorno en lugar de contar acciones correctas individualmente.
  • Uso del ordenador: medir la recuperaciรณn de ventanas emergentes, pรกginas lentas, sesiones interrumpidas y estado de aplicaciรณn inconsistente.
  • Comparaciรณn de modelos: mantener constantes prompts, arneses, herramientas, permisos, configuraciones de esfuerzo y reglas de puntuaciรณn.
  • Economรญa: medir costo por tarea aceptada, no solo costo por token.

Conclusiรณn

La evidencia del benchmark sugiere que Fable 5.1 es mรกs valioso cuando una tarea requiere ejecuciรณn sostenida en lugar de una sola respuesta. Los casos de uso mรกs fuertes incluyen investigaciรณn cientรญfica, codificaciรณn autรณnoma, automatizaciรณn empresarial compleja y flujos con verificaciรณn y recuperaciรณn repetidas.

La evidencia no respalda superioridad universal. Brechas menores en varios benchmarks, tasas significativas de fallo en tareas estrictas de uso de ordenador y la ausencia de GPT-6 Astra en la tabla de lanzamiento de Anthropic refuerzan la necesidad de pruebas especรญficas por carga de trabajo.

Para usuarios de CometAPI, una regla prรกctica de despliegue es probar Fable 5.1 donde el รฉxito de largo horizonte pueda justificar inferencia premium, luego compararlo con Opus 5, GPT-5.6 Sol y GPT-6 Astra en las mismas tareas representativas antes de elegir una ruta de producciรณn.

Preguntas frecuentes

ยฟCuรกl es la puntuaciรณn de benchmark mรกs alta de Claude Fable 5.1?

Entre las mรฉtricas porcentuales reportadas por Anthropic, Fable 5.1 alcanza 77.9% con crรฉdito parcial en OSWorld 2.0 y 73.4% en CursorBench 3.2.0. Su mayor mejora generacional es Terminal-Bench-Science, con 52.6% frente a 24.7% para Fable 5.

ยฟCuรกnto mejor es Claude Fable 5.1 que Fable 5?

La ganancia varรญa drรกsticamente segรบn la carga: 27.9 puntos en Terminal-Bench-Science, 14.3 en AutomationBench y 13.8 en Terminal-Bench 4.0, pero solo 2.9 en CursorBench y 1.2 en Humanityโ€™s Last Exam asistido por herramientas.

ยฟEs Claude Fable 5.1 mejor que Claude Opus 5?

Puntรบa mรกs alto en toda la tabla reportada por Anthropic, pero muchas brechas son pequeรฑas. Anthropic recomienda empezar con Opus 5 y escalar cuando se requiera capacidad adicional de largo horizonte.

ยฟClaude Fable 5.1 supera a GPT-5.6 Sol?

Anthropic reporta puntuaciones mรกs altas de Fable 5.1 en cinco mรฉtricas compartidas. Dado que son evaluaciones de competidores ejecutadas por el proveedor y las configuraciones varรญan, la conclusiรณn segura es que Fable 5.1 es altamente competitivo mรกs que universalmente superior.

ยฟLos resultados estรกn verificados de forma independiente?

Solo parcialmente. Varios benchmarks tienen tablas pรบblicas, pero esfuerzo, arnรฉs, comportamiento de fallback y versiones de tareas deben alinearse antes de comparar sus valores directamente con la ejecuciรณn de lanzamiento de Anthropic.

ยฟPara quรฉ es mejor Claude Fable 5.1?

Su perfil de benchmark es mรกs fuerte para investigaciรณn cientรญfica de larga duraciรณn, codificaciรณn autรณnoma, flujos agรฉnticos complejos, automatizaciรณn empresarial y tareas que requieren planificaciรณn, herramientas, verificaciรณn y recuperaciรณn.

ยฟCรณmo puedo acceder a Claude Fable 5.1?

Claude Fable 5.1 estรก listado en CometAPI con ID de modelo claude-fable-5-1. Un endpoint unificado facilita ejecutar la misma carga de evaluaciรณn en varios modelos antes de elegir una ruta de producciรณn.

Seguir aprendiendo

Conecta este artรญculo con la siguiente decisiรณn.

Ver todos los temas
Publicado el Sep 17, 2026
รšltima actualizaciรณn Sep 17, 2026
0 visitas
Revisado para mayor claridad, atribuciรณn de fuentes y terminologรญa API actual.

ยฟListo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Crรฉditos de prueba gratuitos incluidos. No se requiere tarjeta de crรฉdito.

Leer Mรกs