GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Pesquisa CometAPI

Benchmarks do Claude Fable 5.1: O que as pontuações me dizem

Explore os benchmarks do Claude Fable 5.1, os principais ganhos, limitações e comparações com Fable 5, Opus 5, GPT-5.6 Sol e GPT-6 Astra.

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 17, 2026 14 min de leitura
Benchmarks do Claude Fable 5.1: O que as pontuações me dizem
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Claude Fable 5.1 é principalmente uma atualização focada na execução orientada a agentes. Seus maiores ganhos relatados aparecem em pesquisa científica, automação de negócios, codificação em terminal e outros fluxos de trabalho que exigem planejamento, uso de ferramentas, verificação e recuperação ao longo de muitas etapas. As melhorias são menores em raciocínio de resposta fechada e em tarefas mais curtas de codificação no estilo IDE, portanto a melhor decisão de implantação depende da carga de trabalho em vez de um único número de destaque.

Principais pontos

  • Fable 5.1 marca 52.6% no Terminal-Bench-Science 0.1, mais que o dobro dos 24.7% do Fable 5 na avaliação da Anthropic.
  • O AutomationBench sobe de 17.1% para 31.4%, mostrando uma grande melhoria em fluxos de trabalho de negócios de ponta a ponta.
  • Os ganhos são mais modestos no CursorBench e no Humanity's Last Exam com ferramentas, sugerindo que o lançamento melhora a execução sustentada mais do que todas as formas de raciocínio de maneira igual.
  • Fable 5.1 mantém os mesmos preços padrão de tokens do Fable 5, enquanto o preço menor de leitura de cache pode reduzir o custo efetivo de fluxos de trabalho de agentes com contexto pesado.
  • GPT-6 Astra é agora a comparação mais atual da OpenAI, mas não foi incluído na tabela de benchmarks de 1º de setembro da Anthropic. Qualquer afirmação direta de desempenho requer uma avaliação controlada no mesmo harness.

A Anthropic lançou o Claude Fable 5.1 em 1º de setembro de 2026 para raciocínio exigente, agentes de longo horizonte, engenharia de software, pesquisa e trabalho profissional de conhecimento. Claude Fable 5.1 também está disponível via CometAPI para desenvolvedores que desejam avaliá-lo ao lado de outros modelos de ponta por meio de um endpoint unificado.

Os resultados de destaque são fortes, mas a distribuição da melhoria é mais informativa do que a média. O Fable 5.1 ganha mais quando um agente precisa preservar um objetivo, interagir com ferramentas, recuperar-se de erros e verificar um estado final. Este artigo foca no significado dos resultados de benchmark, onde o modelo ainda fica aquém e como avaliá-lo em relação a alternativas mais recentes.

Visão geral do Claude Fable 5.1

A documentação do modelo da Anthropic especifica uma janela de contexto de 1 milhão de tokens, saída máxima de 128K, entrada de texto e imagem, pensamento adaptativo sempre ativo e um corte de conhecimento em junho de 2026. O ID do modelo na Claude API é claude-fable-5-1.

Especificação oficialClaude Fable 5.1
ProvedorAnthropic
Data de lançamento1º de setembro de 2026
ID do modeloclaude-fable-5-1
Janela de contexto1,000,000 tokens
Saída máxima128,000 tokens
Entrada / saídaTexto e imagens → texto
RaciocínioAdaptativo, sempre ativo
Esforço padrãoAlto
Corte de conhecimentoJunho de 2026
Preço de entrada Anthropic$10 / MTok
Preço de saída Anthropic$50 / MTok
Leitura de cache$0.25 / MTok
Latência comparativaMais lenta
Posicionamento primárioRaciocínio exigente e trabalho de agentes de longo horizonte

Os preços padrão de entrada e saída permanecem os mesmos do Fable 5, enquanto as leituras de cache caíram para $0.25 por milhão de tokens. O Fable 5.1 não tem preços de tokens de entrada/saída mais baixos nos títulos. Seu custo efetivo menor vem principalmente de uma redução de 75% no preço de leitura de cache. A Anthropic estima cerca de 25% de redução de custo para cargas típicas e até aproximadamente 45% para cargas altamente orientadas a agentes.

Isso é relevante porque um agente de longa duração reutiliza repetidamente contexto de repositório, instruções, definições de ferramentas e estado anterior. O custo por tarefa concluída pode melhorar mesmo quando os preços de entrada e saída não mudam.

A Anthropic também relata 60.9% para o Claude Mythos 5.1 no Terminal-Bench 4.0. Mythos 5.1 é uma versão implantada separadamente com salvaguardas diferentes e não deve ser tratado como a pontuação geralmente disponível do Fable 5.1.

O que os benchmarks do Claude Fable 5.1 mostram?

Os valores a seguir vêm da avaliação de setembro de 2026 da Anthropic. Eles descrevem uma configuração de modelo e harness, não uma propriedade imutável do modelo.

BenchmarkO que medeFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Pesquisa científica orientada a agentes52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Codificação em terminal orientada a agentes55.8%42.0%52.3%37.3%
GDPval-AA v2Trabalho profissional de conhecimento, Elo1853172318241711
OSWorld 2.0, parcialUso de computador de longo horizonte77.9%72.9%75.4%
OSWorld 2.0, estritoTarefas de computador totalmente concluídas41.7%36.1%39.6%
Humanity’s Last Exam, sem ferramentasRaciocínio multidisciplinar de nível especialista60.9%57.8%56.6%
Humanity’s Last Exam, com ferramentasRaciocínio especialista com ferramentas65.0%63.8%63.6%
AutomationBenchFluxos de trabalho empresariais de ponta a ponta31.4%17.1%26.9%19.6%
CursorBench 3.2.0Codificação em IDE orientada a agentes73.4%70.5%70.0%67.2%

O Fable 5.1 supera Fable 5 e Opus 5 em todas as nove linhas relatadas. Seus maiores ganhos geracionais ocorrem em pesquisa científica, automação de fluxos de trabalho de negócios e codificação em terminal. As diferenças menores no Humanity's Last Exam e no CursorBench são igualmente importantes porque mostram que a melhoria não é uniforme em todas as cargas.

Onde o Claude Fable 5.1 melhora mais?

Terminal-Bench-Science 0.1: o destaque

O Fable 5.1 marca 52.6%, comparado a 24.7% do Claude Fable 5, 29.0% do Claude Opus 5 e 22.4% do GPT-5.6 Sol no teste da Anthropic. A grande diferença geracional de 27.9 pontos é muito maior do que o erro padrão por modelo relatado, enquanto lacunas menores — como a diferença de 3.5 pontos entre Fable 5.1 e Opus 5 no Terminal-Bench 4.0 — devem ser interpretadas com mais cautela.

O Terminal-Bench-Science avalia fluxos de trabalho de pesquisa completos em domínios científicos e de engenharia. Agentes devem produzir código, análises, provas, simulações ou produtos de dados em vez de apenas responder a perguntas isoladas. A Anthropic relata um erro padrão de aproximadamente ±3.5–4.5 pontos por modelo, portanto lacunas pequenas não devem automaticamente ser interpretadas como diferenças de capacidade significativas.

Terminal-Bench 4.0: codificação autônoma mais forte

O Fable 5.1 alcança 55.8%, à frente do Fable 5 com 42.0%, do Opus 5 com 52.3% e do GPT-5.6 Sol com 37.3%. A melhoria de 13.8 pontos em relação ao Fable 5 é substancial, enquanto a vantagem de 3.5 pontos sobre o Opus 5 é comparativamente estreita.

O benchmark coloca os agentes em um ambiente de execução, portanto o sucesso depende de navegar no ambiente, modificar código e validar resultados. Como o Terminal-Bench 4.0 usa um conjunto de tarefas diferente de versões anteriores, as pontuações devem ser comparadas apenas dentro da mesma versão do benchmark.

AutomationBench: um grande ganho com margem significativa

O AutomationBench sobe de 17.1% no Fable 5 para 31.4% no Fable 5.1. Isso é um aumento absoluto de 14.3 pontos, ou aproximadamente 84% de ganho relativo.

O benchmark avalia fluxos de trabalho em vendas, marketing, operações, suporte, finanças e RH verificando o estado final do ambiente. Isso o torna um teste útil de se um agente realmente concluiu um fluxo de trabalho em vez de simplesmente propor as ações corretas. A pontuação também revela a limitação remanescente: cerca de dois terços das tarefas ainda não foram concluídas na configuração relatada pela Anthropic.

CursorBench 3.2.0: um ganho menor em codificação

O Fable 5.1 alcança 73.4%, versus 70.5% do Fable 5, 70.0% do Opus 5 e 67.2% do GPT-5.6 Sol. O ganho sobre o Fable 5 é de apenas 2.9 pontos.

Portanto, o lançamento parece menos transformador em tarefas mais curtas de codificação no estilo IDE do que em fluxos de trabalho mais longos envolvendo planejamento, execução, verificação e recuperação. Conjuntos de avaliação devem incluir mudanças em escala de repositório e recuperação de testes falhos, e não apenas qualidade de geração de código.

OSWorld 2.0: uso de computador continua difícil

O Fable 5.1 marca 77.9% com crédito parcial e 41.7% sob conclusão estrita. O Opus 5 alcança 75.4% e 39.6%, enquanto o Fable 5 alcança 72.9% e 36.1%.

A pontuação estrita é o sinal de produção mais revelador. Menos da metade das tarefas foi totalmente concluída, demonstrando que o progresso no uso de computador não elimina a necessidade de checkpoints, permissões, monitoramento e lógica de recuperação.

CursorBench e Humanity's Last Exam: ganhos menores

O Fable 5.1 alcança 73.4% no CursorBench 3.2.0, apenas 2.9 pontos acima do Fable 5. No Humanity's Last Exam, ganha 3.1 pontos sem ferramentas e 1.2 pontos com ferramentas.

Essas lacunas mais estreitas suportam a interpretação central: o Fable 5.1 é mais transformador em fluxos de trabalho longos que envolvem planejamento, execução, verificação e recuperação do que em tarefas IDE mais curtas ou em raciocínio acadêmico de resposta fechada.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Resposta curta: Fable 5.1 é a opção mais forte na tabela de benchmarks de longo horizonte publicada pela Anthropic; Opus 5 é o ponto de partida mais econômico quando sua menor diferença de desempenho é aceitável; Fable 5 permanece como baseline legado; GPT-6 Astra requer um teste no mesmo harness antes de qualquer classificação direta.

O Fable 5.1 é uma atualização geracional clara sobre o Fable 5 nos benchmarks de agentes de longo horizonte relatados pela Anthropic. O GPT-6 Astra é a comparação mais atual da OpenAI, mas foi lançado após a avaliação de 1º de setembro da Anthropic e não foi incluído no mesmo harness de benchmark.

DimensãoClaude Fable 5.1Claude Fable 5GPT-6 Astra
Janela de contexto1M tokens1M tokens1.05M tokens
Saída máxima128K128K128K
Entrada / saída padrão$10 / $50 por MTok$10 / $50 por MTok$10 / $50 por MTok
Leitura de cache$0.25 / MTok$1 / MTokVerifique os termos atuais do provedor
Terminal-Bench-Science 0.152.6%24.7%Não incluído na tabela de lançamento da Anthropic
Terminal-Bench 4.055.8%42.0%Não incluído na tabela de lançamento da Anthropic
AutomationBench31.4%17.1%Não incluído na tabela de lançamento da Anthropic
Posicionamento primárioRaciocínio exigente e agentes de longo horizonteBaseline anterior da classe FableTrabalho profissional de ponta a ponta difícil

Em comparação ao Fable 5, o Fable 5.1 mostra seus maiores ganhos medidos em pesquisa científica, automação de negócios e codificação em terminal, mantendo os mesmos preços padrão de tokens. O preço menor de leitura de cache melhora ainda mais a economia de agentes com contexto reutilizado.

Regra de seleção: Comece com o Opus 5 quando o custo for a prioridade, escale para o Fable 5.1 quando conclusão e recuperação de longo horizonte importarem mais, mantenha o Fable 5 apenas para cargas sensíveis à compatibilidade e avalie o GPT-6 Astra em um teste controlado no mesmo harness antes da adoção em produção.

Como é o desempenho por tipo de carga de trabalho?

CapacidadeResultado do Fable 5.1Variação vs Fable 5Interpretação
Pesquisa científica orientada a agentes52.6%+27.9 ptsGanho muito grande
Automação de fluxos de trabalho de negócios31.4%+14.3 ptsGanho muito grande
Codificação em terminal55.8%+13.8 ptsGrande ganho
Uso de computador, estrito41.7%+5.6 ptsGanho moderado
Uso de computador, parcial77.9%+5.0 ptsGanho moderado
Raciocínio especialista, sem ferramentas60.9%+3.1 ptsPequeno ganho
Codificação em IDE orientada a agentes73.4%+2.9 ptsPequeno ganho
Raciocínio especialista, com ferramentas65.0%+1.2 ptsPequeno ganho
Trabalho profissional de conhecimento1853 Elo+130 EloForte, sensível à configuração

O padrão é consistente: as maiores melhorias aparecem quando o sucesso depende de persistência, planejamento, interação com o ambiente, uso de ferramentas e recuperação ao longo do tempo.

O que os benchmarks não informam?

Tabelas de benchmark comprimem o comportamento em números únicos. Elas não provam que agentes autônomos estão resolvidos e não predizem todas as cargas de produção.

  • A principal tabela de comparação é executada pelo fornecedor.
  • Configurações de esforço afetam qualidade, latência e custo.
  • Benchmarks de agentes medem a combinação de modelo, harness, ferramentas e permissões.
  • Salvaguardas de produção estavam habilitadas no Fable 5.1 e afetaram alguns resultados.
  • As versões de benchmark mudam, então valores de diferentes releases de tarefas podem não ser comparáveis.
  • O AutomationBench permanece em 31.4%, enquanto a conclusão estrita do OSWorld permanece em 41.7%; taxas de falha substanciais permanecem.

Uma avaliação prática deve usar pontuações públicas para criar uma shortlist de candidatos, reproduzir uma pequena comparação com configurações idênticas e então testar o fluxo de trabalho real de produção.

O Claude Fable 5.1 é o melhor modelo Claude?

Para capacidade máxima em trabalho difícil e de longa duração, as evidências de benchmark fazem um caso forte para o Claude Fable 5.1. Para toda carga de trabalho, não.

A Anthropic o precifica em $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída, versus $5 e $25 para o Opus 5. O prêmio se justifica apenas quando o Fable 5.1 produz uma maior taxa de sucesso, menos tentativas, menos tokens por tarefa aceita ou redução suficiente no tempo de revisão humana.

O preço menor de leitura de cache pode estreitar a diferença de custo efetivo para agentes. O custo por resultado aceito é, portanto, mais útil do que apenas o preço por token.

Como você deve avaliar o Claude Fable 5.1?

Sua avaliação deve se assemelhar à carga de trabalho de produção pretendida.

  • Coding: Teste issues completas e registre aceitação de patches, testes aprovados, tentativas, chamadas de ferramentas, tempo decorrido e tempo de correção humana.
  • Research: Avalie qualidade das fontes, precisão factual, cobertura de evidências, conclusão de subtarefas e retenção do objetivo em execuções longas.
  • Business agents: Pontue o estado final do ambiente em vez de contar ações individualmente corretas.
  • Computer use: Meça a recuperação de pop-ups, páginas lentas, sessões interrompidas e estado de aplicação inconsistente.
  • Model comparison: Mantenha prompts, harnesses, ferramentas, permissões, configurações de esforço e regras de pontuação constantes.
  • Economics: Meça o custo por tarefa aceita, não apenas o custo por token.

Conclusão

As evidências de benchmark sugerem que o Fable 5.1 é mais valioso quando uma tarefa exige execução sustentada em vez de uma única resposta. Os casos de uso mais fortes incluem pesquisa científica, codificação autônoma, automação de negócios complexa e fluxos de trabalho com verificação e recuperação repetidas.

As evidências não suportam superioridade universal. Lacunas menores em vários benchmarks, taxas significativas de falha em tarefas estritas de uso de computador e a ausência do GPT-6 Astra na tabela de lançamento da Anthropic reforçam a necessidade de testes específicos por carga de trabalho.

Para usuários do CometAPI, uma regra prática de implantação é testar o Fable 5.1 onde o sucesso de longo horizonte possa justificar inferência premium, depois compará-lo com o Opus 5, GPT-5.6 Sol e GPT-6 Astra nas mesmas tarefas representativas antes de escolher uma rota de produção.

Perguntas frequentes

Qual é a maior pontuação de benchmark do Claude Fable 5.1?

Entre as métricas percentuais relatadas pela Anthropic, o Fable 5.1 chega a 77.9% de crédito parcial no OSWorld 2.0 e 73.4% no CursorBench 3.2.0. Sua maior melhoria geracional é no Terminal-Bench-Science, com 52.6% versus 24.7% do Fable 5.

O quanto o Claude Fable 5.1 é melhor que o Fable 5?

O ganho varia fortemente por carga: 27.9 pontos no Terminal-Bench-Science, 14.3 no AutomationBench e 13.8 no Terminal-Bench 4.0, mas apenas 2.9 no CursorBench e 1.2 no Humanity’s Last Exam com ferramentas.

O Claude Fable 5.1 é melhor que o Claude Opus 5?

Ele marca mais alto em toda a tabela relatada pela Anthropic, mas muitas lacunas são pequenas. A Anthropic recomenda começar com o Opus 5 e escalar quando capacidade adicional de longo horizonte for necessária.

O Claude Fable 5.1 supera o GPT-5.6 Sol?

A Anthropic relata pontuações mais altas do Fable 5.1 em cinco métricas compartilhadas. Como são avaliações concorrentes conduzidas pelo fornecedor e as configurações variam, a conclusão segura é que o Fable 5.1 é altamente competitivo em vez de universalmente superior.

Os resultados são verificados de forma independente?

Apenas parcialmente. Vários benchmarks têm leaderboards públicos, mas esforço, harness, comportamento de fallback e versões de tarefas devem estar alinhados antes que seus valores possam ser comparados diretamente com a execução de lançamento da Anthropic.

Para que o Claude Fable 5.1 é melhor?

Seu perfil de benchmark é mais forte para pesquisa científica de longa duração, codificação autônoma, fluxos de trabalho complexos de agentes, automação de negócios e tarefas que exigem planejamento, ferramentas, verificação e recuperação.

Como posso acessar o Claude Fable 5.1?

Claude Fable 5.1 está listado no CometAPI com o ID de modelo claude-fable-5-1. Um endpoint unificado torna prático executar a mesma carga de avaliação em vários modelos antes de escolher uma rota de produção.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Sep 17, 2026
Última atualização Sep 17, 2026
0 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais