TLDR Claude Fable 5.1은 주로 에이전트형 실행(agentic-execution)에 대한 업그레이드입니다. 가장 큰 향상은 과학 연구, 비즈니스 자동화, 터미널 코딩 등 여러 단계에 걸친 계획, 도구 사용, 검증, 복구가 필요한 워크플로에서 나타납니다. 반면 폐쇄형 추론과 짧은 IDE 스타일 코딩 과제에서는 개선 폭이 작으므로, 단일 헤드라인 점수보다는 워크로드에 따라 배포 결정을 내리는 것이 바람직합니다.
핵심 요점
- Anthropic의 평가에서 Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%를 기록하여 Fable 5의 24.7%를 두 배 이상 상회합니다.
- AutomationBench는 17.1%에서 31.4%로 상승하여 엔드 투 엔드 비즈니스 워크플로에서 큰 개선을 보입니다.
- CursorBench와 도구 보조 Humanity's Last Exam에서는 개선 폭이 더 작아, 이번 릴리스가 모든 형태의 추론을 동일하게 향상시키기보다는 지속적 실행 능력을 더 강화했음을 시사합니다.
- Fable 5.1의 표준 토큰 가격은 Fable 5와 동일하지만, 더 낮은 캐시 읽기 가격으로 컨텍스트가 무거운 에이전트 워크플로의 실효 비용을 줄일 수 있습니다.
- GPT-6 Astra가 OpenAI의 최신 비교 대상이지만, Anthropic의 9월 1일 벤치마크 표에는 포함되지 않았습니다. 직접적인 성능 비교 주장은 동일한 하네스에서의 통제된 평가가 필요합니다.
Anthropic은 2026년 9월 1일에 Claude Fable 5.1을 출시했으며, 까다로운 추론, 장기 호라이즌 에이전트, 소프트웨어 엔지니어링, 리서치, 전문 지식 업무를 겨냥합니다. Claude Fable 5.1은 또한 CometAPI를 통해 제공되어, 개발자가 단일 엔드포인트로 다른 프런티어 모델들과 함께 평가할 수 있습니다.
헤드라인 결과는 강력하지만, 평균치보다 개선의 분포가 더 유의미합니다. Fable 5.1은 에이전트가 목표를 유지하고 도구와 상호작용하며 오류에서 복구하고 최종 상태를 검증해야 할 때 가장 큰 성과를 냅니다. 본 글은 이러한 벤치마크 결과의 의미, 모델의 한계, 최신 대안 대비 평가 방법에 초점을 맞춥니다.
Claude Fable 5.1 한눈에 보기
Anthropic의 모델 문서는 100만 토큰 컨텍스트 윈도, 128K 최대 출력, 텍스트 및 이미지 입력, 항상 켜진 적응형 사고, 2026년 6월 지식 컷오프를 명시합니다. Claude API 모델 ID는 claude-fable-5-1입니다.
| 공식 사양 | Claude Fable 5.1 |
|---|---|
| Provider | Anthropic |
| Release date | September 1, 2026 |
| Model ID | claude-fable-5-1 |
| Context window | 1,000,000 tokens |
| Maximum output | 128,000 tokens |
| Input / output | Text and images → text |
| Thinking | Adaptive, always on |
| Default effort | High |
| Knowledge cutoff | June 2026 |
| Anthropic input price | $10 / MTok |
| Anthropic output price | $50 / MTok |
| Cache read | $0.25 / MTok |
| Comparative latency | Slower |
| Primary positioning | Demanding reasoning and long-horizon agentic work |
표준 입력/출력 단가는 Fable 5와 동일하며, 캐시 읽기는 백만 토큰당 $0.25로 하락했습니다. Fable 5.1은 헤드라인 입출력 토큰 가격이 더 낮아진 것은 아닙니다. 실효 비용 하락은 주로 캐시 읽기 가격의 75% 인하에서 비롯됩니다. Anthropic은 일반적 워크로드에서 약 25%, 고도 에이전트 워크로드에서 최대 약 45%의 비용 절감을 추정합니다.
이는 장시간 실행되는 에이전트가 저장소 컨텍스트, 지시문, 도구 정의, 이전 상태를 반복적으로 재사용하기 때문입니다. 헤드라인 입출력 가격이 변하지 않더라도, 완료된 작업당 비용은 개선될 수 있습니다.
Anthropic은 또한 Claude Mythos 5.1이 Terminal-Bench 4.0에서 60.9%를 기록했다고 보고합니다. Mythos 5.1은 별도 배포 버전으로, 상이한 세이프가드를 갖고 있으므로, 일반 제공 Fable 5.1 점수로 간주해서는 안 됩니다.
Claude Fable 5.1 벤치마크는 무엇을 보여줍니까?
다음 수치는 Anthropic의 2026년 9월 평가에서 가져왔습니다. 이는 모델과 하네스의 구성 결과를 나타내며, 모델의 불변 속성을 의미하지는 않습니다.
| Benchmark | 무엇을 측정하는가 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 에이전트형 과학 연구 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 에이전트형 터미널 코딩 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 전문 지식 작업, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | 장기 호라이즌 컴퓨터 사용 | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | 완전 완료된 컴퓨터 작업 | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | 전문 수준의 다학제 추론 | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | 도구 사용을 포함한 전문 추론 | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | 엔드 투 엔드 비즈니스 워크플로 | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 에이전트형 IDE 코딩 | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1은 아홉 개의 모든 보고 항목에서 Fable 5와 Opus 5를 앞섭니다. 가장 큰 세대 간 개선은 과학 연구, 비즈니스 워크플로 자동화, 터미널 코딩에서 나타납니다. Humanity's Last Exam과 CursorBench에서의 더 작은 차이도 중요한데, 이는 개선이 모든 워크로드에 균등하지 않음을 보여줍니다.
Claude Fable 5.1은 어디서 가장 향상되었나?
Terminal-Bench-Science 0.1: 두드러진 결과
Fable 5.1은 Anthropic의 실행에서 Claude Fable 5의 24.7%, Claude Opus 5의 29.0%, GPT-5.6 Sol의 22.4% 대비 52.6%를 기록합니다. 27.9포인트에 달하는 세대 간 격차는 보고된 모델별 표준 오차보다 훨씬 큽니다. 반면 Terminal-Bench 4.0에서 Fable 5.1과 Opus 5 사이의 3.5포인트 격차와 같은 작은 차이는 더 신중히 해석해야 합니다.
Terminal-Bench-Science는 과학 및 공학 도메인 전반에 걸친 완전한 연구 워크플로를 평가합니다. 에이전트는 고립된 질문에 답하는 것을 넘어서 코드, 분석, 증명, 시뮬레이션, 데이터 결과물을 산출해야 합니다. Anthropic은 모델별 표준 오차가 대략 ±3.5–4.5포인트라고 보고하므로, 작은 격차를 곧바로 의미 있는 역량 차이로 해석해서는 안 됩니다.
Terminal-Bench 4.0: 더 강한 자율 코딩
Fable 5.1은 55.8%에 도달했으며, Fable 5의 42.0%, Opus 5의 52.3%, GPT-5.6 Sol의 37.3%를 앞섭니다. Fable 5 대비 13.8포인트의 향상은 상당하지만, Opus 5 대비 3.5포인트의 우위는 상대적으로 좁습니다.
이 벤치마크는 실행 환경에서 에이전트를 평가하므로, 성공은 환경을 탐색하고 코드를 변경하며 결과를 검증하는 능력에 달려 있습니다. 또한 Terminal-Bench 4.0은 이전 릴리스와 다른 태스크 세트를 사용하므로, 동일한 버전 내에서만 점수를 비교해야 합니다.
AutomationBench: 큰 폭의 개선과 여지
AutomationBench는 Fable 5의 17.1%에서 Fable 5.1의 31.4%로 상승했습니다. 이는 절대 14.3포인트, 상대 약 84%의 개선입니다.
이 벤치마크는 최종 환경 상태를 검증함으로써 영업, 마케팅, 운영, 지원, 재무, HR에 걸친 워크플로를 평가합니다. 이는 에이전트가 단지 올바른 행동을 제시했는지가 아니라 실제로 워크플로를 완료했는지의 여부를 시험한다는 점에서 유용합니다. 동시에 한계도 드러납니다. Anthropic이 보고한 구성하에서 약 3분의 2의 태스크는 여전히 완료되지 못했습니다.
CursorBench 3.2.0: 더 작은 코딩 개선
Fable 5.1은 73.4%에 도달했으며, Fable 5의 70.5%, Opus 5의 70.0%, GPT-5.6 Sol의 67.2%와 비교됩니다. Fable 5 대비 증가는 2.9포인트에 불과합니다.
따라서 이번 릴리스는 계획, 실행, 검증, 복구를 수반하는 장기 워크플로에 비해, 짧은 IDE 스타일 코딩 과제에서는 변혁적이진 않아 보입니다. 평가 스위트에는 코드 생성 품질만이 아니라 저장소 규모 변경과 실패 테스트 복구가 포함되어야 합니다.
OSWorld 2.0: 컴퓨터 사용은 여전히 어렵다
Fable 5.1은 부분 점수 기준 77.9%, 엄격 완료(strict) 기준 41.7%를 기록합니다. Opus 5는 각각 75.4%와 39.6%, Fable 5는 72.9%와 36.1%입니다.
실제 운영 신호로는 엄격 완료 점수가 더 의미 있습니다. 절반 미만의 태스크만 완전히 완료되었으며, 이는 컴퓨터 사용에서의 진전이 체크포인트, 권한, 모니터링, 복구 로직의 필요성을 없애지 못했음을 보여줍니다.
CursorBench와 Humanity's Last Exam: 더 작은 개선
Fable 5.1은 CursorBench 3.2.0에서 73.4%로 Fable 5 대비 2.9포인트 상승했습니다. Humanity's Last Exam에서는 도구 없이 3.1포인트, 도구와 함께 1.2포인트 상승했습니다.
이러한 좁은 격차는 핵심 해석을 뒷받침합니다. Fable 5.1은 짧은 IDE 태스크나 폐쇄형 학술 추론보다, 계획·실행·검증·복구가 요구되는 장기 워크플로에서 더 변혁적입니다.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
간단 요약: Fable 5.1은 Anthropic이 공개한 장기 호라이즌 벤치마크 표에서 가장 강력한 옵션입니다. 성능 격차가 수용 가능하다면 Opus 5가 더 경제적인 시작점이고, Fable 5는 레거시 기준선으로 남습니다. GPT-6 Astra는 동일 하네스에서의 비교 테스트가 있어야 직접 순위를 매길 수 있습니다.
Fable 5.1은 Anthropic이 보고한 장기 호라이즌 에이전트 벤치마크에서 Fable 5 대비 명확한 세대 업그레이드를 보여줍니다. GPT-6 Astra는 더 최신의 OpenAI 비교 대상이지만, Anthropic의 9월 1일 평가에는 포함되지 않아 동일한 벤치마크 하네스가 필요합니다.
| 항목 | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Context window | 1M tokens | 1M tokens | 1.05M tokens |
| Maximum output | 128K | 128K | 128K |
| Standard input / output | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Cache read | $0.25 / MTok | $1 / MTok | 현재 제공자 약관 확인 |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Anthropic의 출시 표에 미포함 |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Anthropic의 출시 표에 미포함 |
| AutomationBench | 31.4% | 17.1% | Anthropic의 출시 표에 미포함 |
| Primary positioning | 난도 높은 추론과 장기 호라이즌 에이전트 | 이전 Fable 클래스 기준선 | 어려운 엔드 투 엔드 전문 업무 |
Fable 5 대비 Fable 5.1은 과학 연구, 비즈니스 자동화, 터미널 코딩에서 가장 큰 측정된 향상을 보이며 표준 토큰 가격은 동일하게 유지합니다. 더 낮은 캐시 읽기 가격은 반복 컨텍스트 에이전트의 경제성을 추가로 개선합니다.
선택 규칙: 비용이 우선이라면 Opus 5로 시작하고, 장기 호라이즌의 완료율과 복구가 가장 중요할 때 Fable 5.1로 승급하십시오. Fable 5는 호환성 민감 워크로드에만 유지하고, GPT-6 Astra는 운영 도입 전 동일 하네스에서 통제된 비교 평가를 수행하십시오.
워크로드별 벤치마크 성능은 어떠한가?
| Capability | Fable 5.1 result | Change vs Fable 5 | Interpretation |
|---|---|---|---|
| Agentic scientific research | 52.6% | +27.9 pts | 매우 큰 개선 |
| Business workflow automation | 31.4% | +14.3 pts | 매우 큰 개선 |
| Terminal coding | 55.8% | +13.8 pts | 큰 개선 |
| Computer use, strict | 41.7% | +5.6 pts | 중간 수준의 개선 |
| Computer use, partial | 77.9% | +5.0 pts | 중간 수준의 개선 |
| Expert reasoning, no tools | 60.9% | +3.1 pts | 작은 개선 |
| IDE agentic coding | 73.4% | +2.9 pts | 작은 개선 |
| Expert reasoning, tools | 65.0% | +1.2 pts | 작은 개선 |
| Professional knowledge work | 1853 Elo | +130 Elo | 강함, 설정 민감 |
패턴은 일관됩니다. 성공이 지속성, 계획, 환경 상호작용, 도구 사용, 시간에 따른 복구에 좌우될수록 개선 폭이 크게 나타납니다.
벤치마크가 말해주지 않는 것
벤치마크 표는 행동을 하나의 숫자로 압축합니다. 이는 자율 에이전트가 해결되었음을 증명하지 않으며, 모든 운영 워크로드를 예측하지도 못합니다.
- 주요 비교 표는 벤더가 실행했습니다.
- Effort 설정은 품질, 지연시간, 비용에 영향을 줍니다.
- 에이전트 벤치마크는 모델, 하네스, 도구, 권한의 결합을 측정합니다.
- Fable 5.1에는 운영 세이프가드가 활성화되어 일부 결과에 영향을 미쳤습니다.
- 벤치마크 버전은 변하므로, 다른 태스크 릴리스의 값은 상호 비교 불가할 수 있습니다.
- AutomationBench는 31.4%, OSWorld 엄격 완료는 41.7%에 머물러, 의미 있는 실패율이 여전히 존재합니다.
실용적 평가는 공개 점수를 후보 압축에 사용하고, 동일 설정으로 소규모 비교를 재현한 뒤, 실제 운영 워크플로를 테스트해야 합니다.
Claude Fable 5.1이 최고의 Claude 모델인가?
어려운 장기 작업에서 최대 역량을 원한다면, 벤치마크 근거는 Claude Fable 5.1에 강한 손을 들어줍니다. 그러나 모든 워크로드에 대해 그런 것은 아닙니다.
Anthropic은 Opus 5 대비 입력 백만 토큰당 $10, 출력 백만 토큰당 $50로 가격을 책정하며, Opus 5는 각각 $5와 $25입니다. 프리미엄은 Fable 5.1이 더 높은 성공률, 더 적은 재시도, 승인당 토큰 수 감소, 또는 충분한 휴먼 리뷰 시간 감축을 제공할 때에만 정당화됩니다.
더 낮은 캐시 읽기 가격은 에이전트에서의 실효 비용 격차를 좁힐 수 있습니다. 따라서 승인된 결과당 비용은 토큰당 가격만큼이나(혹은 그 이상으로) 유용한 지표입니다.
Claude Fable 5.1은 어떻게 벤치마크해야 하나요?
평가는 의도된 운영 워크로드를 닮아야 합니다.
- 코딩: 완결 이슈를 테스트하고 패치 승인율, 통과 테스트 수, 재시도, 도구 호출, 경과 시간, 휴먼 수정 시간을 기록하십시오.
- 리서치: 소스 품질, 사실 정확성, 증거 범위, 서브태스크 완료, 장시간 목표 유지 여부를 평가하십시오.
- 비즈니스 에이전트: 개별 행동의 정답 수가 아니라 최종 환경 상태를 점수화하십시오.
- 컴퓨터 사용: 팝업, 느린 페이지, 중단된 세션, 불안정한 앱 상태에서의 복구를 측정하십시오.
- 모델 비교: 프롬프트, 하네스, 도구, 권한, Effort 설정, 채점 규칙을 동일하게 유지하십시오.
- 경제성: 토큰 비용만이 아니라 승인된 작업당 비용을 측정하십시오.
결론
벤치마크 증거는 Fable 5.1이 단일 응답보다 지속적 실행이 필요한 과제에서 가장 가치가 높음을 시사합니다. 가장 강한 사용처는 과학 연구, 자율 코딩, 복잡한 비즈니스 자동화, 반복 검증과 복구를 수반하는 워크플로입니다.
보편적 우월성을 뒷받침하는 증거는 아닙니다. 여러 벤치마크에서의 작은 격차, 엄격한 컴퓨터 사용 태스크에서의 의미 있는 실패율, Anthropic 출시 표에 GPT-6 Astra가 부재한 사실은 워크로드 특화 테스트의 필요성을 강화합니다.
CometAPI 사용자에게 실용적 배포 규칙은, 장기 호라이즌 성공이 프리미엄 추론 비용을 정당화할 수 있는 곳에서 Fable 5.1을 테스트하고, 동일한 대표 태스크에서 Opus 5, GPT-5.6 Sol, GPT-6 Astra와 비교한 뒤 프로덕션 경로를 선택하는 것입니다.
자주 묻는 질문
Claude Fable 5.1의 최고 벤치마크 점수는 무엇인가요?
Anthropic이 보고한 퍼센트 지표 중에서는 OSWorld 2.0에서 부분 점수 77.9%, CursorBench 3.2.0에서 73.4%에 도달합니다. 세대별 최대 향상은 Terminal-Bench-Science로, Fable 5의 24.7% 대비 52.6%입니다.
Claude Fable 5.1은 Fable 5보다 얼마나 더 낫나요?
워크로드별로 크게 다릅니다. Terminal-Bench-Science에서 27.9포인트, AutomationBench에서 14.3포인트, Terminal-Bench 4.0에서 13.8포인트 증가한 반면, CursorBench에서는 2.9포인트, 도구 보조 Humanity’s Last Exam에서는 1.2포인트 증가했습니다.
Claude Fable 5.1이 Claude Opus 5보다 낫나요?
보고된 표 전반에서 더 높은 점수를 기록하지만, 많은 격차는 작습니다. Anthropic은 장기 호라이즌 역량이 추가로 필요할 때 승급하고, 초기에는 Opus 5로 시작할 것을 권장합니다.
Claude Fable 5.1이 GPT-5.6 Sol을 이기나요?
공유된 다섯 개 지표에서 Anthropic은 더 높은 Fable 5.1 점수를 보고합니다. 다만 벤더가 실행한 경쟁 평가이고 구성도 달라질 수 있으므로, 안전한 결론은 Fable 5.1이 매우 경쟁력 있다는 것이지 보편적 우월성은 아니라는 것입니다.
결과가 독립적으로 검증되었나요?
부분적으로 그렇습니다. 여러 벤치마크에 공개 리더보드가 있지만, Effort, 하네스, 폴백 동작, 태스크 버전을 일치시켜야 Anthropic의 출시 실행과 직접 비교할 수 있습니다.
Claude Fable 5.1은 무엇에 가장 적합한가요?
장기 과학 연구, 자율 코딩, 복잡한 에이전트 워크플로, 비즈니스 자동화, 계획·도구·검증·복구가 필요한 태스크에서 벤치마크 프로파일이 가장 강합니다.
Claude Fable 5.1은 어떻게 액세스하나요?
Claude Fable 5.1은 CometAPI에 등재되어 있으며 모델 ID는 claude-fable-5-1입니다. 통합 엔드포인트를 통해 동일한 평가 워크로드를 여러 모델에 걸쳐 실행한 뒤 프로덕션 경로를 선택하기 용이합니다.
