GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/CometAPI 리서치

Gemini 4가 GPT-6와 Claude Fable 5.1을 이미 앞섰나? 유출된 벤치마크 해설

Gemini 4는 OpenAI의 GPT-6 Astra와 Anthropic의 Claude Fable 5.1을 핵심 에이전트 및 코딩 벤치마크에서 능가할 것이며, 일부는 이러한 성능 향상을 RSI와 연관 짓고 있다.

CometAPI
AnnaAI 모델 및 API 리서치 팀
업데이트됨 Sep 20, 2026 10 분 읽기
Gemini 4가 GPT-6와 Claude Fable 5.1을 이미 앞섰나? 유출된 벤치마크 해설
이 패턴 사용

첫 API 호출하기.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR 2026년 9월 중순 유출된 벤치마크와 Arena.ai의 스텔스 테스트에 따르면, 출시되지 않은 Google의 Gemini 4 Pro가 소프트웨어 엔지니어링, 에이전트형 작업, 지식 작업, 추론, 다중모달 벤치마크 전반에서 GPT-6 Astra와 Claude Fable 5.1을 제치고 새로운 프런티어 리더로 자리매김했습니다.

핵심 요약

  • Gemini 4 Pro는 유출 평가에서 DeepSWE v1.1(88.7%), GDPval-AA v2(2064 Elo), Terminal-bench 2.1(95.3%), OSWorld-2.0(86.8%) 및 다수의 에이전트형/추론 스위트에서 선두를 달립니다.
  • 정가 기준으로 GPT-6 Astra($12/$60)와 Claude Fable 5.1($10/$50)보다 저렴하며, 1M급 컨텍스트 윈도우를 맞추거나 능가합니다.
  • Arena.ai에서 플레이스홀더 이름(예: gemini-3.8-flash)으로 진행된 스텔스 테스트에서 뛰어난 SVG, Three.js, 에이전트형 코딩 데모가 나왔습니다.
  • RSI(재귀적 자기 개선) 루머가 돌고 있지만, Gemini 4 자체에 대한 폐쇄 루프 자율적 모델 개선의 공개 증거는 없습니다.
  • Google는 더 큰 Gemini 4 기본 모델에 대한 대규모 투자를 확인했으며, 공개 출시 시점은 아직 비공식적입니다.
  • CometAPI와 같은 플랫폼은 이미 Gemini, GPT-6 Astra, Claude Fable/Opus, 그리고 수백 개의 다른 모델을 하나의 OpenAI 호환 엔드포인트 뒤에서 집계해 경쟁력 있는 요금을 제공합니다—출시 후 새로운 프런티어를 벤치마킹하기에 이상적입니다.

Gemini 4에 대해 무엇을 알고 있나? (유출, 소스, 검증된 맥락)

2026년 9월 20일 기준, Gemini 4 Pro는 Google의 공식 발표, 모델 카드, 공개 API 엔드포인트를 아직 받지 않았습니다. 7월 2026년 실적 발표에서 “더 큰 Gemini 4 기본 모델”에 투자하고 있다는 Google의 이전 발언을 넘어서는 모든 정보는 커뮤니티 유출, Arena.ai 블라인드 테스트, 유통되는 벤치마크 표에서 나온 것입니다.

주요 출처와 주장은 다음과 같습니다:

  • 유출자 Pankaj Kumar와 후속 게시물(9월 초~중순 즈음)은 공개 출시가 10월로 예상되며 이전에 Flash-Lite 변형이 나올 수 있다는 내부 Pro 체크포인트를 언급했습니다.
  • 여러 개발자가 Arena.ai에서 “gemini-3.8-flash”(또는 유사한 플레이스홀더)로 표시된 고성능 모델을 호출했다고 보고했습니다. 출력에는 복잡한 SVG 생성(예: 자전거를 탄 펠리컨, Three.js의 기계식 나비), 길고 반복 없는 JSON 생성, 강한 에이전트형 동작이 포함되었습니다. 일부 사용자는 수백만 토큰 컨텍스트, 256k 출력 상한, 세션 간 메모리, 네이티브 도구/인터넷 기능과 같은 백엔드 세부사항을 주장했습니다.
  • 광범위하게 공유된 비교 표에는 Gemini 4 Pro와 Gemini 4 Flash, Gemini 4 Flash-Lite, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol이 함께 나열됩니다.
  • Google는 Arena 테스트나 해당 표를 확인하지 않았습니다. 과거 패턴을 보면, 정식 출시 몇 주 전에 공공 플랫폼에서 스텔스 평가를 종종 진행하곤 합니다.

Gemini 4가 GPT-6와 Claude Fable 5.1을 이미 앞섰나? 유출된 벤치마크 해설

컨텍스트 윈도우

유출된 표에는 Gemini 4 패밀리의 최대 입력 토큰이 2M으로 나옵니다—GPT-6 Astra의 1M의 두 배이며 Claude Fable/Opus 5 라인의 200k보다 훨씬 큽니다(일부 Claude 변형은 다른 메커니즘을 통해 더 큰 유효 윈도우를 제공해 온 바 있습니다). 별도의 고스트 라우팅 주장은 10M 상한선을 떠돌았지만, 이는 미검증 상태입니다.

Gemini 4의 가격(유출 수치)

유통 중인 표에는 다음이 나옵니다:

  • Gemini 4 Pro: 입력 $2.25 / 출력 $11.25(1M 토큰 기준, 캐싱 없음).
  • Gemini 4 Flash: $0.75 / $3.75.
  • Gemini 4 Flash-Lite: $0.35 / $1.75.

이 수치는 GPT-6 Astra의 보고된 $12/$60와 Claude Fable 5.1의 $10/$50 정가보다 상당히 낮습니다(Fable 5.1은 캐시 읽기 할인으로 에이전트형 워크로드의 실효 비용을 낮출 수 있습니다). 현재 공식 Gemini 3.x Pro 가격은 컨텍스트 길이에 따라 입력 $2–$4 / 출력 $12–$18 범위이므로, 유출된 Pro 수치가 차세대 조정으로서 그럴듯합니다.

실제 공개 가격은 출시 시점에만 알 수 있습니다. Google는 채택을 촉진하기 위해 경쟁적인 토큰 요율과 무료 티어를 역사적으로 활용해 왔습니다.

Gemini 4 Pro 성능: 유출 벤치마크 심층 분석

유통 표는 거의 모든 카테고리에서 Gemini 4 Pro를 최상위에 배치합니다. 이 수치는 작성 시점에 Google이나 독립 제3기관에 의해 공식적으로 검증되지 않은 비공식 수치입니다. 최종 순위가 아닌 방향성 신호로 취급해야 합니다.

소프트웨어 엔지니어링 및 에이전트형 코딩

  • DeepSWE v1.1(장기 지향 소프트웨어 엔지니어링): 88.7%(vs. GPT-6 Astra 86.9%, Claude Fable 5.1 69.1%, Claude Opus 5 75.0%).
  • Terminal-bench 2.1(에이전트형 터미널 코딩): 95.3%(vs. Astra 94.1%, Fable 92.8%).
  • Terminal-bench 4.0(일반 에이전트 역량): 69.7%(Flash 및 경쟁 모델 대비 상대 격차 최대).

지식 작업 및 전문 과업

  • GDPval-AA v2(Elo, 지식 작업): 2064(유일하게 2000 상회; Astra 1994, Fable 1853).
  • Vals Finance Agent v2: 74.2%.
  • Harvey’s Legal Agent Benchmark(복잡한 법률 워크플로우, 전부 통과 비율): 18.7%.

추론, 다중모달 및 특화

  • CharXiv Reasoning(복잡한 차트에서 정보 합성, 도구 없음): 94.7%.
  • LVBench(장편 비디오 이해): 에이전트형 95.8% / 정적 95.0%.
  • HLE-Verified(다학제 전문가 추론): 72.1%.
  • OSWorld-2.0(에이전트형 컴퓨터 사용, 부분 점수, 배치 도구 활성): 86.8%.
  • BioMysteryBench & LABBench2(생물정보학 및 생물학 연구 워크플로우): 인간 해결 가능/난도 높은 하위집합 모두에서 선두 점수.

이 결과가 방향성 측면에서 정확하다면, 장기 지평의 다단계 도구 사용 에이전트형 워크로드에서 특히 강점을 보입니다—이는 9월 초 출시 이후 GPT-6 Astra와 Claude Fable 5.1이 리더로 포지셔닝된 정확한 영역입니다.

Arena의 정성 테스트도 이러한 그림을 강화합니다: 스텔스 모델의 복잡한 SVG와 Three.js 생성은 커뮤니티 사이드바이사이드 비교에서 Astra 대비 우수하거나 매우 경쟁적으로 평가되었습니다.

Gemini 4는 어떻게 작동할까?

Gemini 4(Pro)는 아직 출시되지 않았습니다, 따라서 “어떻게 작동할지”에 대한 설명은 Google의 공식 발언, 초기 내부 체크포인트에 대한 제한된 유출 정보, Gemini 3.x 시리즈의 궤적, 합리적 엔지니어링 추정을 기반으로 합니다. 아래 사양은 확인된 것이 아닙니다.

핵심 학습과 스케일 접근

Google는 Gemini 4를 “가장 야심적인 사전 학습(run)”으로 묘사했으며, 이전 세대보다 상당히 더 큰 기본 모델에 구축했다고 말했습니다. 명시적인 목표는 특히 코딩과 자율 에이전트 영역에서 프런티어 경쟁력을 유지하는 것입니다.

이는 다음을 의미합니다:

  • 더 큰 파라미터 수나 더 효과적인 용량(전문가 혼합(MoE), 더 나은 희소성, 더 밀집한 스케일링 등).
  • 사전 학습 동안 더 무거운 컴퓨트 투자.
  • 텍스트, 이미지, 비디오, 오디오, 코드, 도구 사용 트래젝토리 등 다중모달 학습 데이터에 대한 지속적 강조.

이 모델은 이후 더 빠른 Flash 스타일 변형이 파생될 수 있는 새로운 고능력 기준선으로 기대됩니다.

추론 및 사고 스타일

초기 “argon” 체크포인트에 대한 유출 설명은 단일 생성에 약 2.4분이 소요되고 이전의 약 64k 대비 256k로 보고된 극적으로 높은 출력 한도를 지원하는 “High thinking-effort” 모드를 언급합니다.

이는 다음을 시사합니다:

  • 경쟁 모델의 확장 사고 또는 “최대 노력” 모드와 유사한 선택적 고비용 추론 경로.
  • 답변을 생성하기 전에 어려운 문제에 더 많은 내부 계산을 투입할 수 있는 능력.
  • 완전한 코드베이스, 다단계 계획, 장문의 보고서 등 길고 일관된 출력을 더 잘 지원.

현재 Gemini Flash 모델에서 제공되는 낮음/중간/높음 사고 수준처럼, 사용자들은 속도/비용과 추론 깊이 간의 트레이드오프를 제어할 수 있을 가능성이 큽니다.

핵심 역량 중점 영역

  1. 코딩과 소프트웨어 엔지니어링 장기 지향 성능 강화: 다파일 리팩터링, 저장소 전반 디버깅, 자기 수정 루프, 현실적 소프트웨어 과업에서 더 높은 완수율.
  2. 자율/에이전트형 행동 도구 사용, 중간 결과 관찰, 오류 회복, 많은 단계에 걸친 목표 지속에 대한 계획 능력 향상. 이는 이미 Gemini 3.5/3.8 Flash에 존재하는 컴퓨터 사용 및 에이전트 기능을 직접 확장합니다.
  3. 장컨텍스트 신뢰성 커뮤니티 보고는 150만 토큰대(또는 그 이상)를 목표로 언급합니다. 실질 목표는 단지 더 큰 윈도우가 아니라 매우 긴 문서, 코드베이스, 수시간 에이전트 트레이스에서 더 나은 검색 충실도와 성능 저하 감소입니다.
  4. 다중모달 이해 및 생성 텍스트+이미지+비디오+오디오를 네이티브로 처리하며, 공간 추론, 비디오 이해, 실시간 음성/에이전트 상호작용에서의 향상이 예상됩니다(2026년 9월의 Gemini 3.8 Live 모델을 기반).
  5. 도구 사용 및 구조화된 출력 함수 호출, 코드 실행, 검색 근거 제공, 신뢰할 수 있는 JSON/XML 스타일의 구조적 출력 강화로 애플리케이션과 에이전트 통합을 더 안정적으로 지원.

Gemini 3.x와의 차이점

  • 스케일: 점진적 개선이 아닌 명시적으로 더 큰 기본 모델.
  • 출력 용량: 유출된 더 높은 토큰 한도로 단일 패스에서 더 긴 생성이 가능.
  • 추론 깊이: 어려운 문제에 대한 고노력 모드의 강조.
  • 에이전트형 초점: 단일 턴이나 단기 과업이 아니라 지속적, 다단계 자율 작업에 더 큰 비중.
  • 포지셔닝: 새로운 프런티어 Pro-티어 모델로 의도되며, Flash 라인은 속도와 비용 효율을 위해 빠르게 반복.

재귀적 자기 개선(RSI)와의 관계

Google 임원들은 대규모 AI 자본 지출을 장기 목표인 재귀적 자기 개선—스스로 또는 다음 세대를 만드는 프로세스를 의미 있게 개선할 수 있는 시스템—과 공개적으로 연결지어 왔습니다. 관련 연구(Dream-RSI 등)는 모델 가중치를 바꾸지 않고도 에이전트가 자체 탐색 전략을 개선하는 모습을 보여줍니다.

Gemini 4 Pro는 GPT-6과 Claude Fable 5.1을 능가할까?

카테고리Gemini 4 ProGPT-6 AstraClaude Fable 5.1비고
입력/출력 가격$2.25 / $11.25$12.00 / $60.00$10.00 / $50.00Gemini 4 Pro는 Astra 대비 약 5배 저렴
컨텍스트 윈도우2M1M200kGemini의 큰 이점
DeepSWE v1.188.7%86.9%69.1%강력한 코딩 우위
GDPval-AA v2 (Elo)206419941853지식 작업 선도
Terminal-bench 4.069.7%66.4%57.9%일반 에이전트 역량
OSWorld-2.086.8%84.5%77.9%컴퓨터 사용
HLE-Verified72.1%67.3%62.1%전문가 추론
LVBench (video)95.8% / 95.0%93.8%90.4%다중모달 강점
생물/실험실 연구최고 점수강함경쟁력 있음과학 워크플로우

Gemini 4 Pro는 표의 모든 주요 행에서 1위를 차지하며, 종종 의미 있는 격차를 보입니다. 또한 주장된 가격은 GPT-6 Astra나 Claude Fable 5.1보다 훨씬 공격적입니다.

중요한 유의 사항

  • 이 표는 Google의 공식 발표가 아닙니다. 2026년 9월 20일 기준, Google는 Gemini 4 Pro에 대한 모델 카드, API 엔드포인트, 가격, 벤치마크를 아직 공개하지 않았습니다. 수치는 커뮤니티 소스/ Arena 목격/ 내부 체크포인트 유출(“argon” 관련 코드명)에서 유래했습니다.
  • 이전에 유통된 일부 시트는 예측치 또는 부분적으로 복사된 것으로 표시되기도 했습니다. 각 퍼센트와 가격을 Google 확인 전까지는 미검증으로 취급하세요.
  • Claude Fable 5.1의 컨텍스트 윈도우는 여기서 200k로 기재되어 있는데, 이는 공식 Anthropic 문서에서 일반적으로 보고되는 1M 수치보다 낮습니다. 특정 평가 설정을 반영했거나 유출 시트의 오류일 수 있습니다.
  • 현재 공개적으로 출시되어 독립적으로 평가된 프런티어 모델은 GPT-6 Astra와 Claude Fable 5.1뿐입니다. Artificial Analysis 및 기타 제3자 트래커는 여전히 이들이 전반적으로 근접하게 매치된 것으로 보여줍니다(강점은 다름).

현재 실무 현실(2026년 9월 20일)

모델상태적합한 용도가격 수준
Gemini 4 Pro미출시(강력하다는 주장)장컨텍스트, 코딩, 에이전트, 다중모달, 비용매우 공격적(주장)
GPT-6 Astra출시됨수학, 컴퓨터 사용, 터미널, 자동화, 사이버프리미엄
Claude Fable 5.1출시됨장기 지식 작업, 추론, 코딩 품질, 캐시 효율프리미엄
Gemini 4 Flash / Flash-Lite형제 모델로 주장됨속도 + 비용 민감 워크로드매우 저렴

빠른 요약

  • 전반적 우위: Gemini 4 Pro는 나열된 모든 카테고리에서 1위를 기록하며, 종종 뚜렷한 격차를 보입니다.
  • 특정 강점: 장기 지향 코딩/에이전트(DeepSWE, Terminal-bench), 지식 작업, 다중모달(비디오+차트), 특화 도메인(금융, 법률, 생물학, 컴퓨터 사용).
  • 가격 포지셔닝: 입력과 출력 모두에서 GPT-6 Astra와 Claude Fable 5.1의 약 1/5 가격이면서 더 높은 점수를 제시.

Astra는 컴퓨터 사용, 사이버보안 임계치, 과학적 발견을 강조합니다; Fable 5.1은 장기 지식 작업과 코딩, 정제된 안전장치, 낮은 캐시 읽기 비용을 강조합니다. Gemini 4 Pro의 유출 프로파일은 광범위한 에이전트형 소프트웨어 엔지니어링과 다중모달 추론에서 가장 강해 보입니다.

개발자가 준비하는 법: CometAPI 권장사항

공식 Gemini 4 Pro 접근 권한을 기다리는 동안, 현 프런티어(현행 Gemini 3.x 시리즈, GPT-6 Astra, Claude Fable 5.1 / Opus 5, 그리고 500+ 모델)를 이미 지원하는 통합 게이트웨이가 유용합니다. CometAPI는 정확히 이를 제공합니다: 단일 OpenAI 호환 엔드포인트, 하나의 API 키, 공급사 직결 대비 일반적으로 20–40% 낮은 종량제 청구, 그리고 모델 ID 하나만 바꿔 스위칭 가능한 능력.

실무 워크플로우:

  1. CometAPI를 통해 현재 Gemini Flash/Pro, GPT-6 Astra, Claude Fable 5.1에서 에이전트형 파이프라인을 프로토타입합니다.
  2. 동일한 프롬프트를 모델별로 벤치마킹해 기준치를 마련합니다.
  3. Gemini 4 Pro(및 Flash 변형)가 CometAPI 카탈로그에 등장하면—역사적으로 이 플랫폼은 새로운 Google 모델을 신속히 추가합니다—모델 ID를 교체하고 최소한의 코드 변경으로 재평가를 실행합니다.
  4. 비용 대시보드를 사용해 공급자별 토큰 지출을 추적하고, 대량 또는 지연에 민감한 트래픽을 가장 경제적이면서도 능력 있는 모델로 라우팅하세요.

이 접근법은 다중 키 관리 부담을 제거하고, 벤더 종속 위험을 줄이며, 공개 즉시 Gemini 4 Pro를 채택할 수 있게 포지셔닝합니다.

유출이 방향성 측면에서 정확하다면, Gemini 4 Pro는 에이전트형 소프트웨어 엔지니어링과 장컨텍스트 다중모달 추론에서 프런티어를 되찾으려는 Google의 가장 강력한 시도입니다. 주장된 성능, 큰 컨텍스트, 공격적 가격의 조합은 많은 프로덕션 워크로드에서 기본 고려 대상으로 만들 것입니다. 공식 출시와 독립 평가가 나올 때까지는, 현 프런티어 모델 전반을 지속적으로 벤치마킹하는 것이 신중한 경로입니다—이미 통합 접근을 제공하는 플랫폼을 통해 손쉽게 할 수 있습니다. 공식 발표를 기다려 주세요; 향후 몇 주 내에 과대평가가 실제 운영 현실로 얼마나 이어지는지가 명확해질 것입니다.

FAQ

Gemini 4 Pro가 출시되었나요?

아니요. 최신 카탈로그와 Google 발언(9월 중~하순) 기준으로, 아직 공개 출시되거나 공식 모델 ID로 등록되지 않았습니다.

Gemini 4 Pro의 예상 출시일은 언제인가요?

유출자들은 2026년 10월을 지목합니다(9월 말 추측도 있음). Google는 공식 날짜를 제시하지 않았습니다. API 카탈로그나 블로그 포스트로 확인될 때까지는 추정치로 보세요.

Google가 Gemini 4 Pro로 RSI를 달성했나요?

공개 증거는 모델 개선을 위한 고급 에이전트 루프 사용과 전략 수준 재귀적 개선(Dream-RSI 등) 연구를 보여줍니다. 모델 자체를 산출한 완전한 RSI에 대한 독립 검증은 없습니다.

벤치마크에서 GPT-6 Astra와 Claude Fable 5.1 대비 어떻습니까?

커뮤니티 유출 차트는 여러 에이전트/코딩 스위트에서 리드를 주장합니다. 공개 출시된 Gemini 4 Pro에 대한 공식 독립 점수는 아직 없습니다. 현재는 출시된 모델(Astra와 Fable 5.1)을 실제 과업에 맞춰 평가하는 것이 바람직합니다.

빌드를 Gemini 4 Pro를 기다렸다가 시작해야 하나요?

아니요. 오늘 이용 가능한 최상급 모델(CometAPI 또는 공급사 직결 API)을 활용해 제품을 출시하고, 평가 세트를 준비해 두었다가 독립 및 내부 테스트가 전환을 정당화할 때 새 모델을 채택하세요.

현재 프런티어 모델을 쉽게 어디서 접근할 수 있나요?

CometAPI 같은 통합 제공자는 GPT-6 Astra급, Claude Fable 5.1, 현행 Gemini 모델 등과 다른 모델들에 OpenAI 호환 접근을 제공하며, 간소화된 청구와 모델 스위칭을 지원합니다. 최신 모델 목록과 문서를 확인해 최신 ID와 가격을 확인하세요.

학습 계속하기

이 글을 다음 결정과 연결하세요.

모든 주제 보기
게시일 Sep 20, 2026
최종 업데이트 Sep 20, 2026
0 회 조회
명확성, 출처 표기 및 최신 API 용어에 대해 검토되었습니다.

AI 개발 비용을 20% 절감할 준비가 되셨나요?

몇 분 안에 무료로 시작하세요. 무료 체험 크레딧 제공. 신용카드 불필요.

더 보기