요약: DeepSeek-V4-Pro-0813은 DeepSeek의 플래그십 1.6T-parameter MoE 모델(활성 49B)의 일반 공급(GA) 릴리스입니다. 2026년 4월 프리뷰 대비 에이전트 성능이 크게 향상되었고, 1M 토큰 컨텍스트 윈도우, 최대 384K 출력 토큰, 세 가지 사고 노력 수준(low/high/max), 기본 OpenAI Responses API, 도구 호출, JSON 모드, OpenAI/Anthropic 호환 엔드포인트를 지원합니다.
공식 가격은 입력/출력 100만 토큰(캐시 미스)당 각각 $0.435 / $0.87부터 시작하며, 피크/오프피크 요금이 2026년 8월 16일에 도입됩니다. 가장 간편하고 비용 효율적인 접근 방식은 할인 요금으로 제공되는 CometAPI의 통합 OpenAI 호환 게이트웨이를 이용하는 것입니다.
핵심 요약
- DeepSeek-V4-Pro-0813은 2026년 8월 12–13일경 출시된 프로덕션 GA 버전이며, 모델 ID는 그대로
deepseek-v4-pro입니다. - 에이전트 벤치마크 대폭 상승: DeepSWE 62.7, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, HLE(도구 사용 포함) 60.0.
- 세 가지 사고 모드/노력 수준: 비-사고 + 낮음/높음/최대 추론 노력.
- 전체 기능 세트: 1M 컨텍스트, 최대 384K 출력, 도구 호출, JSON 출력, Responses API, Anthropic 포맷, 스트리밍, 구조화 출력.
- 피크/오프피크 가격이 2026년 8월 16일(UTC)부터 시작되므로 워크로드를 계획하세요.
- OpenAI SDK 드롭인 호환으로 마이그레이션이 매우 간단합니다.
이 종합 가이드는 개발자에게 필요한 모든 것을 다룹니다: 0813 릴리스의 변경점, 공식 사양과 가격, 사고 모드, 스트리밍과 구조화 출력, 그리고 CometAPI를 통한 모델 사용 단계별 안내(다수의 프로덕션/멀티모델 워크플로우에 권장). 모든 정보는 2026년 8월 13일 기준 공식 DeepSeek 문서와 동시 보도에서 가져왔습니다.
DeepSeek V4 Pro 0813이란?
DeepSeek-V4-Pro-0813은 2026년 8월에 출시된 DeepSeek V4 Pro의 일반 공급 프로덕션 스냅샷입니다.
DeepSeek는 8월 13일 공식 V4 Pro 버전이 앱, 웹사이트, API에서 동시에 사용 가능해졌다고 발표했습니다. 또한 OpenAI Responses API 기본 호환과 실무적인 세 가지 추론 수준: 비-사고, 고강도 추론, 최대 강도 추론을 추가했습니다. 개발자에게 중요한 점은 API 모델 이름이 바뀌지 않는다는 것입니다. 개발자는 계속해서 다음을 호출합니다:
deepseek-v4-pro
0813 표기는 프로덕션 스냅샷을 식별할 뿐이며, 개발자가 API 요청에 반드시 기입해야 하는 모델 식별자는 아닙니다.
이 모델은 고급 추론, 소프트웨어 엔지니어링, 장문맥 분석, 에이전트형 워크로드에 주로 포지셔닝되어 있습니다. Artificial Analysis의 현재 보고에 따르면, 선택된 비교용 오픈 가중치 모델의 중앙값 27과 비교해 지능 지수 점수는 53이며, API 테스트 기준 약 초당 77.6 토큰의 출력 속도와 1.71초의 첫 토큰 지연을 보고했습니다.
V4 Pro 0813에서 API에 어떤 변경이 있었나?
코어 모델 식별자와 기본 URL은 동일하므로 기존 통합은 코드 변경 없이 계속 작동합니다. 실제 변화는 능력, 후처리 품질, 지원 기능입니다.
주요 능력 향상
- 프로덕션 스타일 워크로드에서 특히 두드러진 에이전트 기능 업그레이드.
- 0813 빌드 벤치마크:
- HLE(도구 미사용/사용): 42.7 / 60.0
- Terminal Bench 2.1: 87.9
- NL2Repo: 61.5
- Cybergym: 83.3
- DeepSWE: 62.7
- Toolathlon-Verified: 74.1
- Agents’ Last Exam: 25.7
- AutomationBench(Public): 31.8
- DSBench-FullStack: 71.1
- DSBench-Hard: 67.2
이는 2026년 4월 프리뷰 대비 큰 폭의 상승입니다(예: DeepSWE가 크게 상승). 아키텍처는 총 1.6조 파라미터에 토큰당 약 49B가 활성화되는 Mixture-of-Experts 구조를 유지합니다.
신규 및 강화된 API 기능
- OpenAI Responses API 기본 지원, Codex에 최적화된 원클릭 설정 스크립트 제공.
- 더 유연해진 사고 노력 제어: low / high / max(기존 Pro의 제한적 매핑 대비 향상).
- 이중 모드 지속 지원(기본적으로 사고 활성화; 비-사고 모드 제공).
- OpenAI Chat Completions 및 Anthropic Messages 포맷과 완전 호환.
- JSON Output, Tool Calls, Chat Prefix Completion(베타), FIM Completion(베타, 비-사고 전용).
- 컨텍스트 길이는 1M 토큰 유지; 최대 출력은 384K 토큰.
- Pro 동시성 한도: 500(Flash: 2,500).
가격 업데이트 안내
2026년 8월 13일 기준 100만 토큰당 가격:
| Model | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|
| deepseek-v4-flash | $0.0028 | $0.14 | $0.28 |
| deepseek-v4-pro | $0.003625 | $0.435 | $0.87 |
2026년 8월 16일 16:00 UTC부터 피크/오프피크 과금이 적용됩니다(오프피크 = 피크의 절반). 피크 시간: 01:00–04:00 및 06:00–10:00 UTC. 새로운 요금:
| Model | Period | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|---|
| deepseek-v4-pro | Off-peak | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro | Peak | $0.044 | $1.32 | $3.96 |
DeepSeek는 추가적인 전반적 가격 인상이 있을 수 있음을 언급했으므로 공식 가격 페이지를 모니터링하세요.
DeepSeek 제한 문서에 따르면, 표준 V4 Pro 동시성은 계정당 500 요청입니다. 연결은 제출 시점부터 응답 완료까지 계산되며, 초과 요청은 HTTP 429를 받습니다. DeepSeek는 스케줄링 격리를 위해 a 를 허용합니다; 이는 must match 와 일치해야 하며 길이는 512자를 넘지 않아야 합니다. 개인 정보를 포함하지 않아야 합니다.
Responses API 기본 지원
가장 분명한 변화 중 하나는 OpenAI Responses API 포맷의 기본 지원입니다.
DeepSeek는 Responses API가 부분적으로 Codex와 같은 코딩 에이전트 워크플로우를 지원하도록 설계되었다고 설명합니다. 공식 엔드포인트는 다음을 사용합니다:
https://api.deepseek.com
그리고 OpenAI Python SDK로 접근할 수 있습니다.
예시:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
DeepSeek 문서에 따르면 Responses API 요청에 대한 스트리밍도 지원하며, 이전의 data: [DONE] 관례 대신 의미 기반 SSE를 사용합니다.
더욱 유연한 사고 제어
V4 Pro는 별도의 추론 모델을 강제하지 않고 추론 설정을 구성 가능하게 합니다.
DeepSeek 문서는 사고 스위치를 다음과 같이 설명합니다:
{
"thinking": {
"type": "enabled"
}
}
그리고 추론 노력은 다음과 같습니다:
high
max
기본 사고 구성은 활성화이며, 일반 요청에는 high가 사용됩니다. 특정 복잡한 에이전트 워크로드는 자동으로 max를 사용할 수 있습니다.
이는 애플리케이션 개발자에게 실질적으로 다음의 세 가지 모드를 제공합니다:
- 비-사고
- 사고 — 높음
- 사고 — 최대
이 구분은 모든 요청이 최대 추론을 필요로 하지 않기 때문에 AI 애플리케이션 설계에서 매우 유용합니다.
중요한 구현 세부사항: 사고 모드에서는
temperature와top_p같은 매개변수가 출력에 영향을 주지 않습니다. DeepSeek는 이 동작을 명시적으로 문서화합니다.
CometAPI로 DeepSeek V4 Pro 0813 API 사용하기
CometAPI는 각 AI 제공업체마다 개별 통합을 유지하지 않고 DeepSeek V4 Pro를 통합하려는 경우 유용합니다.
CometAPI는 현재 500+ AI 모델을 포괄하는 통합 API를 제공하며, 공통 API 레이어와 통합 결제를 제공합니다. 가격 문서에 따르면 공식 모델 가격은 일반적으로 제공업체 공식 요율 대비 20% 할인으로 제공됩니다.
다음은 실무적인 CometAPI 통합 워크플로우입니다.
1단계: CometAPI 계정 생성
먼저 CometAPI 계정을 생성하거나 로그인하세요.
CometAPI 웹사이트를 열고 API 콘솔에 접속합니다.
CometAPI의 DeepSeek V4 Pro 문서는 CometAPI 콘솔에서 API 토큰을 발급받도록 안내합니다.
2단계: CometAPI API 키 생성
로그인 후 계정의 토큰/API 키 섹션을 열고 API 키를 생성하세요.
애플리케이션 내부에 하드코딩하지 말고 환경 변수로 저장하세요.
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
API 키를 GitHub, 프런트엔드 JavaScript, 모바일 앱, 공개적으로 접근 가능한 설정 파일에 커밋하지 마세요.
3단계: OpenAI Python SDK 설치
CometAPI가 OpenAI 호환 인터페이스를 제공하므로 익숙한 OpenAI Python 클라이언트를 사용할 수 있습니다.
pip install openai
이는 이미 OpenAI API 포맷에 익숙한 개발자의 마이그레이션을 특히 간단하게 합니다.
4단계: CometAPI 기본 URL 구성
클라이언트를 다음과 같이 생성합니다:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
CometAPI가 공개한 V4 Pro 예시는 이 기본 URL과 deepseek-v4-pro 모델 ID를 사용합니다.
5단계: 첫 DeepSeek V4 Pro 요청 보내기
이제 기본 요청을 전송합니다:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
핵심 매개변수:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
세 가지 사고 모드 자세히 보기
DeepSeek V4 Pro는 다음을 지원합니다:
- 비-사고 모드 — 가장 빠른 응답, 명시적 체인 오브 소트 없음. 단순 Q&A나 고처리량 시나리오에 적합.
- 사고 모드(낮음/높음 노력) — 최종 답변 전에 reasoning_content를 생성. 대부분의 에이전트/코딩 작업에는 높음이 실질적 기본값.
- 최대 노력 — 모델의 추론 능력을 극대화; 복잡한 다단계 문제에 권장. 토큰/지연이 더 클 수 있음.
OpenAI 호환 포맷에서 thinking 객체와 reasoning_effort 파라미터로 제어합니다. 체인 오브 소트는 message.reasoning_content에 표시됩니다. 도구를 사용하지 않을 때는 선행 추론을 이후 컨텍스트에서 종종 생략할 수 있지만, 도구를 사용할 때는 전체 추론을 반드시 다시 전달해야 합니다.
사고 노력과 비-사고 모드 전환
- 비-사고:
"thinking": {"type": "disabled"}(또는 Anthropic 스타일reasoning.effort: "none"에 상응). - 사고+노력:
"thinking": {"type": "enabled"}와 함께"reasoning_effort": "low" | "high" | "max".
기본은 사고 활성화 + high 노력입니다. 간단한 쿼리는 low, 일반 에이전트 작업은 high, 가장 어려운 추론/다단계 코딩에는 max를 사용하세요.
스트리밍 응답과 구조화 출력
스트리밍은 "stream": true 설정만으로 활성화됩니다. 콘텐츠와(가능한 경우) 추론 토큰 모두 스트리밍될 수 있습니다. 이는 인터랙티브 에이전트 및 사용자 지향 애플리케이션에 중요합니다.
구조화/JSON 출력은 1급 기능입니다: response_format={"type": "json_object"} 또는 Responses API와 도구 정의를 통한 더 진보된 스키마 지원을 사용하세요. 도구 호출과 결합하면 기계가 읽을 수 있는 동작을 내보내는 신뢰도 높은 에이전트 루프를 구현할 수 있습니다.
Responses API 엔드포인트(/responses)는 특히 Codex 스타일 워크플로우에 유용한, 보다 현대적이고 OpenAI에 맞춘 표면을 제공하며 이제 V4 Pro에서 기본 지원됩니다.
구조화 출력/JSON 모드 사용
DeepSeek는 JSON Output을 지원합니다. response_format으로 요청하세요:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
더 엄격한 스키마 제어가 필요하면 도구 호출 또는 Responses API와 결합하세요.
도구 호출(Function Calling) 구현
OpenAI 포맷으로 도구를 정의합니다. 사고 모드에서는 도구가 사용될 때 후속 턴에 reasoning_content를 올바르게 전달해야 합니다.
이후 도구와 상호작용할 때, 개발자는 마인드셋 도구를 호출할 때 해당 reasoning_content를 유지해야 합니다. 부적절한 처리로 400 오류가 발생할 수 있습니다.
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
도구 호출 및 사고 모드 가이드에서 도구 사용 시 필요한 멀티턴 패턴을 확인하세요.
DeepSeek V4 Pro 0813 API 사용 모범 사례
작업에 맞는 사고 노력 매칭
분류 수준의 작업에 Max 추론을 사용하지 마세요.
간단한 라우팅 정책은 다음과 같습니다:
Simple → Non-thinking
Moderate → High
Complex → Max
이는 지연과 비용을 모두 줄일 수 있습니다.
긴 응답은 스트리밍
애플리케이션에서 응답 생성에 몇 초가 걸릴 수 있다면 다음을 사용하세요:
stream=True
사용자는 전체 응답을 기다리는 것보다 점진적 출력을 훨씬 빠르게 체감합니다.
구조화 출력 검증
JSON 모드는 신뢰성을 높이지만, 애플리케이션은 반환된 JSON을 반드시 검증해야 합니다.
사용 예:
import json
data = json.loads(response_text)
그런 다음 필수 필드를 검증한 뒤 데이터베이스에 쓰거나 외부 동작을 트리거하세요.
토큰 사용량 모니터링
가능한 경우 항상 다음을 확인하세요:
response.usage
V4 Pro 규모에서는 토큰 회계가 선택적 분석 기능이 아니라 핵심 비용 통제 메커니즘입니다.
안정 프롬프트와 동적 프롬프트 분리
장문맥 애플리케이션에서는 반복되는 지시와 문서를 안정적으로 유지해 캐시 재사용을 극대화하세요.
백업 모델 준비
실무적인 프로덕션 아키텍처는 다음과 같이 라우팅할 수 있습니다:
Simple request
↓
V4 Flash
Complex request
↓
V4 Pro
Very difficult request
↓
V4 Pro Max reasoning
정확한 라우팅 정책은 자체 벤치마크로 결정하세요.
일반적인 DeepSeek V4 Pro API 오류
오류: 모델을 찾을 수 없음
다음이 맞는지 확인하세요:
deepseek-v4-pro
스냅샷 모델 이름을 잘못 만들어 사용하지 마세요.
DeepSeek는 0813 프로덕션 릴리스에서도 API 모델 이름이 변경되지 않는다고 밝혔습니다.
오류: 잘못된 사고 매개변수
OpenAI 호환 요청에서는 다음을 사용하세요:
"thinking": {
"type": "enabled"
}
요청 본문에 적절히 포함하고, 다음과 같이 사용하세요:
reasoning_effort=high
또는:
reasoning_effort=max
DeepSeek 공식 API 문서에 이 매개변수가 정의되어 있습니다.
오류: JSON 출력이 손상됨
다음을 사용하세요:
"response_format": {
"type": "json_object"
}
그리고 프롬프트에서 JSON을 생성하라고 명시하세요. DeepSeek는 JSON 모드가 JSON 생성 지시와 함께 사용되어야 한다고 경고합니다.
오류: 멀티턴 도구 호출 중
사고 모드에서 도구 호출을 사용할 때, 후속 요청에서 필요한 reasoning_content를 보존하세요.
이 부분을 놓치기 쉽고 400 응답을 유발할 수 있습니다.
DeepSeek V4 Pro 0813 API: 권장 아키텍처
프로덕션 애플리케이션에 권장되는 출발점 아키텍처는 다음과 같습니다:
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
이는 모델 선택을 애플리케이션 로직과 분리합니다.
다른 모델이 특정 워크로드에서 더 경제적이거나 성능이 좋아지면 라우팅 레이어만 변경해 전체 애플리케이션을 다시 작성할 필요가 없습니다.
결론 및 권장사항
DeepSeek-V4-Pro-0813은 1M 컨텍스트와 시리즈의 매력적인 경제성을 유지하면서 에이전트 성능이 크게 강화된 프로덕션 플래그십으로 V4 Pro 라인의 성숙을 알립니다. OpenAI 및 Anthropic 호환성 덕분에 사실상 마이그레이션 비용 없이 즉시 사용할 수 있습니다.
대부분의 팀에 권장하는 전략:
- CometAPI에서 프로토타이핑과 멀티모델 실험을 진행하세요.
- 피크/오프피크 가격 및 추가 조정이 안정화되면 DeepSeek 전용 고볼륨/지연 민감 워크로드는 공식 엔드포인트로 이전하세요.
- 에이전트와 코딩 작업에는 사고 모드 + reasoning_effort="high"를 기본으로, 가장 어려운 문제에만 max를 사용하세요.
- 도구 호출 시 reasoning_content의 적절한 왕복 전송을 구현하고, 스트리밍과 구조화 출력을 활용해 견고한 애플리케이션을 구축하세요.
0813 릴리스로 DeepSeek는 심층 에이전트 및 장문맥 워크로드에 경쟁력 있는 고성능·비용 효율의 오픈 가중치급 모델을 제공했습니다. CometAPI 또는 공식 API로 통합해 바로 구축을 시작하세요. CometAPI에서 DeepSeek V4 Pro 둘러보기.
자주 묻는 질문
DeepSeek V4 Pro 0813은 deepseek-v4-pro와 동일한가요?
예. DeepSeek 공식 발표에 따르면 API 모델 이름은 변경되지 않으며, 프로덕션 버전이 V4 Pro 0813으로 업데이트되었습니다.
DeepSeek V4 Pro는 1M 토큰 컨텍스트 윈도우를 지원하나요?
예. 현재 모델/가격 문서에 1M 토큰 컨텍스트 길이와 최대 384K 출력이 명시되어 있습니다.
DeepSeek V4 Pro의 세 가지 사고 모드는 무엇인가요?
실무적 관점에서 다음과 같습니다:
- 비-사고
- 고강도 사고
- 최대 강도 사고
API는 사고 토글과 reasoning_effort를 사용합니다. DeepSeek의 현재 API는 high와 max를 노출하며, 호환성 값인 low와 medium은 high에 매핑됩니다.
DeepSeek V4 Pro 응답을 스트리밍할 수 있나요?
예. Chat Completions API를 통해 스트리밍을 지원하며, 사고 모드 스트림에는 일반 답변 콘텐츠 이전에 reasoning_content 델타가 포함될 수 있습니다.
CometAPI에서 DeepSeek V4 Pro를 사용할 수 있나요?
예. CometAPI는 OpenAI 호환 /v1/chat/completions 엔드포인트를 통해 deepseek-v4-pro 모델을 문서화하고 있습니다.
DeepSeek V4 Pro와 V4 Flash 중 무엇을 써야 하나요?
처리량, 지연, 비용이 중요한 경우 V4 Flash를, 어려운 추론·코딩·장문맥 분석·에이전트형 워크로드에는 V4 Pro를 사용하세요.
모든 작업에 Pro를 쓰는 것보다 하이브리드 라우팅 전략이 일반적으로 더 낫습니다.
DeepSeek V4 Pro API 가격이 변경되나요?
예. DeepSeek는 2026년 8월 17일부터 피크/오프피크 가격을 도입한다고 발표했습니다. 공식 문서에는 오프피크 기간에 V4 Pro가 입력(캐시 미스) $0.66/M, 출력 $1.98/M, 피크 기간에는 입력 $1.32/M, 출력 $3.96/M로 기재되어 있습니다.
