TLDR DeepSeek-V4-Flash-0731(2026년 7월 31일 릴리스)는 DeepSeek의 효율적인 Mixture-of-Experts 모델(총 284B / 활성 13B 파라미터, 1M 토큰 컨텍스트)의 공식 프로덕션 준비 버전이다. 타깃팅된 사후 학습을 통해 에이전트형 코딩, 도구 사용, 다단계 소프트웨어 엔지니어링에서 극적인 향상을 제공한다. Responses API와 OpenAI Codex를 네이티브로 지원한다. DeepSeek Harness는 모델을 신뢰할 수 있는 자율 에이전트로 전환하기 위해 설계된 동반 에이전트 프레임워크(공식 평가에 이미 minimal 모드 사용; 전체 릴리스 예정)다.
두 요소를 결합하면 2026년 8월 기준 오픈 가중치 및 API 접근 가능한 에이전트형 AI 중 비용 대비 성능이 가장 강력한 축에 든다.
핵심 요점
- 사후 학습만으로 대규모 에이전트 성능 도약: 4월 프리뷰와 동일한 284B/13B 아키텍처지만 점수 대폭 상승(예: Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
- 활성 파라미터가 훨씬 적음에도 다수의 에이전트 벤치마크에서 DeepSeek-V4-Pro(Preview)를 능가.
- 비용은 훨씬 낮으면서 상위 독점 모델들과 경쟁(여러 에이전트 작업에서 Claude Opus 4.8에 근접).
- 네이티브 1M 컨텍스트, 추측 디코딩(DSpark), 세 가지 추론 노력 수준(low/high/max), MIT 라이선스, 오픈 가중치.
- Responses API와 Codex 공식 지원(CLI, 데스크톱, VS Code 확장).
- DeepSeek Harness(평가에서 minimal 모드 사용)는 공식 에이전트 프레임워크로 클로즈드 베타 중; 곧 공개 예정. DeepSeek Harness는 에이전트 런타임 레이어를 제공하며, 모델 + 하네스 = 프로덕션 에이전트.
- 고볼륨 코딩 에이전트, 터미널 자동화, 도구 사용, 장문 맥락 워크플로우에 이상적.
DeepSeek V4 Flash 0731의 새로운 점은?
공식 릴리스 상태 변경
가장 중요한 제품 변화는 DeepSeek V4 Flash 0731이 이제 API에서 DeepSeek V4 Flash의 공식 릴리스(퍼블릭 베타)가 되었다는 점이다. DeepSeek의 7월 31일 변경 로그에 따르면 개발자는 동일한 모델 이름 deepseek-v4-flash를 계속 호출해 최신 버전에 접근할 수 있다. 이는 마이그레이션 측면에서 중요하다. 새로운 모델 슬러그가 필요 없고 기존 라우팅 로직 뒤에서 업데이트를 테스트할 수 있기 때문이다.
또한 이번 업데이트는 V4 Flash API만 업그레이드되었다고 한다. V4 Pro API와 앱/웹 모델은 7월 31일 릴리스로 변경되지 않았으며, DeepSeek은 공식 V4 Pro 릴리스가 곧 뒤따를 것이라고 밝혔다. 즉, 전체 DeepSeek V4 제품군 일괄 갱신이 아니라, Flash에 대한 타깃 업데이트다.
아키텍처는 동일, 사후 학습만 변경
코어 아키텍처는 그대로다: Mixture-of-Experts(MoE) 모델로 총 파라미터는 284B, 토큰당 활성 파라미터는 13B, 장문 컨텍스트 최적화 하이브리드 어텐션 설계, 네이티브 1M 토큰 컨텍스트 윈도우. 더 빠른 생성을 위해 추측 디코딩 모듈(DSpark)이 붙는다. 모델은 텍스트 전용이며, 조정 가능한 추론 노력 수준(low / high / max), 도구 호출, 구조화 출력 등을 지원하고, 허용적인 MIT 라이선스로 공개된다.
이 구분은 중요하다. 많은 모델 업데이트는 모델이 더 커져서 개선된다. 이번 업데이트는 파라미터 풋프린트를 늘리지 않고 에이전트 성능을 크게 끌어올렸다는 점에서 더 흥미롭다. V4 Flash는 여전히 총 284B, 활성 13B의 MoE 모델로, 추론 시점의 크기 측면에서 V4 Pro(총 1.6T, 활성 49B)보다 훨씬 작다.
에이전트 코딩 점수 급상승
DeepSeek의 공식 표는 터미널, 리포지토리 빌드, 보안, 소프트웨어 엔지니어링, 도구 사용, 자동화, 풀스택 코딩 작업에서 큰 향상을 보여준다. 이전 Flash 프리뷰 대비 가장 큰 절대 상승은 DeepSWE로 54.4 대 7.3, 47.1포인트 상승이다. Cybergym은 38.0포인트, DSBench-Hard는 33.8포인트, DSBench-FullStack은 31.7포인트 상승했다.
이 때문에 V4 Flash 0731은 일반적인 “빠른 모델”이 아니라 코딩 에이전트의 기본 모델 후보로 논의되고 있다. 가치 제안은 단순히 저렴한 채팅이 아니다. 저렴하고, 장문 컨텍스트에 강하며, 도구 친화적인 에이전트 추론이다.
Responses API 및 Codex 지원 도착
7월 31일 변경 로그에 따르면 공식 V4 Flash는 Responses API 형식을 네이티브로 지원하며 Codex에 맞게 특별히 조정되었다. DeepSeek의 Responses API 가이드는 Codex 수요를 충족하기 위해 해당 형식을 추가했으며, 기본 URL은 https://api.deepseek.com이고 현재 deepseek-v4-flash를 지원한다고 설명한다.
이는 중요하다. Codex 스타일의 개발 워크플로우는 단순한 채팅 세션이 아니다. 구조화된 입력/출력 항목, 추론 항목, 도구 호출, 파일 변경 작업, 스트리밍 이벤트, 사용량 집계, 코딩 에이전트 클라이언트와의 통합이 필요하다. DeepSeek의 지원은 OpenAI Responses API의 모든 기능을 완벽히 복제하는 것은 아니지만, V4 Flash를 코딩 에이전트 실험에서 훨씬 실용적인 대체 후보로 만드는 데 충분하다.
공식 V4-Flash 버전의 성능 벤치마크
개발자가 무시하지 말아야 할 벤치마크 유의사항
공식 평가 결과(모델 카드에서 DeepSeek가 보고)에 따르면 프리뷰 대비, 그리고 놀랍게도 훨씬 큰 V4-Pro Preview 대비 에이전트 중심 작업에서 크게 도약했다. 코드 에이전트 벤치마크 평가는 DeepSeek Harness의 minimal 모드에서 최대 추론 노력, temperature = 1.0, top_p = 0.95로 수행되었다.
이는 두 가지 시사점을 가진다. 첫째, 결과는 순수 모델 결과가 아니라 모델+하네스 결과라는 점이다. 에이전트 런타임의 도구 구성, 셸 권한, 컨텍스트 관리, 재시도, 패치 규칙, 실패 처리 방식이 다르면 동일 점수를 얻지 못할 수 있다. 둘째, DeepSeek이 외부 팀이 비교 가능한 테스트를 수행할 수 있도록 충분한 하네스와 평가 설정을 공개하기 전까지는 독립적 재현이 제한된다.
DeepSeek 공식 벤치마크 표
| Benchmark | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
위 9개 벤치마크에서 V4 Flash 0731의 평균은 55.2다. 이전 V4 Flash 프리뷰 평균은 29.6, V4-Pro Preview 평균은 34.9다. 즉, 이 표에서 V4 Flash 0731은 Flash 프리뷰보다 약 25.6포인트, V4-Pro Preview보다 20.3포인트 높다.
서드파티 신호
ARC Prize는 V4 Flash 0731이 최대 노력에서 ARC-AGI-1 Semi-Private 89.0%, ARC-AGI-2 Semi-Private 61.4%를 기록했으며, 태스크당 비용을 각각 $0.02와 $0.04로 보고한다고 밝혔다. 이는 코딩 에이전트 벤치마크는 아니지만, 더 높은 노력 모드에서 모델이 추론 작업에서 경쟁력이 있음을 뒷받침한다.
특히 DeepSWE(소프트웨어 엔지니어링 에이전트 루프)와 Cybergym에서의 향상이 눈에 띈다. 독립 측정(예: Artificial Analysis)은 Terminal-Bench가 약 79%로 다소 낮지만 여전히 강한 수치를 보고하며, 벤더 하네스 수치가 낙관적인 경향이 있음을 상기시킨다.
이전 V4 평가와 서드파티 집계에서도 최대 추론 모드에서 높은 지식 및 코딩 성능이 확인되었다(GPQA Diamond 약 88–91%, LiveCodeBench는 출처에 따라 고 80%~90%대). 0731 사후 학습은 프리뷰에 부족했던 에이전트 신뢰성을 특히 해제했다.
DeepSeek-V4-Flash는 이제 Responses API와 Codex를 지원
전략적으로 중요한 추가점은 OpenAI의 Responses API를 네이티브로 지원한다는 것이다. DeepSeek 공식 문서는 현재 Responses API가 deepseek-v4-flash를 지원한다고 확인한다(Pro 지원은 2026년 8월 초 예상). 기본 URL은 여전히 https://api.deepseek.com.
이는 개발자 경험에서 큰 업그레이드다. Responses API와 Codex 지원 전에도 DeepSeek V4 Flash는 텍스트 모델로 호출할 수 있었지만, 코딩 에이전트는 더 많은 통합 세부사항을 직접 처리해야 했다. 이제 모델은 Responses 스타일 의미론을 기대하는 워크플로우에서 사용할 수 있다.
Responses API 지원에 포함되는 내용
DeepSeek의 Responses API는 /responses에서 OpenAI Responses API 형식으로 모델 응답을 생성한다. Responses API는 model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, 도구, 도구 선택, 추론 노력, 텍스트 형식, 사용량 보고를 지원한다. API는 상태 비저장(stateless)이므로, 다중 턴 상호작용에는 클라이언트가 전체 대화 이력을 전송해야 한다.
가장 중요한 호환성 세부사항은 실무적이다:
deepseek-v4-flash가 현재 Responses API에서 유일하게 지원되는 모델이다.developer메시지는system메시지로 처리된다.- 함수 도구, 스트리밍, 조정 가능한 추론 노력과 서버 측 웹 검색을 지원한다.
- 커스텀 도구 타입은
apply_patch만 지원되며, 이는 Codex 호환성에 중요하다. - 이미지 및 파일 입력은 지원되지 않는다. 이미지 입력 파트는 플레이스홀더 텍스트로 대체된다.
previous_response_id,conversation,store, 백그라운드 모드, 메타데이터, 일부 컨텍스트 관리 기능은 지원되지 않는다.- 미지원 파라미터는 조용히 무시될 수 있으므로, 프로덕션 클라이언트는 기대하는 동작을 명시적으로 테스트해야 한다.
개발자에게 핵심 포인트는 Responses API 지원이 단순한 문법 문제가 아니라는 점이다. 함수 호출, 스트리밍 이벤트, 추론 항목, 패치 적용을 일관되게 표현해야 하는 현대 코딩 에이전트에서 DeepSeek V4 Flash가 사용되는 프로토콜 레인에 들어오게 해 준다.
상태 비저장 설계(클라이언트가 대화 이력 관리). 예시(Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
전체 세부사항과 Codex 통합 가이드: DeepSeek API Docs – Responses API 및 Integrate with Codex.
Codex 지원의 의미
DeepSeek의 Codex 통합 가이드에 따르면 Codex는 Responses API를 통해 모델과 통신하며, DeepSeek가 이를 네이티브로 지원하게 되었다. 이를 통해 Codex(OpenAI의 코딩 에이전트 생태계 — CLI, ChatGPT 데스크톱 앱, VS Code 확장)와 직접 통합이 가능해진다.
개발자는 설정 스크립트 또는 ~/.codex/config.toml과 모델 카탈로그 파일 편집을 통해 한 번 커스텀 프로바이더를 구성할 수 있다. 설정 후 Codex 클라이언트는 DeepSeek-V4-Flash를 인식하고 도구 호출, apply_patch, 웹 검색, 추론 기능을 사용할 수 있다.
DeepSeek V4 Flash vs. DeepSeek V4 Pro
| 측면 | V4-Flash-0731 | V4-Pro(일반 / Preview) |
|---|---|---|
| 총/활성 파라미터 | 284B / 13B | ~1.6T / 49B |
| 컨텍스트 윈도우 | 1M tokens | 1M tokens |
| 강점 | 에이전트 코딩, 터미널, 비용, 속도 | 가장 깊은 추론, 지식, 난도 높은 작업 |
| 에이전트 벤치마크 우위 | 공개된 0731 에이전트 스위트에서 우세 | 이전 평가에서 순수 지식 & 복잡한 다중 파일에 강함 |
| 일반 API 가격대 | ~$0.14 입력 / $0.28 출력(캐시 적중 시 훨씬 낮음) | 크게 더 높음(과거 3–12×) |
| 적합한 용도 | 고볼륨 에이전트, 프로덕션 코딩 루프, 비용 민감형 앱 | 프런티어 연구, 최대 역량 단일 작업 |
| 오픈 가중치 | 예(MIT) | 예(MIT) |
개발자는 무엇을 먼저 써야 할까?
0731에서 공개된 특정 에이전트 벤치마크 기준으로는 작은 Flash 모델이 Pro 프리뷰를 전반적으로 앞선다. 순수 지식 검색이나 가장 어려운 추론 문제에서는 독립적/이전 평가에서 Pro가 여전히 우위를 보이는 경우가 많다. 실무에서는 다수 팀이 대부분의 에이전트 워크로드에 Flash를 기본으로 사용하고, 가장 까다로운 작업만 Pro(또는 다른 프런티어 모델)로 라우팅한다.
이 라우팅 전략에서 CometAPI가 도움이 된다. 모든 워크로드에 하나의 모델을 하드코딩하는 대신, CometAPI를 사용해 모델 선택, 로깅, 비용 추적, 폴백 정책을 중앙화하라. 예를 들어:
- 리포지토리 요약, 리팩터링 계획, 코드 리뷰 초안, 자동 생성 테스트, 구조화 추출, 장문 QA, 반복 에이전트 루프에는 V4 Flash 사용.
- 비즈니스 리스크가 높은 작업, 요구사항이 모호한 과제, 취약한 프로덕션 코드, 반복된 실패가 있는 경우 Pro 또는 다른 프리미엄 모델로 승격.
- 진짜로 중요한 최종 지표를 추적: 달러당 채택된 수정, 시간당 성공 태스크, 절약된 휴먼 리뷰 시간 등.
DeepSeek Harness란?
DeepSeek Harness는 자사 모델을 신뢰할 수 있는 자율 에이전트로 전환하기 위해 DeepSeek이 구축 중인 공식 에이전트 프레임워크/런타임 레이어다. 회사는 이를 간단히 다음과 같이 규정한다: 모델 + 하네스 = 에이전트.
V4-Flash-0731의 공식 평가에는 이미 “minimal 모드”의 DeepSeek Harness가 사용되었다. 전체 제품은 아직 출시 중이며(2026년 7월 말~8월 초에 채용 및 초기 테스트 진행), 팀은 Cui Tianyi가 이끌고 있다(퀀트 트레이딩 시스템 배경). 채용 공고는 prefix 캐싱, 장문 컨텍스트 관리, KV-캐시 최적화, 도구 사용 체이닝, 오류 복구, 자동 재시도 등 DeepSeek-V4 기능과의 심층 통합을 강조한다.
Harness는 범용 LangChain 스타일 래퍼가 아니다. 컨텍스트 관리, 도구 오케스트레이션, 증거 수집, 수리 루프가 V4 특유의 효율성(스파스 어텐션, 캐싱, 추론 모드)을 활용하도록 모델과 공동 설계되고 있다. 커뮤니티 프로젝트와 서드파티 하네스도 존재하지만, 공식 Harness는 가장 긴밀한 모델–런타임 결합을 목표로 한다.
완전 공개 시 기대되는 기능:
- 코딩 및 자동화를 위한 구조화된 에이전트 루프.
- 세이프티 게이트와 승인 플로우.
- 장기 작업을 위한 효율적 컨텍스트 처리.
- 가시성 및 산출물(아티팩트) 생산.
전체 릴리스 전이라도, 개발자는 이미 V4-Flash-0731을 기존 에이전트 프레임워크와 결합하거나 Responses API + Codex 경로를 통해 강력한 결과를 얻을 수 있다.
가격, 가용성, 실무 배포
- 공식 API 가격(대략): 입력 1M 토큰당 $0.14(캐시 미스), 캐시 적중 시 약 $0.0028–0.03, 출력 1M 토큰당 $0.28. 높은 동시성 한도.
- MIT 라이선스로 Hugging Face에서 오픈 가중치 공개; 로컬/자가 호스팅을 위한 양자화 GGUF 버전 광범위 제공(상당한 VRAM 필요 — 풀 프리시전은 큼).
- 추측 디코딩(DSpark)과 하이브리드 어텐션이 장문 컨텍스트 추론의 효율을 비교적 높게 유지.
- 지원 추론 엔진: vLLM, SGLang 및 기타(문서화된 레시피 제공).
다수 팀에 가장 쉬운 프로덕션 경로는 OpenAI 호환 게이트웨이다. CometAPI는 단일 엔드포인트(https://api.cometapi.com/v1)를 통해 DeepSeek 모델(V4 시리즈 포함)과 수백 개의 다른 모델을 통합 접근할 수 있다. 장점은 단순화된 멀티 모델 라우팅, 직통 제공자 대비 경쟁력 있는 또는 할인된 가격, 사용량 분석, 애플리케이션 코드를 바꾸지 않고도 Flash, Pro, 기타 모델 간 전환이 가능하다는 점이다. 이는 난이도/비용에 따라 폴백 또는 라우팅이 필요한 에이전트 시스템에 특히 유용하다.
이 글 작성 시점 기준, CometAPI의 DeepSeek V4 Flash는 비교 표에서 입력 1M 토큰당 시작 가격 $0.12, 출력 1M 토큰당 $0.24, 최근 24시간 가동률 100.0%, 관측 응답 2941 ms로 표시되었다. DeepSeek은 전체 API 가격이 가까운 시일 내 인상될 수 있음을 경고하기도 했다. 공급자 가격은 변동 가능하므로, 프로덕션 예산 확정 전 CometAPI의 라이브 카탈로그와 DeepSeek의 공식 가격을 확인하는 것이 안전하다.
개발자와 팀을 위한 실무 권장사항
- 에이전트 코딩에는 우선 Flash-0731로 시작 — 터미널, 리포지토리, 멀티 도구 워크플로우에서 비용/성능 비가 뛰어나다. 가장 어려운 작업에는 최대 추론 노력 + Harness 스타일 루프를 사용.
- 로컬 추론은 Hugging Face에서 다운로드하고 DSpark를 활성화하는 공식 vLLM/SGLang 레시피를 따를 것.
- Codex를 이미 사용하거나 최신 도구 호출 의미론이 필요하다면 Responses API로 통합.
- 비용 통제와 데이터 프라이버시 극대화를 위해 자가 호스팅 또는 양자화 가중치 사용.
- 지능적으로 라우팅 — 볼륨 작업은 Flash, 초난도 롱테일은 Pro(또는 다른 대형 모델).
- 스택이 이미 DeepSeek과 다른 공급자를 혼용한다면 CometAPI로 멀티 모델 접근을 단순화.
결론
DeepSeek-V4-Flash-0731은 효율적인 에이전트형 AI의 분기점이라 할 만하다. 비교적 컴팩트한 MoE(활성 13B)에서 집중 사후 학습을 통해 프런티어급 에이전트 성능을 제공하고, 목적 구축된 Harness와 현대적 API 호환성(Responses + Codex)을 결합함으로써, 비용 효율적인 코딩 및 자동화 에이전트의 기준을 새로 세웠다.
오픈 가중치를 로컬로 호스팅하든, 공식 API를 호출하든, CometAPI 같은 통합 게이트웨이를 거치든, V4-Flash-0731 + 진화 중인 Harness 생태계는 차세대 AI 에이전트의 고성능·고효율 기반을 제공한다.
FAQs
DeepSeek V4 Flash 0731이란?
DeepSeek V4 Flash 0731은 DeepSeek API에서 공개된 DeepSeek V4 Flash의 공식 퍼블릭 베타 릴리스로, 2026년 7월 31일 변경 로그에서 발표되었다. 프리뷰 버전을 대체하지만 API의 모델 이름 deepseek-v4-flash는 그대로 유지된다.
DeepSeek V4 Flash 0731의 새로운 점은?
주요 변화는 더 강력해진 에이전트 벤치마크 성능, 네이티브 Responses API 지원, Codex 적응, 재사후 학습된 공식 V4 Flash 빌드다. 모델 아키텍처와 크기는 프리뷰와 동일하다고 DeepSeek은 밝혔다.
DeepSeek V4 Flash 0731은 Codex를 지원하나?
예. DeepSeek의 Codex 가이드에 따르면 현재 Codex 통합은 deepseek-v4-flash만 지원한다. Responses API를 통해 작동하며, Codex CLI, ChatGPT 데스크톱 앱, VS Code용 Codex IDE 확장에서 구성 가능하다.
DeepSeek Harness란?
DeepSeek Harness는 언어 모델을 자율 코딩 또는 워크플로우 에이전트로 전환하는 DeepSeek의 에이전트 프레임워크다. 하네스는 도구, 컨텍스트, 파일, 명령 실행, 다단계 워크플로우를 관리하는 레이어로 설명되며, V4 Flash 0731 벤치마크 설정에 Harness minimal 모드를 사용했다.
CometAPI를 통해 DeepSeek V4 Flash에 접근하려면?
CometAPI의 OpenAI 호환 엔드포인트에서 모델 ID를 deepseek-v4-flash로 사용한다. CometAPI 모델 페이지에는 /v1/chat/completions에 대한 cURL, Python, JavaScript 예제와 모델 사양, 가격, 가동률 정보가 제공된다.
DeepSeek V4 Flash가 DeepSeek V4 Pro보다 더 좋은가?
7월 31일 벤치마크 표에서는 V4 Flash 0731이 열거된 에이전트 벤치마크 전반에서 V4-Pro Preview를 앞선다. 이것이 Flash가 항상 Pro보다 낫다는 뜻은 아니다. Pro는 더 크며, 모델 카드에서처럼 지식 집약 및 난도 높은 추론 작업에서 우위를 유지하는 경우가 많다. 비용 민감 에이전트 워크플로우의 기본값으로는 Flash를 사용하고, 초난도 작업은 Pro로 승격하는 전략을 권장한다.
