DeepSeek-V4-Flash의 기술 사양
| 항목 | 상세 |
|---|---|
| 모델 | DeepSeek-V4-Flash |
| 제공자 | DeepSeek |
| 제품군 | DeepSeek-V4 프리뷰 시리즈 |
| 아키텍처 | Mixture-of-Experts (MoE) |
| 총 파라미터 수 | 284B |
| 활성화 파라미터 수 | 13B |
| 컨텍스트 길이 | 1,000,000 토큰 |
| 정밀도 | FP4 + FP8 혼합 |
| 추론 모드 | Non-think, Think, Think Max |
| 출시 상태 | 프리뷰 모델 |
| 라이선스 | MIT 라이선스 |
DeepSeek-V4-Flash란?
DeepSeek-V4-Flash는 DeepSeek의 V4 시리즈에서 효율성에 초점을 맞춘 프리뷰 모델입니다. 이 모델은 규모 대비 활성 파라미터 풋프린트가 비교적 작은 Mixture-of-Experts 언어 모델로 설계되어, 100만 토큰 컨텍스트 윈도우를 지원하면서도 높은 응답성을 유지하도록 돕습니다.
DeepSeek-V4-Flash의 주요 기능
- 백만 토큰 컨텍스트: 1,000,000 토큰 컨텍스트 윈도우를 지원하여 매우 긴 문서, 대형 코드베이스, 다단계 에이전트 세션에 적합합니다.
- 효율 우선 MoE 설계: 총 284B 파라미터를 갖지만 요청당 활성화되는 파라미터는 13B에 불과하여, 더 빠르고 효율적인 추론을 목표로 합니다.
- 세 가지 추론 모드: 작업이 어려워질수록 Non-think, Think, Think Max를 통해 속도와 더 깊은 추론 간의 균형을 조절할 수 있습니다.
- 강력한 장문맥 아키텍처: V4 시리즈는 장문맥 효율을 높이기 위해 Compressed Sparse Attention과 Heavily Compressed Attention을 결합했다고 DeepSeek는 밝힙니다.
- 경쟁력 있는 코딩·에이전트 성능: 모델 카드에 따르면 HumanEval, SWE Verified, Terminal Bench 2.0, BrowseComp 등 코딩 및 에이전트 벤치마크에서 우수한 결과를 보였습니다.
- 오픈 가중치와 로컬 배포: 모델 가중치, 로컬 추론 가이드, MIT 라이선스를 포함해 자가 호스팅과 실험을 용이하게 합니다.
DeepSeek-V4-Flash의 벤치마크 성능
공식 모델 카드에서 발췌한 결과에 따르면, DeepSeek-V4-Flash는 여러 핵심 벤치마크에서 DeepSeek-V3.2-Base 대비 향상된 성능을 보입니다:
| 벤치마크 | DeepSeek-V3.2-Base | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base |
|---|---|---|---|
| AGIEval (EM) | 80.1 | 82.6 | 83.1 |
| MMLU (EM) | 87.8 | 88.7 | 90.1 |
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
추론·에이전트 평가에서도 Flash 계열은 터미널 및 소프트웨어 과제에서 견조한 성적을 보였으며, Flash Max는 Terminal Bench 2.0에서 56.9, SWE Verified에서 79.0을 기록했습니다. 다만 지식 의존도가 높고 난도가 큰 에이전트 과제에서는 더 큰 Pro 모델에 비해 다소 뒤처집니다.
DeepSeek-V4-Flash vs DeepSeek-V4-Pro vs DeepSeek-V3.2
| 모델 | 최적 용도 | 트레이드오프 |
|---|---|---|
| DeepSeek-V4-Flash | 고속 처리, 장문맥 작업, 코딩 어시스턴트, 고처리량 에이전트 플로우 | 순수 지식 과제와 가장 복잡한 에이전트 과제에서 Pro에 다소 뒤처짐 |
| DeepSeek-V4-Pro | 최고 난도 과제, 더 깊은 추론, 복잡한 에이전트 워크플로 | Flash보다 무겁고 효율성 측면에서 불리함 |
| DeepSeek-V3.2 | 비교 및 마이그레이션 계획을 위한 구형 베이스라인 | 공식 표에서 V4-Flash보다 낮은 벤치마크 성능 |
DeepSeek-V4-Flash의 대표적 사용 사례
- 계약서, 연구 자료 묶음, 지원 지식 베이스, 내부 위키용 장문서 분석
- 대형 저장소를 탐색하고 여러 파일에 걸친 지시를 따르며 긴 컨텍스트를 유지하는 코딩 어시스턴트
- 추론·도구 호출·반복을 수행하면서 맥락을 잃지 않는 에이전트 워크플로
- 초대형 컨텍스트 윈도우와 저마찰 배포의 이점을 누리는 엔터프라이즈 채팅 시스템
- 프로덕션 강화 이전에 DeepSeek-V4 동작을 평가하려는 팀의 로컬 프로토타입 배포
Deepseek v4 Flash API에 접근하고 사용하는 방법
1단계: API 키 신청
cometapi.com에 로그인하세요. 아직 사용자가 아니라면 먼저 가입하세요. CometAPI 콘솔에 로그인합니다. 인터페이스의 액세스 자격 증명인 API 키를 발급받습니다. 개인 센터의 API 토큰에서 “Add Token”을 클릭해 토큰 키: sk-xxxxx를 발급받아 제출합니다.
2단계: deepseek v4 flash API로 요청 보내기
“deepseek-v4-flash” 엔드포인트를 선택하여 API 요청을 보내고 요청 본문을 설정하세요. 요청 메서드와 요청 본문은 웹사이트의 API 문서에서 확인할 수 있습니다. 편의를 위해 Apifox 테스트도 제공합니다. 계정의 실제 CometAPI 키로 <YOUR_API_KEY>를 바꾸세요. 어디에서 호출하는가: Anthropic Messages 형식 및 Chat 형식.
질문이나 요청을 content 필드에 입력하면 모델이 여기에 응답합니다. API 응답을 처리하여 생성된 답변을 얻으세요.
3단계: 결과 수신 및 검증
API 응답을 처리하여 생성된 답변을 얻으세요. 처리 후, API는 작업 상태와 출력 데이터를 반환합니다. 표준 파라미터를 통해 스트리밍, 프롬프트 캐싱, 장문맥 처리 등의 기능을 활성화하세요.