TL;DR: 전통적인 코딩 루프와 대규모 배치 처리용 초고속 저지연 텍스트 자동화가 필요하면 DeepSeek-V4-Flash를 선택하세요. 네이티브 멀티모달, 우수한 에이전트 벤치마킹, 고효율 장문맥 프라이빗 서버 호스팅이 필요하면 GLM-5.3-Flash를 선택하세요. 두 모델 모두 MIT License**** 하의 오픈 웨이트를 제공하며 관대한 MIT License로 배포됩니다.
DeepSeek-V4-Flash**** 는 전통적 코딩 루프와 대규모 배치 처리에 적합한 초고속·고처리량 텍스트 전용 API를 원할 때 더 나은 선택입니다. Artificial Analysis Intelligence Index에서 50점을 기록했으며, 통합 DSpark 스펙큘러티브 디코딩 엔진을 사용해 초당 최대 122+ 토큰을 생성합니다. 또한 비혼잡 시간대 API 요금이 백만 입력/출력 토큰당 각각 $0.22/$0.66까지 낮습니다.
GLM-5.3-Flash 는 네이티브 멀티모달, 비주얼-인-더-루프 프로그래밍, 고효율 자체 확장이 필요한 경우 더 다재다능한 선택입니다. Artificial Analysis Intelligence Index에서 57점을 기록했으며, 하이브리드 선형-스파스 어텐션 메커니즘(KDA + NoPE Sparse MLA)을 활용해 1M 컨텍스트에서 KV Cache 메모리를 4.44× 절감하고 네이티브 시각 추론을 제공합니다. API 가격은 입력/출력 백만 토큰당 $0.15/$0.50로 매우 경쟁력이 있으며(프로모션 시 $0.075/$0.25로 인하) 합니다.
핵심 요점
- DeepSeek-V4-Flash는 DeepSeek API News Announcement에서 초기 프리뷰를 거쳐 Hugging Face에서 공식 출시되며 Token-wise Compression, DeepSeek Sparse Attention(DSA), DSpark 스펙큘러티브 디코딩을 도입해 생성 속도를 향상했습니다.
- GLM-5.3-Flash는 August 26, 2026, 에 출시되었으며, OpenRouter에서 "Ox Alpha"라는 코드명으로 익명 테스트 단계에서 폭넓은 인기를 얻었습니다.
- GLM-5.3-Flash는 Artificial Analysis Intelligence Index에서 57점을 기록해 DeepSeek-V4-Flash-0731의 50점을 앞서며, 복잡한 추론과 에이전트 작업에서 전반적인 능력이 더 강합니다.
- 두 아키텍처 모두 추론 시 매우 슬림한 연산 풋프린트를 갖춘 Mixture-of-Experts(MoE) 모델입니다. DeepSeek는 토큰당 284B 중 13B 파라미터를, GLM은 320B 중 18B를 활성화합니다.
- 두 모델 모두 MIT License 하의 완전한 오픈 웨이트로 배포되어 기업 상용화, 맞춤 파인튜닝, 온프레미스 배포에 최대 자유를 제공합니다.
DeepSeek-V4-Flash vs GLM-5.3-Flash: 빠른 비교
| 사양 | DeepSeek-V4-Flash-0731 | GLM-5.3-Flash |
|---|---|---|
| 개발사 | DeepSeek-ai | Z.ai (Zhipu AI) |
| 출시일 | July 31, 2026 | August 26, 2026 |
| 모델 ID | deepseek-v4-flash | glm-5.3-flash |
| Hugging Face 저장소 | deepseek-ai/DeepSeek-V4-Flash | zai-org/GLM-5.3-Flash |
| 아키텍처 | MoE; DSA + Token-wise Compression | MoE; KDA + NoPE Sparse MLA + mHC |
| 전체 파라미터 | 284B (DSpark 모듈 포함 시 304B) | 320B |
| 활성 파라미터 | 토큰당 13B | 토큰당 18B |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,048,576 / 약 1M tokens |
| 입력 / 출력 | Text → Text | Text + Image + Video + File → Text |
| 추론 모드 | Configurable (Thinking / Non-Thinking) | Three-level (Low / High / Max) |
| 함수/툴 사용 | JSON Schema / Tool Calls | ToolCalls, constraints, dynamic tool loading |
| 오픈 웨이트 | Yes (MIT License) | Yes (MIT License) |
| AA Intelligence Index | 50 | 57 |
| 공식 가격(백만 토큰당) | 피크: $0.44 / $1.32 <br> 비혼잡: $0.22 / $0.66 | 리스트: $0.15 / $0.50 <br> 프로모: $0.075 / $0.25 |
| 최적 용도 | 고처리량 에이전트, 빠른 텍스트 생성 | 비주얼 프로그래밍, 맞춤 온프레미스 배포 |
DeepSeek-V4-Flash란?
DeepSeek-V4-Flash는 자율 개발자 에이전트와 대규모 텍스트 처리 파이프라인을 지원하도록 설계된 경량의 초고속 MoE 모델입니다. 원래 DeepSeek API News Announcement에서 프리뷰된 후, Hugging Face에서 DeepSeek-V4-Flash-0731로 공식 출시되며 사후학습 업그레이드를 크게 반영했습니다.
이 모델은 순수 텍스트 처리량, 구조화된 API 호출, 빠른 프로그램 코드 실행에 최적화되어 있습니다. 지연 시간과 토큰별 추론 비용을 최소화하여 속도와 실행 비용이 중요한 다회전 소프트웨어 개발 루프를 겨냥합니다.
프리뷰에서 무엇이 바뀌었나?
공식 0731 버전에는 선택형 공동 학습 스펙큘러티브 드래프팅 모델이 포함되어 로컬 파라미터 총량이 304B로 증가했습니다. 호스팅 시 이 스펙큘러티브 디코딩 프레임워크(DSpark)는 활성 13B 경로와 함께 작동하여 생성 속도를 초당 122.7 토큰까지 가속합니다.
또한 정렬(alignment) 과정이 샌드박스 실행 환경에서 강화학습(RL)로 대대적으로 재학습되어, 다단계 터미널 작업, 셸 스크립팅, 구조화된 도구 사용에서 훨씬 더 높은 신뢰성을 제공합니다.
DeepSeek-V4-Flash 사양
| 속성 | DeepSeek-V4-Flash-0731 |
|---|---|
| 컨텍스트 | 1,000,000 tokens |
| 모달리티 | 텍스트 입력; 텍스트 출력(표준 모델) |
| 추론 | Non-thinking 및 Thinking 모드 지원 |
| 네이티브 API 기능 | JSON Output, Tool Calls, Responses API |
| 지식 컷오프 | 비공개 |
| 표준 가격(백만 토큰당) | 피크: $0.44 Input / $0.014 Cached / $1.32 Output <br> 비혼잡: $0.22 Input / $0.007 Cached / $0.66 Output |
GLM-5.3-Flash란?
GLM-5.3-Flash는 Z.ai의 대표적인 오픈 웨이트 멀티모달 MoE 모델입니다. Z.ai Blog에서 August 26, 2026에 공식 소개되었으며, 표준 "Flash" 등급 비용으로 매우 복잡한 에이전트 실행, 자동화된 웹 탐색, 시각 문서 추론을 수행하도록 설계되었습니다. 웨이트는 Hugging Face에서 공개적으로 이용 가능합니다.
이 모델은 방대한 30조 토큰 멀티모달 데이터셋으로 사전학습되어 시각 입력이 나중에 덧붙여진 기능이 아니라 네이티브 모달리티입니다. 타깃은 소프트웨어 엔지니어링, 로보틱 프로세스 자동화, 멀티모달 데이터베이스 질의입니다.
하이브리드 어텐션, mHC 및 스파스 MoE 스케일링
GLM-5.3-Flash는 세 가지 아키텍처 기둥으로 차별화됩니다:
- Hybrid Attention: Z.ai Blog에 설명된 바와 같이, 모델은 Kimi Delta Attention(KDA)과 NoPE Sparse MLA(Multi-head Latent Attention with No Positional Encoding)를 결합합니다. 이 하이브리드 어텐션 레이어는 키와 값의 프로젝션 크기를 압축하여, 1M 컨텍스트 평가 중 KV Cache 저장을 4.44×, 어텐션 계산을 3.01× 줄입니다.
- Stable LatentMoE: 총 896명의 전문가를 운영하며 토큰당 정확히 16명을 활성화하여, 전문가 라우팅 붕괴를 피하고 긴 다단계 추론 트레이스 동안 안정성을 유지합니다.
- Manifold-Constrained Hyper-Connections (mHC): 45-레이어 구조 전반의 깊은 그래디언트를 안정화하여, 분산 GPU 클러스터 또는 로컬 AI 칩에서 실행 시 하드웨어 성능을 최적화합니다.

GLM-5.3-Flash: 극대 효율을 위한 아키텍처 출처: z.ai
GLM-5.3-Flash 사양
| 속성 | GLM-5.3-Flash |
|---|---|
| 전체 / 활성 파라미터 | 320B / 18B |
| 아키텍처 | 하이브리드 스파스 & 선형 어텐션을 갖춘 MoE |
| 전문가 | 총 896; 토큰당 16 활성화 |
| 컨텍스트 | 1,048,576 tokens (~1M) |
| 비전 | 네이티브 멀티모달(텍스트, 이미지, 비디오, 문서 파일) |
| 추론 | Low, High, Max thinking 모드 지원 |
| 도구 | ToolCalls, constraints, dynamic tool loading |
| 오픈 웨이트 | Hugging Face에서 제공(MIT License) |
| 공식 가격(백만 토큰당) | 리스트: $0.15 Input / $0.03 Cached / $0.50 Output <br> 프로모(9월 9일 종료): $0.075 Input / $0.015 Cached / $0.25 Output |
DeepSeek-V4-Flash vs GLM-5.3-Flash: 기능 비교
아키텍처와 파라미터 효율성
DeepSeek-V4-Flash는 토큰당 13B 활성 경로와 함께 공동 학습 스펙큘러티브 드래프팅 모델을 포함하는 284B 전체 파라미터 아키텍처(로컬 배포 시 304B)를 운영합니다. GLM-5.3-Flash는 고도로 스파스한 45-레이어 레이아웃 전반에 320B 전체 파라미터(토큰당 18B 활성)를 사용합니다. 두 모델 모두 토큰당 활성 파라미터가 매우 적어, 훨씬 작은 모델의 높은 속도를 유지하면서도 대형 모델의 풍부한 지식 표현을 보유합니다.
어텐션 메커니즘과 메모리 최적화
DeepSeek-V4-Flash는 DeepSeek Sparse Attention(DSA)과 Token-wise Compression을 사용합니다. 긴 프롬프트 처리 중 시퀀스 구조를 동적으로 분석하고 중복 토큰(예: 보일러플레이트 코드 구조나 반복적인 시스템 헤더)을 압축합니다.
GLM-5.3-Flash는 선형 KDA와 잠재 프로젝션(NoPE Sparse MLA)을 결합합니다. 이는 키/값 압축 블록에서 명시적 포지셔널 인코딩을 제거하여, 물리적 KV 캐시의 메모리 풋프린트를 전통적 레이아웃의 22.5%까지 줄입니다. 이를 통해 메모리가 제한된 클러스터에서도 장문맥 워크로드에서 훨씬 높은 동시성을 지원할 수 있습니다.
모달리티와 멀티모달 깊이
DeepSeek-V4-Flash-0731은 텍스트 전용 모델입니다. 기술 파일, JSON 스키마, 구조적 마크다운을 해석하는 데 뛰어납니다. 시각적 파싱 작업을 위해서는 별도의 멀티모달 실험 모델(deepseek-v4-flash-vision-exp)을 사용해야 합니다.
GLM-5.3-Flash는 네이티브 멀티모달입니다. 고해상도 이미지, 비디오, 복잡한 오피스 문서 파일(PDF, PPTX, 스프레드시트)을 직접 수용합니다. 이 네이티브 멀티모달은 "visual-in-the-loop" 소프트웨어 개발을 지원하여, 모델이 렌더링된 UI 레이아웃을 검사하고 정렬 문제를 찾아 수동 개입 없이 자체적으로 코드를 반복적으로 수정할 수 있게 합니다.
라이선스와 개방성
두 모델 모두 매우 관대한 MIT License로 배포됩니다. 이는 기업 개발자가 모델 웨이트를 로컬, 프라이빗 VPC 내, 또는 에어갭 온프레미스 클라우드 인프라 내에서 수정, 배포, 서브라이선스, 상용 배포할 수 있는 완전한 자유를 제공합니다.
DeepSeek-V4-Flash vs GLM-5.3-Flash: 벤치마크 비교
동일한 테스트 하니스 하에서 동일한 데이터셋으로 평가했을 때, 두 모델 모두 소프트웨어 엔지니어링과 에이전트 자동화 작업에서 경쟁력 있는 성능을 보입니다.
코딩 및 에이전틱 성능
| 벤치마크 | GLM-5.3-Flash (Z.ai) | DeepSeek-V4-Flash-0731 |
|---|---|---|
| Artificial Analysis Index v4.1.1 | 57 | 50 |
| Terminal Bench 2.1 (Acc) | 84.3 | 82.7 |
| DeepSWE v1.1 (GitHub Issues) | 63.4 | 54.4 |
| Toolathlon (Verified / Pass@1) | 78.4 | 70.3 |
| NL2Repo (Acc) | 56.3 | 54.2 |
| Automation Bench (Acc) | 48.8 | 25.1 |
| GDPval-AA v2 (Agent Elo) | 1773 | 1554 |
GLM-5.3-Flash는 대부분의 에이전틱 및 소프트웨어 엔지니어링 벤치마크에서 우위를 유지하며, DeepSWE v1.1에서 63.4%, Terminal Bench 2.1에서 84.3점을 기록합니다. 토큰당 18B 활성 경로와 다회전 사후 정렬은 복잡한 리포지토리 추적과 운영체제 상호작용을 처리하는 데 도움을 줍니다.

GLM-5.3-Flash 벤치마크: Terminal Bench 2.1에서 84.3점 출처: z.ai
DeepSeek-V4-Flash-0731 역시 매우 유능하며, Terminal Bench 2.1에서 82.7점, Toolathlon에서 70.3점을 기록합니다. 결정적 API 구조와 엄격한 함수 호출에서 신뢰성 있는 성능을 제공합니다.

DeepSeek-V4-Flash Benchmark 0731: Terminal Bench 2.1에서 82.7점 출처: Hugging Face
멀티모달 및 시각 추론
GLM-5.3-Flash의 네이티브 멀티모달 학습은 시각 추론 작업에서 뚜렷한 우위를 제공합니다:
- OfficeQA Pro: 62.4(GLM-5.3-Flash) vs 57.9(DeepSeek-V4-Vision 실험 브랜치). GLM은 내장 이미지, 구조화된 PDF 테이블, 슬라이드 덱의 네이티브 파싱에서 우수함을 보여줍니다.
- Chartography with Tools: 78.0(GLM-5.3-Flash). 시스템 플로차트, 와이어프레임 다이어그램, 청구서 스캔을 탁월하게 수용하여 이를 직접 실행 가능한 시스템 로직으로 변환합니다.
속도와 지연
- 생성 속도: DeepSeek-V4-Flash-0731가 더 빠르며, 스펙큘러티브 디코딩 프레임워크의 도움으로 표준 엔터프라이즈 클라우드 엔드포인트에서 평균 초당 122.7 토큰의 출력 속도를 달성합니다.
- Time to First Token (TTFT): GLM-5.3-Flash는 1.21초로 더 낮은 TTFT를 보이며, DeepSeek-V4-Flash의 3.0초 이상과 비교해 실시간 사용자 대면 채팅 애플리케이션에서 더 민첩하게 느껴집니다.
DeepSeek-V4-Flash vs GLM-5.3-Flash: API 가격
두 모델 모두 매우 비용 효율적인 가격 모델을 제공하여 전통적인 덴스 아키텍처와 비교해 매우 경쟁력이 있습니다.
공식 API 리스트 가격(백만 토큰당)
| 가격 레이어 | DeepSeek-V4-Flash-0731 (피크) | DeepSeek-V4-Flash-0731 (비혼잡) | GLM-5.3-Flash (표준) | GLM-5.3-Flash (프로모 - 9월 9일까지) |
|---|---|---|---|---|
| 입력 가격(Cache Miss) | $0.44 | $0.22 | $0.15 | $0.075 |
| 입력 가격(Cache Hit) | $0.014 | $0.007 | $0.03 | $0.015 |
| 출력 가격 | $1.32 | $0.66 | $0.50 | $0.25 |
비혼잡 시간대에는 DeepSeek-V4-Flash-0731가 매우 경제적이며, 입력 비용은 $0.22/MTok, 출력 비용은 $0.66/MTok, 캐시된 입력 비용은 $0.007/MTok까지 떨어집니다.
GLM-5.3-Flash는 피크 시간대 할증 없이 표준 균일 요금(입력 $0.15 / 출력 $0.50)을 제공합니다. 프로모션 요금(2026년 9월 9일까지)은 입력과 출력을 각각 $0.075, $0.25로 낮춰 대규모 마이그레이션과 벌크 처리에 탁월한 선택지가 됩니다.
강점과 약점
DeepSeek-V4-Flash-0731
- 강점:
- 탁월한 생성 속도: 공동 학습 스펙큘러티브 드래프팅 모델(DSpark)을 사용해 초당 최대 122.7 토큰을 생성합니다.
- 비혼잡 경제성: 백만 토큰당 입력 $0.22, 출력 $0.66의 매우 저렴한 비혼잡 진입 요금을 제공합니다.
- 강력한 CPU 양자화 지원: 성숙한 GGUF 통합 경로를 보유하고 있어, CPU 기반 로컬 런타임과 개인 시스템 메모리 제약에 매우 최적화되어 있습니다.
- 트레이드오프:
- 피크 시간대 요금 변동성: 피크 시간대에는 API 가격이 두 배(0.44/1.32 per MTok)로 상승합니다.
- 텍스트 전용 코어 웨이트: 표준 웨이트는 시각 추론, 이미지, 비디오를 네이티브로 지원하지 않습니다.
- TTFT 오버헤드: GLM과 비교해 더 긴 Time to First Token(TTFT)을 보입니다.
GLM-5.3-Flash
- 강점:
- 최상급 지능: Artificial Analysis Index에서 57점의 매우 경쟁력 있는 성과를 달성했습니다.
- 네이티브 Vision-in-the-Loop: 이미지와 비디오 처리를 사후 정렬에 직접 통합하여, 프런트엔드 웹 코드의 시각 평가를 가능하게 합니다.
- 탁월한 캐시 절감: 하이브리드 선형 KDA와 NoPE MLA 레이어가 메모리 사용을 4.44× 줄여 로컬 동시성을 높입니다.
- 균일 장문맥 요금: 표준 가격이 1M 토큰까지 균일하며 업계 최저 수준의 캐시 히트 요금($0.03 표준, $0.015 프로모)을 제공합니다.
- 트레이드오프:
- 더 느린 토큰 출력: 순수 생성 속도는 DeepSeek의 전용 스펙큘러티브 디코딩 엔진보다 느립니다.
- 하드웨어 요구사항: 높은 스파시티에도 불구하고 전체 320B 파라미터 MoE 구조의 로컬 호스팅에는 멀티 노드 GPU 환경이 필요합니다.
| 모델 | 강점 | 트레이드오프 |
|---|---|---|
| DeepSeek-V4-Flash | 빠른 생성(Artificial Analysis에서 122.7 tok/s); 매우 저렴한 비혼잡 가격; 성숙한 텍스트 양자화 생태계; CPU 기반 로컬 GGUF에 고도로 최적화. | 피크 시간대 요금 변동; 텍스트 전용 베이스 모델(네이티브 비전 없음); 느린 TTFT. |
| GLM-5.3-Flash | AA Intelligence에서 57점; 네이티브 멀티모달 파싱; 4.44× KV 캐시 압축; 균일 가격; 빠른 TTFT(1.21s); MIT 라이선스. | DeepSeek보다 다소 느린 순수 토큰 생성 속도; 로컬 멀티 노드 배포가 하드웨어 집약적. |
DeepSeek-V4-Flash vs GLM-5.3-Flash: 무엇을 선택할까?
| 사용 사례 | 추천 모델 | 이유 |
|---|---|---|
| 기본 프런티어 API | GLM-5.3-Flash | 인텔리전스 지수(57)에서 더 높은 점수, 다단계 에이전트 벤치마크에서 우위. |
| 장시간 실행 텍스트 에이전트 | DeepSeek-V4-Flash | 122+ tok/s의 폭발적 생성 속도로 대규모 텍스트/코드 생성에 매우 효율적. |
| 비주얼 코딩/UX 워크플로우 | GLM-5.3-Flash | 네이티브 멀티모달 설계로 visual-in-the-loop 디버깅과 UI 렌더링 분석 지원. |
| 프라이빗/자가 관리 VPC | GLM-5.3-Flash | MIT 라이선스와 KDA + NoPE MLA 압축으로 하드웨어 VRAM 요구를 4.44× 절감. |
| 로컬 CPU 전용 실행 | DeepSeek-V4-Flash | 더 강력한 로컬 GGUF 양자화 지원(극단적 1-bit 또는 3-bit 실행 시 92GB 통합 메모리). |
| 낮은 피크 출력 비용 | GLM-5.3-Flash | 표준 출력 가격 $0.50/MTok가 균일하며 DeepSeek의 $1.32 피크 출력가보다 저렴. |
| 강력한 프롬프트 캐싱 | DeepSeek-V4-Flash | 비혼잡 캐시 히트가 백만 토큰당 $0.007로 매우 저렴. |
Cometapi로 DeepSeek-V4-Flash와 GLM-5.3-Flash를 사용하는 이유
두 모델은 CometAPI에 완전 통합되어 있습니다. 개발자는 DeepSeek-V4-Flash에 accessDeepSeek-V4-Flash, 그리고 Chat Completions / Responses 스타일 접근에 대한 지원과 GLM-5.3-Flash model page가 통합된 CometAPI 엔드포인트를 통해 GLM-5.3-Flash를 노출합니다. 이는 인증과 대부분의 애플리케이션 배관을 그대로 두고 모델 ID만 전환하여 A/B 테스트를 더 쉽게 만듭니다.
결론
DeepSeek-V4-Flash-0731와 GLM-5.3-Flash의 도입은 장문맥, 스파스 MoE 모델 배포의 경제성을 바꾸어 놓았습니다. 두 아키텍처 모두 매우 낮은 가격대에서 높은 지능을 제공합니다.
DeepSeek-V4-Flash-0731는 스펙큘러티브 디코딩과 로컬 CPU 기반 양자화에서 뛰어난 원시 생성 처리량으로 텍스트와 코드 엔진에 매우 최적화되어 있습니다. GLM-5.3-Flash는 멀티모달 및 에이전트 기반 워크플로우에서 큰 도약을 보여주며, 저지연 시각 추론과 온프레미스 호스팅을 고효율로 만드는 하이브리드 어텐션 메커니즘을 결합합니다.
FAQs
GLM-5.3-Flash의 익명 테스트 이름은 무엇이었나요?
공식 출시 전에 GLM-5.3-Flash는 OpenRouter와 OpenCode에서 "Ox Alpha"라는 코드명으로 익명 테스트되었으며, 개발자들 사이에서 빠르게 인기 있는 모델이 되었습니다.
일반 개인용 컴퓨터에서 이 모델들을 로컬로 실행할 수 있나요?
예, 두 모델 모두 오픈 웨이트이며 Hugging Face에서 이용할 수 있습니다. 그러나 파라미터 크기 때문에 로컬 호스팅에는 상당한 통합 메모리가 필요합니다:
- DeepSeek-V4-Flash-0731: 극단적 1-bit 양자화에는 약 92GB RAM이 필요합니다. 3-bit 양자화 실행을 강력히 권장하며 110–135GB RAM이 필요합니다.
- GLM-5.3-Flash: 극단적 1-bit 양자화에는 약 100GB RAM이 필요하며, 3-bit 실행은 128GB–150GB 통합 시스템 메모리에서 최적 성능을 발휘합니다.
DeepSeek-V4-Flash는 시각 또는 비디오 처리를 지원하나요?
아니요, 표준 DeepSeek-V4-Flash-0731는 텍스트 전용 모델입니다. 시각 작업에는 별도의 멀티모달 실험 모델(deepseek-v4-flash-vision-exp)을 사용해야 합니다.
GLM-5.3-Flash에서 "visual-in-the-loop" 프로그래밍은 어떻게 작동하나요?
모델이 네이티브 시각·이미지 이해를 갖추고 있기 때문에, 프런트엔드 코드를 작성하고 렌더링된 시각 출력을 검토하며, 레이아웃 또는 스타일 오류를 찾아 사람이 텍스트로 설명하지 않아도 그 버그를 수정하도록 코드를 다시 작성할 수 있습니다.
프롬프트 캐싱은 이들 모델에서 비용을 어떻게 절감하나요?
같은 큰 컨텍스트(예: 코드베이스나 문서 컬렉션)를 여러 API 호출에 걸쳐 전송하는 경우, 두 모델 모두 이 프롬프트를 캐시할 수 있습니다. 이후 호출에서는 "캐시 히트" 요금만 청구되며, DeepSeek-V4-Flash(비혼잡)는 백만 토큰당 $0.007, GLM-5.3-Flash(프로모)는 $0.015로 떨어져 API 비용을 크게 줄입니다.
