TL;DR Qwen 3.8 Max는 QwenCloud에서 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6의 비용이 듭니다. 모델별 캐시 요율은 암시적 캐시 적중 입력에 대해 $0.25/M, 명시적 캐시 생성에 $2.50/M, 명시적 캐시 읽기에 $0.17/M입니다.
동일한 표준 토큰 단가가 지원되는 1M 토큰 컨텍스트 윈도우 전체에 적용됩니다. 프롬프트가 클수록 더 많은 토큰을 포함하므로 비용이 늘어나는 것이지, 더 높은 장문맥 가격 구간으로 올라가서가 아닙니다.
정가 기준으로 Qwen 3.8 Max는 Qwen 3.7 Max보다 20% 저렴합니다. 다만 Qwen 3.7 Max는 현재 50% 프로모션이 유지되는 동안 더 저렴합니다. 더 나은 운영 선택은 추론, 캐시 적중, 도구 사용, 재시도, 지연 시간, 휴먼 리뷰를 포함한 승인된 작업당 비용에 따라 달라집니다.
Qwen 3.8 Max API 가격 한눈에 보기
| 항목 | 현재 공식 값 |
|---|---|
| 운영 모델 ID | qwen3.8-max |
| 공식 출시일 | August 3, 2026 |
| 아키텍처 | 총 2.4T 파라미터; 95B 활성 파라미터 |
| 표준 입력 가격 | $2 / 1M tokens |
| 표준 출력 가격 | $6 / 1M tokens |
| 암시적 캐시된 입력 | $0.25 / 1M tokens |
| 명시적 캐시 생성 | $2.50 / 1M tokens |
| 명시적 캐시 읽기 | $0.17 / 1M tokens |
| 컨텍스트 윈도우 | 1M tokens |
| 최대 입력 | 추론 비활성화 시 991K; 추론 활성화 시 983K |
| 최대 출력 | 131K |
| 최대 추론 | 262K |
| 입력 모달리티 | Text, image, and video |
| 출력 모달리티 | Text |
| QwenCloud 기준 제한 | 2M TPM and 15K RPM |
QwenCloud 모델 페이지는 현재의 모델 ID, 가격, 캐시 요율, 컨텍스트 제한, 모달리티에 대한 가장 직접적인 출처입니다. 계정 및 지역별 할당량은 다를 수 있으므로, 운영 동시성 설정 시에는 본인 콘솔에 표시된 제한을 사용하세요.
운영 릴리스는 프리뷰 식별자를 qwen3.8-max로 대체하고, 모델별 요금표를 완비합니다. Qwen의 출시 자료는 low, medium, xhigh 추론 강도 설정을 설명하지만, 실제 운영 동작은 사용 중인 엔드포인트와 API 레퍼런스를 기준으로 검증해야 합니다.
시간 민감 안내: Qwen은 API 릴리스 이후 오픈 웨이트를 제공하겠다고 발표했습니다. 2026년 8월 4일 기준, 공식 체크포인트와 라이선스가 공개되기 전에는 Qwen 3.8 Max를 다운로드 가능 또는 자체 호스팅 가능하다고 설명하지 마십시오.
Qwen 3.8 Max 가격 책정 방식
QwenCloud는 현재 Qwen 3.8 Max가 지원하는 1M 토큰 컨텍스트 윈도우 전체에 대해 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6의 단일 표준 단가를 게시하고 있습니다. 아래의 공식 가격 스냅샷은 2026년 8월 4일에 캡처되었으며, 운영 예산 결정을 내리기 전에는 항상 라이브 모델 페이지를 확인하세요.

출처***:*** QwenCloud, “Qwen3.8-Max” official
| 청구 항목 | 100만 토큰당 가격 | 적용 시점 |
|---|---|---|
| 표준 입력 | $2.00 | 신규 프롬프트 콘텐츠, 도구 정의, 캐시되지 않은 컨텍스트 |
| 표준 출력 | $6.00 | 생성된 출력 및 과금되는 추론 사용량 |
| 암시적 캐시 적중 | $0.25 | 자동으로 재사용된 프롬프트 프리픽스; 적중은 보장되지 않음 |
| 명시적 캐시 생성 | $2.50 | 재사용 가능한 표시된 프롬프트 프리픽스 생성 |
| 명시적 캐시 읽기 | $0.17 | 유효한 명시적 캐시 블록 재사용 |
따라서 900K 토큰 요청은 100K 토큰 요청보다 9배 더 많은 입력 토큰을 처리하기 때문에 비용이 더 들지, 더 높은 가격 구간을 넘어섰기 때문이 아닙니다.
추론은 출력 비용을 증가시킬 수 있음
짧은 가시적 답변이 항상 저비용 답변인 것은 아닙니다. 추론이 활성화된 호출은 추가 추론 토큰을 생성할 수 있으므로, 운영 견적은 가시적 응답 길이가 아니라 API가 반환하는 사용량 필드를 사용해야 합니다.
엔드포인트가 qwen3.8-max에 대해 추론 제어를 지원한다면 동일한 평가 세트에서 사용 가능한 설정을 비교하세요. 프리뷰 기본값이 GA 모델에 그대로 적용된다고 가정하지 마십시오.
캐시 절감 효과는 프롬프트 안정성에 좌우됨
Qwen 3.8 Max의 모델 페이지는 모델별 캐시 요율을 게시합니다. 지출을 추정할 때는 일반적인 캐시 비율이 아니라 이러한 요율을 사용하세요.
명시적 캐시 항목의 유효기간은 5분이며, 적중이 성공하면 해당 기간이 리셋됩니다. 암시적 캐싱은 자동이지만 적중이 보장되지는 않습니다. 시스템 프롬프트, 도구 정의, 저장소 컨텍스트, 대형 문서가 빈번한 호출 간에 안정적으로 유지되는 경우 캐싱이 가장 유용합니다.
내장 도구는 별도의 요금이 발생
QwenCloud는 현재 다음 도구 요금을 토큰 사용량과 별도로 게시하고 있습니다:
| 내장 도구 | 현재 요금 |
|---|---|
| 웹 검색 | $10 / 1K calls |
| 이미지 검색 | $8 / 1K calls |
| 웹 추출기 | Free for a limited time |
| 코드 인터프리터 | Free for a limited time |
함수 호출과 MCP에는 별도 도구 요금이 없지만, 도구 설명은 여전히 입력 토큰으로 계산됩니다. 무료 도구 프로모션은 변경될 수 있으므로, 운영 예산을 확정하기 전에 QwenCloud 가격 가이드를 확인하세요.
예를 들어, 20K 입력 토큰, 2K 출력 토큰, 웹 검색 2회가 포함된 요청의 비용은 대략 다음과 같습니다:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
이 예시에서 두 번의 검색 호출은 전체 요청 비용의 약 27.8%를 차지합니다.
Qwen 3.8 Max 실제 비용 예시
이 예시는 현재 QwenCloud의 모델별 요율을 사용합니다. 세금, 재시도, 폴백, 공급자별 마크업은 제외합니다.
예시 1: 중간 규모 에이전트 요청
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
첫 시도가 성공하면 비용은 약 $0.13입니다. 전체 재시도 한 번은 모델 비용을 대략 $0.26로 올립니다.
예시 2: 장문서 분석
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
현재 요금표에서는 별도의 장문맥 추가 요금이 적용되지 않지만, 프롬프트가 커지면 절대 비용은 크게 늘어납니다.
예시 3: 캐시된 에이전트 세션
재사용 가능한 100K 토큰 프리픽스, 신규 입력 10K 토큰, 출력 5K 토큰, 명시적 캐시가 유효한 동안 50회 호출을 가정:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
추정 절감액 = $8.917, 또는 71.3%
절감 효과는 캐시 적중 성공과 안정적인 프리픽스에 따라 달라집니다. 긴 공백이나 시스템 프롬프트 및 도구 스키마의 빈번한 변경은 효용을 낮춥니다.
Qwen 3.8 Max vs Qwen 3.7 Max:가격 비교
정가 기준으로 Qwen 3.8 Max는 Qwen 3.7 Max보다 20% 저렴하지만, 현재 50% 프로모션이 적용되는 동안에는 Qwen 3.7 Max가 37.5% 더 저렴합니다.
| 모델 및 가격 상태 | 입력 / 1M | 출력 / 1M | 컨텍스트 |
|---|---|---|---|
| qwen3.8-max standard price | $2.00 | $6.00 | 1M |
| qwen3.7-max list price | $2.50 | $7.50 | 1M |
| qwen3.7-max current promotion | $1.25 | $3.75 | 1M |
새 모델을 테스트하는 동안 폴백으로 CometAPI Qwen3.7 Max 모델 페이지를 유지하세요.
토큰당 가격은 결정 요소의 일부일 뿐입니다. Qwen 3.8 Max가 1차 성공률을 높이고, 도구를 더 안정적으로 사용하며, 재시도를 줄이거나, 휴먼 수정 필요성을 낮춘다면 더 경제적일 수 있습니다.
다음 운영 지표를 사용하세요:
승인된 작업당 비용 =
(모델 토큰 + 도구 호출 + 재시도 + 폴백 지출 + 리뷰 비용)
÷ 승인된 출력물
벤더가 보고한 벤치마크 향상은 까다로운 코딩 및 전문 워크플로를 재검증할 이유이지, 모든 Qwen 3.7 워크로드가 반드시 마이그레이션해야 한다는 증거는 아닙니다.
Qwen 3.8 Max로 마이그레이션하는 방법
모델 문자열 변경은 필요하지만, 그것만으로는 완전한 운영 마이그레이션이 아닙니다.
1. 운영 모델 ID를 테스트
테스트 환경에서 프리뷰 식별자를 qwen3.8-max로 교체하세요. 프리뷰 별칭, 기본값, 지연, 응답 동작이 변경되지 않을 것이라고 가정하지 마십시오.
최소 OpenAI 호환 요청은 다음과 같을 수 있습니다:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
문서화된 최소 요청부터 시작하세요. 사용 중인 엔드포인트의 최신 API 레퍼런스가 명시적으로 지원할 때만 추론 제어를 추가하세요.
2. 비용 및 성능 텔레메트리 재기준 설정
최소한 다음을 기록하세요:
- 입력, 출력, 추론 토큰
- 캐시 적중 및 캐시 생성 토큰
- 첫 토큰까지의 시간과 총 지연 시간
- 도구 호출, 재시도, 폴백
- 승인된 출력 대비 반려된 출력
- 휴먼 수정 시간
3. 애플리케이션이 사용하는 인터페이스 재검증
스트리밍 이벤트, 멀티모달 페이로드, 도구 스키마, 구조화 출력, 종료 사유, 사용량 필드, 오류 처리, 멀티 턴 동작을 검증하세요. 운영 모델 페이지는 DashScope 및 OpenAI 호환 접근을 문서화합니다. 추가 호환 레이어에 의존하기 전에 이를 검증하세요.
4. 실질적인 컨텍스트 제한 준수
1M 컨텍스트 윈도우는 1M 토큰 사용자 프롬프트와 동일하지 않습니다. QwenCloud는 최대 입력을 추론 비활성화 시 991K, 추론 활성화 시 983K로 게시합니다. 요청에 출력과 추론을 위한 공간이 남도록 안전 여유를 두세요.
5. Qwen 3.7과 Qwen 3.8을 병행 실행
동일한 프롬프트, 도구, 검증기, 재시도 규칙, 데이터셋을 사용하세요. 고립된 응답을 눈대중으로 판단하기보다 승인된 작업당 비용과 지연 시간을 비교하세요.
Qwen 3.8 Max의 평가 및 라우팅 방법
광범위한 벤치마크 평균보다 실제 워크로드를 사용하세요.
| 워크로드 | 제안 작업 수 | 주요 승인 신호 |
|---|---|---|
| 저장소 코딩 | 4 | 테스트가 휴먼 패칭 없이 통과 |
| 장문서 분석 | 3 | 주장에 제공된 증거가 뒷받침됨 |
| 멀티모달 분석 | 2 | 관련 이미지 또는 비디오 세부사항이 정확히 활용됨 |
| 도구 사용하는 에이전트 | 3 | 올바른 도구 선택과 유효한 인자 |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
다음과 같은 경우에는 Qwen 3.8 Max를 사용하세요: 까다로운 저장소 작업, 장기 지평 에이전트, 멀티모달 분석, 그리고 Qwen 3.7이 승인 기준을 충족하지 못하는 워크플로. Qwen 3.7 Max는 프로모션이 비용을 실질적으로 낮추고 기존 모델이 이미 품질 목표를 충족하는 경우 유지하세요.
임계값을 고정하기 전에 CometAPI 가격 페이지와 라이브 라우팅 정보를 확인하세요. 제공자 가용성과 라우팅된 가격은 QwenCloud의 직접 정가와 독립적으로 변경될 수 있습니다. CometAPI Cookbook은 반복 가능한 요청과 일관된 평가 하네스를 구축하는 데 도움이 됩니다.
FAQ
Qwen 3.8 Max API 비용은 얼마인가요?
QwenCloud는 현재 Qwen 3.8 Max를 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6로 게시하고 있습니다. 캐시 사용 및 내장 도구에는 별도 요율이 있습니다.
128K 토큰을 넘으면 Qwen 3.8 Max 비용이 더 비싼가요?
현재의 모델별 요금표에는 별도의 장문맥 가격 구간이 표시되지 않습니다. 긴 요청은 더 많은 토큰을 포함하기 때문에 비용이 늘어나는 것이지, 더 높은 단가 구간을 넘어서기 때문이 아닙니다.
Qwen 3.8 Max의 추론 토큰도 과금되나요?
추론은 생성된 사용량과 총 비용을 증가시킬 수 있습니다. 가시적 답변으로 추정하지 말고 엔드포인트가 반환하는 추론·출력 토큰 필드를 사용하세요.
Qwen 3.8 Max는 오픈 소스인가요?
Qwen은 API 릴리스 이후 오픈 웨이트를 제공하겠다고 발표했습니다. 공식 체크포인트와 라이선스가 제공되기 전에는 모델을 다운로드 가능 또는 자체 호스팅 가능하다고 설명하지 마십시오.
Qwen 3.7 Max 사용자는 즉시 마이그레이션해야 하나요?
자동으로 그럴 필요는 없습니다. Qwen 3.8 Max는 표준 정가가 더 낮지만, Qwen 3.7 Max는 현재 프로모션 동안 더 저렴합니다. 품질, 지연, 캐시 동작, 승인된 작업당 비용에 대한 자체 데이터가 변경을 뒷받침할 때 마이그레이션하세요.
CometAPI로 Qwen 3.8 Max 테스트
CometAPI Quickstart를 사용해 OpenAI 호환 클라이언트를 구성하세요. 운영 트래픽을 전송하기 전에 계정에서 qwen3.8-max가 라이브인지 확인하고, 거기에 표시되는 라우팅된 가격을 검증하세요.
동일한 프롬프트, 검증기, 재시도 정책, 텔레메트리를 사용해 Qwen 3.7 기준선과 비교하세요. 이렇게 하면 평가가 테스트 하네스 변경이 아니라 모델에 집중됩니다.
