GPT-5.6 Luna price down 80%, Terra down 20% →

Qwen 3.8 Max API 요금: $2 입력, $6 출력, 1M 컨텍스트

CometAPI
Mia MarenAug 4, 2026
Qwen 3.8 Max API 요금: $2 입력, $6 출력, 1M 컨텍스트

Qwen 3.8 Max API 가격: 입력 $2, 출력 $6, 1M 컨텍스트

TL;DR

Qwen 3.8 Max는 QwenCloud에서 1백만 입력 토큰당 $2, 1백만 출력 토큰당 $6입니다. 모델별 캐시 요금은 암시적 캐시된 입력 $0.25/M, 명시적 캐시 생성 $2.50/M, 명시적 캐시 읽기 $0.17/M입니다.

동일한 표준 토큰 단가가 모델이 지원하는 1M-토큰 컨텍스트 윈도우 전체에 적용됩니다. 프롬프트가 클수록 더 많은 토큰을 포함하므로 비용이 증가하는 것이지, 더 높은 장문 컨텍스트 요금제로 올라가서가 아닙니다.

정가 기준으로 Qwen 3.8 Max는 Qwen 3.7 Max보다 20% 저렴합니다. 다만 현재 50% 프로모션이 유지되는 동안에는 Qwen 3.7 Max가 더 저렴합니다. 어떤 모델이 프로덕션에 더 적합한지는 추론, 캐시 적중, 도구 사용, 재시도, 지연시간, 휴먼 리뷰 등을 포함한 승인된 작업당 비용에 따라 달라집니다.

Qwen 3.8 Max API 가격 한눈에 보기

항목현재 공식 값
프로덕션 모델 IDqwen3.8-max
공식 출시일August 3, 2026
아키텍처총 2.4T 파라미터; 활성 95B 파라미터
표준 입력 가격$2 / 1M 토큰
표준 출력 가격$6 / 1M 토큰
암시적 캐시된 입력$0.25 / 1M 토큰
명시적 캐시 생성$2.50 / 1M 토큰
명시적 캐시 읽기$0.17 / 1M 토큰
컨텍스트 윈도우1M 토큰
최대 입력thinking 미사용 991K; thinking 사용 983K
최대 출력131K
최대 추론262K
입력 모달리티텍스트, 이미지, 비디오
출력 모달리티텍스트
QwenCloud 기준 한도TPM 2M 및 RPM 15K

QwenCloud 모델 페이지는 현재 모델 ID, 가격, 캐시 요율, 컨텍스트 한도, 모달리티에 대한 가장 직접적인 출처입니다. 계정 및 지역별 할당량은 다를 수 있으므로, 프로덕션 동시성 설정 시에는 본인 콘솔에 표시된 한도를 사용하세요.

프로덕션 릴리스에서는 프리뷰 식별자가 qwen3.8-max로 교체되고, 모델별 요금표가 완비됩니다. Qwen의 출시 자료는 추론 노력 설정으로 low, medium, xhigh를 설명하지만, 실제 사용하는 엔드포인트와 API 레퍼런스에 맞춰 프로덕션 동작을 검증해야 합니다.

시간 민감 참고: Qwen은 API 출시 이후 오픈 웨이트를 공개한다고 발표했습니다. 2026년 8월 4일 현재, 공식 체크포인트와 라이선스가 공개되기 전까지 Qwen 3.8 Max를 다운로드 가능 또는 자가 호스팅 가능하다고 설명하지 마세요.

Qwen 3.8 Max 가격 체계

QwenCloud는 현재 Qwen 3.8 Max의 지원 1M-토큰 컨텍스트 윈도우 전 구간에 걸쳐 1M 입력 토큰당 $2, 1M 출력 토큰당 $6의 균일 표준 요율을 게시하고 있습니다. 아래 공식 가격 스냅샷은 2026년 8월 4일에 캡처되었습니다. 프로덕션 예산 결정을 내리기 전에는 항상 실시간 모델 페이지를 확인하세요.

Qwen 3.8 Max API 요금: $2 입력, $6 출력, 1M 컨텍스트

출처***:*** QwenCloud, “Qwen3.8-Max” 공식

청구 항목1M 토큰당 가격적용 시점
표준 입력$2.00신규 프롬프트 콘텐츠, 도구 정의, 캐시되지 않은 컨텍스트
표준 출력$6.00생성된 출력 및 과금 대상 추론 사용량
암시적 캐시 적중$0.25프롬프트 접두부 자동 재사용; 적중은 보장되지 않음
명시적 캐시 생성$2.50표시된 재사용 가능한 프롬프트 접두부 생성
명시적 캐시 읽기$0.17유효한 명시적 캐시 블록 재사용

따라서 900K-토큰 요청은 100K-토큰 요청보다 9배 더 많은 입력 토큰을 처리하므로 더 비쌉니다. 더 높은 가격 구간으로 넘어가서가 아닙니다.

추론은 출력 비용을 증가시킬 수 있음

겉으로 보기에 짧은 답변이 항상 저비용 답변인 것은 아닙니다. 추론이 활성화된 호출은 추가 추론 토큰을 생성할 수 있으므로, 프로덕션 추정에는 눈에 보이는 응답 길이 대신 API가 반환하는 사용량 필드를 사용해야 합니다.

사용 중인 엔드포인트가 qwen3.8-max에 대한 추론 제어를 지원하는 경우, 동일한 평가 세트에서 가능한 설정을 비교하세요. 프리뷰 기본값이 GA 모델에 그대로 적용된다고 가정하지 마세요.

캐시 절감 효과는 프롬프트 안정성에 좌우

Qwen 3.8 Max의 모델 페이지는 모델별 캐시 요율을 게시합니다. 지출 추정 시 일반적인 캐시 비율이 아니라 해당 요율을 사용하세요.

명시적 캐시 항목의 유효 기간은 5분이며, 성공적인 적중 시 그 기간이 리셋됩니다. 암시적 캐시는 자동이지만 적중이 보장되지는 않습니다. 시스템 프롬프트, 도구 정의, 리포지토리 컨텍스트 또는 대형 문서가 여러 호출에 걸쳐 안정적으로 유지될 때 캐시가 가장 유용합니다.

내장 도구는 별도 요금 발생

QwenCloud는 현재 토큰 사용량과 별도로 다음 도구 요금을 게시합니다:

내장 도구현재 요금
Web Search$10 / 1K 호출
Image Search$8 / 1K 호출
Web Extractor한시적 무료
Code Interpreter한시적 무료

함수 호출과 MCP는 별도 도구 요금이 없지만, 도구 설명은 입력 토큰으로 계산됩니다. 무료 도구 프로모션은 변경될 수 있으므로, 프로덕션 예산을 확정하기 전에 QwenCloud 가격 가이드를 확인하세요.

예를 들어, 20K 입력 토큰, 2K 출력 토큰, Web Search 2회 호출이 있는 요청의 비용은 대략 다음과 같습니다:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

이 예시에서 두 번의 검색 호출은 전체 요청 비용의 약 27.8%를 차지합니다.

Qwen 3.8 Max 실제 비용 예시

이 예시는 현재 QwenCloud 모델별 요율을 사용합니다. 세금, 재시도, 폴백, 공급자별 마크업은 제외합니다.

예시 1: 중간 규모 에이전트 요청

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

첫 시도에 성공하면 약 $0.13의 비용이 듭니다. 한 번 전체 재시도를 하면 모델 비용은 대략 $0.26로 증가합니다.

예시 2: 장문서 분석

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

현재 요금표에서는 별도의 장문 컨텍스트 추가 요금이 적용되지 않지만, 프롬프트가 커지면 절대 비용은 크게 증가합니다.

예시 3: 캐시된 에이전트 세션

재사용 가능한 100K-토큰 접두부, 신규 입력 10K 토큰, 출력 5K 토큰, 명시적 캐시 유효 기간 내 50회 호출을 가정:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

예상 절감액 = $8.917, 또는 71.3%

예상 절감액은 캐시 적중 성공과 안정적인 접두부에 좌우됩니다. 시스템 프롬프트와 도구 스키마가 자주 바뀌거나 호출 간 간격이 길면 효과가 줄어듭니다.

Qwen 3.8 Max vs Qwen 3.7 Max: 가격 비교

Qwen 3.8 Max는 정가 기준으로 Qwen 3.7 Max보다 20% 저렴하지만, 현재 50% 프로모션이 진행되는 동안에는 Qwen 3.7 Max가 37.5% 더 저렴합니다.

모델 및 가격 상태입력 / 1M출력 / 1M컨텍스트
qwen3.8-max 표준 가격$2.00$6.001M
qwen3.7-max 정가$2.50$7.501M
qwen3.7-max 현재 프로모션$1.25$3.751M

새 모델을 테스트하는 동안 폴백으로 CometAPI Qwen3.7 Max 모델 페이지를 확보해 두세요.

토큰당 가격은 의사결정의 일부일 뿐입니다. Qwen 3.8 Max가 1차 시도 성공률을 높이고, 도구 사용을 더 신뢰성 있게 하며, 재시도를 줄이거나, 인간 수정이 덜 필요하다면 더 경제적일 수 있습니다.

프로덕션 지표는 다음을 사용하세요:

승인된 작업당 비용 =

(모델 토큰 + 도구 호출 + 재시도 + 폴백 비용 + 검토 비용)

÷ 승인된 출력

벤더가 보고한 벤치마크 향상은 까다로운 코딩 및 전문 워크플로를 재평가할 이유이지, 모든 Qwen 3.7 워크로드가 반드시 마이그레이션해야 한다는 증거는 아닙니다.

Qwen 3.8 Max로 마이그레이션하는 방법

모델 문자열을 변경하는 것은 필요하지만, 완전한 프로덕션 마이그레이션에는 그것만으로 충분하지 않습니다.

1. 프로덕션 모델 ID를 테스트

테스트 환경에서 프리뷰 식별자를 qwen3.8-max로 교체하세요. 프리뷰 별칭, 기본값, 지연시간, 응답 동작이 그대로 유지된다고 가정하지 마세요.

최소 OpenAI-호환 요청은 다음과 같을 수 있습니다:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

문서화된 최소 요청부터 시작하세요. 사용하는 엔드포인트의 최신 API 레퍼런스가 명시적으로 지원할 때에만 추론 제어를 추가하세요.

2. 비용 및 성능 텔레메트리 재기준화

최소한 다음을 기록하세요:

  • 입력, 출력, 추론 토큰
  • 캐시 적중 및 캐시 생성 토큰
  • 첫 토큰까지 시간과 총 지연시간
  • 도구 호출, 재시도, 폴백
  • 승인 대비 거부된 출력
  • 인간 수정 시간

3. 애플리케이션이 사용하는 인터페이스 재검증

스트리밍 이벤트, 멀티모달 페이로드, 도구 스키마, 구조화된 출력, 종료 사유, 사용량 필드, 오류 처리, 멀티턴 동작을 검증하세요. 프로덕션 모델 페이지는 DashScope 및 OpenAI-호환 액세스를 문서화합니다. 추가 호환 레이어를 사용하는 경우 의존하기 전에 반드시 검증하세요.

4. 실질적 컨텍스트 한도를 준수

1M 컨텍스트 윈도우가 곧 1M-토큰 사용자 프롬프트와 동일하진 않습니다. QwenCloud는 thinking 미사용 시 최대 입력 991K, thinking 사용 시 983K를 게시합니다. 출력과 추론을 위한 공간이 남도록 안전 여유를 두세요.

5. Qwen 3.7과 Qwen 3.8을 나란히 실행

동일한 프롬프트, 도구, 검증기, 재시도 규칙, 데이터 세트를 사용하세요. 눈대중으로 개별 응답을 평가하기보다 승인된 작업당 비용과 지연시간을 비교하세요.

Qwen 3.8 Max 평가 및 라우팅 방법

광범위한 벤치마크 평균 대신 실제 워크로드를 사용하세요.

워크로드권장 작업 수주요 승인 신호
리포지토리 코딩4사람의 패치 없이 테스트 통과
장문서 분석3주장이 제공된 증거로 뒷받침됨
멀티모달 분석2관련 이미지 또는 비디오 세부정보가 올바르게 사용
도구 사용 에이전트3올바른 도구 선택과 유효한 인자
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

어려운 리포지토리 작업, 장기 지평 에이전트, 멀티모달 분석, Qwen 3.7이 승인 테스트에 실패하는 워크플로에는 Qwen 3.8 Max를 사용하세요. 프로모션으로 비용이 크게 낮아지고 기존 모델이 이미 품질 목표를 충족하는 경우에는 Qwen 3.7 Max를 유지하세요.

임계값을 확정하기 전 CometAPI 가격 페이지와 실시간 라우팅 정보를 확인하세요. 공급자 가용성과 라우팅된 가격은 QwenCloud의 직가와 독립적으로 변경될 수 있습니다. CometAPI Cookbook은 재현 가능한 요청과 일관된 평가 하네스를 구축하는 데 도움이 됩니다.

FAQ

Qwen 3.8 Max API 비용은 얼마인가요?

QwenCloud는 현재 Qwen 3.8 Max를 1백만 입력 토큰당 $2, 1백만 출력 토큰당 $6로 게시하고 있습니다. 캐시 사용 및 내장 도구는 별도 요율이 있습니다.

128K 토큰을 넘으면 Qwen 3.8 Max 비용이 더 비싼가요?

현재 모델별 요금표에는 별도의 장문 컨텍스트 구간이 표시되어 있지 않습니다. 요청이 길수록 더 많은 토큰을 포함하기 때문에 비용이 늘어나는 것이지, 더 높은 단가 구간으로 넘어가서가 아닙니다.

Qwen 3.8 Max의 추론 토큰도 과금되나요?

추론은 생성된 사용량과 총 비용을 증가시킬 수 있습니다. 눈에 보이는 답변 길이로 추정하지 말고 엔드포인트가 반환하는 추론·출력 토큰 필드를 사용하세요.

Qwen 3.8 Max는 오픈 소스인가요?

Qwen은 API 출시 이후 오픈 웨이트 공개를 예고했습니다. 공식 체크포인트와 라이선스가 제공되기 전까지는 다운로드 가능 또는 자가 호스팅 가능하다고 설명하지 마세요.

Qwen 3.7 Max 사용자는 즉시 마이그레이션해야 하나요?

자동으로 그럴 필요는 없습니다. Qwen 3.8 Max는 표준 정가가 더 낮지만, 현재 프로모션 기간 동안에는 Qwen 3.7 Max가 더 저렴합니다. 자체 품질, 지연시간, 캐시 동작, 승인된 작업당 비용 데이터가 변화를 뒷받침할 때 마이그레이션하세요.

CometAPI로 Qwen 3.8 Max 테스트

CometAPI 퀵스타트를 사용해 OpenAI-호환 클라이언트를 설정하세요. 프로덕션 트래픽을 보내기 전에 계정에서 qwen3.8-max가 활성화되어 있는지 확인하고, 그곳에 표시된 라우팅된 가격을 검증하세요.

동일한 프롬프트, 검증기, 재시도 정책, 텔레메트리를 사용해 Qwen 3.7 기준선과 비교하세요. 이렇게 하면 평가가 테스트 하네스 변경이 아니라 모델에 집중됩니다.

AI 개발 비용을 20% 절감할 준비가 되셨나요?

몇 분 안에 무료로 시작하세요. 무료 체험 크레딧 제공. 신용카드 불필요.

더 보기