GPT-5.6 Luna price down 80%, Terra down 20% →

Qwen 3.8 Max API Fiyatlandırması: $2 Girdi, $6 Çıktı, 1M Bağlam

CometAPI
Mia MarenAug 4, 2026
Qwen 3.8 Max API Fiyatlandırması: $2 Girdi, $6 Çıktı, 1M Bağlam

Qwen 3.8 Max API Fiyatlandırması: $2 Girdi, $6 Çıktı, 1M Bağlam

TL;DR

QwenCloud’da Qwen 3.8 Max, 1 milyon girdi token’ı için $2 ve 1 milyon çıktı token’ı için $6 olarak fiyatlandırılır. Model’e özgü önbellek oranları: örtük önbelleğe alınmış girdi için $0.25/M, açık önbellek oluşturma için $2.50/M ve açık önbellek okuma için $0.17/M.

Aynı standart token oranları, modelin desteklediği 1M token’lık bağlam penceresi boyunca geçerlidir. Daha büyük istemler, daha yüksek bir uzun-bağlam fiyatlandırma kademesine girdiği için değil, daha fazla token içerdiği için daha pahalıdır.

Liste fiyatında Qwen 3.8 Max, Qwen 3.7 Max’ten %20 daha ucuzdur. Ancak mevcut %50 promosyonu devam ettiği sürece Qwen 3.7 Max daha ucuzdur. En iyi üretim seçimi, akıl yürütme, önbellek isabetleri, araçlar, yeniden denemeler, gecikme ve insan değerlendirmesi dahil olmak üzere kabul edilen görev başına maliyete bağlıdır.

Qwen 3.8 Max API Fiyatlandırmasına Hızlı Bakış

ÖğeMevcut resmi değer
Üretim model kimliğiqwen3.8-max
Resmi çıkış tarihiAugust 3, 2026
MimariToplam 2.4T parametre; 95B aktif parametre
Standart girdi fiyatı$2 / 1M token
Standart çıktı fiyatı$6 / 1M token
Örtük önbellekli girdi$0.25 / 1M token
Açık önbellek oluşturma$2.50 / 1M token
Açık önbellek okuma$0.17 / 1M token
Bağlam penceresi1M token
Azami girdiAkıl yürütmesiz 991K; akıl yürütmeli 983K
Azami çıktı131K
Azami akıl yürütme262K
Girdi kipleriMetin, görsel ve video
Çıktı kipiMetin
QwenCloud referans limitleri2M TPM ve 15K RPM

QwenCloud model sayfası, güncel model kimliği, fiyatlandırma, önbellek oranları, bağlam limitleri ve kipler için en doğrudan kaynaktır. Hesap ve bölgeye özel kotalar farklılık gösterebilir; üretim eşzamanlılığını ayarlarken kendi konsolunuzda görünen limitleri kullanın.

Üretim sürümü ayrıca önizleme tanımlayıcısını qwen3.8-max ile değiştirir ve model’e özgü eksiksiz bir tarife tablosu ekler. Qwen’in lansman materyalleri low, medium ve xhigh akıl yürütme-çabası ayarlarını tanımlasa da, üretim davranışını kullandığınız uç nokta ve API referansına karşı doğrulamalısınız.

Zamana duyarlı not: Qwen, açık ağırlıkların API sürümünü takip edeceğini duyurdu. August 4, 2026 itibarıyla, resmi bir kontrol noktası ve lisans yayınlanana kadar Qwen 3.8 Max’i indirilebilir veya kendi kendine barındırılabilir olarak tanımlamayın.

Qwen 3.8 Max Fiyatlandırması Nasıl Çalışır

QwenCloud, Qwen 3.8 Max’in desteklediği 1M token’lık bağlam penceresi boyunca 1M girdi token’ı için $2 ve 1M çıktı token’ı için $6 düz standart oranı listeler. Aşağıdaki resmi fiyatlandırma anlık görüntüsü August 4, 2026 tarihinde yakalanmıştır; üretim bütçesi kararları vermeden önce her zaman canlı model sayfasını kontrol edin.

Qwen 3.8 Max API Fiyatlandırması: $2 Girdi, $6 Çıktı, 1M Bağlam

Kaynak***:*** QwenCloud, “Qwen3.8-Max” resmi

Faturalama kalemi1M token başına fiyatNe zaman uygulanır
Standart girdi$2.00Yeni istem içeriği, araç tanımları ve önbelleğe alınmamış bağlam
Standart çıktı$6.00Oluşturulan çıktı ve faturalandırılan akıl yürütme kullanımı
Örtük önbellek isabeti$0.25İstem ön eklerinin otomatik yeniden kullanımı; isabet garanti edilmez
Açık önbellek oluşturma$2.50İşaretlenmiş, yeniden kullanılabilir bir istem ön eki oluşturma
Açık önbellek okuma$0.17Geçerli bir açık önbellek bloğunu yeniden kullanma

Dolayısıyla 900K token’lık bir istek, 100K token’lık bir istekten daha pahalıdır çünkü dokuz kat fazla girdi token’ı işler—daha yüksek bir fiyat kademesine geçtiği için değil.

Akıl yürütme, çıktı maliyetini artırabilir

Kısa bir görünen yanıt her zaman düşük maliyetli bir yanıt değildir. Akıl yürütmeli çağrılar ek akıl yürütme token’ları üretebilir; bu nedenle üretim tahminleri, görünür yanıt uzunluğunu tahmin etmek yerine API tarafından döndürülen kullanım alanlarını kullanmalıdır.

Uç noktanız qwen3.8-max için akıl yürütme denetimlerini destekliyorsa, mevcut ayarları aynı değerlendirme setinde karşılaştırın. Önizleme varsayılanlarının GA modeline taşınacağını varsaymayın.

Önbellek tasarrufu, istemin istikrarına bağlıdır

Qwen 3.8 Max’in model sayfası, model’e özgü önbellek oranlarını yayınlar. Harcama tahmini yaparken genel önbellek oranları değil, bu oranları kullanın.

Açık önbellek girdilerinin geçerlilik süresi beş dakikadır ve başarılı bir isabet bu süreyi sıfırlar. Örtük önbellekleme otomatik olsa da, isabet garanti edilmez. Sistem istemleri, araç tanımları, depo bağlamı veya büyük belgeler sık çağrılar arasında sabit kaldığında önbellekleme en kullanışlıdır.

Yerleşik araçlar ayrı ücretler oluşturur

QwenCloud, token kullanımına ek olarak şu araç ücretlerini listeler:

Yerleşik araçGüncel ücret
Web Search$10 / 1K çağrı
Image Search$8 / 1K çağrı
Web ExtractorSınırlı bir süre ücretsiz
Code InterpreterSınırlı bir süre ücretsiz

Function calling ve MCP için ayrı araç ücreti yoktur, ancak araç açıklamaları yine de girdi token’ı olarak sayılır. Ücretsiz araç promosyonları değişebilir; üretim bütçesini kesinleştirmeden önce QwenCloud fiyatlandırma kılavuzunu kontrol edin.

Örneğin, 20K girdi token’ı, 2K çıktı token’ı ve iki Web Search çağrısı olan bir isteğin yaklaşık maliyeti:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Bu örnekte iki arama çağrısı, toplam istek maliyetinin yaklaşık %27.8’ini oluşturur.

Qwen 3.8 Max Gerçek Dünya Maliyet Örnekleri

Bu örnekler mevcut QwenCloud model’e özgü oranları kullanır. Vergiler, yeniden denemeler, geri dönüşler ve sağlayıcıya özgü marjlar hariçtir.

Örnek 1: Orta ölçekli ajan isteği

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Başarılı ilk deneme yaklaşık $0.13 tutar. Tam bir yeniden deneme, model maliyetini yaklaşık $0.26 seviyesine çıkarır.

Örnek 2: Uzun-belge analizi

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Model, mevcut tarife tablosunda ayrı bir uzun-bağlam ek ücreti uygulamaz, ancak büyük istemler yine de önemli mutlak maliyet yaratır.

Örnek 3: Önbellekli ajan oturumu

Yeniden kullanılabilir 100K token’lık bir ön ek, 10K yeni girdi token’ı, 5K çıktı token’ı ve açık önbellek geçerliyken 50 çağrı varsayalım:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Tahmini tasarruf = $8.917, yani %71.3

Tahmini tasarruf, başarılı önbellek isabetlerine ve stabil bir ön eke bağlıdır. Sistem istemlerinde ve araç şemalarında uzun aralar veya sık değişiklikler faydayı azaltacaktır.

Qwen 3.8 Max vs Qwen 3.7 Max: Fiyatlandırma Karşılaştırması

Qwen 3.8 Max, liste fiyatında Qwen 3.7 Max’ten %20 daha ucuzdur, ancak mevcut promosyonu etkin olduğu sürece Qwen 3.7 Max %37.5 daha ucuzdur.

Model ve fiyatlandırma durumuGirdi / 1MÇıktı / 1MBağlam
qwen3.8-max standart fiyat$2.00$6.001M
qwen3.7-max liste fiyatı$2.50$7.501M
qwen3.7-max mevcut promosyon$1.25$3.751M

Yeni modeli test ederken CometAPI Qwen3.7 Max model sayfasını yedek olarak elinizin altında bulundurun.

Token başına fiyat, kararın sadece bir parçasıdır. Qwen 3.8 Max, ilk geçiş başarısını artırıyorsa, araçları daha güvenilir kullanıyorsa, yeniden denemeleri azaltıyorsa veya daha az insan düzeltmesi gerektiriyorsa yine de daha ekonomik olabilir.

Bu üretim metriğini kullanın:

Kabul edilen görev başına maliyet =

(model token’ları + araç çağrıları + yeniden denemeler + geri dönüş harcaması + inceleme maliyeti)

÷ kabul edilen çıktılar

Sağlayıcı raporlu karşılaştırma kazançları, zorlu kodlama ve profesyonel iş akışlarını yeniden test etmek için bir nedendir; her Qwen 3.7 iş yükünün taşınması gerektiğinin kanıtı değildir.

Qwen 3.8 Max’e Nasıl Geçilir

Model dizesini değiştirmek gereklidir, ancak eksiksiz bir üretim geçişi değildir.

1. Üretim model kimliğini test edin

Önizleme tanımlayıcısını test ortamında qwen3.8-max ile değiştirin. Önizleme takma adlarının, varsayılanların, gecikmenin veya yanıt davranışının değişmeden kalacağını varsaymayın.

En küçük OpenAI-uyumlu istek şöyle görünebilir:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Belgelenmiş en düşük düzey istekle başlayın. Akıl yürütme denetimlerini, yalnızca kullandığınız uç noktanın güncel API referansı bunları açıkça desteklediğinde ekleyin.

2. Maliyet ve performans telemetrisini yeniden temel alın

En azından şunları kaydedin:

  • girdi, çıktı ve akıl yürütme token’ları
  • önbellek isabetleri ve önbellek oluşturma token’ları
  • ilk token’a kadar geçen süre ve toplam gecikme
  • araç çağrıları, yeniden denemeler ve geri dönüşler
  • kabul edilen ve reddedilen çıktılar
  • insan düzeltme süresi

3. Uygulamanızın kullandığı arayüzü yeniden test edin

Yayın olaylarını, çok kipli yükleri, araç şemalarını, yapılandırılmış çıktıyı, bitiş nedenlerini, kullanım alanlarını, hata işlemeyi ve çok turlu davranışı doğrulayın. Üretim model sayfası DashScope ve OpenAI-uyumlu erişimi belgeler; güvenmeden önce kullandığınız ek uyumluluk katmanını doğrulayın.

4. Pratik bağlam limitlerine saygı gösterin

1M bağlam penceresi, 1M token’lık bir kullanıcı istemiyle aynı değildir. QwenCloud, akıl yürütmesiz azami girdiyi 991K ve akıl yürütmeli azami girdiyi 983K olarak listeler. İstek için çıktı ve akıl yürütme alanı kalması adına bir güvenlik payı bırakın.

5. Qwen 3.7 ve Qwen 3.8’i yan yana çalıştırın

Aynı istemleri, araçları, doğrulayıcıları, yeniden deneme kurallarını ve veri kümelerini kullanın. İzole yanıtları gözle yargılamak yerine, kabul edilen görev başına maliyet ve gecikmeyi karşılaştırın.

Qwen 3.8 Max’i Nasıl Değerlendirip Yönlendirirsiniz

Geniş karşılaştırma ortalamaları yerine gerçek iş yüklerini kullanın.

İş yüküÖnerilen görevlerBirincil kabul sinyali
Depo kodlaması4İnsan yamaması olmadan testlerin geçmesi
Uzun-belge analizi3İddiaların sağlanan kanıtlarla desteklenmesi
Çok kipli analiz2İlgili görsel veya video ayrıntılarının doğru kullanımı
Araç kullanan ajanlar3Doğru araç seçimi ve geçerli argümanlar
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Zor depo çalışmaları, uzun ufuklu ajanlar, çok kipli analiz ve Qwen 3.7’nin kabul testlerinde başarısız olduğu iş akışları için Qwen 3.8 Max kullanın. Promosyon maliyeti önemli ölçüde düşürdüğünde ve mevcut model zaten kalite hedefinizi karşıladığında Qwen 3.7 Max’i koruyun.

Sağlayıcı erişilebilirliği ve yönlendirilen fiyatlandırma, QwenCloud’un doğrudan liste fiyatından bağımsız olarak değişebileceği için eşikleri sabitlemeden önce CometAPI fiyatlandırma sayfasını ve canlı yönlendirme bilgilerini kontrol edin. CometAPI Cookbook, tekrarlanabilir istekler ve tutarlı bir değerlendirme düzeni kurmanıza yardımcı olabilir.

SSS

Qwen 3.8 Max API’nin maliyeti ne kadar?

QwenCloud, Qwen 3.8 Max’i şu anda 1 milyon girdi token’ı için $2 ve 1 milyon çıktı token’ı için $6 olarak listeler. Önbellek kullanımı ve yerleşik araçların ayrı oranları vardır.

Qwen 3.8 Max, 128K token’ın üzerinde daha pahalı mı?

Geçerli model’e özgü tarife tablosunda ayrı bir uzun-bağlam kademesi gösterilmemektedir. Uzun istekler, daha yüksek bir birim-fiyat kademesine geçtikleri için değil, daha fazla token içerdiği için daha pahalıdır.

Qwen 3.8 Max akıl yürütme token’ları faturalandırılıyor mu?

Akıl yürütme, oluşturulan kullanımı ve toplam maliyeti artırabilir. Görünür yanıttan tahmin etmek yerine, uç noktanın döndürdüğü akıl yürütme ve çıktı token alanlarını kullanın.

Qwen 3.8 Max açık kaynak mı?

Qwen, açık ağırlıkların API sürümünü takip edeceğini duyurdu. Resmi bir kontrol noktası ve lisans mevcut olana kadar modeli indirilebilir veya kendi kendine barındırılabilir olarak tanımlamayın.

Qwen 3.7 Max kullanıcıları hemen geçiş yapmalı mı?

Otomatik olarak değil. Qwen 3.8 Max’in standart liste fiyatı daha düşüktür, Qwen 3.7 Max ise mevcut promosyonu sırasında daha ucuzdur. Kendi kalite, gecikme, önbellek davranışı ve kabul edilen görev başına maliyet verileriniz geçişi desteklediğinde taşıyın.

CometAPI ile Qwen 3.8 Max’i Test Edin

OpenAI-uyumlu bir istemci yapılandırmak için CometAPI Quickstart’ı kullanın. Üretim trafiği göndermeden önce hesabınızda qwen3.8-max’in canlı olduğunu ve orada görüntülenen yönlendirilmiş fiyatı doğrulayın.

Aynı istemler, doğrulayıcılar, yeniden deneme politikaları ve telemetriyi kullanarak Qwen 3.7 temelinizle karşılaştırın. Bu, değerlendirmeyi test düzeneğindeki değişiklikler yerine modele odaklı tutar.

Yapay zeka geliştirme maliyetlerinizi %20 azaltmaya hazır mısınız?

Dakikalar içinde ücretsiz başlayın. Ücretsiz deneme kredileri dahildir. Kredi kartı gerekmez.

Devamını Oku