TL;DR Qwen 3.8 Max, QwenCloud üzerinde 1 milyon girdi tokenı için $2 ve 1 milyon çıktı tokenı için $6 ücretlendirilir. Model‑özgü önbellek oranları: örtük önbelleğe alınmış girdi için $0.25/M, açık önbellek oluşturma için $2.50/M ve açık önbellek okuma için $0.17/M.
Aynı standart token oranları, modelin desteklediği 1M tokenlık bağlam penceresi boyunca geçerlidir. Daha büyük istemler, daha yüksek bir uzun‑bağlam fiyatlandırma kademesine girdikleri için değil, daha fazla token içerdikleri için daha pahalıdır.
Liste fiyatında, Qwen 3.8 Max, Qwen 3.7 Max’ten %20 daha ucuzdur. Ancak Qwen 3.7 Max, mevcut %50 promosyonu devam ettiği sürece daha ucuzdur. Daha iyi üretim seçimi, muhakeme, önbellek isabetleri, araçlar, yeniden denemeler, gecikme ve insan incelemesi dâhil olmak üzere kabul edilen görev başına maliyete bağlıdır.
Qwen 3.8 Max API Fiyatına Bir Bakış
| Öğe | Güncel resmi değer |
|---|---|
| Üretim model kimliği | qwen3.8-max |
| Resmi çıkış tarihi | 3 Ağustos 2026 |
| Mimari | 2.4T toplam parametre; 95B aktif parametre |
| Standart girdi fiyatı | $2 / 1M token |
| Standart çıktı fiyatı | $6 / 1M token |
| Örtük önbellek isabeti | $0.25 / 1M token |
| Açık önbellek oluşturma | $2.50 / 1M token |
| Açık önbellek okuma | $0.17 / 1M token |
| Bağlam penceresi | 1M token |
| Maksimum girdi | Düşünme olmadan 991K; düşünme ile 983K |
| Maksimum çıktı | 131K |
| Maksimum akıl yürütme | 262K |
| Girdi kipleri | Metin, görsel ve video |
| Çıktı kipi | Metin |
| QwenCloud referans limitleri | 2M TPM ve 15K RPM |
En güncel model kimliği, fiyatlandırma, önbellek oranları, bağlam sınırları ve kipler için en doğrudan kaynak QwenCloud model sayfasıdır. Hesap ve bölgeye göre kotalar farklılık gösterebilir; üretim eşzamanlılığını ayarlarken kendi konsolunuzda gösterilen limitleri kullanın.
Üretim sürümü ayrıca önizleme tanımlayıcısını qwen3.8-max ile değiştirir ve eksiksiz bir model‑özgü ücret tablosu ekler. Qwen’in lansman materyalleri low, medium ve xhigh akıl yürütme çabası ayarlarını tanımlar, ancak üretim davranışını kullandığınız uç nokta ve API başvurusuna göre doğrulamanız gerekir.
Zaman hassas not: Qwen, API sürümünün ardından açık ağırlıkların geleceğini duyurdu. 4 Ağustos 2026 itibarıyla, resmi bir kontrol noktası ve lisans yayımlanana kadar Qwen 3.8 Max’i indirilebilir veya kendi kendine barındırılabilir olarak tanımlamayın.
Qwen 3.8 Max Fiyatlandırması Nasıl Çalışır
QwenCloud, Qwen 3.8 Max’in desteklediği 1M tokenlık bağlam penceresi boyunca, 1M girdi tokenı için $2 ve 1M çıktı tokenı için $6 düz standart oranı listelemektedir. Aşağıdaki resmi fiyatlandırma anlık görüntüsü 4 Ağustos 2026’da alınmıştır; üretim bütçesi kararları vermeden önce her zaman canlı model sayfasını kontrol edin.

Kaynak***:*** QwenCloud, “Qwen3.8-Max” official
| Faturalandırma kalemi | 1M token başına fiyat | Ne zaman uygulanır |
|---|---|---|
| Standart girdi | $2.00 | Yeni istem içeriği, araç tanımları ve önbelleğe alınmamış bağlam |
| Standart çıktı | $6.00 | Üretilen çıktı ve faturalandırılan akıl yürütme kullanımı |
| Örtük önbellek isabeti | $0.25 | Otomatik yeniden kullanılan istem ön ekleri; isabet garanti edilmez |
| Açık önbellek oluşturma | $2.50 | İşaretli, yeniden kullanılabilir istem ön eki oluşturma |
| Açık önbellek okuma | $0.17 | Geçerli açık önbellek bloğunu yeniden kullanma |
Bu nedenle 900K tokenlık bir istek, daha yüksek bir fiyat kademesine girdiği için değil, dokuz kat daha fazla girdi tokenı işlediği için 100K tokenlık bir istekten daha pahalıya mal olur.
Akıl yürütme çıktı maliyetini artırabilir
Kısa bir görünür yanıt her zaman düşük maliyetli bir yanıt değildir. Akıl yürütme etkinleştirilmiş çağrılar ek akıl yürütme tokenları üretebilir; bu nedenle üretim tahminleri, görünür yanıt uzunluğuna göre değil, API tarafından döndürülen kullanım alanlarını kullanmalıdır.
Uç noktanız qwen3.8-max için akıl yürütme denetimlerini destekliyorsa, aynı değerlendirme setinde mevcut ayarları karşılaştırın. Önizleme varsayılanlarının GA modeline taşınacağını varsaymayın.
Önbellek tasarrufu istem kararlılığına bağlıdır
Qwen 3.8 Max’in model sayfası, model‑özgü önbellek oranlarını yayımlar. Harcamayı hesaplarken genel önbellek oranları yerine bu oranları kullanın.
Açık önbellek girişlerinin geçerlilik süresi beş dakikadır ve başarılı bir isabet bu süreyi sıfırlar. Örtük önbelleğe alma otomatik olsa da isabet garanti edilmez. Sistem istemleri, araç tanımları, depo bağlamı veya büyük belgeler sık çağrılar arasında sabit kaldığında önbelleğe alma en kullanışlı hâle gelir.
Yerleşik araçlar ayrı ücretler oluşturur
QwenCloud, token kullanımına ek olarak aşağıdaki araç ücretlerini listelemektedir:
| Yerleşik araç | Güncel ücret |
|---|---|
| Web Search | $10 / 1K çağrı |
| Image Search | $8 / 1K çağrı |
| Web Extractor | Sınırlı süre için ücretsiz |
| Code Interpreter | Sınırlı süre için ücretsiz |
Function calling ve MCP’nin ayrı araç ücretleri yoktur, ancak araç açıklamaları yine de girdi tokenları olarak sayılır. Ücretsiz araç promosyonları değişebilir; üretim bütçesini kesinleştirmeden önce QwenCloud fiyatlandırma kılavuzunu kontrol edin.
Örneğin, 20K girdi tokenı, 2K çıktı tokenı ve iki Web Search çağrısı içeren bir isteğin yaklaşık maliyeti:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Bu örnekte iki arama çağrısı, toplam istek maliyetinin yaklaşık %27,8’ini oluşturur.
Qwen 3.8 Max Gerçek Dünya Maliyet Örnekleri
Bu örnekler, mevcut QwenCloud model‑özgü oranlarını kullanır. Vergiler, yeniden denemeler, geri dönüşler ve sağlayıcıya özgü artışlar dâhil değildir.
Örnek 1: Orta ölçekli ajan isteği
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Başarılı bir ilk deneme yaklaşık $0.13 tutar. Tam bir yeniden deneme, model maliyetini yaklaşık $0.26 seviyesine çıkarır.
Örnek 2: Uzun belge analizi
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Model, mevcut ücret tablosunda ayrıca bir uzun‑bağlam ek ücreti uygulamaz, ancak büyük istemler yine de kayda değer mutlak maliyet yaratır.
Örnek 3: Önbellekli ajan oturumu
Tekrar kullanılabilir 100K tokenlık bir ön ek, 10K yeni girdi tokenı, 5K çıktı tokenı ve açık önbellek geçerli kalırken 50 çağrı varsayalım:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Tahmini tasarruf = $8.917, yani %71,3
Tahmini tasarruf, başarılı önbellek isabetlerine ve kararlı bir ön eke bağlıdır. Uzun aralar veya sistem istemleri ile araç şemalarındaki sık değişiklikler faydayı azaltacaktır.
Qwen 3.8 Max vs Qwen 3.7 Max: Fiyat Karşılaştırması
Qwen 3.8 Max, liste fiyatında Qwen 3.7 Max’ten %20 daha ucuzdur, ancak Qwen 3.7 Max mevcut %50 promosyonu aktifken %37,5 daha ucuzdur.
| Model ve fiyatlandırma durumu | Girdi / 1M | Çıktı / 1M | Bağlam |
|---|---|---|---|
| qwen3.8-max standart fiyat | $2.00 | $6.00 | 1M |
| qwen3.7-max liste fiyatı | $2.50 | $7.50 | 1M |
| qwen3.7-max mevcut promosyon | $1.25 | $3.75 | 1M |
Yeni modeli test ederken CometAPI Qwen3.7 Max model sayfasını yedekte erişilebilir tutun.
Token başına fiyat, kararın yalnızca bir parçasıdır. Qwen 3.8 Max, ilk deneme başarısını artırıyor, araçları daha güvenilir kullanıyor, yeniden denemeleri azaltıyor veya daha az insan düzeltmesi gerektiriyorsa yine de daha ekonomik olabilir.
Şu üretim metriğini kullanın:
Kabul edilen görev başına maliyet =
(model tokenları + araç çağrıları + yeniden denemeler + geri dönüş harcaması + inceleme maliyeti)
÷ kabul edilen çıktılar
Sağlayıcı tarafından bildirilen kıyaslamadaki kazanımlar, zorlu kodlama ve profesyonel iş akışlarını yeniden test etmek için bir nedendir; her Qwen 3.7 iş yükünün taşınması gerektiğinin kanıtı değildir.
Qwen 3.8 Max’e Nasıl Geçilir
Model dizesini değiştirmek gereklidir, ancak bu tek başına eksiksiz bir üretim geçişi değildir.
1. Üretim model kimliğini test edin
Önizleme tanımlayıcısını test ortamında qwen3.8-max ile değiştirin. Önizleme takma adlarının, varsayılanların, gecikmenin veya yanıt davranışının değişmeden kalacağını varsaymayın.
En küçük OpenAI uyumlu istek şöyle görünebilir:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Belgelenmiş minimum istekle başlayın. Yalnızca kullandığınız uç noktanın güncel API başvurusu bunu açıkça destekliyorsa akıl yürütme denetimlerini ekleyin.
2. Maliyet ve performans telemetrilerini yeniden ölçütleyin
En azından şunları kaydedin:
- girdi, çıktı ve akıl yürütme tokenları
- önbellek isabetleri ve önbellek oluşturma tokenları
- ilk tokena kadar süre ve toplam gecikme
- araç çağrıları, yeniden denemeler ve geri dönüşler
- kabul edilen ve reddedilen çıktılar
- insan düzeltme süresi
3. Uygulamanızın kullandığı arayüzü yeniden test edin
Akış olaylarını, çok kipli yükleri, araç şemalarını, yapılandırılmış çıktıyı, bitiş nedenlerini, kullanım alanlarını, hata işlemeyi ve çok turlu davranışı doğrulayın. Üretim model sayfası DashScope ve OpenAI uyumlu erişimi belgeler; buna güvenmeden önce herhangi bir ek uyumluluk katmanını doğrulayın.
4. Pratik bağlam sınırlarına saygı gösterin
1M bağlam penceresi, 1M tokenlık bir kullanıcı istemiyle aynı şey değildir. QwenCloud, düşünme olmadan maksimum girdiyi 991K ve düşünme ile 983K olarak listeler. İstekte çıktıya ve akıl yürütmeye yer kalması için bir güvenlik payı ekleyin.
5. Qwen 3.7 ve Qwen 3.8’i yan yana çalıştırın
Aynı istemleri, araçları, doğrulayıcıları, yeniden deneme kurallarını ve veri setlerini kullanın. İzole yanıtları gözle değerlendirerek hüküm vermek yerine kabul edilen görev başına maliyeti ve gecikmeyi karşılaştırın.
Qwen 3.8 Max’i Nasıl Değerlendirip Yönlendirmeli
Geniş kıyaslama ortalamaları yerine gerçek iş yüklerini kullanın.
| İş yükü | Önerilen görev sayısı | Birincil kabul sinyali |
|---|---|---|
| Depo temelli kodlama | 4 | Testler insan yamaması olmadan geçer |
| Uzun belge analizi | 3 | İddialar sağlanan kanıtlarla desteklenir |
| Çok kipli analiz | 2 | İlgili görsel veya video ayrıntıları doğru kullanılır |
| Araç kullanan ajanlar | 3 | Doğru araç seçimi ve geçerli argümanlar |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Qwen 3.8 Max’i zor depo çalışmaları, uzun ufuklu ajanlar, çok kipli analiz ve Qwen 3.7’nin kabul testlerinde başarısız olduğu iş akışları için kullanın. Mevcut model kalite hedefinizi zaten karşılıyorsa ve promosyon maliyeti önemli ölçüde düşürüyorsa Qwen 3.7 Max’i koruyun.
Sağlayıcı erişilebilirliği ve yönlendirilen fiyatlandırma, QwenCloud’un doğrudan liste fiyatından bağımsız olarak değişebileceğinden eşikleri kilitlemeden önce CometAPI fiyatlandırma sayfasını ve canlı yönlendirme bilgilerini kontrol edin. CometAPI Cookbook, yinelenebilir istekler ve tutarlı bir değerlendirme düzeneği oluşturmanıza yardımcı olabilir.
SSS
Qwen 3.8 Max API’si ne kadar tutar?
QwenCloud, Qwen 3.8 Max’i şu şekilde listeler: 1 milyon girdi tokenı başına $2 ve 1 milyon çıktı tokenı başına $6. Önbellek kullanımı ve yerleşik araçların ayrı oranları vardır.
Qwen 3.8 Max, 128K tokenın üzerinde daha pahalı mı?
Güncel model‑özgü ücret tablosunda ayrı bir uzun‑bağlam kademesi gösterilmemektedir. Uzun istekler, birim fiyat kademesini geçtikleri için değil, daha fazla token içerdiği için daha pahalıdır.
Qwen 3.8 Max’te akıl yürütme tokenları faturalandırılır mı?
Akıl yürütme, üretilen kullanımı ve toplam maliyeti artırabilir. Görünür yanıta göre tahmin etmek yerine, uç nokta tarafından döndürülen akıl yürütme ve çıktı tokenı alanlarını kullanın.
Qwen 3.8 Max açık kaynak mı?
Qwen, API sürümünün ardından açık ağırlıkların geleceğini duyurdu. Resmî bir kontrol noktası ve lisans mevcut olana kadar modeli indirilebilir veya kendi kendine barındırılabilir olarak tanımlamayın.
Qwen 3.7 Max kullanıcıları hemen geçiş yapmalı mı?
Otomatik olarak değil. Qwen 3.8 Max’in standart liste fiyatı daha düşükken, Qwen 3.7 Max mevcut promosyon sırasında daha ucuzdur. Kendi kalite, gecikme, önbellek davranışı ve kabul edilen görev başına maliyet verileriniz değişimi desteklediğinde geçiş yapın.
Qwen 3.8 Max’i CometAPI ile Test Edin
OpenAI uyumlu bir istemciyi yapılandırmak için CometAPI Hızlı Başlangıç rehberini kullanın. Üretim trafiği göndermeden önce hesabınızda qwen3.8-max’in canlı olduğunu doğrulayın ve orada görüntülenen yönlendirilen fiyatı teyit edin.
Aynı istemler, doğrulayıcılar, yeniden deneme politikaları ve telemetriyi kullanarak Qwen 3.7 temelinizle karşılaştırın. Bu, değerlendirmeyi test düzeneğindeki değişiklikler yerine modele odaklı tutar.
