Özet Grok 4.7 kodlama, ajan temelli iş akışları ve profesyonel bilgi işi için SpaceXAI’nin sınır modelidir; 21 Eylül 2026’da yayımlandı. 500.000 tokenlık bağlam penceresi, metin ve görsel girişi, yapılandırılabilir akıl yürütme, fonksiyon çağrısı, web ve X araması ile kod yürütmeyi bir araya getirir.
200.000 tokenın altındaki istemler için, resmi xAI API’si milyon başına girdi tokenı $2, önbelleğe alınmış girdi tokenı $0,50 ve çıktı tokenı $6 listeler. CometAPI, aynı kademede Grok 4.7 için şu anda milyon başına girdi $1,60, önbellekli girdi $0,40 ve çıktı $4,80 olarak listeliyor—model sayfasında gösterilen resmi tarifelere göre %20 indirim.
Pratik değer önerisi evrensel kıyaslama liderliği değildir. Grok 4.7, iş yükü mühendislik görevlerini, uzun ajan döngülerini, araç kullanımını, büyük çalışma bağlamlarını ve çıktı tokenı maliyetine duyarlılığı birleştirdiğinde en caziptir. Ekipler, üretim yönlendirmesinden önce kendi depolarında ve iş akışlarında doğrulamalıdır.
Temel Çıkarımlar
- Grok 4.7, Grok 4.6’dan daha büyük bir temel model, saatler süren daha zorlu görevlerde daha uzun pekiştirmeli öğrenme ve daha güçlü öz-doğrulama kullanır.
- API, 500.000 tokenlık bağlam penceresi, metin ve görsel girişi, metin çıktısı, dört akıl yürütme seviyesi, yapılandırılmış çıktı, fonksiyon çağrısı, web ve X araması ile kod yürütmeyi destekler.
- SpaceXAI, CursorBench 4.0’ta %46,3, DeepSWE v1.1’de %71,0 ve Terminal-Bench 4.0’ta %38,0 raporlar. Bunlar satıcı tarafından yayımlanan sonuçlardır; evrensel liderlik kanıtı değildir.
- CometAPI, Grok 4.7’yi OpenAI uyumlu bir uç nokta ile ve mevcut katalogda gösterilen resmi xAI tarifelerinden %20 daha düşük fiyatlarla listeler.
- Çok adımlı araç kullanımına dayanan ve maliyete duyarlı mühendislik ajanları için Grok 4.7’yi seçin; çok uzun bağlam veya kıyaslama-kritik bir alan birim fiyatın üzerinde daha önemliyse alternatifleri seçin.
Grok 4.7 Nedir?
Grok 4.7 SpaceXAI’nin en yeni sınır büyük dil modelidir ve kodlama, otonom ajan görevleri ve profesyonel bilgi işi için konumlandırılmıştır. Sürüm, tek seferlik yanıtlardan ziyade sürekli etkileşim, araç kullanımı, doğrulama ve revizyon gerektiren görevlere odaklanır.
SpaceXAI, Grok 4.7’nin daha uzun bir pekiştirmeli öğrenme çalışması ve daha zorlu görev karmasıyla eğitildiğini, saatler sürebilen problemlere ağırlık verdiğini söylüyor. Bu yönelim, depo düzeyinde yazılım mühendisliği, hata ayıklama, araştırma, doküman oluşturma, mühendislik analizi ve çok adımlı otomasyonla özellikle ilgilidir.
Grok 4.7, Grok 4.6’dan Nasıl Farklı—ve Daha İyi?
Daha Büyük Bir Temel Model
Grok 4.7, Grok 4.6’dan daha büyük bir temel modele geçiyor. SpaceXAI, kesinleşmiş bir kamuya açık parametre sayısı açıklamadı; savunulabilir sonuç, belirli bir tahmin değil artırılmış temel model kapasitesidir.
Daha Zorlu Görevlerde Daha Uzun Pekiştirmeli Öğrenme
Pekiştirmeli öğrenme aşaması uzatıldı ve daha zorlu, daha uzun ufuklu problemlere kaydırıldı. SpaceXAI, saatler sürebilecek görevlere vurgu yapıyor; bu da modeli otonom kodlama, araştırma ve profesyonel ajan iş akışlarıyla hizalıyor.
Daha Güçlü Öz-Doğrulama
Grok 4.7, kendi işini daha dikkatli inceleyecek şekilde eğitildi. Bu, yazılım mühendisliğinde önemlidir; çünkü güvenilir bir ajan yalnızca ilk yanıtı üretmekle kalmayıp tekrar tekrar incelemeli, değiştirmeli, test etmeli, başarısızlıkları teşhis edip düzeltmeli ve doğrulamalıdır.
Grok 4.6’ya Göre Ölçülen İyileşmeler
| Boyut | Grok 4.6 | Grok 4.7 | Değişim |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 puan |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 puan |
| EEBench | 53.0% | 64.0% | +11.0 puan |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 puan |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 puan |
| HealthBench Professional | 48.5% | 56.7% | +8.2 puan |
Yayımlanan lansman seti boyunca Grok 4.7, listelenen her sonuçta Grok 4.6’ya göre iyileşir. En büyük mutlak artış Terminal-Bench 4.0’ta olup, uzun süreli komut satırı ve araç kullanım iş akışlarına yapılan vurgu ile tutarlıdır. Bu rakamlar satıcı tarafından yayımlanmıştır ve taşınma kararı öncesinde gerçek görevlerde test edilmelidir.
Grok 4.7 Kıyaslamalarda Ne Kadar İyi?
SpaceXAI’nin lansman değerlendirmesi yazılım mühendisliğini, terminal işini, profesyonel ofis görevlerini, hukuk işlerini, klinik muhakemeyi ve elektrik mühendisliğini kapsar. Bunlar satıcı tarafından yayımlanan sonuçlardır ve tedarik veya yönlendirme kararlarından önce üretim iş yüklerine karşı doğrulanmalıdır.
| Kıyaslama | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Grok 4.7 lansman sonuçlarında, SpaceXAI %71,0’lık DeepSWE v1.1 skorunu yüksek akıl yürütme çabası olarak işaretler.
Lansman duyurusu her bir kıyaslama düzenini, araç yapılandırmasını, çalışma sayısını veya değerlendirme ortamını açıklamaz. Bu değerleri satıcı tarafından yayımlanan sonuçlar olarak ele alın ve modeli, üretime yönlendirmeden önce kendi depolarınız, araçlarınız, gecikme hedefleriniz ve hata ölçütlerinize karşı doğrulayın.
Grok 4.7 Kıyaslama Profili Ne Gösteriyor?
Yazılım Mühendisliği
CursorBench 4.0, Grok 4.6’da %40,4’ten Grok 4.7’de %46,3’e yükselirken, DeepSWE v1.1 %65,2’den %71,0’a yükselir. Bu, Grok 4.7’nin yalnızca konuşmalı kodlama yardımından ziyade kodlama ajanları için konumlandırılmasını destekler.
Uzun Süreli Terminal Çalışmaları
Terminal-Bench 4.0, en büyük nesil değişimlerinden birini gösterir: Grok 4.6 için %20,3’e karşılık Grok 4.7 için %38,0. %17,7’lik mutlak artış, daha uzun ufuklu pekiştirmeli öğrenme ve öz-doğrulamaya yapılan vurgu ile uyumludur.
Elektrik Mühendisliği
EEBench’te Grok 4.7 %64,0’a ulaşırken, Grok 4.6 %53,0’daydı. Yayınlanan karşılaştırmalar arasında bu, Grok 4.7’nin en güçlü göreli sonuçlarından biridir.
Profesyonel Bilgi İşi
AA Briefcase v1.1, 1,546’dan 1,657’ye yükselir. Bu görevler, belgeler, sunumlar, analiz ve diğer yapılandırılmış çıktılar gibi yapıtları içeren çok saatlik profesyonel çalışmayı yansıtacak şekilde tasarlanmıştır.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Karşılaştırma
Sağlayıcı-yerel fiyat kontrolü: OpenAI, GPT-5.6 Sol için milyon başına girdi tokenı $4 ve çıktı tokenı $20 listeler; Anthropic ise Claude Fable 5.1 için milyon başına girdi tokenı $10 ve çıktı tokenı $50 listeler.
| Boyut | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Birincil konumlandırma | Kodlama, ajan görevleri, bilgi işi | Karmaşık profesyonel muhakeme ve kodlama | Uzun süreli ajanlar, kodlama ve bilgi işi |
| Bağlam penceresi | 500,000 token | 1,050,000 token | 1,000,000 token |
| Modaliteler | Metin ve görsel girişi; metin çıktısı | Metin ve görsel girişi; metin çıktısı | Metin ve görsel girişi; metin çıktısı |
| Akıl yürütme kontrolü | Low, medium, high, xhigh | None through max | Yapılandırılabilir çabayla uyarlamalı düşünme |
| Sağlayıcı API durumu | Genel xAI API’sinde mevcut | OpenAI Chat Completions ve Responses üzerinden mevcut | Claude API ve destekli bulut pazar yerlerinde mevcut |
| Girdi fiyatı / 1M | $2 | $4 | $10 |
| Çıktı fiyatı / 1M | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| En iyi uyum | Fiyat duyarlı mühendislik ajanları ve sürekli araç kullanımı | Çok uzun bağlamla geniş profesyonel muhakeme | Maksimum kapasiteli uzun süreli ajan ve bilgi iş akışları |
Hangi Modeli Seçmelisiniz?
- Mühendislik iş yükleri, sürekli araç kullanımı, yapılandırılabilir akıl yürütme ve daha düşük çıktı tokenı maliyeti öncelikliyse Grok 4.7’yi seçin. Depo ajanları, terminal iş akışları ve 200K fiyat eşiğinin altında kalan büyük bağlamlı araştırmalar için özellikle çekicidir.
- Görev, bir milyon tokenın üzerindeki bağlam penceresine ihtiyaç duyduğunda veya DeepSWE ya da klinik muhakeme gibi iş-kritik bir değerlendirmede daha güçlü sonucu kendi düzeninizde doğruladıysanız GPT-5.6 Sol’u seçin.
- Maksimum uzun süreli ajan performansı, kod kalitesi, terminal yürütmesi veya klinik muhakeme daha yüksek token fiyatını haklı çıkarıyorsa Claude Fable 5.1’i seçin.
- İş yükleri çeşitliyse model yönlendirme kullanın. Rutin mühendislik ve yüksek hacimli ajan adımlarını en uygun maliyetli nitelikli modele yönlendirin; ölçülen başarı oranlarının primi haklı çıkardığı görevler için daha pahalı modeli ayırın.
Doğru seçim, tek bir kıyaslamaya veya manşet token fiyatına değil; uçtan uca görev başarısına, gecikmeye, yeniden denemelere, araç çağrısı doğruluğuna ve insan yeniden çalışmasına bağlıdır.
Grok 4.7 API’nin Maliyeti Ne Kadar?
Aşağıdaki tablo, 22 Eylül 2026’da CometAPI’nin Grok 4.7 model sayfasında gösterilen fiyatlarla resmi xAI tarifelerini karşılaştırır. CometAPI %20 indirim beyan eder; ağ geçidi fiyatları ve promosyon koşulları değişebileceğinden üretimden önce canlı fiyatları doğrulayın.
| İstem kademesi | Fiyat türü | xAI resmi | CometAPI | Fark |
|---|---|---|---|---|
| 200K istem token altı | Girdi / 1M | $2.00 | $1.60 | %20 daha düşük |
| Önbellekli girdi / 1M | $0.50 | $0.40 | %20 daha düşük | |
| Çıktı / 1M | $6.00 | $4.80 | %20 daha düşük | |
| 200K istem token üstü | Girdi / 1M | $4.00 | $3.20 | %20 daha düşük |
| Önbellekli girdi / 1M | $1.00 | $0.80 | %20 daha düşük | |
| Çıktı / 1M | $12.00 | $9.60 | %20 daha düşük |
200.000 Tokena Kadar Standart Bağlam Fiyatlandırması
İstemin 200.000 tokenı aşmadığı istekler için Grok 4.7, milyon başına girdi tokenı için $2, önbelleğe alınmış girdi tokenı için $0,50 ve çıktı tokenı için $6’dır. Önbellekli girdi en ucuz kategoridir; bu nedenle tekrar eden sistem talimatları veya yeniden kullanılabilir bağlama sahip uygulamalar, bu tokenlar önbelleğe uygun olduğunda maliyeti azaltabilir.
Basit bir örnek olarak, 100.000 önbelleksiz girdi tokenı kullanan ve 10.000 çıktı tokenı üreten bir istek, diğer platform ücretleri hariç yaklaşık $0,26 tutacaktır: girdi için $0,20 ve çıktı için $0,06.
200.000 Tokenın Üzerindeki Uzun Bağlam Fiyatlandırması
İstem 200.000 tokenı aştığında, tarifeler milyon başına girdi tokenı için $4, önbelleğe alınmış girdi tokenı için $1 ve çıktı tokenı için $12’ye iki katına çıkar. Daha yüksek kademe, istem uzunluğu nedeniyle uygulanır; bu nedenle ekipler, her istekten önce biriken konuşma geçmişini, araç izlerini, getirilen belgeleri ve depo bağlamını izlemelidir.
Pratik maliyet kararı, bir görevin kaç token kullandığı kadar, istemin 200.000-token sınırını aşıp aşmadığıdır. Tamamlanan işi özetlemek, eski araç çıktılarını kaldırmak ve yalnızca en alakalı dosyaları getirmek, gerekli bağlamdan ödün vermeden uygun iş yüklerini standart kademede tutabilir.
SpaceXAI sürüm notları bu eşiği belgeliyor. Üretim bütçeleri, yalnızca manşet girdi-token fiyatını karşılaştırmak yerine yeniden denemeleri, ajan döngülerini, başarısız araç çağrılarını ve çıktı uzunluğunu da hesaba katmalıdır.
Grok 4.7’yi Ajanlar İçin Yararlı Kılan Nedir?
- 500K bağlam penceresi: Tek bir çalışma bağlamında önemli miktarda kaynak kodu, şartname, araç çıktısı, günlük ve konuşma geçmişini tutar. Depo ölçekli kodlama ve çok belgeli analiz için yararlıdır; yine de bağlamın etkin budanması gerekir.
- Yapılandırılabilir akıl yürütme: Uygulamalar, görev zorluğuna göre gecikme ve hesaplama ile daha derin akıl yürütme arasında denge kurarak low, medium, high veya xhigh çabasını seçebilir.
- Fonksiyon çağrısı ve yapılandırılmış çıktı: Ajanlar veritabanları sorgulayabilir, testler çalıştırabilir, belgeleri inceleyebilir, dahili API’leri çağırabilir ve makinece okunabilir sonuçlar döndürebilir.
- Web ve X araması: Modelin eğitim verisinin yetersiz kaldığı durumda arama araçları güncel bilgileri getirebilir. Getirilen içerik yine de güvenilmez girdi olarak ele alınmalı ve doğrulanmalıdır.
- Kod yürütme: Model, yalnızca dil modeli çıkarımına güvenmek yerine hesaplamaları doğrulayabilir, verileri dönüştürebilir ve üretilen çözümleri test edebilir.
- Uzun ufuklu iş akışı odağı: Çok saatlik görevlere, bağlam yönetimine ve öz-doğrulamaya yapılan eğitim vurgusu, araç izleri biriken ve başarısızlık sonrası toparlanma gerektiren ajan döngülerini hedefler.
Grok 4.7 Güvenliği Nasıl İyileştiriyor?
SpaceXAI, Grok 4.7’nin tamamen yeni bir güvenlik yığını sunduğunu ve daha güçlü jailbreak direnci ile çift kullanım güvenliği rapor ettiğini söylüyor. Lansman duyurusunda, LatchBio’nun biyogüvenlik kıyaslamasında %62,4 ve HackerBench v0.3’te riskli çift kullanımlı istemlerin yalnızca %3,3’ünün geçirildiği belirtiliyor.
Bu rakamlar satıcı tarafından yayımlanan değerlendirmelerdir. Yayın iddialarını anlamak için faydalıdırlar ancak gerçek dünyadaki güvenlik performansının evrensel ölçüsü olarak ele alınmamalıdır.
Geliştiriciler Grok 4.7 API’sini Nasıl Kullanabilir?
Grok 4.7 şu anda CometAPI üzerinden grok-4.7 model kimliğiyle mevcuttur. CometAPI, birden fazla model sağlayıcısı arasında OpenAI uyumlu bir uç nokta, tek bir API anahtarı ve faturalandırma iş akışı, yan yana model testini ve yönlendirmeyi kolaylaştırır ve şu anda listelenen token fiyatları, resmi xAI tarifelerinin %20 altındadır. Üretim kullanımı öncesinde canlı model sayfasını, uç nokta sağlığını, desteklenen parametreleri, fiyatlandırmayı ve veri işleme gereksinimlerini doğrulayın.
CometAPI istek örneği:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Grok 4.7’ye Geçmeye Değer mi?
Kodlama ajanlarına veya uzun süreli profesyonel iş akışlarına bağımlı mevcut Grok 4.6 kullanıcıları için, lansman kıyaslamaları listelenen her boyutta iyileşirken uzun bağlam eşiğinin altındaki standart token fiyatlandırması aynı $2/$6 seviyesinde kaldığından Grok 4.7 anlamlı bir yükseltme adayıdır.
Diğer sınır modellerin kullanıcıları için karar iş yüküne özeldir. Grok 4.7, çıktı tokenı maliyeti, mühendislik iş yükleri, büyük bağlamlar ve sürekli araç kullanımı önemli olduğunda özellikle ilgi çekicidir. Başka bir modelin kritik bir alanda daha güçlü olduğu durumlarda, her modeli tek bir sağlayıcıyla değiştirmektense model yönlendirme daha rasyonel olabilir.
Sonuç
Grok 4.7, Grok 4.6’ya rutin bir sayısal güncellemeden fazlasıdır. Sürüm açıkça, araçlar üzerinden yürütülen uzun süreli çalışmaya, tekrar eden doğrulamaya, büyük bağlamlara ve birden çok yürütme adımına yöneliktir.
En güçlü nesil kazanımlar, bu eğitim yöneliminin önemli olması beklenen yerlerde görünür: Terminal-Bench 4.0 %20,3’ten %38,0’a, EEBench %53,0’tan %64,0’a ve CursorBench 4.0 %40,4’ten %46,3’e yükselirken, 200K istem eşiğinin altındaki standart fiyatlandırma girdi için $2/M ve çıktı için $6/M seviyesinde kalır.
Pratik değer önerisi “Grok 4.7 her kıyaslamayı kazanır” değildir. Grok 4.7, sınır sınıfı ajan yeteneği ile daha düşük maliyetli çıkarım arasındaki farkı daraltır; bu da özellikle bir defalık yanıtlar yerine birçok adımda çalışması gereken kodlama ajanları, araştırma sistemleri ve profesyonel iş akışları için önemlidir.
