TL;DR
Grok 4.7 ialah model frontier SpaceXAI untuk pengekodan, aliran kerja berasaskan agen, dan kerja pengetahuan profesional, dikeluarkan pada 21 September 2026. Ia menggabungkan tetingkap konteks 500,000 token, input teks dan imej, penaakulan boleh dikonfigurasi, pemanggilan fungsi, carian web dan X, serta pelaksanaan kod.
Untuk prompt di bawah 200,000 token, API rasmi xAI menyenaraikan $2 per juta token input, $0.50 per juta token input di-cache, dan $6 per juta token output. CometAPI kini menyenaraikan Grok 4.7 pada $1.60 input, $0.40 input di-cache, dan $4.80 output per juta token untuk tier yang sama—pengurangan 20% daripada kadar rasmi yang ditunjukkan pada halaman modelnya.
Proposisi nilai praktikal bukanlah kepimpinan penanda aras universal. Grok 4.7 paling meyakinkan apabila beban kerja menggabungkan tugasan kejuruteraan, gelung agen yang panjang, penggunaan alat, konteks kerja yang besar, dan kepekaan terhadap kos token output. Pasukan harus mengesahkannya pada repositori dan aliran kerja mereka sendiri sebelum penghalaan produksi.
Perkara Utama
- Grok 4.7 menggunakan model asas yang lebih besar berbanding Grok 4.6, pembelajaran pengukuhan lebih lama pada tugas multi-jam yang lebih sukar, dan pengesahan kendiri yang lebih kuat.
- API menyokong tetingkap konteks 500,000 token, input teks dan imej, output teks, empat tahap penaakulan, output berstruktur, pemanggilan fungsi, carian web dan X, serta pelaksanaan kod.
- SpaceXAI melaporkan 46.3% pada CursorBench 4.0, 71.0% pada DeepSWE v1.1, dan 38.0% pada Terminal-Bench 4.0. Ini ialah hasil yang diterbitkan oleh vendor, bukan bukti kepimpinan universal.
- CometAPI menyenaraikan Grok 4.7 sebagai tersedia, dengan titik akhir serasi OpenAI dan harga 20% di bawah kadar rasmi xAI yang ditunjukkan dalam katalog semasa.
- Pilih Grok 4.7 untuk agen kejuruteraan sensitif kos dan penggunaan alat berterusan; pilih alternatif apabila konteks yang sangat panjang atau domain kritikal penanda aras lebih penting daripada harga seunit.
Apakah Grok 4.7?
Grok 4.7 ialah model bahasa besar frontier terkini SpaceXAI, diposisikan untuk pengekodan, tugas agen autonomi, dan kerja pengetahuan profesional. Keluaran ini memfokuskan pada tugasan yang memerlukan interaksi berterusan, penggunaan alat, pengesahan, dan semakan—bukan hanya jawapan sekali sahaja.
SpaceXAI menyatakan Grok 4.7 dilatih dengan latihan pembelajaran pengukuhan yang lebih lama pada campuran tugas yang lebih sukar, ditimbang ke arah masalah yang boleh mengambil masa berjam-jam untuk diselesaikan. Arah latihan ini menjadikannya sangat relevan untuk kejuruteraan perisian peringkat repositori, penyahpepijatan, penyelidikan, penciptaan dokumen, analisis kejuruteraan, dan automasi berbilang langkah.
Bagaimanakah Grok 4.7 Berbeza Daripada—dan Lebih Baik Daripada—Grok 4.6?
Model Asas Yang Lebih Besar
Grok 4.7 beralih kepada model asas yang lebih besar berbanding Grok 4.6. SpaceXAI belum mendedahkan kiraan parameter awam yang dimuktamadkan, jadi kesimpulan yang boleh dipertahankan ialah peningkatan kapasiti model asas—bukan anggaran parameter khusus.
Pembelajaran Pengukuhan Lebih Lama pada Tugas yang Lebih Sukar
Peringkat pembelajaran pengukuhan dilanjutkan dan diubah ke arah masalah yang lebih sukar serta berjangka panjang. SpaceXAI menekankan tugas yang mungkin memerlukan kerja berjam-jam, sejajar dengan pengekodan autonomi, penyelidikan, dan aliran kerja agen profesional.
Pengesahan Kendiri yang Lebih Kukuh
Grok 4.7 dilatih untuk memeriksa kerjanya sendiri dengan lebih teliti. Ini penting dalam kejuruteraan perisian kerana agen yang boleh dipercayai mesti berulang kali memeriksa, mengubah suai, menguji, mendiagnosis kegagalan, menyemak, dan mengesahkan—bukan sekadar menjana jawapan pertama.
Peningkatan Terukur Berbanding Grok 4.6
| Dimensi | Grok 4.6 | Grok 4.7 | Perubahan |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pts |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pts |
| EEBench | 53.0% | 64.0% | +11.0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pts |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pts |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pts |
Merentas suite pelancaran yang diterbitkan, Grok 4.7 bertambah baik berbanding Grok 4.6 dalam setiap keputusan yang disenaraikan. Keuntungan mutlak terbesar ialah pada Terminal-Bench 4.0, konsisten dengan penekanan keluaran pada aliran kerja baris perintah dan penggunaan alat yang berjalan lama. Angka ini kekal sebagai hasil yang diterbitkan vendor dan harus diuji terhadap tugas sebenar sebelum keputusan migrasi.
Seberapa Baik Grok 4.7 pada Penanda Aras?
Penilaian pelancaran SpaceXAI meliputi kejuruteraan perisian, kerja terminal, tugas pejabat profesional, kerja undang-undang, penaakulan klinikal, dan kejuruteraan elektrik. Ini ialah hasil yang diterbitkan oleh vendor dan harus disahkan terhadap beban kerja produksi sebelum keputusan pemerolehan atau penghalaan dibuat.
| Penanda aras | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Dalam hasil pelancaran Grok 4.7, SpaceXAI menandakan skor DeepSWE v1.1 sebanyak 71.0% sebagai usaha penaakulan tinggi.
Pengumuman pelancaran tidak mendedahkan setiap harness per penanda aras, konfigurasi alat, bilangan larian, atau persekitaran penilaian. Anggap nilai-nilai ini sebagai keputusan yang diterbitkan vendor dan sahkan model pada repositori, alat, sasaran latensi, dan kriteria kegagalan anda sendiri sebelum menghala kerja produksi.
Apakah Yang Ditunjukkan oleh Profil Penanda Aras Grok 4.7?
Kejuruteraan Perisian
CursorBench 4.0 naik dari 40.4% pada Grok 4.6 kepada 46.3% pada Grok 4.7, manakala DeepSWE v1.1 naik dari 65.2% kepada 71.0%. Ini menyokong kedudukan Grok 4.7 sebagai model untuk agen pengekodan, bukan hanya bantuan pengekodan perbualan.
Kerja Terminal yang Berjalan Lama
Terminal-Bench 4.0 menunjukkan salah satu perubahan generasi terbesar: 20.3% untuk Grok 4.6 berbanding 38.0% untuk Grok 4.7. Kenaikan mutlak 17.7 mata adalah konsisten dengan penekanan SpaceXAI pada pembelajaran pengukuhan berjangka panjang dan pengesahan kendiri.
Kejuruteraan Elektrik
Pada EEBench, Grok 4.7 mencapai 64.0%, berbanding 53.0% untuk Grok 4.6. Antara perbandingan yang diterbitkan, ini adalah salah satu hasil relatif terkuat Grok 4.7.
Kerja Pengetahuan Profesional
AA Briefcase v1.1 naik dari 1,546 kepada 1,657. Tugasan ini direka untuk mencerminkan kerja profesional berjam-jam yang melibatkan artifak seperti dokumen, pembentangan, analisis, dan hasil berstruktur lain.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: Bagaimana Perbandingannya?
Semakan harga daripada penyedia asal: OpenAI menyenaraikan GPT-5.6 Sol pada $4 per juta token input dan $20 per juta token output, manakala Anthropic menyenaraikan Claude Fable 5.1 pada $10 per juta token input dan $50 per juta token output.
| Dimensi | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Kedudukan utama | Pengekodan, tugas berasaskan agen, kerja pengetahuan | Penaakulan profesional kompleks dan pengekodan | Agen berjalan lama, pengekodan, dan kerja pengetahuan |
| Tetingkap konteks | 500,000 token | 1,050,000 token | 1,000,000 token |
| Modaliti | Input teks dan imej; output teks | Input teks dan imej; output teks | Input teks dan imej; output teks |
| Kawalan penaakulan | Low, medium, high, xhigh | None through max | Pemikiran adaptif dengan usaha boleh dikonfigurasi |
| Status API penyedia | Tersedia pada API awam xAI | Tersedia melalui OpenAI Chat Completions dan Responses | Tersedia melalui Claude API dan pasaran awan yang disokong |
| Harga input / 1M token | $2 | $4 | $10 |
| Harga output / 1M token | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Kesesuaian terbaik | Agen kejuruteraan sensitif harga dan penggunaan alat berterusan | Penaakulan profesional luas dengan konteks sangat panjang | Prestasi agen maksimum berjalan lama, kualiti pengekodan, dan aliran kerja pengetahuan |
Model Mana Yang Patut Anda Pilih?
- Pilih Grok 4.7 apabila beban kerja kejuruteraan, penggunaan alat berterusan, penaakulan boleh dikonfigurasi, dan kos token output yang lebih rendah menjadi keutamaan. Ia amat menarik untuk agen repositori, aliran kerja terminal, dan penyelidikan konteks besar yang kekal di bawah ambang harga 200K.
- Pilih GPT-5.6 Sol apabila tugasan memerlukan penaakulan profesional yang lebih luas, tetingkap konteks melebihi satu juta token, atau apabila hasilnya yang lebih kuat pada penilaian kritikal seperti DeepSWE atau penaakulan klinikal telah disahkan dalam kerangka ujian anda sendiri.
- Pilih Claude Fable 5.1 apabila prestasi agen maksimum yang berjalan lama, kualiti pengekodan, pelaksanaan terminal, atau penaakulan klinikal membenarkan harga token yang lebih tinggi.
- Gunakan penghalaan model apabila beban kerja berbeza-beza. Halakan langkah agen kejuruteraan rutin dan volum tinggi kepada model paling cekap kos yang layak, dan rizabkan model yang lebih mahal untuk tugas di mana kadar kejayaan terukur membenarkan premium.
Pilihan yang betul bergantung pada kejayaan tugas hujung ke hujung, latensi, cubaan semula, ketepatan panggilan alat, dan kerja semula manusia—bukan pada satu penanda aras atau kadar token utama sahaja.
Berapakah Kos API Grok 4.7?
Jadual di bawah membandingkan kadar rasmi xAI dengan harga yang dipaparkan pada halaman model Grok 4.7 CometAPI pada 22 September 2026. CometAPI menyatakan diskaun 20%; sahkan harga langsung sebelum produksi kerana harga gerbang dan syarat promosi boleh berubah.
| Tahap prompt | Jenis harga | xAI rasmi | CometAPI | Perbezaan |
|---|---|---|---|---|
| Di bawah 200K token prompt | Input / 1M | $2.00 | $1.60 | 20% lebih rendah |
| Input di-cache / 1M | $0.50 | $0.40 | 20% lebih rendah | |
| Output / 1M | $6.00 | $4.80 | 20% lebih rendah | |
| Melebihi 200K token prompt | Input / 1M | $4.00 | $3.20 | 20% lebih rendah |
| Input di-cache / 1M | $1.00 | $0.80 | 20% lebih rendah | |
| Output / 1M | $12.00 | $9.60 | 20% lebih rendah |
Harga Konteks Standard untuk Prompt Sehingga 200,000 Token
Untuk permintaan yang promptnya tidak melebihi 200,000 token, Grok 4.7 berharga $2 per juta token input, $0.50 per juta token input di-cache, dan $6 per juta token output. Input di-cache ialah kategori paling murah, jadi aplikasi dengan arahan sistem berulang atau konteks boleh guna semula boleh mengurangkan kos apabila token berkenaan layak untuk cache.
Untuk contoh ringkas, permintaan menggunakan 100,000 token input tidak di-cache dan menghasilkan 10,000 token output akan berharga kira-kira $0.26 sebelum caj platform lain: $0.20 untuk input ditambah $0.06 untuk output.
Harga Konteks Panjang Melebihi 200,000 Token Prompt
Sebaik sahaja prompt melebihi 200,000 token, kadar berganda kepada $4 per juta token input, $1 per juta token input di-cache, dan $12 per juta token output. Tier lebih tinggi dikenakan kerana panjang prompt, jadi pasukan harus memantau sejarah perbualan terkumpul, jejak alat, dokumen yang diambil, dan konteks repositori sebelum menghantar setiap permintaan.
Keputusan kos praktikal oleh itu bukan sahaja berapa banyak token yang digunakan oleh tugas, tetapi sama ada prompt melepasi sempadan 200,000 token. Meringkaskan kerja yang siap, mengeluarkan output alat yang usang, dan mengambil hanya fail paling relevan boleh mengekalkan beban kerja yang sesuai dalam tier standard tanpa mengorbankan konteks yang diperlukan.
Nota keluaran SpaceXAI mendokumenkan ambang ini. Bajet produksi juga harus mengambil kira cubaan semula, gelung agen, panggilan alat yang gagal, dan panjang output dan bukannya membandingkan penyedia hanya melalui harga token input utama mereka.
Apa Yang Menjadikan Grok 4.7 Berguna untuk Agen AI?
- 500K context window: Menempatkan kod sumber, spesifikasi, output alat, log, dan sejarah perbualan yang besar dalam satu konteks kerja. Ini berguna untuk pengekodan skala repositori dan analisis berbilang dokumen, walaupun konteks masih perlu dipangkas secara aktif.
- Configurable reasoning: Aplikasi boleh memilih usaha low, medium, high, atau xhigh, menukar latensi dan pengiraan untuk penaakulan lebih mendalam mengikut kesukaran tugas.
- Function calling dan output berstruktur: Agen boleh menyoal pangkalan data, menjalankan ujian, memeriksa dokumen, memanggil API dalaman, dan mengembalikan hasil boleh dibaca mesin.
- Carian web dan X: Alat carian boleh mendapatkan maklumat semasa apabila data latihan model tidak mencukupi. Kandungan yang diambil masih harus dianggap sebagai input tidak dipercayai dan disahkan.
- Pelaksanaan kod: Model boleh mengesahkan pengiraan, mengubah data, dan menguji penyelesaian yang dijana dan bukannya bergantung semata-mata pada inferens model bahasa.
- Fokus aliran kerja berjangka panjang: Penekanan latihan pada tugas berjam-jam, pengurusan konteks, dan pengesahan kendiri menyasarkan gelung agen yang mengumpul jejak alat dan memerlukan pemulihan selepas kegagalan.
Bagaimana Grok 4.7 Meningkatkan Keselamatan?
SpaceXAI menyatakan Grok 4.7 memperkenalkan susunan kawalan keselamatan yang serba baharu dan melaporkan rintangan jailbreak serta keselamatan dwi-guna yang lebih kuat. Dalam pengumuman pelancaran, syarikat melaporkan 62.4% pada penanda aras biosafety LatchBio dan menyatakan hanya 3.3% prompt dwi-guna berisiko dibenarkan melepasi pada HackerBench v0.3.
Angka-angka ini ialah penilaian yang diterbitkan vendor. Ia berguna untuk memahami tuntutan keluaran tetapi tidak harus dianggap sebagai ukuran universal prestasi keselamatan dunia sebenar.
Bagaimana Pemaju Boleh Menggunakan API Grok 4.7?
Grok 4.7 kini tersedia melalui CometAPI di bawah ID model grok-4.7. CometAPI menyediakan titik akhir serasi OpenAI, satu kunci API dan aliran kerja pengebilan merentas pelbagai penyedia model, pengujian dan penghalaan model sebelah menyebelah yang lebih mudah, serta harga token yang kini disenaraikan 20% di bawah kadar rasmi xAI. Sebelum penggunaan produksi, sahkan halaman model langsung, kesihatan titik akhir, parameter yang disokong, harga, dan keperluan pengendalian data.
Contoh permintaan CometAPI:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Adakah Berbaloi Beralih kepada Grok 4.7?
Untuk pengguna Grok 4.6 sedia ada yang bergantung pada agen pengekodan atau aliran kerja profesional yang berjalan lama, Grok 4.7 ialah calon naik taraf material kerana set penanda aras pelancaran bertambah baik merentas setiap dimensi yang dilaporkan sementara harga token standard kekal pada tahap $2/$6 di bawah ambang konteks panjang.
Untuk pengguna model frontier lain, keputusan adalah khusus beban kerja. Grok 4.7 amat menarik apabila kos token output, beban kerja kejuruteraan, konteks besar, dan penggunaan alat berterusan menjadi penting. Di mana model lain lebih kuat pada domain kritikal, penghalaan model boleh menjadi lebih rasional daripada menggantikan setiap model dengan satu penyedia.
Kesimpulan
Grok 4.7 lebih daripada kemas kini berangka rutin kepada Grok 4.6. Keluaran ini jelas berorientasi kepada kerja berjalan lama yang dilakukan melalui alat, pengesahan berulang, konteks besar, dan berbilang langkah pelaksanaan.
Keuntungan generasi terkuat muncul di tempat di mana arah latihan itu sepatutnya penting: Terminal-Bench 4.0 naik dari 20.3% kepada 38.0%, EEBench dari 53.0% kepada 64.0%, dan CursorBench 4.0 dari 40.4% kepada 46.3%, sementara harga standard di bawah ambang prompt 200K kekal pada $2/M input dan $6/M output.
Proposisi nilai praktikal oleh itu bukan “Grok 4.7 memenangi setiap penanda aras.” Ia ialah bahawa Grok 4.7 merapatkan jurang antara keupayaan agen kelas frontier dan inferens berharga lebih rendah, menjadikannya sangat relevan kepada agen pengekodan, sistem penyelidikan, dan aliran kerja profesional yang perlu beroperasi untuk banyak langkah dan bukan menjawab sekali.
