Ringkasan Penanda aras bocor dan ujian senyap Arena.ai pada pertengahan September 2026 meletakkan Gemini 4 Pro (belum dilancar) oleh Google sebagai peneraju barisan hadapan baharu, mengatasi GPT-6 Astra dan Claude Fable 5.1 merentas kejuruteraan perisian, tugas agentik, kerja pengetahuan, penaakulan, dan penanda aras multimodal.
Ringkasan Utama
- Gemini 4 Pro menerajui penilaian bocor pada DeepSWE v1.1 (88.7%), GDPval-AA v2 (2064 Elo), Terminal-bench 2.1 (95.3%), OSWorld-2.0 (86.8%), dan pelbagai suite agentik/penaakulan lain.
- Harganya di bawah GPT-6 Astra ($12/$60) dan Claude Fable 5.1 ($10/$50) pada senarai harga sambil menyamai atau melebihi tetingkap konteks kelas 1M mereka.
- Ujian terselindung di Arena.ai dengan nama sementara (cth., gemini-3.8-flash) menghasilkan demo pengekodan SVG, Three.js, dan agentik yang menonjol.
- Khabar angin RSI (penambahbaikan kendiri rekursif) berlegar tetapi tiada bukti umum tentang penambahbaikan model autonomus gelung tertutup untuk Gemini 4 sendiri.
- Google mengesahkan pelaburan besar dalam model asas Gemini 4 yang lebih besar; masa pelancaran awam masih tidak rasmi.
- Platform seperti CometAPI sudah mengagregatkan Gemini, GPT-6 Astra, Claude Fable/Opus, dan ratusan model lain di sebalik satu endpoint serasi OpenAI pada kadar kompetitif—sesuai untuk membanding tanda aras frontier baharu apabila ia dilancarkan.
Apa Yang Kita Tahu Tentang Gemini 4? (Kebocoran, Sumber, dan Konteks Disahkan)
Sehingga 20 September 2026, Gemini 4 Pro belum menerima pengumuman rasmi Google, kad model, atau endpoint API awam. Segala-galanya selain kenyataan terdahulu Google tentang pelaburan dalam “model asas Gemini 4 yang lebih besar” (pendapatan suku Julai 2026) datang daripada kebocoran komuniti, ujian buta Arena.ai, dan jadual penanda aras yang beredar.
Sumber dan dakwaan utama termasuk:
- Pembocor Pankaj Kumar dan hantaran susulan (sekitar awal hingga pertengahan September) merujuk kepada titik semak Pro dalaman dengan jangkaan keluaran awam pada Oktober dan kemungkinan varian Flash-Lite lebih awal.
- Ramai pembangun melaporkan menarik model berkeupayaan tinggi berlabel “gemini-3.8-flash” (atau nama sementara serupa) di Arena.ai. Output termasuk penjanaan SVG kompleks (cth., burung pelikan menaiki basikal, rama-rama mekanikal dalam Three.js), penjanaan JSON panjang tidak berulang, dan gelagat agentik yang kukuh. Sesetengah pengguna mendakwa butiran backend seperti konteks pelbagai juta token, had output 256k, memori rentas sesi, dan keupayaan alat/internet asli.
- Jadual perbandingan yang tersebar luas menyenaraikan Gemini 4 Pro berbanding Gemini 4 Flash, Gemini 4 Flash-Lite, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5, dan GPT-5.6 Sol.
- Google tidak mengesahkan ujian Arena atau jadual tersebut. Corak sejarah menunjukkan syarikat sering menjalankan penilaian senyap di platform awam beberapa minggu sebelum pelancaran rasmi.

Tetingkap konteks
Jadual bocor menunjukkan 2M token input maksimum untuk keluarga Gemini 4—dua kali ganda 1M milik GPT-6 Astra dan jauh di atas 200k bagi barisan Claude Fable/Opus 5 (sesetengah varian Claude menawarkan tetingkap berkesan lebih besar melalui mekanisme lain). Dakwaan “ghost-routing” berasingan menyebut had 10M; ini kekal tidak disahkan.
Harga Gemini 4 (Angka Bocor)
Jadual yang beredar menyenaraikan:
- Gemini 4 Pro: $2.25 input / $11.25 output per 1M token (tanpa caching).
- Gemini 4 Flash: $0.75 / $3.75.
- Gemini 4 Flash-Lite: $0.35 / $1.75.
Angka ini jauh lebih rendah daripada $12/$60 GPT-6 Astra dan $10/$50 Claude Fable 5.1 (Fable 5.1 menawarkan diskaun bacaan cache yang agresif yang boleh menurunkan kos efektif untuk beban kerja agentik). Harga rasmi semasa Gemini 3.x Pro berada dalam julat $2–$4 input / $12–$18 output bergantung pada panjang konteks, maka angka Pro yang bocor adalah munasabah sebagai pelarasan generasi seterusnya.
Harga awam sebenar hanya akan diketahui semasa pelancaran. Secara sejarah, Google menggunakan kadar token kompetitif dan peringkat percuma untuk memacu penerimaan.
Prestasi Gemini 4 Pro: Selaman Mendalam Penanda Aras Bocor
Jadual yang beredar meletakkan Gemini 4 Pro di puncak hampir setiap kategori. Nombor ini tidak rasmi dan belum disahkan oleh Google atau makmal pihak ketiga bebas pada masa penulisan. Ia harus dianggap sebagai isyarat berarah, bukan kedudukan muktamad.
Kejuruteraan perisian & pengekodan agentik
- DeepSWE v1.1 (kejuruteraan perisian jangka panjang): 88.7% (berbanding GPT-6 Astra 86.9%, Claude Fable 5.1 69.1%, Claude Opus 5 75.0%).
- Terminal-bench 2.1 (pengekodan terminal agentik): 95.3% (berbanding Astra 94.1%, Fable 92.8%).
- Terminal-bench 4.0 (keupayaan agen umum): 69.7% (jurang relatif terbesar berbanding Flash dan pesaing).
Kerja pengetahuan & tugas profesional
- GDPval-AA v2 (Elo, kerja pengetahuan): 2064 (satu-satunya model melebihi 2000; Astra 1994, Fable 1853).
- Vals Finance Agent v2: 74.2%.
- Penanda Aras Ejen Perundangan Harvey (aliran kerja perundangan kompleks, kadar lulus menyeluruh): 18.7%.
Penaakulan, multimodal & khusus
- CharXiv Reasoning (sintesis maklumat daripada carta kompleks, tanpa alat): 94.7%.
- LVBench (pemahaman video panjang): 95.8% agentik / 95.0% statik.
- HLE-Verified (penaakulan pakar pelbagai disiplin): 72.1%.
- OSWorld-2.0 (penggunaan komputer agentik, skor separa, alat kelompok didayakan): 86.8%.
- BioMysteryBench & LABBench2 (bioinformatik dan aliran kerja penyelidikan biologi): skor teratas pada subset boleh diselesaikan manusia dan subset sukar.
Jika tepat secara berarah, keputusan ini menunjukkan kekuatan khusus pada beban kerja agentik yang berbilang langkah, menggunakan alat, dan berjangka panjang—bidang tepat di mana GPT-6 Astra dan Claude Fable 5.1 diposisikan sebagai peneraju selepas keluaran awal September mereka.
Ujian kualitatif Arena mengukuhkan gambaran: penjanaan SVG dan Three.js yang kompleks daripada model terselindung dinilai unggul atau sangat berdaya saing berbanding Astra dalam perbandingan sebelah menyebelah komuniti.
Bagaimana Gemini 4 akan berfungsi?
Gemini 4 (Pro) belum dilancarkan, jadi sebarang penerangan tentang “bagaimana ia akan berfungsi” semestinya berdasarkan kenyataan rasmi Google, butiran terhad yang bocor tentang titik semak dalaman awal, trajektori siri Gemini 3.x, dan inferens kejuruteraan yang munasabah. Tiada apa di bawah harus dianggap sebagai spesifikasi disahkan.
Latihan Teras dan Pendekatan Skala
Google menggambarkan Gemini 4 sebagai “lari pralatih paling bercita-cita tinggi setakat ini,” dibina di atas model asas yang jauh lebih besar berbanding generasi terdahulu. Matlamat jelas adalah kekal berdaya saing di frontier, khususnya dalam pengekodan dan agen autonomus.
Ini membayangkan:
- Kiraan parameter lebih besar atau kapasiti lebih berkesan (melalui mixture-of-experts, kekosongan lebih baik, atau penskalaan lebih tumpat).
- Pelaburan pengiraan lebih berat semasa pralatih.
- Penekanan berterusan pada data latihan multimodal (teks, imej, video, audio, kod, trajektori penggunaan alat).
Model ini dijangka berfungsi sebagai garis dasar keupayaan tinggi baharu yang daripadanya varian gaya Flash yang lebih pantas boleh diperoleh kemudian.
Gaya Inferens dan Penaakulan
Penerangan bocor tentang titik semak awal “argon” menyebut mod usaha pemikiran tinggi yang mengambil kira-kira 2.4 minit untuk satu generasi dan menyokong had output yang jauh lebih tinggi (dilaporkan 256k token berbanding ~64k sebelum ini).
Ini menunjukkan:
- Laluan penaakulan pilihan yang intensif pengiraan (serupa dengan mod pemikiran lanjutan atau “usaha maksimum” dalam model pesaing).
- Keupayaan membelanjakan lebih banyak pengiraan dalaman pada masalah sukar sebelum menghasilkan jawapan.
- Sokongan lebih baik untuk output panjang dan koheren seperti keseluruhan pangkalan kod, rancangan berbilang langkah, atau laporan panjang.
Pengguna berkemungkinan boleh mengawal pertukaran antara kelajuan/kos dan kedalaman penaakulan, seperti pada model Gemini Flash semasa yang menawarkan tahap pemikiran rendah/sederhana/tinggi.
Bidang Fokus Keupayaan Utama
Berdasarkan kenyataan umum Sundar Pichai dan trajektori pembangunan:
- Pengekodan dan kejuruteraan perisian Prestasi jangka panjang yang lebih kuat: pembaikan semula berbilang fail, nyahpepijat merentas repositori, gelung pembetulan diri, dan kadar penyempurnaan lebih tinggi pada tugas perisian realistik.
- Tingkah laku autonomus/agentik Keupayaan dipertingkat untuk merancang, menggunakan alat, memerhati hasil perantaraan, pulih daripada ralat, dan meneruskan ke arah matlamat sepanjang banyak langkah. Ini terus membina ciri penggunaan komputer dan agentik yang sudah wujud dalam Gemini 3.5/3.8 Flash.
- Kebolehpercayaan konteks panjang Laporan komuniti menyebut sasaran dalam lingkungan 1.5 juta token (atau lebih tinggi). Matlamat praktikal bukan sekadar tetingkap lebih besar tetapi fideliti pengambilan lebih baik dan kurang degradasi apabila bekerja dengan dokumen sangat panjang, pangkalan kod, atau jejak agen berjam-jam.
- Pemahaman dan penjanaan multimodal Pengendalian asli teks + imej + video + audio, dengan jangkaan peningkatan penaakulan spatial, pemahaman video, dan interaksi suara/agen masa nyata (berasaskan model Gemini 3.8 Live September 2026).
- Penggunaan alat dan output berstruktur Panggilan fungsi lebih mantap, pelaksanaan kod, pembumian pada carian, dan output berstruktur gaya JSON/XML untuk penyepaduan boleh harap ke dalam aplikasi dan agen.
Bagaimana Ia Berbeza daripada Gemini 3.x
- Skala: Model asas yang jelas lebih besar dan bukannya penambahbaikan beransur.
- Kapasiti output: Had token lebih tinggi yang bocor membolehkan penjanaan pas tunggal lebih panjang.
- Kedalaman penaakulan: Mod usaha tinggi lebih ketara untuk masalah sukar.
- Fokus agentik: Penekanan lebih besar pada kerja autonomus berbilang langkah yang berterusan dan bukannya tugasan satu giliran atau jangka pendek.
- Pemosisian: Dituju sebagai model Pro-tier frontier baharu, sementara barisan Flash meneruskan iterasi pantas untuk kelajuan dan kecekapan kos.
Hubungan dengan Penambahbaikan Kendiri Rekursif (RSI)
Eksekutif Google secara terbuka mengaitkan perbelanjaan modal AI besar syarikat dengan matlamat jangka panjang penambahbaikan kendiri rekursif—sistem yang boleh memperbaiki diri mereka atau proses yang menghasilkan generasi seterusnya. Penyelidikan berkaitan (seperti kertas Dream-RSI) menunjukkan agen memperbaiki strategi penerokaan mereka tanpa mengubah berat model.
Adakah Gemini 4 Pro akan mengatasi GPT-6 dan Claude Fable 5.1?
| Kategori | Gemini 4 Pro | GPT-6 Astra | Claude Fable 5.1 | Catatan |
|---|---|---|---|---|
| Harga Input / Output | $2.25 / $11.25 | $12.00 / $60.00 | $10.00 / $50.00 | Gemini 4 Pro ~5× lebih murah daripada Astra |
| Tetingkap konteks | 2M | 1M | 200k | Kelebihan ketara untuk Gemini |
| DeepSWE v1.1 | 88.7% | 86.9% | 69.1% | Mendahului dalam pengekodan |
| GDPval-AA v2 (Elo) | 2064 | 1994 | 1853 | Peneraju kerja pengetahuan |
| Terminal-bench 4.0 | 69.7% | 66.4% | 57.9% | Keupayaan agen umum |
| OSWorld-2.0 | 86.8% | 84.5% | 77.9% | Penggunaan komputer |
| HLE-Verified | 72.1% | 67.3% | 62.1% | Penaakulan pakar |
| LVBench (video) | 95.8% / 95.0% | 93.8% | 90.4% | Kekuatan multimodal |
| Penyelidikan Bio/LAB | Skor tertinggi | Kuat | Bersaing | Aliran kerja saintifik |
Gemini 4 Pro mendahului setiap baris utama dalam jadual, selalunya dengan margin bermakna, sementara harga yang didakwa jauh lebih agresif daripada GPT-6 Astra atau Claude Fable 5.1.
Penafian Penting
- Jadual ini bukan keluaran rasmi Google. Sehingga 20 September 2026, Google masih belum menerbitkan kad model, endpoint API, harga, atau penanda aras yang disahkan untuk Gemini 4 Pro. Nombor berasal dari sumber komuniti / penampakan Arena / kebocoran titik semak dalaman (nama kod berkaitan “argon”).
- Sebahagian helaian yang beredar sebelum ini kemudian ditandai sebagai ramalan atau disalin sebahagian. Anggap setiap peratusan khusus dan harga sebagai tidak disahkan sehingga Google mengesahkannya.
- Tetingkap konteks Claude Fable 5.1 disenaraikan di sini sebagai 200k, yang lebih rendah daripada angka 1M yang biasa dilaporkan dalam dokumentasi rasmi Anthropic. Ini mungkin mencerminkan tetapan penilaian tertentu atau ralat dalam helaian bocor.
- GPT-6 Astra dan Claude Fable 5.1 kekal sebagai satu-satunya model frontier yang sepenuhnya awam dan dinilai secara bebas sekarang. Penjejak pihak ketiga seperti Artificial Analysis masih menunjukkan mereka sepadan rapat secara keseluruhan (dengan kekuatan berbeza).
Realiti Praktikal Semasa (20 September 2026)
| Model | Status | Terbaik Untuk | Tahap Harga |
|---|---|---|---|
| Gemini 4 Pro | Belum dilancarkan (didakwa kuat) | Konteks panjang, pengekodan, agen, multimodal, kos | Sangat agresif (didakwa) |
| GPT-6 Astra | Dilancarkan | Matematik, penggunaan komputer, terminal, automasi, siber | Premium |
| Claude Fable 5.1 | Dilancarkan | Agen jangka panjang, penaakulan, kualiti pengekodan, kecekapan cache | Premium |
| Gemini 4 Flash / Flash-Lite | Didakwa adik-beradik | Kelajuan + beban kerja sensitif kos | Amat rendah |
Ringkasan Pantas
- Dominan merentas papan: Gemini 4 Pro menduduki #1 dalam setiap kategori yang disenaraikan, sering dengan margin jelas.
- Kekuatan khusus: Pengekodan/agen jangka panjang (DeepSWE, Terminal-bench), kerja pengetahuan, multimodal (video + carta), dan domain khusus (kewangan, perundangan, biologi, penggunaan komputer).
- Pemposisian harga: Kira-kira 1/5 harga GPT-6 Astra dan Claude Fable 5.1 pada input dan output, sambil menyampaikan skor lebih tinggi.
Astra menekankan penggunaan komputer, ambang keselamatan siber, dan penemuan saintifik; Fable 5.1 menekankan kerja pengetahuan jangka panjang dan pengekodan dengan perlindungan ditapis dan kos bacaan cache lebih rendah. Profil bocor Gemini 4 Pro kelihatan paling kuat pada kejuruteraan perisian agentik yang luas dan penaakulan multimodal.
Cara Pembangun Boleh Bersedia: Syor CometAPI
Sementara menunggu akses rasmi Gemini 4 Pro, pasukan mendapat manfaat daripada gerbang bersatu yang sudah menyokong frontier semasa (siri Gemini 3.x, GPT-6 Astra, Claude Fable 5.1 / Opus 5, dan 500+ model lain). CometAPI menyediakan perkara itu: satu endpoint serasi OpenAI, satu kunci API, pengebilan bayar mengikut penggunaan biasanya 20–40% di bawah kadar vendor langsung, dan keupayaan menukar model dengan perubahan satu parameter.
Aliran kerja praktikal:
- Prototip saluran paip agentik pada Gemini Flash/Pro semasa, GPT-6 Astra, dan Claude Fable 5.1 melalui CometAPI.
- Banding tanda aras arahan sama merentas model untuk mewujudkan garis dasar.
- Apabila Gemini 4 Pro (dan varian Flash) muncul dalam katalog CometAPI—secara sejarah platform menambah model Google baharu dengan pantas—tukar ID model dan jalankan semula penilaian dengan perubahan kod minimum.
- Gunakan papan pemuka kos untuk menjejak perbelanjaan token merentas pembekal dan hala trafik volum tinggi atau sensitif kependaman ke model paling ekonomik yang berkeupayaan.
Pendekatan ini menghapuskan pengurusan kunci berbilang, mengurangkan risiko penguncian vendor, dan memposisikan pasukan untuk mengguna pakai Gemini 4 Pro pada hari pertama ketersediaan awam.
Gemini 4 Pro, jika kebocoran terbukti tepat secara berarah, mewakili bidaan terkuat Google setakat ini untuk merampas semula frontier dalam kejuruteraan perisian agentik dan penaakulan multimodal konteks panjang. Gabungan prestasi yang didakwa, konteks besar, dan harga agresif akan menjadikannya pertimbangan lalai untuk banyak beban kerja produksi. Sehingga pelancaran rasmi dan penilaian bebas tiba, laluan bijak ialah pembandingan berterusan merentas model frontier sedia ada—mudah dilakukan melalui platform yang sudah menyatukan akses. Nantikan pengumuman rasmi; beberapa minggu akan datang berkemungkinan memperjelas sejauh mana gembar-gembur diterjemah kepada realiti produksi.
Soalan Lazim
Adakah Gemini 4 Pro telah dilancarkan?
Belum. Mengikut katalog terkini dan kenyataan Google (pertengahan hingga akhir September 2026), ia belum dilancarkan secara awam atau disenaraikan dengan ID model rasmi.
Bilakah tarikh keluaran yang dijangka untuk Gemini 4 Pro?
Pembocor menunjuk Oktober 2026 (dengan sedikit spekulasi hujung September). Google belum memberikan tarikh rasmi. Anggap ia sebagai tetingkap menunggu pengesahan melalui katalog API atau catatan blog.
Adakah Google mencapai RSI dengan Gemini 4 Pro?
Bukti umum menunjukkan penggunaan gelung agentik lanjutan untuk penapisan model dan penyelidikan ke arah penambahbaikan rekursif pada peringkat strategi (cth., Dream-RSI). Dakwaan RSI penuh yang menghasilkan model tidak disokong pengesahan bebas.
Bagaimana perbandingannya dengan GPT-6 Astra dan Claude Fable 5.1 pada penanda aras?
Carta komuniti yang bocor mendakwa mendahului pada beberapa suite agen/pengekodan. Skor rasmi bebas untuk Gemini 4 Pro yang dilancarkan masih belum wujud. Data awam semasa memihak kepada menilai model langsung (Astra dan Fable 5.1) pada tugas anda.
Patutkah saya menunggu Gemini 4 Pro sebelum membina?
Tidak. Hantar dengan model terkuat yang tersedia hari ini (boleh diakses melalui CometAPI atau API langsung), sediakan set penilaian, dan guna pakai model baharu jika dan apabila ujian bebas dan dalaman membenarkan pertukaran.
Di mana saya boleh mengakses model frontier semasa dengan mudah?
Penyedia bersatu seperti CometAPI menawarkan akses serasi OpenAI kepada model kelas GPT-6 Astra, Claude Fable 5.1, model Gemini semasa, dan lain-lain dengan pengebilan dipermudah dan penukaran dipermudah. Semak senarai model langsung dan dokumentasi untuk ID dan harga terkini.
