Spesifikasi teknikal Gemini 4 Argon
| Spesifikasi | Gemini 4 Argon |
|---|---|
| Penyedia | Google DeepMind |
| Keluarga model | Gemini 4 |
| ID model | gemini-4-argon |
| Jenis model | Model penaakulan multimodal barisan hadapan |
| Fokus utama | Aliran kerja kompleks, pengkodan beragens, kerja pengetahuan perusahaan, keselamatan siber |
| Keupayaan multimodal | Google menerangkan pemahaman multimodal; halaman model awam belum menyediakan skema modaliti API yang lengkap |
| Output maksimum | Sehingga 1,000,000 token, menurut penyenaraian API pihak ketiga semasa; ini tidak harus dikelirukan dengan tetingkap konteks input |
| Tetingkap konteks input | Tidak diterbitkan dengan jelas oleh Google pada halaman model awam semasa |
| Ketersediaan API awam | Akses terhad/pra keluaran; Google belum mengumumkan tarikh keluaran umum |
Apakah Gemini 4 Argon?
Gemini 4 Argon ialah model utama yang menjadi tonggak generasi Gemini 4 Google. Google menerangkannya sebagai direka untuk prestasi barisan hadapan bagi beban kerja kompleks, termasuk kejuruteraan perisian, kerja pengetahuan perusahaan dan pertahanan keselamatan siber. Set penilaiannya yang diterbitkan merangkumi kerja pengetahuan, pengkodan beragens, sains dan matematik, penggunaan komputer, pemahaman multimodal, tugasan konteks panjang dan keselamatan siber.
Kedudukan Argon jelas berorientasikan aliran kerja dan tidak terhad kepada soal jawab perbualan. Google menekankan keupayaannya untuk mengekalkan tugasan panjang berbilang langkah dan beroperasi merentas aliran kerja kejuruteraan perisian serta perusahaan yang kompleks.
Ciri utama Gemini 4 Argon
- Penaakulan aliran kerja kompleks: Direka untuk tugasan panjang berbilang langkah yang memerlukan penaakulan berterusan, bukan sekadar satu respons ringkas.
- Pengkodan beragens: Google melaporkan keputusan kukuh pada DeepSWE v1.1, Vibe Code Bench dan penilaian pengkodan lain.
- Kerja pengetahuan perusahaan: Penilaian yang diterbitkan merangkumi tugasan kewangan dan agen perundangan serta automasi perniagaan hujung ke hujung.
- Pemahaman multimodal: Google melaporkan keputusan kukuh pada Chartography dan LVBench, meliputi pemahaman multimodal dan video panjang.
- Prestasi konteks panjang: Keputusan GraphWalks dilaporkan bagi julat sehingga 128K dan 256K hingga 1M token.
- Pertahanan keselamatan siber: Google secara khusus memposisikan Argon untuk keselamatan siber defensif dan melaporkan keputusan CWE-bench v1 bagi pemulihan kelemahan.
Prestasi penanda aras Gemini 4 Argon
Google DeepMind melaporkan keputusan berikut pada halaman penilaian Gemini 4 Argon semasa. Ini ialah keputusan yang diterbitkan vendor dan hanya patut dibandingkan dalam metodologi penanda aras yang dinyatakan. [1]
| Penanda aras | Kategori | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | Kerja pengetahuan | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | Kerja pengetahuan | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | Kerja pengetahuan | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | Kerja pengetahuan | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | Pengkodan beragens | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | Pengkodan beragens | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | Pengkodan beragens | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | Pengkodan beragens | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | Sains & matematik | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | Sains & matematik | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | Sains & matematik | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | Konteks panjang | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | Konteks panjang | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | Pemahaman multimodal | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | Pemahaman multimodal | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | Keselamatan siber | 68.0% | 68.0% | 58.0% | 67.0% |
Keputusan menunjukkan bahawa prestasi Argon berbeza mengikut tugasan: ia mendahului perbandingan yang dirujuk dalam beberapa penilaian kerja pengetahuan, pengkodan, sains, konteks panjang dan multimodal, manakala model lain memperoleh markah lebih tinggi pada penanda aras pengkodan, sains atau penggunaan komputer tertentu. Keputusan ini tidak wajar diringkaskan menjadi satu kedudukan keseluruhan.
Gemini 4 Argon vs GPT-6 Astra vs Claude Fable 5.1
| Bidang | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| Kerja pengetahuan | Keputusan kukuh yang diterbitkan merentas Vals, AutomationBench, kewangan dan penilaian agen perundangan | Kukuh pada set penilaian yang sama | Kukuh pada beberapa penilaian kerja pengetahuan |
| Pengkodan beragens | 77.9% pada DeepSWE v1.1; 91.9% pada Vibe Code Bench | 74.1% pada DeepSWE v1.1; 89.6% pada Vibe Code Bench | 67.4% pada DeepSWE v1.1; 90.3% pada Vibe Code Bench |
| Konteks panjang | 99.7% pada GraphWalks sehingga 128K; 84.2% bagi 256K–1M | 98.7% dan 71.8% masing-masing | 91.4% dan 65.0% masing-masing |
| Pemahaman multimodal | 71.6% Chartography; 91.7% LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| Keselamatan siber | 68.0% pada CWE-bench v1 | 68.0% | 58.0% |
Perbandingan ini khusus mengikut penanda aras. Sebagai contoh, GPT-6 Astra memperoleh markah lebih tinggi daripada Argon pada FrontierSWE v2 dan Terminal-Bench Science 0.1, manakala Argon memperoleh markah lebih tinggi pada DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M dan LVBench.
Kes penggunaan representatif
- Kejuruteraan perisian skala repositori — Pengkodan jangka panjang, pembaikan semula (refactoring), penyahpepijatan dan pembangunan beragens.
- Aliran kerja pengetahuan perusahaan — Penyelidikan perundangan, analisis kewangan dan automasi proses perniagaan.
- Pertahanan keselamatan siber — Penemuan, pengesahan dan pemulihan kelemahan dalam persekitaran terkawal.
- Aliran kerja sains dan matematik — Tugasan yang dicerminkan oleh LABBench, RiemannBench dan penilaian berorientasikan sains.
- Analisis video panjang dan multimodal — Beban kerja yang memerlukan tafsiran merentas maklumat visual dan masa.
- Agen konteks panjang — Aplikasi yang perlu mengekalkan maklumat merentas trajektori tugasan yang sangat besar.