Spesifikasi teknis Gemini 4 Argon
| Spesifikasi | Gemini 4 Argon |
|---|---|
| Provider | Google DeepMind |
| Keluarga model | Gemini 4 |
| ID model | gemini-4-argon |
| Jenis model | Frontier multimodal reasoning model |
| Fokus utama | Alur kerja kompleks, pengodean agenik, pekerjaan pengetahuan perusahaan, keamanan siber |
| Kapabilitas multimodal | Google menggambarkan pemahaman multimodal; halaman model publik belum menyediakan skema modalitas API yang lengkap |
| Output maksimum | Hingga 1,000,000 token, menurut daftar API pihak ketiga saat ini; ini tidak boleh disamakan dengan jendela konteks input |
| Jendela konteks input | Tidak dipublikasikan dengan jelas oleh Google pada halaman model publik saat ini |
| Ketersediaan API publik | Akses terbatas/prarilis; Google belum mengumumkan tanggal rilis publik umum |
Apa itu Gemini 4 Argon?
Gemini 4 Argon adalah model andalan yang menjadi penopang generasi Gemini 4 milik Google. Google menggambarkannya sebagai dirancang untuk performa terdepan pada beban kerja yang kompleks, termasuk rekayasa perangkat lunak, pekerjaan pengetahuan perusahaan, dan pertahanan keamanan siber. Set evaluasi yang dipublikasikan mencakup pekerjaan pengetahuan, pengodean agenik, sains dan matematika, penggunaan komputer, pemahaman multimodal, tugas konteks panjang, dan keamanan siber.
Posisi Argon secara khusus berorientasi pada alur kerja, bukan sekadar tanya jawab percakapan. Google menonjolkan kemampuan untuk mempertahankan tugas yang panjang dan bertahap serta beroperasi di berbagai alur kerja rekayasa perangkat lunak dan perusahaan yang kompleks.
Fitur utama Gemini 4 Argon
- Penalaran alur kerja yang kompleks: Dirancang untuk tugas panjang dan bertahap yang memerlukan penalaran berkelanjutan, bukan satu jawaban singkat.
- Pengodean agenik: Google melaporkan hasil yang kuat pada DeepSWE v1.1, Vibe Code Bench, dan evaluasi pengodean lainnya.
- Pekerjaan pengetahuan perusahaan: Evaluasi yang dipublikasikan mencakup tugas keuangan dan agen hukum serta otomasi bisnis end-to-end.
- Pemahaman multimodal: Google melaporkan hasil yang kuat pada Chartography dan LVBench, mencakup pemahaman multimodal dan video panjang.
- Performa konteks panjang: Hasil GraphWalks dilaporkan untuk rentang hingga 128K dan 256K hingga 1M token.
- Pertahanan keamanan siber: Google secara khusus memposisikan Argon untuk keamanan siber defensif dan melaporkan hasil CWE-bench v1 untuk perbaikan kerentanan.
Kinerja benchmark Gemini 4 Argon
Google DeepMind melaporkan hasil berikut pada halaman evaluasi Gemini 4 Argon saat ini. Ini adalah hasil yang dipublikasikan oleh vendor dan sebaiknya dibandingkan hanya dalam metodologi benchmark yang dinyatakan. [1]
| Benchmark | Kategori | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | Pekerjaan pengetahuan | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | Pekerjaan pengetahuan | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | Pekerjaan pengetahuan | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | Pekerjaan pengetahuan | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | Pengodean agenik | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | Pengodean agenik | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | Pengodean agenik | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | Pengodean agenik | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | Sains & matematika | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | Sains & matematika | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | Sains & matematika | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | Konteks panjang | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | Konteks panjang | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | Pemahaman multimodal | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | Pemahaman multimodal | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | Keamanan siber | 68.0% | 68.0% | 58.0% | 67.0% |
Hasil menunjukkan bahwa kinerja Argon bervariasi menurut tugas: model ini memimpin perbandingan yang dikutip pada beberapa evaluasi pekerjaan pengetahuan, pengodean, sains, konteks panjang, dan multimodal, sementara model lain meraih skor lebih tinggi pada benchmark pengodean, sains, atau penggunaan komputer tertentu. Hasil tersebut tidak boleh digabungkan menjadi satu peringkat keseluruhan.
Gemini 4 Argon vs GPT-6 Astra vs Claude Fable 5.1
| Bidang | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| Pekerjaan pengetahuan | Hasil yang kuat pada Vals, AutomationBench, evaluasi keuangan, dan agen hukum | Kuat pada set evaluasi yang sama | Kuat pada beberapa evaluasi pekerjaan pengetahuan |
| Pengodean agenik | 77.9% pada DeepSWE v1.1; 91.9% pada Vibe Code Bench | 74.1% pada DeepSWE v1.1; 89.6% pada Vibe Code Bench | 67.4% pada DeepSWE v1.1; 90.3% pada Vibe Code Bench |
| Konteks panjang | 99.7% pada GraphWalks hingga 128K; 84.2% dari 256K–1M | Masing-masing 98.7% dan 71.8% | Masing-masing 91.4% dan 65.0% |
| Pemahaman multimodal | 71.6% pada Chartography; 91.7% pada LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| Keamanan siber | 68.0% pada CWE-bench v1 | 68.0% | 58.0% |
Perbandingan ini spesifik terhadap benchmark. Misalnya, GPT-6 Astra memperoleh skor lebih tinggi daripada Argon pada FrontierSWE v2 dan Terminal-Bench Science 0.1, sementara Argon mencetak skor lebih tinggi pada DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M, dan LVBench.
Kasus penggunaan representatif
- Rekayasa perangkat lunak skala repositori — pengodean jangka panjang, refaktorisasi, debug, dan pengembangan agenik.
- Alur kerja pengetahuan perusahaan — riset hukum, analisis keuangan, dan otomasi proses bisnis.
- Pertahanan keamanan siber — penemuan, validasi, dan perbaikan kerentanan dalam lingkungan terkontrol.
- Alur kerja sains dan matematika — tugas-tugas yang tercermin dalam LABBench, RiemannBench, dan evaluasi berorientasi sains.
- Analisis video panjang dan multimodal — beban kerja yang memerlukan interpretasi lintas informasi visual dan temporal.
- Agen konteks panjang — aplikasi yang perlu mempertahankan informasi di sepanjang lintasan tugas yang sangat besar.