GPT-6.1 Sol are now live on CometAPI →
new/Riset CometAPI

Gemini 4 Argon: Benchmark, Fitur, Harga dan Akses API

Jelajahi benchmark Gemini 4 Argon, keluaran 1M token, keamanan, harga, ketersediaan, serta perbandingan dengan GPT-6 Astra dan Claude Opus 5.

CometAPI
AnnaTim riset model AI dan API
Diperbarui Oct 1, 2026 12 menit baca
Gemini 4 Argon: Benchmark, Fitur, Harga dan Akses API
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: Pada 30 September 2026, Google DeepMind mengumumkan Gemini 4 Argon, model frontier terbarunya dan awal dari seri Gemini 4. Model ini menghadirkan kinerja state-of-the-art dalam rekayasa perangkat lunak berjangka panjang (77,9% pada DeepSWE v1.1), pekerjaan pengetahuan tingkat perusahaan (memimpin Vals Index di 68,9%), dan keamanan siber defensif. Peningkatan kunci meliputi batas keluaran 1 juta token yang memimpin industri (naik dari 64K).

Poin-Poin Utama

  • Gemini 4 Argon adalah model paling mumpuni Google hingga kini, dioptimalkan untuk alur kerja kompleks multi-langkah dalam pengodean, pekerjaan pengetahuan legal/keuangan, dan pertahanan siber.
  • Argon dirancang untuk penalaran berkelanjutan di sepanjang alur kerja panjang dan multi-langkah, bukan sekadar chat bentuk pendek biasa. Google menekankan rekayasa perangkat lunak dunia nyata, pekerjaan legal dan keuangan, pemahaman multimodal, serta pertahanan keamanan siber.
  • Google memperluas output maksimum dari level 64K token sebelumnya menjadi 1 juta token. Google belum memublikasikan spesifikasi Gemini API publik lengkap untuk konteks input Argon, modalitas, perilaku endpoint, atau batas laju.
  • Pada tabel perbandingan Google, Argon mencetak 68,9% pada Vals Index, 77,9% pada DeepSWE v1.1, 91,7% pada LVBench, dan 68% pada CWE-bench v1. Argon tidak memimpin setiap tes: GPT-6 Astra memenangkan FrontierSWE v2 dan Terminal-Bench Science, sementara Claude Opus 5.5 memimpin Terminal-Bench 4.0 dan PostTrainBench.
  • Harga API pengantar Google adalah $2 per juta token input dan $10 per juta token output. Setelah periode pengantar, harga naik menjadi $4 dan $20. Input yang di-cache diiklankan 95% di bawah harga token input yang berlaku.
  • Katalog publik CometAPI mencantumkan gemini-4-argon sebagai tersedia, bukan akan datang, pada 1 Oktober 2026.

Google merebut kembali posisi terdepan dalam perlombaan AI frontier dengan peluncuran Gemini 4 Argon. Diumumkan pada 30 September 2026, model ini menandai dimulainya era Gemini 4 dan secara eksplisit diposisikan sebagai “era berikutnya dari kecerdasan frontier” Google. Model ini menargetkan beban kerja dunia nyata yang paling sulit: pengodean agentik berkelanjutan, pekerjaan pengetahuan perusahaan berisiko tinggi (legal, keuangan, pajak), dan keamanan siber defensif.

Berbeda dari pembaruan inkremental sebelumnya, Argon memperkenalkan perubahan mendasar dalam kedalaman kapabilitas melalui panjang keluaran yang diperluas secara dramatis dan pelatihan khusus untuk tugas berjangka panjang. Ribuan karyawan Google telah menggunakannya secara internal untuk pekerjaan rekayasa produksi, sementara akses eksternal dimulai secara sempit dengan mitra keamanan siber terverifikasi.

Apa itu Gemini 4 Argon?

Gemini 4 Argon adalah model bahasa besar frontier terbaru Google DeepMind dan rilis pertama dalam keluarga Gemini 4. Model ini dirancang secara khusus untuk mempertahankan penalaran mendalam di seluruh alur kerja kompleks, multi-langkah, dan berjangka panjang yang sebelumnya sulit diselesaikan secara andal dalam satu trajektori.

Menurut Google, Argon “menghadirkan kinerja frontier dalam alur kerja kompleks di seluruh rekayasa perangkat lunak dunia nyata, pekerjaan pengetahuan perusahaan seperti legal dan keuangan, serta pertahanan keamanan siber.” Model ini dibangun berdasarkan pelajaran dari upaya Gemini 3.5 Pro yang tertunda atau dibatalkan pada awal 2026 dan fokus berikutnya pada seri Gemini 3.8 Flash.

Model ini menekankan kapabilitas agentik—perencanaan otonom, penggunaan alat, pembuatan dan penyuntingan kode, penemuan dan remediasi kerentanan, analisis multi-dokumen, dan pemahaman video panjang—sembari mengintegrasikan sistem keamanan yang lebih kuat untuk daya tingkat frontier.

Secara internal, Argon sudah memberikan dampak terukur pada skala Google:

  • Tim komputasi kuantum menggunakannya untuk mengoptimalkan sumber daya ruang-waktu (qubits × gates), mengalahkan baseline yang dipublikasikan sebesar 40% dalam hitungan menit.
  • Tim agen menganalisis telemetri armada dan secara otonom menerapkan optimasi memori, membebaskan lebih dari 300 TiB memori di seluruh pusat data (dengan estimasi penghematan total 500 TiB hingga 1 PiB).
  • Migrasi kode skala besar dari C/C++ ke Rust sedang berlangsung, termasuk puluhan ribu baris di pustaka inti (re2, libgav1) dan lebih dari 800.000 baris di kernel Fuchsia Zircon. Salah satu hasil mencolok: decoder video aman-memori (libgav1) yang berjalan 2,7× lebih cepat daripada port Rust sebelumnya setelah optimasi berbasis profil.

Penerapan dunia nyata ini menegaskan bahwa Argon bukan sekadar juara benchmark, melainkan pengali produktivitas praktis bagi organisasi rekayasa yang kompleks.

Aksesibilitas Gemini 4 Argon per 1 Oktober

Google mengambil pendekatan rilis bertahap secara sengaja karena kapabilitas model yang maju. Saat ini model ini diluncurkan ke sekelompok pembela siber tepercaya melalui Program Fairwind (yang telah mendaftarkan lebih dari 650 organisasi, termasuk perusahaan keamanan besar). Google juga berpartisipasi dalam proses akses model pra-rilis sukarela pemerintah AS. Ketersediaan yang lebih luas bagi pengembang, perusahaan, dan konsumen—dimulai dengan pelanggan API berbayar dan pelanggan Google AI Ultra—diharapkan “secepatnya” setelah iterasi pagar pengaman lebih lanjut berdasarkan umpan balik awal.

Fitur Utama Gemini 4 Argon

1. Penalaran Jangka Panjang dengan Hingga 1M Token Output

Google menyatakan output maksimum Argon adalah 1 juta token, naik dari 64.000 token pada generasi sebelumnya. Ini adalah batas generasi maksimum, bukan pernyataan bahwa setiap respons harus sangat besar. Batas ini memberi ruang bagi model untuk trajektori penalaran panjang, pembuatan kode multi-berkas, riset mendalam, atau kerja agen berkepanjangan tanpa memaksa permintaan baru setiap beberapa langkah.

Gemini 4 Argon: Benchmark, Fitur, Harga dan Akses API

2. Rekayasa Perangkat Lunak Dunia Nyata

Skor 77,9% Argon pada DeepSWE v1.1 adalah nilai tertinggi di tabel perbandingan Google. DeepSWE berfokus pada pekerjaan rekayasa perangkat lunak berjangka panjang, yang lebih sesuai dengan agen pengodean otonom dibandingkan tes penyelesaian kode pendek. Model ini juga mencapai 91,9% pada Vibe Code Bench.

Gambarnya tidak sepihak. GPT-6 Astra mencetak 65,5% pada FrontierSWE v2 versus 55,0% untuk Argon, dan Claude Opus 5.5 mencetak 66,4% pada Terminal-Bench 4.0 versus 57,4% untuk Argon. Karena itu, pembeli sebaiknya menguji pengeditan repositori, penggunaan shell, debugging, dan pekerjaan migrasi secara terpisah alih-alih mengandalkan satu skor “pengodean”.

Gemini 4 Argon: Benchmark, Fitur, Harga dan Akses API

3. Pekerjaan Pengetahuan Perusahaan

Google melaporkan Argon pada 68,9% di Vals Index, yang memberi bobot pada pekerjaan keuangan, pengodean, legal, dan pajak berdasarkan kontribusi terhadap PDB AS. Model ini juga memimpin model yang dibandingkan pada Vals Finance Agent v2, Harvey's Legal Agent Benchmark, dan AutomationBench.

Evaluasi ini membuat Argon sangat relevan untuk alur kerja yang berat riset: due diligence, peninjauan kontrak, analisis keuangan, riset pajak, dan sintesis lintas dokumen. Evaluasi tersebut tidak menghilangkan kebutuhan verifikasi sumber atau tinjauan profesional. Kepemimpinan benchmark mengukur performa di bawah harness tertentu; itu tidak menetapkan kesesuaian untuk keputusan legal atau finansial tanpa pengawasan.

4. Pemahaman Multimodal dan Video Panjang

Argon mencetak 71,6% pada Chartography dan 91,7% pada LVBench, sedikit memimpin GPT-6 Astra pada pemahaman bagan dan lebih jelas memimpin pada pemahaman video panjang. Google juga menggambarkan alur kerja di mana Argon menafsirkan rangkaian dokumen dan bertindak berdasarkan hasilnya.

Kombinasi ini berguna ketika teks saja tidak cukup: menganalisis grafik pendapatan bersama pengajuan, mengekstrak bukti dari jam-jam video, meninjau tangkapan layar produk dengan persyaratan tertulis, atau merekonsiliasi data di seluruh PDF dan laporan visual.

5. Keamanan Siber Defensif

Google melatih Argon untuk menemukan, memvalidasi, dan menambal kerentanan kritis. Pada CWE-bench v1, Argon dan GPT-6 Astra sama-sama mencetak 68%, sementara Claude Opus 5.5 mencetak 67%. Google mengatakan Argon juga melampaui Gemini 3.8 Flash Cyber dalam evaluasi internal penemuan kerentanan dan pengujian penetrasi kotak hitam.

Akses awal mencerminkan risikonya. Pembela siber tepercaya dapat menggunakan model ini melalui Program Fairwind, dan Google mengatakan Wiz menggunakan Argon dalam inisiatif Scan for Good untuk mengidentifikasi kerentanan kritis yang memengaruhi perangkat lunak layanan kesehatan. Distribusi terbatas memberi Google waktu untuk mengumpulkan bukti sebelum mengekspos kapabilitas siber tingkat lanjut secara lebih luas.

6. Tingkat halusinasi turun menjadi 10%.

Gemini 4 Argon memiliki tingkat halusinasi yang sangat rendah pada Artificial Analysis. 15%. Arena melaporkan estimasi halusinasi alat sebesar 0.10% +/- 0.48% untuk Gemini 4 Argon High, dibandingkan 0.16% +/- 0.09% untuk Gemini 3.8 Flash High. Estimasi titiknya lebih rendah, yang menunjukkan peningkatan. Namun, interval ketidakpastiannya tumpang tindih secara substansial, dan interval Argon jauh lebih lebar.

Gemini 4 Argon: Benchmark, Fitur, Harga dan Akses API

Kinerja Benchmark Gemini 4 Argon

Angka-angka berikut berasal dari tabel perbandingan Google DeepMind. Google menautkan dokumen metodologi terpisah dan menyatakan bahwa skor adalah pass@1 kecuali disebutkan lain. Perlakukan ini sebagai hasil yang dipublikasikan vendor dan validasi terhadap beban kerja privat.

BenchmarkBeban kerjaGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Pemimpin
Vals IndexPekerjaan pengetahuan berbobot PDB68,9%63,1%67,0%Argon
AutomationBenchOtomasi bisnis end-to-end51,3%41,4%42,5%Argon
Vals Finance Agent v2Riset keuangan multi-langkah65,4%53,5%58,6%Argon
Harvey Legal AgentRiset dan penyusunan hukum19,6%5,4%3,8%Argon
DeepSWE v1.1Rekayasa perangkat lunak jangka panjang77,9%74,1%74,2%Argon
FrontierSWE v2Pengodean agentik55,0%65,5%62,3%Astra
Terminal-Bench 4.0Pekerjaan agen berbasis terminal57,4%58,2%66,4%Opus
Terminal-Bench Science 0.1Agen sains dan matematika57,6%68,1%63,3%Astra
GraphWalks, 256K-1MPenelusuran graf konteks panjang, F184,2%71,8%66,8%Argon
Agent's Last ExamPenggunaan komputer39,5%34,2%38,2%Argon
OSWorld 2.0 offline subsetPenggunaan komputer, skor parsial69,2%72,6%Tidak dilaporkanAstra
ChartographyPemahaman bagan71,6%71,0%66,3%Argon
LVBenchPemahaman video panjang91,7%87,5%83,7%Argon
CWE-bench v1Perbaikan kerentanan68,0%68,0%67,0%Seri

Cara Membaca Hasil

Keunggulan paling jelas Argon adalah keluasan di seluruh pekerjaan pengetahuan profesional, konteks panjang, analisis bagan, dan video panjang. Hasil agen legal 19,6% milik Argon lebih dari tiga kali skor 5,4% Astra, meskipun ketiga skor absolut menunjukkan bahwa benchmark ini tetap sulit. Argon juga memimpin AutomationBench dengan 8,8 poin persentase atas Opus 5.5.

Pengodean membutuhkan kesimpulan yang lebih bernuansa. Argon memimpin DeepSWE dan Vibe Code Bench, tetapi Astra memimpin FrontierSWE, dan Opus memimpin Terminal-Bench 4.0. Untuk pekerjaan terminal berorientasi sains, Astra memimpin Argon sebesar 10,5 poin. Judul yang benar bukan “Argon memenangkan setiap benchmark.” Judul yang tepat adalah bahwa Argon sangat kuat di seluruh alur kerja perusahaan berjangka panjang sementara para pesaing tetap memiliki keunggulan penting yang spesifik tugas.

Gemini 4 Argon: Benchmark, Fitur, Harga dan Akses API

Bukti benchmark kuat namun tidak universal. GPT-6 Astra tetap unggul pada beberapa ukuran sains, pengodean, dan penggunaan komputer, sementara Claude Opus 5.5 memimpin tes terminal dan rekayasa ML penting.Bukti independen juga bernuansa serupa: Artificial Analysis menempatkan Argon #8 dari 223 model dalam kelas perbandingannya, dan Arena menempatkan Gemini 4 Argon High #8 dari 46 model agen sambil menempatkannya pertama pada steerability. Keunggulan terbesar Argon adalah kombinasi penalaran berjangka panjang, performa domain perusahaan, dan kedalaman multimodal pada harga yang diumumkan agresif.

Apakah Gemini 4 Argon Tersedia?

Per pengumuman (30 September 2026) dan peliputan berikutnya, belum—bukan untuk publik umum atau pengembang standar. Akses dibatasi untuk:

  • Anggota tepercaya Program Fairwind (pembela siber, pemerintah, mitra infrastruktur kritis).
  • Tim internal Google.
  • Peserta dalam proses akses model pra-rilis sukarela pemerintah AS.

Google menyatakan akan memperluas “secepatnya” setelah mengumpulkan umpan balik dan melakukan iterasi pada pagar pengaman, dimulai dengan pelanggan API berbayar dan pelanggan Google AI Ultra, kemudian akses pengembang, perusahaan, dan konsumen yang lebih luas. Tidak ada tanggal publik tetap yang diberikan

Harga API Gemini 4 Argon

Harga pengantar Google adalah $2 per juta token input dan $10 per juta token output. Tarif pasca-pengantar adalah $4 input dan $20 output. Input yang di-cache dihargai dengan diskon 95% dari tarif input yang berlaku, yang menyiratkan $0,10 per juta selama periode pengantar dan $0,20 setelahnya jika kebijakan diterapkan persis seperti yang diumumkan.

Harganya menarik dibandingkan model frontier premium lainnya, tetapi biaya per token bukan biaya per tugas yang diselesaikan. Model yang menghasilkan ratusan ribu token output atau melakukan banyak panggilan alat masih bisa membuat tagihan besar. Tetapkan batas output, pantau loop alat, dan ukur biaya per hasil yang diterima.

Cara Mengakses API Gemini 4 Argon melalui CometAPI

Setelah Google membuka akses API yang lebih luas, platform yang mengagregasi model frontier menjadi cara tercepat dan sering kali paling hemat biaya bagi pengembang untuk bereksperimen dan memproduksi.

CometAPI menyediakan endpoint terpadu yang kompatibel dengan OpenAI untuk 500+ model dari OpenAI, Anthropic, Google, dan lainnya. Ini berarti Anda dapat beralih antara model Gemini, varian GPT-6, dan model Claude hanya dengan mengubah parameter model—tanpa mengelola banyak akun, sistem penagihan, atau SDK.

Langkah yang direkomendasikan untuk bersiap dan mengakses via CometAPI:

  1. Daftar di cometapi.com dan buat kunci API dari dasbor (diawali dengan sk-).
  2. Gunakan URL dasar https://api.cometapi.com/v1.
  3. Panggil model dengan SDK OpenAI standar atau format Gemini native.

CometAPI sudah mendukung keluarga Gemini (termasuk model Pro dan Flash sebelumnya) dengan harga kompetitif, kredit uji coba gratis, dan peralihan tanpa hambatan. Periksa halaman Models CometAPI secara berkala untuk ketersediaan Gemini 4 Argon. Pendekatan ini menghindari friksi onboarding Google Cloud dan memungkinkan pengujian A/B yang mudah terhadap Claude Opus 5.5 atau GPT-6 Astra dalam basis kode yang sama.

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5

KategoriGemini 4 ArgonGPT-6 AstraClaude Opus 5.5
PenyediaGoogleOpenAIAnthropic
Status rilis pada 1 Okt 2026Peluncuran terbatas untuk penguji tepercaya; akses lebih luas akan datangModel API aktifModel terbaru aktif; dirilis 22 Sept 2026
Kecocokan terbaikPekerjaan pengetahuan jangka panjang, analisis multimodal, pertahanan siber, output besarPenalaran kompleks, sains, penggunaan komputer, ekosistem alat luasPengodean agentik dan pekerjaan pengetahuan jangka panjang
Konteks inputBelum dipublikasikan sebagai spesifikasi API publik final1,050,000 tokens1,000,000 tokens
Output maksimum1,000,000 tokens128,000 tokens128,000 sinkron; 300,000 Batch beta
Input dan outputKapabilitas multimodal disebutkan; matriks API publik terperinci tertundaTeks dan gambar masuk; teks keluarTeks dan gambar masuk; teks keluar
Kontrol penalaranPenalaran jangka panjang; kontrol API publik tertundaupaya penalaran rendah hingga maksimumAdaptive thinking selalu aktif; upaya default sedang
Harga standar per 1M tokensIntro: $2 input / $10 output; kemudian $4 / $20$10 input / $50 output$4 input / $20 output
Kemenangan menonjol di tabel GoogleVals, AutomationBench, DeepSWE, konteks panjang, LVBenchFrontierSWE, pekerjaan terminal sains, subset OSWorldTerminal-Bench 4.0, PostTrainBench
Catatan utamaKetersediaan API luas dan spesifikasi penuh masih dalam proses peluncuranHarga daftar tertinggi dari ketiganyaTidak memimpin tabel pekerjaan pengetahuan Google; adaptive thinking tidak dapat dinonaktifkan

Model Mana yang Terbaik?

Pilih Gemini 4 Argon ketika pekerjaan pengetahuan ber-konteks panjang, bukti multimodal, pertahanan siber, atau artefak terbangun sangat besar mendominasi beban kerja. Pilih GPT-6 Astra ketika Anda membutuhkan permukaan alat OpenAI yang matang, performa agen sains yang kuat, atau kekuatan penggunaan komputernya yang spesifik. Pilih Claude Opus 5.5 untuk pengodean agentik native Claude dan alur kerja terminal, terutama ketika perilakunya sudah berkinerja baik dalam harness evaluasi Anda.

Bagi sebagian besar bisnis, strategi yang lebih baik bukan keputusan model tunggal permanen. Rute permintaan rutin ke model berbiaya lebih rendah, evaluasi Argon, Astra, dan Opus pada ekor yang sulit, dan pertahankan fallback. CometAPI berguna di sini karena satu lapisan integrasi dapat mempermudah pengujian lintas model dan perutean terkontrol.

Kesimpulan

Gemini 4 Argon menandai re-entry terkuat Google ke frontier absolut, merebut kepemimpinan pada beberapa benchmark kritis perusahaan dan jangka panjang sambil memperkenalkan kemajuan praktis seperti 1M token output dan harga pengantar agresif. Rilis bertahap yang mengutamakan keamanan memprioritaskan penerapan yang bertanggung jawab atas kapabilitas pertahanan siber yang kuat.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Oct 1, 2026
Terakhir diperbarui Oct 1, 2026
66 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Baca Selengkapnya