GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Riset CometAPI

Apakah Gemini 4 sudah mengalahkan GPT-6 dan Claude Fable 5.1? Penjelasan benchmark yang bocor

Gemini 4 akan mengungguli GPT-6 Astra dari OpenAI dan Claude Fable 5.1 dari Anthropic pada tolok ukur kunci untuk agen dan pengkodean, dengan sebagian mengaitkan peningkatan tersebut dengan RSI.

CometAPI
AnnaTim riset model AI dan API
Diperbarui Sep 20, 2026 12 menit baca
Apakah Gemini 4 sudah mengalahkan GPT-6  dan Claude Fable 5.1? Penjelasan benchmark yang bocor
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Tolok ukur yang bocor dan pengujian terselubung Arena.ai pada pertengahan September 2026 menempatkan Gemini 4 Pro milik Google yang belum dirilis sebagai pemimpin frontier baru, melampaui GPT-6 Astra dan Claude Fable 5.1 pada rekayasa perangkat lunak, tugas agenik, pekerjaan pengetahuan, penalaran, dan tolok ukur multimodal.

Poin Penting

  • Gemini 4 Pro memimpin evaluasi yang bocor pada DeepSWE v1.1 (88.7%), GDPval-AA v2 (2064 Elo), Terminal-bench 2.1 (95.3%), OSWorld-2.0 (86.8%), dan berbagai suite agenik/penalaran lainnya.
  • Ia menekan harga daftar GPT-6 Astra ($12/$60) dan Claude Fable 5.1 ($10/$50) sambil menyamai atau melampaui jendela konteks kelas 1M mereka.
  • Pengujian terselubung di Arena.ai dengan nama placeholder (mis. gemini-3.8-flash) menghasilkan demo SVG, Three.js, dan coding agenik yang menonjol.
  • Rumor RSI (recursive self-improvement) beredar tetapi tidak ada bukti publik tentang peningkatan model otonom loop tertutup untuk Gemini 4 itu sendiri.
  • Google telah mengonfirmasi investasi besar pada model dasar Gemini 4 yang lebih besar; waktu peluncuran publik masih belum resmi.
  • Platform seperti CometAPI sudah mengagregasi Gemini, GPT-6 Astra, Claude Fable/Opus, dan ratusan model lain di balik satu endpoint yang kompatibel dengan OpenAI dengan tarif kompetitif—ideal untuk membandingkan frontier baru saat dirilis.

Apa yang Kita Ketahui Tentang Gemini 4? (Kebocoran, Sumber, dan Konteks Terverifikasi)

Per 20 September 2026, Gemini 4 Pro belum menerima pengumuman resmi Google, kartu model, atau endpoint API publik. Segala sesuatu di luar pernyataan Google sebelumnya tentang investasi pada “model dasar Gemini 4 yang lebih besar” (pendapatan Juli 2026) berasal dari kebocoran komunitas, uji buta Arena.ai, dan tabel tolok ukur yang beredar.

Sumber dan klaim kunci meliputi:

  • Leaker Pankaj Kumar dan postingan berikutnya (sekitar awal hingga pertengahan September) merujuk pada checkpoint Pro internal dengan perkiraan rilis publik Oktober dan kemungkinan varian Flash-Lite lebih awal.
  • Banyak pengembang melaporkan menarik model berkapabilitas tinggi yang diberi label “gemini-3.8-flash” (atau placeholder serupa) di Arena.ai. Keluaran mencakup pembuatan SVG kompleks (mis. pelikan bersepeda, kupu-kupu mekanis di Three.js), pembuatan JSON panjang non-repetitif, dan perilaku agenik yang kuat. Beberapa pengguna mengklaim detail backend seperti konteks multi-juta token, batas keluaran 256k, memori lintas sesi, dan kemampuan alat/internet bawaan.
  • Tabel perbandingan yang banyak dibagikan mencantumkan Gemini 4 Pro versus Gemini 4 Flash, Gemini 4 Flash-Lite, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5, dan GPT-5.6 Sol.
  • Google belum mengonfirmasi pengujian Arena atau tabel tersebut. Pola historis menunjukkan perusahaan sering menjalankan evaluasi terselubung di platform publik beberapa minggu sebelum peluncuran formal.

Apakah Gemini 4 sudah mengalahkan GPT-6  dan Claude Fable 5.1? Penjelasan benchmark yang bocor

Jendela konteks

Tabel yang bocor menunjukkan 2M token input maksimum untuk keluarga Gemini 4—dua kali lipat 1M milik GPT-6 Astra dan jauh di atas 200k lini Claude Fable/Opus 5 (beberapa varian Claude telah menawarkan jendela efektif yang lebih besar melalui mekanisme lain). Klaim “ghost-routing” terpisah menyebut batas 10M; ini belum terverifikasi.

Harga Gemini 4 (Angka Bocoran)

Tabel yang beredar mencantumkan:

  • Gemini 4 Pro: $2.25 input / $11.25 output per 1M token (tanpa cache).
  • Gemini 4 Flash: $0.75 / $3.75.
  • Gemini 4 Flash-Lite: $0.35 / $1.75.

Angka-angka ini secara substansial lebih rendah daripada $12/$60 yang dilaporkan untuk GPT-6 Astra dan $10/$50 milik Claude Fable 5.1 (Fable 5.1 menawarkan diskon pembacaan cache agresif yang dapat menurunkan biaya efektif untuk beban kerja agenik). Harga resmi Gemini 3.x Pro saat ini berada di kisaran $2–$4 input / $12–$18 output bergantung pada panjang konteks, sehingga angka Pro yang bocor ini masuk akal sebagai penyesuaian generasi berikutnya.

Harga publik yang sebenarnya baru akan diketahui saat peluncuran. Secara historis Google menggunakan tarif token kompetitif dan paket gratis untuk mendorong adopsi.

Kinerja Gemini 4 Pro: Telaah Mendalam Tolok Ukur Bocoran

Tabel yang beredar menempatkan Gemini 4 Pro di puncak hampir setiap kategori. Angka-angka ini tidak resmi dan belum diverifikasi oleh Google atau lab pihak ketiga independen pada saat penulisan. Anggap sebagai sinyal arah, bukan peringkat definitif.

Rekayasa perangkat lunak & pengodean agenik

  • DeepSWE v1.1 (rekayasa perangkat lunak berjangka panjang): 88.7% (vs. GPT-6 Astra 86.9%, Claude Fable 5.1 69.1%, Claude Opus 5 75.0%).
  • Terminal-bench 2.1 (pengodean terminal agenik): 95.3% (vs. Astra 94.1%, Fable 92.8%).
  • Terminal-bench 4.0 (kemampuan agen umum): 69.7% (kesenjangan relatif terbesar dibanding Flash dan pesaing).

Pekerjaan pengetahuan & tugas profesional

  • GDPval-AA v2 (Elo, pekerjaan pengetahuan): 2064 (satu-satunya model di atas 2000; Astra 1994, Fable 1853).
  • Vals Finance Agent v2: 74.2%.
  • Harvey’s Legal Agent Benchmark (alur kerja hukum kompleks, tingkat lulus keseluruhan): 18.7%.

Penalaran, multimodal & khusus

  • CharXiv Reasoning (sintesis informasi dari bagan kompleks, tanpa alat): 94.7%.
  • LVBench (pemahaman video panjang): 95.8% agenik / 95.0% statis.
  • HLE-Verified (penalaran pakar multidisipliner): 72.1%.
  • OSWorld-2.0 (penggunaan komputer agenik, skor parsial, alat batch diaktifkan): 86.8%.
  • BioMysteryBench & LABBench2 (bioinformatika dan alur kerja riset biologi): skor terdepan pada subset yang dapat diselesaikan manusia maupun yang sulit.

Jika akurat secara arah, hasil ini menunjukkan keunggulan khusus pada beban kerja agenik berjangka panjang, multi-langkah, dan menggunakan alat—wilayah yang menjadi andalan GPT-6 Astra dan Claude Fable 5.1 setelah rilis awal September mereka.

Uji kualitatif Arena memperkuat gambaran: pembuatan SVG dan Three.js kompleks dari model terselubung dinilai lebih unggul atau sangat kompetitif dibanding Astra dalam perbandingan berdampingan komunitas.

Bagaimana cara kerja Gemini 4?

Gemini 4 (Pro) belum dirilis, jadi deskripsi “cara kerjanya” didasarkan pada pernyataan resmi Google, detail bocoran terbatas tentang checkpoint internal awal, lintasan seri Gemini 3.x, dan inferensi rekayasa yang wajar. Jangan anggap sebagai spesifikasi yang dikonfirmasi.

Pendekatan Pelatihan Inti dan Skala

Google menggambarkan Gemini 4 sebagai “pra-pelatihan paling ambisius sejauh ini,” dibangun di atas model dasar yang secara signifikan lebih besar daripada generasi sebelumnya. Tujuannya adalah tetap kompetitif di frontier, terutama dalam coding dan agen otonom.

Ini mengimplikasikan:

  • Jumlah parameter lebih besar atau kapasitas yang lebih efektif (melalui mixture-of-experts, sparsity yang lebih baik, atau penskalaan yang lebih padat).
  • Investasi komputasi yang lebih berat selama pra-pelatihan.
  • Penekanan berkelanjutan pada data pelatihan multimodal (teks, gambar, video, audio, kode, trajektori penggunaan alat).

Model ini diharapkan menjadi baseline kapabilitas tinggi baru yang darinya varian gaya Flash yang lebih cepat dapat diturunkan kemudian.

Inferensi dan Gaya Penalaran

Deskripsi bocoran tentang checkpoint awal “argon” menyebut mode upaya pemikiran tinggi yang memakan waktu sekitar 2.4 menit untuk satu generasi dan mendukung batas keluaran yang jauh lebih tinggi (dilaporkan 256k token dibanding ~64k sebelumnya).

Ini menunjuk pada:

  • Jalur penalaran intensif komputasi opsional (mirip semangat dengan mode pemikiran diperluas atau “upaya maksimum” pada model pesaing).
  • Kemampuan mengeluarkan lebih banyak komputasi internal untuk masalah sulit sebelum menghasilkan jawaban.
  • Dukungan lebih baik untuk keluaran yang panjang dan koheren seperti basis kode lengkap, rencana multi-langkah, atau laporan panjang.

Pengguna kemungkinan dapat mengontrol trade-off antara kecepatan/biaya dan kedalaman penalaran, seperti pada model Gemini Flash saat ini yang menawarkan level pemikiran rendah / sedang / tinggi.

Fokus Kemampuan Utama

  1. Coding dan rekayasa perangkat lunak Kinerja berjangka panjang yang lebih kuat: refaktor multi-berkas, debug lintas repositori, loop koreksi diri, dan tingkat penyelesaian lebih tinggi pada tugas perangkat lunak realistis.
  2. Perilaku otonom / agenik Kemampuan yang lebih baik untuk merencanakan, menggunakan alat, mengamati hasil antara, pulih dari kesalahan, dan terus menuju tujuan selama banyak langkah. Ini langsung membangun fitur penggunaan komputer dan agenik yang sudah ada di Gemini 3.5/3.8 Flash.
  3. Keandalan konteks panjang Laporan komunitas menyebut target di kisaran 1,5 juta token (atau lebih tinggi). Tujuannya bukan hanya jendela yang lebih besar tetapi juga fidelitas pengambilan yang lebih baik dan degradasi yang lebih sedikit saat bekerja dengan dokumen sangat panjang, basis kode, atau jejak agen multi-jam.
  4. Pemahaman dan generasi multimodal Penanganan native teks + gambar + video + audio, dengan peningkatan yang diharapkan dalam penalaran spasial, pemahaman video, dan interaksi suara/agen real-time (membangun dari model Gemini 3.8 Live September 2026).
  5. Penggunaan alat dan keluaran terstruktur Panggilan fungsi yang lebih andal, eksekusi kode, pencarian berbasis sumber, dan keluaran terstruktur gaya JSON/XML untuk integrasi yang andal ke aplikasi dan agen.

Perbedaannya dengan Gemini 3.x

  • Skala: Model dasar yang jelas lebih besar alih-alih penyempurnaan inkremental.
  • Kapasitas keluaran: Batas token yang lebih tinggi memungkinkan generasi sekali jalan yang lebih panjang.
  • Kedalaman penalaran: Mode upaya tinggi yang lebih menonjol untuk masalah sulit.
  • Fokus agenik: Penekanan lebih besar pada pekerjaan otonom multi-langkah yang berkelanjutan alih-alih tugas jangka pendek atau horizon pendek.
  • Posisi: Dimaksudkan sebagai model Pro kelas frontier baru, sementara lini Flash terus beriterasi cepat untuk efisiensi kecepatan dan biaya.

Hubungan dengan Recursive Self-Improvement (RSI)

Eksekutif Google secara publik mengaitkan belanja modal AI besar perusahaan dengan tujuan jangka panjang perbaikan diri rekursif—sistem yang dapat secara bermakna meningkatkan dirinya sendiri atau proses yang menghasilkan generasi berikutnya. Riset terkait (seperti makalah Dream-RSI) menunjukkan agen meningkatkan strategi eksplorasinya sendiri tanpa mengubah bobot model.

Akankah Gemini 4 Pro melampaui GPT-6 dan Claude Fable 5.1?

KategoriGemini 4 ProGPT-6 AstraClaude Fable 5.1Catatan
Harga Input / Output$2.25 / $11.25$12.00 / $60.00$10.00 / $50.00Gemini 4 Pro ~5× lebih murah daripada Astra
Jendela konteks2M1M200kKeunggulan signifikan untuk Gemini
DeepSWE v1.188.7%86.9%69.1%Keunggulan kuat pada coding
GDPval-AA v2 (Elo)206419941853Pemimpin pekerjaan pengetahuan
Terminal-bench 4.069.7%66.4%57.9%Kemampuan agen umum
OSWorld-2.086.8%84.5%77.9%Penggunaan komputer
HLE-Verified72.1%67.3%62.1%Penalaran pakar
LVBench (video)95.8% / 95.0%93.8%90.4%Kekuatan multimodal
Riset Bio / LABSkor tertinggiKuatKompetitifAlur kerja ilmiah

Gemini 4 Pro berada di puncak setiap baris utama dalam tabel, seringkali dengan margin yang berarti, sementara harga yang diklaim jauh lebih agresif daripada GPT-6 Astra atau Claude Fable 5.1.

Penting: Batasan dan Catatan

  • Tabel ini bukan rilis resmi Google. Per 20 September 2026, Google masih belum menerbitkan kartu model, endpoint API, harga, atau tolok ukur yang dikonfirmasi untuk Gemini 4 Pro. Angka-angka berasal dari sumber komunitas / penampakan di Arena / kebocoran checkpoint internal (nama kode terkait “argon”).
  • Beberapa lembar yang beredar sebelumnya kemudian ditandai sebagai prediksi atau disalin sebagian. Anggap setiap persentase spesifik dan harga sebagai belum terverifikasi sampai Google mengonfirmasinya.
  • Jendela konteks Claude Fable 5.1 dicantumkan di sini sebagai 200k, yang lebih rendah daripada angka 1M yang umum dilaporkan dalam dokumentasi resmi Anthropic. Ini mungkin mencerminkan pengaturan evaluasi tertentu atau kesalahan pada lembar yang bocor.
  • GPT-6 Astra dan Claude Fable 5.1 tetap menjadi satu-satunya model frontier yang sepenuhnya publik dan dievaluasi secara independen saat ini. Artificial Analysis dan pelacak pihak ketiga lainnya masih menunjukkan keduanya sangat berimbang secara keseluruhan (dengan kekuatan berbeda).

Realitas Praktis Saat Ini (20 September 2026)

ModelStatusTerbaik UntukTingkat Harga
Gemini 4 ProBelum dirilis (diklaim kuat)Konteks panjang, coding, agen, multimodalitas, biayaSangat agresif (diklaim)
GPT-6 AstraDirilisMatematika, penggunaan komputer, terminal, otomasi, siberPremium
Claude Fable 5.1DirilisAgen berjangka panjang, penalaran, kualitas coding, efisiensi cachePremium
Gemini 4 Flash / Flash-LiteSaudara kandung yang diklaimKecepatan + beban kerja sensitif biayaSangat rendah

Ringkasan Cepat

  • Dominan di seluruh papan: Gemini 4 Pro peringkat #1 di setiap kategori yang tercantum, seringkali dengan margin jelas.
  • Kekuatan khusus: Coding/agen berjangka panjang (DeepSWE, Terminal-bench), pekerjaan pengetahuan, multimodal (video + bagan), dan domain khusus (keuangan, hukum, biologi, penggunaan komputer).
  • Posisi harga: Sekitar 1/5 harga GPT-6 Astra dan Claude Fable 5.1 pada input dan output, sambil memberikan skor lebih tinggi.

Astra menekankan penggunaan komputer, ambang keamanan siber, dan penemuan ilmiah; Fable 5.1 menekankan pekerjaan pengetahuan jangka panjang dan coding dengan penjagaan yang disempurnakan serta biaya baca cache yang lebih rendah. Profil bocoran Gemini 4 Pro tampak terkuat pada rekayasa perangkat lunak agenik secara luas dan penalaran multimodal.

Cara Pengembang Mempersiapkan: Rekomendasi CometAPI

Sambil menunggu akses resmi Gemini 4 Pro, tim diuntungkan dari gateway terpadu yang sudah mendukung frontier saat ini (seri Gemini 3.x, GPT-6 Astra, Claude Fable 5.1 / Opus 5, dan 500+ model lain). CometAPI menyediakan tepat itu: satu endpoint yang kompatibel dengan OpenAI, satu kunci API, penagihan bayar sesuai pemakaian yang biasanya 20–40% di bawah tarif vendor langsung, dan kemampuan mengganti model dengan satu perubahan parameter.

Alur kerja praktis:

  1. Prototipe pipeline agenik pada Gemini Flash/Pro saat ini, GPT-6 Astra, dan Claude Fable 5.1 melalui CometAPI.
  2. Benchmark prompt yang sama di seluruh model untuk menetapkan baseline.
  3. Ketika Gemini 4 Pro (dan varian Flash-nya) muncul di katalog CometAPI—secara historis platform menambahkan model Google baru dengan cepat—ganti ID model dan jalankan ulang evaluasi dengan perubahan kode minimal.
  4. Gunakan dasbor biaya untuk melacak pengeluaran token di seluruh penyedia dan rute lalu lintas ber-volume tinggi atau sensitif latensi ke model paling ekonomis yang kapabel.

Pendekatan ini menghilangkan manajemen multi-kunci, mengurangi risiko ketergantungan vendor, dan memposisikan tim untuk mengadopsi Gemini 4 Pro pada hari pertama ketersediaan publik.

Gemini 4 Pro, jika kebocoran terbukti akurat secara arah, mewakili upaya terkuat Google sejauh ini untuk merebut kembali frontier pada rekayasa perangkat lunak agenik dan penalaran multimodal konteks panjang. Kombinasi kinerja yang diklaim, konteks besar, dan harga agresif akan menjadikannya pertimbangan default untuk banyak beban kerja produksi. Hingga peluncuran resmi dan evaluasi independen tiba, jalur bijak adalah benchmarking berkelanjutan di seluruh model frontier yang ada—dengan mudah dilakukan melalui platform yang sudah menyatukan akses. Pantau pengumuman resmi; beberapa minggu ke depan kemungkinan akan memperjelas seberapa besar hype yang beralih menjadi realitas produksi.

FAQ

Apakah Gemini 4 Pro sudah dirilis?

Belum. Berdasarkan katalog terbaru dan pernyataan Google (pertengahan hingga akhir September 2026), belum dirilis secara publik atau dicantumkan dengan ID model resmi.

Kapan tanggal rilis yang diharapkan untuk Gemini 4 Pro?

Para leaker mengarah ke Oktober 2026 (dengan beberapa spekulasi akhir September). Google belum memberikan tanggal resmi. Perlakukan sebagai jendela waktu yang menunggu konfirmasi melalui katalog API atau posting blog.

Apakah Google mencapai RSI dengan Gemini 4 Pro?

Bukti publik menunjukkan penggunaan lanjutan loop agenik untuk penyempurnaan model dan riset ke peningkatan rekursif di tingkat strategi (mis. Dream-RSI). Klaim RSI penuh yang menghasilkan model tersebut tidak didukung verifikasi independen.

Bagaimana perbandingannya dengan GPT-6 Astra dan Claude Fable 5.1 pada tolok ukur?

Grafik komunitas yang bocor mengklaim keunggulan pada beberapa suite agen/coding. Skor resmi independen untuk Gemini 4 Pro yang dirilis belum ada. Data publik saat ini lebih mendukung evaluasi model live (Astra dan Fable 5.1) pada tugas Anda.

Haruskah saya menunggu Gemini 4 Pro sebelum membangun?

Tidak. Rilis dengan model terkuat yang tersedia saat ini (dapat diakses via CometAPI atau API langsung), siapkan set evaluasi, dan adopsi model baru jika dan ketika pengujian independen dan internal membenarkan peralihan.

Di mana saya bisa mengakses model frontier saat ini dengan mudah?

Penyedia terpadu seperti CometAPI menawarkan akses yang kompatibel dengan OpenAI ke model kelas GPT-6 Astra, Claude Fable 5.1, model Gemini saat ini, dan lainnya dengan penagihan sederhana serta kemudahan switching. Periksa daftar model live dan dokumentasi untuk ID dan harga terbaru.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 20, 2026
Terakhir diperbarui Sep 20, 2026
1 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya