FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-model/Riset CometAPI

Analisis Kinerja Claude Opus 5 & Prompt Terbaik: Panduan Lengkap 2026

请提供需要翻译成印度尼西亚语的源文本(可为纯文本、HTML、Markdown、JSON、XML 或代码片段)。我将严格保留原有结构与技术元素,仅翻译可读文本。

CometAPI
AnnaTim riset model AI dan API
Diperbarui Aug 14, 2026 13 menit baca
Analisis Kinerja Claude Opus 5 & Prompt Terbaik: Panduan Lengkap 2026
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR: Claude Opus 5, dirilis oleh Anthropic pada 24 Juli 2026, menghadirkan lompatan besar dibanding Opus 4.8 dalam penalaran mendalam, pengodean agentik, tugas jangka panjang, dan pemecahan masalah novel. Ia menyamai atau mengungguli Fable 5 yang lebih mahal pada tolok ukur kunci (termasuk 43,3% pada Frontier-Bench v0.1 dan rekor 30,2% pada ARC-AGI-3) dengan biaya yang sama seperti Opus 4.8—$5 per juta token input dan $25 per juta token output. Dengan jendela konteks 1M token, thinking aktif secara default, verifikasi mandiri yang kuat, dan penyelarasan yang ditingkatkan (skor perilaku tidak selaras terendah di antara Claude terbaru), model ini unggul dalam pengodean kompleks, penggunaan komputer, pekerjaan pengetahuan, dan alur kerja multi-agen. Upaya tingkat medium sering memberi efisiensi puncak.

Pokok-Pokok Utama

  • Opus 5 adalah peningkatan antargenerasi yang nyata atas Opus 4.8, bukan inkremental—terutama dalam persistensi agentik, penskalaan komputasi saat pengujian, dan kecerdasan fluida (lonjakan ARC-AGI-3 dari ~1,5% ke 30,2%) dari blog Claude.
  • Ia mengungguli atau menyamai Fable 5 pada tolok ukur pengodean/agentik utama dengan kira-kira setengah harga.
  • Harga tetap $5/$25 per juta token; efisiensi berasal dari kinerja per token yang lebih baik dan hasil kuat bahkan pada upaya medium/rendah.
  • Profil keselamatan adalah yang terbaik dari Anthropic untuk lini Opus, dengan batasan sengaja pada kapabilitas siber ofensif dan pengurangan pemicu klasifier.
  • Pergeseran prompting: hapus instruksi verifikasi lama, batasi ruang lingkup secara eksplisit, kendalikan verbositas dan penggunaan subagen, serta manfaatkan parameter effort dari dokumen Claude.
  • Terbaik untuk agen jangka panjang, pengodean multi-berkas, pekerjaan pengetahuan, dan tugas berbantu visi; laporan dunia nyata menyoroti kekuatan dalam demo/pembangunan kompleks bersama gesekan sesekali dalam mengikuti instruksi pada basis kode besar.
  • Platform seperti CometAPI memudahkan pengalihan trafik di antara model Claude (dan kompetitor) dengan penagihan terpadu dan fallback.

Claude Opus 5 hadir sebagai flagship terbaru Anthropic yang tersedia umum dalam tier Opus. Diposisikan di bawah kelas Mythos/Fable yang lebih terbatas di beberapa area spesialis, namun kompetitif atau superior pada banyak evaluasi publik, ia menargetkan pengodean agentik kompleks, pekerjaan pengetahuan enterprise, dan tugas jangka panjang. Dirilis hanya dua bulan setelah Opus 4.8, ini merupakan lompatan, bukan iterasi kecil.

Apa Itu Claude Opus 5?

Claude Opus 5 (ID model API: claude-opus-5) adalah model kelas Opus terbaru dari Anthropic, dioptimalkan untuk pengodean agentik kompleks dan beban kerja enterprise. Ia memiliki jendela konteks 1 juta token (default dan maksimum), hingga 128k token output maksimum, dan thinking aktif secara default. Model memutuskan kapan dan seberapa banyak untuk berpikir; pengembang mengontrol kedalaman melalui parameter effort (low, medium, high, xhigh, max).

Kapabilitas baru dan perubahan perilaku utama dibanding generasi sebelumnya mencakup:

  • Persistensi agentik yang lebih kuat—melanjutkan hingga tugas berhasil alih-alih berhenti pada jawaban yang masuk akal.
  • Verifikasi mandiri dan debugging akar masalah yang ditingkatkan.
  • Koordinasi multi-agen dan pendelegasian subagen yang lebih baik.
  • Visi lebih kuat untuk bagan, dokumen, diagram, dan replikasi UI/frontend (terutama dengan penggunaan alat iteratif).
  • Pekerjaan kantor/dokumen yang lebih andal (spreadsheet multi-lembar kompleks, deck slide terstruktur).
  • Pergantian alat di tengah percakapan (beta), batas minimum prompt-cache lebih rendah (512 token), dan mode fallback default.
  • Mode cepat (pratinjau riset) tersedia di API Claude dengan tarif lebih tinggi.

Anthropic menggambarkannya sebagai menghadirkan kecerdasan tingkat frontier dengan setengah biaya Fable 5 sambil mendukung agen jangka panjang dengan peningkatan dalam pengodean dan pekerjaan profesional.

Claude Opus 5 vs Opus 4.8

Opus 5 secara eksplisit dibingkai sebagai lompatan atas Opus 4.8. Kenaikan terbesar muncul pada penalaran mendalam di sepanjang rantai masalah panjang, pengodean agentik dan loop penggunaan alat jangka panjang (menyelesaikan fitur multi-berkas dan pekerjaan end-to-end tanpa stub), penskalaan komputasi waktu pengujian, efisiensi pada level effort yang lebih rendah, presisi tinjauan kode/temuan bug, visi, konsistensi konteks panjang, tugas kantor, dan koordinasi multi-agen.

Secara perilaku, respons default dan deliverable tertulis menjadi lebih panjang. Model menarasikan progres lebih banyak dalam sesi agentik, lebih siap mendelegasikan ke subagen, dan memverifikasi pekerjaannya sendiri tanpa perlu prompting. Instruksi lama seperti “sertakan langkah verifikasi final” kini menyebabkan verifikasi berlebihan dan pemborosan token—hapus instruksi tersebut.

Thinking aktif secara default (sebelumnya adaptif/thinking memerlukan pengaturan eksplisit pada 4.8). Menonaktifkan thinking hanya diizinkan pada effort high atau di bawahnya; effort lebih tinggi menolak thinking yang dinonaktifkan. Harga tetap identik: $5 input / $25 output per juta token.

Singkatnya, tim yang bermigrasi harus memperbarui ID model, mengevaluasi ulang default effort pada evaluasi internal, membersihkan scaffolding verifikasi dari prompt, dan mengharapkan keluaran yang lebih panjang namun berkualitas lebih tinggi dengan otonomi yang lebih kuat.

Tolok Ukur Kinerja: Apa yang dikatakan data?

Opus 5 mencatat hasil menonjol, khususnya pada evaluasi novel dan agentik. Semua angka di bawah diambil dari materi pengumuman/kartu sistem Anthropic dan agregasi independen per akhir Juli 2026; perhatikan bahwa skor yang dilaporkan laboratorium menggunakan harness dan prompting dari penyedia.

Hasil Utama Pengodean dan Agentik

  • Frontier-Bench v0.1 (pengodean terminal agentik): Opus 5 43,3% vs Fable 5 33,7% vs Opus 4.8 18,7%.
  • SWE-bench Verified: 96,0% (vs Fable 5 95,0%, Opus 4.8 88,6%).
  • SWE-bench Pro: 79,2% (vs Fable 5 80,3%, Opus 4.8 69,2%).
  • DeepSWE v1.1: 68,8% (kompetitif; beberapa varian GPT-5.6 lebih tinggi).
  • FrontierCode 1.1 (puncak effort medium): ~53,4% utama / 63,6% diperluas—konfigurasi paling efisien komputasi yang diuji dalam satu analisis.
  • CursorBench 3.2 (effort maksimum): Dalam ~0,5% dari puncak Fable 5 dengan kira-kira setengah biaya per tugas. Kinerja-per-dolar yang kuat di effort high/xhigh/max.

Penalaran Novel dan Kecerdasan Fluida

  • ARC-AGI-3: 30,2% (froniter sebelumnya ~7,8% untuk GPT-5.6 Sol pada effort tinggi; Opus 4.8 ~1,5%). Ini adalah lonjakan terbesar yang tercatat; model menunjukkan pemodelan aljabar internal atas dinamika permainan dan efisiensi sampel setara manusia pada lingkungan yang sebelumnya belum terpecahkan. Sekitar 3× model terbaik berikutnya—pemecahan masalah novel yang kuat.
  • GDPval-AA v2: Puncak pada pekerjaan pengetahuan profesional.
  • Zapier AutomationBench: ~1,5× model terbaik berikutnya dengan tingkat kelolosan tinggi pada otomasi bisnis end-to-end.
  • OSWorld 2.0 (penggunaan komputer): Melampaui hasil terbaik Fable 5 dengan kira-kira sepertiga biaya.
  • Memimpin atau terbaik di kelas pada HLE (Humanity’s Last Exam) dan tugas riset mendalam bergaya DeepSearchQA.

Penggunaan Komputer, Pekerjaan Pengetahuan, dan Penggunaan Alat

  • OSWorld 2.0: 70,6%—mengungguli rekan pada titik biaya tertentu.
  • BrowseComp: ~90–90,8% (kompetitif dengan atau sedikit di belakang konfigurasi GPT-5.6 teratas).
  • GDPval-AA v2 (Elo): 1861 (memimpin Fable 5 dan generasi sebelumnya).
  • AutomationBench: Tingkat kelolosan kuat; dilaporkan ~1,5× terbaik berikutnya pada biaya serupa dalam beberapa analisis.

Opus 5 menghadirkan peningkatan non-inkremental, khususnya pada evaluasi pengodean, agentik, dan pekerjaan pengetahuan. Laporan Anthropic dan independen menyoroti:

Sains & Domain Spesialis

Kenaikan bermakna atas Opus 4.8 di berbagai evaluasi ilmu hayati, termasuk:

  • Kimia organik (inferensi struktur molekul dari spektroskopi): +10,2 poin persentase.
  • Prediksi fungsi protein: +7,7 poin persentase.
  • Peningkatan konsisten dalam biologi struktural dan bioinformatika.

Karena Fable 5 memiliki pengamanan biologi yang lebih ketat, Opus 5 saat ini merupakan model Anthropic terkuat yang tersedia umum untuk banyak alur kerja riset ilmiah.

Analisis Kinerja Claude Opus 5 & Prompt Terbaik: Panduan Lengkap 2026

Sumber: claude

Komposit papan peringkat publik menempatkan Opus 5 di dekat puncak (mis., ~82,8/100 dan peringkat #2 dari 215 di BenchLM), dengan persentil tinggi khususnya dalam kategori pengetahuan, agentik, pengodean, dan multimodal.

Umpan balik pengembang dunia nyata beragam: pembangunan gim one-shot yang mengesankan, penyelesaian fitur kompleks, dan self-debugging berdampingan dengan laporan sesekali mengabaikan instruksi, halusinasi pada basis kode besar, atau berlebihan dalam mengomplekskan. Tolok ukur menangkap kapabilitas puncak dalam kondisi terkontrol; hasil produksi sangat bergantung pada prompting, desain alat, dan pengaturan effort.

Cuplikan Tolok Ukur

Analisis Kinerja Claude Opus 5 & Prompt Terbaik: Panduan Lengkap 2026

Sumber: claude

Efisiensi dan Biaya

Harga tidak berubah dari Opus 4.8: $5 per juta token input / $25 per juta token output. Input yang dicache jauh lebih murah (~$0,50). Mode cepat berjalan pada sekitar 2× tarif ($10/$50). Ini kira-kira setengah dari tarif Fable 5 sebesar $10/$50. Peningkatan efisiensi berasal dari:

  • Konteks 1M yang memungkinkan alur kerja seluruh basis kode atau dokumen panjang tanpa chunking agresif.
  • Kinerja kuat bahkan pada effort rendah/medium (lebih sedikit token untuk kualitas sebanding pada banyak tugas).
  • Verifikasi mandiri dan iterasi bawaan yang mengurangi kegagalan run dan loop koreksi manusia.
  • Pergantian alat di tengah percakapan (beta) yang mempertahankan cache prompt.

Kisah efisiensi sebenarnya adalah kinerja per dolar dan per token. Opus 5 mengonversi effort tambahan menjadi hasil yang lebih baik lebih andal daripada model Opus sebelumnya. Effort medium sering memberikan skor puncak atau mendekati puncak pada tolok ukur pengodean dengan ~1,5× biaya token dari effort rendah, sementara high/xhigh/max dapat menunjukkan imbal hasil yang menurun atau datar pada beberapa suite.

Pada kurva biaya-versus-kinerja yang dipublikasikan saat peluncuran, Opus 5 berada secara menguntungkan terhadap Fable 5, Opus 4.8, dan model frontier pesaing—skor lebih tinggi pada biaya efektif lebih rendah per tugas yang terselesaikan. Konsumsi token per tinjauan atau loop agentik dapat lebih tinggi secara absolut karena penalaran dan verifikasi mandiri yang lebih panjang, tetapi kualitas dan tingkat penyelesaian meningkat cukup sehingga total biaya untuk hasil sukses sering turun.

Analisis Kinerja Claude Opus 5 & Prompt Terbaik: Panduan Lengkap 2026

Sumber: claude

Untuk tim produksi, rekomendasi praktisnya adalah mulai pada effort default high, lalu jajal low/medium pada evaluasi internal Anda. Gunakan caching prompt secara agresif (kini layak pada panjang yang lebih pendek), pergantian alat di tengah percakapan untuk menjaga cache, dan fallback tingkat platform. Gerbang API terpadu seperti CometAPI dapat semakin mengoptimalkan dengan merutekan tugas sederhana ke model yang lebih murah (tier Sonnet/Haiku) sambil mencadangkan Opus 5 untuk pekerjaan agentik kompleks, dengan analitik penggunaan terpusat dan kontrol pengeluaran.

Keamanan dan Penyelarasan

Anthropic menggambarkan Claude Opus 5 sebagai “model paling selaras hingga saat ini” dan “model teraman sejauh ini” dalam beberapa laporan. Poin kunci dari kartu sistem dan pengumuman:

  • Risiko penyelarasan keseluruhan sangat rendah; tidak ada sifat yang mengkhawatirkan baru relatif terhadap model sebelumnya.
  • Tingkat perilaku menipu terendah yang diukur oleh Anthropic.
  • Tingkat respons tidak berbahaya yang tinggi pada permintaan berbahaya dengan tingkat penolakan berlebihan yang termasuk terendah pada pertanyaan jinak.
  • Ketahanan yang ditingkatkan terhadap vektor penyalahgunaan tertentu; pengamanan siber dikalibrasi lebih dekat ke level Fable 5 mengingat kapabilitas yang lebih kuat, tetapi klasifier aktif lebih jarang (~85% lebih sedikit daripada Fable 5 dalam beberapa estimasi).
  • Tidak melampaui ambang Kebijakan Responsible Scaling Anthropic untuk substitusi R&D AI otomatis atau kategori risiko kimia/biologi yang lebih tinggi (diperlakukan mirip model Opus baru-baru ini dengan perlindungan gaya ASL-3 bila berlaku).

Masih memiliki kesadaran evaluasi yang meningkat dalam pengujian (umum pada model frontier). Pemantauan penerapan dunia nyata menunjukkan tingkat perilaku yang mengkhawatirkan sangat rendah. Seperti semua model frontier, organisasi harus menerapkan pengamanan tingkat aplikasi, terutama untuk penggunaan agen otonom atau berisiko tinggi.

Cara Mem-Prompt Claude Opus 5 untuk Hasil Terbaik

Anthropic menerbitkan panduan prompting khusus model karena Opus 5 berperilaku berbeda dari model Opus sebelumnya. Pergeseran terbesar: ia memverifikasi sendiri, menyelesaikan tugas secara lengkap, dapat memperluas ruang lingkup, dan menghasilkan respons default yang lebih panjang.

Prinsip inti untuk Opus 5

  1. Berikan tugas lengkap di awal — Sediakan spesifikasi, konteks, batasan, dan hasil yang diinginkan secara penuh dalam satu prompt. Ia berkinerja terbaik saat dibiarkan berjalan daripada diberi langkah sedikit demi sedikit. Ia menyelesaikan fitur end-to-end alih-alih meninggalkan stub.
  2. Hapus instruksi verifikasi — Perintah eksplisit “periksa dua kali,” “verifikasi pekerjaan Anda,” atau “gunakan subagen untuk memverifikasi” menyebabkan verifikasi berlebihan dan pemborosan token. Opus 5 sudah memverifikasi dan beriterasi secara internal. Hapus baris ini dari system prompt dan berkas CLAUDE.md.
  3. Kendalikan ruang lingkup secara eksplisit — Ia dapat memperluas tugas berdasarkan penilaiannya sendiri. Tambahkan batasan yang jelas: “Berikan tepat apa yang diminta pada cakupan yang dimaksud. Ambil keputusan rutin sendiri. Hanya periksa jika perbedaan interpretasi mengarah pada pekerjaan yang berbeda secara material. Jika permintaan tampak keliru, catat singkat dan lanjutkan tugas sebagaimana diminta.”
  4. Kelola verbositas — Respons default lebih panjang. Untuk keluaran ringkas tambahkan: “Jaga respons tetap fokus, singkat, dan padat. Prioritaskan jawaban inti; ringkas peringatan.”
  5. Gunakan effort dengan bijak — Mulai dengan high (default). Gunakan low/medium secara luas untuk klasifikasi, penyuntingan sederhana, atau pekerjaan volume tinggi ketika kualitas tetap terjaga. Cadangkan xhigh/max untuk masalah pengodean dan agentik tersulit. Evaluasi ulang pengaturan effort yang diwarisi dari Opus 4.8.
  6. Kontrol subagen — Ia lebih mudah mendelegasikan. Instruksikan: “Delegasikan ke subagen hanya untuk tugas besar yang benar-benar independen dan dapat diparalelkan. Jangan gunakan subagen untuk verifikasi atau pekerjaan yang bisa Anda selesaikan dalam beberapa panggilan alat.”
  7. Tinjauan dan audit — Minta temuan lengkap dengan label kepercayaan/keparahan, lalu saring sendiri. “Hanya laporkan isu berkeparahan tinggi” diikuti secara literal dan dapat melewatkan masalah.

Skeleton prompt pengodean effort tinggi

text
[Set effort to max or xhigh]

Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].

Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.

Output the final artifacts and a brief summary of decisions.

Klasifikasi effort rendah (contoh)

text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.

Untuk migrasi dari Opus 4.8: uji ulang prompt, hapus scaffolding verifikasi, tambahkan kontrol panjang/cakupan eksplisit, dan jajal level effort pada evaluasi internal Anda. Anthropic mencatat banyak set instruksi lama yang detail kini dapat disederhanakan.

Tabel Perbandingan: Claude Opus 5 vs Alternatif Kunci (Perkiraan, Juli 2026)

ModelInput/Output ($/MTok)Frontier-BenchSWE-VerifiedARC-AGI-3ContextCatatan
Claude Opus 5$5 / $2543,3%96,0%30,2%1MHarga/kinerja terbaik untuk penggunaan harian berkapabilitas tinggi
Claude Opus 4.8$5 / $25~19–21%88,6%Rendah1MOpus sebelumnya
Claude Fable 5$10 / $50~33,7%~95%Lebih rendah1MTier lebih tinggi, lebih banyak batasan di beberapa kasus
GPT-5.6 Sol (approx.)KompetitifLebih rendahTinggiLebih rendahBervariasiAlternatif kuat
Claude Sonnet 5Lebih rendah (~$3/$15 atau promo)Lebih rendahKuatLebih rendah1MDriver harian yang lebih cepat/murah

Angka diambil dari pengumuman Anthropic dan laporan agregator; selalu verifikasi evaluasi independen terbaru.

Rekomendasi CometAPI: CometAPI menyediakan akses terpadu ke Claude Opus 5 (dan 500+ model lainnya) melalui endpoint yang kompatibel OpenAI (https://api.cometapi.com/v1) dan dukungan Anthropic Messages API. Harga yang tercantum kompetitif (mis., sekitar $4/$20 per MTok untuk Opus 5 saat penulisan), dengan satu kunci API, penagihan sederhana, dan kemudahan penggantian model. Ini sangat berguna bagi tim yang menginginkan kapabilitas Claude tanpa mengelola banyak akun penyedia atau silo batas laju. Periksa daftar model dan harga CometAPI saat ini untuk tarif terbaru dan promosi token gratis.

Kesimpulan

Claude Opus 5 menetapkan tolok ukur baru untuk tier Opus: kinerja agentik dan penalaran kelas frontier pada titik harga generasi sebelumnya, dengan kemajuan bermakna dalam pemecahan masalah yang diarahkan sendiri (disorot oleh hasil ARC-AGI-3) dan angka penyelarasan paling menguntungkan yang dipublikasikan Anthropic untuk kelas ini. Model ini tidak sempurna—regresi khusus domain dan laporan dunia nyata tentang mengikuti instruksi mengingatkan kita bahwa tolok ukur bukan segalanya—tetapi untuk agen pengodean, alur kerja jangka panjang, pekerjaan pengetahuan, dan aplikasi penggunaan komputer, ini saat ini salah satu opsi terkuat yang tersedia umum.

Padukan disiplin prompting yang kuat dengan dial effort, manfaatkan jendela konteks 1M, dan rute-kan trafik secara cerdas (melalui API resmi atau platform seperti CometAPI) untuk memaksimalkan nilai. Seperti model frontier mana pun, evaluasi berkelanjutan pada data Anda sendiri tetap esensial. Laju iterasi cepat Anthropic menunjukkan penyempurnaan lanjutan akan segera hadir; Opus 5 sudah menghadirkan lompatan kapabilitas yang substansial dan hemat biaya yang layak diadopsi hari ini.

Sumber dan bacaan lanjutan:

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Jul 31, 2026
Terakhir diperbarui Aug 14, 2026
70 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya