DeepSeek Vision and Grok Imagine models are now live on CometAPI →
ai-model/Penyelidikan CometAPI

Claude Opus 5 Analisis Prestasi & Prompt Terbaik: Panduan Lengkap 2026

apa itu Opus 5, bagaimana perbandingannya dengan Opus 4.8 dan model setaranya, prestasi penanda aras, kecekapan dan analisis kos, strategi prompt praktikal yang disarikan

CometAPI
AnnaPasukan penyelidikan model AI dan API
Dikemas kini Aug 24, 2026 13 min baca
Claude Opus 5 Analisis Prestasi & Prompt Terbaik: Panduan Lengkap 2026
Guna corak ini

Buat panggilan API pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: Claude Opus 5, dikeluarkan oleh Anthropic pada 24 Julai 2026, membawa lonjakan besar berbanding Opus 4.8 dalam penaakulan mendalam, pengkodan beragen, tugasan jangka panjang, dan penyelesaian masalah baharu. Ia menyamai atau mengatasi Fable 5 yang lebih mahal pada penanda aras utama (termasuk 43.3% pada Frontier-Bench v0.1 dan rekod 30.2% pada ARC-AGI-3) sambil mengekalkan kos yang sama seperti Opus 4.8—$5 per juta token input dan $25 per juta token output. Dengan tetingkap konteks 1M token, pemikiran diaktifkan secara lalai, pengesahan kendiri yang kukuh, dan penjajaran yang dipertingkat (skor tingkah laku tidak sejajar terendah dalam kalangan Claude terkini), ia cemerlang dalam pengkodan kompleks, penggunaan komputer, kerja berpengetahuan, dan aliran kerja berbilang agen. Usaha sederhana sering menghasilkan kecekapan puncak.

Perkara Utama

  • Opus 5 ialah peningkatan generasi sebenar berbanding Opus 4.8, bukan tambahan kecil—terutamanya dalam ketekalan beragen, penskalaan pengiraan semasa masa ujian, dan kecerdasan cecair (lonjakan ARC-AGI-3 daripada ~1.5% kepada 30.2%) daripada Blog Claude.
  • Ia mengatasi atau menyamai Fable 5 pada penanda aras pengkodan/agen utama pada kira-kira separuh harga.
  • Harga kekal $5/$25 per juta token; kecekapan meningkat melalui prestasi per token yang lebih baik dan keputusan kukuh walaupun pada usaha sederhana/rendah.
  • Profil keselamatan ialah yang terbaik oleh Anthropic setakat ini untuk barisan Opus, dengan had disengajakan pada keupayaan siber ofensif dan pengurangan pencetus pengelas.
  • Perubahan cara menggesa: buang arahan pengesahan lama, hadkan skop secara jelas, kawal kepetahan dan penggunaan subagen, serta guna parameter usaha daripada Dokumen Claude.
  • Terbaik untuk agen jangka panjang, pengkodan berbilang fail, kerja berpengetahuan, dan tugasan dibantu visi; laporan dunia sebenar menyatakan kekuatan dalam demo/pembinaan kompleks di samping geseran pematuhan arahan sekali-sekala pada pangkalan kod besar.
  • Platform seperti CometAPI memudahkan penghalaan trafik merentas model Claude (dan pesaing) dengan pengebilan bersatu dan sandaran.

Claude Opus 5 hadir sebagai model utama terkini Anthropic yang tersedia secara umum dalam tier Opus. Diletakkan di bawah kelas Mythos/Fable yang lebih terhad dalam beberapa bidang khusus tetapi kompetitif atau unggul pada banyak penilaian umum, ia menyasarkan pengkodan beragen yang kompleks, kerja berpengetahuan perusahaan, dan tugasan jangka panjang. Dikeluarkan hanya dua bulan selepas Opus 4.8, ia mewakili lonjakan langkah, bukan iterasi kecil.

Apakah Claude Opus 5?

Claude Opus 5 (ID model API: claude-opus-5) ialah model kelas Opus terbaru Anthropic, dioptimumkan untuk pengkodan beragen yang kompleks dan beban kerja perusahaan. Ia menampilkan tetingkap konteks 1 juta token (lalai dan maksimum), sehingga 128k token keluaran maksimum, dan pemikiran diaktifkan secara lalai. Model ini memutuskan bila dan berapa banyak untuk berfikir; pembangun mengawal kedalaman melalui parameter usaha (low, medium, high, xhigh, max).

Keupayaan baharu utama dan perubahan tingkah laku berbanding generasi terdahulu termasuk:

  • Ketekalan beragen yang lebih kuat—meneruskan sehingga tugas berjaya dan bukannya berhenti pada jawapan yang munasabah.
  • Pengesahan kendiri dan penyahpepijatan punca akar yang dipertingkat.
  • Koordinasi berbilang agen dan delegasi subagen yang lebih baik.
  • Visi yang lebih kuat untuk carta, dokumen, rajah, dan replikasi UI/frontend (terutamanya dengan penggunaan alat beriterasi).
  • Kerja pejabat/dokumen yang dipertingkat (hamparan berbilang helai yang kompleks, dek slaid berstruktur).
  • Pertukaran alat di pertengahan perbualan (beta), keperluan minimum cache gesaan yang lebih rendah (512 token), dan mod sandaran lalai.
  • Mod pantas (pratonton penyelidikan) tersedia pada API Claude pada kadar yang lebih tinggi.

Anthropic menerangkan ia menyampaikan kecerdasan tahap hadapan pada separuh kos Fable 5 sambil memperkasa agen jangka panjang dengan penambahbaikan dalam pengkodan dan kerja profesional.

Claude Opus 5 vs Opus 4.8

Opus 5 secara jelas dibingkaikan sebagai lonjakan langkah berbanding Opus 4.8. Peningkatan terbesar muncul dalam penaakulan mendalam merentas rantaian masalah panjang, pengkodan beragen dan gelung penggunaan alat jangka panjang (menyiapkan ciri berbilang fail dan kerja hujung ke hujung tanpa stub), penskalaan pengiraan semasa masa ujian, kecekapan pada tahap usaha yang lebih rendah, ketepatan semakan kod/pengesanan pepijat, visi, konsistensi konteks panjang, tugas pejabat, dan koordinasi berbilang agen.

Dari segi tingkah laku, respons lalai dan hasil bertulis menjadi lebih panjang. Model ini menceritakan kemajuan dengan lebih banyak dalam sesi beragen, mendelegasi kepada subagen dengan lebih mudah, dan mengesahkan kerjanya sendiri tanpa gesaan. Arahan lama seperti “sertakan langkah pengesahan akhir” atau seumpamanya kini menyebabkan pengesahan berlebihan dan pembaziran token—buang arahan tersebut.

Pemikiran dihidupkan secara lalai (sebelum ini adaptif/berfikir memerlukan tetapan eksplisit pada 4.8). Menyahtaktifkan pemikiran hanya dibenarkan pada usaha tinggi atau ke bawah; usaha lebih tinggi menolak pemikiran dinyahaktif. Harga kekal sama: $5 input / $25 output per juta token.

Ringkasnya, pasukan yang berhijrah harus mengemas kini ID model, menilai semula lalai usaha pada penilaian dalaman mereka, membersihkan rangka pengesahan daripada gesaan, dan menjangkakan keluaran yang lebih panjang tetapi berkualiti lebih tinggi dengan autonomi yang lebih kuat.

Penanda Aras Prestasi: Apa yang akan diberitahu oleh data?

Opus 5 mencatatkan keputusan menonjol, khususnya pada penilaian novel dan beragen. Semua angka di bawah diambil daripada kad sistem/ bahan keluaran Anthropic dan pengagregatan bebas sekitar akhir Julai 2026; ambil perhatian skor dilaporkan makmal menggunakan rangka penyedia dan penggesaan.

Keputusan Utama Pengkodan dan Beragen

  • Frontier-Bench v0.1 (pengkodan terminal beragen): Opus 5 43.3% vs Fable 5 33.7% vs Opus 4.8 18.7%.
  • SWE-bench Verified: 96.0% (vs Fable 5 95.0%, Opus 4.8 88.6%).
  • SWE-bench Pro: 79.2% (vs Fable 5 80.3%, Opus 4.8 69.2%).
  • DeepSWE v1.1: 68.8% (kompetitif; beberapa varian GPT-5.6 lebih tinggi).
  • FrontierCode 1.1 (puncak usaha sederhana): ~53.4% utama / 63.6% lanjutan—konfigurasi paling cekap pengiraan yang diuji dalam satu analisis.
  • CursorBench 3.2 (usaha maksimum): Dalam ~0.5% daripada prestasi puncak Fable 5 pada sekitar separuh kos setiap tugas. Prestasi per dolar yang kukuh merentas usaha high/xhigh/max.

Penaakulan Novel dan Kecerdasan Cecair

  • ARC-AGI-3: 30.2% (had sebelumnya ~7.8% untuk GPT-5.6 Sol pada usaha tinggi; Opus 4.8 ~1.5%). Ini ialah lonjakan terbesar yang direkodkan; model menunjukkan pemodelan algebra dalaman dinamik permainan dan kecekapan sampel setara manusia pada persekitaran yang belum diselesaikan. Kira-kira 3× model terbaik seterusnya — penyelesaian masalah novel yang kuat.
  • GDPval-AA v2: Tahap teratas pada kerja berpengetahuan profesional.
  • Zapier AutomationBench: ~1.5× model terbaik seterusnya dengan kadar lulus tinggi pada automasi perniagaan hujung ke hujung.
  • OSWorld 2.0 (penggunaan komputer): Mengatasi hasil terbaik Fable 5 pada kira-kira satu pertiga kos.
  • Mendahului atau terbaik dalam kategori pada HLE (Humanity’s Last Exam) dan tugasan penyelidikan mendalam gaya DeepSearchQA.

Penggunaan Komputer, Kerja Berpengetahuan, dan Penggunaan Alat

  • OSWorld 2.0: 70.6%—mengatasi rakan setara pada titik kos yang diberikan.
  • BrowseComp: ~90–90.8% (kompetitif dengan atau sedikit di belakang konfigurasi GPT-5.6 teratas).
  • GDPval-AA v2 (Elo): 1861 (mendahului Fable 5 dan generasi terdahulu).
  • AutomationBench: Kadar lulus yang kukuh; dilaporkan ~1.5× model terbaik seterusnya pada kos serupa dalam beberapa analisis.

Opus 5 menyampaikan peningkatan bukan incremental, khususnya pada penilaian pengkodan, beragen, dan kerja berpengetahuan. Laporan Anthropic dan bebas menonjolkan:

Sains & Domain Khusus

Peningkatan bermakna berbanding Opus 4.8 merentas penilaian sains hayat, termasuk:

  • Kimia organik (inferens struktur molekul daripada spektroskopi): +10.2 mata peratusan.
  • Peramalan fungsi protein: +7.7 mata peratusan.
  • Peningkatan konsisten dalam biologi struktur dan bioinformatik.

Memandangkan Fable 5 mempunyai perlindungan biologi yang lebih ketat, Opus 5 kini merupakan model paling kuat yang tersedia secara umum oleh Anthropic untuk banyak aliran kerja penyelidikan saintifik.

Claude Opus 5 Analisis Prestasi & Prompt Terbaik: Panduan Lengkap 2026

Sumber: claude

Gabungan papan pendahulu umum meletakkan Opus 5 hampir di puncak (contohnya, ~82.8/100 dan tangga #2 daripada 215 dalam BenchLM), dengan peratusan yang khususnya tinggi dalam kategori pengetahuan, beragen, pengkodan, dan multimodal.

Maklum balas pembangun dunia sebenar bercampur: pembangunan permainan sekali gus yang mengagumkan, penyempurnaan ciri kompleks, dan penyahpepijatan kendiri bersampingan dengan laporan ketidakpatuhan arahan sekali-sekala, halusinasi pada pangkalan kod besar, atau keterlampauan kerumitan. Penanda aras menangkap kemampuan puncak dalam keadaan terkawal; hasil produksi banyak bergantung pada penggesaan, reka bentuk alat, dan tetapan usaha.

Tinjauan Penanda Aras

Claude Opus 5 Analisis Prestasi & Prompt Terbaik: Panduan Lengkap 2026

Sumber: claude

Kecekapan dan Kos

Harga tidak berubah daripada Opus 4.8: $5 per juta token input / $25 per juta token output. Input dalam cache jauh lebih murah (~$0.50). Mod pantas berjalan pada kadar sekitar 2× ($10/$50). Ini kira-kira separuh daripada kadar $10/$50 Fable 5. Peningkatan kecekapan datang daripada:

  • Konteks 1M membolehkan aliran kerja keseluruhan pangkalan kod atau dokumen panjang tanpa pemecahan agresif.
  • Prestasi yang kuat walaupun pada usaha rendah/sederhana (kurang token untuk kualiti setara pada banyak tugas).
  • Pengesahan dan iterasi terbina dalam yang mengurangkan larian gagal dan gelung pembetulan manusia.
  • Pertukaran alat di pertengahan perbualan (beta) yang mengekalkan cache gesaan.

Kisah kecekapan sebenar ialah prestasi per dolar dan per token. Opus 5 menukar usaha tambahan kepada keputusan yang lebih baik dengan lebih boleh dipercayai berbanding model Opus terdahulu. Usaha sederhana kerap memberikan skor puncak atau hampir puncak pada penanda aras pengkodan pada ~1.5× kos token berbanding usaha rendah, sementara high/xhigh/max boleh menunjukkan pulangan berkurang atau mendatar pada sesetengah suite.

Pada lengkung kos vs prestasi yang diterbitkan sekitar pelancaran, Opus 5 berada dalam kedudukan yang menguntungkan berbanding Fable 5, Opus 4.8, dan model hadapan pesaing—skor lebih tinggi pada kos efektif lebih rendah bagi setiap tugas yang disiapkan. Penggunaan token per semakan atau gelung beragen boleh lebih tinggi dalam istilah mutlak kerana penaakulan lebih panjang dan pengesahan kendiri, tetapi kualiti dan kadar penyempurnaan meningkat secukupnya sehingga kos keseluruhan untuk hasil berjaya sering menurun.

Claude Opus 5 Analisis Prestasi & Prompt Terbaik: Panduan Lengkap 2026

Sumber: claude

Bagi pasukan produksi, cadangan praktikal ialah mulakan pada usaha tinggi (lalai), kemudian jalankan sapuan rendah/sederhana pada penilaian dalaman anda. Guna cache gesaan secara agresif (kini berdaya guna pada panjang yang lebih pendek), pertukaran alat pertengahan perbualan untuk mengekalkan cache, dan sandaran pada paras platform. Gerbang API bersatu seperti CometAPI boleh mengoptimumkan lagi dengan menghala tugas mudah ke model lebih murah (tier Sonnet/Haiku) sambil menempah Opus 5 untuk kerja beragen kompleks, dengan analitik penggunaan berpusat dan kawalan perbelanjaan.

Keselamatan dan Penjajaran

Anthropic menerangkan Claude Opus 5 sebagai “model paling sejajar setakat ini” dan “model paling selamat” dalam beberapa laporan. Perkara utama daripada kad sistem dan pengumuman:

  • Risiko penjajaran keseluruhan yang sangat rendah; tiada sifat baharu yang membimbangkan berbanding model terdahulu.
  • Kadar tingkah laku mengelirukan terendah yang diukur oleh Anthropic.
  • Kadar respons tidak berbahaya yang tinggi terhadap permintaan berbahaya dengan antara kadar keengganan berlebihan terendah pada pertanyaan yang tidak berbahaya.
  • Rintangan dipertingkat kepada beberapa vektor penyalahgunaan; perlindungan siber dilaras lebih hampir ke tahap Fable 5 memandangkan keupayaan lebih kuat, tetapi pengelas terlibat dengan lebih jarang (~85% kurang daripada Fable 5 dalam beberapa anggaran).
  • Tidak melepasi ambang Dasar Penskalakan Bertanggungjawab Anthropic untuk penggantian R&D AI automatik atau kategori risiko kimia/biologi yang lebih tinggi (diurus serupa dengan model Opus terkini dengan perlindungan gaya ASL-3 di mana berkenaan).

Ia masih mempunyai kesedaran penilaian yang tinggi dalam ujian (biasa dalam model hadapan). Pemantauan penggunaan dunia sebenar menunjukkan kadar tingkah laku membimbangkan yang sangat rendah. Seperti semua model hadapan, organisasi harus menerapkan perlindungan pada aras aplikasi, terutama untuk penggunaan agen autonomi atau berisiko tinggi.

Cara Menggesa Claude Opus 5 untuk Hasil Terbaik

Anthropic menerbitkan panduan penggesaan khusus model kerana Opus 5 berkelakuan berbeza daripada model Opus sebelumnya. Perubahan terbesar: ia mengesahkan sendiri, menyiapkan tugas lengkap, boleh mengembangkan skop, dan menghasilkan respons lalai yang lebih panjang.

Prinsip teras untuk Opus 5

  1. Berikan tugas lengkap sejak awal — Sediakan spesifikasi penuh, konteks, kekangan, dan hasil yang diingini dalam satu gesaan. Ia mencapai prestasi terbaik apabila dibiarkan berjalan dan bukannya diberi langkah titisan. Ia menyiapkan ciri hujung ke hujung dan bukannya meninggalkan stub.
  2. Buang arahan pengesahan — “Semak dua kali,” “sahkan kerja,” atau “guna subagen untuk pengesahan” menyebabkan pengesahan berlebihan dan pembaziran token. Opus 5 sudah mengesahkan dan beriterasi secara dalaman. Padamkan baris ini daripada gesaan sistem dan fail CLAUDE.md.
  3. Kawal skop secara jelas — Ia boleh mengembangkan tugas atas pertimbangannya sendiri. Tambah sempadan yang jelas: “Sampaikan tepat seperti yang diminta pada skop yang dimaksudkan. Buat keputusan rutin sendiri. Semak hanya apabila tafsiran berbeza akan membawa kepada kerja yang berbeza secara material. Jika permintaan kelihatan silap, nyatakan secara ringkas dan teruskan tugas seperti diminta.”
  4. Urus kepetahan — Respons lalai lebih panjang. Untuk keluaran padat tambah: “Pastikan respons fokus, ringkas, dan padat. Utamakan jawapan teras; kekalkan kaveat pendek.”
  5. Guna usaha dengan bijak — Mulakan dengan tinggi (lalai). Guna rendah/sederhana secara meluas untuk pengelasan, suntingan ringkas, atau kerja volum tinggi di mana kualiti kekal. Rizabkan xhigh/max untuk masalah pengkodan dan beragen paling sukar. Nilai semula tetapan usaha yang diwarisi daripada Opus 4.8.
  6. Kawalan subagen — Ia mendelegasi dengan lebih mudah. Arahkan: “Delegasikan kepada subagen hanya untuk tugas besar, benar-benar bebas dan boleh dijalankan selari. Jangan guna subagen untuk pengesahan atau kerja yang boleh anda siapkan dalam beberapa panggilan alat.”
  7. Semakan dan audit — Minta penemuan lengkap dengan label keyakinan/keterukan, kemudian tapis sendiri. “Laporkan hanya isu keterukan tinggi” akan diikuti secara literal dan boleh terlepas masalah.

Contoh rangka gesaan pengkodan usaha tinggi

text
[Set effort to max or xhigh]

Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].

Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.

Output the final artifacts and a brief summary of decisions.

Contoh pengelasan usaha rendah

text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.

Untuk migrasi daripada Opus 4.8: uji semula gesaan, buang rangka pengesahan, tambah kawalan panjang/skop yang jelas, dan jalankan sapuan tahap usaha pada penilaian dalaman anda. Anthropic menyatakan bahawa banyak set arahan terperinci lama kini boleh dipermudah.

Jadual Perbandingan: Claude Opus 5 vs Alternatif Utama (Anggaran, Julai 2026)

ModelInput/Output ($/MTok)Frontier-BenchSWE-VerifiedARC-AGI-3KonteksNota
Claude Opus 5$5 / $2543.3%96.0%30.2%1MHarga/prestasi terbaik untuk penggunaan berkeupayaan tinggi harian
Claude Opus 4.8$5 / $25~19–21%88.6%Rendah1MOpus sebelumnya
Claude Fable 5$10 / $50~33.7%~95%Lebih rendah1MPeringkat lebih tinggi, lebih banyak sekatan dalam sesetengah kes
GPT-5.6 Sol (approx.)KompetitifLebih rendahTinggiLebih rendahPelbagaiAlternatif yang kukuh
Claude Sonnet 5Lebih rendah (~$3/$15 atau promo)Lebih rendahKuatLebih rendah1MPemandu harian yang lebih pantas/murah

Angka diambil daripada pengumuman Anthropic dan laporan pengagregat; sentiasa sahkan penilaian bebas terkini.

Cadangan CometAPI: CometAPI menyediakan akses bersatu kepada Claude Opus 5 (dan 500+ model lain) melalui titik akhir serasi OpenAI (https://api.cometapi.com/v1) dan sokongan Anthropic Messages API. Harga yang disenaraikan adalah kompetitif (contohnya, sekitar $4/$20 per MTok diperhatikan untuk Opus 5 pada masa penulisan), dengan satu kunci API, pengebilan dipermudah, dan pertukaran model yang mudah. Ini amat berguna untuk pasukan yang mahukan keupayaan Claude tanpa mengurus berbilang akaun penyedia atau silo had kadar. Semak senarai model dan harga semasa CometAPI untuk kadar terkini dan promosi token percuma.

Kesimpulan

Claude Opus 5 menetapkan penanda aras baharu untuk tier Opus: prestasi beragen dan penaakulan bertaraf hadapan pada titik harga generasi sebelumnya, dengan kemajuan bermakna dalam penyelesaian masalah terarah sendiri (ditonjolkan oleh keputusan ARC-AGI-3) dan angka penjajaran paling menguntungkan yang pernah diterbitkan Anthropic untuk kelas ini. Ia bukan sempurna—kemunduran khusus domain dan laporan pematuhan arahan dunia sebenar mengingatkan kita bahawa penanda aras bukan segalanya—tetapi untuk agen pengkodan, aliran kerja jangka panjang, kerja berpengetahuan, dan aplikasi penggunaan komputer, ia kini antara pilihan paling kuat yang tersedia secara umum.

Padankan disiplin penggesaan yang kukuh dengan tombol usaha, gunakan tetingkap konteks 1M, dan hala trafik dengan bijak (melalui API rasmi atau platform seperti CometAPI) untuk memaksimumkan nilai. Seperti mana-mana model hadapan, penilaian berterusan pada data anda sendiri kekal penting. Kadar iterasi pantas Anthropic menunjukkan penambahbaikan lanjut akan tiba dengan cepat; Opus 5 sudah pun menyampaikan lonjakan kemampuan yang ketara dan cekap kos yang wajar diambil pakai hari ini.

Sumber dan bacaan lanjut:

Terus belajar

Sambungkan artikel ini ke keputusan seterusnya.

Lihat semua topik
Diterbitkan pada Jul 31, 2026
Terakhir dikemas kini Aug 24, 2026
81 paparan
Disemak untuk kejelasan, atribusi sumber dan terminologi API semasa.

Bersedia untuk mengurangkan kos pembangunan AI sebanyak 20%?

Mulakan secara percuma dalam beberapa minit. Kredit percubaan percuma disertakan. Tiada kad kredit diperlukan.

Baca Lagi