TL;DR: Claude Opus 5, uitgebracht door Anthropic op 24 juli 2026, levert een sprong vooruit ten opzichte van Opus 4.8 in diep redeneren, agentisch coderen, langetermijntaken en nieuwe probleemoplossing. Het evenaart of overtreft de duurdere Fable 5 op kernbenchmarks (waaronder 43,3% op Frontier-Bench v0.1 en een record van 30,2% op ARC-AGI-3) terwijl het dezelfde prijs behoudt als Opus 4.8—$5 per miljoen invoertokens en $25 per miljoen uitvoertokens. Met een contextvenster van 1M tokens, denken standaard ingeschakeld, sterke zelfverificatie en verbeterde afstemming (laagste score voor misaligned gedrag onder recente Claudes) blinkt het uit in complex coderen, computergebruik, kenniswerk en multi-agent-workflows. Gemiddelde effort levert vaak piekefficiëntie.
Belangrijkste punten
- Opus 5 is een echte generatie-upgrade boven Opus 4.8, geen incrementele stap—vooral in agentische volharding, test-time compute-scaling en fluïde intelligentie (ARC-AGI-3 van ~1,5% naar 30,2%) volgens de Claude-blog.
- Het presteert beter dan of evenaart Fable 5 op grote codeer-/agentische benchmarks tegen ongeveer de helft van de prijs.
- Prijs blijft gelijk op $5/$25 per miljoen tokens; efficiëntiewinsten komen door betere performance per token en sterke resultaten zelfs bij medium/low effort.
- Het veiligheidsprofiel is tot nu toe het beste van Anthropic voor de Opus-lijn, met bewuste beperkingen op offensieve cybercapaciteiten en minder classifier-triggers.
- Prompting verschuift: verwijder verouderde verificatie-instructies, begrens de scope expliciet, beheer beknoptheid en subagentgebruik, en benut de effort-parameter volgens de Claude-doc.
- Het best voor langlopende agents, multi-file codering, kenniswerk en vision-ondersteunde taken; rapporten uit de praktijk noemen sterke punten in demo’s/complexe builds naast af en toe frictie bij instructieopvolging op grote codebases.
- Platformen zoals CometAPI maken het eenvoudig om verkeer over Claude-modellen (en concurrenten) te routeren met uniforme billing en fallbacks.
Claude Opus 5 verschijnt als Anthropic’s nieuwste algemeen beschikbare vlaggenschip in de Opus-tier. Geplaatst onder de meer beperkte Mythos/Fable-klasse op sommige gespecialiseerde gebieden maar competitief of superieur op veel openbare evaluaties, richt het zich op complex agentisch coderen, enterprise-kenniswerk en lange-horizontaken. Uitgebracht slechts twee maanden na Opus 4.8, vertegenwoordigt het een sprong in plaats van een kleine iteratie.
Wat is Claude Opus 5?
Claude Opus 5 (API model ID: claude-opus-5) is Anthropic’s nieuwste Opus-klasse model, geoptimaliseerd voor complex agentisch coderen en enterprise-workloads. Het heeft een contextvenster van 1 miljoen tokens (standaard en maximum), tot 128k maximale uitvoertokens, en denken standaard ingeschakeld. Het model bepaalt wanneer en hoeveel het denkt; ontwikkelaars sturen de diepte via de effort-parameter (low, medium, high, xhigh, max).
Belangrijke nieuwe mogelijkheden en gedragsveranderingen ten opzichte van eerdere generaties:
- Sterkere agentische volharding—doorgaan tot taken slagen in plaats van te stoppen bij plausibele antwoorden.
- Verbeterde zelfverificatie en root-cause debugging.
- Betere multi-agentcoördinatie en subagent-delegatie.
- Sterkere visie voor grafieken, documenten, diagrammen en UI/frontendreproductie (vooral met iteratief toolgebruik).
- Verbeterd kantoor-/documentwerk (complexe multitabellen-spreadsheets, gestructureerde slidedecks).
- Toolwissels midden in het gesprek (beta), lagere minimumgrootte voor promptcache (512 tokens) en standaard fallback-modus.
- Snelmodus (research preview) beschikbaar op de Claude API tegen hogere tarieven.
Anthropic beschrijft het als het leveren van frontier-niveau intelligentie tegen de halve kosten van Fable 5, terwijl het langlopende agents aandrijft met verbeteringen in coderen en professioneel werk.
Claude Opus 5 vs Opus 4.8
Opus 5 wordt expliciet neergezet als een sprong ten opzichte van Opus 4.8. De grootste winsten verschijnen in diep redeneren over lange probleemketens, agentisch coderen en lange-horizon tool-use loops (voltooien van multi-file features en end-to-end werk zonder stubs), test-time compute-scaling, efficiëntie bij lagere effort-niveaus, precisie in code review/bug-finding, vision, consistentie bij lange context, kantoortaken en multi-agentcoördinatie.
Qua gedrag zijn standaardreacties en opgeleverde stukken langer. Het model vertelt voortgang meer in agentische sessies, delegeert makkelijker naar subagents en verifieert zijn eigen werk zonder prompting. Verouderde instructies zoals “include a final verification step” of soortgelijk veroorzaken oververificatie en verspilde tokens—verwijder ze.
Denken staat standaard aan (voorheen vereiste adaptief/denken expliciet instellen op 4.8). Uitschakelen van denken is alleen toegestaan bij effort high of lager; hogere effort-niveaus weigeren uitgeschakeld denken. Prijzen blijven identiek: $5 input / $25 output per miljoen tokens.
Kortom, teams die migreren moeten de model-ID updaten, effort-standaarden opnieuw evalueren op eigen evals, verificatiescaffolding uit prompts verwijderen, en langere maar hogere kwaliteit outputs met sterkere autonomie verwachten.
Prestatiebenchmarks: wat vertellen de data ons?
Opus 5 levert opvallende resultaten, vooral op nieuwe en agentische evaluaties. Alle onderstaande cijfers zijn afkomstig uit Anthropic system card/launch-materialen en onafhankelijke aggregaties eind juli 2026; let op dat lab-gerapporteerde scores provider-harnassen en prompting gebruiken.
Kopresultaten voor codering en agentische taken
- Frontier-Bench v0.1 (agentisch terminal-coderen): Opus 5 43,3% vs Fable 5 33,7% vs Opus 4.8 18,7%.
- SWE-bench Verified: 96,0% (vs Fable 5 95,0%, Opus 4.8 88,6%).
- SWE-bench Pro: 79,2% (vs Fable 5 80,3%, Opus 4.8 69,2%).
- DeepSWE v1.1: 68,8% (competitief; sommige GPT-5.6-varianten hoger).
- FrontierCode 1.1 (piek bij medium effort): ~53,4% main / 63,6% extended—meest rekenefficiënte configuratie in één analyse.
- CursorBench 3.2 (max effort): Binnen ~0,5% van Fable 5’s piekprestatie tegen ongeveer de helft van de kosten per taak. Sterke prestatie-per-dollar over high/xhigh/max effort.
Nieuwe redenering en fluïde intelligentie
- ARC-AGI-3: 30,2% (voorgaand frontier ~7,8% voor GPT-5.6 Sol bij high effort; Opus 4.8 ~1,5%). Dit is de grootste geregistreerde sprong; het model toonde interne algebraïsche modellering van spel-dynamiek en menselijk-niveau sample-efficiëntie op eerder onopgeloste omgevingen. Ongeveer 3× het op één na beste model — sterke nieuwe probleemoplossing.
- GDPval-AA v2: State-of-the-art op professioneel kenniswerk.
- Zapier AutomationBench: ~1,5× het volgende beste model met hoge slaagpercentages op end-to-end bedrijfsautomatisering.
- OSWorld 2.0 (computergebruik): Overtreft Fable 5’s beste gerapporteerde resultaat tegen ongeveer een derde van de kosten.
- Leidend of best-in-class op HLE (Humanity’s Last Exam) en DeepSearchQA-achtige deep research-taken.
Computergebruik, kenniswerk en toolgebruik
- OSWorld 2.0: 70,6%—overtreft peers bij gegeven kostenniveaus.
- BrowseComp: ~90–90,8% (competitief met of iets achter top GPT-5.6-configuraties).
- GDPval-AA v2 (Elo): 1861 (loopt voor op Fable 5 en eerdere generaties).
- AutomationBench: Sterke slaagpercentages; gerapporteerd ~1,5× het volgende beste tegen vergelijkbare kosten in sommige analyses.
Opus 5 levert niet-incrementele winst, met name op codering, agentische en kenniswerk-evaluaties. Anthropic en onafhankelijke rapporten benadrukken:
Wetenschap en gespecialiseerde domeinen
Betekenisvolle winst ten opzichte van Opus 4.8 op life-sciences-evaluaties, waaronder:
- Organische chemie (moleculaire structuurafleiding uit spectroscopie): +10,2 procentpunt.
- Eiwitfunctie-voorspelling: +7,7 procentpunt.
- Consistente verbeteringen in structurele biologie en bio-informatica.
Omdat Fable 5 meer restrictieve biologiebeveiligingen heeft, is Opus 5 momenteel Anthropic’s sterkste algemeen beschikbare model voor veel wetenschappelijke onderzoeksworkflows.

Bron: claude
Algemene public-leaderboardcomposieten plaatsen Opus 5 dicht bij de top (bijv. ~82,8/100 en plek #2 van 215 in BenchLM), met bijzonder hoge percentielen in kennis, agentisch, codering en multimodaal.
Feedback van ontwikkelaars uit de praktijk is gemengd: indrukwekkende one-shot game-builds, complexe feature-completion en zelf-debugging naast meldingen van af en toe het negeren van instructies, hallucinaties op grote codebases of overcomplicatie. Benchmarks vangen piekcapaciteit onder gecontroleerde condities; productieresultaten hangen sterk af van prompting, tooldesign en effort-instellingen.
Benchmark-overzicht

Bron: claude
Efficiëntie en kosten
Prijs is ongewijzigd ten opzichte van Opus 4.8: $5 per miljoen invoertokens / $25 per miljoen uitvoertokens. Gecachte input is aanzienlijk goedkoper (~$0.50). Snelmodus draait tegen ongeveer 2× tarieven ($10/$50). Dit is ruwweg de helft van Fable 5’s $10/$50. Efficiëntieverbeteringen komen door:
- 1M context waardoor volledige codebase- of lang-documentworkflows mogelijk zijn zonder agressief chunking.
- Sterke prestaties zelfs bij low/medium effort (minder tokens voor vergelijkbare kwaliteit op veel taken).
- Ingebouwde zelfverificatie en iteratie die mislukte runs en menselijke correctielussen verminderen.
- Toolwissels midden in het gesprek (beta) die de promptcache behouden.
Het echte efficiëntieverhaal is performance per dollar en per token. Opus 5 zet extra effort betrouwbaarder om in betere resultaten dan eerdere Opus-modellen. Medium effort levert vaak piek- of bijna piekscores op codeerbenchmarks bij ~1,5× de tokenkosten van low effort, terwijl high/xhigh/max op sommige suites afnemende of vlakke meeropbrengst tonen.
Op kosten-versus-prestatiecurves gepubliceerd rond de lancering zit Opus 5 gunstig ten opzichte van Fable 5, Opus 4.8 en concurrerende frontier-modellen—hogere scores tegen lagere effectieve kosten per voltooide taak. Tokenverbruik per review of agentische loop kan in absolute zin hoger zijn door langer redeneren en zelfverificatie, maar de kwaliteit en completion-rate verbeteren genoeg dat de totale kosten voor succesvolle uitkomsten vaak dalen.

Bron: claude
Voor productieteams is de praktische aanbeveling om te starten op de standaard high effort, en dan low/medium te sweepen op interne evals. Gebruik promptcaching agressief (nu haalbaar bij kortere lengtes), toolwissels midden in het gesprek om cache te behouden, en platform-level fallbacks. Unified API-gateways zoals CometAPI kunnen verder optimaliseren door eenvoudige taken naar goedkopere modellen (Sonnet/Haiku-tiers) te routeren en Opus 5 te reserveren voor complex agentisch werk, met gecentraliseerde gebruiksanalytics en uitgavencontrole.
Veiligheid en afstemming
Anthropic beschrijft Claude Opus 5 als zijn “meest aligned model tot nu toe” en “veiligste model tot nu toe” in diverse rapporten. Belangrijke punten uit de system card en aankondigingen:
- Zeer laag algemeen afstemmingsrisico; geen nieuwe zorgwekkende eigenschappen ten opzichte van eerdere modellen.
- Laagste gemeten rates van misleidend gedrag door Anthropic.
- Hoge harmless-responserates op schadelijke verzoeken met een van de laagste over-refusal rates op onschuldige queries.
- Verbeterde weerstand tegen bepaalde misbruikvectoren; cyberwaarborgen gekalibreerd dichter bij Fable 5-niveaus gezien de sterkere capaciteiten, maar classifiers slaan minder vaak aan (~85% minder dan Fable 5 in sommige schattingen).
- Overschrijdt niet de Responsible Scaling Policy-drempels van Anthropic voor geautomatiseerde AI R&D-substitutie of hogere chemische/biologische risicocategorieën (vergelijkbaar behandeld met recente Opus-modellen met ASL-3-stijl bescherming waar van toepassing).
Het vertoont in tests nog steeds verhoogde evaluatiebewustheid (gangbaar bij frontier-modellen). Monitoring bij inzet in de praktijk toonde zeer lage rates van zorgwekkend gedrag. Zoals bij alle frontier-modellen moeten organisaties safeguards op applicatieniveau toepassen, vooral voor high-stakes of autonoom agentgebruik.
Hoe Claude Opus 5 te prompten voor de beste resultaten
Anthropic publiceerde modelspecifieke prompting-richtlijnen omdat Opus 5 zich anders gedraagt dan eerdere Opus-modellen. De grootste verschuivingen: het verifieert zichzelf, rondt complete taken af, kan de scope uitbreiden en produceert langere standaardreacties.
Kernprincipes voor Opus 5
- Geef de volledige taak upfront — Geef de volledige specificatie, context, beperkingen en gewenst resultaat in één prompt. Het presteert het best wanneer het door mag lopen in plaats van stappen druppelsgewijs te krijgen. Het voltooit end-to-end features in plaats van stubs achter te laten.
- Verwijder verificatie-instructies — Expliciet “double-check”, “verify your work”, of “use a subagent to verify” veroorzaakt oververificatie en verspilde tokens. Opus 5 verifieert en iterereert al intern. Verwijder deze regels uit system prompts en CLAUDE.md-bestanden.
- Beheer de scope expliciet — Het kan taken op eigen oordeel uitbreiden. Voeg duidelijke grenzen toe: “Lever precies wat gevraagd is binnen de beoogde scope. Neem routinematige beslissingen zelf. Check alleen in wanneer verschillende interpretaties tot wezenlijk ander werk zouden leiden. Als het verzoek onjuist lijkt, benoem dat kort en ga door met de taak zoals gevraagd.”
- Beheer de beknoptheid — Standaardreacties zijn langer. Voor beknopte output voeg toe: “Houd de reactie gericht, kort en bondig. Prioriteer het kernantwoord; houd kanttekeningen kort.”
- Gebruik effort verstandig — Start met high (standaard). Gebruik low/medium ruimhartig voor classificatie, eenvoudige edits of hoogvolume-werk waar kwaliteit standhoudt. Reserveer xhigh/max voor de moeilijkste codeer- en agentische problemen. Her-evalueer overgenomen effort-instellingen van Opus 4.8.
- Subagent-controle — Het delegeert makkelijker. Instrueer: “Delegeer alleen naar een subagent voor grote, werkelijk onafhankelijke en paralleliseerbare taken. Gebruik geen subagents voor verificatie of werk dat je in een paar tool-calls kunt afronden.”
- Reviews en audits — Vraag om volledige bevindingen met confidence-/severity-labels, filter vervolgens zelf. “Rapporteer alleen high-severity issues” wordt letterlijk gevolgd en kan problemen missen.
Voorbeeldprompt voor codering met hoge effort
text
[Set effort to max or xhigh]
Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].
Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.
Output the final artifacts and a brief summary of decisions.
Voorbeeld low-effort classificatie
text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.
Voor migratie vanaf Opus 4.8: test prompts opnieuw, verwijder verificatiescaffolding, voeg expliciete lengte-/scope-controles toe, en sweep effort-niveaus op je interne evals. Anthropic merkt op dat veel oudere gedetailleerde instructiesets nu vereenvoudigd kunnen worden.
Vergelijkingstabel: Claude Opus 5 vs sleutelalternatieven (bij benadering, juli 2026)
| Model | Invoer/Uitvoer ($/MTok) | Frontier-Bench | SWE-Verified | ARC-AGI-3 | Context | Opmerkingen |
|---|---|---|---|---|---|---|
| Claude Opus 5 | $5 / $25 | 43,3% | 96,0% | 30,2% | 1M | Beste prijs-prestatieverhouding voor dagelijks gebruik met hoge capaciteiten |
| Claude Opus 4.8 | $5 / $25 | ~19–21% | 88,6% | Laag | 1M | Vorige Opus |
| Claude Fable 5 | $10 / $50 | ~33,7% | ~95% | Lager | 1M | Hoger tier, meer restricties in sommige gevallen |
| GPT-5.6 Sol (approx.) | Concurrerend | Lager | Hoog | Lager | Varieert | Sterk alternatief |
| Claude Sonnet 5 | Lager (~$3/$15 of promo) | Lager | Sterk | Lager | 1M | Snellere/goedkopere dagelijkse keuze |
Getallen afkomstig uit Anthropic-aankondigingen en aggregator-rapporten; verifieer altijd de nieuwste onafhankelijke evals.
CometAPI-aanbeveling: CometAPI biedt uniforme toegang tot Claude Opus 5 (en 500+ andere modellen) via een OpenAI-compatibele endpoint (https://api.cometapi.com/v1) en ondersteuning voor de Anthropic Messages API. Vermelde prijzen zijn concurrerend (bijv. rond $4/$20 per MTok waargenomen voor Opus 5 ten tijde van schrijven), met één API-sleutel, vereenvoudigde billing en eenvoudig modelswitchen. Dit is bijzonder nuttig voor teams die de mogelijkheden van Claude willen zonder meerdere provideraccounts of rate-limit silo’s te beheren. Bekijk de huidige CometAPI-modellijsten en prijzen voor de nieuwste tarieven en gratis-tokenpromoties.
Conclusie
Claude Opus 5 zet een nieuwe standaard voor de Opus-tier: frontier-achtige agentische en redeneerprestaties tegen het prijsniveau van de vorige generatie, met betekenisvolle vooruitgang in zelfgestuurde probleemoplossing (onderstreept door het ARC-AGI-3-resultaat) en de gunstigste afstemmingscijfers die Anthropic voor deze klasse heeft gepubliceerd. Het is niet perfect—domeinspecifieke regressies en praktijkrapporten over instructie-opvolging herinneren eraan dat benchmarks niet het hele verhaal zijn—maar voor codeeragents, lange-horizon-workflows, kenniswerk en computergebruiksapplicaties is het momenteel een van de sterkste algemeen beschikbare opties.
Koppel strakke prompting-discipline aan de effort-dial, benut het 1M-contextvenster en routeer verkeer intelligent (via officiële API’s of platformen zoals CometAPI) om de waarde te maximaliseren. Zoals bij elk frontier-model blijft continue evaluatie op je eigen data essentieel. De snelle iteratiecadans van Anthropic suggereert dat verdere verfijningen snel zullen volgen; Opus 5 levert nu al een substantiële, kostenefficiënte capaciteitsstap die vandaag de moeite van het adopteren waard is.
Bronnen en verder lezen:
- Anthropic: Wat is er nieuw in Claude Opus 5 — https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic: Prompting Claude Opus 5 — https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
- Anthropic nieuwsberichtverwijzingen en system card (juli 2026)
- DataCamp: Claude Opus 5 Explained — https://www.datacamp.com/blog/claude-opus-5
- MindStudio / Vellum / BenchLM benchmark-overzichten (juli 2026)
- ARC Prize Foundation geverifieerde scores
