TL;DR: Claude Opus 5, udgivet af Anthropic den 24. juli 2026, leverer et markant spring over Opus 4.8 inden for dyb ræsonnering, agentisk kodning, langhorisont-opgaver og løsning af nye problemtyper. Den matcher eller overgår den dyrere Fable 5 på nøglebenchmarks (inklusive 43,3% på Frontier-Bench v0.1 og en rekord på 30,2% på ARC-AGI-3), mens den koster det samme som Opus 4.8—$5 pr. million inputtokens og $25 pr. million outputtokens. Med et kontekstvindue på 1M tokens, tænknings-tilstand aktiveret som standard, stærk selvverificering og forbedret alignment (laveste score for misaligned adfærd blandt nyere Claude-modeller) udmærker den sig til kompleks kodning, computerbrug, videnarbejde og multi-agent-workflows. Medium effort giver ofte top-effektivitet.
Vigtigste pointer
- Opus 5 er et ægte generationsløft over Opus 4.8, ikke et inkrementelt—særligt i agentisk vedholdenhed, testtids-compute-skalering og flydende intelligens (ARC-AGI-3 fra ~1,5% til 30,2%) fra Claude-bloggen.
- Den overgår eller matcher Fable 5 på vigtige kodnings-/agentiske benchmarks til omtrent halv pris.
- Priserne forbliver $5/$25 pr. million tokens; effektivitetsgevinster kommer fra bedre performance pr. token og stærke resultater selv ved medium/lav effort.
- Sikkerhedsprofilen er Anthropic’s bedste til dato for Opus-serien, med bevidste begrænsninger på offensive cyber-evner og færre classifier-triggere.
- Prompting-skift: fjern ældre verifikationsinstruktioner, afgræns scope eksplicit, styr verbosity og brug af subagenter, og udnyt effort-parameteren fra Claude-dokumentation.
- Bedst til langkørende agenter, multi-fil-kodning, videnarbejde og vision-assisterede opgaver; rapporter fra praksis fremhæver styrker i demoer/komplekse builds sammen med sporadisk friktion i instruktionsefterlevelse på store kodebaser.
- Platforme som CometAPI gør det nemt at rute trafik på tværs af Claude-modeller (og konkurrenter) med samlet fakturering og fallbacks.
Claude Opus 5 ankommer som Anthropic’s seneste generelt tilgængelige flagskib i Opus-tieret. Placeret under den mere restriktive Mythos/Fable-klasse på visse specialområder, men konkurrencedygtig eller bedre på mange offentlige evalueringer, sigter den mod kompleks agentisk kodning, enterprise-videnarbejde og langhorisont-opgaver. Udgivet blot to måneder efter Opus 4.8, repræsenterer den et kvantespring snarere end en mindre iteration.
Hvad er Claude Opus 5?
Claude Opus 5 (API-model-id: claude-opus-5) er Anthropic’s nyeste Opus-klassemodel, optimeret til kompleks agentisk kodning og enterprise-workloads. Den har et kontekstvindue på 1 million tokens (standard og maksimum), op til 128k maksimale outputtokens og tænknings-tilstand aktiveret som standard. Modellen beslutter selv, hvornår og hvor meget den tænker; udviklere styrer dybden via effort-parameteren (low, medium, high, xhigh, max).
Væsentlige nye evner og adfærdsændringer i forhold til tidligere generationer omfatter:
- Stærkere agentisk vedholdenhed—fortsætter indtil opgaven lykkes frem for at stoppe ved plausible svar.
- Forbedret selvverificering og root-cause-fejlfinding.
- Bedre multi-agent-koordination og subagent-delegering.
- Stærkere vision for diagrammer, dokumenter, skemaer og UI/frontend-replikation (især med iterativ værktøjsbrug).
- Forbedret kontor-/dokumentarbejde (komplekse regneark med flere faner, strukturerede slides).
- Værktøjsskift midt i samtalen (beta), lavere minimum for prompt-cache (512 tokens) og standard “fallbacks”-tilstand.
- Fast mode (research preview) tilgængelig på Claude API til højere takster.
Anthropic beskriver den som leverende frontier-niveau intelligens til halv pris af Fable 5, samtidig med at den driver langkørende agenter med forbedringer i kodning og professionelt arbejde.
Claude Opus 5 vs Opus 4.8
Opus 5 er eksplicit indrammet som et kvantespring over Opus 4.8. De største gevinster ses i dyb ræsonnering over lange problemkæder, agentisk kodning og langhorisont værktøjsloops (færdiggør multifil-funktioner og ende-til-ende-arbejde uden stubs), testtids-compute-skalering, effektivitet ved lavere effort-niveauer, præcision i kodegennemgang/fejlfinding, vision, langkontekst-konsistens, kontoropgaver og multi-agent-koordination.
Adfærdsmæssigt bliver standard-svar og skriftlige leverancer længere. Modellen fortæller mere om sin fremdrift i agentiske sessioner, delegerer lettere til subagenter og verificerer sit eget arbejde uden prompting. Legacy-instruktioner som “inkludér et endeligt verifikationstrin” fører nu til over-verifikation og spildte tokens—fjern dem.
Tænkning er som standard slået til (tidligere krævede adaptiv/tænkning eksplicit opsætning på 4.8). At slå tænkning fra tillades kun ved effort high eller lavere; højere effort afviser deaktiveret tænkning. Prissætning er identisk: $5 input / $25 output pr. million tokens.
Kort sagt bør teams, der migrerer, opdatere model-id, genvurdere effort-standarder på egne evals, fjerne verifikationsstillads fra prompts og forvente længere, men højere kvalitetssvar med stærkere autonomi.
Ydelsesmålinger: Hvad viser dataene?
Opus 5 leverer fremragende resultater, især på nye og agentiske evalueringer. Alle tal nedenfor stammer fra Anthropic’s systemkort/udgivelsesmaterialer og uafhængige aggregeringer fra slutningen af juli 2026; bemærk, at laboratorierapporterede scorer bruger udbyderes harnesses og prompting.
Topresultater for kodning og agentik
- Frontier-Bench v0.1 (agentisk terminalkodning): Opus 5 43,3% vs Fable 5 33,7% vs Opus 4.8 18,7%.
- SWE-bench Verified: 96,0% (vs Fable 5 95,0%, Opus 4.8 88,6%).
- SWE-bench Pro: 79,2% (vs Fable 5 80,3%, Opus 4.8 69,2%).
- DeepSWE v1.1: 68,8% (konkurrencedygtig; nogle GPT-5.6-varianter højere).
- FrontierCode 1.1 (medium effort top): ~53,4% main / 63,6% extended—den mest compute-effektive konfiguration testet i én analyse.
- CursorBench 3.2 (max effort): Inden for ~0,5% af Fable 5’s topydelse til omtrent halv pris pr. opgave. Stærk performance-per-dollar på tværs af high/xhigh/max effort.
Ny ræsonnering og flydende intelligens
- ARC-AGI-3: 30,2% (tidligere frontier ~7,8% for GPT-5.6 Sol ved high effort; Opus 4.8 ~1,5%). Dette er det største registrerede spring; modellen viste intern algebraisk modellering af spildynamik og menneskeniveau prøveeffektivitet på tidligere uløste miljøer. Cirka 3× den næstbedste model—stærk ny problemløsning.
- GDPval-AA v2: State-of-the-art i professionelt videnarbejde.
- Zapier AutomationBench: ~1,5× den næstbedste model med høje passrater på ende-til-ende forretningsautomatisering.
- OSWorld 2.0 (computerbrug): Overgår Fable 5’s bedste rapporterede resultat til cirka en tredjedel af prisen.
- Førende eller bedst i klassen på HLE (Humanity’s Last Exam) og DeepSearchQA-lignende dybe forskningsopgaver.
Computerbrug, videnarbejde og værktøjsbrug
- OSWorld 2.0: 70,6%—overgår jævnaldrende ved givne prisniveauer.
- BrowseComp: ~90–90,8% (på niveau med eller lidt bag top GPT-5.6-konfigurationer).
- GDPval-AA v2 (Elo): 1861 (fører Fable 5 og tidligere generationer).
- AutomationBench: Stærke passrater; rapporteret ~1,5× den næstbedste til tilsvarende pris i nogle analyser.
Opus 5 leverer ikke-inkrementelle gevinster, især på kodnings-, agentiske og videnarbejds-evalueringer. Anthropic og uafhængige rapporter fremhæver:
Videnskab og specialiserede domæner
Mærkbare gevinster over Opus 4.8 på tværs af life-science-evalueringer, herunder:
- Organisk kemi (molekylestrukturinferens fra spektroskopi): +10,2 procentpoint.
- Proteinfunktionsforudsigelse: +7,7 procentpoint.
- Konsistente forbedringer i strukturbiologi og bioinformatik.
Da Fable 5 har mere restriktive biologibeskyttelser, er Opus 5 i øjeblikket Anthropic’s stærkeste generelt tilgængelige model til mange videnskabelige forskningsworkflows.

Kilde: claude
Samlede offentlige leaderboard-kompositter placerer Opus 5 nær toppen (f.eks. ~82,8/100 og rang #2 af 215 i BenchLM), med særligt høje percentiler i viden, agentik, kodning og multimodale kategorier.
Feedback fra udviklere i praksis er blandet: imponerende one-shot spilbuilds, kompleks funktionsfærdiggørelse og selv-debugging sammen med rapporter om lejlighedsvis ignorering af instruktioner, hallucinationer på store kodebaser eller over-komplicering. Benchmarks fanger topkapacitet under kontrollerede forhold; produktionsresultater afhænger i høj grad af prompting, værktøjsdesign og effort-indstillinger.
Benchmark-overblik

Kilde: claude
Effektivitet og omkostninger
Priserne er uændrede fra Opus 4.8: $5 pr. million inputtokens / $25 pr. million outputtokens. Cachet input er markant billigere (~$0.50). Fast mode kører til omtrent 2× takster ($10/$50). Dette er cirka halvdelen af Fable 5’s $10/$50-takster. Effektivitetsforbedringer kommer fra:
- 1M kontekst, der muliggør hele kodebaser eller langdokument-workflows uden aggressiv chunking.
- Stærk performance selv ved low/medium effort (færre tokens for sammenlignelig kvalitet i mange opgaver).
- Indbygget selvverificering og iteration, som reducerer fejlslagne kørseler og behov for menneskelig korrektion.
- Værktøjsskift midt i samtalen (beta), der bevarer prompt-cache.
Den reelle effektivitetsfortælling er performance pr. dollar og pr. token. Opus 5 omsætter ekstra effort til bedre resultater mere pålideligt end tidligere Opus-modeller. Medium effort leverer ofte top- eller næsten top-scorer på kodningsbenchmarks til ~1,5× tokenomkostningen af low effort, mens high/xhigh/max kan vise aftagende eller flade afkast på nogle suiter.
På kurver for omkostning vs. performance offentliggjort omkring lancering ligger Opus 5 gunstigt i forhold til Fable 5, Opus 4.8 og konkurrerende frontier-modeller—højere scorer til lavere effektiv pris pr. fuldført opgave. Tokenforbrug pr. review eller agentisk loop kan være højere i absolutte tal på grund af længere ræsonnering og selvverificering, men kvaliteten og færdiggørelsesraten forbedres nok til, at den samlede pris for succesfulde resultater ofte falder.

Kilde: claude
For produktionsteams er den praktiske anbefaling at starte ved standarden high effort og dernæst sweepe low/medium på jeres interne evals. Brug prompt-caching aggressivt (nu muligt ved kortere længder), værktøjsskift midt i samtalen for at bevare cache og platform-niveau fallbacks. Forenede API-gateways som CometAPI kan yderligere optimere ved at rute simple opgaver til billigere modeller (Sonnet/Haiku-tier) og reservere Opus 5 til kompleks agentisk arbejde, med centraliserede forbrugsanalyser og budgetkontrol.
Sikkerhed og alignment
Anthropic beskriver Claude Opus 5 som deres “mest aligned model til dato” og “sikreste model hidtil” i flere rapporter. Nøglepunkter fra systemkort og annonceringer:
- Meget lav samlet alignment-risiko; ingen nye bekymrende egenskaber relativt til tidligere modeller.
- De laveste rater for vildledende adfærd målt af Anthropic.
- Høje harmless-svarprocenter på skadelige forespørgsler med blandt de laveste over-afvisningsrater på harmløse forespørgsler.
- Forbedret modstand mod visse misbrugsvektorer; cyber-beskyttelser kalibreret tættere på Fable 5-niveauer givet stærkere kapabiliteter, men classifiers aktiveres sjældnere (~85% mindre end Fable 5 i nogle estimater).
- Krydser ikke Anthropic’s Responsible Scaling Policy-tærskler for automatiseret AI R&D-substitution eller højere kemiske/biologiske risikokategorier (behandles tilsvarende som nylige Opus-modeller med ASL-3-lignende beskyttelser hvor relevant).
Den har fortsat forhøjet evalueringsbevidsthed i tests (almindeligt i frontier-modeller). Overvågning i virkelige implementeringer viste meget lave rater af bekymrende adfærd. Som med alle frontier-modeller bør organisationer anvende applikationsniveau-sikkerhedsforanstaltninger, især ved højrisiko- eller autonome agentbrug.
Sådan skriver du prompts til Claude Opus 5 for de bedste resultater
Anthropic har publiceret modelspecifik prompting-vejledning, fordi Opus 5 opfører sig anderledes end tidligere Opus-modeller. De største skift: den selvverificerer, fuldfører komplette opgaver, kan udvide scope og producerer længere standardsvar.
Core-principper for Opus 5
- Giv den komplette opgave fra start — Lever hele specifikationen, kontekst, begrænsninger og ønsket output i én prompt. Den performer bedst, når den får lov at køre frem for at blive fodret i trin. Den fuldfører ende-til-ende-funktioner i stedet for at efterlade stubs.
- Fjern verifikationsinstruktioner — Eksplicit “dobbelttjek”, “verificér dit arbejde” eller “brug en subagent til at verificere” medfører over-verifikation og spildte tokens. Opus 5 verificerer og itererer allerede internt. Slet disse linjer fra systemprompter og CLAUDE.md-filer.
- Kontroller scope eksplicit — Den kan udvide opgaver efter eget skøn. Tilføj klare grænser: “Lever præcis det, der blev bedt om, i det tilsigtede scope. Træf rutinemæssige skøn selv. Tjek kun ind, når forskellige fortolkninger ville føre til materielt forskelligt arbejde. Hvis forespørgslen virker fejlbehæftet, nævn det kort og fortsæt med opgaven som angivet.”
- Styr verbosity — Standardsvar er længere. For kortfattet output tilføj: “Hold svaret fokuseret, kort og præcist. Prioritér kerne svaret; hold forbehold korte.”
- Brug effort klogt — Start med high (standard). Brug low/medium flittigt til klassifikation, simple edits eller højvolumen-arbejde, hvor kvaliteten holder. Reservér xhigh/max til de sværeste kodnings- og agentiske problemer. Genvurdér nedarvede effort-indstillinger fra Opus 4.8.
- Kontrol af subagenter — Den delegerer lettere. Instruér: “Deleger kun til en subagent for store, reelt uafhængige og paralleliserbare opgaver. Brug ikke subagenter til verifikation eller arbejde, du kan færdiggøre i få værktøjskald.”
- Reviews og audits — Bed om komplette fund med confidence/severity-labels, og filtrér selv. “Rapportér kun høj-severitetsproblemer” følges bogstaveligt og kan overse problemer.
Eksempel på promptskabelon til kodning med høj effort
text
[Set effort to max or xhigh]
Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].
Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.
Output the final artifacts and a brief summary of decisions.
Eksempel på lav-effort klassifikation
text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.
Ved migration fra Opus 4.8: retest prompts, fjern verifikationsstillads, tilføj eksplicitte længde-/scope-kontroller, og sweep effort-niveauer på jeres interne evals. Anthropic bemærker, at mange ældre, detaljerede instruktionssæt nu kan forenkles.
Sammenligningstabel: Claude Opus 5 vs centrale alternativer (omtrentlige, juli 2026)
| Model | Input/Output ($/MTok) | Frontier-Bench | SWE-Verified | ARC-AGI-3 | Context | Noter |
|---|---|---|---|---|---|---|
| Claude Opus 5 | $5 / $25 | 43.3% | 96.0% | 30.2% | 1M | Bedste pris/ydelse til daglig højkapabilitetsbrug |
| Claude Opus 4.8 | $5 / $25 | ~19–21% | 88.6% | Low | 1M | Tidligere Opus |
| Claude Fable 5 | $10 / $50 | ~33.7% | ~95% | Lower | 1M | Højere tier, flere restriktioner i nogle tilfælde |
| GPT-5.6 Sol (approx.) | Competitive | Lower | High | Lower | Varies | Stærkt alternativ |
| Claude Sonnet 5 | Lower (~$3/$15 or promo) | Lower | Strong | Lower | 1M | Hurtigere/billigere daglig driver |
Tal hentet fra Anthropic-annonceringer og aggregatorrapporter; verificér altid de seneste uafhængige evals.
CometAPI-anbefaling: CometAPI giver samlet adgang til Claude Opus 5 (og 500+ andre modeller) via et OpenAI-kompatibelt endpoint (https://api.cometapi.com/v1) og støtte til Anthropic Messages API. Oplistede priser er konkurrencedygtige (f.eks. omkring $4/$20 pr. MTok observeret for Opus 5 på tidspunktet for skrivning), med én API-nøgle, forenklet fakturering og nem modelswitching. Dette er særligt nyttigt for teams, der ønsker Claude’s kapabiliteter uden at håndtere flere udbyderkonti eller ratelimit-siloer. Tjek aktuelle CometAPI-modellister og -priser for de nyeste takster og gratistoken-kampagner.
Konklusion
Claude Opus 5 sætter en ny barre for Opus-tieret: frontier-kaliber agentisk og ræsonneringsperformance til den foregående generations prisniveau, med meningsfulde fremskridt i selvstyret problemløsning (fremhævet af ARC-AGI-3-resultatet) og de mest favorable alignment-tal, Anthropic har publiceret for denne klasse. Den er ikke perfekt—domænespecifikke regressioner og rapporter fra praksis om instruktionsefterlevelse minder os om, at benchmarks ikke er hele historien—men til kodningsagenter, langhorisont-workflows, videnarbejde og computerbrugsapplikationer er den i øjeblikket en af de stærkeste generelt tilgængelige muligheder.
Kombinér stram prompting-disciplin med effort-drejeknappen, udnyt 1M-kontekstvinduet, og rut trafik intelligent (via officielle API’er eller platforme som CometAPI) for at maksimere værdien. Som med enhver frontier-model er løbende evaluering på jeres egne data essentiel. Anthropic’s hurtige iterationstakt antyder, at yderligere forfinelser kommer hurtigt; Opus 5 leverer allerede et væsentligt, omkostningseffektivt kapabilitetsspring, der er værd at adoptere i dag.
Kilder og yderligere læsning:
- Anthropic: Hvad er nyt i Claude Opus 5 — https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic: Prompting Claude Opus 5 — https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
- Anthropic-nyhedsannonceringer og systemkort (juli 2026)
- DataCamp: Claude Opus 5 forklaret — https://www.datacamp.com/blog/claude-opus-5
- MindStudio / Vellum / BenchLM benchmark-opsamlinger (juli 2026)
- ARC Prize Foundation verificerede scorer
