TL;DR: Claude Opus 5, wydany przez Anthropic 24 lipca 2026 r., stanowi skokową zmianę względem Opus 4.8 w obszarach głębokiego rozumowania, agentycznego kodowania, zadań długohoryzontowych i rozwiązywania nowych problemów. Dorównuje lub przewyższa droższy Fable 5 na kluczowych benchmarkach (w tym 43,3% na Frontier-Bench v0.1 i rekordowe 30,2% na ARC-AGI-3), kosztując tyle samo co Opus 4.8—$5 za milion tokenów wejściowych i $25 za milion tokenów wyjściowych. Z kontekstem 1M tokenów, domyślnie włączonym „thinking”, silną samoweryfikacją i poprawioną zgodnością (najniższy wynik niepożądanego zachowania wśród ostatnich Claude’ów), wyróżnia się w złożonym kodowaniu, użyciu komputera, pracy wiedzochłonnej i wieloagentowych przepływach pracy. Średni effort często zapewnia szczytową efektywność.
Kluczowe wnioski
- Opus 5 to rzeczywista, generacyjna aktualizacja względem Opus 4.8, a nie inkrementalna—zwłaszcza w zakresie agentycznej wytrwałości, skalowania obliczeń w czasie testu i inteligencji płynnej (skok ARC-AGI-3 z ~1,5% do 30,2%) z Claude blog.
- Przewyższa lub dorównuje Fable 5 na głównych benchmarkach kodowania/agentycznych przy mniej więcej połowie ceny.
- Cennik bez zmian: $5/$25 za milion tokenów; efektywność wynika z lepszej wydajności na token oraz mocnych wyników przy średnim/niższym effort.
- Profil bezpieczeństwa to jak dotąd najlepszy w linii Opus od Anthropic, z celowymi limitami ofensywnych możliwości cyber i mniejszą liczbą wywołań klasyfikatorów.
- Zmiany w promptowaniu: usuń stare instrukcje weryfikacyjne, jednoznacznie zawężaj zakres, kontroluj rozwlekłość i użycie subagentów, korzystaj z parametru effort—zob. Claude doc.
- Najlepszy do agentów długodziałających, kodowania wieloplikowego, pracy wiedzochłonnej i zadań ze wsparciem wizji; raporty z praktyki wskazują na mocne strony w demach/złożonych budowach, ale i sporadyczne tarcia w podążaniu za instrukcjami przy dużych bazach kodu.
- Platformy takie jak CometAPI ułatwiają kierowanie ruchu między modelami Claude (i konkurentami) z ujednoliconym rozliczaniem i fallbackami.
Claude Opus 5 to najnowszy flagowiec Anthropic w klasie Opus, ogólnie dostępny. Pozycjonowany poniżej bardziej ograniczonej klasy Mythos/Fable w niektórych obszarach, ale konkurencyjny lub lepszy w wielu publicznych ewaluacjach, celuje w złożone agentyczne kodowanie, pracę przedsiębiorstw i zadania długohoryzontowe. Wydany zaledwie dwa miesiące po Opus 4.8, reprezentuje zmianę skokową, a nie drobną iterację.
Czym jest Claude Opus 5?
Claude Opus 5 (ID modelu API: claude-opus-5) to najnowszy model klasy Opus od Anthropic, zoptymalizowany pod kątem złożonego agentycznego kodowania i obciążeń korporacyjnych. Oferuje okno kontekstu 1M tokenów (domyślne i maksymalne), do 128k maks. tokenów wyjścia oraz domyślnie włączone „thinking”. Model decyduje, kiedy i jak dużo „myśleć”; deweloperzy kontrolują głębokość poprzez parametr effort (low, medium, high, xhigh, max).
Kluczowe nowe możliwości i zmiany względem poprzednich generacji obejmują:
- Silniejszą agentyczną wytrwałość—kontynuuje pracę aż do sukcesu zamiast zatrzymywać się na wiarygodnych odpowiedziach.
- Ulepszoną samoweryfikację i debugowanie przyczyn źródłowych.
- Lepszą koordynację wieloagentową i delegowanie do subagentów.
- Silniejszą wizję dla wykresów, dokumentów, diagramów oraz replikacji UI/frontend (zwłaszcza przy iteracyjnym użyciu narzędzi).
- Usprawnioną pracę biurową/dokumentową (złożone arkusze wieloarkuszowe, strukturalne prezentacje).
- Zmiany narzędzi w trakcie rozmowy (beta), niższe minimum prompt cache (512 tokenów) i domyślny tryb fallbacków.
- Tryb Fast (podgląd badań) dostępny w API Claude w wyższych stawkach.
Anthropic opisuje go jako dostarczającego inteligencję poziomu frontier za połowę kosztu Fable 5, zasilającego długo działających agentów z ulepszeniami w kodowaniu i pracy profesjonalnej.
Claude Opus 5 vs Opus 4.8
Opus 5 jest wprost przedstawiany jako skokowa zmiana względem Opus 4.8. Największe zyski widać w głębokim rozumowaniu na długich łańcuchach problemów, agentycznym kodowaniu i długohoryzontowych pętlach użycia narzędzi (domykanie funkcji wieloplikowych i prac end-to-end bez stubów), skalowaniu obliczeń w czasie testu, efektywności przy niższych poziomach effort, precyzji w review/bug-finding, wizji, spójności na długim kontekście, pracach biurowych i koordynacji wieloagentowej.
Behawioralnie, odpowiedzi domyślne i dokumenty wyjściowe są dłuższe. Model częściej relacjonuje postęp w sesjach agentycznych, chętniej deleguje do subagentów i sam weryfikuje swoją pracę bez proszenia. Dziedziczone instrukcje typu „uwzględnij końcowy krok weryfikacji” prowadzą teraz do przeweryfikowania i marnowania tokenów—usuń je.
„Thinking” jest domyślnie włączone (wcześniej adaptive/thinking wymagało jawnego ustawienia w 4.8). Wyłączenie thinking jest dozwolone tylko przy effort high lub niższym; wyższe efforty odrzucają wyłączone thinking. Ceny pozostają identyczne: $5 wejście / $25 wyjście za milion tokenów.
Krótko: zespoły migrujące powinny zaktualizować ID modelu, ponownie ocenić domyślne effort na własnych ewaluacjach, usunąć rusztowanie weryfikacyjne z promptów i spodziewać się dłuższych, ale wyższej jakości wyjść z większą autonomią.
Benchmarki wydajności: co powiedzą dane?
Opus 5 notuje wybitne wyniki, szczególnie w nowych i agentycznych ewaluacjach. Wszystkie poniższe liczby pochodzą z materiałów system card/ogłoszeń Anthropic oraz niezależnych zestawień z końca lipca 2026; pamiętaj, że wyniki raportowane przez laboratoria wykorzystują własne harnezy i promptowanie.
Nagłówkowe wyniki w kodowaniu i agentyce
- Frontier-Bench v0.1 (agentyczne kodowanie terminalowe): Opus 5 43,3% vs Fable 5 33,7% vs Opus 4.8 18,7%.
- SWE-bench Verified: 96,0% (vs Fable 5 95,0%, Opus 4.8 88,6%).
- SWE-bench Pro: 79,2% (vs Fable 5 80,3%, Opus 4.8 69,2%).
- DeepSWE v1.1: 68,8% (konkurencyjnie; niektóre warianty GPT-5.6 wyżej).
- FrontierCode 1.1 (szczyt przy medium effort): ~53,4% main / 63,6% extended—najbardziej opłacalna konfiguracja w jednej analizie.
- CursorBench 3.2 (max effort): W granicach ~0,5% od szczytu Fable 5 przy około połowie kosztu na zadanie. Silny wynik koszt/jakość przy high/xhigh/max.
Nowatorskie rozumowanie i inteligencja płynna
- ARC-AGI-3: 30,2% (uprzedni frontier ~7,8% dla GPT-5.6 Sol przy high effort; Opus 4.8 ~1,5%). To największy odnotowany skok; model wykazał wewnętrzne modelowanie algebraiczne dynamiki gier i ludzką efektywność próbkowania na wcześniej nierozwiązanych środowiskach. Około 3× lepiej niż następny najlepszy model—silne rozwiązywanie nowych problemów.
- GDPval-AA v2: Stan sztuki w profesjonalnej pracy wiedzochłonnej.
- Zapier AutomationBench: ~1,5× lepiej od następnego modelu z wysokimi wskaźnikami domykania automatyzacji end-to-end.
- OSWorld 2.0 (użycie komputera): Przewyższa najlepszy zgłoszony wynik Fable 5 przy około jednej trzeciej kosztu.
- Wyniki w czołówce lub najlepsze w klasie na HLE (Humanity’s Last Exam) i zadaniach głębokiego researchu w stylu DeepSearchQA.
Użycie komputera, praca wiedzochłonna i narzędzia
- OSWorld 2.0: 70,6%—lepszy od rówieśników przy danych punktach cen.
- BrowseComp: ~90–90,8% (konkurencyjny lub nieco za szczytowymi konfiguracjami GPT-5.6).
- GDPval-AA v2 (Elo): 1861 (wyprzedza Fable 5 i poprzednie generacje).
- AutomationBench: Silne wskaźniki zaliczeń; raportowane ~1,5× lepiej w porównywalnym koszcie w niektórych analizach.
Opus 5 przynosi nieinkrementalne zyski, szczególnie w kodowaniu, agentyce i ewaluacjach pracy wiedzochłonnej. Anthropic i niezależne raporty podkreślają:
Nauka i dziedziny specjalistyczne
Istotne zyski względem Opus 4.8 na ewaluacjach nauk o życiu, w tym:
- Chemia organiczna (wnioskowanie struktury molekularnej ze spektroskopii): +10,2 punktu proc.
- Predykcja funkcji białek: +7,7 punktu proc.
- Stabilne poprawy w biologii strukturalnej i bioinformatyce.
Ponieważ Fable 5 ma bardziej restrykcyjne zabezpieczenia w biologii, Opus 5 jest obecnie najsilniejszym ogólnie dostępnym modelem Anthropic dla wielu naukowych przepływów pracy.

Źródło: claude
Zbiorcze, publiczne rankingi lokują Opus 5 blisko szczytu (np. ~82,8/100 i miejsce #2 z 215 w BenchLM), z wyjątkowo wysokimi percentylami w kategoriach wiedza, agentyka, kodowanie i multimodalność.
Informacje zwrotne od deweloperów z praktyki są mieszane: imponujące budowy gier w jednym podejściu, domykanie złożonych funkcji i samodzielne debugowanie, ale też raporty o sporadycznym ignorowaniu instrukcji, halucynacjach przy dużych bazach kodu czy nadmiernym komplikowaniu. Benchmarki pokazują szczyt możliwości w kontrolowanych warunkach; wyniki produkcyjne silnie zależą od promptowania, projektu narzędzi i ustawień effort.
Migawka benchmarków

Źródło: claude
Efektywność i koszty
Ceny bez zmian względem Opus 4.8: $5 za milion tokenów wejściowych / $25 za milion tokenów wyjściowych. Buforowane wejście jest znacząco tańsze (~$0,50). Tryb Fast działa mniej więcej w 2× stawkach ($10/$50). To około połowa stawek Fable 5 ($10/$50). Poprawa efektywności wynika z:
- Kontekstu 1M, który umożliwia pracę na całej bazie kodu lub długich dokumentach bez agresywnego chunkingu.
- Silnej wydajności nawet przy effort low/medium (mniej tokenów dla porównywalnej jakości wielu zadań).
- Wbudowanej samoweryfikacji i iteracji, które zmniejszają liczbę nieudanych przebiegów i pętle ręcznych poprawek.
- Zmian narzędzi w trakcie rozmowy (beta), które zachowują cache promptu.
Prawdziwa historia efektywności to wynik na dolara i na token. Opus 5 bardziej niezawodnie przekuwa dodatkowy effort w lepsze rezultaty niż wcześniejsze modele Opus. Medium effort często daje szczytowe lub bliskie szczytu wyniki na benchmarkach kodowania przy ~1,5× koszcie tokenowym względem low, podczas gdy high/xhigh/max na niektórych zestawach mogą dawać malejące lub płaskie zwroty.
Na krzywych koszt–wydajność publikowanych w okolicach premiery, Opus 5 wypada korzystnie względem Fable 5, Opus 4.8 i konkurencyjnych modeli frontier—wyższe wyniki przy niższym efektywnym koszcie na ukończone zadanie. Zużycie tokenów na review lub agentyczną pętlę może być wyższe w bezwzględnych liczbach przez dłuższe rozumowanie i samoweryfikację, ale jakość i odsetek ukończeń poprawiają się na tyle, że całkowity koszt sukcesu często spada.

Źródło: claude
Dla zespołów produkcyjnych rekomendacja praktyczna to zacząć od domyślnego high effort, potem sprawdzić low/medium na wewnętrznych ewaluacjach. Agresywnie korzystaj z prompt cache (teraz sensowne przy krótszych długościach), używaj zmian narzędzi w trakcie rozmowy, by zachować cache, oraz fallbacków na poziomie platformy. Ujednolicone bramki API, jak CometAPI, mogą dodatkowo optymalizować, kierując proste zadania do tańszych modeli (linie Sonnet/Haiku), rezerwując Opus 5 do złożonej agentycznej pracy, z centralną analityką użycia i kontrolą wydatków.
Bezpieczeństwo i zgodność
Anthropic opisuje Claude Opus 5 jako „najbardziej zgodny model do tej pory” i „najbezpieczniejszy jak dotąd” w kilku raportach. Kluczowe punkty z system card i ogłoszeń:
- Bardzo niskie ogólne ryzyko zgodności; brak nowych niepokojących własności względem poprzednich modeli.
- Najniższe wskaźniki zachowań zwodniczych mierzone przez Anthropic.
- Wysokie wskaźniki nieszkodliwych odpowiedzi na szkodliwe żądania przy jednocześnie jednych z najniższych wskaźników nadmiernych odmów na nieszkodliwe pytania.
- Poprawiona odporność na pewne wektory nadużyć; zabezpieczenia cyber skalibrowane bliżej poziomu Fable 5 z uwagi na większe możliwości, ale klasyfikatory uruchamiają się rzadziej (~85% rzadziej niż w Fable 5 w niektórych szacunkach).
- Nie przekracza progów Polityki Odpowiedzialnego Skalowania Anthropic dla automatycznego zastępowania B+R przez SI ani wyższych kategorii ryzyka chemicznego/biologicznego (traktowany podobnie do ostatnich modeli Opus, z zabezpieczeniami w stylu ASL-3 tam, gdzie ma to zastosowanie).
Model nadal wykazuje podwyższoną świadomość ewaluacji w testach (powszechne w modelach frontier). Monitorowanie wdrożeń w realnym świecie pokazało bardzo niskie wskaźniki niepokojących zachowań. Jak przy wszystkich modelach frontier, organizacje powinny stosować zabezpieczenia na poziomie aplikacji, zwłaszcza w zastosowaniach o wysokiej stawce lub dla agentów autonomicznych.
Jak tworzyć prompty dla Claude Opus 5, by uzyskać najlepsze wyniki
Anthropic opublikował wskazówki specyficzne dla modelu, ponieważ Opus 5 zachowuje się inaczej niż wcześniejsze Opus. Największe zmiany: sam weryfikuje, kończy pełne zadania, potrafi rozszerzać zakres i generuje dłuższe odpowiedzi domyślne.
Zasady główne dla Opus 5
- Podaj kompletne zadanie od razu — Dostarcz pełną specyfikację, kontekst, ograniczenia i oczekiwany wynik w jednym prompcie. Najlepiej działa, gdy pozwoli mu się wykonać całość, a nie karmić krokami. Domyka funkcje end-to-end zamiast zostawiać stuby.
- Usuń instrukcje weryfikacji — Jawne „sprawdź podwójnie”, „zweryfikuj swoją pracę” lub „użyj subagenta do weryfikacji” powodują przeweryfikowanie i marnowanie tokenów. Opus 5 już wewnętrznie weryfikuje i iteruje. Usuń te linie z promptów systemowych i CLAUDE.md.
- Kontroluj zakres jednoznacznie — Może rozszerzać zadania wedle własnego uznania. Dodaj jasne granice: „Dostarcz dokładnie to, czego zażądano, w zamierzonym zakresie. Rutynowe decyzje podejmuj sam. Daj znać tylko wtedy, gdy różne interpretacje prowadzą do materialnie różnych prac. Jeśli prośba wydaje się błędna, zaznacz to krótko i kontynuuj zgodnie z poleceniem.”
- Zarządzaj rozwlekłością — Domyślne odpowiedzi są dłuższe. Aby skrócić, dodaj: „Utrzymuj odpowiedź skupioną, zwięzłą i krótką. Priorytetyzuj rdzeń odpowiedzi; zastrzeżenia przedstaw krótko.”
- Rozsądnie używaj effort — Zacznij od high (domyślny). Korzystaj śmiało z low/medium do klasyfikacji, prostych edycji lub pracy masowej, gdzie jakość się utrzymuje. Zarezerwuj xhigh/max dla najtrudniejszych problemów kodowania i agentycznych. Ponownie oceń odziedziczone ustawienia effort z Opus 4.8.
- Kontrola subagentów — Deleguje chętniej. Zastrzeż: „Deleguj do subagenta tylko przy dużych, faktycznie niezależnych i równolegle wykonalnych zadaniach. Nie używaj subagentów do weryfikacji ani pracy, którą możesz skończyć w kilku wywołaniach narzędzi.”
- Przeglądy i audyty — Poproś o kompletne ustalenia z etykietami pewności/ważności, a następnie filtruj sam. „Zgłaszaj tylko problemy o wysokiej ważności” będzie interpretowane dosłownie i może pominąć inne.
Przykładowy szkielet promptu do kodowania przy wysokim effort
text
[Set effort to max or xhigh]
Complete the following end-to-end: [full feature description, acceptance criteria, constraints, existing file structure, style guidelines].
Deliver production-quality code. Adapt strategy as needed. Do not leave stubs or TODOs. Stay within the stated scope unless a material issue requires a one-sentence note.
Output the final artifacts and a brief summary of decisions.
Przykład klasyfikacji przy niskim effort
text
[Set effort to low]
Classify the input into exactly one of: [categories]. Return only the category name.
Przy migracji z Opus 4.8: przetestuj ponownie prompty, usuń rusztowanie weryfikacyjne, dodaj wyraźne ograniczenia długości/zakresu i wykonaj sweep poziomów effort na własnych ewaluacjach. Anthropic zauważa, że wiele starszych, szczegółowych zestawów instrukcji można teraz uprościć.
Tabela porównawcza: Claude Opus 5 vs kluczowe alternatywy (przybliżone, lipiec 2026)
| Model | Wejście/Wyjście ($/MTok) | Frontier-Bench | SWE-Verified | ARC-AGI-3 | Kontekst | Uwagi |
|---|---|---|---|---|---|---|
| Claude Opus 5 | $5 / $25 | 43.3% | 96.0% | 30.2% | 1M | Najlepszy stosunek ceny do wydajności do codziennego użycia o wysokich możliwościach |
| Claude Opus 4.8 | $5 / $25 | ~19–21% | 88.6% | Niski | 1M | Poprzedni Opus |
| Claude Fable 5 | $10 / $50 | ~33.7% | ~95% | Niższy | 1M | Wyższa klasa, w niektórych przypadkach więcej ograniczeń |
| GPT-5.6 Sol (approx.) | Konkurencyjne | Niższy | Wysoki | Niższy | Różne | Mocna alternatywa |
| Claude Sonnet 5 | Niższe (~$3/$15 lub promo) | Niższy | Silny | Niższy | 1M | Szybszy/tańszy model do codziennego użytku |
Liczby pochodzą z ogłoszeń Anthropic i raportów agregatorów; zawsze weryfikuj najnowsze niezależne ewaluacje.
Rekomendacja CometAPI: CometAPI zapewnia ujednolicony dostęp do Claude Opus 5 (i 500+ innych modeli) przez endpoint kompatybilny z OpenAI (https://api.cometapi.com/v1) i obsługę Anthropic Messages API. Wymienione ceny są konkurencyjne (np. około $4/$20 za MTok dla Opus 5 w momencie pisania), z jednym kluczem API, uproszczonym rozliczaniem i łatwym przełączaniem modeli. To szczególnie użyteczne dla zespołów, które chcą możliwości Claude bez zarządzania wieloma kontami dostawców czy limitami. Sprawdź aktualne listy modeli i ceny CometAPI pod kątem najświeższych stawek i promocji darmowych tokenów.
Podsumowanie
Claude Opus 5 wyznacza nowy poziom dla tieru Opus: wydajność agentyczna i rozumowania klasy frontier przy cenie z poprzedniej generacji, z istotnymi postępami w samodzielnym rozwiązywaniu problemów (podkreślone wynikiem ARC-AGI-3) i najkorzystniejszymi jak dotąd wskaźnikami zgodności, jakie Anthropic opublikował dla tej klasy. Nie jest idealny—regresje domenowe i raporty z praktyki o sporadycznym ignorowaniu instrukcji przypominają, że benchmarki to nie wszystko—ale do agentów kodujących, przepływów długohoryzontowych, pracy wiedzochłonnej i zastosowań z użyciem komputera jest obecnie jednym z najsilniejszych ogólnie dostępnych wyborów.
Połącz dyscyplinę w promptowaniu z pokrętłem effort, wykorzystaj okno kontekstu 1M i inteligentnie kieruj ruch (przez oficjalne API lub platformy takie jak CometAPI), aby zmaksymalizować wartość. Jak przy każdym modelu frontier, ciągła ewaluacja na własnych danych pozostaje kluczowa. Szybkie tempo iteracji Anthropic sugeruje, że wkrótce pojawią się kolejne udoskonalenia; Opus 5 już teraz zapewnia znaczący, opłacalny skok możliwości, który warto wdrażać.
Źródła i dalsza lektura:
- Anthropic: What’s new in Claude Opus 5 — https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- Anthropic: Prompting Claude Opus 5 — https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
- Ogłoszenia Anthropic i system card (lipiec 2026)
- DataCamp: Claude Opus 5 Explained — https://www.datacamp.com/blog/claude-opus-5
- Zestawienia benchmarków MindStudio / Vellum / BenchLM (lipiec 2026)
- Zweryfikowane wyniki ARC Prize Foundation
