TL;DR
Claude Sonnet 5.5 to najnowszy model klasy Sonnet od Anthropic, wydany 28 września 2026 r.. Pozycjonowany jest jako szybsze, tańsze uzupełnienie Claude Opus 5.5 do programowania, dobrze zdefiniowanej pracy agentowej, produkcji dokumentów, obsługi komputera i analizy multimodalnej.
Model utrzymuje standardowe ceny $2 za 1M tokenów wejściowych i $10 za 1M tokenów wyjściowych. Anthropic podaje, że generowanie wyjścia jest o ponad 30% szybsze niż w Sonnet 5, a koszt na zadanie może być do 30% niższy, ponieważ nowszy model często kończy pracę mniejszą liczbą tokenów i kroków.
Opublikowane wyniki obejmują 70.6% na Terminal-Bench 4.0, 55.5% na CursorBench 4.0, 1844 na GDPval-AA v2.1 oraz 80.1% na OSWorld 2.1. Wartość praktyczna nie sprowadza się do pojedynczego wyniku: Sonnet 5.5 zbliża się do Opus 5.5 w kilku ewaluacjach pracy profesjonalnej, zachowując niższe standardowe ceny tokenów.
Kluczowe wnioski
- Claude Sonnet 5.5 to drugi model w rodzinie Claude 5.5, zoptymalizowany pod szybkie prace produkcyjne, a nie najbardziej niejednoznaczne, otwarte zadania.
- Obsługuje okno kontekstu 1M tokenów, do 128K tokenów wyjściowych, wejście tekstowe i obrazowe, adaptive thinking, użycie narzędzi oraz ustrukturyzowane odpowiedzi.
- Standardowe ceny w Claude API to $2/M za wejście, $10/M za wyjście, $0.20/M za odczyty z cache i $2.50/M za pięciominutowe zapisy do cache.
- Anthropic raportuje ponad 30% szybsze generowanie w porównaniu z Sonnet 5 oraz duże zyski w programowaniu, obsłudze komputera, rozumieniu wykresów i pracy wiedzochłonnej o długim horyzoncie.
- Identyfikator modelu w Claude API to claude-sonnet-5-5; deweloperzy mogą też korzystać z Claude Sonnet 5.5 API w CometAPI.
Czym jest Claude Sonnet 5.5?
Claude Sonnet 5.5 to najnowszy ogólnego przeznaczenia model Sonnet od Anthropic i drugie wydanie z rodziny Claude 5.5 po Claude Opus 5.5. Anthropic pozycjonuje go jako szybsze i tańsze uzupełnienie Opus, a nie bezpośredni zamiennik flagowca.
Różnica ma charakter praktyczny: Opus 5.5 celuje w złożoną, niejednoznaczną pracę wymagającą trwałego osądu, podczas gdy Sonnet 5.5 jest zoptymalizowany pod dobrze zdefiniowane zadania, naprawę błędów, szybką iterację, programowanie, produkcję dokumentów i wysokonakładowe przepływy pracy profesjonalnej.
Jakie są najważniejsze funkcje Claude Sonnet 5.5?
Model łączy okno kontekstu 1M tokenów, do 128K tokenów wyjściowych, wejście tekstowo-obrazowe, adaptive thinking, regulowany poziom effort, użycie narzędzi, ustrukturyzowane wyjścia, cache promptów, przetwarzanie wsadowe oraz wsparcie przez Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry i Claude Platform na AWS. Dla zespołów produkcyjnych kluczowa jest nie pojedyncza funkcja, lecz połączenie szybkiego generowania, niższego użycia tokenów na zadanie i osiągów bliskich Opus w szeregu dobrze zdefiniowanych prac profesjonalnych.
Benchmarki Claude Sonnet 5.5
Anthropic raportuje istotne zyski w programowaniu, pracy profesjonalnej o długim horyzoncie, obsłudze komputera i rozumieniu wizualnym. Poniższa tabela podsumowuje opublikowane wyniki ewaluacji.
| Benchmark i oficjalne źródło | Claude Sonnet 5.5 | Claude Sonnet 5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% at Xhigh | Not publicly reported |
| FrontierCode 1.1 Main | 46.2% at Max | 42.4% | 54.4% | 49.3% / 52.1% at Xhigh |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | Not publicly reported |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1 | 1811 | 1359 | 1822 | 1483 |
| Humanity's Last Exam | 64.5% with tools | 54.9% | 67.7% | Not reported in the source table |
| OSWorld 2.1 | 80.1% | 57.0% | 81.8% | Not reported in the source table |
| Chartography | 61.6% | 15.6% | 64.4% | 53.6% |
Warunki ewaluacji i zastrzeżenia: Wyniki nie są mierzone przy tym samym ustawieniu effort. Wynik 66.4% dla Opus 5.5 na Terminal-Bench podano dla Xhigh. Anthropic zauważa, że Sonnet 5.5 może uzyskać niższy wynik na Max niż na Xhigh w FrontierCode, ponieważ dodatkowe kroki weryfikacji mogą powodować przekroczenia limitów czasu lub zmiany wykraczające poza zakres. Artificial Analysis uruchomiło GDPval-AA i AA-Briefcase na przedpremierowym wdrożeniu Sonnet 5.5, na które wpływał błąd ustrukturyzowanych wyjść, który – jak podaje Anthropic – został już naprawiony. Dane cross-vendor dla GPT-6 Sol należy traktować jako nieaktualne obserwacje, ponieważ OpenAI skorygowało problem z kodowaniem obrazu 25 września 2026 r.
Co oznaczają wyniki: Sonnet 5.5 nie wygrywa z Sonnet 5 wyłącznie pojedynczymi wynikami. Znacznie zbliża się do Opus 5.5 w programowaniu, pracy profesjonalnej, obsłudze komputera i rozpoznawaniu wykresów, zachowując ceny na poziomie Sonnet. Anthropic podaje też, że przy Low lub Medium effort Sonnet 5.5 może przewyższać najlepsze wyniki Sonnet 5 w kilku ewaluacjach przy mniej więcej jednej dziesiątej kosztu na zadanie. To połączenie możliwości, szybkości i efektywności kosztowej na poziomie zadania stanowi jego główną przewagę konkurencyjną.
Jak dobry jest Claude Sonnet 5.5?
Programowanie
Poprawa jest również operacyjna. Anthropic podaje, że Sonnet 5.5 szybciej rozumie bazy kodu, efektywniej grupuje wywołania narzędzi, używa mniej kroków i obniża koszt na ukończone zadanie. FrontierCode testuje, czy proponowane zmiany kodu można zmergować, podczas gdy CursorBench używa niejednoznacznych, wieloplikowych zadań zaczerpniętych z realnych sesji kodowania; zyski zatem odzwierciedlają wykonanie i osąd na poziomie repozytorium, a nie tylko krótkie generowanie kodu. To ma znaczenie dla naprawy błędów, przeglądów kodu, wykonywania testów i długotrwałych agentów programistycznych.

Praca profesjonalna
Ulepszenia wykraczają poza programowanie. GDPval-AA testuje realne zadania zawodowe w 44 profesjach i dziewięciu głównych branżach, więc wynik Sonnet 5.5 na poziomie 1844 — wobec 1449 dla Sonnet 5 i 1846 dla Opus 5.5 — sugeruje, że zyski przekładają się na praktyczną analizę, produkcję dokumentów i wsparcie decyzyjne, a nie pozostają ograniczone do laboratoryjnych testów rozumowania.
Anthropic podkreśla poprawę w obszarach takich jak analiza finansowa, synteza dokumentów, tworzenie slajdów, praca na arkuszach kalkulacyjnych, interpretacja wykresów, weryfikacja źródeł, wyszukiwanie informacji i pisanie profesjonalne.
Wczesni testerzy zgłaszali też mniej wymierne usprawnienia: klarowniejszą współpracę, bardziej naturalny osąd konwersacyjny i lepsze wyczucie designu. Anthropic twierdzi, że model potrafi dodać szlif interfejsom użytkownika i na tyle ściśle trzymać się szablonów slajdów, by tworzyć deki wymagające minimalnej edycji; w jednym wewnętrznym teście przeglądu operacyjnego dwóch ekspertów uznało, że pierwszy szkic nadaje się do wysłania bez zmian.
Szersza implikacja jest taka, że Sonnet 5.5 najlepiej rozumieć jako model do pracy profesjonalnej, a nie tylko tańszy model do kodowania.
Obsługa komputera
Sonnet 5.5 osiąga 80.1% na OSWorld 2.1, w porównaniu do 57.0% dla Sonnet 5 i 81.8% dla Opus 5.5. OSWorld ocenia zdolność do obsługi graficznych środowisk komputerowych, więc wynik wskazuje na dużą poprawę generacyjną i niemal poziom Opus w przepływach pracy obejmujących przeglądarki, narzędzia desktopowe i multimodalne rozumienie interfejsów. Wyniki Chartography pokazują podobny wzorzec w wizualnym rozpoznawaniu wykresów: 61.6% dla Sonnet 5.5 wobec 15.6% dla Sonnet 5.
Szybkość
Anthropic podaje, że Sonnet 5.5 generuje wyjście o ponad 30% szybciej niż Sonnet 5, czyniąc go na starcie najszybszym modelem Sonnet. Szybsze wyjście w połączeniu z mniejszą liczbą wywołań narzędzi i niższym zużyciem tokenów skraca pętle agenta, redukuje czas oczekiwania podczas iteracyjnego kodowania i poprawia przepustowość w wsparciu i innych wysokonakładowych przepływach pracy.
Ile kosztuje Claude Sonnet 5.5?
| Cennik i oficjalne źródło | Claude Sonnet 5.5 | CometAPI: Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|---|
| Odczyty z pamięci podręcznej | $0.20 / 1M | $0.16 / 1M | $0.20 / 1M |
| Pięciominutowe zapisy do pamięci podręcznej | $2.50 / 1M | $2 / 1M | $5 / 1M |
| Tokeny wejściowe | $2 / 1M | $1.60/M | $4 / 1M |
| Tokeny wyjściowe | $10 / 1M | $8.00/M | $20 / 1M |
Przy standardowych stawkach tokenowych Sonnet 5.5 kosztuje o połowę mniej niż Opus 5.5 za wejście i wyjście. Anthropic podaje też, że nowszy Sonnet często potrzebuje mniej tokenów, by wykonać tę samą pracę niż Sonnet 5, co obniża koszt na ukończone zadanie.
To standardowe ceny Claude API. Cenniki dostawców chmur, region przetwarzania, czas trwania cache, rabaty za batch oraz zasady dla długiego kontekstu mogą zmieniać efektywny koszt.
Jakie zmiany w zakresie bezpieczeństwa wprowadza Claude Sonnet 5.5?
Anthropic podaje, że jego zautomatyzowany audyt zachowań objął ok. 1 850 scenariuszy i wykazał, że Sonnet 5.5 poprawił się lub dorównał Sonnet 5 w większości testowanych miar zgodności, odporności na nadużycia i uczciwości.
Zabezpieczenia w zakresie cyberbezpieczeństwa
Ponieważ Sonnet 5.5 ma silniejsze możliwości cyber niż jego poprzednik, Anthropic wdraża zabezpieczenia podobne do tych używanych dla bardziej zaawansowanych modeli. Rutynowe tworzenie oprogramowania i zwykła naprawa błędów pozostają wspierane, podczas gdy niektóre wyższo-ryzykowne zadania z zakresu cyberbezpieczeństwa mogą przełączać się na bezpieczniejszą ścieżkę modelu.
Zabezpieczenia w zakresie biologii
Model używa tych samych zabezpieczeń biologicznych co Sonnet 5, celując w wąski zestaw potencjalnie szkodliwych żądań, pozostawiając większość badań, edukacji i pracy klinicznej bez wpływu.
Zabezpieczenia antydestylacyjne
Anthropic twierdzi, że Sonnet 5.5 to pierwszy model Sonnet uruchamiany z klasyfikatorami bezpieczeństwa zaprojektowanymi, by zapobiegać ekstrakcji rozumowania poprzez przemysłowe ataki destylacyjne. Rozszerza też preserved thinking, wiążąc treść myślenia z kontem i rozmową, które je utworzyły, tak by rozumowanie nie mogło być swobodnie odłączane i odtwarzane gdzie indziej. Większość deweloperów nie zauważy tej zmiany, ale systemy, które przenoszą rozmowy między kontami lub zmieniają wcześniejszy stan rozmowy, powinny przejrzeć wytyczne migracji.
Te stwierdzenia opisują zgłaszane przez Anthropic zabezpieczenia, a nie niezależną gwarancję bezpieczeństwa dla każdego wdrożenia. Zespoły powinny oceniać model względem własnego modelu zagrożeń, polityk i przepływów wysokiego ryzyka.
Claude Sonnet 5.5 vs Claude Sonnet 5 vs Claude Opus 5.5 vs GPT-6 Sol
Claude Sonnet 5.5 jest pozycjonowany jako szybki, wydajny model produkcyjny w tej grupie. Anthropic podaje, że generuje wyniki ponad 30% szybciej niż Claude Sonnet 5, zachowując tę samą nagłówkową cenę tokenów. Claude Opus 5.5 celuje w trudniejszą i bardziej niejednoznaczną pracę, a GPT-6 Sol to najbliższe porównanie od OpenAI dla długiego kontekstu w programowaniu i przepływów agentowych.
| Wymiar | Claude Sonnet 5 | Claude Sonnet 5.5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Pozycjonowanie | Poprzedni model Sonnet do produkcji | Szybki, wydajny koń pociągowy do produkcji | Wyższy poziom złożonego rozumowania | Złożone programowanie i przepływy agentowe |
| Okno kontekstu | 1M | 1M | 1M | 1.05M |
| Maksymalne wyjście | 128K | 128K | 128K | 128K |
| Sterowanie rozumowaniem | Adaptive effort | Adaptive effort | Adaptive thinking, always on | none, low, medium, high, xhigh, and max |
| Wejście multimodalne | Tekst i obrazy | Tekst i obrazy | Tekst i obrazy | Tekst i obrazy |
| Dostępność API | Claude API i główne platformy chmurowe | Claude API i główne platformy chmurowe | Claude API i główne platformy chmurowe | Responses API and Chat Completions |
| Standardowa cena za 1M wej./wyj. | $2 / $10 | $2 / $10 | $4 / $20 | $2 / $10 dla promptów do 272K tokenów wejściowych |
| Szybkość | Linia bazowa | Ponad 30% szybciej niż Sonnet 5 | Zoptymalizowany pod trudniejsze, dłuższe zadania | Zależna od poziomu reasoning effort |
| FrontierCode 1.1 | 42.4% | 46.2% at Max | 54.4% | 49.3% / 52.1% at Xhigh |
| GDPval-AA v2.1 | 1449 | 1844 | 1846 | 1487 |
| Najlepiej nadaje się do | Istniejące obciążenia Sonnet | Wysokonakładowe programowanie i agenci profesjonalni | Trudne, niejednoznaczne, długotrwałe zadania | Natywne dla OpenAI kodowanie, agenci, narzędzia i przepływy z długim kontekstem |
Te liczby benchmarków to obserwacje cross-vendor, a nie kontrolowane, trwałe rankingi. Wyniki zależą od ustawień effort i warunków wdrożenia.
Jak uzyskać dostęp i wywołać Claude Sonnet 5.5 przez CometAPI?
Claude Sonnet 5.5 jest dostępny przez Claude, Claude Platform, Amazon Web Services, Google Cloud i Microsoft Azure. Deweloperzy, którzy chcą jednego interfejsu kompatybilnego z OpenAI dla wielu dostawców, mogą wywołać model przez Claude Sonnet 5.5 API w CometAPI z identyfikatorem modelu claude-sonnet-5-5.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="claude-sonnet-5-5",
messages=[
{
"role": "user",
"content": "Analyze this codebase and identify the three highest-impact bugs.",
}
],
max_tokens=2048,
)
print(response.choices[0].message.content)
Do zastosowań produkcyjnych przechowuj klucz API w zmiennej środowiskowej oraz oceń ustawienia effort, cache, wywołania narzędzi, zachowanie retry i zużycie tokenów na zadanie.
Czym jest ustawienie effort w Claude Sonnet 5.5?
Claude Sonnet 5.5 obsługuje regulowane poziomy effort, które zamieniają szybkość i użycie tokenów na głębokość rozumowania. Anthropic ustawia domyślnie Medium effort w aplikacjach Claude i Claude Code, podczas gdy Claude Platform domyślnie używa High.
Niższe poziomy effort pasują do rutynowej lub silnie ustrukturyzowanej pracy. Wyższe ustawienia pozwalają na więcej rozumowania i sprawdzania w trudniejszym programowaniu, analizie i zadaniach agentowych. Budżetowanie produkcyjne powinno zatem uwzględniać effort, użycie narzędzi i całkowity koszt ukończenia zadania, a nie tylko cenę tokenów.
API: co nowego względem Sonnet 5
Pięć zmian może zepsuć lub zmienić istniejące integracje Sonnet 5:
- Migracje z wyłączonym thinking: integracje, które wyłączały thinking, powinny przełączyć się na thinking: {"type": "between_tools"}. To ustawienie wyłącza thinking na początku, zachowując rozumowanie między narzędziami.
- Wymuszony użytek narzędzi: wymuszone wybory narzędzi teraz zwracają błąd; używaj automatycznego wyboru narzędzi ze ścisłymi schematami tam, gdzie to właściwe.
- Zachowanie bloków thinking: bloki thinking są powiązane z modelem i rozmową. Przekazuj je z powrotem bez zmian i nie zakładaj, że można je odtwarzać po zmianie wcześniejszych komunikatów systemowych, narzędzi lub kontekstu konta.
- Wersja narzędzia do obsługi komputera: w Claude API i Google Cloud starsze computer_20251124 nie jest już akceptowane; migruj do aktualnie udokumentowanego zestawu narzędzi komputerowych.
- Zgodność advisor: narzędzie advisor odrzuca Claude Opus 4.8, Opus 4.7 i Sonnet 5 jako doradców.
Jedna dodatkowa zmiana kształtu odpowiedzi może cicho się nie powieść: tekst generowany między wywołaniami narzędzi może pojawić się w blokach thinking zamiast w blokach tekstowych. Aplikacje, które strumieniują komunikaty o postępie, powinny przetwarzać odpowiedzi według typu bloku i ustawić odpowiedni tryb wyświetlania. Sonnet 5.5 dodaje też per-message effort w wersji beta, systemowe komunikaty w trakcie rozmowy, zmiany narzędzi w trakcie rozmowy w wersji beta, minimalną długość 512 tokenów dla cache’owalnego promptu, przetwarzanie wsadowe, Files API, wejście PDF i vision oraz zarówno narzędzia po stronie serwera, jak i klienta.
Co oznacza Claude Sonnet 5.5 dla rodziny Claude 5.5?
- Claude Opus 5.5: złożona praca o wysokim poziomie osądu i długim horyzoncie.
- Claude Sonnet 5.5: wydajna produkcja, programowanie, agenci i praca profesjonalna.
- Claude Haiku 5.5: zapowiedziany jako nadchodzący członek rodziny o wysokiej przepustowości i wrażliwości na koszty.
Szersza zmiana polega na mierzeniu kosztu na udane zadanie, szybkości inferencji i routingu modeli, zamiast skupiania się wyłącznie na cenie tokena lub pojedynczym benchmarku.
Podsumowanie
Claude Sonnet 5.5 to usprawnienie ukierunkowane na efektywność w warstwie produkcyjnej Anthropic. Zachowuje standardowe ceny tokenów Sonnet 5 na poziomie $2/$10, dodając okno kontekstu 1M tokenów, do 128K tokenów wyjściowych, znacząco szybsze generowanie i duże zyski w programowaniu, obsłudze komputera, rozumieniu wizualnym i pracy merytorycznej.
Najmocniejszy argument za modelem to ekonomika pracy: jak niezawodnie i szybko kończy zadanie, ile wywołań narzędzi i tokenów zużywa oraz jak często przepływ wciąż wymaga eskalacji do Opus 5.5. Zespoły powinny zweryfikować te czynniki na własnych zadaniach i traktować benchmarki międzydostawcowe jako nieaktualne obserwacje, a nie trwałe rankingi.
