24 lipca 2026 roku Anthropic udostępnił Claude Opus 5, nowy model z najwyższej klasy Opus, przeznaczony przede wszystkim do złożonego programowania agentowego, długich procesów wieloetapowych oraz wymagającej pracy enterprise.[1]
Oficjalna nazwa modelu to Claude Opus 5, a nie „Claude Opus 5.0”. Identyfikator używany w API to:
claude-opus-5
Opus 5 nie zastępuje Claude Fable 5 jako najmocniejszego publicznie dostępnego modelu Anthropic. Producent przedstawia go raczej jako model zbliżający się do możliwości Fable 5 przy niższej cenie i umiarkowanej, a nie najwolniejszej, charakterystyce opóźnień.[2]
Najważniejszą wiadomością dla obecnych użytkowników Opus 4.8 jest to, że cena bazowa nie wzrosła:
- 5 USD za milion tokenów wejściowych,
- 25 USD za milion tokenów wyjściowych.[3]
Jednocześnie Opus 5 wprowadza domyślnie włączone rozumowanie adaptacyjne, nowy najwyższy poziom wysiłku max, kontekst do miliona tokenów, maksymalnie 128 tysięcy tokenów standardowego wyjścia oraz nowe mechanizmy przeznaczone dla długotrwałych agentów.[2][4]
Najkrótszy wniosek: Claude Opus 5 jest przede wszystkim dużą aktualizacją dla zespołów, które zlecają modelowi całe zadania, a nie tylko pojedyncze fragmenty kodu. Nie każda aplikacja skorzysta jednak na migracji, ponieważ Sonnet 5 pozostaje znacznie tańszy, a Fable 5 nadal zajmuje najwyższe miejsce w ofercie pod względem maksymalnych możliwości.
Informacje i dokumentację zweryfikowano 24 lipca 2026 roku.
TL;DR
| Pytanie | Odpowiedź |
|---|---|
| Kiedy odbyła się premiera? | 24 lipca 2026 roku |
| Jaka jest oficjalna nazwa? | Claude Opus 5 |
| Jaki jest identyfikator API? | claude-opus-5 |
| Ile kosztuje? | 5 USD / MTok wejścia i 25 USD / MTok wyjścia |
| Czy cena wzrosła względem Opus 4.8? | Nie |
| Jak duży jest kontekst? | 1 milion tokenów |
| Jak duże jest standardowe maksymalne wyjście? | 128 tysięcy tokenów |
| Czy rozumowanie jest domyślnie włączone? | Tak |
| Jakie poziomy effort obsługuje? | low, medium, high, xhigh, max |
| Czy zastępuje Fable 5 jako najmocniejszy model? | Nie |
| Czy Opus 4.8 znika? | Nie, pozostaje dostępny |
| Gdzie jest dostępny? | Claude, Claude Code, API, AWS, Google Cloud i Microsoft Foundry |
| Czy istnieje Fast mode? | Tak, jako research preview |
| Czy wszystkie benchmarki są niezależne? | Nie, większość opublikowanych w dniu premiery pochodzi od Anthropic lub partnerów |
1. Czym jest Claude Opus 5?
Anthropic opisuje Opus 5 jako model do:
- złożonego programowania agentowego,
- pracy nad dużymi repozytoriami,
- długich pętli korzystania z narzędzi,
- rozwiązywania wieloetapowych problemów,
- analizy dokumentów i danych,
- pracy biurowej,
- koordynowania wielu agentów,
- budowania oraz poprawiania interfejsów i materiałów wizualnych.[4]
Opus 5 znajduje się pomiędzy Sonnet 5 i Fable 5:
Sonnet 5
szybszy i tańszy model do pracy na dużą skalę
Opus 5
model do trudnych zadań agentowych i enterprise
Fable 5
najwyższa publicznie dostępna zdolność Anthropic
Producent rekomenduje rozpoczęcie od Opus 5, gdy aplikacja wykonuje złożone programowanie agentowe lub pracę enterprise. Fable 5 ma być wybierany wtedy, gdy potrzebne są najwyższe dostępne możliwości, niezależnie od wyższego kosztu.[2]
2. Najważniejsze parametry techniczne
| Parametr | Claude Opus 5 |
|---|---|
| API ID | claude-opus-5 |
| Kontekst | 1 000 000 tokenów |
| Standardowe maksymalne wyjście | 128 000 tokenów |
| Rozumowanie | adaptacyjne, domyślnie włączone |
| Poziomy effort | low, medium, high, xhigh, max |
| Cena wejścia | 5 USD / MTok |
| Cena wyjścia | 25 USD / MTok |
| Cena Batch API | 2,50 USD / MTok wejścia, 12,50 USD / MTok wyjścia |
| Fast mode | 10 USD / MTok wejścia, 50 USD / MTok wyjścia |
| Reliable knowledge cutoff | maj 2026 |
| Training data cutoff | maj 2026 |
| Obraz jako wejście | tak |
| Tekst jako wyjście | tak |
Dane dotyczące kontekstu, cen i dat granicznych pochodzą z oficjalnego zestawienia modeli oraz cennika Anthropic.[2][3]
Milion tokenów jest wartością domyślną
W Opus 5 kontekst jednego miliona tokenów jest jednocześnie wartością domyślną i maksymalną. Nie istnieje osobny, mniejszy wariant kontekstu modelu.[4]
Nie oznacza to jednak, że każda informacja z bardzo długiego promptu zostanie wykorzystana z identyczną dokładnością. Maksymalna pojemność kontekstu nie jest gwarancją doskonałego wyszukiwania, rozumowania ani pamiętania każdego szczegółu.
Standardowe wyjście do 128 tysięcy tokenów
Standardowe wywołania Messages API mogą wygenerować do 128 tysięcy tokenów. Anthropic dokumentuje także eksperymentalne wyjście do 300 tysięcy tokenów dla Message Batches API, po zastosowaniu odpowiedniego nagłówka beta.[5]
To rozwiązanie jest przeznaczone między innymi do:
- bardzo długiej dokumentacji,
- obszernych ekstrakcji danych,
- dużych szkieletów kodu,
- książkowych wersji roboczych,
- długich procesów rozumowania.
Generowanie tak dużej odpowiedzi może trwać ponad godzinę i nie jest dostępne w zwykłym synchronicznym Messages API.[5]
3. Thinking jest teraz włączony domyślnie
To jedna z najważniejszych zmian migracyjnych.
W Opus 4.8 żądanie bez pola thinking działało bez dodatkowego rozumowania. W Opus 5 ten sam request uruchamia rozumowanie adaptacyjne. Model sam decyduje, kiedy oraz jak długo powinien analizować problem.[4]
Podstawowe wywołanie może wyglądać tak:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=16_000,
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Przeanalizuj architekturę projektu i zaproponuj plan migracji."
}
],
)
print(response.content)
Nie trzeba dodawać:
thinking={"type": "adaptive"}
ponieważ jest to zachowanie domyślne. Jawne ustawienie tej wartości nadal jest obsługiwane.
Pięć poziomów effort
Opus 5 obsługuje pełną skalę:
low
medium
high
xhigh
max
max jest najwyższym poziomem test-time compute. Nie wymaga nagłówka beta.[4]
Wyższy effort może zwiększać jakość przy trudnych zadaniach, ale zwykle oznacza również:
- większe zużycie tokenów,
- wyższy koszt,
- dłuższe oczekiwanie,
- więcej operacji narzędziowych,
- dłuższe procesy wykonywane przez subagentów.
Dlatego nie należy automatycznie ustawiać max dla wszystkich zapytań.
4. Ważna zmiana: kiedy można wyłączyć thinking?
Opus 5 pozwala wyłączyć thinking tylko przy effort:
low,medium,high.
Połączenie:
{
"thinking": {"type": "disabled"},
"output_config": {"effort": "xhigh"}
}
lub:
{
"thinking": {"type": "disabled"},
"output_config": {"effort": "max"}
}
zwraca błąd HTTP 400.[4]
To zmiana niekompatybilna z Opus 4.8.
Anthropic ostrzega także, że przy wyłączonym thinking Opus 5 może sporadycznie:
- zapisać wywołanie narzędzia jako zwykły tekst zamiast bloku
tool_use, - umieścić we widocznej odpowiedzi wewnętrzne znaczniki XML.
Producent zaleca pozostawienie thinking włączonego i kontrolowanie kosztu za pomocą niższego effort, o ile integracja nie wymaga innego zachowania.[4]
5. Co rzeczywiście poprawiono względem Opus 4.8?
Według dokumentacji Anthropic największe zmiany dotyczą:
- głębokiego rozumowania,
- programowania agentowego,
- długotrwałych zadań,
- skalowania jakości wraz z effort,
- code review i wyszukiwania błędów,
- analizy wizualnej,
- pracy z długim kontekstem,
- dokumentów, arkuszy i prezentacji,
- koordynacji wielu agentów.[4]
Dłuższe zadania i mniej niedokończonej pracy
Anthropic deklaruje, że Opus 5 lepiej utrzymuje cel podczas długich pętli narzędziowych i częściej kończy:
- funkcje obejmujące wiele plików,
- duże refaktoryzacje,
- zadania end-to-end,
- pracę wymagającą testowania i weryfikacji.
Producent zwraca uwagę na ograniczenie pozostawiania placeholderów i niedokończonych fragmentów.[4]
Automatyczna weryfikacja
Opus 5 częściej sam sprawdza własne wyniki. Dokumentacja migracyjna sugeruje nawet usunięcie powtarzanych instrukcji takich jak:
Na końcu koniecznie zweryfikuj swoją pracę.
Użyj osobnego subagenta do kontroli.
Pozostawienie takich poleceń może prowadzić do nadmiernej weryfikacji, dodatkowych wywołań narzędzi i niepotrzebnego kosztu.[4]
Więcej delegowania do subagentów
W środowiskach wieloagentowych model częściej dzieli zadania i deleguje je subagentom. To może być zaletą przy złożonych projektach, ale wymaga:
- limitowania budżetu,
- monitorowania liczby wywołań,
- kontroli uprawnień narzędzi,
- ochrony przed równoczesną edycją tych samych plików.
6. Benchmarki: co ogłosił Anthropic?
W dniu premiery Anthropic ogłosił, że Opus 5 osiąga najlepsze wyniki w jego zestawieniach dotyczących programowania i pracy wiedzy, między innymi na Frontier-Bench oraz GDPval-AA.[1]
Należy jednak zachować właściwy kontekst:
- część testów jest wewnętrzna,
- konfigurację i harness dobierał producent lub partner,
- wyniki mogą zależeć od effort,
- koszt na zadanie zależy od liczby wykorzystanych tokenów,
- nie każdy benchmark ma publiczny, łatwo odtwarzalny zestaw,
- nie są to niezależne certyfikaty jakości.
Frontier-Bench v0.1
Anthropic twierdzi, że Opus 5:
- zajmuje pierwsze miejsce w Frontier-Bench v0.1,
- osiąga ponad dwukrotnie wyższy wynik niż Opus 4.8,
- robi to przy niższym koszcie na zadanie.[1]
W przypisie producent podaje, że chodzi o wewnętrzne uruchomienie Frontier-Bench v0.1 na harnessie mini-SWE-agent, backendzie GKE i średnim wyniku z pięciu prób na zadanie. Przy odmowach klasyfikatora bezpieczeństwa używano Opus 4.8 jako modelu fallback.[1]
To ważne ograniczenie metodologiczne i powinno być podawane razem z wynikiem.
CursorBench 3.2
Przy effort max Opus 5 miał znaleźć się w odległości 0,5 punktu procentowego od najlepszego wyniku Fable 5, przy około połowie kosztu na zadanie.[1]
Jest to wynik przydatny do oceny relacji cena-jakość, ale pochodzi z testów opublikowanych przez Anthropic i partnera, a nie z neutralnej instytucji certyfikującej.
ARC-AGI 3
Anthropic podaje, że wynik Opus 5 był około trzykrotnie wyższy od następnego najlepszego modelu w zestawieniu.[1]
Bez pełnego opisu każdej konfiguracji nie należy tłumaczyć tego jako „trzy razy inteligentniejszy model”. Benchmark mierzy określony typ rozwiązywania nowych problemów, a nie ogólną inteligencję.
Zapier AutomationBench
Według Anthropic pass rate Opus 5 był około 1,5 raza wyższy niż następnego modelu przy podobnym koszcie na zadanie. Producent twierdzi również, że nawet najniższy effort Opus 5 przechodził więcej zadań niż pozostałe modele w tym zestawieniu.[1]
OSWorld 2.0
Na benchmarku obsługi środowiska komputerowego Opus 5 miał uzyskać najlepszą relację wydajności do kosztu i przekroczyć najlepszy rezultat Fable 5 przy nieco ponad jednej trzeciej kosztu.[1]
Badania naukowe
Anthropic raportuje poprawę we wszystkich własnych ewaluacjach life sciences względem Opus 4.8, w tym:
- o 10,2 punktu procentowego w wewnętrznym teście dotyczącym wnioskowania struktur molekularnych z danych spektroskopowych,
- o 7,7 punktu procentowego w zadaniach dotyczących przewidywania wpływu zmian sekwencji białka na jego funkcję.[1]
Są to wyniki wewnętrzne producenta. Nie powinny być przedstawiane jako niezależna walidacja kliniczna lub naukowa.
7. Opus 5 vs Opus 4.8
| Cecha | Opus 4.8 | Opus 5 |
|---|---|---|
| Cena bazowa | 5 / 25 USD za MTok | 5 / 25 USD za MTok |
| Kontekst | do 1M tokenów | 1M tokenów domyślnie |
| Max output | 128k | 128k |
| Thinking bez konfiguracji | wyłączony | włączony adaptacyjnie |
| Najwyższy effort | niższy zakres | max |
| Min. długość prompt cache | 1024 tokeny | 512 tokenów |
| Zmiany narzędzi w trakcie rozmowy | brak nowej funkcji | beta |
| Automatyczny fallback wg kategorii odmowy | brak nowego trybu | beta |
| Cena Fast mode | 10 / 50 USD | 10 / 50 USD |
| Status | nadal aktywny | najnowszy Opus |
Opus 4.8 nie został wycofany. Według oficjalnego harmonogramu oba modele pozostają aktywne, a Opus 5 nie ma zostać wycofany wcześniej niż 24 lipca 2027 roku.[6]
Kiedy zostać przy Opus 4.8?
Pozostanie przy poprzednim modelu może mieć sens, gdy:
- istniejący prompt i agent są dokładnie dostrojone,
- zespół nie zdążył przeprowadzić regresji,
- aplikacja zakłada brak thinking bez jawnej konfiguracji,
- proces wymaga stabilnego, znanego stylu odpowiedzi,
- klasyfikatory Opus 5 blokują legalny workflow cyberbezpieczeństwa,
- migracja nie przynosi mierzalnej poprawy jakości.
8. Opus 5 vs Sonnet 5
| Cecha | Sonnet 5 | Opus 5 |
|---|---|---|
| Profil | szybkość i inteligencja na dużą skalę | trudne zadania agentowe i enterprise |
| Cena standardowa | 3 / 15 USD za MTok | 5 / 25 USD za MTok |
| Cena promocyjna Sonnet | 2 / 10 USD do 31 sierpnia 2026 | brak analogicznej promocji |
| Kontekst | 1M | 1M |
| Max output | 128k | 128k |
| Thinking | adaptacyjny | adaptacyjny |
| Latency wg Anthropic | fast | moderate |
| Najwyższy effort | niższy niż pełna drabina Opus | max |
Sonnet 5 będzie lepszym wyborem dla:
- dużego ruchu,
- częstych krótkich zadań,
- automatyzacji, w której koszt ma pierwszeństwo,
- standardowego generowania kodu,
- klasyfikacji i ekstrakcji,
- aplikacji wymagających niższych opóźnień.
Opus 5 ma więcej sensu, gdy pojedynczy błąd lub niedokończone zadanie jest droższe niż dodatkowe tokeny.
9. Opus 5 vs Fable 5
| Cecha | Opus 5 | Fable 5 |
|---|---|---|
| Pozycja w ofercie | trudne agentic coding i enterprise | najwyższa publicznie dostępna zdolność |
| Cena | 5 / 25 USD | 10 / 50 USD |
| Kontekst | 1M | 1M |
| Max output | 128k | 128k |
| Latency wg Anthropic | moderate | slower |
| Thinking | adaptacyjny | zawsze włączony |
| Data retention requirement | brak specjalnego wymogu dla zwykłego dostępu | wymagane 30 dni w API |
| Cyber safeguards | mniej restrykcyjne | znacznie silniejsze klasyfikatory |
Anthropic przedstawia Opus 5 jako model zbliżający się do inteligencji Fable 5 za połowę jego ceny.[1]
Nie oznacza to, że Opus 5 zawsze dorównuje Fable 5. Oficjalne zestawienie nadal wskazuje Fable 5 jako najbardziej zdolny szeroko dostępny model Anthropic.[2]
Gdzie Opus 5 może być praktyczniejszy?
- codzienna praca programistyczna,
- code review,
- duże refaktoryzacje,
- workflow przedsiębiorstwa,
- analiza dokumentów,
- praca wymagająca mniejszej liczby odmów w legalnym cyberbezpieczeństwie,
- zastosowania, w których koszt Fable jest zbyt wysoki.
10. Nowości dla agentów i API
Zmiana narzędzi w trakcie rozmowy
W becie można dodawać lub usuwać narzędzia pomiędzy turami, bez unieważniania prompt cache.[4]
Wymagany jest nagłówek:
mid-conversation-tool-changes-2026-07-01
Może to być przydatne, gdy agent:
- rozpoczyna od narzędzi analitycznych,
- później otrzymuje dostęp do repozytorium,
- na końcu korzysta wyłącznie z testów i deploymentu.
Pozwala to ograniczać uprawnienia zamiast udostępniać wszystkie narzędzia od początku.
Automatyczne fallbacki
Parametr fallbacks otrzymał tryb "default", w którym Anthropic dobiera model zastępczy według kategorii odmowy.[4]
Funkcja jest w becie i wymaga nagłówka:
server-side-fallback-2026-07-01
W aplikacjach Anthropic część zablokowanych żądań cyberbezpieczeństwa może zostać przekazana do Opus 4.8. Podobny mechanizm można włączyć w API.[1]
Krótsze prompty mogą korzystać z cache
Minimalna długość promptu możliwego do zapisania w cache spadła z:
1024 tokenów w Opus 4.8
do
512 tokenów w Opus 5
Może to obniżyć koszt powtarzalnych system promptów i średnich instrukcji agentowych.[4]
11. Fast mode
Opus 5 posiada Fast mode w trybie research preview.
Anthropic podaje, że model działa w nim około 2,5 raza szybciej niż w standardowym trybie.[1]
Cena wynosi:
- 10 USD za milion tokenów wejściowych,
- 50 USD za milion tokenów wyjściowych.[3]
Jest to dwukrotność ceny bazowej.
Fast mode jest dostępny przez Claude API i przez usage credits w Claude Code. Dokumentacja wskazuje, że nie jest obecnie dostępny przez Amazon Bedrock, Google Cloud ani Microsoft Foundry.[4]
Warto go używać tylko wtedy, gdy niższe opóźnienie ma rzeczywistą wartość biznesową, na przykład podczas:
- interaktywnego pair programming,
- reagowania na incydent,
- code review na żądanie,
- pilnych procesów analitycznych,
- działania agenta w pętli z człowiekiem.
12. Bezpieczeństwo i ograniczenia w cyberbezpieczeństwie
Anthropic informuje, że Opus 5 nie przesuwa granicy w najbardziej ryzykownych zdolnościach dual-use i pozostaje za Mythos 5 w biologii oraz ofensywnym cyberbezpieczeństwie.[1]
Producent celowo nie trenował Opus 5 bezpośrednio na zadaniach cybernetycznych. Model poprawił się jednak w wyszukiwaniu podatności jako skutek ogólnego wzrostu możliwości.
Według Anthropic:
- Opus 5 zbliża się do Mythos 5 w identyfikowaniu podatności,
- pozostaje znacznie słabszy od Mythos 5 w tworzeniu działających exploitów,
- ma klasyfikatory bezpieczeństwa zbliżone do Opus 4.8,
- otrzymał mocniejsze zabezpieczenia dla wąskiego zakresu zadań cybernetycznych.[1]
Co może zostać zablokowane?
Anthropic opisuje blokowanie między innymi:
- binarnego skanowania podatności,
- części testów penetracyjnych,
- generowania exploitów.
Jednocześnie model ma nadal pozwalać na korzystne zastosowania, takie jak znajdowanie podatności w kodzie źródłowym.[1]
Producent szacuje, że klasyfikatory Opus 5 będą interweniować około 85% rzadziej niż zabezpieczenia Fable 5. To prognoza Anthropic, a nie niezależny pomiar.[1]
Dla zweryfikowanych organizacji i badaczy istnieje Cyber Verification Program, który może umożliwić dostęp do wariantu z mniejszymi ograniczeniami bezpieczeństwa.
13. Co mówi Anthropic o alignment?
W automatycznym audycie behawioralnym Anthropic Opus 5 uzyskał wynik 2,3 dla ogólnego zachowania niezgodnego z założeniami. Producent opisuje go jako najniższy wynik wśród swoich ostatnich modeli.[1]
Według Anthropic model:
- lepiej przestrzega Claude Constitution,
- rzadziej zachowuje się zwodniczo,
- jest trudniejszy do nakłonienia do nadużyć,
- rzadziej wykonuje ryzykowne działania o trudnych do odwrócenia skutkach.
Należy zaznaczyć, że jest to audyt producenta. Wynik nie oznacza, że model jest nieomylny, całkowicie bezpieczny albo odporny na każdy prompt injection.
14. Ograniczenia Claude Opus 5
Nie ma aktualnej wiedzy o wszystkim po maju 2026 roku
Reliable knowledge cutoff i training data cutoff modelu to maj 2026 roku.[2]
Do informacji późniejszych potrzebne są:
- wyszukiwanie internetowe,
- aktualne bazy danych,
- narzędzia,
- dokumenty dostarczone w kontekście.
Milion tokenów nie gwarantuje doskonałej pamięci
Duży kontekst zwiększa ilość dostępnego materiału, ale nie usuwa:
- pomijania szczegółów,
- błędnej interpretacji,
- konfliktów instrukcji,
- degradacji przy źle zorganizowanym kontekście,
- problemów z nieistotnymi dokumentami.
Thinking domyślnie zwiększa nieprzewidywalność kosztu
Ten sam prompt może zużyć różną liczbę tokenów w zależności od problemu oraz effort. Aplikacja powinna mierzyć:
- input tokens,
- output tokens,
- cache hits,
- czas odpowiedzi,
- liczbę wywołań narzędzi,
- koszt całego zadania, nie tylko pojedynczego requestu.
Dłuższe odpowiedzi mogą wymagać korekty promptów
Dokumentacja ostrzega, że domyślne odpowiedzi i dokumenty mogą być dłuższe niż w Opus 4.8. Model częściej relacjonuje postęp pracy.[4]
Do zadań wymagających krótkiego wyniku trzeba dodać jasne limity formatu.
Benchmark nie jest produkcją
Dobry wynik na teście nie gwarantuje:
- poprawności w prywatnym frameworku,
- znajomości wewnętrznego API,
- zgodności z firmowymi standardami,
- braku regresji,
- stabilnego kosztu,
- dobrego działania z konkretnym agent harness.
15. Jak bezpiecznie przeprowadzić migrację z Opus 4.8?
Krok 1: nie podmieniaj modelu bez testów
Przygotuj zestaw rzeczywistych zadań:
- naprawa błędu,
- refaktoryzacja,
- code review,
- stworzenie testów,
- analiza dokumentów,
- praca z narzędziami,
- zadanie długiego horyzontu.
Krok 2: aktualizuj identyfikator
model = "claude-opus-4-8"
zamień na:
model = "claude-opus-5"
Krok 3: sprawdź konfigurację thinking
Jeżeli wcześniejsza integracja nie wysyła pola thinking, po migracji model zacznie używać rozumowania adaptacyjnego.
Jeżeli thinking musi pozostać wyłączony, nie ustawiaj effort powyżej high.
Krok 4: zwiększ max_tokens dla trudnych zadań
Thinking i odpowiedź mieszczą się we wspólnym limicie. Zbyt niski max_tokens może przerwać pracę wcześniej niż w Opus 4.8.[4]
Krok 5: usuń nadmiarowe instrukcje weryfikacji
Sprawdź, czy prompt nie nakazuje wielokrotnej kontroli, której Opus 5 i tak dokonuje sam.
Krok 6: mierz koszt całego zadania
Porównuj:
koszt zakończonego zadania
czas do poprawnego wyniku
liczbę iteracji
liczbę tool calls
liczbę ręcznych poprawek
Nie porównuj wyłącznie ceny za milion tokenów.
Krok 7: zachowaj fallback
Opus 4.8 pozostaje aktywny. Może służyć jako:
- fallback przy odmowie klasyfikatora,
- zabezpieczenie regresji,
- stabilny model dla istniejących promptów,
- alternatywa dla określonych workflow cybernetycznych.
16. Czy warto przejść na Claude Opus 5?
Tak, gdy:
- agent realizuje zadania obejmujące wiele plików,
- model ma pracować przez długi czas bez ciągłego nadzoru,
- ważne jest code review i wyszukiwanie subtelnych błędów,
- tworzysz duże refaktoryzacje,
- model korzysta z wielu narzędzi i subagentów,
- przygotowujesz dokumenty, arkusze albo prezentacje,
- obecny Opus 4.8 często kończy zadania częściowo,
- koszt Fable 5 jest zbyt wysoki.
Niekoniecznie, gdy:
- wykonujesz krótkie, powtarzalne operacje,
- Sonnet 5 zapewnia wystarczającą jakość,
- opóźnienie ma większe znaczenie niż maksymalna dokładność,
- nie przeprowadzono regresji promptów,
- aplikacja wymaga thinking wyłączonego przy najwyższym effort,
- workflow cyberbezpieczeństwa jest blokowany przez nowe klasyfikatory,
- wzrost jakości nie rekompensuje większej liczby tokenów.
17. Werdykt
Claude Opus 5 nie jest po prostu „Opus 4.8 z nowym numerem”.
Najważniejsze zmiany dotyczą sposobu wykonywania pracy:
- thinking jest aktywny domyślnie,
- dostępny jest effort
max, - model częściej sam weryfikuje wynik,
- lepiej realizuje długie i wieloplikowe zadania,
- chętniej koordynuje subagentów,
- otrzymał mechanizmy dla dynamicznych narzędzi i automatycznych fallbacków,
- zachowuje cenę Opus 4.8.
Na podstawie informacji producenta Opus 5 może oferować bardzo dobrą relację możliwości do kosztu w trudnych zadaniach programistycznych i enterprise. Nie jest jednak bezwarunkowo najlepszym wyborem:
- Sonnet 5 pozostaje bardziej ekonomiczny,
- Fable 5 pozostaje najmocniejszym szeroko dostępnym modelem Anthropic,
- benchmarki z dnia premiery w większości pochodzą od Anthropic lub partnerów,
- każda migracja wymaga własnych testów jakości, kosztu i bezpieczeństwa.
Najbardziej rozsądna strategia nie polega na zastąpieniu wszystkich modeli jednym Opus 5. Polega na routingu:
Sonnet 5
dla szybkich i masowych zadań
Opus 5
dla trudnych, agentowych i wieloetapowych procesów
Fable 5
dla najtrudniejszych przypadków, w których maksymalna zdolność uzasadnia koszt
18. Checklista przed wdrożeniem
API
- Zmieniono model ID na
claude-opus-5. - Sprawdzono wersję SDK.
- Zweryfikowano
max_tokens. - Uwzględniono domyślny thinking.
- Nie wyłączono thinking przy
xhighlubmax. - Sprawdzono obsługę błędów HTTP 400.
- Dodano fallback.
- Zmierzono prompt cache.
- Sprawdzono region i dostawcę chmurowego.
Jakość
- Przygotowano własny zestaw ewaluacyjny.
- Porównano Opus 5 z Opus 4.8.
- Porównano Opus 5 z Sonnet 5.
- Zmierzono liczbę poprawnych zadań, nie styl odpowiedzi.
- Sprawdzono duże repozytoria.
- Sprawdzono code review.
- Sprawdzono frontend i analizę obrazów.
- Sprawdzono długie dokumenty.
- Sprawdzono powtarzalność kilku uruchomień.
Koszt
- Zmierzono tokeny wejściowe.
- Zmierzono tokeny wyjściowe i thinking.
- Zmierzono cache hits.
- Zmierzono liczbę tool calls.
- Zmierzono koszt całego zadania.
- Porównano standard i Fast mode.
- Porównano effort
low,medium,high,xhighimax. - Ustalono limity budżetu dla subagentów.
Bezpieczeństwo
- Zweryfikowano uprawnienia narzędzi.
- Ograniczono możliwość wykonywania destrukcyjnych operacji.
- Dodano zatwierdzanie wdrożeń i zmian produkcyjnych.
- Przetestowano prompt injection.
- Sprawdzono zachowanie klasyfikatorów cyberbezpieczeństwa.
- Zweryfikowano logowanie i audyt działań agenta.
- Nie uznano automatycznej weryfikacji modelu za niezależny audyt.

