Skip to content
MJ Marketing
Benchmarki Claude Opus 5: Anthropic w porównaniu z Fable 5 i GPT-5.6 Sol
AI i Narzędzia
12 min read
Mijo Jurisic

Claude Opus 5: benchmarki, cena i paradoks kosztów

Claude Opus 5 w teście: 1. miejsce w Intelligence Index z 61 punktami, połowa ceny Fable 5 i paradoks kosztów wynikający z gadatliwości modelu.

TL;DR

Anthropic wydał Claude Opus 5 w lipcu 2026. Według Artificial Analysis model prowadzi w Intelligence Index z 61 punktami i zajmuje 1. miejsce na 191 wymienionych modeli, kosztując 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion tokenów wyjściowych, czyli dokładnie połowę ceny Fable 5 i tyle samo co poprzednik Opus 4.8. Haczykiem jest gadatliwość: w przebiegu indeksu Opus 5 wygenerował według Artificial Analysis 100 milionów tokenów wyjściowych wobec średniej 63 milionów, dlatego portal officechai szacuje oszczędność na zadanie wobec Fable 5 na 26, a nie na 50 procent. Słabym punktem pozostaje wiedza faktograficzna: w rankingu AA-Omniscience Opus 5 jest trzeci z 31 punktami.

Film do artykułu

Claude Opus 5 im Check: Platz 1 der Welt, halber Preis, und der Haken dabeiZobacz na YouTubeWszystkie filmy
Share:

Anthropic wydał Claude Opus 5 w lipcu 2026 i po raz pierwszy model tej firmy stoi na szczycie Intelligence Index od Artificial Analysis: 61 punktów, 1. miejsce na 191 wymienionych modeli. To pomiar niezależny, a nie deklaracja dostawcy, i właśnie to nadaje tej liczbie wartość.

Jeszcze ciekawsza jest dla mnie cena. Opus 5 kosztuje 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion tokenów wyjściowych, czyli dokładnie połowę tego, co własny model szczytowy Anthropic, Fable 5, i ani centa więcej niż poprzednik Opus 4.8. W tym artykule konsekwentnie rozdzielam dwie rzeczy: niezależnie zebrane liczby od Artificial Analysis oraz własne pomiary Anthropic z karty systemowej i wpisu na blogu, bo w relacjach medialnych chętnie się je miesza. To, których modeli faktycznie używamy w agencji, transparentnie pokazujemy na stronie AI w liczbach.

Czym jest Claude Opus 5

Najbardziej rzucającą się w oczy decyzją produktową jest rezygnacja z wariantów modelu. Tam, gdzie OpenAI dzieli serię GPT-5.6 na Luna, Terra i Sol, Opus 5 jest według dokumentacji Anthropic jednym modelem z pięcioma poziomami wysiłku: low, medium, high, xhigh i max. Domyślny jest high, zarówno w Claude API, jak i w Claude Code. Fortune trafnie opisuje ten regulator jako pokrętło przy własnym rachunku za AI, bo pozwala firmom samodzielnie dawkować nakład i koszt na zadanie.

Model jest dostępny przez Claude API, Amazon Bedrock, Google Vertex AI, Microsoft Foundry oraz przez claude.ai i Claude Code. W planie Claude Max jest według the-decoder modelem domyślnym, a w Claude Pro najmocniejszym dostępnym.

Druga ważna sprawa to kontekst. Opus 5 ma okno miliona tokenów, i to jednocześnie jako wartość domyślną i maksymalną, bez opt-inu i bez nagłówka beta. Przede wszystkim nie ma dopłaty za długi kontekst. Dokumentacja cenowa Anthropic ujmuje to dosłownie: „Claude 4.6 and later models include the full 1M token context window at standard pricing." Zapytanie o długości 900.000 tokenów jest więc rozliczane po tej samej stawce za token co zapytanie o długości 9.000. Maksymalny synchroniczny output to 128.000 tokenów, a wiedza modelu sięga maja 2026.

Pierwsze miejsce w Intelligence Index, mierzone niezależnie

Intelligence Index od Artificial Analysis ma znaczenie właśnie dlatego, że nie pochodzi od dostawcy. Łączy kilka pojedynczych testów, między innymi GDPval-AA v2, Terminal-Bench, SciCode, Humanity's Last Exam, GPQA Diamond i AA-Omniscience.

W tym zestawieniu Claude Opus 5 na poziomie max osiąga 61 punktów i zajmuje 1. miejsce na 191 wymienionych modeli. Poziom xhigh uzyskuje 60 punktów i 2. miejsce. Dalej plasują się Claude Fable 5 z wynikiem 60, GPT-5.6 Sol z 59 i otwarty model Kimi K3 z 57 punktami. Godny uwagi jest nie tyle jeden punkt przewagi, ile sama konfiguracja: Anthropic tańszym modelem pokonuje własny, dwukrotnie droższy okręt flagowy.

Należy się do tego zastrzeżenie i pochodzi ono od samego Anthropic. W karcie systemowej firma pisze, że Opus 5 nie jest ogólnie zdolniejszy niż Fable 5. Uczciwe sformułowanie brzmi więc nie „najlepszy model świata", lecz: Opus 5 prowadzi w Intelligence Index od Artificial Analysis według liczb ocenionych tutaj w lipcu 2026.

Cena: połowa tego, co Fable 5

Cennik jest właściwym sednem tej historii. Za milion tokenów Opus 5 kosztuje według Anthropic 5 dolarów na wejściu i 25 dolarów na wyjściu. Dla porównania: Claude Fable 5 to 10 i 50 dolarów, GPT-5.6 Sol to 5 i 30 dolarów, Kimi K3 to 3 i 15 dolarów. Poprzednik, Claude Opus 4.8, kosztował dokładnie tyle samo co Opus 5, cała poprawa przychodzi więc bez podwyżki.

Do tego dochodzą typowe dźwignie: 50 procent rabatu przez Batch API i 0,50 dolara za trafienie w cache, co odpowiada dziesięciu procentom ceny wejścia. Detal, który w praktyce daje więcej, niż brzmi: minimum dla cache'owania promptów spada według dokumentacji Anthropic z 1.024 do 512 tokenów. Prompty, które wcześniej były zbyt krótkie, żeby je cache'ować, teraz da się cache'ować.

Paradoks kosztów: taniej za token, ale nie o połowę taniej za zadanie

Tutaj robi się niewygodnie i jest to część, którą nagłówki zwykle pomijają. O połowę niższa cena tokena nie oznacza automatycznie o połowę niższych kosztów, bo rachunek ma dwa czynniki: cenę za token i liczbę tokenów.

Artificial Analysis zmierzył ten drugi czynnik. W przebiegu Intelligence Index Opus 5 wygenerował około 100 milionów tokenów wyjściowych wobec średniej dla modeli na poziomie 63 milionów. Artificial Analysis określa model odpowiednio jako „very verbose", a dodatkowo jako „notably slow" oraz „particularly expensive when comparing to other models of similar price". Koszt pełnego przebiegu indeksu Artificial Analysis podaje na 3.835,51 dolara przy poziomie max i 2.909,91 dolara przy xhigh. W szybkości generowania Opus 5 osiąga 59,8 tokena na sekundę i 95. miejsce na 191, a czas do pierwszego tokena Artificial Analysis podaje jako 66,36 sekundy.

Co to oznacza dla realnego rachunku, oszacował portal officechai: oszczędność na zadanie wobec Fable 5 określa na około 26 procent zamiast 50 procent sugerowanych przez cenę tokena. Te 26 procent to dana od officechai, a nie oryginalna liczba Artificial Analysis, i cytuję ją wyraźnie jako taką.

Puenta officechai dobrze podsumowuje cały kierunek: nie sam szczytowy wynik, lecz koszt punktu inteligencji jest metryką, o którą laboratoria dziś rywalizują. Z własnej praktyki mogę to tylko podkreślić: kto porównuje modele, nie powinien zestawiać cenników, tylko mierzyć koszt realnego, typowego zadania.

Skoki, które mierzy sam Anthropic

Poniższe liczby pochodzą z własnej karty systemowej Anthropic i z wpisu ogłaszającego premierę. Są to dane dostawcy. To ich nie unieważnia, ale trzeba to powiedzieć.

Najwyraźniejszy jest skok na Frontier-Bench v0.1, benchmarku zadań agentowych. Anthropic podaje tam 43,3 procent dla Opus 5 wobec 21,1 procent dla Opus 4.8, 33,7 procent dla Fable 5 i 34,4 procent dla GPT-5.6 Sol. Podwojenie wyniku w obrębie jednej generacji modelu, przy tej samej cenie tokena, jest nietypowe.

Jeszcze bardziej rzuca się w oczy ARC-AGI-3, test rozwiązywania nowych problemów bez znanych wzorców. Opus 5 osiąga według karty systemowej 30,2 procent, GPT-5.6 Sol dochodzi tam do 7,8 procent, a Opus 4.8 do 1,5 procent. To niemal czterokrotność kolejnego najlepszego modelu na benchmarku celowo odpornym na trenowanie pod test.

Dwie kolejne wartości są dla codziennej pracy istotniejsze niż wyniki rekordowe. W GDPval-AA v2, który według Artificial Analysis odwzorowuje realną pracę umysłową w 44 zawodach i 9 branżach, Anthropic raportuje 1.861 Elo dla Opus 5 wobec 1.747 dla Fable 5 i 1.736 dla GPT-5.6 Sol. Ważne: benchmark pochodzi od Artificial Analysis, ale podana tu liczba to własny pomiar Anthropic. A w obsłudze komputera, mierzonej testem OSWorld 2.0, Anthropic podaje 70,6 procent wobec 66,1 procent dla Fable 5 i 62,6 procent dla GPT-5.6 Sol. Na SWE-bench Verified Anthropic raportuje 96,0 procent.

Coding Agent Index: dzielone pierwsze miejsce przy 67 punktach

AA Coding Agent Index to znów pomiar niezależny i ocenia nie sam model, lecz połączenie agenta z modelem. Składa się z trzech równoważnych części: DeepSWE, Terminal-Bench v2 i SWE-Atlas-QnA.

Claude Code z Opus 5 na poziomie xhigh osiąga tam 67 punktów i dzieli pierwsze miejsce z Codex i GPT-5.6 Sol na poziomie max, również 67 punktów. Za nimi plasują się Opus 5 na poziomie max oraz Fable 5 z fallbackiem, po 66 punktów, a dalej Kimi K3 i Claude Opus 4.8 po 61 punktów.

Jeden szczegół zasługuje na uwagę: najwyższy poziom wysiłku nie jest najlepszy. Opus 5 z xhigh wyprzedza Opus 5 z max o punkt, choć max kosztuje więcej mocy obliczeniowej. Portal the-decoder obserwuje ten sam efekt na Frontier-Bench v0.1. Większy nakład daje tam gorszy wynik przy wyższych kosztach. W praktyce oznacza to, że wybieranie najdroższego ustawienia w ciemno nie jest strategią.

Słaby punkt: wiedza faktograficzna i halucynacje

Żaden model nie prowadzi wszędzie, a przy Opus 5 słaby punkt jest jasno nazwany. W rankingu AA-Omniscience, który mierzy wiedzę faktograficzną i skłonność do halucynacji, Opus 5 zajmuje 3. miejsce z 31 punktami, za Claude Fable 5 (40) i Gemini 3.1 Pro Preview (33).

Rzecz godna uwagi: Anthropic sam potwierdza ten kierunek. W podsumowaniu karty systemowej stoi dosłownie: „We found a surprising number of cases in which Opus 5 confidently stated an answer about which it was in fact unsure. The model hallucinates factual claims slightly more than Opus 4.8, despite being more accurate overall." Po polsku znaczy to tyle: model jest ogólnie dokładniejszy, ale jednocześnie nieco częściej formułuje nieprawdziwe twierdzenia faktograficzne i robi to pewnym tonem.

Dla praktyki jest to najważniejsze zdanie całego artykułu. Model, który brzmi pewnie, a myli się odrobinę częściej, jest w pracy researchowej groźniejszy niż taki, który widocznie się waha. Twierdzenia faktograficzne z Opus 5 wymagają weryfikacji, zwłaszcza gdy trafiają do tekstów dla klientów, ofert albo raportów.

Co to oznacza dla małych i średnich firm

Teraz część, która liczy się na co dzień. To moja ocena oparta na udokumentowanych wyżej liczbach i na własnej pracy z tymi narzędziami, a nie fakt zewnętrzny.

Przy długich, wieloetapowych zadaniach i przy procesach programistycznych dane przemawiają za Opus 5. Dzielone pierwsze miejsce w Coding Agent Index, mocny wynik w obsłudze komputera i najlepszy rezultat w bliskim pracy pomiarze GDPval składają się na wyraźny profil. Kto pracuje z agentami działającymi samodzielnie przez wiele kroków, dostaje tu dużo możliwości za euro.

Do researchu faktograficznego i pytań wymagających wiedzy nie użyłbym Opus 5 jako jedynego źródła. Trzecie miejsce w AA-Omniscience i własna wypowiedź Anthropic o wskaźniku halucynacji to wystarczający powód, żeby puścić obok drugi model albo konsekwentnie żądać źródeł i je sprawdzać.

Do zadań rutynowych, takich jak streszczenia, warianty tekstów czy przygotowanie danych, klasa szczytowa jest zwykle przewymiarowana. Tu opłaca się regulator wysiłku: niski poziom albo mniejszy model załatwi to za ułamek kosztów. A kto naprawdę chce obniżyć koszt na zadanie, powinien najpierw spojrzeć na cache'owanie promptów i przetwarzanie wsadowe, a nie na cennik.

Ostatnia uwaga w imię uczciwości: według Fortune Anthropic nadal poleca Fable 5 do zaawansowanych projektów autonomicznych, a Opus 5 pozycjonuje jako oszczędną alternatywę do codziennej pracy. Dostawca, który nie sprzedaje tańszego modelu jako lekarstwa na wszystko, jest wiarygodniejszy niż taki, który to robi.

Moja ocena

Claude Opus 5 jest dla mnie dotąd najwyraźniejszym dowodem na to, że konkurencja się przesunęła. Nie chodzi już tylko o to, kto ma najwyższą liczbę w tabeli, lecz o to, ile kosztuje punkt inteligencji. Ta sama cena co u poprzednika, a przy tym pierwsze miejsce w niezależnym rankingu: to jest właściwa wiadomość.

Jednocześnie za niedocenianym haczykiem uważam gadatliwość. Jeśli model produkuje średnio zauważalnie więcej tokenów niż inne, zjada to część przewagi cenowej. Z własnej praktyki porównuję więc modele wyłącznie na realnych zadaniach, nigdy na cennikach.

I pozostaję przy dwóch zastrzeżeniach. Po pierwsze halucynacje: model pewnie mylący się kosztuje w poprawkach więcej, niż oszczędza w eksploatacji. Po drugie krótki czas obserwacji, bo liczby z pierwszych dni nie zastąpią tygodni realnej pracy. Jeśli chcesz ustalić, który model pasuje do twoich zadań, twoich ram ochrony danych i twojego budżetu, to jest dokładnie temat naszego konsultingu AI. Jak takie narzędzia wykorzystać konkretnie w procesach Google Ads, opisałem we wpisie o automatyzacji AI w codziennej pracy z Google Ads. Dla porównania warto też spojrzeć na debatę o benchmarkach i oszukiwaniu wokół GPT-5.6 Sol oraz na powrót Fable 5.

Źródła

Stan na: lipiec 2026

Najczęstsze pytania

Czym jest Claude Opus 5?

Claude Opus 5 to model Anthropic wydany w lipcu 2026. Zamiast osobnych wariantów modelu dokumentacja Anthropic wymienia pięć poziomów wysiłku jednego modelu: low, medium, high, xhigh i max, przy czym high jest ustawieniem domyślnym w Claude API i Claude Code. Okno kontekstowe obejmuje milion tokenów jako wartość domyślną i maksymalną, bez dopłaty za długi kontekst, a wiedza modelu sięga maja 2026.

Jak Claude Opus 5 wypada w benchmarkach?

W niezależnie mierzonym Intelligence Index od Artificial Analysis Opus 5 na poziomie max osiąga 61 punktów i 1. miejsce na 191 modeli, przed Fable 5 (60), GPT-5.6 Sol (59) i Kimi K3 (57). W AA Coding Agent Index Opus 5 w Claude Code dzieli pierwsze miejsce z 67 punktami razem z Codex i GPT-5.6 Sol. Własne pomiary Anthropic podają między innymi 43,3 procent na Frontier-Bench i 70,6 procent na OSWorld 2.0.

Ile kosztuje Claude Opus 5?

Według cennika Anthropic Opus 5 kosztuje 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion tokenów wyjściowych. To dokładnie połowa ceny Claude Fable 5 (10 i 50 dolarów) i tyle samo co poprzednik Opus 4.8. Okno kontekstowe miliona tokenów jest wliczone w cenę standardową, a dopłaty za długi kontekst według dokumentacji nie ma.

Czy Claude Opus 5 jest naprawdę o połowę tańszy od Fable 5?

Za token tak, za zadanie już nie. Artificial Analysis określa Opus 5 jako bardzo rozwlekły i zauważalnie wolny: 100 milionów tokenów wyjściowych w przebiegu indeksu wobec średniej 63 milionów. Portal officechai wylicza dlatego około 26 procent oszczędności na zadanie wobec Fable 5 zamiast 50 procent, które sugeruje sama cena tokenów.

Gdzie Claude Opus 5 jest słaby?

W wiedzy faktograficznej. W benchmarku halucynacji AA-Omniscience od Artificial Analysis Opus 5 zajmuje 3. miejsce z 31 punktami, za Fable 5 (40) i Gemini 3.1 Pro Preview (33). Anthropic potwierdza ten kierunek we własnej karcie systemowej i pisze, że model zaskakująco często pewnym tonem podawał odpowiedzi, co do których w rzeczywistości nie miał pewności. Twierdzenia faktograficzne trzeba więc dalej weryfikować.

Mijo Jurisic

Mijo Jurisic

Konsultant Google Ads i założyciel MJ Marketing. Ponad pięć lat praktyki: od samouczenia po Google Premier Partner Programme z 500+ klientami Google Ads i €20M+ zarządzanego budżetu mediowego.

Share this article:

Share: