
Claude Fable 5.1 pod lupą: co naprawdę mówią liczby
Anthropic prowadzi w dziewięciu benchmarkach, w niezależnych pomiarach jest ciasno. Co potrafi Claude Fable 5.1, ile kosztuje i kiedy wystarczy Opus 5.
TL;DR
Anthropic opublikował Claude Fable 5.1 1 września 2026 i prowadzi we wszystkich dziewięciu wierszach własnej tabeli benchmarków, w tym z wynikiem 52,6 procent na Terminal-Bench-Science, który jest daną producenta z jego własnego środowiska testowego. Niezależne pomiary dają obraz znacznie ciaśniejszy: na publicznym leaderboardzie Terminal-Bench 4.0 GPT-6 Astra ma 58,2 procent i minimalnie wyprzedza Fable 5.1 z 57,9 procent, a w Artificial Analysis Intelligence Index v4.3 prowadzi Fable 5.1 z wynikiem 53,37 wobec 52,81 punktu. Praktycznie najważniejsza zmiana to nie liczba z benchmarku, tylko cena odczytu z cache: z 1 dolara na 25 centów za milion tokenów.
Film do artykułu
1 września 2026 Anthropic opublikował Claude Fable 5.1, a razem z nim bliźniaka o nazwie Mythos 5.1, z którego prawie nikt nie może korzystać. W ogłoszeniu jest tabela z dziewięcioma benchmarkami i we wszystkich dziewięciu wierszach nowy model prowadzi. Ta tabela jest powodem, dla którego model chodzi teraz wszędzie jako nowy numer jeden. Jest też powodem, dla którego warto spojrzeć drugi raz.
W tym artykule konsekwentnie rozdzielam trzy klasy stwierdzeń: dane producenta z własnego posta Anthropic i z dokumentacji produktowej, niezależne pomiary Artificial Analysis oraz publicznego leaderboardu Terminal-Bench, i moją własną ocenę, którą oznaczam jako ocenę. Wersja wideo tej analizy jest na górze tej strony oraz na stronie z wideo. To, jakich narzędzi AI faktycznie używamy w agencji, opisujemy otwarcie na stronie AI w liczbach. Stan wszystkich liczb w tym artykule: 8 września 2026.
Fakty z ogłoszenia
Najpierw to, co sprawdzalne, wszystko z ogłoszenia Anthropic i z przeglądu modeli platformy Claude.
| Cecha | Claude Fable 5.1 |
|---|---|
| Publikacja | 1 września 2026 |
| ID modelu | claude-fable-5-1 |
| Okno kontekstowe | 1 milion tokenów |
| Maksymalne wyjście | 128.000 tokenów |
| Stan wiedzy | czerwiec 2026, u Anthropic opisany jako „reliable knowledge cutoff" |
| Platformy | Claude API, Amazon Web Services, Google Cloud, Microsoft Azure |
| W claude.ai | od planu Max i w Enterprise, w Pro tylko przez kredyty użycia, w planie Team wcale |
Dwie rzeczy z tej tabeli giną w doniesieniach. Okno kontekstowe miliona tokenów Fable 5.1 dzieli z Opus 5 i Sonnet 5, nie jest więc wyróżnikiem. A w aplikacji Claude model jest dostępny gorzej, niż sugerują nagłówki: w planie Team nie ma go w ogóle, w Pro działa wyłącznie przez kredyty użycia.
Tabela Anthropic: dziewięć wierszy, dziewięć wygranych
Poniższe wartości to dane producenta, zebrane przez Anthropic. Jedynym wymienionym konkurentem jest GPT-5.6 Sol. GPT-6 Astra się nie pojawia, co jest logiczne, bo wyszedł dopiero dwa dni po Fable 5.1.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Terminal-Bench 4.0 | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| GDPval-AA v2 (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | 77,9 % | 72,9 % | 75,4 % | brak wartości |
| OSWorld 2.0, strict | 41,7 % | 36,1 % | 39,6 % | brak wartości |
| Humanity's Last Exam, bez narzędzi | 60,9 % | 57,8 % | 56,6 % | brak wartości |
| Humanity's Last Exam, z narzędziami | 65,0 % | 63,8 % | 63,6 % | brak wartości |
| AutomationBench | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
| CursorBench 3.2.0 | 73,4 % | 70,5 % | 70,0 % | 67,2 % |
Dwa zastrzeżenia stoją pod tabelą u samego Anthropic. Po pierwsze, Fable 5.1 był testowany z aktywnymi zabezpieczeniami produkcyjnymi; tam, gdzie zabezpieczenia zadziałały, zadanie liczyło się jako zero punktów, co według Anthropic raczej zaniża jego własne wyniki w OSWorld 2.0 i AutomationBench. Po drugie, liczby z OSWorld opierają się na zestawie zadań z sierpnia 2026, dlatego nie ma tam w ogóle wyniku konkurencji. To jest ujawnione i uczciwe. Nie zmienia jednak tego, że wszystkie dziewięć wierszy pochodzi z jednego środowiska testowego.
Terminal-Bench-Science: liczba, którą cytują wszyscy
Nagłówek z tej tabeli brzmi 52,6 procent na Terminal-Bench-Science 0.1, czyli ponad dwa razy więcej niż u poprzednika z 24,7 procent. Benchmark mierzy, czy agent AI wykonuje w terminalu prawdziwą pracę badawczą: analizę danych, uruchamianie symulacji, dopasowywanie modeli. Prowadzi go projekt Terminal-Bench, a leaderboard jest publiczny.
I właśnie tam Fable 5.1 na dzień 8 września 2026 nie figuruje. Wymienione są Opus 5 z wynikiem 30,0 procent, GPT-5.6 Sol z 22,4 i Fable 5 z 21,4 procent. Anthropic ujawnia to sam w przypisie do tabeli, podaje obie wartości z leaderboardu, stawia obok własną reprodukcję (29,0 dla Opus 5 i 24,7 dla Fable 5) i określa błąd standardowy na 3,5 do 4,5 punktu procentowego na model.
To jest porządna robota i nie czyni tych 52,6 procent liczbą fałszywą. Czyni ją daną producenta z własnego środowiska, a nie wynikiem niezależnie odtworzonym. Na marginesie, bo dobrze pokazuje mechanizm: OpenAI podaje dla GPT-6 Astra na tym samym teście 64,6 procent wobec 52,6 dla Fable 5.1. To także dana producenta, tylko z drugiej firmy.
Niezależna kontrola: Terminal-Bench 4.0
Jest jeden benchmark, na którym dane producenta i niezależny pomiar stoją obok siebie: Terminal-Bench 4.0, czyli agentowe programowanie w terminalu. To są wartości z publicznego leaderboardu, pobrane 8 września 2026.
| Model (agent) | Resolution rate | Tokeny | Koszt przebiegu |
|---|---|---|---|
| GPT-6 Astra (Codex) | 58,2 % (± 2,8) | 1,5 mld | około 3.300 dolarów |
| Claude Fable 5.1 (Claude Code) | 57,9 % (± 3,8) | 2,7 mld | około 6.200 dolarów |
| Claude Opus 5 (Claude Code) | 51,8 % (± 3,4) | 6,5 mld | około 6.000 dolarów |
| Claude Fable 5 (Claude Code) | 44,5 % (± 3,8) | 3,8 mld | około 7.300 dolarów |
Są w tym dwa wnioski. Po pierwsze, liczby Anthropic wytrzymują kontrolę: producent podaje dla Fable 5.1 55,8 procent, pomiar daje 57,9. Dla Opus 5 Anthropic podaje 52,3 wobec zmierzonych 51,8, dla Fable 5 42,0 wobec 44,5, a przy GPT-5.6 Sol obie strony mówią 37,3. Wszystko mieści się w słupkach błędu.
Po drugie, Fable 5.1 nie jest tu na pierwszym miejscu. GPT-6 Astra prowadzi z 58,2 procent, zużywając mniej więcej połowę tokenów i mniej więcej połowę pieniędzy. Różnica 0,3 punktu procentowego to praktycznie remis, różnica kosztów już nie.
Artificial Analysis: równo na szczycie, różnie przy kasie
Drugim niezależnym źródłem jest Artificial Analysis. Ich Intelligence Index w wersji 4.3 łączy dziesięć testów, między innymi Terminal-Bench v4.0, SciCode, Humanity's Last Exam i GDPval-AA v2, mierzonych na własnym sprzęcie.
| Model (wariant) | Intelligence Index v4.3 | Tempo wyjścia (tokeny/s) | Koszt zadania z indeksu |
|---|---|---|---|
| Claude Fable 5.1 (max with fallback) | 53,37 | 69,54 | 7,63 dolara |
| GPT-6 Astra (max) | 52,81 | 61,52 | 3,26 dolara |
| Claude Opus 5 (max) | 50,70 | 54,26 | 5,86 dolara |
| Claude Fable 5 (with fallback) | 49,70 | 61,66 | 8,75 dolara |
Fable 5.1 jest więc na pierwszym miejscu, a przewaga wynosi 0,56 punktu indeksu. Na wykresie Artificial Analysis oba czołowe modele pokazują po zaokrągleniu 53.
Do tego należą dwie uwagi, inaczej cytuje się złą liczbę. Po pierwsze, indeks był od premiery przebudowywany dwa razy, 4 września do v4.2 i 7 września do v4.3, między innymi z przejściem na Terminal-Bench v4 i dodaniem AutomationBench-AA. Liczba 66, która stoi w wielu doniesieniach z 1 września, pochodzi ze starej wersji indeksu i nie da się jej porównać z dzisiejszą. Po drugie, Artificial Analysis sam pisze, że wspierał Anthropic w ewaluacji przed premierą. To są ich własne przebiegi na własnym sprzęcie, ale pełna niezależność to jednak co innego.
Dlaczego jedno zadanie kosztuje tak dużo
Najciekawsza kolumna to nie indeks, tylko cena za zadanie. Jedno zadanie z indeksu kosztuje przy Fable 5.1 średnio 7,63 dolara, przy Opus 5 5,86, a przy GPT-6 Astra 3,26. Wśród obecnych czołowych modeli Fable 5.1 jest więc najdroższą drogą do wyniku. Z zastrzeżeniem, które trzeba dopowiedzieć: własny poprzednik Fable 5 leży w tym samym pomiarze jeszcze wyżej, na 8,75 dolara. Fable 5.1 jest zatem drogi, ale tańszy od modelu, który zastępuje.
Powodem jest rozwlekłość. Na przebieg indeksu Fable 5.1 wygenerował według Artificial Analysis 190 milionów tokenów, przy medianie 88 milionów dla porównywalnych modeli. Cały przebieg kosztował 13.128,86 dolara. Artificial Analysis podsumowuje model tak: wśród wiodących pod względem inteligencji, wyraźnie drogi w porównaniu z modelami o podobnej cenie, wolniejszy od średniej i bardzo rozwlekły.
Bliźniak Mythos 5.1, wyjaśniony właściwą stroną
Nazwa sugeruje, że to Mythos jest wariantem mocniej zabezpieczonym. Jest odwrotnie. Anthropic pisze, że oba to ten sam model z różnymi poziomami zabezpieczeń. Fable 5.1 to wersja ogólnodostępna z surowszymi zabezpieczeniami standardowymi. Mythos 5.1 ma luźniejsze, a dostęp dostaje tylko ten, kto przeszedł weryfikację: obrońcy cyberprzestrzeni przez Cyber Verification Program i naukowcy z nauk o życiu przez Life Sciences Verification Program, obecnie wyłącznie organizacje w USA.
Różnicę widać we własnej tabeli Anthropic: na Terminal-Bench 4.0 firma podaje dla Mythos 5.1 60,9 procent wobec 55,8 dla Fable 5.1. Anthropic tłumaczy tę lukę tym, że przy Fable zabezpieczenia cyber zadziałały w części zadań.
Praktycznie ważne dla pracy programistycznej: Fable 5.1 może teraz identyfikować luki w oprogramowaniu, czyli wykonywać obronną pracę bezpieczeństwa. Testy penetracyjne, generowanie exploitów i skanowanie luk na binariach nadal trafiają do modeli Opus, podobnie jak badania i rozwój w naukach o życiu. Efekt nowych, precyzyjniejszych reguł Anthropic określa na około 60 procent mniej interwencji na sesję Claude Code. To również dana producenta.
Cena: zmienił się jeden jedyny wiersz
Wszystkie wartości za milion tokenów, ceny cennikowe dostawców, stan na 8 września 2026.
| Model | Wejście | Wyjście | Odczyt z cache |
|---|---|---|---|
| Claude Fable 5.1 | 10 dolarów | 50 dolarów | 0,25 dolara |
| Claude Fable 5 | 10 dolarów | 50 dolarów | 1,00 dolara |
| Claude Opus 5 | 5 dolarów | 25 dolarów | 0,50 dolara |
| GPT-6 Astra | 10 dolarów | 50 dolarów | 1,00 dolara |
Cena cennikowa za wejście i wyjście jest wobec Fable 5 bez zmian i nadal dwa razy wyższa niż przy Opus 5. Jedyna realna zmiana stoi w kolumnie cache. Kiedy model czyta kontekst, który już przetworzył, kosztowało to dotąd jednego dolara za milion tokenów. Teraz jest to 25 centów, czyli o 75 procent mniej, i po raz pierwszy mniej niż przy Opus 5 z 50 centami. GPT-6 Astra ma dokładnie te same ceny cennikowe, 10 i 50 dolarów, ale za odczyt z cache liczy nadal jednego dolara.
Dlaczego to najważniejszy wiersz: agent, który godzinami pracuje nad tym samym zadaniem, czyta ten sam kontekst w kółko. Przy takich przebiegach rachunek składa się głównie z odczytów z cache. Anthropic wylicza, że typowe obciążenia wychodzą dzięki temu około 25 procent taniej niż na Fable 5, a mocno agentowe do 45 procent taniej. Ważne: te procenty to wyliczenie na własnym miksie użycia Anthropic z sierpnia 2026, a nie rabat, który zobaczysz na fakturze. Twardym faktem jest cena cache, z jednego dolara na 25 centów. Kto może grupować zadania, dostaje przez przetwarzanie wsadowe dodatkowe 50 procent zniżki na wejście i wyjście.
Spojrzenie wstecz: co wyszło z doniesień o leaku
Pod koniec lipca sprawdziłem krążące wtedy doniesienia o leaku Claude Fable 5.1. Wniosek brzmiał: brak artefaktu, brak ID modelu, brak wpisu w dokumentacji, więc pozostaje twierdzenie. Teraz artefakt leży na stole, więc można się rozliczyć.
Nazwa Fable 5.1 się zgadzała. Termin już nie: zamiast sierpnia wyszedł 1 września. Zapewnienie „ceny bez zmian" było w połowie trafne, bo ceny cennikowe rzeczywiście zostały, ale właściwej zmiany, czyli rabatu na cache, nie było w żadnym z krążących twierdzeń. A przypuszczenie, że Anthropic trzyma model na następną premierę OpenAI? Fable 5.1 wyszedł 1 września, GPT-6 Astra 3 września. Wzorzec czasowy pasuje, dowodem na związek przyczynowy to nie jest, a Anthropic nigdy się do tego nie odniósł.
Najciekawsza jest dla mnie nauka z tego: fabryka plotek w połowie trafiła nazwę i kompletnie przegapiła jedyną praktycznie istotną nowość.
Komu opłaca się Fable 5.1, a komu wystarczy Opus
To, co teraz następuje, jest moją oceną na podstawie udokumentowanych wyżej liczb i mojej własnej pracy z tymi modelami, a nie faktem zewnętrznym.
Anthropic formułuje rekomendację we własnym przeglądzie modeli tak: kto nie jest pewien, zaczyna od Claude Opus 5; Fable 5.1 jest przewidziany do wymagającego wnioskowania i długich zadań agentowych albo wtedy, gdy własne testy na Opus 5 przy wyższym poziomie wysiłku nadal nie wystarczają. Z mojej praktyki pokrywa się to z tym, co widzę. Do tekstów, analiz i zwykłej automatyzacji Opus 5 za połowę ceny tokenów jest wyborem rozsądnym, a jego liczby benchmarkowe opisałem w analizie Claude Opus 5. Po Fable 5.1 sięgasz wtedy, gdy agent pracuje godzinami na tym samym dużym kontekście, bo właśnie tam działa nowa cena cache.
W prawie każdym rachunku brakuje jednego szczegółu: poziomu wysiłku. Fable 5.1 ma ich pięć, a według analizy Artificial Analysis między najniższym a najwyższym jest jedenastokrotna różnica w tokenach wyjściowych. Kto nie ustawia poziomu świadomie, płaci maksymalny nakład za zadania, które go nie potrzebują. Jeśli chcesz uporządkować, które modele pasują do Twoich zadań, Twoich wymogów ochrony danych i Twojego budżetu, to jest dokładnie temat naszego konsultingu AI.
Źródła
- Anthropic, ogłoszenie „Introducing Claude Fable 5.1 and Claude Mythos 5.1", 1 września 2026: anthropic.com
- Claude Platform Docs, przegląd modeli z ID modeli, oknami kontekstowymi i stanem wiedzy: platform.claude.com
- Claude Platform Docs, cennik wraz z cache i przetwarzaniem wsadowym: platform.claude.com
- claude.com, plany i dostępność modeli, pobrane 8 września 2026: claude.com/pricing
- Anthropic, system card do Fable 5.1 i Mythos 5.1: anthropic.com
- Artificial Analysis, strona modelu Claude Fable 5.1, Intelligence Index v4.3, pobrane 8 września 2026: artificialanalysis.ai
- Artificial Analysis, artykuł z 1 września 2026, wersja indeksu sprzed v4.2: artificialanalysis.ai
- Terminal-Bench 4.0, publiczny leaderboard, pobrany 8 września 2026: tbench.ai
- Terminal-Bench-Science 0.1, publiczny leaderboard, pobrany 8 września 2026: tbench.ai
- OpenAI, ogłoszenie GPT-6 Astra z własnym porównaniem do Fable 5.1: openai.com
- OpenAI, ceny API dla GPT-6 Astra: developers.openai.com
Stan liczb: 8 września 2026
Najczęstsze pytania
Co nowego jest w Claude Fable 5.1?
Anthropic opublikował Claude Fable 5.1 1 września 2026 razem z bliźniaczym wariantem Mythos 5.1. Okno kontekstowe miliona tokenów, 128.000 tokenów maksymalnego wyjścia i stan wiedzy z czerwca 2026 zgadzają się z przeglądem modeli Anthropic. Cennik za wejście i wyjście pozostaje bez zmian: 10 i 50 dolarów za milion tokenów. Jedyna realna zmiana ceny dotyczy odczytów z cache: spadają z 1 dolara na 25 centów za milion tokenów, czyli o 75 procent.
Czy 52,6 procent na Terminal-Bench-Science zostało niezależnie potwierdzone?
Nie. Te 52,6 procent to dana producenta z własnego środowiska testowego Anthropic. Na publicznym leaderboardzie Terminal-Bench-Science na dzień 8 września 2026 Fable 5.1 w ogóle nie figuruje; są tam Opus 5 z wynikiem 30,0 procent, GPT-5.6 Sol z 22,4 i Fable 5 z 21,4 procent. Anthropic ujawnia to sam w przypisie, podaje wartości z leaderboardu i określa błąd standardowy na 3,5 do 4,5 punktu procentowego na model.
Ile kosztuje Claude Fable 5.1 w porównaniu z Opus 5?
Według cennika platformy Claude Fable 5.1 kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, czyli nadal dwa razy więcej niż Opus 5 z ceną 5 i 25 dolarów. Przy odczycie z cache proporcja się odwraca: 25 centów przy Fable 5.1 wobec 50 centów przy Opus 5. W pomiarze Artificial Analysis jedno zadanie z indeksu kosztuje mimo to 7,63 dolara na Fable 5.1, 5,86 na Opus 5 i 3,26 na GPT-6 Astra.
Czy opłaca się przejście z Opus 5 na Fable 5.1?
Anthropic we własnej dokumentacji radzi zacząć od Opus 5, a Fable 5.1 brać do wymagającego wnioskowania i długich zadań agentowych. Z mojej praktyki to się zgadza: do tekstów, analiz i zwykłej automatyzacji Opus 5 za połowę ceny tokenów jest wyborem rozsądnym. Fable 5.1 opłaca się tam, gdzie agent pracuje godzinami na tym samym dużym kontekście, bo właśnie wtedy działa nowa cena cache.
Mijo Jurisic
Konsultant Google Ads i założyciel MJ Marketing. Ponad pięć lat praktyki: od samouczenia po Google Premier Partner Programme z 500+ klientami Google Ads i €20M+ zarządzanego budżetu mediowego.
Udostępnij artykuł:



