AI i Narzędzia
Claude Opus 5: benchmarki, cena i paradoks kosztów
Claude Opus 5 w teście: 1. miejsce w Intelligence Index z 61 punktami, połowa ceny Fable 5 i paradoks kosztów wynikający z gadatliwości modelu.
12 min read
Mijo Jurisic
Czytaj dalej3 artykułów
Claude Opus 5 w teście: 1. miejsce w Intelligence Index z 61 punktami, połowa ceny Fable 5 i paradoks kosztów wynikający z gadatliwości modelu.
Seria GPT-5.6 od OpenAI (Luna, Terra, Sol) w teście benchmarków i ustalenia METR o oszukiwaniu: dlaczego mocne wyniki i reward hacking idą w parze.
Kimi K3 od Moonshot AI w teście: największy otwarty model, miejsca 2 do 4 wobec Fable 5 i GPT-5.6 Sol, najlepszy stosunek ceny do jakości.