Przewodnik porównania modeli AI
Otwierasz selektor modeli i widzisz kilka opcji. Każda ma inne mocne strony, okna kontekstu i poziomy cen. Ten przewodnik mówi, którego modelu użyć do jakiego zadania, kiedy się przełączyć i ile to kosztuje.
Co z tego wyniesiesz
Dział zatytułowany „Co z tego wyniesiesz”- Jasną rekomendację domyślnego modelu dla każdego narzędzia
- Kryteria decyzji, kiedy zmienić model
- Rozbicie cen według typu żądania
- Strategię routingu modeli, której możesz użyć od razu
Szybki przewodnik wyboru
Dział zatytułowany „Szybki przewodnik wyboru”| Zadanie | Rekomendowany model | Dlaczego |
|---|---|---|
| Złożone kodowanie agentowe, refaktoryzacje wieloplikowe | Claude Opus 5 | Domyślny Opus Anthropic; wyprzedza Fable 5 w większości mierzonych benchmarków za połowę ceny |
| Zadania dłuższe niż jedna sesja | Claude Fable 5 | Tier o najwyższych możliwościach; jego przewaga rośnie z długością i złożonością zadania |
| Codzienna praca Claude Code | Claude Sonnet 5 | Zalecany punkt startu koszt/jakość; default konta zależy od planu |
| Tania praca równoległa / masowa | Claude Haiku 4.5 | Połowa promocyjnej stawki Sonnet; jedna trzecia po promocji Sonnet |
| Najtrudniejsze zadania Codex | GPT-5.6 Sol | Flagowy poziom do złożonego kodowania i pracy profesjonalnej |
| Codzienna praca Codex | GPT-5.6 Terra | Równowaga możliwości, opóźnienia i kosztu |
| Praca masowa Codex | GPT-5.6 Luna | Najtańszy poziom GPT-5.6 |
| Długie zadania w Cursor | Grok 4.5 | Model first-party frontier do oprogramowania i pracy na komputerze |
| Szybka iteracja (Cursor) | Cursor Composer 2.5 | Wbudowany model kodowania o prędkości frontier |
| Duża baza kodu (>200K tokenów) | Opus 5, Sonnet 5, rodzina GPT-5.6 lub Gemini 3.1 Pro | Okna kontekstu klasy 1M |
| Multimodalność (obrazy, wideo) | Gemini 3.1 Pro | Mocne wsparcie multimodalne z kontekstem 1M |
| Architektura i projektowanie | Claude Opus 5 | Głębokie rozumowanie przy poziomie wysiłku high lub xhigh |
| Praca na komputerze i agenci przeglądarkowi | Claude Opus 5 | Wyprzedza Fable 5 w OSWorld 2.0 przy około jednej trzeciej kosztu |
| Budżet | Model podstawowy | Alternatywa |
|---|---|---|
| Premium (szczytowe możliwości) | Claude Fable 5 | Claude Opus 5 |
| Standardowy | Claude Sonnet 5 | GPT-5.6 Terra |
| Nastawiony na szybkość (Cursor) | Cursor Composer 2.5 | Grok 4.5 Fast |
| Wrażliwy na koszty | GPT-5.6 Luna | Claude Haiku 4.5 |
| Korporacyjny/Multimodalny | GPT-5.6 Sol | Gemini 3.1 Pro |
Specyfikacje modeli
Dział zatytułowany „Specyfikacje modeli”Pełna tabela porównawcza
Dział zatytułowany „Pełna tabela porównawcza”| Model | Dostawca | Kontekst | Limit wyjścia | Rola | Wejście $/1M | Wyjście $/1M | Szybkość |
|---|---|---|---|---|---|---|---|
| Claude Fable 5 | Anthropic | 1M | 128K | Szczyt Claude | $10 | $50 | Wolniejsza |
| Claude Opus 5 | Anthropic | 1M | 128K | Domyślny Claude | $5 | $25 | Standardowa |
| Claude Opus 4.8 | Anthropic | 1M | 128K | Poprzedni Opus | $5 | $25 | Standardowa |
| Claude Sonnet 5 | Anthropic | 1M | 128K | Codzienny Claude | $2* | $10* | Standardowa |
| Claude Haiku 4.5 | Anthropic | 200K | 64K | Tani Claude | $1 | $5 | Szybka |
| GPT-5.6 Sol | OpenAI | 1.05M | 128K | Flagowy | $5 | $30 | Standardowa |
| GPT-5.6 Terra | OpenAI | 1.05M | 128K | Zrównoważony | $2.50 | $15 | Szybsza |
| GPT-5.6 Luna | OpenAI | 1.05M | 128K | Masowy | $1 | $6 | Najszybsza |
| Grok 4.5 | Cursor / SpaceXAI | 500K API** | — | Szeroki frontier | $2 | $6 | Standardowa |
| Cursor Composer 2.5 | Cursor | 200K | — | Specjalista kodowania | $0.50 | $2.50 | Szybka |
| Gemini 3.1 Pro | 1M | — | Multimodalny | $2*** | $12*** | Standardowa |
* Cena premierowa Sonnet 5 do 31 sierpnia 2026; potem standardowo $3 / $15 za MTok.
** SpaceXAI dokumentuje kontekst 500K w API Grok 4.5. Host taki jak Cursor może udostępniać mniej, więc przed pracą na dużym kontekście sprawdź bieżący selektor.
*** Gemini 3.1 Pro wycenia się progowo: $2 / $12 za MTok dla promptów do 200K tokenów wejścia i $4 / $18 powyżej tego progu.
Claude Fable 5 (Anthropic)
Dział zatytułowany „Claude Fable 5 (Anthropic)”Tier o najwyższych możliwościach, do pracy dłuższej niż jedna sesja.
- Wydany: 9 czerwca 2026
- Okno kontekstu: 1M tokenów z limitem wyjścia 128K
- Kluczowa siła: Anthropic podaje, że przewaga Fable 5 nad pozostałymi modelami rośnie wraz z długością i złożonością zadania — to tier do długich autonomicznych przebiegów, nie do rutynowej przepustowości. Rankingi benchmarków zależą od effort, harnessu i zestawu zadań, a Opus 5 wyprzedza go teraz w większości opublikowanych pomiarów.
- Dostępny w: Claude Code v2.1.170+ (
/model fable), Cursor (selektor modeli), Claude API (claude-fable-5)
Kiedy używać: Gdy różnicą jest sam horyzont zadania — przebiegi nocne, migracje rozłożone na wiele sesji — wybierz Fable 5 jawnie dla głównej sesji. Fable nigdy nie jest automatycznym defaultem konta, a subagenty mogą dziedziczyć model rodzica, więc przy kontroli kosztu przypnij je do Sonnet lub Haiku. Zanim zapłacisz 2×, spróbuj podnieść poziom wysiłku w Opus 5: low i medium w obecnej generacji często wypadają lepiej niż xhigh w poprzednich modelach.
Ceny: $10 / $50 za 1M tokenów (wejście/wyjście) — dokładnie 2× Opus 5. Poziomy wysiłku to low, medium, high, xhigh i max. Myślenie jest zawsze włączone i nie da się go wyłączyć; przesłanie thinking: {"type": "disabled"} zwraca błąd 400. Fable 5 wymaga 30-dniowej retencji danych i jest niedostępny dla organizacji w trybie zero data retention.
Fable 5 to ogólnie dostępny, dostrojony pod kątem bezpieczeństwa członek klasy Mythos — według słów Anthropic „model klasy Mythos, który uczyniliśmy bezpiecznym do ogólnego użytku”. Siostrzany Claude Mythos 5 to ten sam model bazowy ze zniesionymi w niektórych obszarach zabezpieczeniami; początkowy dostęp jest ograniczony do cyberobrońców Project Glasswing i dostawców infrastruktury krytycznej.
Claude Opus 5 (Anthropic)
Dział zatytułowany „Claude Opus 5 (Anthropic)”Domyślny tier Claude do złożonego kodowania agentowego i pracy korporacyjnej.
- Wydany: 24 lipca 2026
- Okno kontekstu: 1M tokenów — zarówno domyślnie, jak i maksymalnie — z limitem wyjścia 128K
- Kluczowa siła: Anthropic raportuje wyniki state-of-the-art w Frontier-Bench v0.1 (ponad dwukrotność Opus 4.8 przy niższym koszcie na zadanie) i GDPval-AA v2, około 3× wynik następnego najlepszego modelu w ARC-AGI-3 oraz zwycięstwo nad Fable 5 w OSWorld 2.0 przy około jednej trzeciej kosztu. Przy poziomie wysiłku
maxmieści się w 0,5 punktu od szczytowego wyniku Fable 5 w CursorBench 3.2 za połowę kosztu na zadanie. Jego granica wiedzy z maja 2026 jest najświeższa spośród wszystkich modeli Claude - Dostępny w: Claude Code v2.1.219+, Cursor (selektor modeli), Claude API (
claude-opus-5), Bedrock (anthropic.claude-opus-5), Google Cloud, Microsoft Foundry
Kiedy używać: Ustaw go jako domyślny. Decyzje architektoniczne, refaktoryzacje wieloplikowe, złożone debugowanie, długotrwali agenci, praca na komputerze i praca wiedzowa na dużą skalę. Opus 5 jest defaultem konta na Max, Team Premium, Enterprise pay-as-you-go, w Anthropic API, Claude Platform on AWS, Bedrock i Google Cloud; Pro, Team Standard i miejsca Enterprise domyślnie używają Sonnet 5.
Ceny: $5 / $25 za 1M tokenów (wejście/wyjście) — identycznie jak Opus 4.8 i połowa ceny Fable 5. Tryb Fast kosztuje $10 / $50 za około 2,5× szybkość wyjścia, wyłącznie w Claude API. Przetwarzanie wsadowe obniża obie stawki o połowę. Minimalny cache’owalny prompt spada do 512 tokenów z 1024 w Opus 4.8, więc krótsze prompty trafiają teraz do cache bez zmian w kodzie.
Claude Opus 4.8 (Anthropic)
Dział zatytułowany „Claude Opus 4.8 (Anthropic)”Poprzedni Opus, nadal dostępny — i model docelowy fallbacku dla oflagowanych żądań.
- Wydany: 28 maja 2026
- Okno kontekstu: 1M tokenów z limitem wyjścia 128K
- Kluczowa siła: Około czterokrotnie rzadziej niż Opus 4.7 pozostawia nieoznaczone wady we własnym kodzie; mocny w długich zadaniach agentowych
- Dostępny w: Claude Code, Cursor (selektor modeli), Anthropic API, Bedrock, Google Cloud
Kiedy używać: Opus 5 zastępuje go w tej samej cenie, więc nowa praca powinna startować na Opus 5. Opus 4.8 warto znać z dwóch powodów: nie jest wycofany i nadal obsługuje przypięty ruch produkcyjny, a także jest modelem, na którym automatycznie powtarzane są żądania oflagowane jako cyberbezpieczeństwo zarówno w Opus 5, jak i w Fable 5. Wspiera też nadal Priority Tier, którego Opus 5 nie obsługuje.
Ceny: $5 / $25 za 1M tokenów (wejście/wyjście) — bez zmian względem Opus 4.7. Tryb Fast działa z 2× standardowej stawki za 2,5× szybkość. Domyślny poziom wysiłku to high.
Claude Sonnet 5 (Anthropic)
Dział zatytułowany „Claude Sonnet 5 (Anthropic)”Ekonomiczny codzienny tier Claude i default standardowych miejsc subskrypcyjnych.
- Wydany: 30 czerwca 2026
- Okno kontekstu: Natywne 1M tokenów
- Kluczowa siła: Ścisła poprawa względem Sonnet 4.6 z szerszym zakresem koszt/wydajność; przy wysokim effort na części zadań dorównuje tierowi Opus
- Dostępny w: Claude Code, Cursor, Anthropic API
Kiedy używać: Używaj do codziennego kodowania, analizy dużych baz i większości pracy agentowej wrażliwej na koszt; najpierw zwiększ effort, a dopiero potem przechodź na Opus lub Fable. Sonnet 5 jest defaultem konta na Pro, Team Standard i subskrypcyjnych miejscach Enterprise. Max, Team Premium, Enterprise pay-as-you-go i sesje Anthropic API domyślnie używają Opus 5; polityka organizacji może to nadpisać.
Ceny: $2 / $10 za 1M tokenów do 31 sierpnia 2026; potem $3 / $15.
Claude Haiku 4.5 (Anthropic)
Dział zatytułowany „Claude Haiku 4.5 (Anthropic)”Tania, szybka warstwa napędzająca pracę równoległą.
- Wydany: październik 2025
- Okno kontekstu: 200K tokenów
- Kluczowa siła: Wystarczająco szybki i tani do napędzania subagentów, codemodów i masowych edycji plików; jego stawka $1/$5 to połowa promocyjnej stawki Sonnet 5 ($2/$10) i jedna trzecia późniejszej stawki $3/$15
- Dostępny w: Claude Code (subagenci i
/model), Anthropic API
Kiedy używać: Eksploracja tylko do odczytu, masowe skany, rozproszeni subagenci i proste formatowanie, gdzie nie potrzebujesz rozumowania frontier. Model Warstwy 1 w strategii routingu modeli.
Ceny: $1 / $5 za 1M tokenów (wejście/wyjście).
Rodzina GPT-5.6 (OpenAI)
Dział zatytułowany „Rodzina GPT-5.6 (OpenAI)”Trzy trwałe poziomy możliwości dla Codex, ChatGPT Work i API OpenAI.
- Wydany: GA 9 lipca 2026 (preview 26 czerwca)
- Okno kontekstu: 1,05M tokenów i limit wyjścia 128K dla Sol, Terra i Luna
- Poziomy:
gpt-5.6-soldo pracy frontier,gpt-5.6-terrajako równowaga możliwości i kosztu,gpt-5.6-lunado wydajnej pracy masowej; aliasgpt-5.6prowadzi do Sol - Dostępny w: Wszystkie trzy poziomy w Codex, ChatGPT Work i API; zwykłe rozmowy ChatGPT udostępniają Sol w kwalifikujących się płatnych planach
Kiedy używać: Sol do najtrudniejszego kodowania, researchu, designu, computer use i pracy profesjonalnej; Terra jako codzienny domyślny poziom; Luna do ekstrakcji, routingu, operacji masowych oraz pracy wrażliwej na opóźnienie i koszt. W Codex plany Free i Go używają Terra, a Plus, Pro, Business i Enterprise mogą wybierać wszystkie trzy.
Ceny: Sol $5 / $30, Terra $2.50 / $15, Luna $1 / $6 za 1M tokenów wejścia/wyjścia. Odczyty cache kosztują 10% ceny wejścia, a zapisy 1,25× ceny uncached input. Żądania powyżej 272K tokenów wejściowych są rozliczane jako 2× wejście / 1,5× wyjście dla całego żądania.
GPT-5.6 obsługuje effort none, low, medium, high, xhigh i max. Pro to tryb rozumowania wybranego modelu GPT-5.6, nie osobny slug API. Responses API dodaje też persisted reasoning, explicit prompt caching, Programmatic Tool Calling i beta multi-agent.
Grok 4.5 (Cursor / SpaceXAI)
Dział zatytułowany „Grok 4.5 (Cursor / SpaceXAI)”Model first-party frontier Cursora do długiej pracy wykraczającej poza software engineering.
- Wydany: 8 lipca 2026
- Architektura: Mixture-of-experts, wspólnie trenowany przez Cursor i SpaceXAI
- Dostępny w: Cursor desktop, web, iOS, CLI i SDK
- Ceny: $2 / $6 za 1M tokenów wejścia/wyjścia; wariant fast $4 / $18
Kiedy używać: Trudne, długie zadania wymagające kreatywnego użycia narzędzi w oprogramowaniu, data science, finansach, prawie lub ogólnej pracy na komputerze. Composer 2.5 lepiej pasuje do mniejszych pętli kodowania nastawionych na szybkość.
Grok 4.5 nie zastępuje Composer 2.5. Cursor opisuje je jako różne klasy wag, zapowiada dalszą dostępność Composer 2.5 i kolejne modele o tym mniejszym rozmiarze. Grok jest większym, szerszym modelem frontier; Composer pozostaje tańszym specjalistą kodowania.
Cursor wykluczył Grok 4.5 z premierowego porównania CursorBench, ponieważ w danych treningowych przypadkowo znalazł się starszy snapshot kodu Cursora; nie traktuj tego benchmarku jako niezależnego dowodu jakości.
Gemini 3.1 Pro (Google)
Dział zatytułowany „Gemini 3.1 Pro (Google)”Mocny model multimodalny z dużym oknem kontekstu.
- Wydany: luty 2026
- Okno kontekstu: 1M tokenów
- Kluczowa siła: Analiza obrazu, dźwięku i wideo oraz tryb Deep Think do złożonego rozumowania.
- Dostępny w: Cursor (selektor modeli), bezpośrednie API
Kiedy używać: Zadania wymagające więcej niż 200K tokenów kontekstu, analiza multimodalna (diagramy, zrzuty ekranu, nagrania) lub gdy potrzebujesz trybu rozumowania Deep Think.
Ceny: Progowe według rozmiaru promptu. $2 / $12 za 1M tokenów (wejście/wyjście) dla promptów do 200K tokenów wejścia; powyżej tego progu wejście podwaja się do $4, a wyjście rośnie do $18. Przy świadomym korzystaniu z dużego okna kontekstu planuj budżet według wyższego progu.
Cursor Composer 2.5 (Cursor)
Dział zatytułowany „Cursor Composer 2.5 (Cursor)”Mniejszy, tańszy specjalista kodowania Cursora.
- Wydany: 18 maja 2026
- Architektura: Mixture-of-Experts, wzmocniona własnym kontynuowanym pretrainingiem i uczeniem ze wzmocnieniem Cursor
- Okno kontekstu: 200K tokenów
- Kluczowa siła: Wyraźny krok naprzód względem Composer 2 — lepszy w długotrwałej pracy nad zadaniami i bardziej niezawodny w realizacji złożonych instrukcji
- Dostępny w: Cursor i Grok Build
Kiedy używać: Szybka lokalna iteracja w Cursor. Zoptymalizowany pod edycje wielu plików, generowanie kodu, refaktoryzację i długie łańcuchy zadań obejmujące setki akcji.
Ceny: $0.50 / $2.50 za 1M tokenów (standard); $3.00 / $15.00 (wariant fast, domyślny).
Strategia routingu modeli
Dział zatytułowany „Strategia routingu modeli”Użyj tego drzewa decyzyjnego do codziennej pracy:
- Sprawdź rzeczywisty default konta: Sonnet 5 na standardowych miejscach subskrypcyjnych Anthropic, Opus 5 na kontach premium/direct API i w zarządzanych chmurach, Sonnet 4.5 na Microsoft Foundry; Terra do codziennej pracy Codex i Sol do najtrudniejszych zadań
- Złożona praca nie wychodzi na modelu domyślnym? Podnieś poziom wysiłku w Opus 5, zanim zmienisz model —
highjest domyślny, axhighpasuje do większości kodowania agentowego. Zwykle jest to tańsze niż zmiana tieru - Horyzont zadania obejmuje wiele sesji? Wtedy wybierz Fable 5 jawnie dla głównej sesji. Jeśli liczy się koszt, przypnij subagenty do Sonnet/Haiku; mogą dziedziczyć model rodzica zamiast automatycznie schodzić niżej
- Potrzebujesz frontierowej, długiej pracy w Cursor? Użyj Grok 4.5; do szybkiej iteracji przełącz na Composer 2.5
- Potrzebujesz oszczędności? Użyj GPT-5.6 Luna lub Haiku 4.5 do pracy masowej/równoległej
- Kontekst przekracza 200K? Użyj Opus 5, Sonnet 5, dowolnego poziomu GPT-5.6 lub Gemini 3.1 Pro (pamiętaj o progu cenowym Gemini powyżej 200K)
- Analiza multimodalna? Gemini 3.1 Pro
- Wszystko inne? Zostań przy domyślnym
Analiza kosztów
Dział zatytułowany „Analiza kosztów”Ilustracyjny koszt według łącznych tokenów
Dział zatytułowany „Ilustracyjny koszt według łącznych tokenów”Poniższe przykłady zakładają 80% niecache’owanego inputu i 20% outputu. To ilustracja arytmetyczna, nie zmierzona średnia zadania; cache, reasoning tokens, tool calls i ceny hosta zmieniają koszt rzeczywisty.
| Łączne tokeny | Opus 5 | Sonnet 5* | GPT-5.6 Sol | Composer 2.5 |
|---|---|---|---|---|
| 1K | ~$0.009 | ~$0.0036 | ~$0.010 | ~$0.0009 |
| 10K | ~$0.09 | ~$0.036 | ~$0.10 | ~$0.009 |
| 50K | ~$0.45 | ~$0.18 | ~$0.50 | ~$0.045 |
| 100K | ~$0.90 | ~$0.36 | ~$1.00 | ~$0.09 |
Kolumna Opus 5 dotyczy także Opus 4.8, wycenianego identycznie. Żądanie Claude Fable 5 kosztuje dokładnie dwukrotność tej kolumny — $10 / $50 za 1M tokenów wobec $5 / $25 — a tryb Fast w Opus 5 kosztuje tyle samo co Fable 5, czyli $10 / $50. * Kolumna Sonnet 5 używa ceny premierowej z lipca 2026.
Kontekst subskrypcji
Dział zatytułowany „Kontekst subskrypcji”Cursor rozlicza użycie modeli z puli zawartej w planie według bieżącej stawki wybranego modelu. Grok 4.5 kosztuje na przykład $2/$6 za MTok w trybie standard i $4/$18 w fast. Limity planów i dostępne modele mogą się zmieniać; weryfikuj je w Cursor Settings > Usage oraz na oficjalnej stronie cennika.
| Plan | Cena | Model podstawowy | Użycie |
|---|---|---|---|
| Pro | $20/miesiąc | Sonnet 5 jako default konta; Opus 5 wybieralny | Najniższe limity |
| Max 5x | $100/miesiąc | Opus 5 jako default; Sonnet/Fable wybieralne | Wyższe limity |
| Max 20x | $200/miesiąc | Opus 5 jako default; Sonnet/Fable wybieralne | Najwyższe limity indywidualne |
Default Claude Code zależy od konta i providera: Sonnet 5 na Pro, Team Standard i subskrypcyjnych miejscach Enterprise; Opus 5 na Max, Team Premium, Enterprise pay-as-you-go i w sesjach Anthropic API. Polityka organizacji może nadpisać tę mapę. Od v2.1.219 defaulty zarządzanych chmur to Opus 5 na Amazon Bedrock, Google Cloud Agent Platform i Claude Platform on AWS, natomiast Microsoft Foundry domyślnie używa Sonnet 4.5 i wciąż rozwiązuje alias opus na Opus 4.6. Sam Opus 5 wymaga Claude Code v2.1.219 lub nowszego — starsze wersje nie pokazują go w selektorze. Sprawdzaj zarówno providera, jak i ustawienia organizacji. Limity często się zmieniają — weryfikuj bieżące przydziały na stronie cennika Anthropic. Od 20 lipca 2026 Fable 5 jest na stałe wliczony w plany Max i Team Premium do 50% tygodniowych limitów użycia, a Pro i Team Standard sięgają po niego przez usage credits.
| Plan | Cena | Model | Dostęp |
|---|---|---|---|
| Free / Go | Zależnie od planu | GPT-5.6 Terra | Podstawowy dostęp Codex |
| Plus / Pro / Business / Enterprise | Zależnie od planu | GPT-5.6 Sol, Terra, Luna | Wybór modelu i effort |
Codex udostępnia rodzinę GPT-5.6 zależnie od planu. Sol jest poziomem flagowym, Terra zrównoważonym, a Luna najtańszym; max reasoning jest dostępny dla użytkowników z dostępem do GPT-5.6.
Benchmarki wydajności
Dział zatytułowany „Benchmarki wydajności”Wyniki kodowania raportowane przez dostawców
Dział zatytułowany „Wyniki kodowania raportowane przez dostawców”Snapshot zweryfikowany 11 lipca 2026. To wyniki premierowe opublikowane przez dostawców modeli; -- oznacza brak bezpośrednio porównywalnej wartości w cytowanej publikacji.
| Model i ustawienie | SWE-Bench Pro | DeepSWE 1.1 | Terminal-Bench 2.1 |
|---|---|---|---|
GPT-5.6 Sol (max) | 64,6% | 72,7% | 88,8% |
GPT-5.6 Terra (max) | 63,4% | 69,6% | 87,4% |
GPT-5.6 Luna (max) | 62,7% | 67,2% | 84,7% |
Grok 4.5 (high) | 64,7% | 53,0% | 83,3% |
Claude Sonnet 5 (max) | 63,2% | — | 80,4% |
Osobny wykres premierowy Cursora porównał Grok 4.5 z Composer 2.5: 64,7% wobec 54,0% w SWE-Bench Pro, 83,3% wobec 73,0% w Terminal-Bench 2.1 oraz 62,0% wobec 18,0% w DeepSWE 1.0. Pokazuje to dużą różnicę możliwości w tych runach, ale nie oznacza wycofania: Cursor jawnie utrzymuje oba modele. Cursor zaznacza też, że część wyników konkurentów na jego wykresie była self-reported.
Niezależny snapshot: Artificial Analysis
Dział zatytułowany „Niezależny snapshot: Artificial Analysis”Poniższe wyniki Artificial Analysis odczytano 27 lipca 2026. Intelligence Index używa wersji v4.1, a Coding Agent Index v1.1 uśrednia DeepSWE, Terminal-Bench v2 i SWE-Atlas-QnA. Artificial Analysis wspierało Anthropic w ocenie Claude Opus 5 przed premierą, więc traktuj jego wyniki dla Opus 5 jako bliskie dostawcy, nie w pełni niezależne.
| Model + mierzony system | Intelligence Index v4.1 | Coding Agent Index v1.1 | Koszt na zadanie |
|---|---|---|---|
Claude Opus 5 max / Claude Code | 61 | wspólne 1. miejsce* | $2,03 |
Claude Fable 5 max + fallback / Claude Code | 60 | 77 | $2,75 |
GPT-5.6 Sol max / Codex | 59 | 80 | — |
Claude Opus 4.8 max / Claude Code | 56 | 73 | $1,80 |
GPT-5.6 Terra max / Codex | 55 | 77 | — |
Grok 4.5 high / Grok Build | 54 | 76 | — |
Claude Sonnet 5 max | 53 | — | $1,53 |
GPT-5.6 Luna max / Codex | 51 | 75 | — |
| Composer 2.5 / Cursor CLI | — | 52 | — |
* Artificial Analysis umieszcza Opus 5 przy xhigh z Claude Code na wspólnym pierwszym miejscu w Coding Agent Index, obok GPT-5.6 Sol z Codex, nie publikując dla niego osobnej wartości indeksu. Opus 5 prowadzi w Intelligence Index z wynikiem 61, minimalnie przed Fable 5 z 60, i ustanawia najwyższe zmierzone dotąd wyniki GDPval-AA v2 (1 861 Elo wobec ~1 747 dla Fable 5) oraz AA-Briefcase (1 720 wobec ~1 574).
Kolumna kosztu na zadanie jest najważniejsza dla routingu: Opus 5 osiąga najwyższy wynik Intelligence Index przy koszcie na zadanie o około 26% niższym niż Fable 5. Opus 4.8 jest jeszcze tańszy w przeliczeniu na zadanie, ale wypada o pięć punktów słabiej.
Bieżący Composer 2.5 w v1.1 ma około 16% DeepSWE, 67% Terminal-Bench v2 i 72% SWE-Atlas-QnA, z tym samym indeksem 52 dla Standard i Fast. Standard kosztował średnio około $0,08 i 9,7 minuty na zadanie, a Fast około $0,55 i 6,8 minuty. Często cytowany wynik Composer 62 pochodził z majowego indeksu v1.0, zanim DeepSWE zastąpił SWE-Bench-Pro-Hard-AA, i nie jest bezpośrednio porównywalny z wartościami v1.1.
Grok 4.5 łączy mocny niezależny wynik kodowania z relatywnie niskim zmierzonym kosztem, ale AA-Omniscience daje ważne ostrzeżenie przed nadmiernym uogólnianiem: Artificial Analysis raportuje 52% trafności i 54% hallucination rate. Przy pracy faktograficznej zachowaj pętlę weryfikacji.
Lista kontrolna wyboru modelu
Dział zatytułowany „Lista kontrolna wyboru modelu”-
Zidentyfikuj swoje główne narzędzie: Cursor, Claude Code lub Codex
-
Sprawdź wybrany/default model: Zależny od konta/providera w Claude Code (defaulty zarządzanych chmur są inne), Terra/Sol według zadania Codex albo Composer 2.5/Grok 4.5 według opóźnienia i złożoności Cursor
-
Oceń złożoność zadania: Proste zadania nie potrzebują najdroższego modelu
-
Sprawdź wymagania kontekstowe: Obciążenia przekraczające 200K tokenów potrzebują Opus 5, Sonnet 5, poziomu GPT-5.6 lub innego zweryfikowanego modelu z kontekstem 1M
-
Rozważ budżet: Śledź z
/cost(Claude Code), Settings > Usage (Cursor) lub pulpit Codex -
Dostosuj według potrzeb: Przełączaj modele na podstawie zadania, nie przyzwyczajenia
Najlepsze praktyki
Dział zatytułowany „Najlepsze praktyki”- Domyślnie najlepszy model dla zadań, które się liczą — architektura, przegląd bezpieczeństwa, złożone debugowanie
- Obniż poziom dla rutynowej pracy — proste poprawki, boilerplate, formatowanie nie potrzebują tieru Opus
- Używaj modeli szybkości do iteracji — Composer 2.5 w Cursor dla szybkich cykli próbnych i błędów
- Kieruj pracę masową do Haiku 4.5 — subagenci, codemody i skany rozproszone kosztują ułamek Opus
- Monitoruj koszty co tydzień — Śledź które modele zapewniają najlepszy ROI dla twojego przepływu pracy
- Bądź na bieżąco — Możliwości modeli i ceny zmieniają się często. Sprawdź stronę Aktualizacje
Źródła weryfikacji
Dział zatytułowany „Źródła weryfikacji”- OpenAI: ogłoszenie GPT-5.6, przewodnik po modelach i changelog Codex
- Cursor / SpaceXAI: oficjalny changelog, premiera Grok 4.5 według Cursora, premiera Grok 4.5 według SpaceXAI i Composer 2.5 w Grok Build
- Anthropic: przegląd modeli Claude, cennik, konfiguracja modeli Claude Code, changelog Claude Code, Claude Opus 5, Claude Sonnet 5 i dostępność Fable 5
- Niezależne benchmarki: Artificial Analysis o Claude Opus 5, GPT-5.6, Grok 4.5, żywy ranking agentów kodowania i metodologia v1.1
- Google: cennik Gemini API
- Status transakcji: Form 8-K SpaceX złożony w SEC