Przejdź do głównej zawartości

Przewodnik porównania modeli AI

Otwierasz selektor modeli i widzisz kilka opcji. Każda ma inne mocne strony, okna kontekstu i poziomy cen. Ten przewodnik mówi, którego modelu użyć do jakiego zadania, kiedy się przełączyć i ile to kosztuje.

  • Jasną rekomendację domyślnego modelu dla każdego narzędzia
  • Kryteria decyzji, kiedy zmienić model
  • Rozbicie cen według typu żądania
  • Strategię routingu modeli, której możesz użyć od razu
ZadanieRekomendowany modelDlaczego
Złożone kodowanie agentowe, refaktoryzacje wieloplikoweClaude Opus 5Domyślny Opus Anthropic; wyprzedza Fable 5 w większości mierzonych benchmarków za połowę ceny
Zadania dłuższe niż jedna sesjaClaude Fable 5Tier o najwyższych możliwościach; jego przewaga rośnie z długością i złożonością zadania
Codzienna praca Claude CodeClaude Sonnet 5Zalecany punkt startu koszt/jakość; default konta zależy od planu
Tania praca równoległa / masowaClaude Haiku 4.5Połowa promocyjnej stawki Sonnet; jedna trzecia po promocji Sonnet
Najtrudniejsze zadania CodexGPT-5.6 SolFlagowy poziom do złożonego kodowania i pracy profesjonalnej
Codzienna praca CodexGPT-5.6 TerraRównowaga możliwości, opóźnienia i kosztu
Praca masowa CodexGPT-5.6 LunaNajtańszy poziom GPT-5.6
Długie zadania w CursorGrok 4.5Model first-party frontier do oprogramowania i pracy na komputerze
Szybka iteracja (Cursor)Cursor Composer 2.5Wbudowany model kodowania o prędkości frontier
Duża baza kodu (>200K tokenów)Opus 5, Sonnet 5, rodzina GPT-5.6 lub Gemini 3.1 ProOkna kontekstu klasy 1M
Multimodalność (obrazy, wideo)Gemini 3.1 ProMocne wsparcie multimodalne z kontekstem 1M
Architektura i projektowanieClaude Opus 5Głębokie rozumowanie przy poziomie wysiłku high lub xhigh
Praca na komputerze i agenci przeglądarkowiClaude Opus 5Wyprzedza Fable 5 w OSWorld 2.0 przy około jednej trzeciej kosztu
ModelDostawcaKontekstLimit wyjściaRolaWejście $/1MWyjście $/1MSzybkość
Claude Fable 5Anthropic1M128KSzczyt Claude$10$50Wolniejsza
Claude Opus 5Anthropic1M128KDomyślny Claude$5$25Standardowa
Claude Opus 4.8Anthropic1M128KPoprzedni Opus$5$25Standardowa
Claude Sonnet 5Anthropic1M128KCodzienny Claude$2*$10*Standardowa
Claude Haiku 4.5Anthropic200K64KTani Claude$1$5Szybka
GPT-5.6 SolOpenAI1.05M128KFlagowy$5$30Standardowa
GPT-5.6 TerraOpenAI1.05M128KZrównoważony$2.50$15Szybsza
GPT-5.6 LunaOpenAI1.05M128KMasowy$1$6Najszybsza
Grok 4.5Cursor / SpaceXAI500K API**Szeroki frontier$2$6Standardowa
Cursor Composer 2.5Cursor200KSpecjalista kodowania$0.50$2.50Szybka
Gemini 3.1 ProGoogle1MMultimodalny$2***$12***Standardowa

* Cena premierowa Sonnet 5 do 31 sierpnia 2026; potem standardowo $3 / $15 za MTok.

** SpaceXAI dokumentuje kontekst 500K w API Grok 4.5. Host taki jak Cursor może udostępniać mniej, więc przed pracą na dużym kontekście sprawdź bieżący selektor.

*** Gemini 3.1 Pro wycenia się progowo: $2 / $12 za MTok dla promptów do 200K tokenów wejścia i $4 / $18 powyżej tego progu.

Tier o najwyższych możliwościach, do pracy dłuższej niż jedna sesja.

  • Wydany: 9 czerwca 2026
  • Okno kontekstu: 1M tokenów z limitem wyjścia 128K
  • Kluczowa siła: Anthropic podaje, że przewaga Fable 5 nad pozostałymi modelami rośnie wraz z długością i złożonością zadania — to tier do długich autonomicznych przebiegów, nie do rutynowej przepustowości. Rankingi benchmarków zależą od effort, harnessu i zestawu zadań, a Opus 5 wyprzedza go teraz w większości opublikowanych pomiarów.
  • Dostępny w: Claude Code v2.1.170+ (/model fable), Cursor (selektor modeli), Claude API (claude-fable-5)

Kiedy używać: Gdy różnicą jest sam horyzont zadania — przebiegi nocne, migracje rozłożone na wiele sesji — wybierz Fable 5 jawnie dla głównej sesji. Fable nigdy nie jest automatycznym defaultem konta, a subagenty mogą dziedziczyć model rodzica, więc przy kontroli kosztu przypnij je do Sonnet lub Haiku. Zanim zapłacisz 2×, spróbuj podnieść poziom wysiłku w Opus 5: low i medium w obecnej generacji często wypadają lepiej niż xhigh w poprzednich modelach.

Ceny: $10 / $50 za 1M tokenów (wejście/wyjście) — dokładnie 2× Opus 5. Poziomy wysiłku to low, medium, high, xhigh i max. Myślenie jest zawsze włączone i nie da się go wyłączyć; przesłanie thinking: {"type": "disabled"} zwraca błąd 400. Fable 5 wymaga 30-dniowej retencji danych i jest niedostępny dla organizacji w trybie zero data retention.

Fable 5 to ogólnie dostępny, dostrojony pod kątem bezpieczeństwa członek klasy Mythos — według słów Anthropic „model klasy Mythos, który uczyniliśmy bezpiecznym do ogólnego użytku”. Siostrzany Claude Mythos 5 to ten sam model bazowy ze zniesionymi w niektórych obszarach zabezpieczeniami; początkowy dostęp jest ograniczony do cyberobrońców Project Glasswing i dostawców infrastruktury krytycznej.

Domyślny tier Claude do złożonego kodowania agentowego i pracy korporacyjnej.

  • Wydany: 24 lipca 2026
  • Okno kontekstu: 1M tokenów — zarówno domyślnie, jak i maksymalnie — z limitem wyjścia 128K
  • Kluczowa siła: Anthropic raportuje wyniki state-of-the-art w Frontier-Bench v0.1 (ponad dwukrotność Opus 4.8 przy niższym koszcie na zadanie) i GDPval-AA v2, około 3× wynik następnego najlepszego modelu w ARC-AGI-3 oraz zwycięstwo nad Fable 5 w OSWorld 2.0 przy około jednej trzeciej kosztu. Przy poziomie wysiłku max mieści się w 0,5 punktu od szczytowego wyniku Fable 5 w CursorBench 3.2 za połowę kosztu na zadanie. Jego granica wiedzy z maja 2026 jest najświeższa spośród wszystkich modeli Claude
  • Dostępny w: Claude Code v2.1.219+, Cursor (selektor modeli), Claude API (claude-opus-5), Bedrock (anthropic.claude-opus-5), Google Cloud, Microsoft Foundry

Kiedy używać: Ustaw go jako domyślny. Decyzje architektoniczne, refaktoryzacje wieloplikowe, złożone debugowanie, długotrwali agenci, praca na komputerze i praca wiedzowa na dużą skalę. Opus 5 jest defaultem konta na Max, Team Premium, Enterprise pay-as-you-go, w Anthropic API, Claude Platform on AWS, Bedrock i Google Cloud; Pro, Team Standard i miejsca Enterprise domyślnie używają Sonnet 5.

Ceny: $5 / $25 za 1M tokenów (wejście/wyjście) — identycznie jak Opus 4.8 i połowa ceny Fable 5. Tryb Fast kosztuje $10 / $50 za około 2,5× szybkość wyjścia, wyłącznie w Claude API. Przetwarzanie wsadowe obniża obie stawki o połowę. Minimalny cache’owalny prompt spada do 512 tokenów z 1024 w Opus 4.8, więc krótsze prompty trafiają teraz do cache bez zmian w kodzie.

Poprzedni Opus, nadal dostępny — i model docelowy fallbacku dla oflagowanych żądań.

  • Wydany: 28 maja 2026
  • Okno kontekstu: 1M tokenów z limitem wyjścia 128K
  • Kluczowa siła: Około czterokrotnie rzadziej niż Opus 4.7 pozostawia nieoznaczone wady we własnym kodzie; mocny w długich zadaniach agentowych
  • Dostępny w: Claude Code, Cursor (selektor modeli), Anthropic API, Bedrock, Google Cloud

Kiedy używać: Opus 5 zastępuje go w tej samej cenie, więc nowa praca powinna startować na Opus 5. Opus 4.8 warto znać z dwóch powodów: nie jest wycofany i nadal obsługuje przypięty ruch produkcyjny, a także jest modelem, na którym automatycznie powtarzane są żądania oflagowane jako cyberbezpieczeństwo zarówno w Opus 5, jak i w Fable 5. Wspiera też nadal Priority Tier, którego Opus 5 nie obsługuje.

Ceny: $5 / $25 za 1M tokenów (wejście/wyjście) — bez zmian względem Opus 4.7. Tryb Fast działa z 2× standardowej stawki za 2,5× szybkość. Domyślny poziom wysiłku to high.

Ekonomiczny codzienny tier Claude i default standardowych miejsc subskrypcyjnych.

  • Wydany: 30 czerwca 2026
  • Okno kontekstu: Natywne 1M tokenów
  • Kluczowa siła: Ścisła poprawa względem Sonnet 4.6 z szerszym zakresem koszt/wydajność; przy wysokim effort na części zadań dorównuje tierowi Opus
  • Dostępny w: Claude Code, Cursor, Anthropic API

Kiedy używać: Używaj do codziennego kodowania, analizy dużych baz i większości pracy agentowej wrażliwej na koszt; najpierw zwiększ effort, a dopiero potem przechodź na Opus lub Fable. Sonnet 5 jest defaultem konta na Pro, Team Standard i subskrypcyjnych miejscach Enterprise. Max, Team Premium, Enterprise pay-as-you-go i sesje Anthropic API domyślnie używają Opus 5; polityka organizacji może to nadpisać.

Ceny: $2 / $10 za 1M tokenów do 31 sierpnia 2026; potem $3 / $15.

Tania, szybka warstwa napędzająca pracę równoległą.

  • Wydany: październik 2025
  • Okno kontekstu: 200K tokenów
  • Kluczowa siła: Wystarczająco szybki i tani do napędzania subagentów, codemodów i masowych edycji plików; jego stawka $1/$5 to połowa promocyjnej stawki Sonnet 5 ($2/$10) i jedna trzecia późniejszej stawki $3/$15
  • Dostępny w: Claude Code (subagenci i /model), Anthropic API

Kiedy używać: Eksploracja tylko do odczytu, masowe skany, rozproszeni subagenci i proste formatowanie, gdzie nie potrzebujesz rozumowania frontier. Model Warstwy 1 w strategii routingu modeli.

Ceny: $1 / $5 za 1M tokenów (wejście/wyjście).

Trzy trwałe poziomy możliwości dla Codex, ChatGPT Work i API OpenAI.

  • Wydany: GA 9 lipca 2026 (preview 26 czerwca)
  • Okno kontekstu: 1,05M tokenów i limit wyjścia 128K dla Sol, Terra i Luna
  • Poziomy: gpt-5.6-sol do pracy frontier, gpt-5.6-terra jako równowaga możliwości i kosztu, gpt-5.6-luna do wydajnej pracy masowej; alias gpt-5.6 prowadzi do Sol
  • Dostępny w: Wszystkie trzy poziomy w Codex, ChatGPT Work i API; zwykłe rozmowy ChatGPT udostępniają Sol w kwalifikujących się płatnych planach

Kiedy używać: Sol do najtrudniejszego kodowania, researchu, designu, computer use i pracy profesjonalnej; Terra jako codzienny domyślny poziom; Luna do ekstrakcji, routingu, operacji masowych oraz pracy wrażliwej na opóźnienie i koszt. W Codex plany Free i Go używają Terra, a Plus, Pro, Business i Enterprise mogą wybierać wszystkie trzy.

Ceny: Sol $5 / $30, Terra $2.50 / $15, Luna $1 / $6 za 1M tokenów wejścia/wyjścia. Odczyty cache kosztują 10% ceny wejścia, a zapisy 1,25× ceny uncached input. Żądania powyżej 272K tokenów wejściowych są rozliczane jako 2× wejście / 1,5× wyjście dla całego żądania.

GPT-5.6 obsługuje effort none, low, medium, high, xhigh i max. Pro to tryb rozumowania wybranego modelu GPT-5.6, nie osobny slug API. Responses API dodaje też persisted reasoning, explicit prompt caching, Programmatic Tool Calling i beta multi-agent.

Model first-party frontier Cursora do długiej pracy wykraczającej poza software engineering.

  • Wydany: 8 lipca 2026
  • Architektura: Mixture-of-experts, wspólnie trenowany przez Cursor i SpaceXAI
  • Dostępny w: Cursor desktop, web, iOS, CLI i SDK
  • Ceny: $2 / $6 za 1M tokenów wejścia/wyjścia; wariant fast $4 / $18

Kiedy używać: Trudne, długie zadania wymagające kreatywnego użycia narzędzi w oprogramowaniu, data science, finansach, prawie lub ogólnej pracy na komputerze. Composer 2.5 lepiej pasuje do mniejszych pętli kodowania nastawionych na szybkość.

Grok 4.5 nie zastępuje Composer 2.5. Cursor opisuje je jako różne klasy wag, zapowiada dalszą dostępność Composer 2.5 i kolejne modele o tym mniejszym rozmiarze. Grok jest większym, szerszym modelem frontier; Composer pozostaje tańszym specjalistą kodowania.

Cursor wykluczył Grok 4.5 z premierowego porównania CursorBench, ponieważ w danych treningowych przypadkowo znalazł się starszy snapshot kodu Cursora; nie traktuj tego benchmarku jako niezależnego dowodu jakości.

Mocny model multimodalny z dużym oknem kontekstu.

  • Wydany: luty 2026
  • Okno kontekstu: 1M tokenów
  • Kluczowa siła: Analiza obrazu, dźwięku i wideo oraz tryb Deep Think do złożonego rozumowania.
  • Dostępny w: Cursor (selektor modeli), bezpośrednie API

Kiedy używać: Zadania wymagające więcej niż 200K tokenów kontekstu, analiza multimodalna (diagramy, zrzuty ekranu, nagrania) lub gdy potrzebujesz trybu rozumowania Deep Think.

Ceny: Progowe według rozmiaru promptu. $2 / $12 za 1M tokenów (wejście/wyjście) dla promptów do 200K tokenów wejścia; powyżej tego progu wejście podwaja się do $4, a wyjście rośnie do $18. Przy świadomym korzystaniu z dużego okna kontekstu planuj budżet według wyższego progu.

Mniejszy, tańszy specjalista kodowania Cursora.

  • Wydany: 18 maja 2026
  • Architektura: Mixture-of-Experts, wzmocniona własnym kontynuowanym pretrainingiem i uczeniem ze wzmocnieniem Cursor
  • Okno kontekstu: 200K tokenów
  • Kluczowa siła: Wyraźny krok naprzód względem Composer 2 — lepszy w długotrwałej pracy nad zadaniami i bardziej niezawodny w realizacji złożonych instrukcji
  • Dostępny w: Cursor i Grok Build

Kiedy używać: Szybka lokalna iteracja w Cursor. Zoptymalizowany pod edycje wielu plików, generowanie kodu, refaktoryzację i długie łańcuchy zadań obejmujące setki akcji.

Ceny: $0.50 / $2.50 za 1M tokenów (standard); $3.00 / $15.00 (wariant fast, domyślny).

Użyj tego drzewa decyzyjnego do codziennej pracy:

  1. Sprawdź rzeczywisty default konta: Sonnet 5 na standardowych miejscach subskrypcyjnych Anthropic, Opus 5 na kontach premium/direct API i w zarządzanych chmurach, Sonnet 4.5 na Microsoft Foundry; Terra do codziennej pracy Codex i Sol do najtrudniejszych zadań
  2. Złożona praca nie wychodzi na modelu domyślnym? Podnieś poziom wysiłku w Opus 5, zanim zmienisz model — high jest domyślny, a xhigh pasuje do większości kodowania agentowego. Zwykle jest to tańsze niż zmiana tieru
  3. Horyzont zadania obejmuje wiele sesji? Wtedy wybierz Fable 5 jawnie dla głównej sesji. Jeśli liczy się koszt, przypnij subagenty do Sonnet/Haiku; mogą dziedziczyć model rodzica zamiast automatycznie schodzić niżej
  4. Potrzebujesz frontierowej, długiej pracy w Cursor? Użyj Grok 4.5; do szybkiej iteracji przełącz na Composer 2.5
  5. Potrzebujesz oszczędności? Użyj GPT-5.6 Luna lub Haiku 4.5 do pracy masowej/równoległej
  6. Kontekst przekracza 200K? Użyj Opus 5, Sonnet 5, dowolnego poziomu GPT-5.6 lub Gemini 3.1 Pro (pamiętaj o progu cenowym Gemini powyżej 200K)
  7. Analiza multimodalna? Gemini 3.1 Pro
  8. Wszystko inne? Zostań przy domyślnym

Poniższe przykłady zakładają 80% niecache’owanego inputu i 20% outputu. To ilustracja arytmetyczna, nie zmierzona średnia zadania; cache, reasoning tokens, tool calls i ceny hosta zmieniają koszt rzeczywisty.

Łączne tokenyOpus 5Sonnet 5*GPT-5.6 SolComposer 2.5
1K~$0.009~$0.0036~$0.010~$0.0009
10K~$0.09~$0.036~$0.10~$0.009
50K~$0.45~$0.18~$0.50~$0.045
100K~$0.90~$0.36~$1.00~$0.09

Kolumna Opus 5 dotyczy także Opus 4.8, wycenianego identycznie. Żądanie Claude Fable 5 kosztuje dokładnie dwukrotność tej kolumny — $10 / $50 za 1M tokenów wobec $5 / $25 — a tryb Fast w Opus 5 kosztuje tyle samo co Fable 5, czyli $10 / $50. * Kolumna Sonnet 5 używa ceny premierowej z lipca 2026.

Cursor rozlicza użycie modeli z puli zawartej w planie według bieżącej stawki wybranego modelu. Grok 4.5 kosztuje na przykład $2/$6 za MTok w trybie standard i $4/$18 w fast. Limity planów i dostępne modele mogą się zmieniać; weryfikuj je w Cursor Settings > Usage oraz na oficjalnej stronie cennika.

Snapshot zweryfikowany 11 lipca 2026. To wyniki premierowe opublikowane przez dostawców modeli; -- oznacza brak bezpośrednio porównywalnej wartości w cytowanej publikacji.

Model i ustawienieSWE-Bench ProDeepSWE 1.1Terminal-Bench 2.1
GPT-5.6 Sol (max)64,6%72,7%88,8%
GPT-5.6 Terra (max)63,4%69,6%87,4%
GPT-5.6 Luna (max)62,7%67,2%84,7%
Grok 4.5 (high)64,7%53,0%83,3%
Claude Sonnet 5 (max)63,2%80,4%

Osobny wykres premierowy Cursora porównał Grok 4.5 z Composer 2.5: 64,7% wobec 54,0% w SWE-Bench Pro, 83,3% wobec 73,0% w Terminal-Bench 2.1 oraz 62,0% wobec 18,0% w DeepSWE 1.0. Pokazuje to dużą różnicę możliwości w tych runach, ale nie oznacza wycofania: Cursor jawnie utrzymuje oba modele. Cursor zaznacza też, że część wyników konkurentów na jego wykresie była self-reported.

Poniższe wyniki Artificial Analysis odczytano 27 lipca 2026. Intelligence Index używa wersji v4.1, a Coding Agent Index v1.1 uśrednia DeepSWE, Terminal-Bench v2 i SWE-Atlas-QnA. Artificial Analysis wspierało Anthropic w ocenie Claude Opus 5 przed premierą, więc traktuj jego wyniki dla Opus 5 jako bliskie dostawcy, nie w pełni niezależne.

Model + mierzony systemIntelligence Index v4.1Coding Agent Index v1.1Koszt na zadanie
Claude Opus 5 max / Claude Code61wspólne 1. miejsce*$2,03
Claude Fable 5 max + fallback / Claude Code6077$2,75
GPT-5.6 Sol max / Codex5980
Claude Opus 4.8 max / Claude Code5673$1,80
GPT-5.6 Terra max / Codex5577
Grok 4.5 high / Grok Build5476
Claude Sonnet 5 max53$1,53
GPT-5.6 Luna max / Codex5175
Composer 2.5 / Cursor CLI52

* Artificial Analysis umieszcza Opus 5 przy xhigh z Claude Code na wspólnym pierwszym miejscu w Coding Agent Index, obok GPT-5.6 Sol z Codex, nie publikując dla niego osobnej wartości indeksu. Opus 5 prowadzi w Intelligence Index z wynikiem 61, minimalnie przed Fable 5 z 60, i ustanawia najwyższe zmierzone dotąd wyniki GDPval-AA v2 (1 861 Elo wobec ~1 747 dla Fable 5) oraz AA-Briefcase (1 720 wobec ~1 574).

Kolumna kosztu na zadanie jest najważniejsza dla routingu: Opus 5 osiąga najwyższy wynik Intelligence Index przy koszcie na zadanie o około 26% niższym niż Fable 5. Opus 4.8 jest jeszcze tańszy w przeliczeniu na zadanie, ale wypada o pięć punktów słabiej.

Bieżący Composer 2.5 w v1.1 ma około 16% DeepSWE, 67% Terminal-Bench v2 i 72% SWE-Atlas-QnA, z tym samym indeksem 52 dla Standard i Fast. Standard kosztował średnio około $0,08 i 9,7 minuty na zadanie, a Fast około $0,55 i 6,8 minuty. Często cytowany wynik Composer 62 pochodził z majowego indeksu v1.0, zanim DeepSWE zastąpił SWE-Bench-Pro-Hard-AA, i nie jest bezpośrednio porównywalny z wartościami v1.1.

Grok 4.5 łączy mocny niezależny wynik kodowania z relatywnie niskim zmierzonym kosztem, ale AA-Omniscience daje ważne ostrzeżenie przed nadmiernym uogólnianiem: Artificial Analysis raportuje 52% trafności i 54% hallucination rate. Przy pracy faktograficznej zachowaj pętlę weryfikacji.

  1. Zidentyfikuj swoje główne narzędzie: Cursor, Claude Code lub Codex

  2. Sprawdź wybrany/default model: Zależny od konta/providera w Claude Code (defaulty zarządzanych chmur są inne), Terra/Sol według zadania Codex albo Composer 2.5/Grok 4.5 według opóźnienia i złożoności Cursor

  3. Oceń złożoność zadania: Proste zadania nie potrzebują najdroższego modelu

  4. Sprawdź wymagania kontekstowe: Obciążenia przekraczające 200K tokenów potrzebują Opus 5, Sonnet 5, poziomu GPT-5.6 lub innego zweryfikowanego modelu z kontekstem 1M

  5. Rozważ budżet: Śledź z /cost (Claude Code), Settings > Usage (Cursor) lub pulpit Codex

  6. Dostosuj według potrzeb: Przełączaj modele na podstawie zadania, nie przyzwyczajenia

  1. Domyślnie najlepszy model dla zadań, które się liczą — architektura, przegląd bezpieczeństwa, złożone debugowanie
  2. Obniż poziom dla rutynowej pracy — proste poprawki, boilerplate, formatowanie nie potrzebują tieru Opus
  3. Używaj modeli szybkości do iteracji — Composer 2.5 w Cursor dla szybkich cykli próbnych i błędów
  4. Kieruj pracę masową do Haiku 4.5 — subagenci, codemody i skany rozproszone kosztują ułamek Opus
  5. Monitoruj koszty co tydzień — Śledź które modele zapewniają najlepszy ROI dla twojego przepływu pracy
  6. Bądź na bieżąco — Możliwości modeli i ceny zmieniają się często. Sprawdź stronę Aktualizacje