Przejdź do głównej zawartości

Porównanie modeli AI dla agentów kodujących

Na dzień 2026-09-26 Claude Opus 5.5 jest domyślnym modelem Claude Code od v2.1.280 (kanał latest), a GPT-6 Astra domyślnym modelem Codex. Zasada: zacznij od modelu domyślnego narzędzia, przed zmianą modelu podnieś poziom rozumowania (effort), a model zmieniaj, gdy zysk pokażą ewaluacje: Claude Fable 5.1 do najdłuższych zadań, Sonnet 5, GPT-6 Sol, GPT-6 Luna lub Haiku 4.5, gdy liczy się koszt.

We wrześniu 2026 Anthropic wydał Claude Fable 5.1 i Opus 5.5, OpenAI wydał GPT-6 Astra, Sol i Luna, Google wydał Gemini 3.8 Flash, a według MarkTechPost SpaceXAI wydał Grok 4.7. Lista w selektorze modeli zmieniła się bez twojego udziału, wykres z premiery pokazuje, że twój obecny model zostaje w tyle, a ktoś w zespole chce przejść na nowy jeszcze dziś. Ta strona jest dla programisty, który wybiera model do sesji, oraz dla tech leada lub CTO, który ustala model domyślny i budżet zespołu. To także jedyna strona w serwisie z wersjami i cenami modeli; wszystkie inne linkują tutaj.

  • Rekomendację modelu dla każdego rodzaju pracy w Claude Code, Codex i Cursorze.
  • Aktualne ceny, identyfikatory modeli i limity kontekstu, sprawdzone 2026-09-26.
  • Dokładne polecenia i ustawienia do zmiany modelu i poziomu rozumowania oraz do ich przypięcia.
  • Dwa prompty do skopiowania: jeden znajduje przestarzałe ID modeli w repozytorium, drugi porównuje poziomy rozumowania.
  • Awarie, które pojawiają się po zmianie modelu, wraz z naprawą każdej z nich.

Anthropic radzi wprost: „If you’re unsure which model to use, start with Claude Opus 5.5 for most workloads”. Katalog modeli Codex daje GPT-6 Astra priorytet pierwszy. Tabela odzwierciedla ustawienia domyślne obu dostawców.

ZadanieClaude CodeCodexDlaczego
Trudna praca agentowa (przypadek domyślny)Claude Opus 5.5 na domyślnym medium, podniesiony do high lub xhigh, gdy praca nie wychodziGPT-6 Astra (domyślny poziom rozumowania low)Model domyślny każdego narzędzia; Anthropic: „start with”; priorytet 1 w katalogu Codex
Codzienna praca, gdy liczy się kosztClaude Sonnet 5GPT-6 Sol („Workhorse model for coding and everyday work”)Połowa ceny flagowca lub mniej
Tanio i masowo: klasyfikacja, ekstrakcja, wiele subagentówClaude Haiku 4.5GPT-6 Luna („Fast and affordable model for easier tasks”)Najniższa cena za token w danej rodzinie
Najdłuższy horyzont, najtrudniejsze rozumowanieClaude Fable 5.1, wybierany ręcznie (/model fable)GPT-6 Astra na max lub ultraAnthropic: Fable 5.1 wtedy, gdy „your evals on Claude Opus 5.5 at higher effort still fall short”
Własny hosting lub sieć odcięta od internetuZobacz modele open-weight dla agentów kodującychTo samo, przez codex --ossLicencja i obsługa w narzędziu różnią się między modelami

Cursor. Grok 4.7 od SpaceXAI był dostępny w Cursorze od dnia premiery, według MarkTechPost (2026-09-21). Modelu domyślnego Cursora, puli modeli ani cen po stronie Cursora nie dało się zweryfikować 2026-09-26, więc sprawdź selektor modeli i cennik Cursora, zanim na nich oprzesz decyzję.

Ceny w USD za milion tokenów (MTok), wejście / wyjście, poziom standardowy, sprawdzone 2026-09-26 na cenniku każdego dostawcy, chyba że wiersz podaje inne źródło.

ModelID w APICena wej. / wyj.Kontekst / maks. wyjścieStatus
Claude Opus 5.5claude-opus-5-54 / 20 USD1M / 128KObecny model domyślny, premiera 2026-09-22
Claude Fable 5.1claude-fable-5-110 / 50 USD1M / 128KAktualny; nigdy domyślny
Claude Sonnet 5claude-sonnet-52 / 10 USD, na stałe1M / 128KAktualny; alias sonnet
Claude Haiku 4.5claude-haiku-4-51 / 5 USD200K / 64KAktualny Haiku; bez parametru effort
Claude Opus 5claude-opus-55 / 25 USD1M / 128KStarszy (legacy), nadal dostępny
Claude Opus 4.8claude-opus-4-85 / 25 USD—Starszy (legacy), nadal dostępny

Przetwarzanie wsadowe (batch) obniża każdą stawkę o połowę. Odczyt z cache kosztuje 0,1× ceny wejścia, z wyjątkiem 0,05× dla Opus 5.5 (0,20 USD) i 0,025× dla Fable 5.1 (0,25 USD). Tryb fast dla Opus 5.5 kosztuje 8 / 40 USD i jest dostępny jako research preview tylko w Claude API. Modele Claude 4.7 i nowsze mają tokenizer, który dla tego samego tekstu daje około 30% więcej tokenów, więc porównuj koszt zadania, a nie cenę tokenu. ID w Bedrock mają prefiks anthropic., na przykład anthropic.claude-opus-5-5.

Ceny subskrypcji narzędzi (Claude Pro i Max, plany ChatGPT, plany Cursora) są w porównaniu cen narzędzi, nie tutaj.

Zadanie, które czyta 200K tokenów wejścia bez cache i zapisuje 20K tokenów wyjścia, kosztuje według cen katalogowych, przed uwzględnieniem cache:

ModelKoszt zadania
Claude Fable 5.1 · GPT-6 Astra3,00 USD
Claude Opus 5.51,20 USD
Claude Sonnet 5 · GPT-6 Sol0,60 USD
Claude Haiku 4.50,30 USD
GPT-6 Luna0,03 USD

Ten sam tekst daje u różnych dostawców różną liczbę tokenów, więc równe wiersze nie oznaczają równego kosztu tego samego zadania.

To arytmetyka, a nie pomiar. Agent w każdej turze czyta kontekst od nowa, więc cache zmienia realny koszt bardziej niż cena katalogowa, a tańszy model, który potrzebuje trzech podejść, kosztuje więcej niż droższy, który potrzebuje jednego. Dokumentacja kosztów Claude Code od Anthropic podaje typowy wydatek w firmach: „around $13 per developer per active day and $150-250 per developer per month” (sprawdzone 2026-09-26). Zanim ułożysz budżet, zmierz koszt zaakceptowanego zadania na własnej pracy.

Jak zmienić model i poziom rozumowania w każdym narzędziu?

Dział zatytułowany „Jak zmienić model i poziom rozumowania w każdym narzędziu?”

Od wersji v2.1.280 w kanale wydań latest Opus 5.5 jest modelem domyślnym na każdym płatnym planie, w Anthropic API, Claude Platform on AWS, Bedrock i Google Cloud Agent Platform. Kanał stable (v2.1.274 na 2026-09-26) nie doszedł jeszcze do v2.1.280: tam Pro i Team Standard domyślnie dostają Sonnet 5, a pozostałe plany Opus 5. Microsoft Foundry domyślnie używa Sonnet 4.5 (Anthropic zobowiązuje się wycofać Sonnet 4.5 „nie wcześniej niż” 2026-09-29, więc zanim oprzesz się na tym ustawieniu, sprawdź stronę wycofywania modeli). Opus 5.5 działa domyślnie na medium, Fable 5.1 i Sonnet 5 na high, a Haiku 4.5 nie ma ustawienia effort.

Okno terminala
# Terminal: sesja na wybranym modelu i poziomie rozumowania
claude --model opus --effort high
# Modele zapasowe po kolei, gdy główny jest przeciążony
claude --model opus --fallback-model sonnet

W trakcie sesji /model zmienia model, a /effort ustawia low, medium, high, xhigh lub max, a /effort ultracode uruchamia xhigh z automatyczną orkiestracją przepływów pracy. Aliasy to opus (Opus 5.5), sonnet (Sonnet 5), fable (Fable 5.1) i opusplan (Opus w trybie planowania, Sonnet przy wykonaniu). Aby przypiąć modele dla zespołu, użyj ustawień availableModels, enforceAvailableModels i maxEffortLevel w ustawieniach zarządzanych (managed settings).

Zmiana modelu to zmiana systemu produkcyjnego, więc wymaga takich samych dowodów jak zmiana kodu. Nie oceniasz jej, czytając diffy agenta; oceniasz ją po tym, co przechodzi twoje bramki jakości.

  1. Przypnij obecną konfigurację. Zapisz dokładne ID modelu (claude-opus-5-5, gpt-6-astra), poziom rozumowania i wersję narzędzia, żeby przesunięcie aliasu w przyszłości nie zmieniło zachowania po cichu.

  2. Najpierw poziom rozumowania, potem model. Uruchom te same zadania na następnym poziomie rozumowania. Dokumentacja Claude Code mówi, że „Opus 5.5 at medium matches or exceeds Opus 5 at high” — i tego wzorca się spodziewaj: poziom rozumowania to tańsza dźwignia.

  3. Uruchom własny zestaw ewaluacyjny. Weź 20–40 zadań z połączonych pull requestów, każde z poleceniem testowym, które rozstrzyga o wyniku. Budowę takiego zestawu opisuje strona o benchmarkach.

  4. Porównaj trzy liczby. Odsetek zaakceptowanych zadań (testy, sprawdzanie typów i lint kończą się sukcesem, a zmiana przechodzi review), koszt zaakceptowanego zadania i czas zadania.

  5. Wdrażaj zmianę po jednym przepływie pracy agenta (pętli) naraz, z planem wycofania. Tech lead odpowiedzialny za managed settings zatwierdza zmianę, przestawia przypięty model w jednym przepływie naraz i przywraca poprzedni, jeśli spadnie odsetek zaakceptowanych zadań. Pełną 48-godzinną procedurę opisuje plan oceny nowego modelu.

Zastąp LEVEL w nazwie gałęzi wartością medium, high lub xhigh, MERGED_SHA commitem scalającym prawdziwego pull requesta, ISSUE_TEXT oryginalną treścią zgłoszenia, a oba polecenia swoimi poleceniami testów i sprawdzania typów. Uruchom prompt w trzech nowych sesjach, po jednej na poziom rozumowania: /effort medium, high i xhigh w Claude Code albo -c model_reasoning_effort="medium" i kolejne w Codex. Każdą sesję uruchom we własnym worktree (claude --worktree lub codex --worktree), żeby przebiegi nie widziały nawzajem swoich zmian. W Claude Code odczytaj koszt każdego przebiegu w /usage; w Codex /status pokazuje szacunkowe kredyty lub koszt w uprawnionych przestrzeniach roboczych (0.148.0+), a /usage pokazuje użycie konta (0.156.0+); poza tym porównaj czas i wynik testów. Potem porównaj trzy raporty.

Na oficjalnej tablicy wyników Terminal-Bench 4.0 (odczyt 2026-09-26) Claude Fable 5.1 (poziom max) uruchomiony w Claude Code ma 57,9% ± 3,8, Claude Opus 5 (max) w Claude Code 51,8% ± 3,4, a GPT-5.6 Sol (max) w Codex 37,3% ± 3,8. Wszystkie te wpisy to przebiegi na poziomie max, więc żaden z nich nie pokazuje, jak model radzi sobie na domyślnym poziomie rozumowania. Ani Claude Opus 5.5, ani GPT-6 Astra nie miały tego dnia wpisu na tablicy. Anthropic podaje 66,4% dla Opus 5.5 na poziomie xhigh w tabeli premierowej z 2026-09-22 i sam ostrzega: „at these levels of capability we’ve found that benchmark margins have become a less reliable guide to real-world differences. In our own use, the gap between Opus 5.5 and Claude Fable 5.1 is narrower than these scores suggest”.

Każdy wynik mierzy model w jednym konkretnym narzędziu agentowym na cudzych zadaniach. Zanim zacytujesz którykolwiek, przeczytaj, jak czytać benchmarki agentów kodujących, a decyzję pozostaw własnemu zestawowi ewaluacyjnemu.

Najczęstsze pytania

Który model jest domyślny w Claude Code, a który w Codex?

Claude Opus 5.5 jest domyślnym modelem Claude Code na każdym płatnym planie i w Anthropic API od wersji v2.1.280 w kanale latest; kanał stable wciąż daje starsze ustawienia. GPT-6 Astra jest domyślnym modelem Codex od CLI 0.153.4 (2026-09-04).

Ile kosztują obecne modele Claude za milion tokenów?

Claude Opus 5.5 kosztuje 4 / 20 USD, Claude Fable 5.1 10 / 50 USD, Claude Sonnet 5 2 / 10 USD (zapowiadana podwyżka do 3 / 15 USD została odwołana), a Claude Haiku 4.5 1 / 5 USD, wejście / wyjście, stan na 2026-09-26.

Podnieść effort czy przejść na większy model?

Najpierw podnieś effort. Opus 5.5 działa w Claude Code domyślnie na poziomie medium, a GPT-6 Astra w Codex na low; przejdź na high lub xhigh przez /effort albo model_reasoning_effort, a model zmieniaj dopiero wtedy, gdy zysk pokażą ewaluacje na własnych zadaniach.

Kiedy Claude Fable 5.1 jest wart swojej ceny?

Przy zadaniach o najdłuższym horyzoncie i najtrudniejszym rozumowaniu, wybierany ręcznie przez /model fable. Nigdy nie jest modelem domyślnym, kosztuje 10 / 50 USD za milion tokenów i zależnie od planu może być rozliczany z kredytów.