Porównanie modeli AI dla agentów kodujących
Na dzień 2026-09-26 Claude Opus 5.5 jest domyślnym modelem Claude Code od v2.1.280 (kanał latest), a GPT-6 Astra domyślnym modelem Codex. Zasada: zacznij od modelu domyślnego narzędzia, przed zmianą modelu podnieś poziom rozumowania (effort), a model zmieniaj, gdy zysk pokażą ewaluacje: Claude Fable 5.1 do najdłuższych zadań, Sonnet 5, GPT-6 Sol, GPT-6 Luna lub Haiku 4.5, gdy liczy się koszt.
We wrześniu 2026 Anthropic wydał Claude Fable 5.1 i Opus 5.5, OpenAI wydał GPT-6 Astra, Sol i Luna, Google wydał Gemini 3.8 Flash, a według MarkTechPost SpaceXAI wydał Grok 4.7. Lista w selektorze modeli zmieniła się bez twojego udziału, wykres z premiery pokazuje, że twój obecny model zostaje w tyle, a ktoś w zespole chce przejść na nowy jeszcze dziś. Ta strona jest dla programisty, który wybiera model do sesji, oraz dla tech leada lub CTO, który ustala model domyślny i budżet zespołu. To także jedyna strona w serwisie z wersjami i cenami modeli; wszystkie inne linkują tutaj.
Co daje ci ta strona
Dział zatytułowany „Co daje ci ta strona”- Rekomendację modelu dla każdego rodzaju pracy w Claude Code, Codex i Cursorze.
- Aktualne ceny, identyfikatory modeli i limity kontekstu, sprawdzone 2026-09-26.
- Dokładne polecenia i ustawienia do zmiany modelu i poziomu rozumowania oraz do ich przypięcia.
- Dwa prompty do skopiowania: jeden znajduje przestarzałe ID modeli w repozytorium, drugi porównuje poziomy rozumowania.
- Awarie, które pojawiają się po zmianie modelu, wraz z naprawą każdej z nich.
Jakiego modelu użyć do danego zadania?
Dział zatytułowany „Jakiego modelu użyć do danego zadania?”Anthropic radzi wprost: „If you’re unsure which model to use, start with Claude Opus 5.5 for most workloads”. Katalog modeli Codex daje GPT-6 Astra priorytet pierwszy. Tabela odzwierciedla ustawienia domyślne obu dostawców.
| Zadanie | Claude Code | Codex | Dlaczego |
|---|---|---|---|
| Trudna praca agentowa (przypadek domyślny) | Claude Opus 5.5 na domyślnym medium, podniesiony do high lub xhigh, gdy praca nie wychodzi | GPT-6 Astra (domyślny poziom rozumowania low) | Model domyślny każdego narzędzia; Anthropic: „start with”; priorytet 1 w katalogu Codex |
| Codzienna praca, gdy liczy się koszt | Claude Sonnet 5 | GPT-6 Sol („Workhorse model for coding and everyday work”) | Połowa ceny flagowca lub mniej |
| Tanio i masowo: klasyfikacja, ekstrakcja, wiele subagentów | Claude Haiku 4.5 | GPT-6 Luna („Fast and affordable model for easier tasks”) | Najniższa cena za token w danej rodzinie |
| Najdłuższy horyzont, najtrudniejsze rozumowanie | Claude Fable 5.1, wybierany ręcznie (/model fable) | GPT-6 Astra na max lub ultra | Anthropic: Fable 5.1 wtedy, gdy „your evals on Claude Opus 5.5 at higher effort still fall short” |
| Własny hosting lub sieć odcięta od internetu | Zobacz modele open-weight dla agentów kodujących | To samo, przez codex --oss | Licencja i obsługa w narzędziu różnią się między modelami |
Cursor. Grok 4.7 od SpaceXAI był dostępny w Cursorze od dnia premiery, według MarkTechPost (2026-09-21). Modelu domyślnego Cursora, puli modeli ani cen po stronie Cursora nie dało się zweryfikować 2026-09-26, więc sprawdź selektor modeli i cennik Cursora, zanim na nich oprzesz decyzję.
Ile kosztują obecne modele?
Dział zatytułowany „Ile kosztują obecne modele?”Ceny w USD za milion tokenów (MTok), wejście / wyjście, poziom standardowy, sprawdzone 2026-09-26 na cenniku każdego dostawcy, chyba że wiersz podaje inne źródło.
| Model | ID w API | Cena wej. / wyj. | Kontekst / maks. wyjście | Status |
|---|---|---|---|---|
| Claude Opus 5.5 | claude-opus-5-5 | 4 / 20 USD | 1M / 128K | Obecny model domyślny, premiera 2026-09-22 |
| Claude Fable 5.1 | claude-fable-5-1 | 10 / 50 USD | 1M / 128K | Aktualny; nigdy domyślny |
| Claude Sonnet 5 | claude-sonnet-5 | 2 / 10 USD, na stałe | 1M / 128K | Aktualny; alias sonnet |
| Claude Haiku 4.5 | claude-haiku-4-5 | 1 / 5 USD | 200K / 64K | Aktualny Haiku; bez parametru effort |
| Claude Opus 5 | claude-opus-5 | 5 / 25 USD | 1M / 128K | Starszy (legacy), nadal dostępny |
| Claude Opus 4.8 | claude-opus-4-8 | 5 / 25 USD | — | Starszy (legacy), nadal dostępny |
Przetwarzanie wsadowe (batch) obniża każdą stawkę o połowę. Odczyt z cache kosztuje 0,1× ceny wejścia, z wyjątkiem 0,05× dla Opus 5.5 (0,20 USD) i 0,025× dla Fable 5.1 (0,25 USD). Tryb fast dla Opus 5.5 kosztuje 8 / 40 USD i jest dostępny jako research preview tylko w Claude API. Modele Claude 4.7 i nowsze mają tokenizer, który dla tego samego tekstu daje około 30% więcej tokenów, więc porównuj koszt zadania, a nie cenę tokenu. ID w Bedrock mają prefiks anthropic., na przykład anthropic.claude-opus-5-5.
| Model | ID w API | Cena wej. / wyj. | Kontekst w Codex | Status |
|---|---|---|---|---|
| GPT-6 Astra | gpt-6-astra | 10 / 50 USD | domyślnie 272K, do 872K | Domyślny w Codex od 2026-09-04 |
| GPT-6 Sol | gpt-6-sol | 2 / 10 USD | domyślnie 272K, do 872K | Aktualny, premiera 2026-09-22 |
| GPT-6 Luna | gpt-6-luna | 0,10 / 0,50 USD | domyślnie 272K, do 872K | Aktualny, premiera 2026-09-22 |
| GPT-5.6 Sol, Terra, Luna | gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna | niezweryfikowana | domyślnie 272K, do 872K | Starsze, nadal do wyboru w Codex |
Cennika OpenAI nie dało się odczytać 2026-09-26. Ceny katalogowe GPT-6 pochodzą z doniesień prasowych (CloudZero i Evolink dla Astry; The New Stack i VentureBeat dla Sol i Luny), a opublikowane rozliczenia GitHub Copilot stosują te same stawki. Kolumna kontekstu pochodzi z katalogu modeli Codex 0.157.1 (codex debug models --bundled). GPT-6 Terra nie istnieje, a GPT-6 Pro to nazwa produktu w ChatGPT, nie ID modelu w API.
| Model | Cena wej. / wyj. | Kontekst | Status |
|---|---|---|---|
| Gemini 3.8 Flash | 0,75 / 3,75 USD do 2026-12-31, potem 1,50 / 7,50 USD | niezweryfikowany | Aktualny Flash, premiera 2026-09-02 (źródło wtórne: The Register) |
| Gemini 3.1 Pro Preview | 2 / 12 USD do 200K tokenów wejścia, 4 / 18 USD powyżej | niezweryfikowany | Google nadal oznacza go jako preview |
| Grok 4.7 | 2 / 6 USD do 200K, 4 / 12 USD powyżej (stawka rozliczeniowa GitHub Copilot) | 500K (źródło wtórne: MarkTechPost) | Najnowszy Grok, premiera 2026-09-21 (źródło wtórne: MarkTechPost) |
Ceny Google to ceny globalnego endpointu z cennika Vertex AI; endpointy regionalne są o 10% droższe. Cen katalogowych Groka nie dało się zweryfikować na stronie SpaceXAI, więc wiersz podaje stawkę, którą nalicza GitHub Copilot.
Ceny subskrypcji narzędzi (Claude Pro i Max, plany ChatGPT, plany Cursora) są w porównaniu cen narzędzi, nie tutaj.
Ile kosztuje jedno zadanie na każdym modelu?
Dział zatytułowany „Ile kosztuje jedno zadanie na każdym modelu?”Zadanie, które czyta 200K tokenów wejścia bez cache i zapisuje 20K tokenów wyjścia, kosztuje według cen katalogowych, przed uwzględnieniem cache:
| Model | Koszt zadania |
|---|---|
| Claude Fable 5.1 · GPT-6 Astra | 3,00 USD |
| Claude Opus 5.5 | 1,20 USD |
| Claude Sonnet 5 · GPT-6 Sol | 0,60 USD |
| Claude Haiku 4.5 | 0,30 USD |
| GPT-6 Luna | 0,03 USD |
Ten sam tekst daje u różnych dostawców różną liczbę tokenów, więc równe wiersze nie oznaczają równego kosztu tego samego zadania.
To arytmetyka, a nie pomiar. Agent w każdej turze czyta kontekst od nowa, więc cache zmienia realny koszt bardziej niż cena katalogowa, a tańszy model, który potrzebuje trzech podejść, kosztuje więcej niż droższy, który potrzebuje jednego. Dokumentacja kosztów Claude Code od Anthropic podaje typowy wydatek w firmach: „around $13 per developer per active day and $150-250 per developer per month” (sprawdzone 2026-09-26). Zanim ułożysz budżet, zmierz koszt zaakceptowanego zadania na własnej pracy.
Jak zmienić model i poziom rozumowania w każdym narzędziu?
Dział zatytułowany „Jak zmienić model i poziom rozumowania w każdym narzędziu?”Od wersji v2.1.280 w kanale wydań latest Opus 5.5 jest modelem domyślnym na każdym płatnym planie, w Anthropic API, Claude Platform on AWS, Bedrock i Google Cloud Agent Platform. Kanał stable (v2.1.274 na 2026-09-26) nie doszedł jeszcze do v2.1.280: tam Pro i Team Standard domyślnie dostają Sonnet 5, a pozostałe plany Opus 5. Microsoft Foundry domyślnie używa Sonnet 4.5 (Anthropic zobowiązuje się wycofać Sonnet 4.5 „nie wcześniej niż” 2026-09-29, więc zanim oprzesz się na tym ustawieniu, sprawdź stronę wycofywania modeli). Opus 5.5 działa domyślnie na medium, Fable 5.1 i Sonnet 5 na high, a Haiku 4.5 nie ma ustawienia effort.
# Terminal: sesja na wybranym modelu i poziomie rozumowaniaclaude --model opus --effort high
# Modele zapasowe po kolei, gdy główny jest przeciążonyclaude --model opus --fallback-model sonnetW trakcie sesji /model zmienia model, a /effort ustawia low, medium, high, xhigh lub max, a /effort ultracode uruchamia xhigh z automatyczną orkiestracją przepływów pracy. Aliasy to opus (Opus 5.5), sonnet (Sonnet 5), fable (Fable 5.1) i opusplan (Opus w trybie planowania, Sonnet przy wykonaniu). Aby przypiąć modele dla zespołu, użyj ustawień availableModels, enforceAvailableModels i maxEffortLevel w ustawieniach zarządzanych (managed settings).
GPT-6 Astra jest domyślnym modelem od CLI 0.153.4 (2026-09-04), z domyślnym poziomem rozumowania low. Serwer może nadpisać model domyślny dla zalogowanych kont, więc przypnij model, jeśli potrzebujesz stałego. GPT-6 Sol i Luna domyślnie działają na medium. Codex dodaje poziom ultra („Maximum reasoning with automatic task delegation”) dla Astry i Sol; Luna go nie ma.
# Terminal: jedna sesja na GPT-6 Sol z wysokim poziomem rozumowaniacodex -m gpt-6-sol -c model_reasoning_effort="high"
# Lista modeli znanych tej wersji Codexcodex debug models --bundled# ~/.codex/config.toml: przypięty model domyślny zespołumodel = "gpt-6-astra"model_reasoning_effort = "medium"model_context_window = 400000 # więcej niż domyślne 272K, maksymalnie 872KPowyżej 272K tokenów wejścia zapytania są rozliczane według wyższej stawki (GitHub Copilot nalicza tam za GPT-6 Astra 20 / 75 USD zamiast 10 / 50 USD). Podnoś okno tylko w sesjach, które tego potrzebują, na przykład przez -c model_context_window=400000 w jednym uruchomieniu.
Model wybierasz w selektorze modeli dla każdego czatu lub agenta. Listy modeli Cursora, ustawień domyślnych i stawek za model nie dało się zweryfikować 2026-09-26, więc odczytaj je w ustawieniach i cenniku Cursora, a nie z tego serwisu. Zasady dotyczące poziomu rozumowania i ewaluacji opisane niżej obowiązują bez zmian.
Jak udowodnić, że zmiana modelu się opłaciła?
Dział zatytułowany „Jak udowodnić, że zmiana modelu się opłaciła?”Zmiana modelu to zmiana systemu produkcyjnego, więc wymaga takich samych dowodów jak zmiana kodu. Nie oceniasz jej, czytając diffy agenta; oceniasz ją po tym, co przechodzi twoje bramki jakości.
-
Przypnij obecną konfigurację. Zapisz dokładne ID modelu (
claude-opus-5-5,gpt-6-astra), poziom rozumowania i wersję narzędzia, żeby przesunięcie aliasu w przyszłości nie zmieniło zachowania po cichu. -
Najpierw poziom rozumowania, potem model. Uruchom te same zadania na następnym poziomie rozumowania. Dokumentacja Claude Code mówi, że „Opus 5.5 at
mediummatches or exceeds Opus 5 athigh” — i tego wzorca się spodziewaj: poziom rozumowania to tańsza dźwignia. -
Uruchom własny zestaw ewaluacyjny. Weź 20–40 zadań z połączonych pull requestów, każde z poleceniem testowym, które rozstrzyga o wyniku. Budowę takiego zestawu opisuje strona o benchmarkach.
-
Porównaj trzy liczby. Odsetek zaakceptowanych zadań (testy, sprawdzanie typów i lint kończą się sukcesem, a zmiana przechodzi review), koszt zaakceptowanego zadania i czas zadania.
-
Wdrażaj zmianę po jednym przepływie pracy agenta (pętli) naraz, z planem wycofania. Tech lead odpowiedzialny za managed settings zatwierdza zmianę, przestawia przypięty model w jednym przepływie naraz i przywraca poprzedni, jeśli spadnie odsetek zaakceptowanych zadań. Pełną 48-godzinną procedurę opisuje plan oceny nowego modelu.
Zastąp LEVEL w nazwie gałęzi wartością medium, high lub xhigh, MERGED_SHA commitem scalającym prawdziwego pull requesta, ISSUE_TEXT oryginalną treścią zgłoszenia, a oba polecenia swoimi poleceniami testów i sprawdzania typów. Uruchom prompt w trzech nowych sesjach, po jednej na poziom rozumowania: /effort medium, high i xhigh w Claude Code albo -c model_reasoning_effort="medium" i kolejne w Codex. Każdą sesję uruchom we własnym worktree (claude --worktree lub codex --worktree), żeby przebiegi nie widziały nawzajem swoich zmian. W Claude Code odczytaj koszt każdego przebiegu w /usage; w Codex /status pokazuje szacunkowe kredyty lub koszt w uprawnionych przestrzeniach roboczych (0.148.0+), a /usage pokazuje użycie konta (0.156.0+); poza tym porównaj czas i wynik testów. Potem porównaj trzy raporty.
Co benchmarki mówią o tych modelach?
Dział zatytułowany „Co benchmarki mówią o tych modelach?”Na oficjalnej tablicy wyników Terminal-Bench 4.0 (odczyt 2026-09-26) Claude Fable 5.1 (poziom max) uruchomiony w Claude Code ma 57,9% ± 3,8, Claude Opus 5 (max) w Claude Code 51,8% ± 3,4, a GPT-5.6 Sol (max) w Codex 37,3% ± 3,8. Wszystkie te wpisy to przebiegi na poziomie max, więc żaden z nich nie pokazuje, jak model radzi sobie na domyślnym poziomie rozumowania. Ani Claude Opus 5.5, ani GPT-6 Astra nie miały tego dnia wpisu na tablicy. Anthropic podaje 66,4% dla Opus 5.5 na poziomie xhigh w tabeli premierowej z 2026-09-22 i sam ostrzega: „at these levels of capability we’ve found that benchmark margins have become a less reliable guide to real-world differences. In our own use, the gap between Opus 5.5 and Claude Fable 5.1 is narrower than these scores suggest”.
Każdy wynik mierzy model w jednym konkretnym narzędziu agentowym na cudzych zadaniach. Zanim zacytujesz którykolwiek, przeczytaj, jak czytać benchmarki agentów kodujących, a decyzję pozostaw własnemu zestawowi ewaluacyjnemu.
Co psuje się po zmianie modelu?
Dział zatytułowany „Co psuje się po zmianie modelu?”Dokąd dalej w temacie wyboru modelu
Dział zatytułowany „Dokąd dalej w temacie wyboru modelu”- Jak czytać benchmarki agentów kodujących i budować własne ewaluacje: zestaw ewaluacyjny, który podejmuje decyzję.
- Nowy model na rynku: plan oceny w 48 godzin: procedura wdrożenia i wycofania.
- Modele open-weight i hostowane samodzielnie dla agentów kodujących: GLM, Qwen, Kimi, DeepSeek i Mistral.
- Routing modeli oparty na dowodach, nie na marce: kierowanie różnych zadań do różnych modeli.
- Gdzie działa model: bramki, chmury, rezydencja danych i zero retencji: dla CTO wybierającego sposób hostowania.
- Kontrola kosztów w Claude Code i zarządzanie kosztami w Codex: jak zmieścić się w budżecie.
Źródła sprawdzone 2026-09-26
Dział zatytułowany „Źródła sprawdzone 2026-09-26”- Anthropic: przegląd modeli, cennik, wycofywanie modeli, ogłoszenie Claude Opus 5.5, konfiguracja modelu w Claude Code i koszty Claude Code.
- OpenAI: wydanie Codex 0.153.4, wydanie Codex 0.156.1, lokalny katalog
codex debug models --bundled(0.157.1) i tabela cen modeli GitHub Copilot. - Google: cennik generatywnej AI w Vertex AI.
- SpaceXAI: MarkTechPost o Groku 4.7 (źródło wtórne).
- Benchmarki: dane tablicy wyników Terminal-Bench 4.0.
Najczęstsze pytania
Który model jest domyślny w Claude Code, a który w Codex?
Claude Opus 5.5 jest domyślnym modelem Claude Code na każdym płatnym planie i w Anthropic API od wersji v2.1.280 w kanale latest; kanał stable wciąż daje starsze ustawienia. GPT-6 Astra jest domyślnym modelem Codex od CLI 0.153.4 (2026-09-04).
Ile kosztują obecne modele Claude za milion tokenów?
Claude Opus 5.5 kosztuje 4 / 20 USD, Claude Fable 5.1 10 / 50 USD, Claude Sonnet 5 2 / 10 USD (zapowiadana podwyżka do 3 / 15 USD została odwołana), a Claude Haiku 4.5 1 / 5 USD, wejście / wyjście, stan na 2026-09-26.
Podnieść effort czy przejść na większy model?
Najpierw podnieś effort. Opus 5.5 działa w Claude Code domyślnie na poziomie medium, a GPT-6 Astra w Codex na low; przejdź na high lub xhigh przez /effort albo model_reasoning_effort, a model zmieniaj dopiero wtedy, gdy zysk pokażą ewaluacje na własnych zadaniach.
Kiedy Claude Fable 5.1 jest wart swojej ceny?
Przy zadaniach o najdłuższym horyzoncie i najtrudniejszym rozumowaniu, wybierany ręcznie przez /model fable. Nigdy nie jest modelem domyślnym, kosztuje 10 / 50 USD za milion tokenów i zależnie od planu może być rozliczany z kredytów.