Krajobraz rozwoju AI zmienia się co tydzień. Pojawiają się nowe modele, zmieniają się ceny, a funkcje lądują we wszystkich trzech narzędziach. Ta strona śledzi aktualizacje, które mają znaczenie, dzięki czemu możesz pozostać na bieżąco bez śledzenia każdego changelogu.
Lipiec ustawił nowy baseline całego stosu: Anthropic zamknął miesiąc modelem Claude Opus 5, OpenAI wydał rodzinę GPT-5.6 i włączył Codex do desktopowego ChatGPT, Cursor wydał 3.11 oraz Grok 4.5, a Claude Code dodał Sonnet 5, a potem Opus 5 do routingu modeli zależnego od konta/providera i utwardził runtime stale działających agentów w tle.
Claude Opus 524 lipca: nowy domyślny Opus w cenie Opus 4.8 ($5/$25), o połowę taniej niż Fable 5. Prowadzi w Artificial Analysis Intelligence Index, granica wiedzy z maja 2026, wymaga Claude Code v2.1.219+. Myślenie jest teraz domyślnie włączone, a jego wyłączenie działa najwyżej przy wysiłku high.
GPT-5.6 Sol, Terra i Luna9 lipca: Sol jest modelem flagowym, Terra równoważy możliwości i koszt, a Luna celuje w pracę masową. Wszystkie obsługują max reasoning; API dodaje persisted reasoning, explicit caching, Programmatic Tool Calling i beta multi-agent.
Codex dołącza do ChatGPT desktop + CLI 0.144.19 lipca: Codex jest częścią aplikacji desktopowej ChatGPT z edycją inline, przeglądem PR i projektami multi-repo. CLI 0.143–0.144 dodaje domyślne remote plugins, GPT-5.6 na Bedrock, tryb zatwierdzania writes i interaktywny auth MCP.
Cursor 3.11 + Grok 4.58–10 lipca: wspólnie trenowany Grok 4.5 trafia do desktop, web, iOS, CLI i SDK, nie zastępując mniejszego Composer 2.5; Cursor 3.11 dodaje trwałe side chats, wyszukiwanie transkryptów, nowe selektory projektów i hooki chmurowe na poziomie rozmowy.
Claude Code 2.1.207 + Sonnet 5Claude Sonnet 5 jest teraz domyślny na standardowych miejscach subskrypcyjnych Anthropic; wybrane konta premium/direct API domyślnie używają Opus 4.8, a defaulty zarządzanych chmur są inne. Wydania 2.1.185–207 utrwalają agenty w tle przez restarty, dodają auth MCP w CLI, ochronę credentials w sandboxie, rozmiar dynamic workflows, łączenie skills i diagnostyczny /doctor z naprawami.
Połowa–koniec lipca: Claude Code 2.1.215 · Codex 0.144.614–19 lipca: Claude Code przestał automatycznie uruchamiać /verify i /code-review, dodał narzędzie EndConversation, /fork do sesji w tle i tryb czytnika ekranu; Codex 0.144.6 zaostrzył wykrywanie niebezpiecznych komend i poprawił GPT-5.6 Sol/Terra/Luna do kontekstu roboczego 272K; Cursor dodał środowiska multi-repo w Slacku i plan-przed-startem na linii 3.11.
Wyścig o pracę autonomiczną nie zwolnił tempa w czerwcu: Cursor wepchnął Design Mode do przeglądarki i kanw, Claude Code ustalił ultracode jako słowo kluczowe wyzwalające dynamiczne przepływy pracy, Codex wydał parowanie kontrolerów dla bezgłowych flot, a Anthropic wydał Claude Fable 5 — nowy poziom modeli powyżej Opusa.
Claude Code: Artifacts (beta)18 czerwca: zamień sesję Claude Code w interaktywną stronę — przewodnik po PR lub żywy dashboard — udostępnianą pod prywatnym linkiem. Beta w planach Team i Enterprise.
Cursor 3.8 — /automate18 czerwca: opisz automatyzację zwykłym językiem, a agent skonfiguruje wyzwalacze, instrukcje i narzędzia. Plus wyzwalacz emoji Slack i pięć nowych wyzwalaczy GitHub.
Cursor — subagenty chmurowe (/in-cloud, /babysit)17 czerwca: uruchamiaj subagenty chmurowe w izolowanych VM, zlecaj im przygotowanie PR-ów zdalnie i skonfiguruj chmurowe środowisko deweloperskie w mniej niż 10 minut.
SpaceX podpisuje umowę przejęcia Cursora16 czerwca: SpaceX zgadza się przejąć Anysphere/Cursor za akcje przy implikowanej wycenie $60 mld. Transakcja nadal oczekiwała na zgody regulacyjne i spełnienie warunków zamknięcia; finalizację przewidywano na III kwartał 2026.
Codex v0.141 + Record & Replay18 czerwca: szyfrowane kanały Noise relay dla zdalnych egzekutorów i serwery MCP egzekutora per wątek; Record & Replay w aplikacji Codex zamienia zademonstrowany przepływ pracy w edytowalny skill.
Claude Code v2.1.172–183Zagnieżdżone sub-agenty do 5 poziomów w głąb, niejawne zespoły agentów (usunięto TeamCreate/TeamDelete), reguły uprawnień ograniczone do parametrów oraz zabezpieczenia trybu auto przed niszczącymi operacjami git/terraform.
Claude Fable 5 — nowy poziom modeli powyżej Opusa9 czerwca: model klasy Mythos, który uczyniono bezpiecznym do ogólnego użytku; w Claude Code od v2.1.170 (`/model fable`) i w selektorze modeli Cursora. $10/$50 za MTok; rozliczanie ustalono 20 lipca — na stałe wliczony w Max i Team Premium do 50% tygodniowych limitów, usage credits w Pro i Team Standard.
Cursor 3.7 — Canvas Design Mode4–5 czerwca: Design Mode działa teraz w przeglądarce i wewnątrz kanw — wielokrotny wybór elementów, narracja głosowa podczas pracy agenta, interaktywny raport zużycia kontekstu i pełnoekranowe współdzielone kanwy.
Cursor SDK — niestandardowe narzędzia i auto-review4 czerwca: udostępnij własne funkcje lokalnemu agentowi przez `local.customTools`, kieruj bezgłowe wywołania narzędzi przez klasyfikator auto-review, wybierz magazyny JSONL/SQLite i zagnieżdżaj subagenty na dowolną głębokość.
Cursor 3.6 — Auto-review Run Mode29 maja: tryb run działający dłużej przy mniejszej liczbie promptów — wywołania z listy dozwolonych uruchamiają się natychmiast, wywołania sandboxowalne są sandboxowane, reszta trafia do subagenta klasyfikatora. Plus Organizations dla Enterprise (3 czerwca).
Claude Code: `ultracode` to słowo kluczowe workflowv2.1.160 (2 czerwca) zmieniła nazwę wyzwalacza dynamicznych przepływów pracy z `workflow` na `ultracode`, wyróżnianego na fioletowo. v2.1.156–158 dodały auto-load pluginów `.claude/skills` oraz tryb auto na Bedrock/Vertex/Foundry.
Claude Code v2.1.166 — modele zapasowe6 czerwca: skonfiguruj do trzech `fallbackModel`-i próbowanych po kolei, gdy główny jest przeciążony, wzorce glob w regułach deny (`*` blokuje wszystkie narzędzia) oraz utwardzone przesyłanie wiadomości między sesjami.
Codex v0.137 — parowanie kontrolerów, równoległe wyszukiwanie w sieci4 czerwca: klienci `codex remote-control` mogą inicjować parowanie i zarządzać przyznaniami kontrolera; plugin list zyskuje output JSON; samodzielne wyszukiwania w sieci działają równolegle. v0.136 dodała sesje `/archive`.
Nowi oficjalni wydawcy skillsOpenAI, Google Gemini, LangChain, Vercel, Prisma, Convex, Deepgram, Box, Contentful, Contentstack i Base publikują teraz oficjalne agent skills na skills.sh.
Pivotalny miesiąc: Anthropic wydał Claude Opus 4.8 i dynamiczne przepływy pracy, a wszystkie trzy narzędzia dopełniły swoje pierwszorzędne prymitywy pracy autonomicznej w ciągu kilku tygodni od siebie.
Claude Opus 4.8 + dynamiczne przepływy pracy28 maja: nowy flagowy model Anthropic — około czterokrotnie rzadziej pozostawiający nieoznaczone wady w kodzie niż Opus 4.7 — plus dynamiczne przepływy pracy (podgląd badawczy) orkiestrujące od dziesiątek do setek (nawet do 1 000) subagentów ze skryptu, oraz `ultracode`, by Claude sam decydował, kiedy taki uruchomić.
Claude Code: /goal i agent view`/goal` ustawia weryfikowalny stan końcowy, a Claude pracuje turami, aż zostanie spełniony. `claude agents` to nowy dashboard dla każdej sesji w tle. Oba wydane w v2.1.139 11 maja.
Cursor 3.3 — PR review, Build in Parallel7 maja: przeprojektowany PR review (zakładki Reviews/Commits/Changes), quick action Build in Parallel, Split changes into PRs, przypięte quick-action pills. Bugbot przechodzi na rozliczanie usage-based.
Codex v0.129 — `/vim`, `/hooks` browser7 maja: modalna edycja Vim w composerze, przeprojektowany resume/fork picker, theme-aware status line, browser `/hooks` z pre/post-compaction execution.
Cursor w Microsoft Teams11 maja: wzmianka `@Cursor` w dowolnym kanale Teams deleguje pracę do agentów chmurowych. Automatyczny wybór repo i modelu z kontekstu promptu.
Cursor 3.2 — `/multitask`24 kwietnia: async subagenty równolegle zamiast w kolejce. Multi-root workspaces do sesji cross-repo agenta w jednej rozmowie.
Claude Code: 5-godzinne limity podwojoneMaj 2026: 5-godzinne limity użycia podwojone dla Pro / Max / Team / Enterprise, aby wspierać nowe długotrwałe workflow agentów.
Fundamentalna zmiana z forka VS Code na dedykowany workspace do pracy z agentami:
Agents Window
Nowy wielorepozytorium interfejs do równoległego uruchamiania agentów w różnych środowiskach — lokalnie, w worktrees, w chmurze i przez remote SSH. Scentralizowany sidebar pokazuje wszystkich agentów. Przełącz przez Cmd+Shift+P → Agents Window.
Design Mode
Adnotowanie elementów UI bezpośrednio w przeglądarce dla precyzyjnego wizualnego feedbacku. Użyj ⌘+Shift+D do przełączania, Shift+przeciągnij do zaznaczania, ⌘+L do dodania elementu do czatu, ⌥+klik do dodania do inputu.
Agent Tabs i Worktrees
Wyświetlaj wiele czatów obok siebie lub w siatce. Nowe polecenie /worktree tworzy izolowane git worktrees. /best-of-n uruchamia zadania równolegle na wielu modelach i porównuje wyniki.
Pluginy i Enterprise
MCP Apps wspierają ustrukturyzowaną treść dla bogatszych outputów. Wtyczki firm trzecich domyślnie wyłączone dla Enterprise. Nazwy grup katalogowych w logach audytu. Zarządzanie sekretami self-hosted cloud agents.
Pierwszy model ogólnego przeznaczenia z natywną obsługą komputera, teraz domyślny na wszystkich powierzchniach OpenAI:
Natywna Obsługa Komputera
Pierwszy model ogólnego przeznaczenia z najnowocześniejszymi możliwościami obsługi komputera — 75% na OSWorld. Agenty mogą obsługiwać komputery i realizować złożone przepływy pracy między aplikacjami.
Kontekst 1M Tokenów
Obsługuje do 1M tokenów kontekstu. Łączy wiodące w branży możliwości kodowania z GPT-5.3-Codex, jednocześnie ulepszając użycie narzędzi w środowiskach programistycznych.
Najlepsze Benchmarki
57.7% na SWE-bench Pro (kodowanie), 83% na GDPval (praca z wiedzą). Znaczące ulepszenia w zadaniach profesjonalnych obejmujących arkusze kalkulacyjne, prezentacje i dokumenty.
Dostępny Wszędzie
Wdrażany w ChatGPT, Codex i API jako domyślny model. Wariant GPT-5.4 Pro dostępny dla maksymalnej wydajności przy złożonych zadaniach.
Agenty zawsze aktywne, działające według harmonogramów lub reagujące na zdarzenia:
Wyzwalacze zdarzeń: Slack, Linear, GitHub, PagerDuty i webhooks — agenty uruchamiają sandboxowane środowiska chmurowe ze skonfigurowanymi MCP i modelami
Narzędzie pamięci: Agenty uczą się z przeszłych uruchomień i poprawiają się z powtórzeniami w powtarzających się zadaniach
Szablony bezpieczeństwa: Przeglądanie ponad 3000 wewnętrznych PR tygodniowo, wykrywanie ponad 200 podatności dedykowanymi agentami audytu bezpieczeństwa
Pipeline incydentów: Alerty PagerDuty → analiza logów Datadog → podsumowania Slack z proponowanymi poprawkami, w pełni zautomatyzowane
Codex rozszerzył zasięg platformowy i możliwości CLI:
Aplikacja Windows (4 marca): Natywne wsparcie PowerShell i natywny sandbox Windows z tokenami ograniczonymi na poziomie OS i kontrolą uprawnień systemu plików (ACL)
CLI 0.117: Wtyczki jako workflow pierwszej klasy z synchronizacją produktową, sub-agenty z adresowaniem opartym na ścieżkach, konfiguracja tytułu terminala przez /title
CLI 0.118: Sandbox Windows z sieciowaniem proxy-only, logowanie ChatGPT device-code, prompt+stdin dla codex exec, dynamiczne bearer tokeny dla niestandardowych dostawców modeli
Najnowszy model Claude i nowa domyślna rekomendacja dla wszystkich złożonych zadań kodowania:
Najlepsze Wyniki SWE-Bench
Najlepsza wydajność na SWE-Bench Verified wśród wszystkich dostępnych modeli. Doskonałe zachowanie agentowe i utrzymane rozumowanie przez długie zadania.
Ulepszona Wydajność Agentowa
Ulepszone użycie narzędzi w setkach narzędzi. Lepsza odporność na prompt injection. Bardziej niezawodne wykonywanie zadań wieloetapowych.
200K Context Window
200K tokenów kontekstu z limitem 64K outputu. Parametr effort dla regulowanej głębokości rozumowania. Ulepszenia pamięci dla złożonych zadań.
Dostępny Wszędzie
Dostępny w Claude Code, Cursor (przez wybór modelu) i przez API Anthropic. Zalecany z planami subskrypcyjnymi Max/Ultra dla pełnego dostępu.
GPT-4, GPT-4.1, GPT-4o (legacy wobec bieżących wskazówek GPT-5.6; dostępność zależy od produktu)
GPT-5.1 / GPT-5.1-Codex / GPT-5.1-Codex-Mini/Max, GPT-5.2 (usunięte z selektora modeli Codex)
GPT-5.3-Codex, GPT-5.4 i GPT-5.5 (zastąpione przez rodzinę GPT-5.6)
Cursor Composer 1 i Composer 2 (starsze generacje; Composer 2.5 jest bieżący)
Claude Opus 4.8 (zastąpiony przez Opus 5 w tej samej cenie $5 / $25; nadal dostępny, nadal objęty Priority Tier i nadal jest modelem, na który wracają żądania Opus 5 i Fable 5 oflagowane jako cyberbezpieczeństwo)
Claude Opus 4.6 / 4.7 (starsze od Opus 4.8; v2.1.219 przeniósł udokumentowane defaulty chmur zarządzanych na Opus 5, z wyjątkiem Foundry, które zostaje na Sonnet 4.5 i rozwiązuje opus na Opus 4.6)
Claude Opus 4.1 (deprecated — wycofanie 5 sierpnia 2026; migruj na Opus 5)
Seria Claude 3.x (legacy wobec bieżących wskazówek 4.5+ i serii 5)
Claude Sonnet 5 (30 czerwca): default na Pro, Team Standard i subskrypcyjnych miejscach Enterprise z natywnym kontekstem 1M; Max, Team Premium, Enterprise pay-as-you-go i sesje Anthropic API domyślnie używają teraz Opus 5, defaulty zarządzanych chmur są inne, a promocyjna cena API Sonnet kończy się 31 sierpnia 2026
Claude Fable 5: przywrócony globalnie 1 lipca; od 20 lipca 2026 na stałe wliczony w Max i Team Premium do 50% tygodniowych limitów użycia, a Pro i Team Standard sięgają po niego przez usage credits
Rodzina GPT-5.6 (9 lipca): Sol, Terra i Luna zastępują wskazówki z ery GPT-5.5; sprawdź slugi, poziomy reasoning effort i routing tierów
Cursor Grok 4.5 (8 lipca): dostępny w desktop, web, iOS, CLI i SDK; wybierz cennik standard lub fast
Cursor 3.0: Nowy interfejs Agents Window zastępuje stary layout — cloud agents usunięte z Editora
Claude Code: /simplify i /code-review są odrębnymi komendami; użyj /simplify do przeglądu reuse/jakości/wydajności, a /code-review do dedykowanego workflow review
Claude Code v2.1.84+: Polecenia /tag i /vim usunięte (użyj /config → Editor mode zamiast tego)
Claude Code v2.1.160 (2 czerwca): słowo kluczowe wyzwalające dynamiczne przepływy pracy zmieniło się z workflow na ultracode — wpisanie „workflow” już nie uruchamia przebiegu, choć poproszenie własnymi słowami nadal działa