Poziom 5: prowadzisz fabrykę oprogramowania
Poziom 5 na drabinie autonomii to fabryka oprogramowania: potok, w którym agenci biorą pracę z kolejki, budują ją, weryfikują i otwierają pull requesty, a człowiek nie pisze kodu. Minions Stripe’a scalają ponad 1300 PR-ów tygodniowo (stripe.dev, luty 2026). Fabryka ma sześć stanowisk: intencja, harness, pętla, graf, weryfikacja, wydanie. Ta strona pokazuje, co do każdego dostarczają Claude Code, Codex i Cursor.
Shapiro (The Five Levels, styczeń 2026) nazywa ten szczebel ciemną fabryką oprogramowania i opisuje go bez ogródek: “To czarna skrzynka, która zamienia specyfikacje w oprogramowanie”, gdzie “ludzie nie są ani potrzebni, ani mile widziani”. Umieszcza tam garstkę ludzi, w zespołach poniżej pięciu osób. Traktuj to, co niżej, jak spis części, a nie jak trasę: części są udokumentowane, całość jest rzadka.
Sześć stanowisk bierze się z podzielenia potoku agentowego według decyzji. Intencja rozstrzyga, co agent wie na starcie. Harness rozstrzyga, co wolno mu uruchomić. Pętla rozstrzyga, kiedy przestaje. Graf rozstrzyga, kto co robi, gdy agentów jest więcej niż jeden. Weryfikacja rozstrzyga, co liczy się jako dowód. Wydanie rozstrzyga, jak praca opuszcza budynek. Każdą komórkę poniżej pobrano z dokumentacji producenta 28 sierpnia 2026; komórka z napisem nieudokumentowane na 2026-08-28 oznacza lukę w dokumentacji, a nie dowód, że narzędzie tego nie potrafi.
Czego potrzebuje stanowisko Intencji i co dostarcza do niego każde narzędzie?
Dział zatytułowany „Czego potrzebuje stanowisko Intencji i co dostarcza do niego każde narzędzie?”| Możliwość | Claude Code | Codex | Cursor |
|---|---|---|---|
| Trwałe instrukcje projektu | CLAUDE.md i auto memory | AGENTS.md | Rules |
| Procedura wielokrotnego użytku | Skills | Skills | Agent Skills |
| Paczka do dystrybucji | Plugins | Plugins | Plugins |
| Plan przed implementacją | Plan mode | /plan | Plan Mode |
| Wskazówki, jak sformułować weryfikowalny cel | Nieudokumentowane na 2026-08-28 | Long-running work | Nieudokumentowane na 2026-08-28 |
Trzy pliki kontekstu mają to samo zadanie i różną mechanikę: Codex “czyta pliki AGENTS.md, zanim weźmie się do jakiejkolwiek pracy”, rules w Cursorze “pakują razem prompty, skrypty i więcej”, a Claude Code dokłada do pliku, który napiszesz, nagromadzoną pamięć. Rady o samym celu publikuje tylko Codex i to jest zdanie do skopiowania: wynik, ograniczenia, weryfikacja.
Czego potrzebuje stanowisko Harnessu i co dostarcza do niego każde narzędzie?
Dział zatytułowany „Czego potrzebuje stanowisko Harnessu i co dostarcza do niego każde narzędzie?”| Możliwość | Claude Code | Codex | Cursor |
|---|---|---|---|
| Tryby uprawnień | Permission modes | Permission modes | Run modes |
| Polityka zatwierdzeń | Auto mode | Approvals | Nieudokumentowane na 2026-08-28 |
| Sandbox systemu operacyjnego | Sandboxed Bash tool | Sandbox | /sandbox |
| Przechwytywanie cyklu życia | Hooks | Hooks | Hooks |
| Narzędzia zewnętrzne | MCP | MCP | MCP |
| Zarządzane środowisko zdalne | Cloud environments | Cloud environment | Builds |
| Własna infrastruktura obliczeniowa | Self-hosted environments | Nieudokumentowane na 2026-08-28 | Private workers |
| Wpychanie zdarzeń zewnętrznych do żywej sesji | Channels | Nieudokumentowane na 2026-08-28 | Nieudokumentowane na 2026-08-28 |
To stanowisko zespół faktycznie domknie w jedno popołudnie i to ono rozstrzyga, ile z reszty jest bezpieczne. Dwa wiersze warto przeczytać uważnie. Tryb auto w Claude Code przepuszcza “wywołania narzędzi przez klasyfikator, który blokuje wszystko nieodwracalne, destrukcyjne albo wycelowane poza twoje środowisko”, czyli osąd wykonuje model; polityka zatwierdzeń w Codeksie to nazwany tryb, on-request, never, untrusted albo granular, czyli osąd wykonujesz ty. Oba są lepsze niż agent chodzący na uprawnieniach, które zostawiła po sobie ostatnia sesja.
Czego potrzebuje stanowisko Pętli i co dostarcza do niego każde narzędzie?
Dział zatytułowany „Czego potrzebuje stanowisko Pętli i co dostarcza do niego każde narzędzie?”| Możliwość | Claude Code | Codex | Cursor |
|---|---|---|---|
| Cel albo warunek stopu | /goal | /goal | /goal |
| Pętla interwałowa | /loop | Nie ma na liście komend (sprawdzono 2026-08-28) | Skill /loop, dołączony od 3.5 (20 maja 2026) — nie ma go w referencji poleceń CLI (sprawdzono 2026-08-28) |
| Zaplanowane przebiegi bez nadzoru | Routines | Scheduled tasks | Automations |
| Wywołanie headless | claude -p | codex exec | Print mode |
| SDK programistyczne | Agent SDK | Codex SDK | TypeScript SDK, Python SDK |
| Izolowany przebieg w chmurze | Claude Code on the web | Codex cloud | Cloud Agents |
Wyzwalacze różnią się bardziej niż same silniki. Routines w Claude Code “działają według harmonogramu, wyzwalają się wywołaniem API albo reagują na zdarzenia GitHuba” i działają “jako pełne sesje Claude Code w chmurze: nie ma wyboru trybu uprawnień ani promptów o zgodę w trakcie przebiegu”, i dokładnie dlatego harness musi być dobry wcześniej. Automations w Codeksie wymieniają jako źródła zdarzeń Gmaila, Slacka i aktywność pull requestów na GitHubie. Automations w Cursorze działają “według harmonogramu albo w odpowiedzi na zdarzenia z GitHuba, GitLaba, Slacka, webhooków, Lineara i innych”, a na liście wyzwalaczy są też Sentry i PagerDuty. Jeśli twoja fabryka bierze pracę z kolejki, tą kolejką jest właśnie ta lista wyzwalaczy.
Czego potrzebuje stanowisko Grafu i co dostarcza do niego każde narzędzie?
Dział zatytułowany „Czego potrzebuje stanowisko Grafu i co dostarcza do niego każde narzędzie?”| Możliwość | Claude Code | Codex | Cursor |
|---|---|---|---|
| Delegowani subagenci | Subagents | Subagents | Subagents |
| Udokumentowany limit równoległości | Domyślnie 20 na sesję | Konfigurowalny, bez udokumentowanej wartości domyślnej | Brak udokumentowanego maksimum |
| Subagenci na własnej maszynie | Dzielą maszynę sesji; izolację dają worktree | Nieudokumentowane na 2026-08-28 | Tak, od 19 sierpnia 2026 |
| Agenci wymieniający wiadomości między sobą | Agent teams, eksperymentalne | Nieudokumentowane na 2026-08-28 | Nieudokumentowane na 2026-08-28 |
| Orkiestracja sterowana skryptem | Dynamic workflows | Nieudokumentowane na 2026-08-28 | Nieudokumentowane na 2026-08-28 |
| Izolacja systemu plików | Worktrees | Worktrees | Worktrees |
| Jeden ekran dla wielu agentów | Agent view | Codex Micro | Agents window |
| Programowe sterowanie flotą | Agent SDK | Codex SDK i app-server | Cloud Agents API |
Dwa wiersze to stan sztuki, a nie odhaczona funkcja. Dynamic workflows w Claude Code “orkiestrują wielu subagentów ze skryptu, który Claude pisze, a ty możesz go uruchomić ponownie”, i to najbliżej, jak którykolwiek producent podchodzi do hali fabrycznej trzymanej w wersjonowaniu. Changelog Cursora z 19 sierpnia 2026 daje subagentom “izolowaną kopię projektu z czystym kontekstem, we własnym środowisku chmurowym”, co zmienia rozgałęzianie z problemu kontekstu w problem harmonogramu.
Czego potrzebuje stanowisko Weryfikacji i co dostarcza do niego każde narzędzie?
Dział zatytułowany „Czego potrzebuje stanowisko Weryfikacji i co dostarcza do niego każde narzędzie?”| Możliwość | Claude Code | Codex | Cursor |
|---|---|---|---|
| Przegląd lokalnego diffa | /code-review | /review | Agent review |
| Głęboki, zweryfikowany przegląd wieloagentowy | Ultrareview | Nieudokumentowane na 2026-08-28 | Nieudokumentowane na 2026-08-28 |
| Zarządzany przegląd pull requestów | Code Review | Przegląd na GitHubie i GitLabie | Bugbot |
| Skanowanie bezpieczeństwa | Claude Security plugin | Codex Security | Security Agents |
| Cofnięcie albo przewinięcie | Checkpointing | Nieudokumentowane na 2026-08-28 | /rewind |
| Eskalacja do mocniejszego modelu | Advisor | Nieudokumentowane na 2026-08-28 | Nieudokumentowane na 2026-08-28 |
Nic w tej tabeli nie jest deterministyczne i to jest główny problem tego stanowiska. Ultrareview idzie najdalej, “każde zgłoszone znalezisko jest niezależnie odtwarzane i weryfikowane”, i wciąż kosztuje mniej więcej od 5 do 25 dolarów oraz od 5 do 10 minut na przebieg. Dowód, na którym stoi fabryka, to nudna warstwa pod spodem: typy, testy, lint, migracje padające na czerwono. Minions Stripe’a zbudowano na “ogromnej, istniejącej już baterii testów Stripe, ponad trzech milionach” i ograniczono do “najwyżej dwóch rund CI”, zanim gałąź wraca do człowieka.
Czego potrzebuje stanowisko Wydania i co dostarcza do niego każde narzędzie?
Dział zatytułowany „Czego potrzebuje stanowisko Wydania i co dostarcza do niego każde narzędzie?”| Możliwość | Claude Code | Codex | Cursor |
|---|---|---|---|
| Uruchomienie w CI GitHuba | GitHub Actions | Codex GitHub Action | GitHub Actions |
| Uruchomienie w CI GitLaba | GitLab CI/CD | GitLab | GitLab |
| Reakcja na zdarzenia w repozytorium | Wyzwalacz GitHub w Routines | Zadania w chmurze z GitHuba, GitLaba, Lineara, Slacka | Wyzwalacze z kontroli wersji w Automations |
| Wyzwalanie z własnych systemów | Wyzwalacz API w Routines | Nieudokumentowane na 2026-08-28 | Wyzwalacze webhookowe |
| Powiadomienie wychodzące o statusie przebiegu | Nieudokumentowane na 2026-08-28 | Nieudokumentowane na 2026-08-28 | Webhooks |
| Kierowanie i zatwierdzanie pull requestów | Nieudokumentowane na 2026-08-28 | Nieudokumentowane na 2026-08-28 | Kierowanie i zatwierdzanie PR-ów |
| Sterowanie przebiegiem z telefonu | Remote Control | Codex Remote | Mobile |
Luka, która ma tu znaczenie, to droga powrotna. Routines w Claude Code przyjmują przychodzący wyzwalacz HTTP, “POST na endpoint z tokenem bearer routine’y startuje nową sesję i zwraca jej URL”, ale nie publikują webhooka wychodzącego; Cursor publikuje webhooki wychodzące ze zdarzeniem statusChange i jako jedyny z trójki dokumentuje agenta zatwierdzającego pull requesty. Fabryka, która nie umie powiedzieć twoim systemom, co się stało, jest fabryką, którą musisz odpytywać.
Które stanowiska mogą chodzić po ciemku
Dział zatytułowany „Które stanowiska mogą chodzić po ciemku”Poziom należy do pętli, nie do firmy, a każdą pętlę rozstrzygają te same cztery pytania. Pochodzą z tekstu o fabrykach oprogramowania i są regułą na to, które stanowisko może chodzić bez nadzoru:
- Jaka wyrocznia rozstrzyga, że “zrobione”? Nazwij konkret. “Testy przechodzą” to wyrocznia. “Wygląda dobrze” nie.
- Czy agent może to podrobić? Jeśli agent może edytować wyrocznię, wyrocznia jest sugestią. Testy wewnątrz repo oblewają to pytanie z definicji.
- Ile trwa, zanim zła odpowiedź wypłynie? Sekundy to zielone światło. “Człowiek zauważy za trzy tygodnie” to czerwone.
- Jaki jest zasięg rażenia, jeśli odpowiedź jest zła? Odwracalny i ograniczony, czy migracja schematu.
Pętla, która czysto odpowiada na wszystkie cztery, może dziś chodzić po ciemku. Pętla, która oblewa pytanie 2 albo 3, zostaje przy świetle, choćby harness był najlepszy.
Gdzie fabryka gnije najpierw
Dział zatytułowany „Gdzie fabryka gnije najpierw”Kolejka przerasta przepustowość review. Faros AI zmierzył kształt tego w kwietniu 2026 na 22 000 programistów: incydenty na pull request +242,7%, mediana czasu w review +441,5% i o 31,3% więcej pull requestów scalanych bez review. Fabryka, która skaluje generowanie bez skalowania dowodu, daje ten sam wynik co zepsuta, tylko trochę później.
Wyrocznia wchodzi w zasięg agenta. Każde stanowisko, które weryfikuje własną pracę, prędzej czy później przepisze sprawdzenie. Trzymaj rozstrzygający walidator w CI, w osobnym pakiecie albo za komendą, której przebieg nie umie edytować.
Przebiegi bez nadzoru dziedziczą wczorajsze uprawnienia. Routines z założenia działają bez promptów o zgodę. To, na co harness pozwalał ostatnim razem, kiedy w niego patrzyłeś, chodzi o trzeciej w nocy.
Do agenta z narzędziami trafia niezaufany tekst. Treści zgłoszeń, komentarze do pull requestów, ładunki webhooków i zescrapowane strony to wejścia, które może napisać ktoś z zewnątrz. Opakuj je jako dane, nigdy jako instrukcje, i daj pętlom, które je czytają, najwęższe uprawnienia w całej fabryce.
Nikt nie odpowiada za całą linię. Sześć stanowisk, sześciu właścicieli i nikt nie czyta szwów: tak zielony potok wypuszcza zły produkt. Ta robota się nie automatyzuje, zostaje przy człowieku.