Przejdź do głównej zawartości

Poziom 5: prowadzisz fabrykę oprogramowania

Poziom 5 na drabinie autonomii to fabryka oprogramowania: potok, w którym agenci biorą pracę z kolejki, budują ją, weryfikują i otwierają pull requesty, a człowiek nie pisze kodu. Minions Stripe’a scalają ponad 1300 PR-ów tygodniowo (stripe.dev, luty 2026). Fabryka ma sześć stanowisk: intencja, harness, pętla, graf, weryfikacja, wydanie. Ta strona pokazuje, co do każdego dostarczają Claude Code, Codex i Cursor.

Shapiro (The Five Levels, styczeń 2026) nazywa ten szczebel ciemną fabryką oprogramowania i opisuje go bez ogródek: “To czarna skrzynka, która zamienia specyfikacje w oprogramowanie”, gdzie “ludzie nie są ani potrzebni, ani mile widziani”. Umieszcza tam garstkę ludzi, w zespołach poniżej pięciu osób. Traktuj to, co niżej, jak spis części, a nie jak trasę: części są udokumentowane, całość jest rzadka.

Sześć stanowisk bierze się z podzielenia potoku agentowego według decyzji. Intencja rozstrzyga, co agent wie na starcie. Harness rozstrzyga, co wolno mu uruchomić. Pętla rozstrzyga, kiedy przestaje. Graf rozstrzyga, kto co robi, gdy agentów jest więcej niż jeden. Weryfikacja rozstrzyga, co liczy się jako dowód. Wydanie rozstrzyga, jak praca opuszcza budynek. Każdą komórkę poniżej pobrano z dokumentacji producenta 28 sierpnia 2026; komórka z napisem nieudokumentowane na 2026-08-28 oznacza lukę w dokumentacji, a nie dowód, że narzędzie tego nie potrafi.

Czego potrzebuje stanowisko Intencji i co dostarcza do niego każde narzędzie?

Dział zatytułowany „Czego potrzebuje stanowisko Intencji i co dostarcza do niego każde narzędzie?”
MożliwośćClaude CodeCodexCursor
Trwałe instrukcje projektuCLAUDE.md i auto memoryAGENTS.mdRules
Procedura wielokrotnego użytkuSkillsSkillsAgent Skills
Paczka do dystrybucjiPluginsPluginsPlugins
Plan przed implementacjąPlan mode/planPlan Mode
Wskazówki, jak sformułować weryfikowalny celNieudokumentowane na 2026-08-28Long-running workNieudokumentowane na 2026-08-28

Trzy pliki kontekstu mają to samo zadanie i różną mechanikę: Codex “czyta pliki AGENTS.md, zanim weźmie się do jakiejkolwiek pracy”, rules w Cursorze “pakują razem prompty, skrypty i więcej”, a Claude Code dokłada do pliku, który napiszesz, nagromadzoną pamięć. Rady o samym celu publikuje tylko Codex i to jest zdanie do skopiowania: wynik, ograniczenia, weryfikacja.

Czego potrzebuje stanowisko Harnessu i co dostarcza do niego każde narzędzie?

Dział zatytułowany „Czego potrzebuje stanowisko Harnessu i co dostarcza do niego każde narzędzie?”
MożliwośćClaude CodeCodexCursor
Tryby uprawnieńPermission modesPermission modesRun modes
Polityka zatwierdzeńAuto modeApprovalsNieudokumentowane na 2026-08-28
Sandbox systemu operacyjnegoSandboxed Bash toolSandbox/sandbox
Przechwytywanie cyklu życiaHooksHooksHooks
Narzędzia zewnętrzneMCPMCPMCP
Zarządzane środowisko zdalneCloud environmentsCloud environmentBuilds
Własna infrastruktura obliczeniowaSelf-hosted environmentsNieudokumentowane na 2026-08-28Private workers
Wpychanie zdarzeń zewnętrznych do żywej sesjiChannelsNieudokumentowane na 2026-08-28Nieudokumentowane na 2026-08-28

To stanowisko zespół faktycznie domknie w jedno popołudnie i to ono rozstrzyga, ile z reszty jest bezpieczne. Dwa wiersze warto przeczytać uważnie. Tryb auto w Claude Code przepuszcza “wywołania narzędzi przez klasyfikator, który blokuje wszystko nieodwracalne, destrukcyjne albo wycelowane poza twoje środowisko”, czyli osąd wykonuje model; polityka zatwierdzeń w Codeksie to nazwany tryb, on-request, never, untrusted albo granular, czyli osąd wykonujesz ty. Oba są lepsze niż agent chodzący na uprawnieniach, które zostawiła po sobie ostatnia sesja.

Czego potrzebuje stanowisko Pętli i co dostarcza do niego każde narzędzie?

Dział zatytułowany „Czego potrzebuje stanowisko Pętli i co dostarcza do niego każde narzędzie?”
MożliwośćClaude CodeCodexCursor
Cel albo warunek stopu/goal/goal/goal
Pętla interwałowa/loopNie ma na liście komend (sprawdzono 2026-08-28)Skill /loop, dołączony od 3.5 (20 maja 2026) — nie ma go w referencji poleceń CLI (sprawdzono 2026-08-28)
Zaplanowane przebiegi bez nadzoruRoutinesScheduled tasksAutomations
Wywołanie headlessclaude -pcodex execPrint mode
SDK programistyczneAgent SDKCodex SDKTypeScript SDK, Python SDK
Izolowany przebieg w chmurzeClaude Code on the webCodex cloudCloud Agents

Wyzwalacze różnią się bardziej niż same silniki. Routines w Claude Code “działają według harmonogramu, wyzwalają się wywołaniem API albo reagują na zdarzenia GitHuba” i działają “jako pełne sesje Claude Code w chmurze: nie ma wyboru trybu uprawnień ani promptów o zgodę w trakcie przebiegu”, i dokładnie dlatego harness musi być dobry wcześniej. Automations w Codeksie wymieniają jako źródła zdarzeń Gmaila, Slacka i aktywność pull requestów na GitHubie. Automations w Cursorze działają “według harmonogramu albo w odpowiedzi na zdarzenia z GitHuba, GitLaba, Slacka, webhooków, Lineara i innych”, a na liście wyzwalaczy są też Sentry i PagerDuty. Jeśli twoja fabryka bierze pracę z kolejki, tą kolejką jest właśnie ta lista wyzwalaczy.

Czego potrzebuje stanowisko Grafu i co dostarcza do niego każde narzędzie?

Dział zatytułowany „Czego potrzebuje stanowisko Grafu i co dostarcza do niego każde narzędzie?”
MożliwośćClaude CodeCodexCursor
Delegowani subagenciSubagentsSubagentsSubagents
Udokumentowany limit równoległościDomyślnie 20 na sesjęKonfigurowalny, bez udokumentowanej wartości domyślnejBrak udokumentowanego maksimum
Subagenci na własnej maszynieDzielą maszynę sesji; izolację dają worktreeNieudokumentowane na 2026-08-28Tak, od 19 sierpnia 2026
Agenci wymieniający wiadomości między sobąAgent teams, eksperymentalneNieudokumentowane na 2026-08-28Nieudokumentowane na 2026-08-28
Orkiestracja sterowana skryptemDynamic workflowsNieudokumentowane na 2026-08-28Nieudokumentowane na 2026-08-28
Izolacja systemu plikówWorktreesWorktreesWorktrees
Jeden ekran dla wielu agentówAgent viewCodex MicroAgents window
Programowe sterowanie flotąAgent SDKCodex SDK i app-serverCloud Agents API

Dwa wiersze to stan sztuki, a nie odhaczona funkcja. Dynamic workflows w Claude Code “orkiestrują wielu subagentów ze skryptu, który Claude pisze, a ty możesz go uruchomić ponownie”, i to najbliżej, jak którykolwiek producent podchodzi do hali fabrycznej trzymanej w wersjonowaniu. Changelog Cursora z 19 sierpnia 2026 daje subagentom “izolowaną kopię projektu z czystym kontekstem, we własnym środowisku chmurowym”, co zmienia rozgałęzianie z problemu kontekstu w problem harmonogramu.

Czego potrzebuje stanowisko Weryfikacji i co dostarcza do niego każde narzędzie?

Dział zatytułowany „Czego potrzebuje stanowisko Weryfikacji i co dostarcza do niego każde narzędzie?”
MożliwośćClaude CodeCodexCursor
Przegląd lokalnego diffa/code-review/reviewAgent review
Głęboki, zweryfikowany przegląd wieloagentowyUltrareviewNieudokumentowane na 2026-08-28Nieudokumentowane na 2026-08-28
Zarządzany przegląd pull requestówCode ReviewPrzegląd na GitHubie i GitLabieBugbot
Skanowanie bezpieczeństwaClaude Security pluginCodex SecuritySecurity Agents
Cofnięcie albo przewinięcieCheckpointingNieudokumentowane na 2026-08-28/rewind
Eskalacja do mocniejszego modeluAdvisorNieudokumentowane na 2026-08-28Nieudokumentowane na 2026-08-28

Nic w tej tabeli nie jest deterministyczne i to jest główny problem tego stanowiska. Ultrareview idzie najdalej, “każde zgłoszone znalezisko jest niezależnie odtwarzane i weryfikowane”, i wciąż kosztuje mniej więcej od 5 do 25 dolarów oraz od 5 do 10 minut na przebieg. Dowód, na którym stoi fabryka, to nudna warstwa pod spodem: typy, testy, lint, migracje padające na czerwono. Minions Stripe’a zbudowano na “ogromnej, istniejącej już baterii testów Stripe, ponad trzech milionach” i ograniczono do “najwyżej dwóch rund CI”, zanim gałąź wraca do człowieka.

Czego potrzebuje stanowisko Wydania i co dostarcza do niego każde narzędzie?

Dział zatytułowany „Czego potrzebuje stanowisko Wydania i co dostarcza do niego każde narzędzie?”
MożliwośćClaude CodeCodexCursor
Uruchomienie w CI GitHubaGitHub ActionsCodex GitHub ActionGitHub Actions
Uruchomienie w CI GitLabaGitLab CI/CDGitLabGitLab
Reakcja na zdarzenia w repozytoriumWyzwalacz GitHub w RoutinesZadania w chmurze z GitHuba, GitLaba, Lineara, SlackaWyzwalacze z kontroli wersji w Automations
Wyzwalanie z własnych systemówWyzwalacz API w RoutinesNieudokumentowane na 2026-08-28Wyzwalacze webhookowe
Powiadomienie wychodzące o statusie przebieguNieudokumentowane na 2026-08-28Nieudokumentowane na 2026-08-28Webhooks
Kierowanie i zatwierdzanie pull requestówNieudokumentowane na 2026-08-28Nieudokumentowane na 2026-08-28Kierowanie i zatwierdzanie PR-ów
Sterowanie przebiegiem z telefonuRemote ControlCodex RemoteMobile

Luka, która ma tu znaczenie, to droga powrotna. Routines w Claude Code przyjmują przychodzący wyzwalacz HTTP, “POST na endpoint z tokenem bearer routine’y startuje nową sesję i zwraca jej URL”, ale nie publikują webhooka wychodzącego; Cursor publikuje webhooki wychodzące ze zdarzeniem statusChange i jako jedyny z trójki dokumentuje agenta zatwierdzającego pull requesty. Fabryka, która nie umie powiedzieć twoim systemom, co się stało, jest fabryką, którą musisz odpytywać.

Poziom należy do pętli, nie do firmy, a każdą pętlę rozstrzygają te same cztery pytania. Pochodzą z tekstu o fabrykach oprogramowania i są regułą na to, które stanowisko może chodzić bez nadzoru:

  1. Jaka wyrocznia rozstrzyga, że “zrobione”? Nazwij konkret. “Testy przechodzą” to wyrocznia. “Wygląda dobrze” nie.
  2. Czy agent może to podrobić? Jeśli agent może edytować wyrocznię, wyrocznia jest sugestią. Testy wewnątrz repo oblewają to pytanie z definicji.
  3. Ile trwa, zanim zła odpowiedź wypłynie? Sekundy to zielone światło. “Człowiek zauważy za trzy tygodnie” to czerwone.
  4. Jaki jest zasięg rażenia, jeśli odpowiedź jest zła? Odwracalny i ograniczony, czy migracja schematu.

Pętla, która czysto odpowiada na wszystkie cztery, może dziś chodzić po ciemku. Pętla, która oblewa pytanie 2 albo 3, zostaje przy świetle, choćby harness był najlepszy.

Kolejka przerasta przepustowość review. Faros AI zmierzył kształt tego w kwietniu 2026 na 22 000 programistów: incydenty na pull request +242,7%, mediana czasu w review +441,5% i o 31,3% więcej pull requestów scalanych bez review. Fabryka, która skaluje generowanie bez skalowania dowodu, daje ten sam wynik co zepsuta, tylko trochę później.

Wyrocznia wchodzi w zasięg agenta. Każde stanowisko, które weryfikuje własną pracę, prędzej czy później przepisze sprawdzenie. Trzymaj rozstrzygający walidator w CI, w osobnym pakiecie albo za komendą, której przebieg nie umie edytować.

Przebiegi bez nadzoru dziedziczą wczorajsze uprawnienia. Routines z założenia działają bez promptów o zgodę. To, na co harness pozwalał ostatnim razem, kiedy w niego patrzyłeś, chodzi o trzeciej w nocy.

Do agenta z narzędziami trafia niezaufany tekst. Treści zgłoszeń, komentarze do pull requestów, ładunki webhooków i zescrapowane strony to wejścia, które może napisać ktoś z zewnątrz. Opakuj je jako dane, nigdy jako instrukcje, i daj pętlom, które je czytają, najwęższe uprawnienia w całej fabryce.

Nikt nie odpowiada za całą linię. Sześć stanowisk, sześciu właścicieli i nikt nie czyta szwów: tak zielony potok wypuszcza zły produkt. Ta robota się nie automatyzuje, zostaje przy człowieku.