Poziom 4: piszesz specyfikacje
Poziom 4 na drabinie autonomii to menedżer specyfikacji: programista pisze specyfikację i warunek stopu, agent pracuje godzinami, a człowiek sprawdza, czy testy przechodzą, zamiast czytać każdy diff. Narzędzia do tego to tryb planowania, /goal i /loop, hooki wymuszające sprawdzenia, przebiegi sterowane testami i compound engineering, które odkłada wnioski z każdego przebiegu z powrotem w repozytorium.
Specyfikacja ma trzy zdania, przebieg dwanaście godzin, a między dobrym porankiem a straconym dniem stoi jedna linia: co znaczy “zrobione”. Shapiro (The Five Levels, styczeń 2026) opisuje ten szczebel bez blasku: “piszesz specyfikację”, a potem “wychodzisz na 12 godzin i sprawdzasz, czy testy przechodzą”.
Z czego składa się przebieg na poziomie 4
Dział zatytułowany „Z czego składa się przebieg na poziomie 4”Cztery artefakty istnieją, zanim agent ruszy, i żaden z nich nie jest kodem.
Specyfikacja, która podaje wynik, ograniczenia i to, co jest poza zakresem. Plan, który agent napisał, a ty przeczytałeś: cała robota trybu planowania i najtańsze review, jakie w życiu zrobisz. Warunek stopu, który maszyna umie ocenić. I wyrocznia: testy, typy i sprawdzenia rozstrzygające, czy ten warunek zachodzi. Wyrocznię zespoły pomijają, a to ona pozwala bezpiecznie wyjść.
Prowadzi do tego ta sama droga, którą już chodzisz na poziomie 2, tylko dłuższa: brief produktowy zmienia się w plan, plan w listę zadań, a lista zadań w przebieg. Obie połowy opisują workflow PRD w Cursorze i tryb planowania.
Przebiegi sterowane celem w Claude Code, Codeksie i Cursorze
Dział zatytułowany „Przebiegi sterowane celem w Claude Code, Codeksie i Cursorze”Sprawdzone w dokumentacji producentów 28 sierpnia 2026.
| Możliwość | Claude Code | Codex | Cursor |
|---|---|---|---|
| Cel, który kończy przebieg | /goal | /goal | /goal, od 19 sierpnia 2026 |
| Prompt w rytmie | /loop | Nie ma na liście komend | Dołączony skill /loop od Cursora 3.5 (20 maja 2026) |
| Pisemne wskazówki, jak sformułować cel | Nieudokumentowane na 2026-08-28 | Long-running work | Nieudokumentowane na 2026-08-28 |
Claude Code. “Ustaw warunek ukończenia przez /goal, a Claude pracuje, dopóki nie zostanie spełniony, dopóki model nie uzna go za niemożliwy albo dopóki celu nie skasuje błąd, który musisz naprawić”. Ocena jest oddzielona od pracy: “po każdej turze mały, szybki model sprawdza, czy warunek zachodzi”. Warunek może mieć do 4000 znaków, a w sesji aktywny jest jeden cel. /loop to odpowiednik rytmiczny, czyli “uruchamiaj prompty wielokrotnie, odpytuj o status albo ustaw jednorazowe przypomnienia w sesji Claude Code”, z odstępem dobieranym samodzielnie od minuty do godziny, gdy pominiesz interwał, i z zadaniami cyklicznymi wygasającymi siedem dni po utworzeniu.
Codex. /goal jest w komendach deweloperskich, opisane jako “ustaw, edytuj, wstrzymaj, wznów, obejrzyj lub wyczyść cel zadania”. Strona Long-running work to jedyne wskazówki producenta o pisaniu samego celu: “napisz cel, który pozwoli ChatGPT weryfikować własny postęp. Uwzględnij trzy rzeczy, jeśli mają zastosowanie: wynik, ograniczenia, weryfikację”. W Codeksie nie ma /loop.
Cursor. /goal pojawiło się w changelogu z 19 sierpnia 2026 i jest opisane tak: “daj agentowi długo żyjący cel, do którego ma pracować aż do pełnego ukończenia. W trakcie udostępniania”. /loop nie figuruje w referencji komend ukośnikowych CLI, ale od Cursora 3.5 (20 maja 2026) jest dołączonym skillem.
Dwie poprawki dla każdego, kto pracuje na starszych materiałach: Codex dokumentuje /goal, a /loop istnieje w Claude Code i w Cursorze (tam jako dołączony skill) — w Codeksie go nie ma. Pełne omówienia są w tekstach o poleceniu /goal i poleceniu /loop.
Pięć reguł, które musi spełnić warunek stopu
Dział zatytułowany „Pięć reguł, które musi spełnić warunek stopu”- Jeden cel, jedna meta. Dwa cele w jednym przebiegu dają sprawdzającemu dwie mety i będzie się między nimi miotał. Rozdziel je na dwa przebiegi.
- Warunek jest komendą. “Wygląda dobrze” nie jest sprawdzalne,
npm testkończące się kodem 0 jest. Podaj dokładne komendy, które dowodzą postępu. - Nazwij, co przeczytać najpierw. Plan, dokumentację, jeden już poprawny przykład. Agent, który musi zgadywać cel, błądzi.
- Poproś o checkpoint w każdej rundzie. Jednolinijkowy log postępu daje ci miejsce na przerwanie i sprawia, że dwunastogodzinny przebieg da się później prześledzić.
- Ogranicz zasięg rażenia, razem z testami. Napisz, co jest poza zakresem i czego nie wolno ruszać. Pętla bez granicy przerobi ci warstwę autoryzacji, żeby test przeszedł.
Co pilnuje uczciwości długiego przebiegu
Dział zatytułowany „Co pilnuje uczciwości długiego przebiegu”Hooki to deterministyczny opór i mają je wszystkie trzy narzędzia. Claude Code: “uruchamiaj komendy powłoki automatycznie, gdy Claude Code edytuje pliki, kończy zadania albo potrzebuje odpowiedzi”; Codex: “uruchamiaj skrypty albo narzędzia MCP w trakcie pętli agentowej”; Cursor: “działają przed zdefiniowanymi etapami pętli agenta albo po nich i mogą obserwować, blokować lub zmieniać zachowanie”. Hook Stop, który odmawia zakończenia, dopóki testy są czerwone, zmienia twoją intencję w regułę, z której przebieg się nie wygada. Zacznij od hooków w Claude Code.
Testy napisane przed przebiegiem to jedyna część wyroczni, której nie napisał agent. Na tym stoi cały argument za programowaniem sterowanym testami z agentami na tym poziomie: nie chodzi o czystość, tylko o pochodzenie.
Compound engineering sprawia, że nie każdy przebieg zaczyna się od zera. Skończony przebieg zostawia po sobie regułę, sprawdzenie albo skill, więc następny startuje dalej; mechanikę opisuje pętla, wtyczka i dowody, superpowers pakuje jej zdyscyplinowaną wersję, a grill me to przebieg dostrajający, który robi się przed długim zadaniem, a nie po nim.
Kiedy dwunastogodzinny przebieg wraca zielony i zły
Dział zatytułowany „Kiedy dwunastogodzinny przebieg wraca zielony i zły”Agent zmienił wyrocznię. Jeśli testy leżą w repozytorium i przebieg może je edytować, warunek jest sugestią. Oznacz pliki testów jako nietykalne albo trzymaj rozstrzygające sprawdzenie poza diffem: w CI, w osobnym pakiecie, w komendzie, której przebieg nie przepisze.
Długie horyzonty się sypią. SlopCodeBench, opublikowany w marcu 2026, przepuścił 15 agentów kodujących przez 36 problemów i 196 checkpointów iteracyjnego rozwijania własnej pracy: “żaden agent nie rozwiązuje w pełni żadnego problemu od początku do końca, a najlepszy przechodzi 14,8% checkpointów”, a degradację zmierzono jako erozję struktury i rozwlekłość. Dwunastogodzinny przebieg to długi horyzont. Checkpointy są po to, żeby znaleźć miejsce, w którym skręcił.
Budżet kończy się przed celem. Nieosiągalny warunek spala limit za jednym posiedzeniem. Daj przebiegowi liczbę rund i polecenie, żeby zamiast kontynuować, zdał raport.
Przebieg w ogóle nie ruszył. W Claude Code /goal jest zaimplementowane jako hook Stop o zasięgu sesji, więc nie działa, gdy ustawienia wyłączają hooki. Komenda mówi o tym wprost, zamiast milczeć, więc przeczytaj komunikat, zanim uznasz funkcję za zepsutą.
Zielony to nie to samo co poprawny. Przechodzące testy znaczą tyle, że testy przeszły. Sprawdź diff wyrywkowo w tych klasach zmian, w których przechodzący zestaw nigdy nie wystarczał: schemat, autoryzacja, cennik, wszystko, co widzi klient.