Frameworki pracy z agentami: porównanie
Framework pracy z agentami to spakowana metodyka dla agentów kodujących: ustalona kolejność kroków, artefakty, które każdy krok zostawia, oraz skille, hooki albo wtyczki, które tę kolejność wymuszają. Frameworki dzielą się na trzy rodziny — potoki spec-first, pakiety dyscypliny i harnessy orkiestracyjne — i najbardziej różnią się ceremonią oraz stałym kosztem kontekstu.
Na Slacku trwa spór: Superpowers kontra Spec Kit kontra „raz próbowaliśmy BMAD”, a argumentem są gwiazdki na GitHubie. Ta strona jest dla developera, który wybiera framework, oraz dla tech leada albo CTO, który ma go ustandaryzować: porównuje frameworki pod kątem tego, co zostawiają i ile kosztują, a potem zarysowuje pilotaż na jednej funkcji, który rozstrzyga spór dowodami.
Co zyskujesz z tego porównania frameworków
Dział zatytułowany „Co zyskujesz z tego porównania frameworków”- Trzy rodziny frameworków i problem, który rozwiązuje każda z nich.
- Dwie tabele 16 frameworków: artefakty i akceptacje, a potem obsługiwane agenty, koszt kontekstu, gwiazdki i sytuacje, w których lepiej po nie nie sięgać.
- Sprawdzony sposób na zmierzenie kosztu kontekstu za pomocą
claude plugin details. - Cztery kroki pilotażu, prompt audytowy i typowe awarie przy wdrożeniu.
Która rodzina frameworków rozwiązuje twój problem?
Dział zatytułowany „Która rodzina frameworków rozwiązuje twój problem?”Potoki spec-first zamieniają intencję w przejrzany Markdown, zanim powstanie kod: Spec Kit, OpenSpec, BMAD, Tessl, specyfikacje Kiro i AI-DLC. Sięgnij po nie, gdy po fakcie nikt nie potrafi powiedzieć, co znaczyło „gotowe”. Zobacz frameworki spec-driven, a jeśli potrzebujesz śladu audytowego — frameworki dla przedsiębiorstw.
Pakiety dyscypliny zmieniają zachowanie agenta skillami, które uruchamiają się same: Superpowers, skille Matta Pococka, Compound Engineering, addyosmani/agent-skills, gstack, Ponytail i karpathy-guidelines. Sięgnij po nie, gdy agent pomija testy, plan albo przegląd. Łączenie ich opisuje strona pakiety dyscypliny.
Harnessy orkiestracyjne dokładają subagenty, hooki, pamięć i pętle: GSD Core, pętle Ralph, Everything Claude Code (ECC) oraz harnessy wieloagentowe. Sięgnij po nie tylko wtedy, gdy chcesz godzin pracy bez nadzoru i masz testy na tyle mocne, żeby zatrzymać zły przebieg. Zobacz pętle autonomiczne.
Na drabinie autonomii odczytujemy to tak: pakiety dyscypliny sprawiają, że sesje na poziomach 2 i 3 są przewidywalne, potoki spec-first przenoszą twoje czytanie z diffu na specyfikację w drodze na poziom 4, a harnessy orkiestracyjne zakładają poziom 4 — spisaną specyfikację, warunek zatrzymania i testy, którym ufasz.
Jak wypadają frameworki w porównaniu?
Dział zatytułowany „Jak wypadają frameworki w porównaniu?”Co framework zostawia i kto to zatwierdza
Dział zatytułowany „Co framework zostawia i kto to zatwierdza”„Drabina / etap” to nasze odczytanie, jaki poziom drabiny autonomii (P2–P5) framework zakłada i na których etapach cyklu życia pojawiają się jego artefakty.
| Framework | Rodzina | Artefakty, które zostawia | Bramki ludzkie | Drabina / etap |
|---|---|---|---|---|
| Superpowers | dyscyplina | dokument projektowy, plan | akceptacja projektu i planu | P2–3 / plan, budowa |
| Skille Matta Pococka | dyscyplina | specyfikacja, tickety | wywiad uzgadniający | P2–3 / plan |
| Everything Claude Code | orkiestracja | niewymagane | przy każdej komendzie | P3–4 / budowa, automatyzacja |
| karpathy-guidelines | dyscyplina | brak | brak | P2–3 / budowa |
| Ponytail | dyscyplina | brak | brak (poziomy) | P2–3 / budowa |
| Spec Kit | spec-first | .specify/, specs/ dla każdej funkcji | po każdym kroku | P4 / plan |
| gstack | dyscyplina | dokument projektowy, plan testów (w ~/.gstack/projects/), raporty QA | przy każdej komendzie roli | P2–3 / plan, testy, wydanie |
| addyosmani/agent-skills | dyscyplina | specyfikacja, plan | przy każdej komendzie fazy | P2–3 / od planu do wydania |
| OpenSpec | spec-first | openspec/changes/, żywe openspec/specs/ | przegląd propozycji | P4 / plan |
| BMAD Method | spec-first | PRD, architektura, historyjki | przy każdym dokumencie | P4 / plan |
| Compound Engineering | dyscyplina | plany, docs/solutions/ | burza mózgów i plan | P3 / plan, wydanie |
Pętla Ralph (wtyczka ralph-loop) | orkiestracja | plik planu, historia Gita | brak wewnątrz pętli | P4–5 / automatyzacja |
| GSD Core | orkiestracja | .planning/ (roadmapa, stan, plany) | dyskusja i odbiór | P4 / plan, automatyzacja |
| AI-DLC (AWS Labs) | spec-first | plik stanu, dopisywany ślad audytowy | po każdym etapie | P4 / plan |
| Tile spec-driven-development od Tessl | spec-first | pliki .spec.md powiązane z testami | zbieranie wymagań | P4 / plan, testy |
| Specyfikacje Kiro | spec-first | .kiro/specs/<feature>/: wymagania, projekt, zadania | przy każdym dokumencie | P4 / plan |
Gdzie działa, ile kosztuje i kiedy go unikać
Dział zatytułowany „Gdzie działa, ile kosztuje i kiedy go unikać”Gwiazdki pochodzą ze stron repozytoriów, odczytane 2026-09-26; mierzą uwagę, nie użycie. Stały koszt to liczba tokenów, którą wtyczka dokłada do każdej sesji Claude Code, według projekcji claude plugin details na Claude Code 2.1.283 z tego samego dnia. „n/d” oznacza, że framework instaluje się jako pliki projektu, klon repozytorium albo osobny produkt, a nie jako zmierzona wtyczka.
| Framework | Claude Code / Codex / Cursor | Stały koszt | Gwiazdki | Unikaj, gdy |
|---|---|---|---|---|
| Superpowers | tak / tak / tak | ~838 | 291,7 tys. | drobne poprawki, brak testów |
| Skille Matta Pococka | tak / tak / tak | ~1609 | 269,8 tys. | product ownerzy muszą zatwierdzać ślad specyfikacji |
| Everything Claude Code | tak / tak / tak | ~41 515 | 268 tys. | nie zamierzasz go przyciąć |
| karpathy-guidelines | wtyczka / CLAUDE.md skopiowany jako AGENTS.md / reguła Cursora | n/d (niezmierzone) | 215,2 tys. | potrzebujesz procesu, a nie reguł zachowania |
| Ponytail | tak / tak / tak | ~983 | 146,1 tys. | chcesz, żeby decydował o zakresie, a nie o rozmiarze |
| Spec Kit | tak / tak / tak | n/d (10 skilli projektu) | 138,9 tys. | małe zmiany w istniejącym kodzie |
| gstack | tak / przez ./setup --host / przez ./setup --host | n/d (klon Git) | 134,2 tys. | masz już własny proces /review |
| addyosmani/agent-skills | tak / tak / tak | ~3620 | 99,1 tys. | używasz /review albo /ship z innego pakietu |
| OpenSpec | tak / tak / tak | n/d (6 skilli projektu) | 70,4 tys. | potrzebujesz rozbudowanego nadzoru i śladu audytowego |
| BMAD Method | tak / tak / tak | ~1676 | 53,5 tys. | małe funkcje robione w pojedynkę |
| Compound Engineering | tak / tak / tak | ~2989 | 25,3 tys. | prototypy albo nikt nie kuratoruje wniosków |
| Pętla Ralph | tylko wtyczka Claude Code | ~84 | 21,9 tys. (snarktank/ralph) | brak wyroczni testowej, sekrety na hoście |
| GSD Core | tak / tak / tak | ~10 700 | 9,9 tys. (zarchiwizowany oryginał 64,5 tys.) | sesje wrażliwe na kontekst |
| AI-DLC | tak / tak / tak | n/d (natywne CLI) | 4,8 tys. | nie potrzebujesz śladu audytowego |
| Tile Tessl | przez Tessl CLI | n/d (tile Tessl) | 54 (repozytorium tile’a) | nie chcesz zamkniętej binarki w narzędziach |
| Specyfikacje Kiro | nie / nie / nie (tylko Kiro IDE i CLI) | n/d (wbudowane w Kiro) | n/d (produkt) | zespół pracuje w Claude Code, Codeksie albo Cursorze |
Wiersze Kiro i Tessl opierają się na dokumentacji producentów, której nie mogliśmy tu uruchomić; sprawdź oba przed pilotażem. Obsługę Cursora podajemy za README każdego projektu. Jeden plik reguł dla wielu agentów opisuje synchronizacja reguł.
Kiedy nie używać żadnego frameworka?
Dział zatytułowany „Kiedy nie używać żadnego frameworka?”Pomiń frameworki przy jednolinijkowych poprawkach, prototypach do wyrzucenia i w repozytoriach bez testów. Framework dokłada kroki, nie wyrocznię testową. Jeśli agent nie może uruchomić zestawu testów, który zawiedzie przy złej odpowiedzi, zacznij od krótkiego CLAUDE.md albo AGENTS.md, kryteriów akceptacji i bramki testowej.
Zmierz koszt kontekstu dwóch frameworków przed wyborem
Dział zatytułowany „Zmierz koszt kontekstu dwóch frameworków przed wyborem”claude plugin details wypisuje komponenty wtyczki i projekcję jej kosztu w tokenach. Zainstaluj kandydatów w tymczasowym katalogu konfiguracji, żeby twoja prawdziwa konfiguracja pozostała nietknięta.
# Terminal. Tymczasowy katalog konfiguracji chroni ~/.claude.export CLAUDE_CONFIG_DIR="$(mktemp -d)"claude plugin marketplace add anthropics/claude-plugins-officialclaude plugin marketplace add EveryInc/compound-engineering-pluginclaude plugin install superpowers@claude-plugins-officialclaude plugin install compound-engineering@compound-engineering-pluginclaude plugin details superpowersclaude plugin details compound-engineeringOczekiwany wynik (skrócony; Claude Code 2.1.283, 2026-09-26):
superpowers 6.4.1 Skills (15) brainstorming, ... writing-plans, writing-skills Hooks (1) SessionStart (harness-only — no model context cost)Projected token cost Always-on: ~838 tok added to every session subagent-driven-development ... ~11.8k brainstorming ... ~6.3k
compound-engineering 3.29.0 Skills (36) ce-brainstorm, ... lfgProjected token cost Always-on: ~2,989 tok added to every sessionLiczby nieznacznie się zmieniają między wydaniami Claude Code i poszczególnych wtyczek.
Tokeny always-on płacisz w każdej sesji, on-invoke — za każdym razem, gdy skill się uruchamia. Superpowers tanio trzymać zainstalowany, ale jego skill subagent-driven-development kosztuje około 11,8 tys. tokenów przy każdym wywołaniu. Oficjalny marketplace przypina konkretny commit, więc zainstalował Superpowers 6.4.1, choć repozytorium autora było już na 6.4.2.
Codex i Cursor nie mają odpowiednika, który udało nam się sprawdzić: codex plugin w codex-cli 0.157.1 oferuje add, list, marketplace i remove, bez raportu kosztu. Tam porównaj wskaźnik kontekstu w świeżej sesji przed włączeniem frameworka i po nim. Co ten narzut robi z długimi sesjami, wyjaśnia strona o koszcie kontekstu.
Przetestuj framework pilotażowo na jednej funkcji
Dział zatytułowany „Przetestuj framework pilotażowo na jednej funkcji”Pilotaż to protokół porównawczy w skali frameworka; kartę wyników i regułę decyzji opisuje projekt pilotażu.
-
Wybierz jeden framework pod awarię, którą naprawiasz — najwyżej dwa, nigdy dwa z tej samej rodziny.
-
Zainstaluj go w zakresie projektu, na gałęzi. W Claude Code
--scope projectzapisuje marketplace i wtyczkę w.claude/settings.json; zacommituj ten plik.Okno terminala claude plugin marketplace add EveryInc/compound-engineering-plugin --scope projectclaude plugin install compound-engineering@compound-engineering-plugin --scope projectclaude plugin details compound-engineeringOkno terminala codex plugin marketplace add EveryInc/compound-engineering-plugincodex plugin add compound-engineering@compound-engineering-pluginCodex nie ma zakresu projektu dla wtyczek (codex-cli 0.157.1); instalacja obejmuje całego użytkownika, więc po pilotażu usuń wtyczkę poleceniem
codex plugin remove compound-engineering@compound-engineering-plugin./add-plugin compound-engineeringWpisz to w czacie Agenta. Komenda pochodzi z README projektu, nie z naszego testu.
-
Przeprowadź przez niego jedną prawdziwą funkcję z kryteriami akceptacji spisanymi najpierw jako testy, a tę samą funkcję bez frameworka — na gałęzi bazowej.
-
Oceń obie gałęzie tak samo, potem wdróż albo odinstaluj. Tech lead czyta wyniki i pakiet dowodów, a nie diff; dokumenty frameworka są wkładem, dowodem są testy.
Co psuje się, gdy zespół wdraża framework?
Dział zatytułowany „Co psuje się, gdy zespół wdraża framework?”| Awaria | Co widzisz | Jak naprawić |
|---|---|---|
| Dwa frameworki procesowe naraz | Dwie komendy /review, sprzeczne plany, podwójny koszt stały | Jeden framework na rodzinę; pakiet procesowy łącz tylko z Ponytail |
| Artefakty traktowane jako dowód | Piękna specyfikacja, a błąd na produkcji | Scalaj dopiero po testach i kryteriach akceptacji |
| Instalacja całego pakietu | Sesja startuje z dziesiątkami tysięcy tokenów mniej (ECC ~41 515) | Zmierz przez claude plugin details; wyłącz to, czego nie używasz |
| Pętla bez limitu | Pętla Ralph kręci się całą noc nad celem, którego nie osiągnie | Podawaj --max-iterations, uruchamiaj w sandboksie, cele na jedną sesję powierzaj wbudowanemu /goal |
Dokąd dalej w temacie frameworków
Dział zatytułowany „Dokąd dalej w temacie frameworków”Najczęstsze pytania
Czym jest framework pracy z agentami?
To spakowana metodyka pracy z agentami kodującymi: ustalona kolejność kroków, artefakty, które każdy krok zostawia, oraz skille, komendy, hooki lub wtyczki, które tę kolejność wymuszają. Większość instaluje się dziś jako wtyczki Claude Code lub Codeksa albo jako lokalne Agent Skills projektu.
Od którego frameworka zespół powinien zacząć?
Od tego, który rozwiązuje twój problem. Brak śladu specyfikacji wskazuje Spec Kit (nowy projekt) albo OpenSpec (istniejący kod); agent pomijający kroki wskazuje Superpowers albo skille Matta Pococka; lekcje, które się nie utrwalają, wskazują Compound Engineering; długie przebiegi bez nadzoru wymagają GSD Core albo pętli Ralph i mocnej wyroczni testowej. Przed wdrożeniem przetestuj framework pilotażowo na jednej funkcji.
Ile kontekstu kosztuje framework?
Pokazuje to claude plugin details w Claude Code. Na Claude Code 2.1.283 (2026-09-26) stały koszt wahał się od około 84 tokenów dla ralph-loop do około 41 515 dla Everything Claude Code; Superpowers kosztował około 838, a Compound Engineering około 2989.
Czy framework dowodzi, że wynik agenta jest poprawny?
Nie. Frameworki wytwarzają specyfikacje, plany i notatki z przeglądu. Dowodem nadal są testy, bramki typów i lintera, kryteria akceptacji oraz pakiet dowodów w pull requeście.