Przejdź do głównej zawartości

Frameworki pracy z agentami: porównanie

Framework pracy z agentami to spakowana metodyka dla agentów kodujących: ustalona kolejność kroków, artefakty, które każdy krok zostawia, oraz skille, hooki albo wtyczki, które tę kolejność wymuszają. Frameworki dzielą się na trzy rodziny — potoki spec-first, pakiety dyscypliny i harnessy orkiestracyjne — i najbardziej różnią się ceremonią oraz stałym kosztem kontekstu.

Na Slacku trwa spór: Superpowers kontra Spec Kit kontra „raz próbowaliśmy BMAD”, a argumentem są gwiazdki na GitHubie. Ta strona jest dla developera, który wybiera framework, oraz dla tech leada albo CTO, który ma go ustandaryzować: porównuje frameworki pod kątem tego, co zostawiają i ile kosztują, a potem zarysowuje pilotaż na jednej funkcji, który rozstrzyga spór dowodami.

  • Trzy rodziny frameworków i problem, który rozwiązuje każda z nich.
  • Dwie tabele 16 frameworków: artefakty i akceptacje, a potem obsługiwane agenty, koszt kontekstu, gwiazdki i sytuacje, w których lepiej po nie nie sięgać.
  • Sprawdzony sposób na zmierzenie kosztu kontekstu za pomocą claude plugin details.
  • Cztery kroki pilotażu, prompt audytowy i typowe awarie przy wdrożeniu.

Która rodzina frameworków rozwiązuje twój problem?

Dział zatytułowany „Która rodzina frameworków rozwiązuje twój problem?”

Potoki spec-first zamieniają intencję w przejrzany Markdown, zanim powstanie kod: Spec Kit, OpenSpec, BMAD, Tessl, specyfikacje Kiro i AI-DLC. Sięgnij po nie, gdy po fakcie nikt nie potrafi powiedzieć, co znaczyło „gotowe”. Zobacz frameworki spec-driven, a jeśli potrzebujesz śladu audytowego — frameworki dla przedsiębiorstw.

Pakiety dyscypliny zmieniają zachowanie agenta skillami, które uruchamiają się same: Superpowers, skille Matta Pococka, Compound Engineering, addyosmani/agent-skills, gstack, Ponytail i karpathy-guidelines. Sięgnij po nie, gdy agent pomija testy, plan albo przegląd. Łączenie ich opisuje strona pakiety dyscypliny.

Harnessy orkiestracyjne dokładają subagenty, hooki, pamięć i pętle: GSD Core, pętle Ralph, Everything Claude Code (ECC) oraz harnessy wieloagentowe. Sięgnij po nie tylko wtedy, gdy chcesz godzin pracy bez nadzoru i masz testy na tyle mocne, żeby zatrzymać zły przebieg. Zobacz pętle autonomiczne.

Na drabinie autonomii odczytujemy to tak: pakiety dyscypliny sprawiają, że sesje na poziomach 2 i 3 są przewidywalne, potoki spec-first przenoszą twoje czytanie z diffu na specyfikację w drodze na poziom 4, a harnessy orkiestracyjne zakładają poziom 4 — spisaną specyfikację, warunek zatrzymania i testy, którym ufasz.

„Drabina / etap” to nasze odczytanie, jaki poziom drabiny autonomii (P2–P5) framework zakłada i na których etapach cyklu życia pojawiają się jego artefakty.

FrameworkRodzinaArtefakty, które zostawiaBramki ludzkieDrabina / etap
Superpowersdyscyplinadokument projektowy, planakceptacja projektu i planuP2–3 / plan, budowa
Skille Matta Pocockadyscyplinaspecyfikacja, ticketywywiad uzgadniającyP2–3 / plan
Everything Claude Codeorkiestracjaniewymaganeprzy każdej komendzieP3–4 / budowa, automatyzacja
karpathy-guidelinesdyscyplinabrakbrakP2–3 / budowa
Ponytaildyscyplinabrakbrak (poziomy)P2–3 / budowa
Spec Kitspec-first.specify/, specs/ dla każdej funkcjipo każdym krokuP4 / plan
gstackdyscyplinadokument projektowy, plan testów (w ~/.gstack/projects/), raporty QAprzy każdej komendzie roliP2–3 / plan, testy, wydanie
addyosmani/agent-skillsdyscyplinaspecyfikacja, planprzy każdej komendzie fazyP2–3 / od planu do wydania
OpenSpecspec-firstopenspec/changes/, żywe openspec/specs/przegląd propozycjiP4 / plan
BMAD Methodspec-firstPRD, architektura, historyjkiprzy każdym dokumencieP4 / plan
Compound Engineeringdyscyplinaplany, docs/solutions/burza mózgów i planP3 / plan, wydanie
Pętla Ralph (wtyczka ralph-loop)orkiestracjaplik planu, historia Gitabrak wewnątrz pętliP4–5 / automatyzacja
GSD Coreorkiestracja.planning/ (roadmapa, stan, plany)dyskusja i odbiórP4 / plan, automatyzacja
AI-DLC (AWS Labs)spec-firstplik stanu, dopisywany ślad audytowypo każdym etapieP4 / plan
Tile spec-driven-development od Tesslspec-firstpliki .spec.md powiązane z testamizbieranie wymagańP4 / plan, testy
Specyfikacje Kirospec-first.kiro/specs/<feature>/: wymagania, projekt, zadaniaprzy każdym dokumencieP4 / plan

Gwiazdki pochodzą ze stron repozytoriów, odczytane 2026-09-26; mierzą uwagę, nie użycie. Stały koszt to liczba tokenów, którą wtyczka dokłada do każdej sesji Claude Code, według projekcji claude plugin details na Claude Code 2.1.283 z tego samego dnia. „n/d” oznacza, że framework instaluje się jako pliki projektu, klon repozytorium albo osobny produkt, a nie jako zmierzona wtyczka.

FrameworkClaude Code / Codex / CursorStały kosztGwiazdkiUnikaj, gdy
Superpowerstak / tak / tak~838291,7 tys.drobne poprawki, brak testów
Skille Matta Pocockatak / tak / tak~1609269,8 tys.product ownerzy muszą zatwierdzać ślad specyfikacji
Everything Claude Codetak / tak / tak~41 515268 tys.nie zamierzasz go przyciąć
karpathy-guidelineswtyczka / CLAUDE.md skopiowany jako AGENTS.md / reguła Cursoran/d (niezmierzone)215,2 tys.potrzebujesz procesu, a nie reguł zachowania
Ponytailtak / tak / tak~983146,1 tys.chcesz, żeby decydował o zakresie, a nie o rozmiarze
Spec Kittak / tak / takn/d (10 skilli projektu)138,9 tys.małe zmiany w istniejącym kodzie
gstacktak / przez ./setup --host / przez ./setup --hostn/d (klon Git)134,2 tys.masz już własny proces /review
addyosmani/agent-skillstak / tak / tak~362099,1 tys.używasz /review albo /ship z innego pakietu
OpenSpectak / tak / takn/d (6 skilli projektu)70,4 tys.potrzebujesz rozbudowanego nadzoru i śladu audytowego
BMAD Methodtak / tak / tak~167653,5 tys.małe funkcje robione w pojedynkę
Compound Engineeringtak / tak / tak~298925,3 tys.prototypy albo nikt nie kuratoruje wniosków
Pętla Ralphtylko wtyczka Claude Code~8421,9 tys. (snarktank/ralph)brak wyroczni testowej, sekrety na hoście
GSD Coretak / tak / tak~10 7009,9 tys. (zarchiwizowany oryginał 64,5 tys.)sesje wrażliwe na kontekst
AI-DLCtak / tak / takn/d (natywne CLI)4,8 tys.nie potrzebujesz śladu audytowego
Tile Tesslprzez Tessl CLIn/d (tile Tessl)54 (repozytorium tile’a)nie chcesz zamkniętej binarki w narzędziach
Specyfikacje Kironie / nie / nie (tylko Kiro IDE i CLI)n/d (wbudowane w Kiro)n/d (produkt)zespół pracuje w Claude Code, Codeksie albo Cursorze

Wiersze Kiro i Tessl opierają się na dokumentacji producentów, której nie mogliśmy tu uruchomić; sprawdź oba przed pilotażem. Obsługę Cursora podajemy za README każdego projektu. Jeden plik reguł dla wielu agentów opisuje synchronizacja reguł.

Pomiń frameworki przy jednolinijkowych poprawkach, prototypach do wyrzucenia i w repozytoriach bez testów. Framework dokłada kroki, nie wyrocznię testową. Jeśli agent nie może uruchomić zestawu testów, który zawiedzie przy złej odpowiedzi, zacznij od krótkiego CLAUDE.md albo AGENTS.md, kryteriów akceptacji i bramki testowej.

Zmierz koszt kontekstu dwóch frameworków przed wyborem

Dział zatytułowany „Zmierz koszt kontekstu dwóch frameworków przed wyborem”

claude plugin details wypisuje komponenty wtyczki i projekcję jej kosztu w tokenach. Zainstaluj kandydatów w tymczasowym katalogu konfiguracji, żeby twoja prawdziwa konfiguracja pozostała nietknięta.

Okno terminala
# Terminal. Tymczasowy katalog konfiguracji chroni ~/.claude.
export CLAUDE_CONFIG_DIR="$(mktemp -d)"
claude plugin marketplace add anthropics/claude-plugins-official
claude plugin marketplace add EveryInc/compound-engineering-plugin
claude plugin install superpowers@claude-plugins-official
claude plugin install compound-engineering@compound-engineering-plugin
claude plugin details superpowers
claude plugin details compound-engineering

Oczekiwany wynik (skrócony; Claude Code 2.1.283, 2026-09-26):

superpowers 6.4.1
Skills (15) brainstorming, ... writing-plans, writing-skills
Hooks (1) SessionStart (harness-only — no model context cost)
Projected token cost
Always-on: ~838 tok added to every session
subagent-driven-development ... ~11.8k
brainstorming ... ~6.3k
compound-engineering 3.29.0
Skills (36) ce-brainstorm, ... lfg
Projected token cost
Always-on: ~2,989 tok added to every session

Liczby nieznacznie się zmieniają między wydaniami Claude Code i poszczególnych wtyczek.

Tokeny always-on płacisz w każdej sesji, on-invoke — za każdym razem, gdy skill się uruchamia. Superpowers tanio trzymać zainstalowany, ale jego skill subagent-driven-development kosztuje około 11,8 tys. tokenów przy każdym wywołaniu. Oficjalny marketplace przypina konkretny commit, więc zainstalował Superpowers 6.4.1, choć repozytorium autora było już na 6.4.2.

Codex i Cursor nie mają odpowiednika, który udało nam się sprawdzić: codex plugin w codex-cli 0.157.1 oferuje add, list, marketplace i remove, bez raportu kosztu. Tam porównaj wskaźnik kontekstu w świeżej sesji przed włączeniem frameworka i po nim. Co ten narzut robi z długimi sesjami, wyjaśnia strona o koszcie kontekstu.

Pilotaż to protokół porównawczy w skali frameworka; kartę wyników i regułę decyzji opisuje projekt pilotażu.

  1. Wybierz jeden framework pod awarię, którą naprawiasz — najwyżej dwa, nigdy dwa z tej samej rodziny.

  2. Zainstaluj go w zakresie projektu, na gałęzi. W Claude Code --scope project zapisuje marketplace i wtyczkę w .claude/settings.json; zacommituj ten plik.

    Okno terminala
    claude plugin marketplace add EveryInc/compound-engineering-plugin --scope project
    claude plugin install compound-engineering@compound-engineering-plugin --scope project
    claude plugin details compound-engineering
  3. Przeprowadź przez niego jedną prawdziwą funkcję z kryteriami akceptacji spisanymi najpierw jako testy, a tę samą funkcję bez frameworka — na gałęzi bazowej.

  4. Oceń obie gałęzie tak samo, potem wdróż albo odinstaluj. Tech lead czyta wyniki i pakiet dowodów, a nie diff; dokumenty frameworka są wkładem, dowodem są testy.

AwariaCo widziszJak naprawić
Dwa frameworki procesowe narazDwie komendy /review, sprzeczne plany, podwójny koszt stałyJeden framework na rodzinę; pakiet procesowy łącz tylko z Ponytail
Artefakty traktowane jako dowódPiękna specyfikacja, a błąd na produkcjiScalaj dopiero po testach i kryteriach akceptacji
Instalacja całego pakietuSesja startuje z dziesiątkami tysięcy tokenów mniej (ECC ~41 515)Zmierz przez claude plugin details; wyłącz to, czego nie używasz
Pętla bez limituPętla Ralph kręci się całą noc nad celem, którego nie osiągniePodawaj --max-iterations, uruchamiaj w sandboksie, cele na jedną sesję powierzaj wbudowanemu /goal

Najczęstsze pytania

Czym jest framework pracy z agentami?

To spakowana metodyka pracy z agentami kodującymi: ustalona kolejność kroków, artefakty, które każdy krok zostawia, oraz skille, komendy, hooki lub wtyczki, które tę kolejność wymuszają. Większość instaluje się dziś jako wtyczki Claude Code lub Codeksa albo jako lokalne Agent Skills projektu.

Od którego frameworka zespół powinien zacząć?

Od tego, który rozwiązuje twój problem. Brak śladu specyfikacji wskazuje Spec Kit (nowy projekt) albo OpenSpec (istniejący kod); agent pomijający kroki wskazuje Superpowers albo skille Matta Pococka; lekcje, które się nie utrwalają, wskazują Compound Engineering; długie przebiegi bez nadzoru wymagają GSD Core albo pętli Ralph i mocnej wyroczni testowej. Przed wdrożeniem przetestuj framework pilotażowo na jednej funkcji.

Ile kontekstu kosztuje framework?

Pokazuje to claude plugin details w Claude Code. Na Claude Code 2.1.283 (2026-09-26) stały koszt wahał się od około 84 tokenów dla ralph-loop do około 41 515 dla Everything Claude Code; Superpowers kosztował około 838, a Compound Engineering około 2989.

Czy framework dowodzi, że wynik agenta jest poprawny?

Nie. Frameworki wytwarzają specyfikacje, plany i notatki z przeglądu. Dowodem nadal są testy, bramki typów i lintera, kryteria akceptacji oraz pakiet dowodów w pull requeście.

Edytuj stronę

Ostatnia aktualizacja:

Cytuj tę stronę — https://developertoolkit.ai/pl/ecosystem/frameworks/, developertoolkit.ai