Przejdź do głównej zawartości

Ocena i iteracja oparte na dowodach

Score designu jest użyteczny tylko wtedy, gdy każdy punkt wynika z obserwowalnego dowodu i decyzji nazwanego approvera. Agent tworzący może wykonać pierwszą krytykę, lecz nie certyfikuje własnej pracy. Połącz deterministyczne checki, świeże review i ludzki judgment produktu lub designu; zapisuj defekty i dyspozycje zamiast promptować do deklaracji 10/10.

Zgodność z intencją

Czy artefakt spełnia zaakceptowany outcome i non-goals? Cytuj każde kryterium.

Kompletność stanów

Czy zawiera wymagane states, breakpointy, copy, keyboard paths i failures?

Spójność systemu

Czy używa kanonicznych tokens, components, interactions i terminology?

Jakość dowodów

Czy inny reviewer odtworzy state, route, viewport, check i finding?

Oceń każdy wymiar 0–10, a jako wynik handoffu przyjmij minimum. 10 nie oznacza „wygląda świetnie”; każde kryterium ma odtwarzalny dowód i nie ma otwartego blokera. Dla zwykłej pracy ustaw jawny próg, np. 9/10 bez finding wysokiej wagi i z wymaganą ludzką akceptacją.

Zrecenzuj ARTIFACT względem ACCEPTANCE_CRITERIA jako niezależny reviewer.
Dla każdego kryterium zwróć pass, fail lub not-tested wraz z dowodem.
Oceń zgodność z intencją, kompletność stanów, spójność systemu
i jakość dowodów 0-10; overall to minimum.
Wypisz blokery, gaps i ownera każdej decyzji manualnej.
Nie edytuj artefaktu podczas review.

Po poprawkach uruchom tę samą checklistę w świeżym kontekście. Zachowaj poprzednie findings i oznacz je jako fixed, accepted, duplicate lub open.

Zatrzymaj pętlę i przekaż człowiekowi, gdy:

  • brakuje decyzji product, brand, legal, privacy lub accessibility;
  • dwie iteracje nie poprawiają tego samego kryterium;
  • narzędzie nie potrafi odtworzyć artefaktu lub zebrać dowodów;
  • poprawka zmienia zaakceptowaną intencję lub architekturę;
  • próg jest osiągnięty, a reszta luk ma jawne dyspozycje.

Score rośnie, artefakt nie. Wymagaj dowodu per kryterium i porównuj rzeczywistą wersję, nie summary agenta.

Wszystko dostaje 10/10. Zaostrz kryteria, dodaj negatywne states i kalibruj wyniki z ludzkim review.

Review edytuje artefakt. Oddziel read-only review od osobno autoryzowanego fix task.

Taste przykrywa jakość funkcjonalną. Najpierw blokuj na intencji, states, accessibility i system constraints.

  • Rubryka wskazuje kryteria i wersje artefaktu.
  • Każdy failing score ma odtwarzalny dowód.
  • Świeży review potwierdza poprawki.
  • Decyzje człowieka mają ownerów i dyspozycje.
  • Pętla ma próg i jawne stop conditions.
  • Zaakceptowany score i dowody idą do następnego etapu SDLC.

Stosuj rubrykę na każdym handoffie pipeline czterech artefaktów.