Stan inżynierii agentowej, sierpień 2026
Inżynieria agentowa to dyscyplina kierowania omylnymi agentami kodującymi bez utraty poprawności, bezpieczeństwa i smaku, a dane z sierpnia 2026 pokazują, że udział kodu pisanego przez agentów rośnie: ponad 80% scalanego kodu w Anthropic, 42% kodu z commitów z udziałem AI według Sonara, średnio 51,9% w panelu DX za drugi kwartał. Otwarte pozostaje pytanie, na którym poziomie autonomii pracuje zespół.
CTO pyta, jaki procent kodbazy piszą agenci. Lead odpowiada, że 40%. Programista, który tych agentów prowadzi, wie, że połowa tych linii to testy napisane przez agenta do własnej zmiany. Trzy osoby, trzy szczeble jednej drabiny, i nikt nie umie jej nazwać.
Co daje ten przegląd dowodów z sierpnia 2026
Dział zatytułowany „Co daje ten przegląd dowodów z sierpnia 2026”- Tabelę dowodów ze źródłami: każda liczba z wydawcą, datą i jednostką
- Sześciostopniową drabinę Shapiro i pięciokrokowy test, którym sam się na niej umieścisz
- Sześć stanowisk fabryki, przy każdym po jednej udokumentowanej funkcji w Claude Code, Codeksie i Cursorze
- Kontrdowody w pełnej sile: METR, Faros, DORA, SlopCodeBench
- Trzy prompty: audyt poziomu, projekt warunku stopu, kontrakt stanowiska
Dlaczego 100% kodu napiszą agenci
Dział zatytułowany „Dlaczego 100% kodu napiszą agenci”Argumentem jest trajektoria, a żadna pojedyncza liczba jej nie rozstrzyga.
| Miara | Wtedy | Teraz | Źródło |
|---|---|---|---|
| Linie od Claude scalone w Anthropic | “niski jednocyfrowy procent”, luty 2025 | “ponad 80%” | Anthropic, “stan na maj 2026” |
| Udział kodu od AI, ponad 400 firm | 27,4%, I kw. 2026 | średnio 51,9% | DX, 17 czerwca 2026 |
| Kod w commitach zgłoszony jako wygenerowany lub wspierany przez AI | nie mierzono | 42% | Sonar, 8 stycznia 2026 |
| Pull requesty Stripe tygodniowo, bez kodu pisanego przez człowieka | “ponad tysiąc” | “ponad 1300” | Stripe, 19 lutego 2026 |
| Kod scalony w Anthropic na inżyniera dziennie | poziom bazowy 2024 | 8x | Anthropic, II kw. 2026 |
Na poziomie pojedynczej osoby dochodzi do 100% i tam zostaje. Boris Cherny powiedział Fortune 29 stycznia 2026: “U mnie osobiście to 100% od ponad dwóch miesięcy, nie robię ręcznie nawet drobnych poprawek”. “Roon” z OpenAI, w tym samym tekście: “100%, już nie piszę kodu”.
Dario Amodei zapowiedział to w Council on Foreign Relations 10 marca 2025: AI napisze “90 procent kodu” w ciągu trzech do sześciu miesięcy, a “praktycznie cały kod” w ciągu dwunastu. Rozliczmy to uczciwie. Osiemnaście miesięcy później zapowiedź trzyma się wewnątrz Anthropic, którego rzecznik podał Fortune przedział “od 70% do 90%”, i nie sprawdza się dla branży, której najlepszą serią jest 51,9% od DX. Fast Company podaje, że Sundar Pichai wskazał w kwietniu 2026 na 75% nowego kodu w Google, ale żadne pierwotne źródło Google tego nie mówi, więc to doniesienie prasowe.
Co naprawdę mierzą liczby o “procencie kodu”
Dział zatytułowany „Co naprawdę mierzą liczby o “procencie kodu””Każdy z tych procentów liczy linie, a linie są najtańszym, co agent produkuje. Ryan Greenblatt z Redwood Research postawił ten zarzut precyzyjnie 22 października 2025: “Wzrost produktywności przy danym udziale wygenerowanego kodu nie jest aż tak duży, bo AI pozwala tanio wytwarzać mnóstwo kodu o bardzo niskiej wartości”.
Anthropic stawia tę samą granicę: kierownictwo szacowało 90% i więcej “wliczając skrypty i kod eksperymentalny”, a opublikowana liczba mierzy “udział linii scalonych do produkcji, które można przypisać Claude’owi”. Dwa zakresy, jeden nagłówek.
Objętość niesie to samo ostrzeżenie. DX zmierzył medianę wielkości pull requesta “rosnącą z 44 do 72 linii na pull request między lipcem 2025 a czerwcem 2026”. Rosnący udział AI i prawie podwojony diff to jedno zdarzenie opisane dwa razy, a drugi opis mówi, kto za to płaci.
Czym jest inżynieria agentowa?
Dział zatytułowany „Czym jest inżynieria agentowa?”Andrej Karpathy nazwał tę dyscyplinę w swoim podsumowaniu Sequoia Ascent z 30 kwietnia 2026:
“Nazywam to inżynierią agentową, bo to dyscyplina inżynierska. Masz agentów, czyli byty poszarpane (spiky entities). Są omylne i stochastyczne, ale wyjątkowo mocne. Jak je skoordynować, żeby iść szybciej bez schodzenia poniżej własnego progu jakości?
Vibe coding podnosi podłogę. Inżynieria agentowa polega na rozciąganiu sufitu.”
Ograniczenie stawia wprost: “Nie wolno ci wprowadzać podatności dlatego, że robisz vibe coding. Nadal odpowiadasz za swoje oprogramowanie, tak samo jak wcześniej”. Vibe coding podnosi podłogę wszystkim. Inżynieria agentowa mówi o tym, co dzieje się z progiem jakości, gdy przestają pisać ci, którzy potrafią budować oprogramowanie. Definicja otwierająca tę stronę streszcza ten fragment, nie jest cytatem.
Nazywa też, co zmieniło się pod spodem: “Jednostka programowania przesunęła się z pisania linii kodu na delegowanie większych ‘makrodziałań’”. O samych agentach mówi bez komplementów: “Na razie agenci są jak stażyści. Nadal odpowiadasz za estetykę, osąd, smak i nadzór”. Zdanie, które cytuje z aprobatą, nie podając autora, nazywa koszt: “Myślenie możesz zlecić na zewnątrz, ale zrozumienia nie”.
Na którym poziomie drabiny autonomii jesteś?
Dział zatytułowany „Na którym poziomie drabiny autonomii jesteś?”Dan Shapiro opublikował ten model 23 stycznia 2026 jako “The Five Levels: from Spicy Autocomplete to the Dark Factory”, wzorując się na skali automatyzacji NHTSA. Numeracja zaczyna się od zera, więc pod tytułem mówiącym o pięciu poziomach siedzi sześć szczebli. Notatka Simona Willisona z 28 stycznia wskazuje zespół z poziomu 5: to dywizja AI w StrongDM.
| Poziom | Nazwa u Shapiro | Kto pisze | Kto czyta | Jak to wygląda |
|---|---|---|---|---|
| L0 | Ostre autouzupełnianie | Człowiek | Człowiek | “żaden znak nie trafia na dysk bez twojej zgody” |
| L1 | Stażysta od kodu | Człowiek | Człowiek | “oddajesz stażyście AI konkretne, wydzielone zadania” |
| L2 | Junior | Człowiek i agent | Człowiek | “czujesz, że skończyłeś. Ale nie skończyłeś” |
| L3 | Programista | AI | Recenzent | “Twoje życie to diffy.” |
| L4 | Zespół inżynierski | AI | Testy | “wychodzisz na 12 godzin i sprawdzasz, czy testy przechodzą” |
| L5 | Ciemna fabryka oprogramowania | AI | Nikt | “To czarna skrzynka, która zamienia specyfikacje w oprogramowanie.” |
Poradniki według szczebla. L1 i L2: szybkie starty dla Claude Code, Codeksa, Cursora. L3: floty agentów, widok agenta. L4: goal, loop, hooki. L5: fabryki oprogramowania.
Poziom 2 Shapiro nazywa miejscem, “gdzie mieszka dziś 90% programistów ‘AI-native’”, o poziomie 3 mówi “prawie wszyscy zatrzymują się tutaj”, siebie umieszcza na poziomie 4, a na poziomie 5 widzi “garstkę ludzi”, u których “ludzie nie są ani potrzebni, ani mile widziani”.
Przejdź ten test na repozytorium, nie na wrażeniu. Pierwszy krok, na który nie masz dowodu, jest twoim sufitem.
- Z L0 na L1. Czy na dysk trafia kod, którego nie napisałeś?
- Z L1 na L2. Oddajesz całe zadania z kryteriami akceptacji, czy tylko podpowiedzi wewnątrz funkcji, którą właśnie piszesz?
- Z L2 na L3. Czy agent pracuje bez nadzoru na tyle długo, że jego robotę spotykasz jako diff? To zmiana zawodu, nie zmiana tempa.
- Z L3 na L4. Czy masz warunek stopu, który maszyna umie ocenić, zapisany jako komendy kończące się kodem 0? Poziom 4 definiuje wyjście z pokoju.
- Z L4 na L5. Czy cokolwiek zostaje scalone, czego nie przeczytał człowiek, i umiesz nazwać wyrocznię, która to zabezpieczyła?
Jak wygląda fabryka oprogramowania z poziomu 5 na produkcji?
Dział zatytułowany „Jak wygląda fabryka oprogramowania z poziomu 5 na produkcji?”Najbardziej szczegółowy opublikowany opis ma Stripe. Jego Minions to jednorazowi agenci działający od początku do końca, zbudowani na “forku agenta kodującego goose od Blocka” i sięgający do Toolshed z “blisko 500 narzędziami MCP”. Do 19 lutego 2026 “ponad 1300 pull requestów Stripe… scalanych co tydzień powstaje w całości u minionów, jest przeglądanych przez człowieka i nie zawiera ani linii napisanej przez człowieka”. Trzy decyzje warto skopiować wcześniej niż słownictwo:
- Pętla ma twardy limit. Stripe dopuszcza “najwyżej dwie rundy CI”, a potem “odsyłamy gałąź do jej ludzkiego operatora do ręcznej kontroli”.
- Workflow jest kodem. “Blueprints to workflowy zdefiniowane w kodzie, które kierują przebiegiem miniona”, a kończy się to “maszyną stanów mieszającą deterministyczne węzły kodu ze swobodnymi węzłami agentowymi”.
- Wyrocznia była wcześniej niż agenci. Miniony pracują przeciwko “ogromnej, istniejącej już baterii testów Stripe — ponad trzem milionom”.
Badanie wdrożenia w Microsofcie jest miarą w skali populacji. Murphy-Hill, Butler i Savelieva prześledzili wdrożenie Claude Code i GitHub Copilot CLI z początku 2026 wśród “dziesiątek tysięcy inżynierów”. Ci, którzy je przyjęli, “scalili mniej więcej o 24% więcej pull requestów, niż scaliliby bez nich”, z zastrzeżeniem: “scalony PR to nie to samo co wartość, którą przynosi”.
Gas Town Yegge’a nazywa role, gdy agentów robi się więcej: “Ugotuj formułę, rzuć ją polecatowi, świadek patrzy, rafineria scala”. Tim Sehn z DoltHuba zmierzył jeden dzień: “Całe to sześćdziesięciominutowe doświadczenie kosztowało mnie jakieś 100 dolarów w tokenach Claude’a”. Tydzień kosztował 3000 dolarów.
Framework BCG Platinion z marca 2026 układa to w pięć filarów: model operacyjny sterowany intencją, skodyfikowana wiedza, przekwalifikowanie zespołu, zaprojektowanie fabryki, nadzór. Weź strukturę, pomiń mnożniki: bez populacji, bez metody. Zdanie, które zostaje: “Zmiana definiująca nie polega na braku ludzi, tylko na przeniesieniu ludzkiego wysiłku”. Alexander Opalic, z fotela programisty: “programiści przestają pisać kod ręcznie… a projektują i ulepszają fabrykę”.
Sześć stanowisk fabryki oprogramowania
Dział zatytułowany „Sześć stanowisk fabryki oprogramowania”Taksonomia Alexeya Grigoriewa z lipca 2026 nazywa cztery etapy, obok inżynierii promptów: inżynierię kontekstu (co agent wie, zanim ruszy), inżynierię pętli (kiedy przestaje pracować) i inżynierię grafową (kto co robi, gdy agentów jest więcej niż jeden). Dołóż to, co wolno uruchomić, i to, co wychodzi na produkcję, a stanowisk jest sześć. Każdą komórkę poniżej pobrano z dokumentacji producenta 28 sierpnia 2026.
| Stanowisko | Rozstrzyga | Claude Code | Codex | Cursor |
|---|---|---|---|---|
| Intencja | Co agent wie na starcie | CLAUDE.md | AGENTS.md | Rules |
| Harness | Co uruchamia się przy każdej zmianie | Hooks | Hooks | Hooks |
| Pętla | Kiedy przestaje | /goal | /goal | /goal |
| Graf | Kto co robi | Subagents | Subagents | Subagents |
| Weryfikacja | Co to udowadnia | /code-review | /review | Bugbot |
| Wydanie | Jak trafia na produkcję | Actions | Codex Action | Actions |
Kolumny różnią trzy szczegóły. Claude Code domyślnie ogranicza liczbę równoległych subagentów do 20 na sesję. Cursor wypuścił /goal 19 sierpnia 2026, a tego samego dnia subagentów działających na własnych maszynach wirtualnych, z “izolowaną kopią projektu i czystym kontekstem”. /loop to wbudowany skill w Claude Code, a od Cursora 3.5 (20 maja 2026) także skill dołączony do Cursora: „With /loop, Cursor can run a prompt repeatedly on a local schedule, until a certain outcome is achieved, or until you stop it.” Codex nie ma /loop i pokrywa cykliczność przez /goal i Automations.
To weryfikacja rozstrzyga, czy reszta jest bezpieczna, jak pisze Naresh B A na dev.to: “Model może argumentować, że jego praca jest skończona. Deterministyczny walidator może udowodnić, że brakuje wymaganego pola”. Peter Steinberger, cytowany przez Grigoriewa: “Nie powinieneś już promptować agentów kodujących. Powinieneś projektować pętle, które promptują twoich agentów”. Matryca stanowisko po stanowisku, z każdą udokumentowaną funkcją każdego narzędzia, to strona poziomu 5 drabiny, która ukaże się jako następna; strona drabiny linkuje to, co jest już opublikowane.
Co mówią dowody przeciw autonomii?
Dział zatytułowany „Co mówią dowody przeciw autonomii?”METR nigdy nie zmierzył przyspieszenia. W badaniu z randomizacją z 2025 roku, na 16 doświadczonych programistach open source i 246 zgłoszeniach, wyszło, że “korzystanie z AI wydłuża zadania o 19%, przy przedziale ufności od +2% do +39%”, a ci sami programiści po wszystkim wciąż uważali, że przyspieszyli o 20%. Aktualizacja z lutego 2026 szacuje “przyspieszenie o -18%, przy przedziale ufności od -38% do +9%” dla pierwotnej grupy i “-4%, przy przedziale ufności od -15% do +9%” dla nowo rekrutowanych. Oba przedziały przechodzą przez zero, a METR odcina się od własnego narzędzia: nowe dane “dają nam niewiarygodny sygnał o bieżącym wpływie narzędzi AI na produktywność”. W żadnym z tych wpisów nie ma dodatniego oszacowania punktowego. Powoływanie się na METR jako na dowód przyspieszenia odwraca znak.
Faros zmierzył szarpnięcie. Dwa lata telemetrii, 22 000 programistów, ponad 4000 zespołów, kwiecień 2026. Przepustowość w górę: epiki na programistę +66,2%, zadania +33,7%, tempo scalania +16,2%. Jakość w tym samym okresie w dół: błędy na programistę +54%, incydenty na pull request +242,7%, churn +861%, pull requesty scalane bez review +31,3%. Dwie metryki review poruszają się osobno i osobno trzeba je nazywać: mediana czasu w review wzrosła o 441,5%, a czas do pierwszego review o 156,6%.
DORA nazwała mechanizm wcześniej. Raport z 2025 roku znalazł “dodatnią zależność między adopcją AI a przepustowością dostarczania oprogramowania i wydajnością produktu”, a jednocześnie, że “adopcja AI nadal ma ujemną zależność ze stabilnością dostarczania oprogramowania”. Wyjaśnienie: “Bez solidnych systemów kontroli, takich jak mocne testy automatyczne, dojrzałe praktyki kontroli wersji i szybkie pętle zwrotne, wzrost liczby zmian prowadzi do niestabilności”.
SlopCodeBench zmierzył rozkład. Na 36 problemach, 196 checkpointach i 15 agentach rozwijających własne wcześniejsze rozwiązania “żaden agent nie rozwiązuje w pełni żadnego problemu od początku do końca, a najlepszy przechodzi 14,8% checkpointów”. Wystąpienie Dexa Horthy’ego na AI Engineer World’s Fair, “Harness Engineering is not Enough: Why Software Factories Fail”, stawia tę samą tezę. Oba opisujemy w fabrykach oprogramowania.
Jak drabina odpowiada na kontrdowody
Dział zatytułowany „Jak drabina odpowiada na kontrdowody”Nic z tego nie przemawia za zostaniem na poziomie 2. Przemawia za tym, jak zespół ma się wspinać. Autonomię zdobywa się pętla po pętli, wobec wyroczni weryfikacyjnej, a nie ogłasza dla całej kodbazy, a METR mierzył delegowanie bez ograniczeń i bez wyroczni w pętli. Faros zmierzył generowanie, które skalowało się szybciej niż weryfikacja, czyli sufit poziomu 3 widziany w telemetrii: większość zespołów zatrzymuje przepustowość review, a nie możliwości modelu. Wspinaczka polega na dodaniu dowodu, nie na usunięciu czytelnika. Uczciwym testem jest Stripe: skalowało się na trzech milionach testów i zostawiło człowieka na końcu drugiej rundy.
Co w inżynierii agentowej zostaje przy człowieku?
Dział zatytułowany „Co w inżynierii agentowej zostaje przy człowieku?”Sześć obowiązków przetrwa każdy szczebel poniżej ciemnej fabryki.
- Smak. Karpathy: “odpowiadasz za smak, inżynierię, projekt i za to, czy system ma sens”.
- Architektura. “Nadal musisz rozumieć podstawy”, bo “nie będziesz dobrym reżyserem, jeśli nie rozumiesz”. DORA: “Zespoły pracujące w luźno powiązanych architekturach, z szybkimi pętlami zwrotnymi, notują zyski”.
- Kierunek produktu. Karpathy: “Sam staję się wąskim gardłem w tym, żeby w ogóle wiedzieć, co próbujemy zbudować, po co to robić i jak kierować agentami”. Człowiek z poziomu 4 u Shapiro pisze specyfikację.
- Projekt ewaluacji i warunku stopu. Shapiro: “wychodzisz na 12 godzin i sprawdzasz, czy testy przechodzą”. Stripe: dwie rundy CI na trzech milionach testów, potem człowiek.
- Uprawnienia. To, co agent może uruchomić bez nadzoru, jest decyzją projektową. Codex dokumentuje politykę zatwierdzeń określającą, “kiedy Codex musi cię zapytać, zanim wykona działanie”. Claude Code stawia przed trybem auto klasyfikator.
- Decyzja, żeby czegoś nie automatyzować. Linear: “agenta nie da się pociągnąć do odpowiedzialności”, więc “zgłoszenia można przypisywać tylko ludziom, a agentom tylko delegować”.
Ta lista opisuje poziom 4, na którym leżą dowody, a nie poziom 5, który Shapiro definiuje przez jej brak: “ludzie nie są ani potrzebni, ani mile widziani” opisuje garstkę malutkich zespołów, a nie opublikowaną drogę. Więcej w tekście o człowieku w pętli.
Gotowe prompty, które umieszczą twoją pracę na drabinie
Dział zatytułowany „Gotowe prompty, które umieszczą twoją pracę na drabinie”Pierwszy uruchom na repozytorium, z którego wysyłasz na produkcję.
Gdzie te liczby się sypią
Dział zatytułowany „Gdzie te liczby się sypią”Pięć sposobów, na jakie te dowody bywają nadużywane, i wyjście z każdego.
- Czytanie “procentu linii” jako “procentu pracy”. Przypis Anthropic i krytyka Redwood odmawiają tego kroku. Do każdej liczby o udziale dołóż liczbę o pracy, którą ten sam zespół kontroluje: czas review, incydenty na pull request.
- Cytowanie połowy Farosa. +66,2% epików i +242,7% incydentów pochodzą z jednego zbioru telemetrii. Cytuj przepustowość i jakość razem albo wcale, a metryki review trzymaj osobno.
- Ogłaszanie poziomu dla całej firmy. Pętla migracyjna z deterministycznym walidatorem może chodzić na poziomie 4, podczas gdy praca nad funkcjami obok siedzi na poziomie 2. Przypisuj poziom pętla po pętli i nazywaj jej wyrocznię.
- Podawanie wewnętrznego udziału producenta jako stawki branżowej. Anthropic, Stripe, Google i Cherny raportują o sobie. Po liczbę branżową sięgnij do 51,9% od DX albo 42% od Sonara.
- Publikowanie przeterminowanych informacji o funkcjach. Cursor nie miał
/goaldo 19 sierpnia 2026, a dziś nazywa je “długo żyjącym celem, do którego pracuje się aż do pełnego ukończenia”. Codex dokumentuje/goal, a nie/loop. Pobierz stronę producenta ponownie tego dnia, którego publikujesz.
Dokąd dalej na drabinie
Dział zatytułowany „Dokąd dalej na drabinie”- Shapiro, “The Five Levels”, 23 stycznia 2026. https://www.danshapiro.com/blog/2026/01/the-five-levels-from-spicy-autocomplete-to-the-software-factory/
- Simon Willison, ten sam tytuł, 28 stycznia 2026. https://simonwillison.net/2026/Jan/28/the-five-levels/
- Karpathy, “Sequoia Ascent 2026”, 30 kwietnia 2026. https://karpathy.bearblog.dev/sequoia-ascent-2026/
- Anthropic, “When AI builds itself”, bez daty (“stan na maj 2026”). https://www.anthropic.com/institute/recursive-self-improvement
- Fortune, “Top engineers at Anthropic, OpenAI say AI now writes 100% of their code”, 29 stycznia 2026, i “The head of Claude Code hasn’t ‘written a line of code by hand’ in 8 months”, 11 czerwca 2026. https://fortune.com/2026/01/29/100-percent-of-code-at-anthropic-and-openai-is-now-ai-written-boris-cherny-roon/ i https://fortune.com/2026/06/11/anthropic-claude-boris-cherny-doesnt-write-code-by-hand-anymore/
- DX, “AI-authored code has nearly doubled”, 17 czerwca 2026. https://newsletter.getdx.com/p/ai-authored-code-has-nearly-doubled
- Sonar, “State of Code Developer Survey”, 8 stycznia 2026. https://www.sonarsource.com/blog/state-of-code-developer-survey-report-the-current-reality-of-ai-coding/
- Murphy-Hill, Butler i Savelieva, “Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft’s Early 2026 Rollout of Claude Code and GitHub Copilot CLI”, arXiv:2607.01418, 1 lipca 2026. https://arxiv.org/abs/2607.01418
- Stripe, “Minions”, 9 i 19 lutego 2026. https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents i https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents-part-2
- Ryan Greenblatt, Redwood Research, “Is 90% of code at Anthropic being written by AIs?”, 22 października 2025. https://blog.redwoodresearch.org/p/is-90-of-code-at-anthropic-being
- METR, “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity”, 10 lipca 2025, i “We are Changing our Developer Productivity Experiment Design”, 24 lutego 2026. https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/ i https://metr.org/blog/2026-02-24-uplift-update/
- Faros AI, “The Acceleration Whiplash”, kwiecień 2026. https://www.faros.ai/blog/ai-acceleration-whiplash-takeaways
- Google Cloud, “2025 DORA Report”, 23 września 2025. https://cloud.google.com/blog/products/ai-machine-learning/announcing-the-2025-dora-report
- Orlanski i in., “SlopCodeBench”, 25 marca 2026. https://arxiv.org/abs/2603.24755
- BCG Platinion, “The Agentic Software Factory”, 26 marca 2026. https://www.bcgplatinion.com/insights/the-agentic-software-factory
- Grigorev, “AI-Native Development”, 22 lipca 2026. https://aishippingblog.com/p/ai-native-development-specifications
- Naresh B A, “Graph Engineering for AI Coding Agents: Beyond Prompt Loops”, 30 lipca 2025. https://dev.to/naresh_007/graph-engineering-for-ai-coding-agents-beyond-prompt-loops-48h4
- Linear, “Agent Interaction SDK”, 1 sierpnia 2025. https://linear.app/now/our-approach-to-building-the-agent-interaction-sdk
- Yegge, “Gas Town”, 1 stycznia 2026. https://yegge.ai/gastown
- DoltHub (Tim Sehn), “A Day in Gas Town”, 15 stycznia 2026, i “A Week in Gas Town”, 24 marca 2026. https://www.dolthub.com/blog/2026-01-15-a-day-in-gas-town/ i https://www.dolthub.com/blog/2026-03-24-a-week-in-gas-town/
- Opalic, “The Software Factory”, 22 marca 2026. https://alexop.dev/posts/the-software-factory/
- Council on Foreign Relations, “CEO Speaker Series With Dario Amodei of Anthropic”, 10 marca 2025. https://www.cfr.org/event/ceo-speaker-series-dario-amodei-anthropic
- Fast Company (źródło wtórne), “Google CEO says 75% of the company’s code is AI-generated”, 24 kwietnia 2026. https://www.fastcompany.com/91531519/google-ceo-says-75-of-the-companys-code-is-ai-generated
- Dex Horthy (wystąpienie, źródło wtórne), “Harness Engineering is not Enough: Why Software Factories Fail”, AI Engineer World’s Fair, lipiec 2026. https://www.youtube.com/watch?v=Ib5GBkD555M
Najczęstsze pytania
Jaki procent kodu pisze AI w 2026 roku?
Najlepiej obsadzoną miarą branżową jest panel DX z drugiego kwartału 2026, ponad 400 firm: średnio 51,9% kodu napisanego przez AI. Ankieta Sonara ze stycznia 2026 wśród ponad 1100 programistów podaje 42% kodu w commitach jako wygenerowanego lub wspieranego przez AI. "Ponad 80%" Anthropic pochodzi z wnętrza firmy i liczy linie scalone do produkcji, a nie udział pracy.
Czym jest inżynieria agentowa?
Andrej Karpathy nazwał tę dyscyplinę 30 kwietnia 2026: "Nazywam to inżynierią agentową, bo to dyscyplina inżynierska. Masz agentów, czyli byty poszarpane. Są omylne i stochastyczne, ale wyjątkowo mocne. Jak je skoordynować, żeby iść szybciej bez schodzenia poniżej własnego progu jakości?" Przeciwstawia ją vibe codingowi: "Vibe coding podnosi podłogę. Inżynieria agentowa polega na rozciąganiu sufitu."
Jakie jest pięć poziomów autonomii w kodowaniu z AI?
Skala Dana Shapiro, opublikowana 23 stycznia 2026, zaczyna numerację od zera i biegnie od L0 do L5: ostre autouzupełnianie, przy którym żaden znak nie trafia na dysk bez twojej zgody; stażysta od kodu, czyli wydzielone zadania oddane w całości; junior, praca w parze i czytanie linia po linii; programista, przy którym twoje życie to diffy; zespół inżynierski, przy którym piszesz specyfikację i sprawdzasz, czy testy przechodzą; oraz ciemna fabryka oprogramowania, w której nikt nie czyta kodu.
Czy AI przyspiesza programistów?
METR, jedyne cytowane tu badanie z randomizacją, nie daje dodatniego oszacowania punktowego dla tempa pojedynczej osoby. W badaniu METR z 2025 roku zadania trwały o 19% dłużej, a aktualizacja z lutego 2026 szacuje -18% dla pierwotnej grupy i -4% dla nowo rekrutowanych, w obu przypadkach z przedziałami przechodzącymi przez zero, a sam METR nazywa nowe dane niewiarygodnym sygnałem. Badanie wdrożenia w Microsofcie zmierzyło mniej więcej 24% więcej scalonych pull requestów, a Faros zmierzył koszt jakości, który przyszedł razem z tą przepustowością.