Stan inżynierii agentowej, wrzesień 2026
Inżynieria agentowa to dyscyplina kierowania omylnymi agentami kodującymi bez obniżania progu jakości. We wrześniu 2026 DX mierzy, że 51,9% kodu w ponad 400 firmach pisze AI, a programiści w badaniu Sonara deklarują 42%. Anthropic podaje ponad 80% własnych scalanych linii, a Faros i DORA wskazują, że granicą jest przepustowość weryfikacji, nie generowanie.
Ten raport jest dla CTO i członków zarządu, którzy ustalają strategię, dla tech leadów decydujących, na ile ufać agentom, i dla programistów, którzy chcą umiejscowić własny sposób pracy. CTO pyta, jaki procent kodu piszą agenci. Lead odpowiada, że 40%. Programista, który tych agentów prowadzi, wie, że połowa tych linii to testy napisane przez agenta do jego własnej zmiany. Trzy osoby, trzy szczeble jednej drabiny, i nikt nie potrafi nazwać szczebla.
Co daje ten przegląd dowodów z 2026 roku
Dział zatytułowany „Co daje ten przegląd dowodów z 2026 roku”- Tabelę dowodów, w której każda liczba ma wydawcę, datę i jednostkę
- Sześciostopniową drabinę autonomii Shapiro i pięć pytań, które umieszczają na niej repozytorium
- Sześć stanowisk fabryki oprogramowania z odpowiadającą im funkcją w Claude Code, Codeksie i Cursorze
- Kontrdowody odczytane poprawnie: METR, Faros, DORA i SlopCodeBench
- Trzy prompty do skopiowania i szablon par metryk, który zarząd może przyjąć bez zmian
Ile kodu piszą agenci w 2026 roku?
Dział zatytułowany „Ile kodu piszą agenci w 2026 roku?”Argumentem jest trajektoria: udział rośnie wszędzie, gdzie się go mierzy, a dla niektórych osób już dziś wynosi 100%.
| Miara | Wtedy | Teraz | Źródło |
|---|---|---|---|
| Linie scalone w Anthropic, których autorem jest Claude | „niskie jednocyfrowe wartości”, luty 2025 | „ponad 80%” | Anthropic, „stan na maj 2026” |
| Udział kodu napisanego przez AI, ponad 400 firm | 27,4%, I kw. 2026 | średnio 51,9% | DX, 17 cze 2026 |
| Kod w commitach deklarowany jako wygenerowany lub wspierany przez AI | nie mierzono | 42% | Sonar, 8 sty 2026 |
| Pull requesty w Stripe tygodniowo bez kodu pisanego przez człowieka | „ponad tysiąc”, 9 lut 2026 | „ponad 1300” | Stripe, 19 lut 2026 |
| Kod scalany dziennie przez inżyniera Anthropic | punkt odniesienia z 2024 | 8× | Anthropic, II kw. 2026 |
| Scalone PR-y osób używających agentów CLI w Microsofcie | ci sami inżynierowie bez narzędzi (model) | „mniej więcej 24% więcej” | Murphy-Hill i in., arXiv, 1 lip 2026 |
Na poziomie pojedynczych osób udział sięga 100% i tam zostaje. Boris Cherny, szef Claude Code, powiedział Fortune 29 stycznia 2026: „U mnie osobiście to 100% od ponad dwóch miesięcy, nie robię ręcznie nawet drobnych poprawek”.
Dario Amodei powiedział w Council on Foreign Relations 10 marca 2025, że w ciągu dwunastu miesięcy AI będzie pisać „w zasadzie cały kod”. Po osiemnastu miesiącach Anthropic podaje „ponad 80%” własnych scalonych linii, a najlepszą serią branżową jest 51,9% z DX. Fast Company podaje, że Sundar Pichai mówił w kwietniu 2026 o 75% nowego kodu Google; żadne źródło Google tego nie potwierdza, więc traktuj to jako wtórną relację prasową.
Co naprawdę mierzą liczby „procent kodu”?
Dział zatytułowany „Co naprawdę mierzą liczby „procent kodu”?”Każdy z tych odsetków liczy linie, a linie to najtańsze, co agent produkuje. Ryan Greenblatt z Redwood Research napisał 22 października 2025: „Wzrost produktywności przy danym odsetku generowanego kodu nie jest aż tak duży, bo AI pozwala tanio generować mnóstwo kodu o bardzo niskiej wartości”.
Anthropic stawia tę samą granicę. Kierownictwo szacowało 90% lub więcej „łącznie ze skryptami i kodem eksperymentalnym”, a opublikowana liczba mierzy „udział linii scalonych do produkcji, które można przypisać Claude’owi”. DX dopisuje koszt: mediana rozmiaru pull requesta wzrosła „z 44 do 72 linii między lipcem 2025 a czerwcem 2026”. Rosnący udział AI i niemal dwukrotnie większy diff to jedno zdarzenie, a płaci za nie recenzent.
Czym jest inżynieria agentowa?
Dział zatytułowany „Czym jest inżynieria agentowa?”Andrej Karpathy nazwał tę dyscyplinę w podsumowaniu Sequoia Ascent z 30 kwietnia 2026:
„Nazywam to inżynierią agentową, bo to dyscyplina inżynierska. Masz agentów, czyli byty nierówne w swoich możliwościach. Są omylne i stochastyczne, ale wyjątkowo mocne. Jak je skoordynować, żeby iść szybciej bez obniżania progu jakości?
Vibe coding podnosi podłogę. Inżynieria agentowa polega na podnoszeniu sufitu”.
Ograniczenie jest postawione wprost: „Nadal odpowiadasz za swoje oprogramowanie, tak jak wcześniej”. Zmieniła się jednostka pracy: „z pisania linii kodu na delegowanie większych «makroakcji»”. Definicja na początku tej strony streszcza ten fragment; nie jest cytatem.
Na którym szczeblu drabiny autonomii jest twój zespół?
Dział zatytułowany „Na którym szczeblu drabiny autonomii jest twój zespół?”Dan Shapiro opublikował model 23 stycznia 2026 jako „The Five Levels: from Spicy Autocomplete to the Dark Factory”, wzorując się na skali automatyzacji jazdy NHTSA. Numeracja zaczyna się od zera, więc pod tytułem o pięciu poziomach jest sześć szczebli. Simon Willison w tekście z 28 stycznia wskazuje, że zespołem z poziomu 5 jest dział AI firmy StrongDM.
| Poziom | Nazwa u Shapiro | Pisze | Czyta | Jak to wygląda | Przewodnik |
|---|---|---|---|---|---|
| L0 | Ostre autouzupełnianie | Człowiek | Człowiek | „żaden znak nie trafia na dysk bez twojej zgody” | L1–2 |
| L1 | Stażysta od kodu | Człowiek | Człowiek | „oddajesz stażyście AI konkretne, wydzielone zadania” | L1–2 |
| L2 | Junior | Oboje | Człowiek | „masz wrażenie, że skończyłeś. Ale nie skończyłeś” | L1–2 |
| L3 | Programista | AI | Recenzent | „Twoje życie to diffy”. | L3 |
| L4 | Zespół inżynierski | AI | Testy | „wyjdź na 12 godzin i sprawdź, czy testy przechodzą” | L4 |
| L5 | Ciemna fabryka oprogramowania | AI | Nikt | „To czarna skrzynka, która zamienia specyfikacje w oprogramowanie”. | L5 |
Shapiro pisze, że poziom 2 to miejsce, „gdzie żyje dziś 90% programistów «AI-native»”, o poziomie 3 mówi, że „prawie wszyscy tu się zatrzymują”, siebie umieszcza na poziomie 4, a na poziomie 5, gdzie „ludzie nie są ani potrzebni, ani mile widziani”, stawia „garstkę ludzi”.
Żeby umiejscowić repozytorium, odpowiadaj na pytania dowodami z repozytorium, a nie z wrażeń. Pierwsze pytanie, na które nie masz dowodu, wyznacza sufit.
- Z L0 na L1. Czy na dysk trafia kod, którego nikt nie wpisał?
- Z L1 na L2. Czy przekazujesz całe zadania z kryteriami akceptacji, czy tylko uzupełnienia wewnątrz funkcji, którą piszesz?
- Z L2 na L3. Czy agent pracuje bez nadzoru na tyle długo, że jego pracę widzisz dopiero jako diff? To zmiana zawodu, a nie tempa.
- Z L3 na L4. Czy istnieje warunek stopu, który maszyna potrafi ocenić, zapisany jako polecenia kończące się kodem 0? Poziom 4 definiuje to, że możesz wyjść.
- Z L4 na L5. Czy cokolwiek jest scalane bez lektury człowieka i czy umiesz nazwać wyrocznię, która to zabezpieczyła?
Poziom przypisuj pętli, a nie firmie. Pętla aktualizacji zależności z deterministycznym walidatorem może działać na poziomie 4, podczas gdy praca nad funkcjami w tym samym repozytorium zostaje na poziomie 2. Jedna mapa nakłada drabinę na cykl dostarczania oprogramowania.
Jak wygląda produkcyjna fabryka oprogramowania?
Dział zatytułowany „Jak wygląda produkcyjna fabryka oprogramowania?”Najdokładniej opisaną publicznie fabryką jest ta ze Stripe. Minions to jednorazowe agenty działające od początku do końca, zbudowane na „forku agenta kodującego goose firmy Block” i korzystające z Toolshedu liczącego „prawie 500 narzędzi MCP”. Do 19 lutego 2026 „ponad 1300 pull requestów Stripe scalanych co tydzień jest w całości wyprodukowanych przez minionów, przejrzanych przez ludzi, ale bez kodu napisanego przez człowieka”. Trzy decyzje projektowe warto skopiować:
- Pętla ma twardą granicę. Stripe dopuszcza „najwyżej dwie rundy CI”, a potem „odsyłamy gałąź do jej ludzkiego operatora do ręcznej weryfikacji”.
- Przepływ pracy jest kodem. Blueprints to „maszyna stanów, która przeplata deterministyczne węzły kodu i swobodne węzły agentowe”.
- Wyrocznia jest starsza niż agenci. Miniony pracują na „ogromnym, istniejącym wcześniej zestawie testów Stripe — ponad trzech milionach”.
Badanie Microsoftu nad wdrożeniem Claude Code i GitHub Copilot CLI na początku 2026 roku obejmuje „dziesiątki tysięcy inżynierów”, a autorzy sami zastrzegają przy wyniku 24%: „scalony PR to nie to samo co wartość, którą dostarcza”.
Prowadzenie fabryki kosztuje realne pieniądze: godzina pracy orkiestratora Gas Town Steve’a Yegge’a kosztowała Tima Sehna z DoltHub „około 100 dolarów w tokenach Claude’a” (15 stycznia 2026), a tydzień 3000 dolarów. BCG Platinion napisał w marcu 2026: „Kluczową zmianą nie jest nieobecność ludzi, tylko przeniesienie ludzkiego wysiłku”.
Sześć stanowisk fabryki oprogramowania
Dział zatytułowany „Sześć stanowisk fabryki oprogramowania”Taksonomia Alexeya Grigoreva z lipca 2026 oddziela inżynierię kontekstu (co agent wie przed startem), inżynierię pętli (kiedy przestaje pracować) i inżynierię grafową (kto co robi, gdy agentów jest więcej niż jeden). Dodaj to, co wolno uruchomić, to, co dowodzi wyniku, i to, co trafia do wydania, a fabryka ma sześć stanowisk. Każde narzędzie ma dziś na każdym z nich udokumentowaną funkcję.
| Stanowisko | Rozstrzyga | Claude Code | Codex | Cursor |
|---|---|---|---|---|
| Intencja | Co agent wie na starcie | CLAUDE.md | AGENTS.md | Rules |
| Harness (uprząż wykonawcza) | Co uruchamia się przy każdej edycji | Hooks | Hooks | Hooks |
| Pętla | Kiedy agent kończy | /goal | /goal | /goal |
| Graf | Kto co robi | Subagenty | Subagenty | Subagenty |
| Weryfikacja | Co dowodzi wyniku | /code-review | /review | Bugbot |
| Wydanie | Jak zmiana trafia na produkcję | GitHub Actions | openai/codex-action@v1 | GitHub Actions |
Komórki Claude Code sprawdzono ponownie 26 września 2026. Funkcje Codeksa potwierdzono tego samego dnia w codex-cli 0.157.1, którego codex features list pokazuje goals, hooks i multi_agent jako stabilne i włączone; linki do dokumentacji Codeksa i komórki Cursora sprawdzono ostatnio 28 sierpnia 2026.
W Claude Code uruchomienie subagenta kończy się błędem, gdy w sesji działa już 20 subagentów (v2.1.217+; limit zmienia CLAUDE_CODE_MAX_CONCURRENT_SUBAGENTS, a sesje z aktywnym ultracode są z niego zwolnione). Cursor zaczął udostępniać /goal 19 sierpnia 2026 (changelog, odczyt 28 sierpnia 2026), tego samego dnia, w którym subagenty dostały własne maszyny wirtualne. /loop jest wbudowany w Claude Code, a w Cursorze od wersji 3.5 (20 maja 2026) jest dołączonym skillem; Codex 0.157.1 nie ma /loop (sprawdzone 26 września 2026) a cykliczne uruchamianie zapewnia przez Automations (pętlę do celu przez /goal).
Co mówią dowody przeciwko autonomii?
Dział zatytułowany „Co mówią dowody przeciwko autonomii?”Cztery zbiory dowodów przemawiają za ostrożnością. Każdy cytuj w całości.
METR zmierzył spowolnienie, a potem stracił narzędzie pomiaru. Randomizowane badanie z 2025 roku, 16 doświadczonych programistów open source i 246 zgłoszeń, wykazało, że zadania trwały o 19% dłużej (przedział od +2% do +39%), a programiści i tak uważali potem, że AI przyspieszyła ich o 20%. Kontynuacja z lutego 2026 podaje zmianę czasu wykonania o -18% (przedział od -38% do +9%) dla powracających programistów i -4% (od -15% do +9%) dla nowo zrekrutowanych. Wartość ujemna oznacza mniej czasu, więc oba oszacowania punktowe wypadają na korzyść AI, ale oba przedziały przechodzą przez zero, a METR pisze, że nowe dane dają „niewiarygodny sygnał co do obecnego wpływu narzędzi AI na produktywność”. Ani „18% wolniej”, ani „18% szybciej” nie jest wynikiem.
Faros zmierzył koszt przyspieszenia (raport „The Acceleration Whiplash”). Dwa lata telemetrii od 22 000 programistów i ponad 4000 zespołów, opublikowane w kwietniu 2026. Przepustowość wzrosła: epiki na programistę +66,2%, zadania +33,7%, tempo scalania +16,2%, a liczba wdrożeń tygodniowo spadła o 11,7%. Jakość w tym samym czasie spadła: błędy na programistę +54%, incydenty na pull request +242,7%, churn +861%, pull requesty scalane bez przeglądu +31,3%. Mediana czasu w przeglądzie wzrosła o 441,5%, a czas do pierwszego przeglądu o 156,6%; to dwie różne metryki.
DORA nazwała mechanizm. Raport z 2025 roku znalazł „pozytywną zależność między wdrożeniem AI a przepustowością dostarczania oprogramowania i wynikami produktu”, a zarazem to, że „wdrożenie AI nadal ma negatywną zależność ze stabilnością dostarczania”. Wyjaśnienie: „Bez solidnych systemów kontroli, takich jak mocne testy automatyczne, dojrzałe praktyki kontroli wersji i szybkie pętle informacji zwrotnej, wzrost wolumenu zmian prowadzi do niestabilności”.
SlopCodeBench zmierzył degradację w czasie. W 36 problemach, 196 punktach kontrolnych i przy 15 agentach rozbudowujących własne wcześniejsze rozwiązania „żaden agent nie rozwiązuje w pełni żadnego problemu od początku do końca, a najlepszy przechodzi 14,8% punktów kontrolnych”.
Jak weryfikować pracę agenta bez czytania każdej linii?
Dział zatytułowany „Jak weryfikować pracę agenta bez czytania każdej linii?”Nic z tego nie przemawia za pozostaniem na poziomie 2. Pokazuje tylko, jak się wspinać: autonomię zdobywa się dla każdej pętli osobno, wobec wyroczni weryfikacyjnej, a nie ogłasza dla całej bazy kodu. Faros pokazuje generowanie, które się skaluje, i weryfikację, która się nie skaluje, czyli sufit poziomu 3 zapisany w telemetrii. Wspinaczka polega na dokładaniu dowodów, a nie na rezygnacji z recenzenta.
| Warstwa | Czego dowodzi | Kto zatwierdza |
|---|---|---|
| Warunek stopu jako polecenia kończące się kodem 0 | Cel pętli jest spełniony | Autor specyfikacji, przed startem przebiegu |
| Deterministyczne walidatory (typy, lint, testy, schematy) | Znane klasy błędów nie występują | CI, przy każdym pushu |
Agent recenzujący (/code-review, /review, Bugbot) | Drugi model nie znalazł problemu blokującego | Człowiek przypisany do zadania czyta jego ustalenia, nie diff |
| Limit powtórzeń i eskalacja | Agent nie zapętli się ani nie osłabi testu, żeby przejść | Ludzki operator, po wyczerpaniu limitu (Stripe: dwie rundy CI) |
| Sygnały z produkcji (incydenty na PR, odsetek wycofań) | Wyrocznia łapie to, co ważne | Tech lead, co tydzień |
Naresh B A ujmuje zasadę w jednym zdaniu: „Model może przekonywać, że jego praca jest skończona. Deterministyczny walidator może udowodnić, że brakuje wymaganego pola”. Zasada produktowa Lineara ustala odpowiedzialność: „zgłoszenia można przypisać tylko ludziom, a agentom jedynie delegować”. Pełna metoda to czytanie dowodów zamiast diffów.
Co zostaje przy człowieku w inżynierii agentowej?
Dział zatytułowany „Co zostaje przy człowieku w inżynierii agentowej?”Sześć obowiązków przetrwa każdy szczebel poniżej ciemnej fabryki: smak, architektura, kierunek produktu, projektowanie warunków stopu, uprawnienia i decyzja, czego nie automatyzować. Karpathy mówi: „odpowiadasz za smak, inżynierię, projekt i za to, czy system ma sens”. Zrozumienie to ten obowiązek, który eroduje po cichu. W randomizowanym badaniu Anthropic z 29 stycznia 2026, na 52 głównie młodszych inżynierach uczących się nowej biblioteki, „grupa z AI uzyskała średnio 50% w quizie, wobec 67% w grupie piszącej ręcznie”. Nadzór wymaga umiejętności, które nadmierne delegowanie osłabia. Zadanie człowieka omawia każdy obowiązek szczegółowo.
Prompty i szablony, które umieszczą twój zespół na drabinie
Dział zatytułowany „Prompty i szablony, które umieszczą twój zespół na drabinie”Pierwszy prompt uruchom w Claude Code, Codeksie albo Cursorze na repozytorium, z którego wdrażasz. Działa bez zmian we wszystkich trzech narzędziach.
Dla kadry zarządzającej artefaktem do przyjęcia jest zasada raportowania: nigdy nie pokazuj udziału kodu ani przepustowości bez pary jakościowej.
| Raportuj to | Zawsze obok | Dlaczego ta para |
|---|---|---|
| Udział linii scalonych napisanych przez AI | Incydenty na pull request | Anthropic i Redwood: linie to nie praca |
| Pull requesty scalone na inżyniera | Mediana czasu w przeglądzie i czas do pierwszego przeglądu | Faros: obie metryki przeglądu ruszyły razem z przepustowością |
| Mediana rozmiaru pull requesta | Odsetek PR-ów scalonych bez przeglądu | DX i Faros: większe diffy, cieńszy przegląd |
| Poziom autonomii dla każdej pętli | Nazwana wyrocznia i jej limit powtórzeń | Stripe: limit dwóch rund CI i ponad 3 mln testów sprawiają, że ludzie recenzują zamiast przepisywać |
Model zdolności AI od DORA (23 września 2025) wskazuje siedem fundamentów, które warto sfinansować najpierw. Ramy metryk zamieniają te pary w dashboard.
Kiedy liczby o inżynierii agentowej z 2026 roku są nadużywane
Dział zatytułowany „Kiedy liczby o inżynierii agentowej z 2026 roku są nadużywane”Pięć sposobów błędnego odczytania tych dowodów, każdy z drogą wyjścia.
- Czytanie „procentu linii” jako „procentu pracy”. Przypis Anthropic i krytyka Redwood odmawiają tego kroku. Wyjście: każdą liczbę udziału zestawiaj z miarą pracy, którą ten sam zespół kontroluje.
- Cytowanie połowy Farosa. +66,2% epików i +242,7% incydentów pochodzą z jednego zbioru danych. Cytuj przepustowość i jakość razem albo wcale.
- Odwrócenie znaku METR. METR podaje zmianę czasu wykonania, więc -18% oznacza mniej czasu, a nie spowolnienie. Wyjście: za każdym razem podawaj przedział i zastrzeżenie METR o „niewiarygodnym sygnale”.
- Podawanie wewnętrznego udziału dostawcy jako stawki branżowej. Anthropic, Stripe, Google i Cherny mówią o sobie. Jako liczbę branżową podawaj 51,9% z DX albo 42% z Sonara.
- Publikowanie przeterminowanych twierdzeń o funkcjach. Cursor nie miał
/goal, zanim 19 sierpnia 2026 zaczął go udostępniać. W dniu publikacji sprawdź ponownie stronę dostawcy albo--helpw CLI i dopisz datę do każdego twierdzenia przeczącego.
Dokąd dalej na drabinie
Dział zatytułowany „Dokąd dalej na drabinie”- Shapiro, „The Five Levels: from Spicy Autocomplete to the Dark Factory”, 23 sty 2026. https://www.danshapiro.com/blog/2026/01/the-five-levels-from-spicy-autocomplete-to-the-software-factory/
- Simon Willison, „The Five Levels: from Spicy Autocomplete to the Dark Factory”, 28 sty 2026. https://simonwillison.net/2026/Jan/28/the-five-levels/
- Karpathy, „Sequoia Ascent 2026”, 30 kwi 2026. https://karpathy.bearblog.dev/sequoia-ascent-2026/
- Anthropic, „When AI builds itself”, bez daty („as of May 2026”). https://www.anthropic.com/institute/recursive-self-improvement
- Fortune, „Top engineers at Anthropic, OpenAI say AI now writes 100% of their code”, 29 sty 2026. https://fortune.com/2026/01/29/100-percent-of-code-at-anthropic-and-openai-is-now-ai-written-boris-cherny-roon/
- DX, „AI-authored code has nearly doubled”, 17 cze 2026. https://newsletter.getdx.com/p/ai-authored-code-has-nearly-doubled
- Sonar, „State of Code Developer Survey”, 8 sty 2026. https://www.sonarsource.com/blog/state-of-code-developer-survey-report-the-current-reality-of-ai-coding/
- Murphy-Hill, Butler i Savelieva, „Adoption and Impact of Command-Line AI Coding Agents”, arXiv:2607.01418, 1 lip 2026. https://arxiv.org/abs/2607.01418
- Stripe, „Minions”, części 1 i 2, 9 i 19 lut 2026. https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents-part-2
- Ryan Greenblatt, Redwood Research, „Is 90% of code at Anthropic being written by AIs?”, 22 paź 2025. https://blog.redwoodresearch.org/p/is-90-of-code-at-anthropic-being
- METR, badanie z początku 2025 roku, 10 lip 2025, i aktualizacja z 24 lut 2026, wraz z kodem analizy, który definiuje znak. https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/, https://metr.org/blog/2026-02-24-uplift-update/ oraz https://github.com/METR/Measuring-Late-2025-AI-on-OSS-Devs
- Faros AI, „The Acceleration Whiplash”, kwi 2026. https://www.faros.ai/blog/ai-acceleration-whiplash-takeaways
- Google Cloud, „Announcing the 2025 DORA Report”, 23 wrz 2025, oraz „Introducing DORA’s inaugural AI Capabilities Model”, 23 wrz 2025. https://cloud.google.com/blog/products/ai-machine-learning/announcing-the-2025-dora-report oraz https://cloud.google.com/blog/products/ai-machine-learning/introducing-doras-inaugural-ai-capabilities-model
- Orlanski i in., „SlopCodeBench”, 25 mar 2026. https://arxiv.org/abs/2603.24755
- Anthropic Research (Judy Hanwen Shen i Alex Tamkin), randomizowane badanie wpływu asysty AI na umiejętności programistyczne, 29 sty 2026. https://www.anthropic.com/research/AI-assistance-coding-skills
- BCG Platinion, „The Agentic Software Factory”, 26 mar 2026. https://www.bcgplatinion.com/insights/the-agentic-software-factory
- Grigorev, „AI-Native Development”, 22 lip 2026. https://aishippingblog.com/p/ai-native-development-specifications
- Naresh B A, „Graph Engineering for AI Coding Agents”, 30 lip 2025. https://dev.to/naresh_007/graph-engineering-for-ai-coding-agents-beyond-prompt-loops-48h4
- Linear, „Our approach to building the Agent Interaction SDK”, 1 sie 2025. https://linear.app/now/our-approach-to-building-the-agent-interaction-sdk
- DoltHub (Tim Sehn), „A Day in Gas Town”, 15 sty 2026, oraz „A Week in Gas Town”, 24 mar 2026. https://www.dolthub.com/blog/2026-01-15-a-day-in-gas-town/ oraz https://www.dolthub.com/blog/2026-03-24-a-week-in-gas-town/
- Council on Foreign Relations, „CEO Speaker Series With Dario Amodei”, 10 mar 2025. https://www.cfr.org/event/ceo-speaker-series-dario-amodei-anthropic
- Fast Company (źródło wtórne), „Google CEO says 75% of the company’s code is AI-generated”, 24 kwi 2026. https://www.fastcompany.com/91531519/google-ceo-says-75-of-the-companys-code-is-ai-generated
Najczęstsze pytania
Jaki procent kodu pisze AI w 2026 roku?
Najszerszą miarą branżową jest panel DX z drugiego kwartału 2026, ponad 400 firm: średnio 51,9% kodu napisanego przez AI. Ankieta Sonara ze stycznia 2026 wśród ponad 1100 programistów podaje 42% kodu w commitach jako wygenerowanego lub wspieranego przez AI. „Ponad 80%” Anthropic to liczba z wnętrza firmy i dotyczy linii scalonych do produkcji, a nie udziału w pracy.
Czym jest inżynieria agentowa?
Andrej Karpathy nazwał tę dyscyplinę 30 kwietnia 2026: „Nazywam to inżynierią agentową, bo to dyscyplina inżynierska. Masz agentów, czyli byty nierówne w swoich możliwościach. Są omylne i stochastyczne, ale wyjątkowo mocne. Jak je skoordynować, żeby iść szybciej bez obniżania progu jakości?”
Jakie są poziomy autonomii w kodowaniu z AI?
Skala Dana Shapiro z 23 stycznia 2026 biegnie od L0 do L5: ostre autouzupełnianie, stażysta od kodu, junior, programista (twoje życie to diffy), zespół inżynierski (piszesz specyfikację i sprawdzasz, czy testy przechodzą) oraz ciemna fabryka oprogramowania, w której nikt nie czyta kodu.
Czy AI przyspiesza programistów?
Żaden pomiar tego nie rozstrzyga. Randomizowane badanie METR z 2025 roku wykazało, że zadania trwały o 19% dłużej. W kontynuacji z lutego 2026 oszacowania punktowe wypadają na korzyść AI (około 18% i 4% mniej czasu), ale przedziały przechodzą przez zero, a METR nazywa te dane niewiarygodnym sygnałem. Microsoft zmierzył mniej więcej 24% więcej scalonych pull requestów, a Faros spadek jakości idący w parze ze wzrostem przepustowości.