Przejdź do głównej zawartości

Stan inżynierii agentowej, wrzesień 2026

Inżynieria agentowa to dyscyplina kierowania omylnymi agentami kodującymi bez obniżania progu jakości. We wrześniu 2026 DX mierzy, że 51,9% kodu w ponad 400 firmach pisze AI, a programiści w badaniu Sonara deklarują 42%. Anthropic podaje ponad 80% własnych scalanych linii, a Faros i DORA wskazują, że granicą jest przepustowość weryfikacji, nie generowanie.

Ten raport jest dla CTO i członków zarządu, którzy ustalają strategię, dla tech leadów decydujących, na ile ufać agentom, i dla programistów, którzy chcą umiejscowić własny sposób pracy. CTO pyta, jaki procent kodu piszą agenci. Lead odpowiada, że 40%. Programista, który tych agentów prowadzi, wie, że połowa tych linii to testy napisane przez agenta do jego własnej zmiany. Trzy osoby, trzy szczeble jednej drabiny, i nikt nie potrafi nazwać szczebla.

  • Tabelę dowodów, w której każda liczba ma wydawcę, datę i jednostkę
  • Sześciostopniową drabinę autonomii Shapiro i pięć pytań, które umieszczają na niej repozytorium
  • Sześć stanowisk fabryki oprogramowania z odpowiadającą im funkcją w Claude Code, Codeksie i Cursorze
  • Kontrdowody odczytane poprawnie: METR, Faros, DORA i SlopCodeBench
  • Trzy prompty do skopiowania i szablon par metryk, który zarząd może przyjąć bez zmian

Argumentem jest trajektoria: udział rośnie wszędzie, gdzie się go mierzy, a dla niektórych osób już dziś wynosi 100%.

MiaraWtedyTerazŹródło
Linie scalone w Anthropic, których autorem jest Claude„niskie jednocyfrowe wartości”, luty 2025„ponad 80%”Anthropic, „stan na maj 2026”
Udział kodu napisanego przez AI, ponad 400 firm27,4%, I kw. 2026średnio 51,9%DX, 17 cze 2026
Kod w commitach deklarowany jako wygenerowany lub wspierany przez AInie mierzono42%Sonar, 8 sty 2026
Pull requesty w Stripe tygodniowo bez kodu pisanego przez człowieka„ponad tysiąc”, 9 lut 2026„ponad 1300”Stripe, 19 lut 2026
Kod scalany dziennie przez inżyniera Anthropicpunkt odniesienia z 20248×Anthropic, II kw. 2026
Scalone PR-y osób używających agentów CLI w Microsofcieci sami inżynierowie bez narzędzi (model)„mniej więcej 24% więcej”Murphy-Hill i in., arXiv, 1 lip 2026

Na poziomie pojedynczych osób udział sięga 100% i tam zostaje. Boris Cherny, szef Claude Code, powiedział Fortune 29 stycznia 2026: „U mnie osobiście to 100% od ponad dwóch miesięcy, nie robię ręcznie nawet drobnych poprawek”.

Dario Amodei powiedział w Council on Foreign Relations 10 marca 2025, że w ciągu dwunastu miesięcy AI będzie pisać „w zasadzie cały kod”. Po osiemnastu miesiącach Anthropic podaje „ponad 80%” własnych scalonych linii, a najlepszą serią branżową jest 51,9% z DX. Fast Company podaje, że Sundar Pichai mówił w kwietniu 2026 o 75% nowego kodu Google; żadne źródło Google tego nie potwierdza, więc traktuj to jako wtórną relację prasową.

Każdy z tych odsetków liczy linie, a linie to najtańsze, co agent produkuje. Ryan Greenblatt z Redwood Research napisał 22 października 2025: „Wzrost produktywności przy danym odsetku generowanego kodu nie jest aż tak duży, bo AI pozwala tanio generować mnóstwo kodu o bardzo niskiej wartości”.

Anthropic stawia tę samą granicę. Kierownictwo szacowało 90% lub więcej „łącznie ze skryptami i kodem eksperymentalnym”, a opublikowana liczba mierzy „udział linii scalonych do produkcji, które można przypisać Claude’owi”. DX dopisuje koszt: mediana rozmiaru pull requesta wzrosła „z 44 do 72 linii między lipcem 2025 a czerwcem 2026”. Rosnący udział AI i niemal dwukrotnie większy diff to jedno zdarzenie, a płaci za nie recenzent.

Andrej Karpathy nazwał tę dyscyplinę w podsumowaniu Sequoia Ascent z 30 kwietnia 2026:

„Nazywam to inżynierią agentową, bo to dyscyplina inżynierska. Masz agentów, czyli byty nierówne w swoich możliwościach. Są omylne i stochastyczne, ale wyjątkowo mocne. Jak je skoordynować, żeby iść szybciej bez obniżania progu jakości?

Vibe coding podnosi podłogę. Inżynieria agentowa polega na podnoszeniu sufitu”.

Ograniczenie jest postawione wprost: „Nadal odpowiadasz za swoje oprogramowanie, tak jak wcześniej”. Zmieniła się jednostka pracy: „z pisania linii kodu na delegowanie większych «makroakcji»”. Definicja na początku tej strony streszcza ten fragment; nie jest cytatem.

Na którym szczeblu drabiny autonomii jest twój zespół?

Dział zatytułowany „Na którym szczeblu drabiny autonomii jest twój zespół?”

Dan Shapiro opublikował model 23 stycznia 2026 jako „The Five Levels: from Spicy Autocomplete to the Dark Factory”, wzorując się na skali automatyzacji jazdy NHTSA. Numeracja zaczyna się od zera, więc pod tytułem o pięciu poziomach jest sześć szczebli. Simon Willison w tekście z 28 stycznia wskazuje, że zespołem z poziomu 5 jest dział AI firmy StrongDM.

PoziomNazwa u ShapiroPiszeCzytaJak to wyglądaPrzewodnik
L0Ostre autouzupełnianieCzłowiekCzłowiek„żaden znak nie trafia na dysk bez twojej zgody”L1–2
L1Stażysta od koduCzłowiekCzłowiek„oddajesz stażyście AI konkretne, wydzielone zadania”L1–2
L2JuniorObojeCzłowiek„masz wrażenie, że skończyłeś. Ale nie skończyłeś”L1–2
L3ProgramistaAIRecenzent„Twoje życie to diffy”.L3
L4Zespół inżynierskiAITesty„wyjdź na 12 godzin i sprawdź, czy testy przechodzą”L4
L5Ciemna fabryka oprogramowaniaAINikt„To czarna skrzynka, która zamienia specyfikacje w oprogramowanie”.L5

Shapiro pisze, że poziom 2 to miejsce, „gdzie żyje dziś 90% programistów «AI-native»”, o poziomie 3 mówi, że „prawie wszyscy tu się zatrzymują”, siebie umieszcza na poziomie 4, a na poziomie 5, gdzie „ludzie nie są ani potrzebni, ani mile widziani”, stawia „garstkę ludzi”.

Żeby umiejscowić repozytorium, odpowiadaj na pytania dowodami z repozytorium, a nie z wrażeń. Pierwsze pytanie, na które nie masz dowodu, wyznacza sufit.

  1. Z L0 na L1. Czy na dysk trafia kod, którego nikt nie wpisał?
  2. Z L1 na L2. Czy przekazujesz całe zadania z kryteriami akceptacji, czy tylko uzupełnienia wewnątrz funkcji, którą piszesz?
  3. Z L2 na L3. Czy agent pracuje bez nadzoru na tyle długo, że jego pracę widzisz dopiero jako diff? To zmiana zawodu, a nie tempa.
  4. Z L3 na L4. Czy istnieje warunek stopu, który maszyna potrafi ocenić, zapisany jako polecenia kończące się kodem 0? Poziom 4 definiuje to, że możesz wyjść.
  5. Z L4 na L5. Czy cokolwiek jest scalane bez lektury człowieka i czy umiesz nazwać wyrocznię, która to zabezpieczyła?

Poziom przypisuj pętli, a nie firmie. Pętla aktualizacji zależności z deterministycznym walidatorem może działać na poziomie 4, podczas gdy praca nad funkcjami w tym samym repozytorium zostaje na poziomie 2. Jedna mapa nakłada drabinę na cykl dostarczania oprogramowania.

Najdokładniej opisaną publicznie fabryką jest ta ze Stripe. Minions to jednorazowe agenty działające od początku do końca, zbudowane na „forku agenta kodującego goose firmy Block” i korzystające z Toolshedu liczącego „prawie 500 narzędzi MCP”. Do 19 lutego 2026 „ponad 1300 pull requestów Stripe scalanych co tydzień jest w całości wyprodukowanych przez minionów, przejrzanych przez ludzi, ale bez kodu napisanego przez człowieka”. Trzy decyzje projektowe warto skopiować:

  • Pętla ma twardą granicę. Stripe dopuszcza „najwyżej dwie rundy CI”, a potem „odsyłamy gałąź do jej ludzkiego operatora do ręcznej weryfikacji”.
  • Przepływ pracy jest kodem. Blueprints to „maszyna stanów, która przeplata deterministyczne węzły kodu i swobodne węzły agentowe”.
  • Wyrocznia jest starsza niż agenci. Miniony pracują na „ogromnym, istniejącym wcześniej zestawie testów Stripe — ponad trzech milionach”.

Badanie Microsoftu nad wdrożeniem Claude Code i GitHub Copilot CLI na początku 2026 roku obejmuje „dziesiątki tysięcy inżynierów”, a autorzy sami zastrzegają przy wyniku 24%: „scalony PR to nie to samo co wartość, którą dostarcza”.

Prowadzenie fabryki kosztuje realne pieniądze: godzina pracy orkiestratora Gas Town Steve’a Yegge’a kosztowała Tima Sehna z DoltHub „około 100 dolarów w tokenach Claude’a” (15 stycznia 2026), a tydzień 3000 dolarów. BCG Platinion napisał w marcu 2026: „Kluczową zmianą nie jest nieobecność ludzi, tylko przeniesienie ludzkiego wysiłku”.

Taksonomia Alexeya Grigoreva z lipca 2026 oddziela inżynierię kontekstu (co agent wie przed startem), inżynierię pętli (kiedy przestaje pracować) i inżynierię grafową (kto co robi, gdy agentów jest więcej niż jeden). Dodaj to, co wolno uruchomić, to, co dowodzi wyniku, i to, co trafia do wydania, a fabryka ma sześć stanowisk. Każde narzędzie ma dziś na każdym z nich udokumentowaną funkcję.

StanowiskoRozstrzygaClaude CodeCodexCursor
IntencjaCo agent wie na starcieCLAUDE.mdAGENTS.mdRules
Harness (uprząż wykonawcza)Co uruchamia się przy każdej edycjiHooksHooksHooks
PętlaKiedy agent kończy/goal/goal/goal
GrafKto co robiSubagentySubagentySubagenty
WeryfikacjaCo dowodzi wyniku/code-review/reviewBugbot
WydanieJak zmiana trafia na produkcjęGitHub Actionsopenai/codex-action@v1GitHub Actions

Komórki Claude Code sprawdzono ponownie 26 września 2026. Funkcje Codeksa potwierdzono tego samego dnia w codex-cli 0.157.1, którego codex features list pokazuje goals, hooks i multi_agent jako stabilne i włączone; linki do dokumentacji Codeksa i komórki Cursora sprawdzono ostatnio 28 sierpnia 2026.

W Claude Code uruchomienie subagenta kończy się błędem, gdy w sesji działa już 20 subagentów (v2.1.217+; limit zmienia CLAUDE_CODE_MAX_CONCURRENT_SUBAGENTS, a sesje z aktywnym ultracode są z niego zwolnione). Cursor zaczął udostępniać /goal 19 sierpnia 2026 (changelog, odczyt 28 sierpnia 2026), tego samego dnia, w którym subagenty dostały własne maszyny wirtualne. /loop jest wbudowany w Claude Code, a w Cursorze od wersji 3.5 (20 maja 2026) jest dołączonym skillem; Codex 0.157.1 nie ma /loop (sprawdzone 26 września 2026) a cykliczne uruchamianie zapewnia przez Automations (pętlę do celu przez /goal).

Cztery zbiory dowodów przemawiają za ostrożnością. Każdy cytuj w całości.

METR zmierzył spowolnienie, a potem stracił narzędzie pomiaru. Randomizowane badanie z 2025 roku, 16 doświadczonych programistów open source i 246 zgłoszeń, wykazało, że zadania trwały o 19% dłużej (przedział od +2% do +39%), a programiści i tak uważali potem, że AI przyspieszyła ich o 20%. Kontynuacja z lutego 2026 podaje zmianę czasu wykonania o -18% (przedział od -38% do +9%) dla powracających programistów i -4% (od -15% do +9%) dla nowo zrekrutowanych. Wartość ujemna oznacza mniej czasu, więc oba oszacowania punktowe wypadają na korzyść AI, ale oba przedziały przechodzą przez zero, a METR pisze, że nowe dane dają „niewiarygodny sygnał co do obecnego wpływu narzędzi AI na produktywność”. Ani „18% wolniej”, ani „18% szybciej” nie jest wynikiem.

Faros zmierzył koszt przyspieszenia (raport „The Acceleration Whiplash”). Dwa lata telemetrii od 22 000 programistów i ponad 4000 zespołów, opublikowane w kwietniu 2026. Przepustowość wzrosła: epiki na programistę +66,2%, zadania +33,7%, tempo scalania +16,2%, a liczba wdrożeń tygodniowo spadła o 11,7%. Jakość w tym samym czasie spadła: błędy na programistę +54%, incydenty na pull request +242,7%, churn +861%, pull requesty scalane bez przeglądu +31,3%. Mediana czasu w przeglądzie wzrosła o 441,5%, a czas do pierwszego przeglądu o 156,6%; to dwie różne metryki.

DORA nazwała mechanizm. Raport z 2025 roku znalazł „pozytywną zależność między wdrożeniem AI a przepustowością dostarczania oprogramowania i wynikami produktu”, a zarazem to, że „wdrożenie AI nadal ma negatywną zależność ze stabilnością dostarczania”. Wyjaśnienie: „Bez solidnych systemów kontroli, takich jak mocne testy automatyczne, dojrzałe praktyki kontroli wersji i szybkie pętle informacji zwrotnej, wzrost wolumenu zmian prowadzi do niestabilności”.

SlopCodeBench zmierzył degradację w czasie. W 36 problemach, 196 punktach kontrolnych i przy 15 agentach rozbudowujących własne wcześniejsze rozwiązania „żaden agent nie rozwiązuje w pełni żadnego problemu od początku do końca, a najlepszy przechodzi 14,8% punktów kontrolnych”.

Jak weryfikować pracę agenta bez czytania każdej linii?

Dział zatytułowany „Jak weryfikować pracę agenta bez czytania każdej linii?”

Nic z tego nie przemawia za pozostaniem na poziomie 2. Pokazuje tylko, jak się wspinać: autonomię zdobywa się dla każdej pętli osobno, wobec wyroczni weryfikacyjnej, a nie ogłasza dla całej bazy kodu. Faros pokazuje generowanie, które się skaluje, i weryfikację, która się nie skaluje, czyli sufit poziomu 3 zapisany w telemetrii. Wspinaczka polega na dokładaniu dowodów, a nie na rezygnacji z recenzenta.

WarstwaCzego dowodziKto zatwierdza
Warunek stopu jako polecenia kończące się kodem 0Cel pętli jest spełnionyAutor specyfikacji, przed startem przebiegu
Deterministyczne walidatory (typy, lint, testy, schematy)Znane klasy błędów nie występująCI, przy każdym pushu
Agent recenzujący (/code-review, /review, Bugbot)Drugi model nie znalazł problemu blokującegoCzłowiek przypisany do zadania czyta jego ustalenia, nie diff
Limit powtórzeń i eskalacjaAgent nie zapętli się ani nie osłabi testu, żeby przejśćLudzki operator, po wyczerpaniu limitu (Stripe: dwie rundy CI)
Sygnały z produkcji (incydenty na PR, odsetek wycofań)Wyrocznia łapie to, co ważneTech lead, co tydzień

Naresh B A ujmuje zasadę w jednym zdaniu: „Model może przekonywać, że jego praca jest skończona. Deterministyczny walidator może udowodnić, że brakuje wymaganego pola”. Zasada produktowa Lineara ustala odpowiedzialność: „zgłoszenia można przypisać tylko ludziom, a agentom jedynie delegować”. Pełna metoda to czytanie dowodów zamiast diffów.

Sześć obowiązków przetrwa każdy szczebel poniżej ciemnej fabryki: smak, architektura, kierunek produktu, projektowanie warunków stopu, uprawnienia i decyzja, czego nie automatyzować. Karpathy mówi: „odpowiadasz za smak, inżynierię, projekt i za to, czy system ma sens”. Zrozumienie to ten obowiązek, który eroduje po cichu. W randomizowanym badaniu Anthropic z 29 stycznia 2026, na 52 głównie młodszych inżynierach uczących się nowej biblioteki, „grupa z AI uzyskała średnio 50% w quizie, wobec 67% w grupie piszącej ręcznie”. Nadzór wymaga umiejętności, które nadmierne delegowanie osłabia. Zadanie człowieka omawia każdy obowiązek szczegółowo.

Prompty i szablony, które umieszczą twój zespół na drabinie

Dział zatytułowany „Prompty i szablony, które umieszczą twój zespół na drabinie”

Pierwszy prompt uruchom w Claude Code, Codeksie albo Cursorze na repozytorium, z którego wdrażasz. Działa bez zmian we wszystkich trzech narzędziach.

Dla kadry zarządzającej artefaktem do przyjęcia jest zasada raportowania: nigdy nie pokazuj udziału kodu ani przepustowości bez pary jakościowej.

Raportuj toZawsze obokDlaczego ta para
Udział linii scalonych napisanych przez AIIncydenty na pull requestAnthropic i Redwood: linie to nie praca
Pull requesty scalone na inżynieraMediana czasu w przeglądzie i czas do pierwszego przegląduFaros: obie metryki przeglądu ruszyły razem z przepustowością
Mediana rozmiaru pull requestaOdsetek PR-ów scalonych bez przegląduDX i Faros: większe diffy, cieńszy przegląd
Poziom autonomii dla każdej pętliNazwana wyrocznia i jej limit powtórzeńStripe: limit dwóch rund CI i ponad 3 mln testów sprawiają, że ludzie recenzują zamiast przepisywać

Model zdolności AI od DORA (23 września 2025) wskazuje siedem fundamentów, które warto sfinansować najpierw. Ramy metryk zamieniają te pary w dashboard.

Kiedy liczby o inżynierii agentowej z 2026 roku są nadużywane

Dział zatytułowany „Kiedy liczby o inżynierii agentowej z 2026 roku są nadużywane”

Pięć sposobów błędnego odczytania tych dowodów, każdy z drogą wyjścia.

  • Czytanie „procentu linii” jako „procentu pracy”. Przypis Anthropic i krytyka Redwood odmawiają tego kroku. Wyjście: każdą liczbę udziału zestawiaj z miarą pracy, którą ten sam zespół kontroluje.
  • Cytowanie połowy Farosa. +66,2% epików i +242,7% incydentów pochodzą z jednego zbioru danych. Cytuj przepustowość i jakość razem albo wcale.
  • Odwrócenie znaku METR. METR podaje zmianę czasu wykonania, więc -18% oznacza mniej czasu, a nie spowolnienie. Wyjście: za każdym razem podawaj przedział i zastrzeżenie METR o „niewiarygodnym sygnale”.
  • Podawanie wewnętrznego udziału dostawcy jako stawki branżowej. Anthropic, Stripe, Google i Cherny mówią o sobie. Jako liczbę branżową podawaj 51,9% z DX albo 42% z Sonara.
  • Publikowanie przeterminowanych twierdzeń o funkcjach. Cursor nie miał /goal, zanim 19 sierpnia 2026 zaczął go udostępniać. W dniu publikacji sprawdź ponownie stronę dostawcy albo --help w CLI i dopisz datę do każdego twierdzenia przeczącego.
  1. Shapiro, „The Five Levels: from Spicy Autocomplete to the Dark Factory”, 23 sty 2026. https://www.danshapiro.com/blog/2026/01/the-five-levels-from-spicy-autocomplete-to-the-software-factory/
  2. Simon Willison, „The Five Levels: from Spicy Autocomplete to the Dark Factory”, 28 sty 2026. https://simonwillison.net/2026/Jan/28/the-five-levels/
  3. Karpathy, „Sequoia Ascent 2026”, 30 kwi 2026. https://karpathy.bearblog.dev/sequoia-ascent-2026/
  4. Anthropic, „When AI builds itself”, bez daty („as of May 2026”). https://www.anthropic.com/institute/recursive-self-improvement
  5. Fortune, „Top engineers at Anthropic, OpenAI say AI now writes 100% of their code”, 29 sty 2026. https://fortune.com/2026/01/29/100-percent-of-code-at-anthropic-and-openai-is-now-ai-written-boris-cherny-roon/
  6. DX, „AI-authored code has nearly doubled”, 17 cze 2026. https://newsletter.getdx.com/p/ai-authored-code-has-nearly-doubled
  7. Sonar, „State of Code Developer Survey”, 8 sty 2026. https://www.sonarsource.com/blog/state-of-code-developer-survey-report-the-current-reality-of-ai-coding/
  8. Murphy-Hill, Butler i Savelieva, „Adoption and Impact of Command-Line AI Coding Agents”, arXiv:2607.01418, 1 lip 2026. https://arxiv.org/abs/2607.01418
  9. Stripe, „Minions”, części 1 i 2, 9 i 19 lut 2026. https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents-part-2
  10. Ryan Greenblatt, Redwood Research, „Is 90% of code at Anthropic being written by AIs?”, 22 paź 2025. https://blog.redwoodresearch.org/p/is-90-of-code-at-anthropic-being
  11. METR, badanie z początku 2025 roku, 10 lip 2025, i aktualizacja z 24 lut 2026, wraz z kodem analizy, który definiuje znak. https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/, https://metr.org/blog/2026-02-24-uplift-update/ oraz https://github.com/METR/Measuring-Late-2025-AI-on-OSS-Devs
  12. Faros AI, „The Acceleration Whiplash”, kwi 2026. https://www.faros.ai/blog/ai-acceleration-whiplash-takeaways
  13. Google Cloud, „Announcing the 2025 DORA Report”, 23 wrz 2025, oraz „Introducing DORA’s inaugural AI Capabilities Model”, 23 wrz 2025. https://cloud.google.com/blog/products/ai-machine-learning/announcing-the-2025-dora-report oraz https://cloud.google.com/blog/products/ai-machine-learning/introducing-doras-inaugural-ai-capabilities-model
  14. Orlanski i in., „SlopCodeBench”, 25 mar 2026. https://arxiv.org/abs/2603.24755
  15. Anthropic Research (Judy Hanwen Shen i Alex Tamkin), randomizowane badanie wpływu asysty AI na umiejętności programistyczne, 29 sty 2026. https://www.anthropic.com/research/AI-assistance-coding-skills
  16. BCG Platinion, „The Agentic Software Factory”, 26 mar 2026. https://www.bcgplatinion.com/insights/the-agentic-software-factory
  17. Grigorev, „AI-Native Development”, 22 lip 2026. https://aishippingblog.com/p/ai-native-development-specifications
  18. Naresh B A, „Graph Engineering for AI Coding Agents”, 30 lip 2025. https://dev.to/naresh_007/graph-engineering-for-ai-coding-agents-beyond-prompt-loops-48h4
  19. Linear, „Our approach to building the Agent Interaction SDK”, 1 sie 2025. https://linear.app/now/our-approach-to-building-the-agent-interaction-sdk
  20. DoltHub (Tim Sehn), „A Day in Gas Town”, 15 sty 2026, oraz „A Week in Gas Town”, 24 mar 2026. https://www.dolthub.com/blog/2026-01-15-a-day-in-gas-town/ oraz https://www.dolthub.com/blog/2026-03-24-a-week-in-gas-town/
  21. Council on Foreign Relations, „CEO Speaker Series With Dario Amodei”, 10 mar 2025. https://www.cfr.org/event/ceo-speaker-series-dario-amodei-anthropic
  22. Fast Company (źródło wtórne), „Google CEO says 75% of the company’s code is AI-generated”, 24 kwi 2026. https://www.fastcompany.com/91531519/google-ceo-says-75-of-the-companys-code-is-ai-generated

Najczęstsze pytania

Jaki procent kodu pisze AI w 2026 roku?

Najszerszą miarą branżową jest panel DX z drugiego kwartału 2026, ponad 400 firm: średnio 51,9% kodu napisanego przez AI. Ankieta Sonara ze stycznia 2026 wśród ponad 1100 programistów podaje 42% kodu w commitach jako wygenerowanego lub wspieranego przez AI. „Ponad 80%” Anthropic to liczba z wnętrza firmy i dotyczy linii scalonych do produkcji, a nie udziału w pracy.

Czym jest inżynieria agentowa?

Andrej Karpathy nazwał tę dyscyplinę 30 kwietnia 2026: „Nazywam to inżynierią agentową, bo to dyscyplina inżynierska. Masz agentów, czyli byty nierówne w swoich możliwościach. Są omylne i stochastyczne, ale wyjątkowo mocne. Jak je skoordynować, żeby iść szybciej bez obniżania progu jakości?”

Jakie są poziomy autonomii w kodowaniu z AI?

Skala Dana Shapiro z 23 stycznia 2026 biegnie od L0 do L5: ostre autouzupełnianie, stażysta od kodu, junior, programista (twoje życie to diffy), zespół inżynierski (piszesz specyfikację i sprawdzasz, czy testy przechodzą) oraz ciemna fabryka oprogramowania, w której nikt nie czyta kodu.

Czy AI przyspiesza programistów?

Żaden pomiar tego nie rozstrzyga. Randomizowane badanie METR z 2025 roku wykazało, że zadania trwały o 19% dłużej. W kontynuacji z lutego 2026 oszacowania punktowe wypadają na korzyść AI (około 18% i 4% mniej czasu), ale przedziały przechodzą przez zero, a METR nazywa te dane niewiarygodnym sygnałem. Microsoft zmierzył mniej więcej 24% więcej scalonych pull requestów, a Faros spadek jakości idący w parze ze wzrostem przepustowości.