Rynek agentów kodujących poza wielką trójką
Poza Claude Code, Codex i Cursorem agenci kodujący we wrześniu 2026 dzielą się na trzy grupy: agentów chmurowych, którzy zamieniają zgłoszenie w pull request (GitHub Copilot, Jules), skryptowalnych agentów terminalowych (Gemini CLI, OpenCode, Amp, Factory Droid) oraz środowiska edytorowe i desktopowe (Kiro, Devin Desktop, Cline, Kilo Code, Junie, Warp). Uszeregować ich może tylko bake-off na prawdziwych zamkniętych zgłoszeniach.
CTO pyta: „czy kupić jeszcze agenta Copilota, czy przejść na Kiro?”. Strony producentów, liczby gwiazdek i leaderboardy nie odpowiedzą, bo żadne z nich nie mierzy twojego kodu, twoich bramek ani czasu twoich recenzentów.
Co daje ci ta mapa agentów
Dział zatytułowany „Co daje ci ta mapa agentów”- Datowaną mapę 14 agentów i tabelę, która prowadzi od twojej potrzeby do agentów wartych testu.
- Jedyny w serwisie protokół bake-offu (korzystają z niego też przegląd powłok agentowych i hub frameworków): karta wyników, polecenia uruchomienia i reguła decyzyjna.
Gdzie działa który agent kodujący?
Dział zatytułowany „Gdzie działa który agent kodujący?”Sprawdzone 2026-09-26 w repozytoriach producentów, w github/docs i w npm. Ceny planów są na stronie cenowej, ceny modeli w hubie modeli.
| Agent | Producent, licencja | Gdzie działa | Co automatyzuje | Instalacja lub punkt wejścia |
|---|---|---|---|---|
| GitHub Copilot | GitHub, licencja własnościowa | Cloud agent w GitHub Actions; aplikacja desktopowa; CLI | Zadania kończące się pull requestem, @copilot w pull requestach, automatyzacje; uruchamia też Claude i Codex (public preview) | npm install -g @github/copilot (CLI 1.0.88, polecenie copilot) |
| Gemini CLI | Google, Apache-2.0 | Terminal, tryb headless, GitHub Action | Zadania skryptowe z wyjściem JSON, @gemini-cli w zgłoszeniach | npm install -g @google/gemini-cli (0.61.0, polecenie gemini) |
| Jules i Antigravity | Jules: maszyna wirtualna w chmurze; Antigravity: limit w planach Google AI (źródło wtórne: CloudZero) | Jules otwiera pull requesty (jules-action); Antigravity obsługuje Agent Skills | Konta u producenta | |
| Kiro | AWS | IDE, CLI, Web, Mobile (preview) | Specyfikacje, testy oparte na właściwościach, steering, Agent Skills | Pobranie od producenta |
| Devin Desktop i Devin CLI | Cognition | Edytor (dawniej Windsurf), CLI | Agent w edytorze; model SWE-2 od 2026-09-10 | Pobranie od producenta |
| OpenCode | anomalyco, open source | Terminal, aplikacja desktopowa (beta) | Dowolny dostawca modeli; agent plan tylko do odczytu | npm i -g opencode-ai@latest (1.18.32) |
| Amp | Amp, licencja własnościowa | Terminal | Tryb wykonawczy amp -x, subagenci, druga opinia modelu „Oracle” | npm install -g @ampcode/cli (polecenie amp) |
| Factory Droid | Factory, licencja własnościowa | Terminal, tryb headless | Nienadzorowane zadania z CLI | npm install -g @factory/cli (0.228.0, polecenie droid) |
| Cline | Cline, Apache-2.0 | VS Code, JetBrains, CLI headless | Twoje własne klucze do modeli | npm install -g cline (3.0.65) |
| Kilo Code | Kilo, MIT | VS Code, JetBrains, CLI (fork OpenCode) | „500+ models” w jednym agencie | npm install -g @kilocode/cli (7.8.1, polecenie kilo) |
| Junie | JetBrains | IDE JetBrains, terminal, CI/CD | „An LLM-agnostic coding agent” | npm install -g @jetbrains/junie (3110.7.0) |
| Warp | Warp, klient na AGPL-3.0 | Terminal desktopowy | Własny agent, Claude Code, Codex, Gemini CLI | Pobranie od producenta |
Zmiana nazwy na Devin Desktop (czerwiec 2026) i data SWE-2 pochodzą ze źródeł wtórnych (SECONDARY: creeta, aipricing.guru). Kolejnych agentów terminalowych open source (Goose, Crush, Qwen Code, Aider) opisuje strona inni agenci kodujący.
Popularność, z datą. Gwiazdki na GitHubie 2026-09-26: OpenCode 210 085, Gemini CLI 107 166, Cline 69 340, Warp 65 162, Kilo Code 27 419, Copilot CLI 11 211 (repozytorium bez kodu źródłowego, więc gwiazdki zaniżają użycie). Gwiazdki mierzą uwagę, a nie dopasowanie.
Którego agenta testować przy jakiej potrzebie?
Dział zatytułowany „Którego agenta testować przy jakiej potrzebie?”| Jeśli potrzebujesz… | Testuj najpierw | Dlaczego |
|---|---|---|
| Zgłoszenia zamienianego w pull request bez człowieka przy klawiaturze | Copilot cloud agent, Jules | Przebiegi w środowisku producenta, które otwierają pull requesty |
| Drugiego agenta w ramach istniejącej umowy na Copilota | Aplikacja lub CLI Copilota, potem Claude albo Codex wewnątrz Copilota | Licencje, za które już płacisz; AI credits od 2026-06-01 |
| Agenta open source dla dowolnego modelu, także hostowanego u siebie | OpenCode, Cline, Kilo Code | Otwarte licencje, dowolny dostawca; zobacz modele open-weight |
| Agenta dla zespołu na IDE JetBrains | Junie, potem Cline, Kilo Code | Agent zostaje w IDE zespołu |
| Pracy spec-driven z testami opartymi na właściwościach | Kiro | Wbudowane w produkt |
| Darmowego agenta terminalowego do skryptów | Gemini CLI | „60 requests/min and 1,000 requests/day with personal Google account” (README, 2026-09-26) |
| Jednego graficznego terminala dla agentów, których już używasz | Warp | Uruchamia twoich agentów obok siebie; licencję AGPL-3.0 klienta uzgodnij z działem prawnym, zanim zaczniesz go modyfikować lub dystrybuować |
Utrzymuj harness przenośny: Copilot, Kiro i Antigravity obsługują Agent Skills, Copilot i Gemini CLI obsługują MCP, a jeden plik AGENTS.md może przechowywać reguły projektu dla nich wszystkich. Kandydat z własnym formatem instrukcji to koszt uzależnienia od dostawcy; zobacz lock-in i przenośność.
Jak przeprowadzić bake-off agentów kodujących?
Dział zatytułowany „Jak przeprowadzić bake-off agentów kodujących?”Bake-off to powtórzenie zamkniętej już pracy przez obecne narzędzie i jednego lub dwóch kandydatów w identycznych warunkach, z oceną przez bramki jakości zamiast opinii. Projekt pilotażu sprawdza potem, czy zwycięzca zmienia dostarczanie.
-
Najpierw spisz regułę decyzyjną. Wskaż właściciela decyzji, obecne narzędzie, najwyżej dwóch kandydatów i progi (tabela niżej).
-
Zbuduj zestaw zadań. Wybierz 10–20 zgłoszeń zamkniętych w ostatnich 90 dniach, ze scaloną poprawką: około 40% błędów, 30% małych funkcji, 20% refaktoryzacji, 10% testów.
-
Ukryj wyrocznię. Zamień każdą scaloną poprawkę w testy akceptacyjne poza worktree agenta; zobacz chroń wyrocznię testową.
-
Zamroź harness. Ten sam commit,
AGENTS.md, serwery MCP i limit budżetu, świeży worktree lub kontener na każdy przebieg. Użyj domyślnego modelu każdego narzędzia i, gdzie się da, jednego przebiegu na wspólnym modelu, żeby oddzielić harness od modelu. -
Uruchom każde zadanie trzy razy na agenta. Jeden przebieg mierzy szczęście.
-
Oceniaj automatycznie, a przeglądaj tylko to, co przeszło. Bramki, ukryte testy, agent recenzujący; człowiek przegląda tylko to, co przeszło wszystkie trzy etapy, i zapisuje minuty.
-
Zdecyduj i zaplanuj powtórkę. Zastosuj regułę, a potem powtórz test, gdy producent zmieni domyślny model; zobacz playbook nowego modelu.
Uruchom to samo zadanie w trybie headless w każdym agencie
Dział zatytułowany „Uruchom to samo zadanie w trybie headless w każdym agencie”Polecenia sprawdzono 2026-09-26 w zainstalowanym CLI albo w dokumentacji producenta. Każde polecenie niżej uruchamia agenta w pełni otwartego, więc uruchamiaj je tylko w jednorazowym kontenerze.
# Terminal, w jednorazowym kontenerze zadaniaclaude -p "$(cat task.md)" --permission-mode bypassPermissions \ --output-format json --max-budget-usd 5 > run.json# Tylko w kontenerze z zewnętrznym sandboxem (codex 0.157.1)codex exec --dangerously-bypass-approvals-and-sandbox --json -o last-message.md "$(cat task.md)" > run.jsonlUruchom ten sam task.md jako Cloud Agent albo w agencie edytora na świeżej gałęzi i wypełnij kartę wyników ręcznie. Nazwy polecenia Cursor CLI nie zweryfikowano 2026-09-26, więc nie ma go tu w skrypcie.
# Kandydaci, ten sam plik zadania, ten sam w pełni otwarty zakres# (gemini, amp: dokumentacja producentów; copilot: --help CLI 1.0.88; 2026-09-26)gemini -p "$(cat task.md)" --approval-mode yolo --output-format json > run.jsoncopilot -p "$(cat task.md)" --allow-all-tools --max-ai-credits 500 -s > run.txtamp -x "$(cat task.md)"Trzymaj jeden zakres uprawnień dla wszystkich agentów, inaczej mierzysz uprawnienia, a nie agenta. Dla węższego zakresu ogranicz każdego agenta do edycji i polecenia testów: Claude Code --permission-mode acceptEdits --allowedTools "Bash(npm test *)", Codex --sandbox workspace-write, Copilot wzorcami z copilot help permissions, na przykład --allow-tool='shell(npm:*)' (sprawdź to raz wcześniej: Copilot CLI 1.0.88 nazywa --allow-all-tools flagą „required for non-interactive mode”).
Claude Code (--max-budget-usd) i Copilot CLI (--max-ai-credits, 1 AI credit = $0.01; CLI 1.0.88) ograniczają wydatki z poziomu CLI. Dla Codex, Gemini CLI i Ampa (brak flagi limitu wydatków; sprawdzone na codex 0.157.1) egzekwuj limit z kroku 4 przez timeout (na przykład timeout 20m), a cost_usd odczytuj z eksportu rozliczeń dostawcy. Inne tryby headless: zobacz agenci headless w CI.
Karta wyników i reguła decyzyjna do przyjęcia
Dział zatytułowany „Karta wyników i reguła decyzyjna do przyjęcia”Jeden wiersz na przebieg; accepted ma wartość 1 tylko wtedy, gdy przeszły bramki, ukryte testy i przegląd człowieka.
task_id,agent,model,run,gates_pass,heldout_pass,blocking_review_findings,interventions,wall_minutes,cost_usd,reviewer_minutes,acceptedBUG-4312,incumbent,default,1,1,1,0,0,14,1.80,6,1| Metryka | Definicja | Przykładowy próg „przyjmujemy kandydata” |
|---|---|---|
| Odsetek akceptacji | zaakceptowane przebiegi ÷ wszystkie przebiegi | Najwyżej 5 punktów poniżej obecnego narzędzia albo lepiej |
| Koszt zaakceptowanej zmiany | (koszt użycia + minuty recenzenta × pełna stawka) ÷ zaakceptowane przebiegi; zobacz ekonomię | Najwyżej 80% kosztu obecnego narzędzia |
| Interwencje | wiadomości lub zatwierdzenia człowieka | Nie więcej niż mediana obecnego narzędzia |
| Ucieczki spod bramek | przebiegi, które przechodzą bramki, ale oblewają ukryte testy | Nie więcej niż u obecnego narzędzia |
Dwa prompty do skopiowania: zestaw zadań i ukryte testy
PR_NUMBER to numer scalonego pull requesta, który zamknął zgłoszenie.
Co psuje bake-off agentów kodujących?
Dział zatytułowany „Co psuje bake-off agentów kodujących?”- Kandydat widział odpowiedź. Plik zadania cytujący poprawkę albo testy w worktree zawyżają wyniki. Naprawa: wygeneruj
task.mdwyłącznie ze zgłoszenia. - Wynik mierzy model, a nie agenta. Naprawa: dodaj przebieg na wspólnym modelu z kroku 4.
- Plik instrukcji się nie wczytał. Claude Code na przykład czyta
AGENTS.mdtylko wtedy, gdy nie maCLAUDE.md(od v2.1.277, kanałlatest). Naprawa: zaczynaj każdy przebieg od prośby, żeby agent zacytował pierwszą regułę projektu. - Narzędzie zmieniło się w trakcie. Roo Code zamknięto 15 maja 2026 według jego README, a README Continue mówi „no longer actively maintained and is read-only”. Naprawa: wybieraj przenośną konfigurację (MCP, Agent Skills,
AGENTS.md) i powtarzaj bake-off przed odnowieniem umów. - Agent chmurowy dostał więcej dostępu, niż wymagał test. Naprawa: podłącz repozytorium testowe lub fork; zobacz uprawnienia i sandboxing.
Dokąd dalej z mapą agentów
Dział zatytułowany „Dokąd dalej z mapą agentów”Najczęstsze pytania
Jacy agenci kodujący istnieją poza Claude Code, Codex i Cursorem?
Stan na 2026-09-26: GitHub Copilot (cloud agent, aplikacja desktopowa, CLI), Gemini CLI, Jules i Antigravity od Google, Kiro od AWS, Devin Desktop (dawniej Windsurf) i Devin CLI od Cognition oraz niezależne narzędzia OpenCode, Amp, Factory Droid, Cline, Kilo Code, Junie od JetBrains i Warp.
Który z nich jest najlepszy?
Ta strona nie tworzy rankingu, bo żaden publiczny benchmark nie mierzy twojego repozytorium, twoich bramek jakości ani kosztu review. Zawęź listę według tego, gdzie agent działa i co automatyzuje, a potem przeprowadź bake-off na 10–20 własnych zamkniętych zgłoszeniach.
Jak porównać nowego agenta z tym, którego już używamy?
Przepuść te same zamknięte zgłoszenia przez obu agentów z tego samego commita, z tym samym plikiem instrukcji i budżetem, po trzy przebiegi. Oceń wyniki istniejącymi bramkami i ukrytymi testami akceptacyjnymi, a potem porównaj zaakceptowane zmiany, interwencje i koszt zaakceptowanej zmiany z regułą decyzyjną spisaną przed pierwszym przebiegiem.