Przejdź do głównej zawartości

Rynek agentów kodujących poza wielką trójką

Poza Claude Code, Codex i Cursorem agenci kodujący we wrześniu 2026 dzielą się na trzy grupy: agentów chmurowych, którzy zamieniają zgłoszenie w pull request (GitHub Copilot, Jules), skryptowalnych agentów terminalowych (Gemini CLI, OpenCode, Amp, Factory Droid) oraz środowiska edytorowe i desktopowe (Kiro, Devin Desktop, Cline, Kilo Code, Junie, Warp). Uszeregować ich może tylko bake-off na prawdziwych zamkniętych zgłoszeniach.

CTO pyta: „czy kupić jeszcze agenta Copilota, czy przejść na Kiro?”. Strony producentów, liczby gwiazdek i leaderboardy nie odpowiedzą, bo żadne z nich nie mierzy twojego kodu, twoich bramek ani czasu twoich recenzentów.

  • Datowaną mapę 14 agentów i tabelę, która prowadzi od twojej potrzeby do agentów wartych testu.
  • Jedyny w serwisie protokół bake-offu (korzystają z niego też przegląd powłok agentowych i hub frameworków): karta wyników, polecenia uruchomienia i reguła decyzyjna.

Sprawdzone 2026-09-26 w repozytoriach producentów, w github/docs i w npm. Ceny planów są na stronie cenowej, ceny modeli w hubie modeli.

AgentProducent, licencjaGdzie działaCo automatyzujeInstalacja lub punkt wejścia
GitHub CopilotGitHub, licencja własnościowaCloud agent w GitHub Actions; aplikacja desktopowa; CLIZadania kończące się pull requestem, @copilot w pull requestach, automatyzacje; uruchamia też Claude i Codex (public preview)npm install -g @github/copilot (CLI 1.0.88, polecenie copilot)
Gemini CLIGoogle, Apache-2.0Terminal, tryb headless, GitHub ActionZadania skryptowe z wyjściem JSON, @gemini-cli w zgłoszeniachnpm install -g @google/gemini-cli (0.61.0, polecenie gemini)
Jules i AntigravityGoogleJules: maszyna wirtualna w chmurze; Antigravity: limit w planach Google AI (źródło wtórne: CloudZero)Jules otwiera pull requesty (jules-action); Antigravity obsługuje Agent SkillsKonta u producenta
KiroAWSIDE, CLI, Web, Mobile (preview)Specyfikacje, testy oparte na właściwościach, steering, Agent SkillsPobranie od producenta
Devin Desktop i Devin CLICognitionEdytor (dawniej Windsurf), CLIAgent w edytorze; model SWE-2 od 2026-09-10Pobranie od producenta
OpenCodeanomalyco, open sourceTerminal, aplikacja desktopowa (beta)Dowolny dostawca modeli; agent plan tylko do odczytunpm i -g opencode-ai@latest (1.18.32)
AmpAmp, licencja własnościowaTerminalTryb wykonawczy amp -x, subagenci, druga opinia modelu „Oracle”npm install -g @ampcode/cli (polecenie amp)
Factory DroidFactory, licencja własnościowaTerminal, tryb headlessNienadzorowane zadania z CLInpm install -g @factory/cli (0.228.0, polecenie droid)
ClineCline, Apache-2.0VS Code, JetBrains, CLI headlessTwoje własne klucze do modelinpm install -g cline (3.0.65)
Kilo CodeKilo, MITVS Code, JetBrains, CLI (fork OpenCode)„500+ models” w jednym agencienpm install -g @kilocode/cli (7.8.1, polecenie kilo)
JunieJetBrainsIDE JetBrains, terminal, CI/CD„An LLM-agnostic coding agent”npm install -g @jetbrains/junie (3110.7.0)
WarpWarp, klient na AGPL-3.0Terminal desktopowyWłasny agent, Claude Code, Codex, Gemini CLIPobranie od producenta

Zmiana nazwy na Devin Desktop (czerwiec 2026) i data SWE-2 pochodzą ze źródeł wtórnych (SECONDARY: creeta, aipricing.guru). Kolejnych agentów terminalowych open source (Goose, Crush, Qwen Code, Aider) opisuje strona inni agenci kodujący.

Popularność, z datą. Gwiazdki na GitHubie 2026-09-26: OpenCode 210 085, Gemini CLI 107 166, Cline 69 340, Warp 65 162, Kilo Code 27 419, Copilot CLI 11 211 (repozytorium bez kodu źródłowego, więc gwiazdki zaniżają użycie). Gwiazdki mierzą uwagę, a nie dopasowanie.

Jeśli potrzebujesz…Testuj najpierwDlaczego
Zgłoszenia zamienianego w pull request bez człowieka przy klawiaturzeCopilot cloud agent, JulesPrzebiegi w środowisku producenta, które otwierają pull requesty
Drugiego agenta w ramach istniejącej umowy na CopilotaAplikacja lub CLI Copilota, potem Claude albo Codex wewnątrz CopilotaLicencje, za które już płacisz; AI credits od 2026-06-01
Agenta open source dla dowolnego modelu, także hostowanego u siebieOpenCode, Cline, Kilo CodeOtwarte licencje, dowolny dostawca; zobacz modele open-weight
Agenta dla zespołu na IDE JetBrainsJunie, potem Cline, Kilo CodeAgent zostaje w IDE zespołu
Pracy spec-driven z testami opartymi na właściwościachKiroWbudowane w produkt
Darmowego agenta terminalowego do skryptówGemini CLI„60 requests/min and 1,000 requests/day with personal Google account” (README, 2026-09-26)
Jednego graficznego terminala dla agentów, których już używaszWarpUruchamia twoich agentów obok siebie; licencję AGPL-3.0 klienta uzgodnij z działem prawnym, zanim zaczniesz go modyfikować lub dystrybuować

Utrzymuj harness przenośny: Copilot, Kiro i Antigravity obsługują Agent Skills, Copilot i Gemini CLI obsługują MCP, a jeden plik AGENTS.md może przechowywać reguły projektu dla nich wszystkich. Kandydat z własnym formatem instrukcji to koszt uzależnienia od dostawcy; zobacz lock-in i przenośność.

Bake-off to powtórzenie zamkniętej już pracy przez obecne narzędzie i jednego lub dwóch kandydatów w identycznych warunkach, z oceną przez bramki jakości zamiast opinii. Projekt pilotażu sprawdza potem, czy zwycięzca zmienia dostarczanie.

  1. Najpierw spisz regułę decyzyjną. Wskaż właściciela decyzji, obecne narzędzie, najwyżej dwóch kandydatów i progi (tabela niżej).

  2. Zbuduj zestaw zadań. Wybierz 10–20 zgłoszeń zamkniętych w ostatnich 90 dniach, ze scaloną poprawką: około 40% błędów, 30% małych funkcji, 20% refaktoryzacji, 10% testów.

  3. Ukryj wyrocznię. Zamień każdą scaloną poprawkę w testy akceptacyjne poza worktree agenta; zobacz chroń wyrocznię testową.

  4. Zamroź harness. Ten sam commit, AGENTS.md, serwery MCP i limit budżetu, świeży worktree lub kontener na każdy przebieg. Użyj domyślnego modelu każdego narzędzia i, gdzie się da, jednego przebiegu na wspólnym modelu, żeby oddzielić harness od modelu.

  5. Uruchom każde zadanie trzy razy na agenta. Jeden przebieg mierzy szczęście.

  6. Oceniaj automatycznie, a przeglądaj tylko to, co przeszło. Bramki, ukryte testy, agent recenzujący; człowiek przegląda tylko to, co przeszło wszystkie trzy etapy, i zapisuje minuty.

  7. Zdecyduj i zaplanuj powtórkę. Zastosuj regułę, a potem powtórz test, gdy producent zmieni domyślny model; zobacz playbook nowego modelu.

Uruchom to samo zadanie w trybie headless w każdym agencie

Dział zatytułowany „Uruchom to samo zadanie w trybie headless w każdym agencie”

Polecenia sprawdzono 2026-09-26 w zainstalowanym CLI albo w dokumentacji producenta. Każde polecenie niżej uruchamia agenta w pełni otwartego, więc uruchamiaj je tylko w jednorazowym kontenerze.

Okno terminala
# Terminal, w jednorazowym kontenerze zadania
claude -p "$(cat task.md)" --permission-mode bypassPermissions \
--output-format json --max-budget-usd 5 > run.json
Okno terminala
# Kandydaci, ten sam plik zadania, ten sam w pełni otwarty zakres
# (gemini, amp: dokumentacja producentów; copilot: --help CLI 1.0.88; 2026-09-26)
gemini -p "$(cat task.md)" --approval-mode yolo --output-format json > run.json
copilot -p "$(cat task.md)" --allow-all-tools --max-ai-credits 500 -s > run.txt
amp -x "$(cat task.md)"

Trzymaj jeden zakres uprawnień dla wszystkich agentów, inaczej mierzysz uprawnienia, a nie agenta. Dla węższego zakresu ogranicz każdego agenta do edycji i polecenia testów: Claude Code --permission-mode acceptEdits --allowedTools "Bash(npm test *)", Codex --sandbox workspace-write, Copilot wzorcami z copilot help permissions, na przykład --allow-tool='shell(npm:*)' (sprawdź to raz wcześniej: Copilot CLI 1.0.88 nazywa --allow-all-tools flagą „required for non-interactive mode”).

Claude Code (--max-budget-usd) i Copilot CLI (--max-ai-credits, 1 AI credit = $0.01; CLI 1.0.88) ograniczają wydatki z poziomu CLI. Dla Codex, Gemini CLI i Ampa (brak flagi limitu wydatków; sprawdzone na codex 0.157.1) egzekwuj limit z kroku 4 przez timeout (na przykład timeout 20m), a cost_usd odczytuj z eksportu rozliczeń dostawcy. Inne tryby headless: zobacz agenci headless w CI.

Jeden wiersz na przebieg; accepted ma wartość 1 tylko wtedy, gdy przeszły bramki, ukryte testy i przegląd człowieka.

task_id,agent,model,run,gates_pass,heldout_pass,blocking_review_findings,interventions,wall_minutes,cost_usd,reviewer_minutes,accepted
BUG-4312,incumbent,default,1,1,1,0,0,14,1.80,6,1
MetrykaDefinicjaPrzykładowy próg „przyjmujemy kandydata”
Odsetek akceptacjizaakceptowane przebiegi ÷ wszystkie przebiegiNajwyżej 5 punktów poniżej obecnego narzędzia albo lepiej
Koszt zaakceptowanej zmiany(koszt użycia + minuty recenzenta × pełna stawka) ÷ zaakceptowane przebiegi; zobacz ekonomięNajwyżej 80% kosztu obecnego narzędzia
Interwencjewiadomości lub zatwierdzenia człowiekaNie więcej niż mediana obecnego narzędzia
Ucieczki spod bramekprzebiegi, które przechodzą bramki, ale oblewają ukryte testyNie więcej niż u obecnego narzędzia
Dwa prompty do skopiowania: zestaw zadań i ukryte testy

PR_NUMBER to numer scalonego pull requesta, który zamknął zgłoszenie.

  • Kandydat widział odpowiedź. Plik zadania cytujący poprawkę albo testy w worktree zawyżają wyniki. Naprawa: wygeneruj task.md wyłącznie ze zgłoszenia.
  • Wynik mierzy model, a nie agenta. Naprawa: dodaj przebieg na wspólnym modelu z kroku 4.
  • Plik instrukcji się nie wczytał. Claude Code na przykład czyta AGENTS.md tylko wtedy, gdy nie ma CLAUDE.md (od v2.1.277, kanał latest). Naprawa: zaczynaj każdy przebieg od prośby, żeby agent zacytował pierwszą regułę projektu.
  • Narzędzie zmieniło się w trakcie. Roo Code zamknięto 15 maja 2026 według jego README, a README Continue mówi „no longer actively maintained and is read-only”. Naprawa: wybieraj przenośną konfigurację (MCP, Agent Skills, AGENTS.md) i powtarzaj bake-off przed odnowieniem umów.
  • Agent chmurowy dostał więcej dostępu, niż wymagał test. Naprawa: podłącz repozytorium testowe lub fork; zobacz uprawnienia i sandboxing.

Najczęstsze pytania

Jacy agenci kodujący istnieją poza Claude Code, Codex i Cursorem?

Stan na 2026-09-26: GitHub Copilot (cloud agent, aplikacja desktopowa, CLI), Gemini CLI, Jules i Antigravity od Google, Kiro od AWS, Devin Desktop (dawniej Windsurf) i Devin CLI od Cognition oraz niezależne narzędzia OpenCode, Amp, Factory Droid, Cline, Kilo Code, Junie od JetBrains i Warp.

Który z nich jest najlepszy?

Ta strona nie tworzy rankingu, bo żaden publiczny benchmark nie mierzy twojego repozytorium, twoich bramek jakości ani kosztu review. Zawęź listę według tego, gdzie agent działa i co automatyzuje, a potem przeprowadź bake-off na 10–20 własnych zamkniętych zgłoszeniach.

Jak porównać nowego agenta z tym, którego już używamy?

Przepuść te same zamknięte zgłoszenia przez obu agentów z tego samego commita, z tym samym plikiem instrukcji i budżetem, po trzy przebiegi. Oceń wyniki istniejącymi bramkami i ukrytymi testami akceptacyjnymi, a potem porównaj zaakceptowane zmiany, interwencje i koszt zaakceptowanej zmiany z regułą decyzyjną spisaną przed pierwszym przebiegiem.