Od automatického doplňování k delegovaným úlohám
První vlna AI pro kód doplňovala řádky a odpovídala na otázky. V roce 2026 pracují vyspělé agentní systémy ve smyčce: získají kontext, naplánují postup, čtou a mění soubory, používají nástroje, ověřují výsledky a iterují. OpenAI popisuje Codex jako agenta pro psaní, kontrolu a dodávání kódu, GitHub jako systém schopný samostatně provádět úlohy v životním cyklu softwaru. [2][3][7]
Vývojář už nemusí řídit každou lokální změnu, ale musí přesněji popsat cíl, rozsah, omezení a definici dokončení.
Co dnes programovací agent skutečně zvládne
Současní agenti umí prohledávat repozitáře, číst historii a dokumentaci, měnit více souborů, spouštět příkazy, testy a linting, analyzovat chyby a připravovat změny k review. GitHub Copilot cloud agent může pracovat na větvi bez okamžitého otevření pull requestu. [7][10]
Claude Code nabízí řízení nástrojů a oprávnění, Codex funguje lokálně i v cloudu a Gemini CLI může běžet interaktivně, ve skriptech i v sandboxu. [2][6][13]
Čtyři hlavní pracovní modely agentů v roce 2026
| Agent | Hlavní prostředí | Pracovní model | Kontrola |
|---|---|---|---|
| OpenAI Codex | ChatGPT, aplikace, CLI, IDE, cloud | Lokálně a paralelně v cloudu | Skills, prostředí, review |
| Claude Code | Terminál, SDK, MCP | Interaktivně a skriptovatelně | Režimy oprávnění, povolené/zakázané nástroje |
| GitHub Copilot cloud agent | GitHub, VS Code, Mobile, desktop app | Asynchronně přes branch/PR | Repo pravidla, logy, review |
| Google Antigravity / Gemini CLI | Antigravity desktop, CLI, SDK | Paralelní agenti a automatizace | Sandbox, hooks, MCP, izolace |
Codex pokrývá aplikaci, CLI, IDE a cloud. Claude Code je zaměřený na terminál a skriptování. GitHub Copilot cloud agent je zabudovaný do issues, větví a pull requestů. Google Antigravity 2.0 zdůrazňuje multiagentní orchestraci a Gemini CLI nabízí open-source terminálového agenta. [2][6][7][8][12][13]
Volba v praxi závisí stejně na prostředí, oprávněních, governance a review procesu jako na samotném modelu.
Úlohy se prodlužují a častěji běží paralelně
OpenAI uvádí, že v květnu 2026 70,2% zkoumaných individuálních uživatelů Codexu zadalo alespoň jednu úlohu odhadovanou na více než hodinu lidské práce a 25,6% alespoň jednu nad osm hodin. Jde o modelové odhady z náhodného vzorku 0,1%, proto jsou orientační. [1]
GitHub Copilot app a Google Antigravity jsou rovněž navrženy pro paralelní relace a nezávislé pracovní proudy. [8][12]
Lidé častěji rozhodují co, agenti jak
Anthropic analyzoval přibližně 400 000 relací Claude Code od října 2025 do dubna 2026. V typické relaci uživatel udělal asi 70% plánovacích rozhodnutí a Claude přibližně 80% prováděcích rozhodnutí. Jeden prompt spustil v průměru asi deset akcí agenta. [4]
Vývojář si tak častěji drží cíl, architekturu a akceptační kritéria, zatímco agent řeší mnoho lokálních implementačních rozhodnutí. Ta stále potřebují kontrolu.
Odbornost stále zvyšuje úspěšnost
Ve stejné studii Anthropic byly odborněji hodnocené relace úspěšnější. Podle nejpřísnější metriky ověřeného úspěchu dosahovaly začátečnické relace asi 15%, zatímco střední a vyšší úroveň zhruba 28 až 33%. Metrika vychází z transkriptů, testů, commitů a potvrzení uživatele, ne z přímé kvality v produkci. [4]
Doménové znalosti proto zůstávají výhodou: pochopení pravidel, okrajových případů, architektury a ověření umožňuje agenta lépe řídit.
Důkazy o produktivitě jsou smíšené a závisí na měření
| Zdroj | Vzorek | Hlavní zjištění |
|---|---|---|
| Anthropic 2026 | ~400 000 relací Claude Code | Uživatel ~70% plánovacích rozhodnutí, Claude ~80% prováděcích |
| METR 2025 RCT | 16 vývojářů, 246 úloh | 19% delší čas s AI nástroji z počátku 2025 |
| METR 2026 survey | 349 technických pracovníků | Medián sebehodnocení 1,4 až 2x hodnoty práce, s důležitými výhradami |
| OpenAI 2026 Codex | Náhodný 0,1% vzorek individuálních uživatelů | 70,2% mělo alespoň jednu úlohu odhadovanou nad jednu hodinu lidské práce |
Randomizovaná studie METR z roku 2025 sledovala 16 zkušených open-source vývojářů na 246 reálných úlohách v dobře známých repozitářích. S nástroji AI z počátku 2025 trvaly úlohy v průměru o 19% déle, i když účastníci věřili, že jsou rychlejší. [14]
V roce 2026 METR označil větší navazující experiment za obtížně interpretovatelný kvůli selekčnímu zkreslení, protože někteří vývojáři nechtěli pracovat bez AI. Samostatný průzkum 349 technických pracovníků vykázal medián sebehodnocené změny hodnoty práce 1,4 až 2x, ale s výraznými výhradami. [15][16]
Code review se stává hlavním kontrolním bodem
Když agent dokáže změnit mnoho souborů a připravit celý pull request, review se stává klíčovým kontrolním mechanismem. GitHub staví agentní workflow na diffech, pull requestech, logách relací, pravidlech repozitáře a lidské kontrole. [7][8][11]
Review se tak posouvá od syntaxe k předpokladům, rozsahu, API kontraktům, architektuře, bezpečnosti, okrajovým případům a tomu, zda změna řeší správný problém.
Testy a CI se stávají kontraktem pro agenta
Agent dokáže rychle vytvořit mnoho věrohodně vypadajícího kódu, ale správnost určí jen explicitní kritéria. Unit, integrační a end-to-end testy, typová kontrola, linting a reprodukovatelné buildy proto získávají na významu. Claude Code a GitHub workflow podporují spouštění příkazů a testů během práce. [6][7][10]
Dobrá úloha popisuje výsledek i způsob ověření. Čím determinističtější verifikace, tím méně ručního odhadování na konci.
Bezpečnost: více autonomie znamená větší rizikovou plochu
Programovací agent může spouštět shell, číst soubory, používat síť a měnit zdrojový kód. Režimy oprávnění, sandbox, omezení nástrojů, ochrana tajemství a auditní logy se proto stávají základními kontrolami. Claude Code má permission modes a allow/deny seznamy, Gemini CLI kontejnerovou izolaci a GitHub logy relací v rámci governance repozitáře. [6][11][13]
Týmy by měly uplatňovat nejmenší oprávnění. Agent pro UI nepotřebuje automaticky produkční tajemství, práva k nasazení nebo destruktivní přístup k infrastruktuře.
Kontext repozitáře se stává infrastrukturou
Kvalita agenta závisí na explicitních konvencích projektu. Instrukce repozitáře, standardy kódu, architektonická pravidla, kontextové soubory, Skills a MCP spojení se mění na strojově čitelné postupy. [2][6][9][13]
Dokumentace tak není jen pro lidi. Zastaralé README, nejasné hranice modulů nebo chybějící příkazy testů přímo snižují spolehlivost agenta.
Multiagentní práce mění den vývojáře
Codex, GitHub Copilot app a Google Antigravity podporují paralelní úlohy. Vývojář může odděleně delegovat testy, refaktor, dokumentaci a opravu chyby a výsledky později zkontrolovat. [1][8][12]
Úzké hrdlo se přesouvá z psaní kódu na prioritizaci, kontext, review a integraci. Příliš mnoho agentů bez jasných kritérií může vytvořit více práce s kontrolou než skutečné hodnoty.
Které úlohy se v roce 2026 delegují nejsnáze
Nejlepší jsou omezené a ověřitelné úlohy: doplnění testů, lokální refaktory, API migrace, reprodukovatelné opravy chyb, aktualizace závislostí, dokumentace, analýza repozitáře a první verze pull requestu. [2][6][7][12][13]
Obtížnější jsou úlohy se skrytými požadavky, významnými produktovými kompromisy nebo vysokou cenou chyby. Agent může zrychlit analýzu, ale odpovědnost za rozhodnutí má zůstat člověku.
Jak zavést agenty bez chaosu
Začněte omezeným rozsahem: povolené typy úloh, jasné instrukce repozitáře, povinné testy, maximální oprávnění a pevné body lidského schválení. DORA popisuje AI jako zesilovač existujících silných a slabých stránek, takže špatný engineering proces se přidáním agenta automaticky nezlepší. [17]
Měřte celý tok: čas k přijatému pull requestu, dobu review, počet iterací, chyby CI, regrese, cenu agenta a podíl změn vyžadujících velké přepsání.
- Definujte povolené kategorie úloh.
- Udržujte aktuální instrukce repozitáře a ověřovací příkazy.
- Vyžadujte testy, linting a čistý build.
- Používejte nejmenší oprávnění.
- Vyžadujte lidské review u změn s vysokým dopadem.
- Uchovávejte logy agentů a auditní stopu.
- Měřte čas a cenu úspěšně ověřené úlohy.

