Van autocomplete naar gedelegeerde taken
De eerste golf coding-AI vulde regels aan en beantwoordde vragen. In 2026 werken volwassen agents in een lus: context verzamelen, plannen, bestanden lezen en wijzigen, tools gebruiken, resultaten valideren en itereren. OpenAI beschrijft Codex als agent voor code schrijven, reviewen en opleveren; GitHub beschrijft agents als systemen die zelfstandig taken uitvoeren binnen de softwarelevenscyclus. [2][3][7]
De praktische verandering is groot. Developers hoeven niet elke lokale wijziging te sturen, maar moeten doel, scope, beperkingen en definitie van klaar veel scherper formuleren.
Wat een codingagent daadwerkelijk zelfstandig kan doen
Huidige agents kunnen repositories doorzoeken, historie en documentatie lezen, meerdere bestanden wijzigen, commando’s, tests en linters uitvoeren, fouten analyseren en wijzigingen voor review voorbereiden. GitHub Copilot cloud agent kan op een branch werken zonder direct een pull request te openen. [7][10]
Claude Code biedt tool- en permissiecontroles, Codex werkt lokaal en in de cloud en Gemini CLI kan interactief, in scripts en in een sandbox draaien. [2][6][13]
Vier belangrijke agent-workflows in 2026
| Agent | Hoofdomgeving | Werkmodel | Controle |
|---|---|---|---|
| OpenAI Codex | ChatGPT, app, CLI, IDE, cloud | Lokaal en parallel in cloud | Skills, omgevingen, review |
| Claude Code | Terminal, SDK, MCP | Interactief en scriptbaar | Permissiemodi, allow/deny tools |
| GitHub Copilot cloud agent | GitHub, VS Code, Mobile, desktop app | Asynchroon via branch/PR | Repo-beleid, logs, review |
| Google Antigravity / Gemini CLI | Antigravity desktop, CLI, SDK | Parallelle agents en automatisering | Sandbox, hooks, MCP, isolatie |
Codex beslaat app, CLI, IDE en cloud. Claude Code is terminalgericht en scriptbaar. GitHub Copilot cloud agent zit in issues, branches en pull requests. Google Antigravity 2.0 richt zich op multi-agentorkestratie, terwijl Gemini CLI een open-source terminalagent biedt. [2][6][7][8][12][13]
De keuze hangt in de praktijk evenveel af van uitvoeringsomgeving, permissies, governance en reviewflow als van het onderliggende model.
Taken worden langer en vaker parallel uitgevoerd
OpenAI meldt dat in mei 2026 70,2% van de onderzochte individuele Codex-gebruikers minstens één verzoek deed dat werd geschat op meer dan één uur menselijke arbeid, en 25,6% minstens één boven acht uur. Dit zijn modelinschattingen uit een willekeurige 0,1%-steekproef en moeten als richtinggevend worden gelezen. [1]
GitHub Copilot app en Google Antigravity zijn eveneens ontworpen voor parallelle sessies en onafhankelijke werkstromen. [8][12]
Mensen beslissen vaker wat, agents vaker hoe
Anthropic analyseerde ongeveer 400.000 Claude Code-sessies van oktober 2025 tot april 2026. In een typische sessie nam de gebruiker ongeveer 70% van de planningsbeslissingen, terwijl Claude ongeveer 80% van de uitvoeringsbeslissingen nam. Eén prompt leidde gemiddeld tot circa tien agentacties. [4]
De developer houdt dus vaker doel, architectuur en acceptatiecriteria vast, terwijl de agent veel lokale implementatiebeslissingen neemt. Die beslissingen blijven review nodig hebben.
Expertise verbetert nog steeds de uitkomst
In dezelfde Anthropic-studie waren sessies met een hogere expertise-inschatting vaker succesvol. Bij de strengste maat voor geverifieerd succes scoorden novice-sessies ongeveer 15%, tegenover ongeveer 28 tot 33% voor intermediate en hoger. De maat is afgeleid uit transcripties, tests, commits en gebruikersbevestiging, niet direct uit productieprestaties. [4]
Domeinkennis blijft dus hefboom: wie businessregels, randgevallen, architectuur en verificatie begrijpt, kan een agent beter sturen.
Productiviteitsbewijs is gemengd en hangt af van de meetmethode
| Bron | Steekproef | Belangrijkste resultaat |
|---|---|---|
| Anthropic 2026 | ~400.000 Claude Code-sessies | Gebruiker ~70% planningsbeslissingen, Claude ~80% uitvoeringsbeslissingen |
| METR 2025 RCT | 16 developers, 246 taken | 19% langere voltooiingstijd met AI-tools van begin 2025 |
| METR 2026 survey | 349 technische werkers | Mediaan zelfgerapporteerd 1,4 tot 2x werkwaarde, met belangrijke kanttekeningen |
| OpenAI 2026 Codex | Willekeurige 0,1%-steekproef individuele gebruikers | 70,2% had minstens één taak geschat boven één uur menselijke arbeid |
METR volgde in een gerandomiseerde studie uit 2025 16 ervaren open-source developers bij 246 echte taken in bekende repositories. Met AI-tools van begin 2025 duurden taken gemiddeld 19% langer, terwijl deelnemers dachten sneller te werken. [14]
In 2026 vond METR een grotere vervolgstudie lastig te interpreteren door selectiebias, omdat developers steeds vaker niet zonder AI wilden werken. Een aparte enquête onder 349 technische werkers vond een zelfgerapporteerde mediaan van 1,4 tot 2x verandering in werkwaarde, met duidelijke waarschuwingen over de grootte van dat effect. [15][16]
Code review wordt een primair controlepunt
Wanneer een agent veel bestanden kan wijzigen en een complete pull request kan voorbereiden, wordt review een kerncontrole. GitHub bouwt agentworkflows rond diffs, pull requests, sessielogs, repositorybeleid en menselijke review. [7][8][11]
Review verschuift daardoor van syntax naar aannames, scope, API-contracten, architectuur, beveiliging, randgevallen en de vraag of de wijziging het juiste probleem oplost.
Tests en CI worden het contract voor de agent
Een agent kan snel veel plausibele code produceren, maar alleen expliciete criteria bepalen of die correct is. Unit-, integratie- en end-to-end-tests, typechecking, linting en reproduceerbare builds worden daarom belangrijker. Claude Code en GitHub-workflows ondersteunen het uitvoeren van commando’s en tests tijdens het werk. [6][7][10]
Een goede taak beschrijft zowel de gewenste uitkomst als de manier van verifiëren. Hoe deterministischer de verificatie, hoe minder handmatig giswerk aan het einde.
Veiligheid: meer autonomie betekent meer risicoppervlak
Een codingagent kan shellcommando’s uitvoeren, bestanden lezen, netwerk gebruiken en broncode wijzigen. Permissiemodi, sandboxing, toolbeperkingen, secret-bescherming en auditlogs worden dus basiscontroles. Claude Code heeft permissiemodi en allow/deny-lijsten, Gemini CLI containerisolatie en GitHub sessielogs binnen repositorygovernance. [6][11][13]
Teams moeten least privilege toepassen. Een agent voor UI-code hoort niet automatisch productiegeheimen, deployrechten of destructieve infrastructuurtoegang te krijgen.
Repositorycontext wordt infrastructuur
Agentkwaliteit hangt sterk af van expliciete projectconventies. Repository-instructies, codingstandaarden, architectuurregels, contextbestanden, Skills en MCP-koppelingen worden machineleesbare werkprocedures. [2][6][9][13]
Documentatie is daarmee niet alleen voor mensen. Een verouderde README, onduidelijke modulegrenzen of ontbrekende testcommando’s verlagen direct de betrouwbaarheid van de agent.
Multi-agentwerk verandert de dag van de developer
Codex, GitHub Copilot app en Google Antigravity ondersteunen parallelle taken. Een developer kan tests, refactor, documentatie en een bugfix aan afzonderlijke werkstromen delegeren en de resultaten later reviewen. [1][8][12]
De bottleneck verschuift dan van typen naar prioritering, context, review en integratie. Te veel agents zonder sterke acceptatiecriteria kunnen meer reviewwerk opleveren dan waarde.
Welke taken in 2026 het makkelijkst te delegeren zijn
De beste kandidaten zijn afgebakend en verifieerbaar: tests toevoegen, lokale refactors, API-migraties, reproduceerbare bugfixes, dependency-updates, documentatie, repositoryanalyse en een eerste pull-requestversie. [2][6][7][12][13]
Moeilijker blijven taken met impliciete eisen, grote productafwegingen of hoge foutkosten. De agent kan analyse versnellen, maar de beslissingsverantwoordelijkheid hoort bij een mens te blijven.
Agents invoeren zonder chaos te creëren
Begin met een beperkte scope: toegestane taaktypes, duidelijke repository-instructies, verplichte tests, maximale permissies en vaste menselijke goedkeuringsmomenten. DORA beschrijft AI als versterker van bestaande sterke en zwakke punten, dus een zwak engineeringproces wordt niet automatisch goed door een agent toe te voegen. [17]
Meet vervolgens de hele workflow: tijd tot geaccepteerde pull request, reviewtijd, iteraties, CI-fouten, regressies, agentkosten en het aandeel wijzigingen dat veel herschreven moet worden.
- Definieer toegestane taakcategorieën.
- Houd repository-instructies en verificatiecommando’s actueel.
- Eis tests, linting en een schone build.
- Pas least privilege toe.
- Eis menselijke review voor wijzigingen met hoge impact.
- Bewaar agentlogs en audittrail.
- Meet tijd en kosten per succesvol geverifieerde taak.

