Del autocompletado a las tareas delegadas
La primera ola de IA para código se centró en completar líneas y responder preguntas. En 2026, los agentes maduros trabajan en un ciclo: reúnen contexto, planifican, leen y modifican archivos, usan herramientas, validan resultados e iteran. OpenAI describe Codex como un agente para escribir, revisar y entregar código, mientras GitHub define sus agentes como sistemas capaces de ejecutar tareas de forma independiente durante el ciclo de desarrollo. [2][3][7]
La diferencia práctica es importante. El desarrollador puede dejar de guiar cada edición local, pero debe definir mejor el objetivo, alcance, restricciones y qué significa terminar correctamente.
Qué puede hacer realmente un agente de programación
Los agentes actuales pueden buscar en repositorios, leer historial y documentación, modificar varios archivos, ejecutar comandos, pruebas y linters, analizar fallos y preparar cambios para revisión. GitHub Copilot cloud agent puede trabajar en una rama sin abrir inmediatamente un pull request. [7][10]
Claude Code ofrece controles de herramientas y permisos, Codex funciona en superficies locales y cloud, y Gemini CLI puede ejecutarse de forma interactiva, en scripts y dentro de una sandbox. [2][6][13]
Cuatro grandes modelos de trabajo con agentes en 2026
| Agente | Superficie principal | Modelo de trabajo | Control |
|---|---|---|---|
| OpenAI Codex | ChatGPT, app, CLI, IDE, cloud | Local y paralelo en cloud | Skills, entornos, revisión |
| Claude Code | Terminal, SDK, MCP | Interactivo y automatizable | Modos de permisos, herramientas permitidas/bloqueadas |
| GitHub Copilot cloud agent | GitHub, VS Code, Mobile, app desktop | Asíncrono mediante rama/PR | Políticas de repo, logs, revisión |
| Google Antigravity / Gemini CLI | Antigravity desktop, CLI, SDK | Agentes paralelos y automatización | Sandbox, hooks, MCP, aislamiento |
Codex abarca app, CLI, IDE y cloud. Claude Code está centrado en terminal y automatización. GitHub Copilot cloud agent vive dentro de issues, ramas y pull requests. Google Antigravity 2.0 enfatiza la orquestación multiagente y Gemini CLI ofrece un agente de terminal open source. [2][6][7][8][12][13]
En la práctica, la elección depende tanto del entorno de ejecución, permisos, gobernanza y flujo de revisión como del modelo subyacente.
Las tareas son más largas y cada vez más paralelas
OpenAI informa de que en mayo de 2026 el 70,2% de la muestra de usuarios individuales de Codex realizó al menos una solicitud estimada en más de una hora de trabajo humano, y el 25,6% al menos una por encima de ocho horas. Son umbrales estimados por modelo sobre una muestra aleatoria del 0,1%, por lo que deben interpretarse como orientativos. [1]
GitHub Copilot app y Google Antigravity también están diseñados alrededor de sesiones paralelas y flujos de trabajo independientes. [8][12]
Las personas deciden más el qué, los agentes más el cómo
Anthropic analizó unas 400.000 sesiones de Claude Code entre octubre de 2025 y abril de 2026. En una sesión típica, el usuario tomaba alrededor del 70% de las decisiones de planificación, mientras Claude tomaba cerca del 80% de las decisiones de ejecución. Un prompt provocaba unas diez acciones del agente de media. [4]
El desarrollador conserva así objetivos, arquitectura y criterios de aceptación, mientras el agente toma muchas decisiones locales de implementación. Esas decisiones siguen necesitando revisión.
La experiencia sigue mejorando los resultados
En el mismo estudio de Anthropic, las sesiones calificadas como más expertas tuvieron más éxito. Con la métrica más estricta de éxito verificado, las sesiones de nivel principiante alcanzaron alrededor del 15%, frente a aproximadamente 28 a 33% para nivel intermedio o superior. La métrica se basa en transcripciones, pruebas, commits y confirmaciones, no en calidad de producción directa. [4]
El conocimiento del dominio sigue siendo una ventaja: entender reglas de negocio, casos límite, arquitectura y estrategia de validación permite dirigir mejor al agente.
La evidencia sobre productividad es mixta y depende de cómo se mida
| Fuente | Muestra | Resultado principal |
|---|---|---|
| Anthropic 2026 | ~400.000 sesiones Claude Code | Usuario ~70% decisiones de planificación, Claude ~80% de ejecución |
| METR 2025 RCT | 16 desarrolladores, 246 tareas | 19% más tiempo con herramientas de IA de principios de 2025 |
| METR 2026 survey | 349 trabajadores técnicos | Mediana autodeclarada de 1,4 a 2x de valor del trabajo, con reservas importantes |
| OpenAI 2026 Codex | Muestra aleatoria del 0,1% de usuarios individuales | 70,2% tuvo al menos una tarea estimada por encima de una hora humana |
El estudio aleatorizado de METR de 2025 siguió a 16 desarrolladores open source experimentados en 246 tareas reales de repositorios conocidos. Con herramientas de IA de principios de 2025, las tareas tardaron un 19% más de media, aunque los participantes creían estar siendo más rápidos. [14]
En 2026, METR consideró difícil interpretar un estudio de seguimiento mayor por sesgo de selección, ya que algunos desarrolladores no querían trabajar sin IA. Otra encuesta a 349 trabajadores técnicos encontró una mediana autodeclarada de 1,4 a 2x de cambio en el valor del trabajo, pero METR señala razones claras para ser cautos con la magnitud. [15][16]
La revisión de código se convierte en un punto principal de control
Cuando un agente puede modificar muchos archivos y preparar un pull request completo, la revisión deja de ser una formalidad final y pasa a ser un mecanismo central de control. GitHub estructura los flujos de agentes alrededor de diffs, pull requests, logs de sesión, políticas de repositorio y revisión humana. [7][8][11]
La revisión se desplaza de la sintaxis hacia supuestos, alcance, contratos API, arquitectura, seguridad, casos límite y si la solución resuelve realmente el problema previsto.
Las pruebas y CI se convierten en el contrato del agente
Un agente puede producir rápidamente mucho código plausible, pero solo criterios explícitos determinan si es correcto. Pruebas unitarias, integración, end-to-end, tipado, linting y builds reproducibles ganan importancia. Claude Code y los agentes de GitHub permiten ejecutar comandos y pruebas durante el trabajo. [6][7][10]
Una buena tarea debe describir tanto el resultado deseado como cómo verificarlo. Cuanto más determinista sea la validación, menos trabajo manual de interpretación queda al final.
Seguridad: más autonomía significa más superficie de riesgo
Un agente puede ejecutar comandos de shell, leer archivos, usar red y modificar código. Los modos de permisos, sandboxes, restricciones de herramientas, protección de secretos y logs de auditoría pasan a ser controles fundamentales. Claude Code ofrece modos y listas de herramientas, Gemini CLI aislamiento en contenedor y GitHub logs de sesión dentro de la gobernanza del repositorio. [6][11][13]
Los equipos deberían aplicar mínimo privilegio. Un agente encargado de cambiar UI no debería recibir automáticamente secretos de producción, permisos de despliegue o acceso destructivo a infraestructura.
El contexto del repositorio se convierte en infraestructura
La calidad del agente depende de que las convenciones del proyecto estén explícitas. Instrucciones del repositorio, estándares de código, reglas de arquitectura, archivos de contexto, Skills y conexiones MCP se convierten en procedimientos legibles por máquina. [2][6][9][13]
La documentación ya no es solo para personas. Un README desactualizado, límites de módulos ambiguos o comandos de prueba ausentes reducen directamente la fiabilidad del agente.
El trabajo multiagente cambia el día del desarrollador
Codex, GitHub Copilot app y Google Antigravity permiten tareas paralelas. En lugar de esperar a una sesión secuencial, un desarrollador puede delegar pruebas, refactorización, documentación y una corrección de bug a flujos separados y revisarlos después. [1][8][12]
El cuello de botella pasa de escribir código a priorizar, aportar contexto, revisar e integrar. Demasiados agentes sin criterios de aceptación sólidos pueden generar más carga de revisión que valor.
Qué tareas son más fáciles de delegar en 2026
Los mejores candidatos son trabajos limitados y verificables: añadir pruebas, refactorizaciones locales, migraciones de API, bugs reproducibles, actualizaciones de dependencias, documentación, análisis de repositorio y primera versión de pull requests. [2][6][7][12][13]
Siguen siendo más difíciles las tareas con requisitos ocultos, grandes compromisos de producto o alto coste de error. El agente puede acelerar el análisis, pero la responsabilidad de la decisión debe permanecer en una persona.
Cómo adoptar agentes sin crear caos
Conviene empezar con un alcance limitado: tipos de tareas permitidos, instrucciones de repositorio, pruebas obligatorias, permisos máximos y puntos claros de aprobación humana. DORA describe la IA como un amplificador de fortalezas y debilidades existentes, por lo que un proceso de ingeniería débil no se vuelve bueno automáticamente al añadir un agente. [17]
Después hay que medir el flujo completo: tiempo hasta el pull request aceptado, duración de revisión, iteraciones, fallos CI, regresiones, coste del agente y porcentaje de cambios que requieren reescritura importante.
- Define categorías de tareas permitidas.
- Mantén instrucciones del repositorio y comandos de verificación actualizados.
- Exige pruebas, linting y build correcto.
- Aplica mínimo privilegio.
- Exige revisión humana para cambios de alto impacto.
- Conserva logs de agentes y trazabilidad.
- Mide tiempo y coste por tarea verificada correctamente.

