Guía interactiva · Día 1 · Serie Agents

De código a intención

Durante décadas, programar fue un acto de traducción: entender el problema, diseñar la solución y plasmarla en sintaxis — llaves, punto y coma, tipos. Esa fricción se está colapsando. Esta guía resume el paper "The New SDLC With Vibe Coding" (Addy Osmani, Shubham Saboo & Sokratis Kartakis) en formato interactivo: quizzes, simuladores y cheatsheets para dominar la transición del prompting ad-hoc a la ingeniería agéntica.

📄 Paper original: Day_1_v3.pdf ⏱ ~15 min de estudio 🎮 3 simuladores ✅ Quiz de 8 preguntas
👥 Para quién es esta guía
👩‍💻 Ingenieros de software 🧭 Engineering managers 🏛 Arquitectos 🎯 Líderes técnicos

El objetivo: entender cómo la IA está remodelando el SDLC y adoptar esas capacidades sin sacrificar la disciplina que exige el software de producción. Presupone familiaridad con prácticas modernas de desarrollo — no con los detalles de IA o machine learning.

dev@2026: ~/producto — la nueva interfaz del desarrollador
dev@2026:~/producto$ agent "construye un soporte que responda dudas de nuestra documentación" ▸ planificando cambios en 14 archivos… ok ▸ escribiendo implementación, tests y evals… ok ▸ ejecutando suite en sandbox… 42/42 pasaron ▸ abriendo pull request para revisión humana… PR #231 dev@2026:~/producto$
0%
de los devs profesionales ya usan agentes de codificación regularmente (inicios de 2026)
0%
usan agentes todos los días en el trabajo
0%
de todo código nuevo ya es generado por IA
01

Agentes de IA en 60 segundos

Primero, un vocabulario común. Un chatbot responde y espera. Un agente ejecuta su propio loop: tú le das el objetivo y él decide el siguiente paso.

La escalada: del autocomplete a la autonomía

⌨️
~2021
Autocomplete
Predicción de tokens dentro del editor
🧩
~2023
Sugerencias inline
Completa funciones enteras
💬
~2024
Chat
Describe en lenguaje natural, recibe una implementación
🤖
2025→
Agentes autónomos
Clonan repos, planifican, ejecutan en sandbox, prueban y abren PRs

El loop del agente — haz clic en cada paso

OBJETIVOdado por ti🎯🎯 Percibir🧠PlanificarActuar👁️Observar🔁Iterar

🎯 Percibir

El agente lee el estado actual: el objetivo recibido, el contexto disponible, el resultado de la última acción. Es el "escanear la escena" antes de decidir cualquier cosa. → haz clic en los otros pasos del diagrama.

Las 5 piezas de todo agente

🧠
MODELO
El motor de razonamiento: lee el contexto y decide el siguiente pensamiento o llamada de herramienta
🔧
Herramientas
Conectan el modelo con el mundo: APIs, código ejecutable, bases de datos, otros agentes
💾
Memoria
El estado: interacciones pasadas, reglas del proyecto, contexto entre sesiones
🎛️
🎛️ Orquestación
El código que ejecuta el loop: arma el contexto, despacha herramientas, decide si continúa
🚀
Despliegue
Del prototipo al servicio: hosting, identidad, observabilidad, infraestructura de producción
💡 Idea centralEl loop percibir → planificar → actuar → observar → iterar es el corazón de todo agente. Todo lo demás del paper — y del curso — es una variación de este loop.
02

El espectro: vibe coding → ingeniería agéntica

En feb/2025, Andrej Karpathy describió el vibe coding: "entrégate a los vibes, olvida que el código existe". El término se viralizó — y se volvió un paraguas confuso. En 2026, el propio Karpathy propuso ingeniería agéntica para el extremo disciplinado. No es binario: es un espectro. El diferenciador no es si usas IA — es cuánta estructura, verificación y juicio humano rodea el output.

caos creativodisciplina de producción
DimensiónVibe CodingIA-Asistido EstructuradoIngeniería Agéntica
Especificación de la intenciónPrompts casuales en lenguaje naturalPrompts detallados con ejemplos y restriccionesSpecs formales, docs de arquitectura, archivos de memoria
Verificación"¿Parece que funciona?"Pruebas manuales, spot-checkingSuites automatizadas, gates de CI/CD, jueces LM
Entendimiento del códigoMínimo — el dev puede ni leer el código generadoRevisión selectiva de los caminos críticosRevisión completa de la arquitectura; la IA cuida los detalles
Manejo de erroresCopiar el error de vuelta al promptEl dev diagnostica la causa raíz, la IA implementa el fixLos agentes se autodiagnostican dentro de límites; los humanos cuidan lo arquitectónico
Alcance apropiadoPrototipos, scripts, proyectos personales, hackathonsFeatures en codebases establecidasSistemas en producción, desarrollo a escala de equipo
Perfil de riesgoAlto — aceptable para código desechableModerado — juicio humano en los checkpointsBajo — verificación sistemática en cada etapa
⚠️ La línea que separa los dos extremos El mayor divisor es la verificación. En la ingeniería agéntica, dos mecanismos trabajan juntos: los tests verifican lo determinístico (esta entrada → esta salida, chequeado por código) y los evals verifican lo no determinístico (¿el agente siguió la trayectoria correcta? ¿eligió las herramientas correctas? ¿la respuesta final alcanza el estándar? — chequeado por datasets etiquetados, rúbricas y jueces LM). Sin ambos, es vibe coding — no importa cuán sofisticados sean los prompts.
🎯 Consejo aplicadoLa posición correcta en el espectro depende de lo que está en juego. Un prototipo de fin de semana → vibe coding puro. Una API de producción que maneja transacciones financieras → ingeniería agéntica. La habilidad es saber dónde trazar la línea para cada tarea.
03

Ingeniería de contexto: la habilidad real

La calidad del código generado depende menos de la astucia del prompt y más de la calidad del contexto proporcionado. La pregunta no es "¿cómo engaño a la IA?" — es: "¿qué necesitaría saber un nuevo miembro del equipo para contribuir bien, y cómo codifico eso?"

Los 6 tipos de contexto que todo agente necesita

📜
Instrucciones
El rol central del agente, objetivos y límites operacionales
📚
Conocimiento
Documentos recuperados, diagramas de arquitectura, datos de dominio
💾
Memoria
Corto plazo (lo que acaba de pasar) + largo plazo (lo que el proyecto es)
🧪
Ejemplos
Demostraciones few-shot y patrones de referencia del codebase
🔧
Herramientas
Definiciones precisas de las APIs, scripts y servicios que el agente puede invocar
🚧
Guardrails
Restricciones rígidas, reglas de formato, validaciones de seguridad

Estático × Dinámico: el trade-off de arquitectura

📌 Contexto estático

siempre cargado · pagado en cada interacción
  • Instrucciones de sistema y persona
  • Archivos de reglas: AGENTS.md, CLAUDE.md, GEMINI.md
  • Memoria global del proyecto

Costo: cada token está presente en toda interacción, relevante o no. El exceso diluye la señal.

VS

⚡ Contexto dinámico

cargado bajo demanda · pagado solo cuando se usa
  • Skills activadas por matching de tarea
  • Resultados de herramientas durante la ejecución
  • Documentos vía RAG, historial de sesión con ventana

Eficiencia: el agente paga el costo de tokens solo cuando la información es necesaria.

Lo que es estático y lo que es dinámico es una decisión de arquitectura de primera clase — revisada y versionada como cualquier configuración. Demasiado estático desperdicia tokens; demasiado poco y el agente olvida reglas críticas.

Agent Skills — el patrón ganador (haz clic en las pestañas)

El agente comienza como un generalista liviano. Ve solo nombres y descripciones cortas de decenas de skills — sin pagar por el contenido:

skills_disponibles:
  - deploy-agent:    "despliegue de agentes ADK en Agent Runtime"
  - eval-runner:     "ejecuta evalsets y reporta regresiones"
  - db-migration:    "migraciones seguras de schema"
  - legacy-refactor: "refactorización de código legacy"
  ... (decenas más)
costo de tokens en contexto~200 tokens

Pides un deploy. El agente hace matching con la skill deploy-agent y carga las instrucciones completas de esa skill — y solo de esa:

cargando skill: deploy-agent
  ✓ checklist de pre-despliegue (env vars, permisos)
  ✓ pasos de publicación en Agent Runtime
  ✓ reglas de rollback automático
costo de tokens en contexto~2.000 tokens

Solo si la tarea lo exige, el agente trae el material de referencia profundo — la API completa, edge cases, tablas de error. Divulgación progresiva: cada nivel cuesta más, pero solo se paga cuando es necesario.

referencia profunda: deploy-agent/reference.md
  ✓ catálogo completo de flags de agents-cli
  ✓ matriz de permisos por ambiente
  ✓ runbook de incidentes de despliegue
costo de tokens en contexto~9.000 tokens (solo ahora)

Las Skills resuelven 4 problemas clásicos: context rot (prompts sobrecargados), la falta de memoria procedural de los LLMs, el overhead de arquitecturas multi-agente y la necesidad de portabilidad entre herramientas y vendors.

04

El nuevo ciclo de vida (SDLC)

La IA comprime el ciclo de forma desigual: la implementación que llevaba semanas ahora toma horas, mientras que requisitos, arquitectura y verificación siguen a ritmo humano. El resultado no es un SDLC antiguo más rápido — es un flujo diferente, con fases que se mezclan e iteraciones de minutos.

⏳ Nota sobre el ritmo de cambio El panorama fase por fase de esta guía refleja el estado del SDLC orientado por IA a mediados de 2026 — y está cambiando rápido. Ya hay equipos experimentando flujos donde el dev va directo de la spec al review, con agentes encargándose de implementación, pruebas y despliegue en segundo plano. Los límites trazados aquí pueden verse diferentes en 12 meses. Lo que permanece constante: el juicio humano, el gusto y la habilidad de verificar el output de la IA a medida que las máquinas asumen más implementación.

La compresión (animada)

📋 Requisitos
ritmo humano → asistido por IA
🏛 Arquitectura
terca y humana — trade-offs
⚙️ Implementación
semanas → horas ⚡
🧪 Pruebas y QA
tests + evals continuos
🚦 Review y Deploy
IA como primera pasada de review
🔧 Mantenimiento
legacy finalmente tocable

Fase por fase — explora

Fase 01 · compresión máxima del feedback

Los requisitos se vuelven conversación

Históricamente, requisitos era la fase con la mayor brecha entre intención e implementación. Ahora la IA participa directamente del refinamiento:

  • Genera user stories a partir de briefs de producto
  • Identifica edge cases que los humanos dejan pasar
  • Produce API schemas desde descripciones en lenguaje natural
  • Genera prototipos interactivos a partir de docs de especificación
"Los requisitos dejan de ser un documento pasado entre equipos. Se vuelven una conversación entre humanos e IA que produce especificación e implementación inicial simultáneamente."
✓ en la práctica
De la descripción al prototipo funcional en minutos — el loop requisito→prototipo tiende a cero.
⚙ pruébalo
Toma un brief real y pide: "genera user stories + criterios de aceptación + 5 edge cases que no consideré"
Fase 02 · la más humana de todas

La arquitectura sigue siendo nuestra

Las decisiones arquitectónicas son fundamentalmente sobre trade-offs: consistencia × disponibilidad, complejidad × flexibilidad, construir × comprar. Dependen de contexto de negocio, restricciones organizacionales y estrategia de largo plazo que la IA no aprehende por completo.

  • La IA es excelente en implementar decisiones arquitectónicas ya tomadas
  • Con un doc de arquitectura claro, los agentes esqueletizan aplicaciones enteras con patrones consistentes
  • Tu rol cambia de escribir boilerplate a tomar y documentar las decisiones estructurales
"El desarrollador deja de escribir el boilerplate y pasa a tomar y documentar las decisiones estructurales que el boilerplate implementa."
✗ no delegues
Trade-offs estratégicos, restricciones de negocio, decisiones de largo plazo.
✓ delega
Scaffolding, generación de patrones consistentes entre módulos, conformidad con convenciones.
Fase 03 · ganancias reales, panorama matizado

De escribir a revisar, guiar y verificar

Los agentes modernos generan features enteras desde descripciones en lenguaje natural, algoritmos complejos y cambios multi-archivo coherentes.

  • Encuestas de la industria reportan ganancias de productividad del 25–39%, con proyecciones de 30–35% en el proceso completo
  • Pero el estudio de METR halló que devs experimentados fueron 19% más lentos en ciertas tareas — por el tiempo verificando, depurando y corrigiendo output de la IA
  • La IA no elimina el trabajo de implementación: lo transforma
"La IA no elimina el trabajo de implementación — lo transforma de escribir a revisar, guiar y verificar."
📊 las dos caras de la moneda
+25–39% productividad promedio en encuestas · −19% en tareas de devs senior sin estructura (METR, feb/2026). ¿La diferencia? Verificación.
Fase 04 · el flywheel de la calidad

Tests y evals: el lenguaje de la intención

Probar código generado por IA exige evaluar no solo qué produjo el agente, sino cómo llegó ahí:

  • Evaluación de output: el artefacto final — ¿compila? ¿pasan los tests?
  • Evaluación de trayectoria: la secuencia completa de llamadas de herramientas y razonamiento intermedio
  • Un output fluido que saltó sus pasos de verificación es un fracaso más peligroso que un error visible
  • Los agentes generan casos de prueba — incluyendo edge cases y tests property-based — que los humanos no pensarían
"Una suite de evals bien escrita le dice a la IA qué significa 'correcto' — y da una forma automatizada de verificarlo."
✓ el flywheel continuo
1. Evaluar contra un benchmark → 2. Diagnosticar fallos agrupando causas raíz → 3. Optimizar prompts/herramientas → 4. Verificar contra suite de regresión → 5. Monitorear producción. Cada ciclo se compone.
Fase 05 · pipelines conscientes de IA

Review ampliado, despliegue vigilante

La IA actúa como revisora de primera pasada: bugs potenciales, violaciones de estilo, vulnerabilidades de seguridad y problemas de rendimiento — antes de que un humano vea el código.

  • No sustituye el review humano: las decisiones de diseño, mantenibilidad y alineación estratégica siguen con nosotros
  • Reduce drásticamente la carga cognitiva de quien revisa
  • Los agentes monitorean la salud del despliegue, hacen rollback automático y predicen riesgo según la naturaleza de los cambios
"Los pipelines de despliegue se están volviendo conscientes de IA — con loops de feedback entre el comportamiento en producción y las decisiones de desarrollo."
⚙ división del trabajo
IA: bugs, estilo, seguridad, rendimiento.
Humano: diseño, mantenibilidad, estrategia.
Fase 06 · la transformación subestimada

El legado por fin deja de ser intocable

Codebases legacy que eran impenetrables para nuevos miembros ahora pueden ser navegados, entendidos y modificados con ayuda de IA.

  • El agente lee el codebase, entiende sus patrones, identifica los archivos relevantes e implementa respetando la arquitectura existente
  • El código "demasiado riesgoso para tocar" puede ser refactorizado, modernizado y extendido con seguridad
  • Migraciones de framework, actualización de APIs deprecadas, modernización de suites de prueba — tareas que antes simplemente nunca ocurrían
"El mantenimiento es quizá la transformación más subestimada de todas."
✓ deuda técnica
La deuda que solo el autor original entendía se vuelve un objetivo viable de refactorización sistemática — el riesgo baja cuando la IA puede explicar antes de cambiar.
05

El modelo de fábrica

El modelo mental que lo ata todo: la producción principal del desarrollador no es el código — es el sistema que produce código. Un gerente de fábrica no ensambla cada pieza a mano: diseña la línea de montaje y asegura el control de calidad.

👷

Tú diseñas el sistema

Especificaciones, contexto, criterios de éxito — no instrucciones paso a paso

🤖

Los agentes producen el código

Traducen specs en implementación e iteran solos dentro de los límites

Los tests verifican el output

Quality gates y feedback loops devuelven los fallos para corrección automática

Las 5 piezas de tu fábrica

📜 Especificaciones y contexto 🤖 Agentes de implementación 🧪 Tests y quality gates 🔁 Feedback loops (fallo → agente) 🚧 Guardrails de comportamiento
🏭 Regla de oroEl éxito viene de dar a los agentes criterios de éxito — no instrucciones paso a paso — y dejarlos iterar. Si estás dictando cada tecla, te convertiste en el cuello de botella de tu propia fábrica.
06

Harness: lo que rodea al modelo

Es tentador tratar al modelo como el sistema: "salió un modelo nuevo, el agente se volvió más listo". Esa intuición está equivocada. El modelo es una entrada. Todo lo demás — prompts, herramientas, políticas de contexto, hooks, sandboxes, sub-agentes, observabilidad — es el harness: el andamiaje que permite al modelo terminar las cosas.

AGENTE = MODELO + Harness
un modelo crudo no es un agente — se vuelve uno cuando el harness le da estado, ejecución, feedback y restricciones
🧠
MODELO
motor de razonamiento

📜 Instrucciones y archivos de reglas

El texto que define quién es el agente, qué le importa y qué tiene prohibido hacer: AGENTS.md, CLAUDE.md, GEMINI.md, archivos de skill y prompts de sub-agentes. Es la pieza más barata y de mayor impacto.

El harness en cada fase del SDLC

1 · Requisitos y Arquitectura → Configurar el harness

Antes de cualquier código de producción: crear el AGENTS.md, definir restricciones arquitectónicas, elegir las herramientas (APIs, schemas) y las reglas inquebrantables.

2 · Implementación → Ejecutar el harness

El modelo genera código y lo ejecuta dentro del sandbox aislado del harness. ¿Necesita leer un archivo o buscar algo? Usa las herramientas que el harness provee — nada más.

3 · Pruebas y QA → El loop de feedback

¿Falló un test? La orquestación captura el error del sandbox y lo devuelve al modelo, pidiendo otro intento. El harness crea el loop automático pensar → actuar → observar.

4 · Review, Despliegue y Mantenimiento → Observar el harness

Hooks determinísticos bloquean el commit con contraseña hardcodeada. La observabilidad rastrea costo de tokens, latencia y drift — auditas por qué el agente decidió lo que decidió.

fuera del Top 30 → Top 5

En Terminal Bench 2.0, un equipo subió un agente de codificación en el ranking cambiando solo el harness — cero cambio de modelo.

+13.7 puntos

Estudio de LangChain en el mismo benchmark: ajuste solo de system prompt, herramientas y middleware alrededor de un modelo fijo.

🔧 Diagnóstico honestoCuando un agente falla, el instinto es culpar al modelo. La mayoría de las veces, el fallo viene de una herramienta ausente, una regla vaga, un guardrail inexistente o una ventana de contexto llena de ruido. La mayoría de los fracasos de agentes son fracasos de configuración.
07

Director × Orquestador: tu nuevo rol

Dos modos de trabajo entre los que alternarás fluidamente. Ninguno es "mejor" — cada uno sirve a un tipo de tarea.

🎻

El Director

manos a la obra · tiempo real
  • Estás en el IDE, viendo aparecer el código, guiando con prompts y correcciones
  • Control fino de cada cambio
  • Ideal para: lógica compleja, debugging difícil, codebases desconocidos
  • Riesgo: si dictas cada tecla, te vuelves el cuello de botella
GitHub CopilotGemini Code AssistCursorWindsurf
🎼

El Orquestador

asíncrono · multi-agente
  • Defines objetivos, delegas a agentes y revisas resultados — sin ver línea por línea
  • Los agentes trabajan en paralelo, en segundo plano, en sandboxes
  • Ideal para: bug fixes, features con patrón establecido, migraciones, generación de tests
  • Exige: especificación, descomposición, evaluación y diseño de sistema
Google JulesCopilot agent modeCursor backgroundClaude Code

El problema del 80% — haz clic en la barra

80% — la IA genera rápido ⚡
el 20% difícil
🟩 80%: implementación directa de tareas bien especificadas 🟥 20%: donde vive el peligro — y tu valor

Qué compone el 20%:

  • Edge cases y manejo de errores realista
  • Puntos de integración con otros sistemas
  • Requisitos sutiles de corrección
  • Suposiciones erradas sobre la lógica de negocio
  • Falta de pedir aclaración en requisitos ambiguos
  • Decisiones arquitectónicas que crean deuda de mantenimiento invisible

Estos errores son más insidiosos porque el código "parece correcto" y puede incluso pasar los tests básicos. Los mejores devs usan la IA para lo que hace bien y reservan su propia atención para lo que no hace — no intentan ser más rápidos aceptando todo.

08

Agentes de codificación en la práctica

Tres lugares en tu día — y la mayoría de los devs usa los tres el mismo día. El punto de partida correcto depende de la tarea, no de qué categoría está más arriba en la escalera de autonomía.

En el editor

Flujo continuo

Completions inline, chat que explica/modifica en el lugar, conciencia del codebase entero. Donde la mayoría encuentra la IA por primera vez.

CopilotCursorWindsurfJetBrains AI
Úsalo cuando: estás en medio del código y quieres sugerencias, ediciones rápidas o explicaciones sin salir del flujo.
En la terminal

Multi-archivo con ejecución

Das un objetivo en lenguaje natural; el agente recorre el codebase, ejecuta herramientas y tests, e itera sobre lo que observa. Donde el vibe coding serio ocurre hoy.

Claude CodeCodex CLIGemini CLIClineAntigravity
Úsalo cuando: trabajo multi-archivo, explorar un codebase desconocido, tareas que exigen ejecutar código y reaccionar.
En segundo plano

Delegar y revisar después

El agente recibe la tarea y corre autónomo en un sandbox en la nube — a veces durante horas — y entrega un pull request como output.

Google JulesCopilot agent modeCursor backgroundAlphaEvolve
Úsalo cuando: la tarea cabe en un párrafo — un bug conocido, una suite de tests, una migración de framework.

¿Y cuando el producto es un agente?

Un bot de soporte, un asistente de investigación, un monitor de cumplimiento — estos no son tareas para que resuelva un agente de codificación: son productos que necesitan su propia memoria persistente, permisos con alcance, cobertura de evals y observabilidad. El mismo flujo de terminal que produce scripts de prototipo ahora alcanza estos agentes de producción — el ciclo construir → evaluar → desplegar → observar → refinar vive en un solo lugar:

agents-cli — del laptop a producción sin reescribir
# instalación única — da a tu agente de codificación 7 skills de ciclo de vida ADK uvx google-agents-cli setup # después, en tu agente de codificación (Claude Code, Codex, el que prefieras): > Construye un agente de soporte que responda preguntas de nuestra documentación. > Evalúalo en el dataset de FAQ. > Despliégalo en Agent Engine. ▸ scaffold del proyecto desde plantilla ......... ▸ código ADK escrito + evalset generado ............... ▸ evals corriendo contra el agente ..................... 94% aprobado ▸ despliegue en Agent Runtime ........................... ✓ producción # ¿prefieres conducir directamente? los mismos comandos existen como CLI: agents-cli create · agents-cli playground · agents-cli eval · agents-cli deploy

🔗 MCP

Model Context Protocol — el estándar para acceso a herramientas entre agentes y vendors.

🤝 A2A

Agent2Agent — el protocolo para delegación entre agentes. Juntos, MCP + A2A son el tejido conectivo de los sistemas multi-agente.

🦀 Prueba real

A inicios de 2026, los equipos de agentes de Anthropic construyeron un compilador de C en Rust en dos semanas — los humanos dieron dirección y revisaron, sin escribir la implementación.

09

La economía: CapEx × OpEx en la era de los tokens

La conversación suele empezar y terminar en "¿qué tan rápido escribimos código?". Para los líderes, la métrica crítica es el TCO — y en la era de la IA, el OpEx está dictado por la economía de los tokens.

🎲 Vibe CodingCapEx bajo · OpEx ALTO (y acumulativo)
CapEx ~
OpEx: quema de tokens + mantenimiento + seguridad ↗↗
Suscripción mensual + prompts casuales. Parece barato — hasta que llega la cuenta: token burn rate (archivos enormes arrojados al contexto, loops caros de "arréglalo de nuevo"), impuesto de mantenimiento (código espagueti para hacer ingeniería inversa meses después) y remediación de seguridad (una vulnerabilidad en producción cuesta exponencialmente más que en el diseño).
🏗 Ingeniería AgénticaCapEx alto · OpEx BAJO
CapEx: schemas, tests, contexto estructurado
OpEx: costo marginal por feature se desploma ↘
Inversión deliberada antes de la primera línea de producción: schemas de API, suites de prueba determinísticas y, sobre todo, estructuración del contexto. El output sale estructuralmente sano, pre-probado y alineado con los estándares.

El contexto como palanca financiera + enrutamiento inteligente

🧠 Modelos grandes y caros

  • Requisitos y refinamiento
  • Decisiones de arquitectura
  • Implementación inicial compleja

Tareas de alta complejidad — donde el juicio pesa más que el costofrontier

enrutamiento
automático

⚡ Modelos pequeños y baratos

  • Generación de tests
  • Code review de primera pasada
  • Monitoreo de CI/CD

Tareas determinísticas y de baja complejidad — pagar precios premium aquí es desperdiciofast/cheap

💰 La cuentaLa ingeniería de contexto es una estrategia financiera: pasar un repositorio de 100.000 tokens en cada prompt es inviable a escala. Un payload denso y de alta señal (un AGENTS.md preciso + guardrails arquitectónicos) eleva la tasa de acierto a la primera — y elimina los loops caros de prueba y error que acechan al vibe coding.
10

Conclusión: La intención como nueva interfaz

La transición de la sintaxis a la intención no es una predicción futura — es una realidad presente. Los desarrolladores ya pasan más tiempo describiendo lo que quieren que especificando cómo construirlo. El SDLC ya está siendo comprimido, reestructurado y reimaginado en torno a las capacidades de la IA. La pregunta no es si esta transformación ocurrirá, sino con qué eficacia los desarrolladores, equipos y organizaciones la navegarán.

El framework presentado en este paper — el espectro del vibe coding a la ingeniería agéntica, el modelo director-orquestador de roles, la taxonomía de agentes ambientales, de workflow y autónomos, y el modelo de fábrica de producción de software — proporciona un conjunto de modelos mentales para dar sentido a un panorama en rápida evolución. Estos modelos seguirán siendo útiles incluso a medida que las herramientas y capacidades específicas evolucionen.

Tres principios duraderos

🏗 La estructura escala, los vibes no

El vibe coding es válido para exploración, prototipado y proyectos personales. Pero para el software del que dependen las organizaciones, la disciplina de la ingeniería agéntica — especificaciones, pruebas, guardrails y supervisión humana de la arquitectura — no es opcional. La brecha entre 'parece funcionar' y 'funciona correctamente bajo todas las condiciones' es donde viven las caídas de producción, vulnerabilidades de seguridad y pesadillas de mantenimiento.

🔊 La IA amplifica tu cultura de ingeniería

Las organizaciones con prácticas sólidas de pruebas, estándares arquitectónicos claros y procesos saludables de code review obtienen dramáticamente más valor del desarrollo asistido por IA que aquellas sin ellos. La IA es un multiplicador de fuerza — y multiplica tanto tus fortalezas como tus debilidades.

🧠 El rol humano evoluciona, no disminuye

Los constructores que entienden arquitectura, pueden definir especificaciones precisas, evaluar output críticamente y diseñar sistemas efectivos de restricciones y bucles de retroalimentación son más valiosos que nunca. Las habilidades que importan están cambiando de la implementación al juicio, de escribir código a diseñar los sistemas que producen código.

Estamos al inicio de una transformación que remodelará no solo cómo se construye el software, sino qué tipo de software es posible construir. Equipos más pequeños podrán abordar problemas más grandes. Desarrolladores individuales podrán construir y mantener sistemas que antes requerían departamentos enteros. La barrera para crear software seguirá cayendo, abriendo la práctica del desarrollo de software a una población más amplia.

Los equipos que prosperarán serán aquellos que abracen la IA como una herramienta poderosa mientras mantienen la disciplina de ingeniería que siempre ha sido la base del software confiable. Serán los que entienden que el futuro de la ingeniería de software no se trata de elegir entre experiencia humana y capacidad de IA — se trata de diseñar sistemas donde ambos contribuyan con sus fortalezas únicas.

La generación está resuelta. La verificación, el juicio y la dirección son el nuevo oficio.
11

Quiz: pon a prueba tu comprensión

8 preguntas que cubren toda la guía. Sin prisa — la explicación de cada respuesta es parte del estudio.

12

Cheatsheets listos para copiar

Tres artefactos que puedes usar hoy. Haz clic en copiar y pega en tu proyecto.

📜AGENTS.md — starter de 10 líneas
# AGENTS.md

## Stack
TypeScript 6.x · Next.js 16 · Postgres (Drizzle ORM) · Vitest

## Convenciones
- Funciones puras siempre que sea posible; errores vía Result<T, E>, nunca throw suelto
- Nombres en inglés, comentarios explicando el "por qué", no el "qué"
- Todo handler de API valida input con zod antes de tocar la base de datos

## Reglas rígidas (inquebrantables)
- NUNCA commitear secretos; usar env vars vía .env.local
- NUNCA instalar una dependencia sin confirmar conmigo
- NUNCA modificar migrations ya aplicadas en producción

## Workflow
1. Lee docs/ antes de implementar  2. Escribe el test primero
3. Corre `pnpm test` hasta verde   4. Describe el diff antes del commit
🧪Checklist de review para código generado por IA
# REVIEW DE CÓDIGO GENERADO POR IA

[ ] Imports reales        — ¿cada paquete existe? ¿versión compatible?
                              (la alucinación de dependencias es el error nº 1)
[ ] Nada "demasiado listo" — si parece demasiado clever, desconfía;
                              código que el equipo no entiende = deuda
[ ] Error handling real   — cubre modos de fallo realistas, no solo
                              el happy path que pasa el test
[ ] Edge cases del negocio — la IA no conoce tu regla de reembolso;
                              verifica supuestos de la lógica de negocio
[ ] Trayectoria, no solo output — ¿el agente EJECUTÓ los tests o solo
                              dijo que lo hizo? revisa logs / hooks de CI
[ ] Secretos y permisos   — nada hardcodeado; alcance mínimo de acceso
[ ] Podrías explicar este diff — si no puedes explicarlo, no lo embarques
🗺️El mapa mental del paper en 12 líneas
# EL NUEVO SDLC — MAPA MENTAL

cambio      : sintaxis → intención (tú dices el QUÉ, la máquina el CÓMO)
espectro    : vibe coding ──────── ia-asistido ──────── ing. agéntica
divisor     : verificación (tests = determinístico · evals = no-determ.)
habilidad   : ingeniería de contexto (6 tipos: instrucciones, conocimiento,
              memoria, ejemplos, herramientas, guardrails)
trade-off   : contexto estático (siempre pagado) × dinámico (pagado bajo demanda)
patrón clave: Agent Skills — generalista liviano se vuelve especialista bajo demanda
fábrica     : tu output es el SISTEMA que produce código, no el código
harness     : AGENTE = MODELO + HARNESS · fallos de agente ≈ fallos de config
roles       : director (tiempo real) ⇄ orquestador (asíncrono, multi-agente)
80/20       : la IA hace 80% rápido; tu valor está en el 20% (edge, integración, sutileza)
economía    : vibe = CapEx↓ OpEx↑↑ · agéntico = CapEx↑ OpEx↓ + enrutamiento de modelos
lema        : "La generación está resuelta. Verificación, juicio y dirección son el nuevo oficio."
13

Por dónde empezar — checklists interactivos

Marca las casillas a medida que avanzas. El progreso se guarda en tu navegador.

👩‍💻 Devs individuales

Crea un AGENTS.md de 10 líneas: stack, convenciones, reglas rígidas, workflow. Añade una regla por cada error del agente.
Instala un set de skills (ej.: Agents CLI) para construir, evaluar y desplegar agentes.
Elige un workflow repetitivo y conviértelo en tu primer agente, del prototipo a producción.
Escribe tests y evals ANTES de generar el código — son el contrato con la IA.
Revisa cada línea que se embarcará. Desconfía de lo que parece clever. Verifica imports reales.
Mantén tus habilidades: debugging, diseño de sistemas, intuición de rendimiento. La IA es palanca, no sustituto.

🧭 Líderes de ingeniería

Convierte la ingeniería de contexto en práctica de primera clase: prompts, evals y skills revisados en PRs, versionados, con dueño.
Pon el estándar en el eval, no en la demo — con rúbricas explícitas (éxito, uso de herramientas, trayectoria, alucinación).
Remodela el code review para código generado: entrena a los revisores en los modos de fallo típicos.
Separa prototipo de producción en las normas del equipo — un prototipo que se embarca por accidente es síntoma de frontera difusa.
Invierte en el harness como activo compartido: construye una vez, refina muchas.

🏢 Organizaciones

Trata el desarrollo con IA como inversión de ingeniería, no como feature de productividad.
Construye el sustrato de producción ANTES de escalar: evals en CI, traces, permisos con alcance, security review.
Adopta estándares abiertos (MCP para herramientas, A2A para delegación) — preserva la opción de cambiar de vendor.
Planifica equipos híbridos humano+agente: review, on-call y estructura de equipo deben evolucionar.
Contrata y desarrolla por juicio, no solo implementación — quien dirige bien agentes vale más que quien escribe más código.
14

Glosario de bolsillo

Vibe Coding
Describir lo que quieres en lenguaje natural y aceptar el output; cuando se rompe, pegar el error de vuelta al prompt. Válido para prototipos y código desechable.
Ingeniería Agéntica
IA como motor de implementación dentro de sistemas diseñados por humanos: restricciones, tests, evals y supervisión de arquitectura.
Ingeniería de Contexto
La práctica de proporcionar al agente información rica y estructurada sobre el codebase, la arquitectura, las convenciones y la intención — la habilidad central del nuevo SDLC.
Harness
Todo el andamiaje alrededor del modelo: instrucciones, herramientas, sandboxes, orquestación, hooks y observabilidad. Agente = Modelo + Harness.
Eval (evaluación)
Verificación de lo no determinístico: trayectoria de pasos, elección de herramientas y calidad de la respuesta final, vía datasets etiquetados, rúbricas y jueces LM.
Agent Skills
Paquetes portátiles de conocimiento procedural cargados bajo demanda — divulgación progresiva que mantiene al agente generalista y liviano.
El modelo de fábrica
El dev diseña el sistema que produce código (specs + agentes + tests + feedback + guardrails) en lugar de producir código directamente.
El Problema del 80%
La IA genera ~80% rápido; el 20% final (edge cases, integraciones, corrección sutil) exige conocimiento contextual profundo — y ahí vive el valor humano.
Director × Orquestador
Dos modos de trabajo: dirección en tiempo real en el IDE (director) vs. delegación asíncrona a múltiples agentes con revisión de resultados (orquestador).
MCP / A2A
Model Context Protocol (acceso a herramientas) y Agent2Agent (delegación entre agentes) — los estándares abiertos que conectan sistemas multi-agente.
01

La estructura escala, los vibes no

El vibe coding sirve para explorar. Para software del que la organización depende, la disciplina de la ingeniería agéntica — specs, tests, guardrails, supervisión — no es opcional. Es en la brecha entre "parece funcionar" y "funciona correctamente bajo todas las condiciones" donde viven los fallos de producción.

02

La IA amplifica tu cultura de ingeniería

Los equipos con tests fuertes, estándares claros y review saludable extraen dramáticamente más valor. La IA es un multiplicador de fuerza — y multiplica tanto tus fortalezas como tus debilidades.

03

El papel humano está evolucionando, no disminuyendo

Quien entiende arquitectura, especifica con precisión, evalúa con criticidad y diseña sistemas de restricción y feedback vale más que nunca. Las habilidades migran de la implementación al juicio.

"La generación está resuelta.
Verificación, juicio y dirección
son el nuevo oficio."
— conclusión del paper
15

Continúa el viaje: los papers complementarios

Esta guía es el Día 1 de una serie. La serie completa tiene cuatro complementarios que profundizan los temas introducidos aquí — anota a dónde ir después.

16

Recursos para continuar

Las fuentes originales que fundamentan esta guía, para cuando quieras ir más allá del resumen.

17

Referencias (endnotes del paper)

Las notas al pie numeradas del paper original, para que rastrees cada afirmación hasta su fuente.

1GetPanto — AI Coding Assistant Statistics 2025-2026; Index.dev — Developer Productivity Statistics with AI Tools.
2Karpathy, A. — “Vibe Coding”, X/Twitter, feb/2025; Wikipedia — “Vibe coding”.
3Osmani, A. — “Agentic Engineering”, addyosmani.com.
4Karpathy, A. — “From Vibe Coding to Agentic Engineering”, 2026; The New Stack — “Vibe Coding is Passe”.
5Glide Blog — “What is Agentic Engineering?”; The New Stack — “Vibe Coding, Agentic Engineering”.
6CircleCI — “AI-Native SDLC”.
7GroovyWeb — “SDLC in the AI Era: Software Development 2026”; EPAM — “From Traditional Software to a Native AI SDLC”.
8Osmani, A. — “The Factory Model”, addyosmani.com.
9Deloitte — “AI in Software Engineering: Productivity Gains 2025-2026” (proyección de 30-35% de ganancia).
10METR — “Uplift Update: Measuring the Impact of AI Coding Tools”, feb/2026.
11Google — “Introduction to Agents”, Agents Whitepaper Series, nov/2025.
12Osmani, A. — “From Conductors to Orchestrators: The Future of Agentic Coding”, addyosmani.com.
13Google — “Jules: AI-Powered Coding Agent”, Google Developers Blog.
14Osmani, A. — “The 80% Problem in Agentic Coding”, addyo.substack.com.
15Medium, Dave Patten — “The State of AI Coding Agents 2026”.
16Lawfare — “When the Vibes Are Off: The Security Risks of AI-Generated Code”.
17Google — “Introduction to Agents”, sección Multi-Agent Systems and Design Patterns, nov/2025.
18Google — “Agent Development Kit (ADK)”; Kartakis, S. — “From Zero to Multi-Agents: A Beginner’s Guide to Google ADK”, Medium.
19Google — “Agent-to-Agent (A2A) Protocol”; Kartakis, S. & Hotz, H. — “Generative AI in the Real World: Understanding A2A”, O’Reilly Podcast.
20TLDL — “AI Coding Tools 2026”; Kanerika — “GitHub Copilot vs Claude Code vs Cursor vs Windsurf”.
21Google — “Gemini Code Assist”, Google Cloud.
22Dark Reading — “Coders Adopt AI Agents, but Security Pitfalls Lurk in 2026”.
23Google — “Gemini CLI”, GitHub.
24Google — “Agent Tools: Interoperability with Model Context Protocol (MCP)”, Agents Whitepaper Series, nov/2025.
25Google — “Agent Quality” y “Prototype to Production”, Agents Whitepaper Series, nov/2025.
26Lawfare — “When the Vibes Are Off: The Security Risks of AI-Generated Code”.
27DevOps.com — “AI-Generated Code Packages Can Lead to Slopsquatting Threat”.
28Osmani, A. — “Beyond Vibe Coding”, O’Reilly Media, 2025-2026.
29“Awesome LLM Apps”, GitHub.
30Osmani, A. — “My LLM Coding Workflow Going Into 2026”, addyosmani.com.
31Questera — “7 AI Coding Trends to Watch in 2026”.
32DEV Community — “Programming in the Age of AI: From Code to Intent”.