De código a intención
Durante décadas, programar fue un acto de traducción: entender el problema, diseñar la solución y plasmarla en sintaxis — llaves, punto y coma, tipos. Esa fricción se está colapsando. Esta guía resume el paper "The New SDLC With Vibe Coding" (Addy Osmani, Shubham Saboo & Sokratis Kartakis) en formato interactivo: quizzes, simuladores y cheatsheets para dominar la transición del prompting ad-hoc a la ingeniería agéntica.
El objetivo: entender cómo la IA está remodelando el SDLC y adoptar esas capacidades sin sacrificar la disciplina que exige el software de producción. Presupone familiaridad con prácticas modernas de desarrollo — no con los detalles de IA o machine learning.
Agentes de IA en 60 segundos
Primero, un vocabulario común. Un chatbot responde y espera. Un agente ejecuta su propio loop: tú le das el objetivo y él decide el siguiente paso.
La escalada: del autocomplete a la autonomía
El loop del agente — haz clic en cada paso
🎯 Percibir
El agente lee el estado actual: el objetivo recibido, el contexto disponible, el resultado de la última acción. Es el "escanear la escena" antes de decidir cualquier cosa. → haz clic en los otros pasos del diagrama.
Las 5 piezas de todo agente
El espectro: vibe coding → ingeniería agéntica
En feb/2025, Andrej Karpathy describió el vibe coding: "entrégate a los vibes, olvida que el código existe". El término se viralizó — y se volvió un paraguas confuso. En 2026, el propio Karpathy propuso ingeniería agéntica para el extremo disciplinado. No es binario: es un espectro. El diferenciador no es si usas IA — es cuánta estructura, verificación y juicio humano rodea el output.
| Dimensión | Vibe Coding | IA-Asistido Estructurado | Ingeniería Agéntica |
|---|---|---|---|
| Especificación de la intención | Prompts casuales en lenguaje natural | Prompts detallados con ejemplos y restricciones | Specs formales, docs de arquitectura, archivos de memoria |
| Verificación | "¿Parece que funciona?" | Pruebas manuales, spot-checking | Suites automatizadas, gates de CI/CD, jueces LM |
| Entendimiento del código | Mínimo — el dev puede ni leer el código generado | Revisión selectiva de los caminos críticos | Revisión completa de la arquitectura; la IA cuida los detalles |
| Manejo de errores | Copiar el error de vuelta al prompt | El dev diagnostica la causa raíz, la IA implementa el fix | Los agentes se autodiagnostican dentro de límites; los humanos cuidan lo arquitectónico |
| Alcance apropiado | Prototipos, scripts, proyectos personales, hackathons | Features en codebases establecidas | Sistemas en producción, desarrollo a escala de equipo |
| Perfil de riesgo | Alto — aceptable para código desechable | Moderado — juicio humano en los checkpoints | Bajo — verificación sistemática en cada etapa |
Ingeniería de contexto: la habilidad real
La calidad del código generado depende menos de la astucia del prompt y más de la calidad del contexto proporcionado. La pregunta no es "¿cómo engaño a la IA?" — es: "¿qué necesitaría saber un nuevo miembro del equipo para contribuir bien, y cómo codifico eso?"
Los 6 tipos de contexto que todo agente necesita
Estático × Dinámico: el trade-off de arquitectura
📌 Contexto estático
- Instrucciones de sistema y persona
- Archivos de reglas:
AGENTS.md, CLAUDE.md, GEMINI.md - Memoria global del proyecto
Costo: cada token está presente en toda interacción, relevante o no. El exceso diluye la señal.
⚡ Contexto dinámico
- Skills activadas por matching de tarea
- Resultados de herramientas durante la ejecución
- Documentos vía RAG, historial de sesión con ventana
Eficiencia: el agente paga el costo de tokens solo cuando la información es necesaria.
Lo que es estático y lo que es dinámico es una decisión de arquitectura de primera clase — revisada y versionada como cualquier configuración. Demasiado estático desperdicia tokens; demasiado poco y el agente olvida reglas críticas.
Agent Skills — el patrón ganador (haz clic en las pestañas)
El agente comienza como un generalista liviano. Ve solo nombres y descripciones cortas de decenas de skills — sin pagar por el contenido:
skills_disponibles: - deploy-agent: "despliegue de agentes ADK en Agent Runtime" - eval-runner: "ejecuta evalsets y reporta regresiones" - db-migration: "migraciones seguras de schema" - legacy-refactor: "refactorización de código legacy" ... (decenas más)
Pides un deploy. El agente hace matching con la skill deploy-agent y carga las instrucciones completas de esa skill — y solo de esa:
cargando skill: deploy-agent ✓ checklist de pre-despliegue (env vars, permisos) ✓ pasos de publicación en Agent Runtime ✓ reglas de rollback automático
Solo si la tarea lo exige, el agente trae el material de referencia profundo — la API completa, edge cases, tablas de error. Divulgación progresiva: cada nivel cuesta más, pero solo se paga cuando es necesario.
referencia profunda: deploy-agent/reference.md ✓ catálogo completo de flags de agents-cli ✓ matriz de permisos por ambiente ✓ runbook de incidentes de despliegue
Las Skills resuelven 4 problemas clásicos: context rot (prompts sobrecargados), la falta de memoria procedural de los LLMs, el overhead de arquitecturas multi-agente y la necesidad de portabilidad entre herramientas y vendors.
El nuevo ciclo de vida (SDLC)
La IA comprime el ciclo de forma desigual: la implementación que llevaba semanas ahora toma horas, mientras que requisitos, arquitectura y verificación siguen a ritmo humano. El resultado no es un SDLC antiguo más rápido — es un flujo diferente, con fases que se mezclan e iteraciones de minutos.
La compresión (animada)
Fase por fase — explora
Los requisitos se vuelven conversación
Históricamente, requisitos era la fase con la mayor brecha entre intención e implementación. Ahora la IA participa directamente del refinamiento:
- Genera user stories a partir de briefs de producto
- Identifica edge cases que los humanos dejan pasar
- Produce API schemas desde descripciones en lenguaje natural
- Genera prototipos interactivos a partir de docs de especificación
"genera user stories + criterios de aceptación + 5 edge cases que no consideré"La arquitectura sigue siendo nuestra
Las decisiones arquitectónicas son fundamentalmente sobre trade-offs: consistencia × disponibilidad, complejidad × flexibilidad, construir × comprar. Dependen de contexto de negocio, restricciones organizacionales y estrategia de largo plazo que la IA no aprehende por completo.
- La IA es excelente en implementar decisiones arquitectónicas ya tomadas
- Con un doc de arquitectura claro, los agentes esqueletizan aplicaciones enteras con patrones consistentes
- Tu rol cambia de escribir boilerplate a tomar y documentar las decisiones estructurales
De escribir a revisar, guiar y verificar
Los agentes modernos generan features enteras desde descripciones en lenguaje natural, algoritmos complejos y cambios multi-archivo coherentes.
- Encuestas de la industria reportan ganancias de productividad del 25–39%, con proyecciones de 30–35% en el proceso completo
- Pero el estudio de METR halló que devs experimentados fueron 19% más lentos en ciertas tareas — por el tiempo verificando, depurando y corrigiendo output de la IA
- La IA no elimina el trabajo de implementación: lo transforma
Tests y evals: el lenguaje de la intención
Probar código generado por IA exige evaluar no solo qué produjo el agente, sino cómo llegó ahí:
- Evaluación de output: el artefacto final — ¿compila? ¿pasan los tests?
- Evaluación de trayectoria: la secuencia completa de llamadas de herramientas y razonamiento intermedio
- Un output fluido que saltó sus pasos de verificación es un fracaso más peligroso que un error visible
- Los agentes generan casos de prueba — incluyendo edge cases y tests property-based — que los humanos no pensarían
Review ampliado, despliegue vigilante
La IA actúa como revisora de primera pasada: bugs potenciales, violaciones de estilo, vulnerabilidades de seguridad y problemas de rendimiento — antes de que un humano vea el código.
- No sustituye el review humano: las decisiones de diseño, mantenibilidad y alineación estratégica siguen con nosotros
- Reduce drásticamente la carga cognitiva de quien revisa
- Los agentes monitorean la salud del despliegue, hacen rollback automático y predicen riesgo según la naturaleza de los cambios
Humano: diseño, mantenibilidad, estrategia.
El legado por fin deja de ser intocable
Codebases legacy que eran impenetrables para nuevos miembros ahora pueden ser navegados, entendidos y modificados con ayuda de IA.
- El agente lee el codebase, entiende sus patrones, identifica los archivos relevantes e implementa respetando la arquitectura existente
- El código "demasiado riesgoso para tocar" puede ser refactorizado, modernizado y extendido con seguridad
- Migraciones de framework, actualización de APIs deprecadas, modernización de suites de prueba — tareas que antes simplemente nunca ocurrían
El modelo de fábrica
El modelo mental que lo ata todo: la producción principal del desarrollador no es el código — es el sistema que produce código. Un gerente de fábrica no ensambla cada pieza a mano: diseña la línea de montaje y asegura el control de calidad.
Tú diseñas el sistema
Especificaciones, contexto, criterios de éxito — no instrucciones paso a paso
Los agentes producen el código
Traducen specs en implementación e iteran solos dentro de los límites
Los tests verifican el output
Quality gates y feedback loops devuelven los fallos para corrección automática
Las 5 piezas de tu fábrica
Harness: lo que rodea al modelo
Es tentador tratar al modelo como el sistema: "salió un modelo nuevo, el agente se volvió más listo". Esa intuición está equivocada. El modelo es una entrada. Todo lo demás — prompts, herramientas, políticas de contexto, hooks, sandboxes, sub-agentes, observabilidad — es el harness: el andamiaje que permite al modelo terminar las cosas.
un modelo crudo no es un agente — se vuelve uno cuando el harness le da estado, ejecución, feedback y restricciones
📜 Instrucciones y archivos de reglas
El texto que define quién es el agente, qué le importa y qué tiene prohibido hacer: AGENTS.md, CLAUDE.md, GEMINI.md, archivos de skill y prompts de sub-agentes. Es la pieza más barata y de mayor impacto.
El harness en cada fase del SDLC
1 · Requisitos y Arquitectura → Configurar el harness
Antes de cualquier código de producción: crear el AGENTS.md, definir restricciones arquitectónicas, elegir las herramientas (APIs, schemas) y las reglas inquebrantables.
2 · Implementación → Ejecutar el harness
El modelo genera código y lo ejecuta dentro del sandbox aislado del harness. ¿Necesita leer un archivo o buscar algo? Usa las herramientas que el harness provee — nada más.
3 · Pruebas y QA → El loop de feedback
¿Falló un test? La orquestación captura el error del sandbox y lo devuelve al modelo, pidiendo otro intento. El harness crea el loop automático pensar → actuar → observar.
4 · Review, Despliegue y Mantenimiento → Observar el harness
Hooks determinísticos bloquean el commit con contraseña hardcodeada. La observabilidad rastrea costo de tokens, latencia y drift — auditas por qué el agente decidió lo que decidió.
En Terminal Bench 2.0, un equipo subió un agente de codificación en el ranking cambiando solo el harness — cero cambio de modelo.
Estudio de LangChain en el mismo benchmark: ajuste solo de system prompt, herramientas y middleware alrededor de un modelo fijo.
Director × Orquestador: tu nuevo rol
Dos modos de trabajo entre los que alternarás fluidamente. Ninguno es "mejor" — cada uno sirve a un tipo de tarea.
El Director
- Estás en el IDE, viendo aparecer el código, guiando con prompts y correcciones
- Control fino de cada cambio
- Ideal para: lógica compleja, debugging difícil, codebases desconocidos
- Riesgo: si dictas cada tecla, tú te vuelves el cuello de botella
El Orquestador
- Defines objetivos, delegas a agentes y revisas resultados — sin ver línea por línea
- Los agentes trabajan en paralelo, en segundo plano, en sandboxes
- Ideal para: bug fixes, features con patrón establecido, migraciones, generación de tests
- Exige: especificación, descomposición, evaluación y diseño de sistema
El problema del 80% — haz clic en la barra
Qué compone el 20%:
- Edge cases y manejo de errores realista
- Puntos de integración con otros sistemas
- Requisitos sutiles de corrección
- Suposiciones erradas sobre la lógica de negocio
- Falta de pedir aclaración en requisitos ambiguos
- Decisiones arquitectónicas que crean deuda de mantenimiento invisible
Estos errores son más insidiosos porque el código "parece correcto" y puede incluso pasar los tests básicos. Los mejores devs usan la IA para lo que hace bien y reservan su propia atención para lo que no hace — no intentan ser más rápidos aceptando todo.
Agentes de codificación en la práctica
Tres lugares en tu día — y la mayoría de los devs usa los tres el mismo día. El punto de partida correcto depende de la tarea, no de qué categoría está más arriba en la escalera de autonomía.
Flujo continuo
Completions inline, chat que explica/modifica en el lugar, conciencia del codebase entero. Donde la mayoría encuentra la IA por primera vez.
Multi-archivo con ejecución
Das un objetivo en lenguaje natural; el agente recorre el codebase, ejecuta herramientas y tests, e itera sobre lo que observa. Donde el vibe coding serio ocurre hoy.
Delegar y revisar después
El agente recibe la tarea y corre autónomo en un sandbox en la nube — a veces durante horas — y entrega un pull request como output.
¿Y cuando el producto es un agente?
Un bot de soporte, un asistente de investigación, un monitor de cumplimiento — estos no son tareas para que resuelva un agente de codificación: son productos que necesitan su propia memoria persistente, permisos con alcance, cobertura de evals y observabilidad. El mismo flujo de terminal que produce scripts de prototipo ahora alcanza estos agentes de producción — el ciclo construir → evaluar → desplegar → observar → refinar vive en un solo lugar:
🔗 MCP
Model Context Protocol — el estándar para acceso a herramientas entre agentes y vendors.
🤝 A2A
Agent2Agent — el protocolo para delegación entre agentes. Juntos, MCP + A2A son el tejido conectivo de los sistemas multi-agente.
🦀 Prueba real
A inicios de 2026, los equipos de agentes de Anthropic construyeron un compilador de C en Rust en dos semanas — los humanos dieron dirección y revisaron, sin escribir la implementación.
La economía: CapEx × OpEx en la era de los tokens
La conversación suele empezar y terminar en "¿qué tan rápido escribimos código?". Para los líderes, la métrica crítica es el TCO — y en la era de la IA, el OpEx está dictado por la economía de los tokens.
El contexto como palanca financiera + enrutamiento inteligente
🧠 Modelos grandes y caros
- Requisitos y refinamiento
- Decisiones de arquitectura
- Implementación inicial compleja
Tareas de alta complejidad — donde el juicio pesa más que el costofrontier
automático
⚡ Modelos pequeños y baratos
- Generación de tests
- Code review de primera pasada
- Monitoreo de CI/CD
Tareas determinísticas y de baja complejidad — pagar precios premium aquí es desperdiciofast/cheap
Conclusión: La intención como nueva interfaz
La transición de la sintaxis a la intención no es una predicción futura — es una realidad presente. Los desarrolladores ya pasan más tiempo describiendo lo que quieren que especificando cómo construirlo. El SDLC ya está siendo comprimido, reestructurado y reimaginado en torno a las capacidades de la IA. La pregunta no es si esta transformación ocurrirá, sino con qué eficacia los desarrolladores, equipos y organizaciones la navegarán.
El framework presentado en este paper — el espectro del vibe coding a la ingeniería agéntica, el modelo director-orquestador de roles, la taxonomía de agentes ambientales, de workflow y autónomos, y el modelo de fábrica de producción de software — proporciona un conjunto de modelos mentales para dar sentido a un panorama en rápida evolución. Estos modelos seguirán siendo útiles incluso a medida que las herramientas y capacidades específicas evolucionen.
Tres principios duraderos
🏗 La estructura escala, los vibes no
El vibe coding es válido para exploración, prototipado y proyectos personales. Pero para el software del que dependen las organizaciones, la disciplina de la ingeniería agéntica — especificaciones, pruebas, guardrails y supervisión humana de la arquitectura — no es opcional. La brecha entre 'parece funcionar' y 'funciona correctamente bajo todas las condiciones' es donde viven las caídas de producción, vulnerabilidades de seguridad y pesadillas de mantenimiento.
🔊 La IA amplifica tu cultura de ingeniería
Las organizaciones con prácticas sólidas de pruebas, estándares arquitectónicos claros y procesos saludables de code review obtienen dramáticamente más valor del desarrollo asistido por IA que aquellas sin ellos. La IA es un multiplicador de fuerza — y multiplica tanto tus fortalezas como tus debilidades.
🧠 El rol humano evoluciona, no disminuye
Los constructores que entienden arquitectura, pueden definir especificaciones precisas, evaluar output críticamente y diseñar sistemas efectivos de restricciones y bucles de retroalimentación son más valiosos que nunca. Las habilidades que importan están cambiando de la implementación al juicio, de escribir código a diseñar los sistemas que producen código.
Estamos al inicio de una transformación que remodelará no solo cómo se construye el software, sino qué tipo de software es posible construir. Equipos más pequeños podrán abordar problemas más grandes. Desarrolladores individuales podrán construir y mantener sistemas que antes requerían departamentos enteros. La barrera para crear software seguirá cayendo, abriendo la práctica del desarrollo de software a una población más amplia.
Los equipos que prosperarán serán aquellos que abracen la IA como una herramienta poderosa mientras mantienen la disciplina de ingeniería que siempre ha sido la base del software confiable. Serán los que entienden que el futuro de la ingeniería de software no se trata de elegir entre experiencia humana y capacidad de IA — se trata de diseñar sistemas donde ambos contribuyan con sus fortalezas únicas.
Quiz: pon a prueba tu comprensión
8 preguntas que cubren toda la guía. Sin prisa — la explicación de cada respuesta es parte del estudio.
Cheatsheets listos para copiar
Tres artefactos que puedes usar hoy. Haz clic en copiar y pega en tu proyecto.
# AGENTS.md ## Stack TypeScript 6.x · Next.js 16 · Postgres (Drizzle ORM) · Vitest ## Convenciones - Funciones puras siempre que sea posible; errores vía Result<T, E>, nunca throw suelto - Nombres en inglés, comentarios explicando el "por qué", no el "qué" - Todo handler de API valida input con zod antes de tocar la base de datos ## Reglas rígidas (inquebrantables) - NUNCA commitear secretos; usar env vars vía .env.local - NUNCA instalar una dependencia sin confirmar conmigo - NUNCA modificar migrations ya aplicadas en producción ## Workflow 1. Lee docs/ antes de implementar 2. Escribe el test primero 3. Corre `pnpm test` hasta verde 4. Describe el diff antes del commit
# REVIEW DE CÓDIGO GENERADO POR IA [ ] Imports reales — ¿cada paquete existe? ¿versión compatible? (la alucinación de dependencias es el error nº 1) [ ] Nada "demasiado listo" — si parece demasiado clever, desconfía; código que el equipo no entiende = deuda [ ] Error handling real — cubre modos de fallo realistas, no solo el happy path que pasa el test [ ] Edge cases del negocio — la IA no conoce tu regla de reembolso; verifica supuestos de la lógica de negocio [ ] Trayectoria, no solo output — ¿el agente EJECUTÓ los tests o solo dijo que lo hizo? revisa logs / hooks de CI [ ] Secretos y permisos — nada hardcodeado; alcance mínimo de acceso [ ] Podrías explicar este diff — si no puedes explicarlo, no lo embarques
# EL NUEVO SDLC — MAPA MENTAL cambio : sintaxis → intención (tú dices el QUÉ, la máquina el CÓMO) espectro : vibe coding ──────── ia-asistido ──────── ing. agéntica divisor : verificación (tests = determinístico · evals = no-determ.) habilidad : ingeniería de contexto (6 tipos: instrucciones, conocimiento, memoria, ejemplos, herramientas, guardrails) trade-off : contexto estático (siempre pagado) × dinámico (pagado bajo demanda) patrón clave: Agent Skills — generalista liviano se vuelve especialista bajo demanda fábrica : tu output es el SISTEMA que produce código, no el código harness : AGENTE = MODELO + HARNESS · fallos de agente ≈ fallos de config roles : director (tiempo real) ⇄ orquestador (asíncrono, multi-agente) 80/20 : la IA hace 80% rápido; tu valor está en el 20% (edge, integración, sutileza) economía : vibe = CapEx↓ OpEx↑↑ · agéntico = CapEx↑ OpEx↓ + enrutamiento de modelos lema : "La generación está resuelta. Verificación, juicio y dirección son el nuevo oficio."
Por dónde empezar — checklists interactivos
Marca las casillas a medida que avanzas. El progreso se guarda en tu navegador.
👩💻 Devs individuales
🧭 Líderes de ingeniería
🏢 Organizaciones
Glosario de bolsillo
La estructura escala, los vibes no
El vibe coding sirve para explorar. Para software del que la organización depende, la disciplina de la ingeniería agéntica — specs, tests, guardrails, supervisión — no es opcional. Es en la brecha entre "parece funcionar" y "funciona correctamente bajo todas las condiciones" donde viven los fallos de producción.
La IA amplifica tu cultura de ingeniería
Los equipos con tests fuertes, estándares claros y review saludable extraen dramáticamente más valor. La IA es un multiplicador de fuerza — y multiplica tanto tus fortalezas como tus debilidades.
El papel humano está evolucionando, no disminuyendo
Quien entiende arquitectura, especifica con precisión, evalúa con criticidad y diseña sistemas de restricción y feedback vale más que nunca. Las habilidades migran de la implementación al juicio.
Verificación, juicio y dirección
son el nuevo oficio."
Continúa el viaje: los papers complementarios
Esta guía es el Día 1 de una serie. La serie completa tiene cuatro complementarios que profundizan los temas introducidos aquí — anota a dónde ir después.
Serie Agents Whitepaper — hub
Todas las guías de la serie en un solo lugar.
Agent Tools & Interoperability
Los 5 protocolos abiertos (MCP, A2A, A2UI, AP2, UCP) que conectan agentes a herramientas y entre sí.
Context Engineering: Sessions, Skills & Memory
Lleva más allá cada idea de la sección 03 de esta guía — profundizando el diseño y la gestión del contexto a escala de producción.
Vibe Coding Agent Security and Evaluation
Cómo proteger y evaluar agentes: 7 pilares de seguridad, 8 métodos de evaluación y quality gates.
Spec-Driven Production Grade Development in the Age of Vibe Coding
Las prácticas que hacen el workflow de agentes production-grade a escala de equipo — del spec al despliegue seguro.
Recursos para continuar
Las fuentes originales que fundamentan esta guía, para cuando quieras ir más allá del resumen.
Referencias (endnotes del paper)
Las notas al pie numeradas del paper original, para que rastrees cada afirmación hasta su fuente.