Andrej Karpathy: From Vibe Coding to Agentic Engineering
Entrevista con Andrej Karpathy (cofundador de OpenAI, ex Tesla Autopilot) sobre el paso de vibe coding a agentic engineering: December 2025 transition como punto de inflexión ("nunca se sintió más rezagado como programador"), la taxonomía Software 1.0/2.0/3.0, el ejemplo openclaw (script bash → texto para copiar y pegar en el agente) y MenuGen vuelto obsoleto por Nanobanana de Gemini, la teoría de la verifiability que explica por qué los LLM son jagged (picos en matemáticas/código, fallo al "caminar a un lavadero de coches a 50 m"), la distinción entre vibe coding (elevar el piso) y agentic engineering (preservar el estándar de calidad), la metáfora "animales vs fantasmas", la refundación de la contratación mediante proyectos agente contra agente, y la fórmula clave: "Puedes externalizar tu pensamiento pero no puedes externalizar tu comprensión."
Por Andrej Karpathy// Fuente youtube.com ↗/Lectura 2 min/.md// Traducción verificada automáticamente
Andrej Karpathy — cofundador de OpenAI, antiguo arquitecto del Autopilot de Tesla y creador del término vibe coding — afirma en esta entrevista que nunca se ha sentido más rezagado como programador. El punto de inflexión: December 2025 transition. Durante una pausa, observa que los chunks de código generados por los nuevos modelos salen correctos a la primera; deja de corregir, confía en el resultado y hace vibe coding de forma continua. Su conclusión: quienes vivieron la IA en 2024 como un avatar adyacente a ChatGPT necesitan volver a mirar — algo ha cambiado de forma fundamental en el flujo de trabajo agéntico coherente.
Karpathy formaliza su taxonomía Software 1.0 / 2.0 / 3.0: código explícito, luego pesos aprendidos mediante datasets, luego el prompting como programación de un intérprete LLM. Dos ejemplos ilustran la ruptura. openclaw: en lugar de un script de shell sobredimensionado que cubra cada plataforma, la instalación se convierte en texto para copiar y pegar en el agente, que depura en bucle. MenuGen: su aplicación vibe-coded en Vercel para generar imágenes de platos queda obsoleta cuando descubre que se puede dar directamente la foto del menú a Gemini, pidiendo a Nanobanana que superponga los platos — ninguna aplicación entre la imagen de entrada y la de salida. "Esa aplicación no debería existir." Lección: no pensar en la IA como una aceleración del paradigma existente, sino como nuevas posibilidades (por ejemplo, LLM Knowledge Bases).
Su teoría de la verifiability explica por qué los LLM siguen siendo jagged: los laboratorios entrenan mediante RL en dominios verificables (matemáticas, código), creando picos de capacidad y vacíos en el resto. Una anécdota reveladora: Opus 4.7 refactoriza 100.000 líneas de código pero recomienda caminar 50 m hasta el lavadero de coches. Consejo a los fundadores: apuntar a dominios verificables donde se puedan crear entornos de RL propios y hacer fine-tuning.
Karpathy distingue vibe coding (elevar el piso — democratización) de agentic engineering (preservar el estándar de calidad — disciplina de ingeniería para coordinar agentes spiky/stochastic). El ingeniero 10x se ve magnificado mucho más allá de 10x. La contratación debe reconstruirse: se acabaron los puzles, hay lugar para grandes proyectos adversariales (agente clon de Twitter frente a agentes de red team).
Los agentes son becarios con excelente memoria pero sin taste — los humanos siguen a cargo de la estética, el diseño y la especificación. Karpathy rechaza la metáfora animal: no estamos construyendo animales, estamos invocando fantasmas — circuitos estadísticos, no vida. Reclama una infraestructura nativa para agentes (sensores/actuadores, documentación para agentes, despliegue impulsado por prompts). Fórmula de cierre: "Puedes externalizar tu pensamiento pero no puedes externalizar tu comprensión." Los humanos siguen siendo el cuello de botella de la comprensión que dirige el sistema.
Puntos clave
Fecha estimada. abril de 2026, conferencia AI Startup School / "AIN" (referencia a que Sam Altman había venido "el año pasado"). Vídeo de YouTube: https://www.youtube.com/watch?v=96jN2OCOfLs
Frase de apertura."Nunca se ha sentido más rezagado como programador." — una afirmación que se volvió viral en X/Twitter y que el entrevistador usa para abrir.
Punto de inflexión de December 2025 transition. Karpathy estaba de vacaciones, tenía más tiempo, y notó que "los chunks simplemente salían bien y luego yo seguía pidiendo más y seguía saliendo bien." Ya no había necesidad de corregir. Insiste: "mucha gente experimentó la IA el año pasado como algo adyacente a ChatGPT. Pero realmente había que volver a mirar y había que mirar a partir de December porque las cosas han cambiado fundamentalmente."
Software 1.0 / 2.0 / 3.0.
1.0. código explícito escrito por un humano
2.0. programación mediante la creación de datasets + entrenamiento de redes neuronales (pesos aprendidos)
3.0. programación = prompting; el contexto es la palanca sobre el intérprete LLM; el LLM se convierte en un ordenador programable
Ejemplo openclaw (ilustración de Software 3.0). en lugar de un script de shell que se infla para cubrir cada plataforma, la instalación es "un copiar y pegar de texto que le das a tu agente." El agente observa el entorno y depura en bucle, lo cual es más potente que un script preciso.
MenuGen → Nanobanana (caso extremo). Karpathy hizo vibe coding de MenuGen (foto del menú de un restaurante → OCR + generación de imágenes para visualizar los platos) en Vercel. Luego descubre que basta con dar la foto a Gemini y decir "usa Nanobanana para superponer las cosas en el menú" — Nanobanana devuelve la imagen original con los platos superpuestos en píxeles. "Todo mi MenuGen es espurio. Funciona en el paradigma antiguo. Esa aplicación no debería existir." La red neuronal lo hace todo, el prompt es la imagen, la salida es la imagen. Ninguna aplicación en medio. Conclusión de Karpathy: no pensar en la IA como aceleración del paradigma existente, sino como cosas recién posibles.
Nuevas posibilidades. LLM Knowledge Bases — "consigues que los LLM creen wikis para tu organización o para ti en persona." Esto no es código, es una recompilación/reordenación de documentos para crear una nueva proyección. "Esto no es algo que pudiera existir antes."
Extrapolación 2026 (equivalente a la web de los 90, el móvil de los 2010, el SaaS en la nube). Karpathy imagina ordenadores neuronales donde la red neuronal se convierte en el proceso anfitrión y las CPU pasan a ser coprocesadores — un modelo de difusión que renderiza una UI única sobre la marcha, a partir de entrada de vídeo/audio en bruto. "En los años 50 y 60 no era realmente obvio si los ordenadores se parecerían a calculadoras o a redes neuronales. Por supuesto, tomamos el camino de la calculadora." Esta rama podría invertirse pieza a pieza.
Marco de la verifiability. ¿por qué son jagged los LLM?
"Los ordenadores tradicionales pueden automatizar fácilmente lo que puedes especificar en código; los LLM pueden automatizar fácilmente lo que puedes verificar."
Los laboratorios de frontera entrenan mediante RL con recompensas de verificación → picos en matemáticas/código y áreas adyacentes, ásperos en los bordes en el resto.
Combinación: verificable + a los laboratorios les importa (lo que entra en la mezcla de datos según el valor económico).
Anécdota GPT-3.5 → GPT-4 en ajedrez: la enorme mejora se debió a una gran cantidad de datos de ajedrez añadidos intencionadamente al preentrenamiento, no a un progreso general.
Consecuencia: se está "un poco a merced de lo que estén haciendo los laboratorios." Si estás dentro de un circuito de RL, vuelas. Si no, es necesario el fine-tuning propio.
Ejemplo moderno de jaggedness."Quiero ir a un lavadero de coches a lavar mi coche y está a 50 metros. ¿Debería conducir o caminar? Los modelos de última generación de hoy te dirán que camines porque está muy cerca. ¿Cómo es posible que el Opus 4.7 de última generación pueda simultáneamente refactorizar una base de código de 100.000 líneas o encontrar vulnerabilidades de día cero y aun así decirme que camine hasta ese lavadero de coches? Es una locura."
Consejo a los fundadores. apuntar a dominios verificables donde puedas crear tus propios entornos/ejemplos de RL → el fine-tuning funciona como palanca. "La verifiability sigue siendo cierta incluso si los laboratorios no se centran en ella directamente." Karpathy se niega a revelar un dominio específico en el escenario: "No quiero hacer vibe post en el escenario."
Sobre lo que NO es automatizable."En última instancia, casi todo puede hacerse verificable hasta cierto punto. Incluso para la escritura, se puede imaginar un consejo de jueces LLM." Para Karpathy: todo es, en última instancia, automatizable, solo que es más o menos fácil.
Vibe coding vs. Agentic engineering (distinción clave).
Vibe coding. = elevar el piso. Cualquiera puede hacer vibe coding de cualquier cosa. Democratización.
Agentic engineering. = preservar el estándar de calidad del software profesional. "No se te permite introducir vulnerabilidades por hacer vibe coding. Sigues siendo responsable de tu software igual que antes, pero ¿puedes ir más rápido?"
Es una disciplina de ingeniería: coordinar agentes spiky/stochastic para avanzar rápido sin sacrificar la calidad.
El ingeniero 10x se ve magnificado."10x no es la aceleración que se gana. Las personas que son muy buenas en esto alcanzan mucho más de 10x."
Sobre la contratación (punto muy accionable)."La mayoría de la gente todavía no ha refactorizado su proceso de contratación para la capacidad de agentic engineer. Si estás dando puzles para resolver, eso sigue siendo el paradigma antiguo. La contratación tiene que parecerse a: dame un proyecto realmente grande y mira a alguien implementar ese gran proyecto." Ejemplo: "Escribamos un clon de Twitter para agentes, hagámoslo realmente bueno, hagámoslo realmente seguro, luego hagamos que algunos agentes simulen actividad, y voy a usar 10 codecs 5.4x for X high para intentar romper tu sitio web. No deberían poder romperlo." (Reformulación de Karpathy de la entrevista de Sierra AI-native — corroboración directa de Bret Taylor / Iyengar / Asemanfar / Wang.)
Habilidades humanas que ganan valor.taste, estética, juicio, supervisión, diseño de especificaciones. Los agentes son becarios — tienen excelente memoria (detalles de la API de PyTorch/NumPy/pandas que ya no hay que memorizar: keep_dims vs keep_dim, dim vs axis, reshape vs permute vs transpose), pero se les escapan cosas fundamentales. Anécdota de MenuGen: el agente intentó cruzar cuentas de Stripe y Google por dirección de correo electrónico en lugar de usar un ID de usuario persistente — "esto es una cosa muy rara de hacer."
El papel del humano."Estás a cargo del taste, la ingeniería, el diseño, de que tenga sentido, de que estés pidiendo las cosas correctas. Los ingenieros están rellenando los huecos." A Karpathy no le entusiasma especialmente el plan mode en sí, pero cree en una especificación detallada codiseñada con el agente.
Infarto al leer el código generado."No siempre es necesariamente un código súper genial y es muy bloated y hay mucho copiar y pegar y abstracciones incómodas y frágiles y como que funciona pero es simplemente muy asqueroso." Sobre micro GPT: intentó que el LLM lo simplificara, "los modelos odian esto. No pueden hacerlo. Sientes que estás fuera de los circuitos de RL. Es como sacar muelas." — prueba de que la estética de la simplicidad no forma parte del RL de los laboratorios.
Animales vs Fantasmas."No estamos construyendo animales, estamos invocando fantasmas." Los LLM no son inteligencias de tipo animal (gritarles no cambia nada). Son circuitos de simulación estadística: el sustrato es el preentrenamiento (estadístico), con el RL añadido encima para aumentar los apéndices. Karpathy admite: "No sé que tenga como aquí están los cinco resultados obvios de cómo mejorar tu sistema. Es más bien sospechar de él e ir descubriéndolo con el tiempo."
Infraestructura nativa para agentes."Todo sigue estando fundamentalmente escrito para humanos y hay que moverlo de un lado a otro. Sigo usando la mayor parte del tiempo, cuando uso distintos frameworks o librerías... siguen teniendo documentación fundamentalmente escrita para humanos. Esta es mi manía favorita. ¿Por qué la gente me sigue diciendo qué hacer? No quiero hacer nada. ¿Qué es lo que debería copiar y pegar a mi agente?" Visión: descomponer las cargas de trabajo en sensores sobre el mundo / actuadores sobre el mundo. Prueba definitiva: "Espero poder darle un prompt a un LLM 'construye MenuGen' y luego no tener que tocar nada y que esté desplegado." El despliegue de la configuración de Vercel/DNS/Stripe fue el verdadero punto de dolor, no el código.
Largo plazo."Haré que mi agente hable con tu agente para acordar los detalles de las reuniones." Representación basada en agentes para personas y organizaciones.
Fórmula de cierre (sobre educación y conocimiento)."Puedes externalizar tu pensamiento pero no puedes externalizar tu comprensión." Karpathy: "Todavía tengo que hacer que, de alguna manera, la información llegue a mi cerebro y siento que me estoy convirtiendo en un cuello de botella de simplemente saber qué estamos tratando de construir, por qué vale la pena hacerlo, cómo dirijo a mis agentes." Defiende las LLM Knowledge Bases como herramienta para una comprensión aumentada, mediante generación de datos sintéticos sobre un corpus fijo (sus artículos → wiki personal).
Conexión con el expediente de veille.
Confirma y populariza, con su propia voz, el paradigma Software 3.0 (cf. Greyling 2026-03-09 "el entorno de desarrollo se está colapsando", Rauch 2026-01-02 "la CLI como abstracción fundamental del agente de codificación").
La distinción vibe coding / agentic engineering cristaliza el debate llevado desde Kent Beck (2024-10), Mogère (2025-07), Yegge & Kim (2025-11), Beck Starving Genies (2026-04-03) — Karpathy aporta el vocabulario estable para la oposición.
La refundación de la contratación mediante grandes proyectos adversariales corrobora explícitamente a Sierra (Taylor 2026-04-20, Iyengar/Asemanfar/Wang 2026-04-22) y a Soto (Developer Taste 2026-04).
La verifiability como cuadrícula explicativa de la jagged frontier extiende a Mollick (2025-11-12 Giving your AI a Job Interview) y aporta un marco operativo (crear tus propios entornos de RL).
Animales vs fantasmas. se inscribe en el linaje filosófico de las notas sobre el núcleo ontológico (Seale 2025-05-30) y la maleabilidad del mundo (Andreessen 2026-02 / rebatido por Ralmuto 2026-03-17).
La infraestructura nativa para agentes extiende Cloudflare Markdown for Agents (2026-02-12), Levie Building for Trillions of Agents (2026-03-07), Sierra (2026-04).
Afirmaciones atribuidas
"nunca me sentí tan atrasado como programador"
— Andrej Karpathy
"Puedes externalizar tu pensamiento, pero no puedes externalizar tu comprensión"
— Andrej Karpathy
diciembre de 2025 marca el cambio hacia un flujo de trabajo agéntico coherente
— Andrej Karpathy
los LLM son fantasmas (circuitos de simulación estadística), no animales
— Andrej Karpathy
Opus 4.7 refactoriza 100k líneas pero falla en la pregunta del lavado de autos a 50 m
— Andrej Karpathy
El grafo de conocimiento extraído de esta ficha — 15 entidades, 21 relaciones.
En este grafo :Andrej Karpathy · Software 3.0 · Vibe coding · Agentic engineering · Verifiability · Jagged intelligence · MenuGen · Nanobanana · Animals vs Ghosts · Hiring refactoring par projets adversariels · LLM Knowledge Bases · Opus 4.7 · AI Startup School · December 2025 transition · LLM