Andrej Karpathy: From Vibe Coding to Agentic Engineering
Interview mit Andrej Karpathy (Mitgründer von OpenAI, ehemals Tesla Autopilot) über den Übergang von vibe coding zu agentic engineering: December 2025 transition als Wendepunkt – „noch nie so sehr als Programmierer hinterhergehinkt“ –, die Taxonomie Software 1.0/2.0/3.0, das Beispiel openclaw (Bash-Skript → Text zum Kopieren in den Agenten) und MenuGen, das durch Geminis Nanobanana obsolet wird, die Verifiability-Theorie, die erklärt, warum LLMs jagged sind (Spitzenwerte bei Mathematik/Code, aber Scheitern bei „50 m zu Fuß zur Autowaschanlage“), die Unterscheidung zwischen vibe coding (die Einstiegshürde senken) und agentic engineering (den Qualitätsanspruch wahren), die Metapher „animals vs ghosts“, die Neuausrichtung der Personalauswahl über Agent-gegen-Agent-Projekte sowie die Kernformel: „You can outsource your thinking but you can't outsource your understanding.“
Von Andrej Karpathy// Quelle youtube.com ↗/Lesezeit 2 min/.md// Automatisch geprüfte Übersetzung
Andrej Karpathy — Mitgründer von OpenAI, ehemaliger Architekt von Teslas Autopilot und Schöpfer des Begriffs vibe coding — erklärt in diesem Interview, dass er sich noch nie so sehr als Programmierer im Rückstand gefühlt habe. Der Wendepunkt: December 2025 transition. Während einer Pause bemerkt er, dass die von den neuen Modellen erzeugten Code-Chunks auf Anhieb korrekt sind; er hört auf zu korrigieren, vertraut der Ausgabe und betreibt durchgehend Vibe-Coding. Seine Schlussfolgerung: Wer KI 2024 als ChatGPT-nahes Avatar-Erlebnis erfahren hat, muss noch einmal hinschauen – im kohärenten agentischen Workflow hat sich grundlegend etwas verändert.
Karpathy formalisiert seine Taxonomie Software 1.0 / 2.0 / 3.0: expliziter Code, dann über Datensätze gelernte Gewichte, dann Prompting als Programmierung eines LLM-Interpreters. Zwei Beispiele veranschaulichen den Bruch. openclaw: Statt eines aufgeblähten Shell-Skripts, das jede Plattform abdeckt, wird die Installation zu Text, den man in den Agenten kopiert, der dann in einer Schleife debuggt. MenuGen: Seine vibe-gecodete App auf Vercel zur Erzeugung von Gerichtsfotos wird obsolet, als er entdeckt, dass man das Menüfoto direkt an Gemini übergeben und Nanobanana bitten kann, die Gerichte einzublenden – keine App mehr zwischen Eingabebild und Ausgabebild. „That app shouldn't exist.“ Lehre: KI nicht als Beschleunigung des bestehenden Paradigmas denken, sondern als neue Möglichkeiten (z. B. LLM Knowledge Bases).
Seine Verifiability-Theorie erklärt, warum LLMs weiterhin jagged bleiben: Die Labore trainieren per RL auf verifizierbaren Domänen (Mathematik, Code), wodurch Fähigkeitsspitzen und -lücken andernorts entstehen. Eine aufschlussreiche Anekdote: Opus 4.7 refaktoriert 100.000 Codezeilen, empfiehlt aber, 50 m zu Fuß zur Autowaschanlage zu gehen. Rat an Gründer: verifizierbare Domänen anvisieren, in denen man eigene RL-Umgebungen schaffen und Fine-Tuning betreiben kann.
Karpathy unterscheidet vibe coding (die Einstiegshürde senken – Demokratisierung) von agentic engineering (den Qualitätsanspruch wahren – Engineering-Disziplin zur Koordination spiky/stochastic Agenten). Der 10x-Engineer wird weit über das 10-Fache hinaus verstärkt. Die Personalauswahl muss neu aufgebaut werden: keine Puzzles mehr, Raum für große adversariale Projekte (Twitter-Klon-Agent vs. Red-Team-Agenten).
Agenten sind Praktikanten mit hervorragendem Erinnerungsvermögen, aber ohne Geschmack – Menschen bleiben verantwortlich für Ästhetik, Design und Spezifikation. Karpathy lehnt die Tiermetapher ab: Wir bauen keine Tiere, wir beschwören Geister – statistische Schaltkreise, kein Leben. Er fordert agentennative Infrastruktur (Sensoren/Aktoren, Dokumentation für Agenten, promptgesteuerte Bereitstellung). Schlussformel: „You can outsource your thinking but you can't outsource your understanding.“ Der Mensch bleibt der Engpass des Verständnisses, das das System steuert.
Kernpunkte
Geschätztes Datum. April 2026, Konferenz AI Startup School / „AIN“ (Bezug darauf, dass Sam Altman „letztes Jahr“ dabei war). YouTube-Video: https://www.youtube.com/watch?v=96jN2OCOfLs
Eröffnungspointe.„He's never felt more behind as a programmer.“ — eine Aussage, die auf X/Twitter viral ging und mit der der Interviewer eröffnet.
Wendepunkt December 2025 transition. Karpathy war in einer Pause, hatte mehr Zeit und bemerkte, dass „the chunks just came out fine and then I kept asking for more and it just came out fine.“ Keine Korrekturen mehr nötig. Er betont: „a lot of people experienced AI last year as ChatGPT-adjacent thing. But you really had to look again and you had to look as of December because things have changed fundamentally.“
Software 1.0 / 2.0 / 3.0.
1.0. expliziter, von einem Menschen geschriebener Code
2.0. Programmierung durch Erstellung von Datensätzen + Training neuronaler Netze (gelernte Gewichte)
3.0. Programmierung = Prompting; der Kontext ist der Hebel am LLM-Interpreter; das LLM wird zum programmierbaren Computer
Beispiel openclaw (Veranschaulichung von Software 3.0). Statt eines Shell-Skripts, das aufgebläht wird, um jede Plattform abzudecken, ist die Installation „a copy-paste of text that you give to your agent.“ Der Agent betrachtet die Umgebung und debuggt in einer Schleife – mächtiger als ein präzises Skript.
MenuGen → Nanobanana (Extremfall). Karpathy hat MenuGen (Foto einer Restaurantkarte → OCR + Bildgenerierung zur Visualisierung der Gerichte) auf Vercel vibe-gecodet. Dann entdeckt er, dass man das Foto einfach Gemini geben und sagen kann: „use Nanobanana to overlay the things onto the menu“ – Nanobanana liefert das Originalbild mit den Gerichten pixelgenau eingeblendet zurück. „All of my menu gen is spurious. It's working in the old paradigm. That app shouldn't exist.“ Das neuronale Netz erledigt alles, der Prompt ist das Bild, die Ausgabe ist das Bild. Keine App dazwischen. Karpathys Fazit: KI nicht als Beschleunigung des bestehenden Paradigmas denken, sondern als neu mögliche Dinge.
Neue Möglichkeiten. LLM Knowledge Bases – „you get LLMs to create wikis for your organization or for you in person.“ Das ist kein Code, sondern eine Neukompilierung/Neuordnung von Dokumenten zur Erzeugung einer neuen Projektion. „This is not something that could exist before.“
Extrapolation 2026 (vergleichbar mit dem Web der 90er, Mobile der 2010er, Cloud-SaaS). Karpathy stellt sich neuronale Computer vor, bei denen das neuronale Netz zum Host-Prozess und CPUs zu Co-Prozessoren werden – ein Diffusionsmodell, das aus rohen Video-/Audioeingaben eine einzigartige UI in Echtzeit rendert. „In the 50s and 60s it was not really obvious whether computers would look like calculators or computers would look like neural nets. Of course we went down the calculator path.“ Dieser Zweig könnte sich Stück für Stück umkehren.
Verifiability-Rahmen. Warum sind LLMs jagged?
„Traditional computers can easily automate what you can specify in code; LLMs can easily automate what you can verify.“
Frontier-Labore trainieren per RL mit Verifikations-Rewards → Spitzenwerte bei Mathematik/Code und angrenzenden Bereichen, rough around the edges andernorts.
Kombination: verifizierbar + den Laboren wichtig (was aufgrund wirtschaftlichen Werts in den Datenmix gelangt).
Anekdote Schach GPT-3.5 → GPT-4: Die enorme Verbesserung war auf eine große Menge absichtlich ins Pretraining eingebrachter Schachdaten zurückzuführen, nicht auf allgemeinen Fortschritt.
Konsequenz: Man ist „slightly at the mercy of whatever the labs are doing.“ Befindet man sich innerhalb eines RL-Kreislaufs, fliegt man. Andernfalls ist hausinternes Fine-Tuning nötig.
Beispiel für moderne jaggedness.„I want to go to a car wash to wash my car and it's 50 meters away. Should I drive or should I walk? State-of-the-art models today will tell you to walk because it's so close. How is it possible that state-of-the-art Opus 4.7 will simultaneously refactor a 100,000 line codebase or find zero day vulnerabilities and yet tells me to walk to this car wash? This is insane.“
Rat an Gründer.verifizierbare Domänen anvisieren, in denen man eigene RL-Umgebungen/Beispiele schaffen kann → Fine-Tuning wirkt als Hebel. „Verifiability remains true even if the labs are not focusing on it directly.“ Karpathy weigert sich, auf der Bühne eine konkrete Domäne zu nennen: „I don't want to vibe post on stage.“
Was NICHT automatisierbar ist.„Ultimately almost everything can be made verifiable to some extent. Even for writing, you can imagine having a council of LLM judges.“ Für Karpathy: letztlich ist alles automatisierbar, nur mehr oder weniger leicht.
Vibe coding vs. Agentic engineering (zentrale Unterscheidung).
Vibe coding. = die Einstiegshürde senken. Jeder kann alles vibe-coden. Demokratisierung.
Agentic engineering. = den Qualitätsanspruch professioneller Software wahren. „You're not allowed to introduce vulnerabilities due to vibe coding. You're still responsible for your software just as before, but can you go faster?“
Es handelt sich um eine Engineering-Disziplin: die Koordination spiky/stochastischer Agenten, um schneller voranzukommen, ohne Qualität zu opfern.
Der 10x-Engineer wird verstärkt.„10x is not the speed up you gain. People who are very good at this peak a lot more than 10x.“
Zur Personalauswahl (hoch umsetzbarer Punkt).„Most people have still not refactored their hiring process for agentic engineer capability. If you're giving out puzzles to solve, this is still the old paradigm. Hiring has to look like: give me a really big project and see someone implement that big project.“ Beispiel: „Let's write a Twitter clone for agents, make it really good, make it really secure, then have some agents simulate activity, and I'm going to use 10 codecs 5.4x for X high to try to break your website. They should not be able to break it.“ (Karpathys Umformulierung des Sierra-AI-native-Interviews – direkte Bestätigung von Bret Taylor / Iyengar / Asemanfar / Wang.)
Menschliche Fähigkeiten gewinnen an Wert.Geschmack, Ästhetik, Urteilsvermögen, Aufsicht, Spezifikationsdesign. Agenten sind Praktikanten – sie haben ein hervorragendes Erinnerungsvermögen (Details der PyTorch/NumPy/pandas-API, die man sich nicht mehr merken muss: keep_dims vs. keep_dim, dim vs. axis, reshape vs. permute vs. transpose), übersehen aber grundlegende Dinge. MenuGen-Anekdote: Der Agent versuchte, Stripe- und Google-Konten anhand der E-Mail-Adresse zu verknüpfen, statt eine persistente Nutzer-ID zu verwenden – „this is such a weird thing to do.“
Die Rolle des Menschen.„You're in charge of the taste, the engineering, the design, that it makes sense, that you're asking for the right things. The engineers are doing the fill in the blanks.“ Karpathy ist kein großer Fan des plan mode selbst, glaubt aber an eine detaillierte, gemeinsam mit dem Agenten erarbeitete Spezifikation.
Herzinfarkt beim Lesen des generierten Codes.„It's not super amazing code necessarily all the time and it's very bloaty and there's a lot of copy paste and there's awkward abstractions that are brittle and like it works but it's just really gross.“ Zu micro GPT: Er versuchte, das LLM zur Vereinfachung zu bewegen, „the models hate this. They can't do it. You feel like you're outside of the RL circuits. It's like pulling teeth.“ — Beweis dafür, dass die Ästhetik der Einfachheit nicht Teil des RL der Labore ist.
Animals vs Ghosts.„We're not building animals, we are summoning ghosts.“ LLMs sind keine tierähnlichen Intelligenzen (sie anzuschreien ändert nichts). Es sind statistische Simulationsschaltkreise: Das Substrat ist Pretraining (statistisch), mit obendrauf montiertem RL, das die Appendages vergrößert. Karpathy räumt ein: „I don't know that I have like here are the five obvious outcomes of how to make your system better. It's more just being suspicious of it and figuring out over time.“
Agentennative Infrastruktur.„Everything is still fundamentally written for humans and has to be moved around. I still use most of the time when I use different frameworks or libraries... they still have docs that are fundamentally written for humans. This is my favorite pet peeve. Why are people still telling me what to do? I don't want to do anything. What is the thing I should copy paste to my agent?“ Vision: Arbeitslasten aufteilen in Sensoren über die Welt / Aktoren über die Welt. Ultimativer Test: „I would hope that I could give a prompt to an LLM 'build menu gen' and then I didn't have to touch anything and it's deployed.“ Die Konfiguration von Vercel/DNS/Stripe war der eigentliche Schmerzpunkt, nicht der Code.
Langfristig.„I'll have my agent talk to your agent to figure out details of meetings.“ Agentenbasierte Vertretung für Personen und Organisationen.
Schlussformel (zu Bildung und Wissen).„You can outsource your thinking but you can't outsource your understanding.“ Karpathy: „I still have to somehow information still has to make it into my brain and I feel like I'm becoming a bottleneck of just even knowing what are we trying to build why is it worth doing how do I direct my agents.“ Er befürwortet LLM Knowledge Bases als Werkzeug für erweitertes Verständnis durch synthetische Datengenerierung über einem festen Korpus (seine Artikel → persönliches Wiki).
Bezug zum Veille-Dossier.
Bestätigt und popularisiert in eigener Stimme das Paradigma Software 3.0 (vgl. Greyling 2026-03-09 „the development environment is collapsing“, Rauch 2026-01-02 „CLI as fundamental coding agent abstraction“).
Die Unterscheidung vibe coding / agentic engineering kristallisiert die seit Kent Beck (2024-10), Mogère (2025-07), Yegge & Kim (2025-11), Beck Starving Genies (2026-04-03) geführte Debatte heraus – Karpathy liefert das stabile Vokabular für den Gegensatz.
Die Neuausrichtung der Personalauswahl über große adversariale Projekte bestätigt explizit Sierra (Taylor 2026-04-20, Iyengar/Asemanfar/Wang 2026-04-22) und Soto (Developer Taste 2026-04).
Verifiability. als Erklärungsraster für die jagged frontier erweitert Mollick (2025-11-12 Giving your AI a Job Interview) und liefert einen operationalen Rahmen (eigene RL-Umgebungen schaffen).
Animals vs ghosts. fügt sich in die philosophische Linie der Notizen zum ontologischen Kern (Seale 2025-05-30) und zur Formbarkeit der Welt (Andreessen 2026-02 / widerlegt von Ralmuto 2026-03-17) ein.
Agentennative Infrastruktur. erweitert Cloudflare Markdown for Agents (2026-02-12), Levie Building for Trillions of Agents (2026-03-07), Sierra (2026-04).
Zugeschriebene Aussagen
"never felt more behind as a programmer"
— Andrej Karpathy
"You can outsource your thinking but you can't outsource your understanding"
— Andrej Karpathy
Dezember 2025 markiert den Wendepunkt zu einem kohärenten agentischen Workflow
— Andrej Karpathy
LLMs sind Gespenster (Schaltkreise statistischer Simulation), keine Tiere
— Andrej Karpathy
Opus 4.7 refaktorisiert 100k Zeilen, scheitert aber an der Frage der Autowaschanlage in 50m Entfernung
— Andrej Karpathy
Der aus dieser Fiche extrahierte Wissensgraph — 15 Entitäten, 21 Relationen.
In diesem Graphen :Andrej Karpathy · Software 3.0 · Vibe coding · Agentic engineering · Verifiability · Jagged intelligence · MenuGen · Nanobanana · Animals vs Ghosts · Hiring refactoring par projets adversariels · LLM Knowledge Bases · Opus 4.7 · AI Startup School · December 2025 transition · LLM