# trivedy-langchain-anatomy-agent-harness-2026-03-10

## Veille

Anatomy of an Agent Harness: Agent = Model + Harness, grundlegende Komponenten und die Entwicklung der LangChain-Harnesses

## Titre Article

The Anatomy of an Agent Harness

## Date

2026-03-10

## URL

https://blog.langchain.com/the-anatomy-of-an-agent-harness/

## Keywords

agent harness, harness engineering, Agent = Model + Harness, Dateisystem, Sandbox, Bash, Codeausführung, Gedächtnis, Suche, context rot, Compaction, lang laufende Ausführung, Ralph Loop, Planung, Selbstverifikation, Ko-Evolution von Modell und Harness, deepagents, LangChain, Terminal Bench

## Authors

Vivek Trivedy

## Ton

**Profil**: Perspektive eines Framework-Entwicklers, didaktisches technisches Register, Niveau mittel bis fortgeschritten. Vivek schreibt wie ein Ingenieur, der ein Konzept systematisch zerlegt, um es umsetzbar zu machen.

**Beschreibung**: Der Ton ist pädagogisch und strukturiert und folgt einem logischen Herleitungsansatz: Jede Harness-Komponente wird ausgehend von einem gewünschten Agentenverhalten begründet und rückwärts zur technischen Lösung entwickelt. Der Artikel verwendet ein wiederkehrendes Muster, „Behavior we want → Harness Design to help the model achieve this“, das die Lektüre schrittweise und verständlich macht. Der Stil ist technisch, aber zugänglich, mit konkreten Beispielen aus dem LangChain-Ökosystem. Der Autor vertritt eine differenzierte Position zur Zukunft der Harnesses: Auch wenn Modelle einige Harness-Funktionen absorbieren werden, bleibt Harness Engineering nützlich, weil es Systeme rund um die Intelligenz des Modells aufbaut. Die Zielgruppe sind Entwickler, die KI-Agenten bauen.

## Pense-betes

- **Grundlegende Definition**: Agent = Model + Harness. „If you're not the model, you're the harness.“ Der Harness = der gesamte Code, die Konfiguration und die Ausführungslogik, die nicht das Modell selbst ist
- **Harness-Komponenten**: Systemprompts, Tools/Skills/MCP und ihre Beschreibungen, eingebettete Infrastruktur (Dateisystem, Sandbox, Browser), Orchestrierungslogik (Subagenten, Handoffs, Modell-Routing), Hooks/Middleware für deterministische Ausführung (Compaction, Fortsetzung, Lint-Prüfungen)
- **Dateisystem**: die fundamentalste Primitive des Harness. Ermöglicht: Arbeitsbereich, inkrementelle Speicherung, Kollaborationsfläche zwischen mehreren Agenten/Menschen. Git fügt Versionierung hinzu
- **Bash + Codeausführung**: ein universelles Werkzeug statt vorkonfigurierter Tools für jede Aktion. Das Modell entwirft seine eigenen Tools spontan per Code
- **Sandboxes**: sichere, isolierte Ausführungsumgebungen. Ermöglichen Skalierbarkeit (bei Bedarf erstellt, danach zerstört). Gute Umgebungen enthalten Standard-Tools (Runtimes, Git-CLI, Browser)
- **Gedächtnis und Suche**: das Dateisystem als Gedächtnis-Primitive (AGENTS.md, beim Start in den Kontext geladen). Web Search und MCP (z. B. Context7), um auf Wissen jenseits des Trainings-Cutoffs zuzugreifen
- **Context Rot**: Leistungsverschlechterung, wenn sich das Kontextfenster füllt. Lösungen: Compaction (intelligente Zusammenfassung), Auslagern von Tool-Ergebnissen, Skills als progressive Offenlegung
- **Ralph Loop**: ein Harness-Muster, das den Ausstiegsversuch des Modells über einen Hook abfängt und den ursprünglichen Prompt in ein sauberes Kontextfenster neu einspeist, wodurch der Agent zur Fortsetzung gezwungen wird. Das Dateisystem ermöglicht dies, da jede Iteration mit einem frischen Kontext beginnt, aber den Zustand der vorherigen Iteration liest
- **Selbstverifikation**: Hooks, die eine Testsuite ausführen und bei einem Fehlschlag die Fehlermeldung als Feedback an das Modell zurückspielen
- **Ko-Evolution von Modell und Harness**: Agentenprodukte (Claude Code, Codex) werden mit Modell und Harness gemeinsam im Loop nachtrainiert. Dies erzeugt Overfitting (z. B. verschlechtert eine Änderung der apply_patch-Logik die Leistung). Der beste Harness für die eigene Aufgabe ist jedoch nicht zwangsläufig derjenige, mit dem das Modell trainiert wurde
- **Terminal Bench 2.0**: Opus 4.6 in Claude Code schneidet deutlich schlechter ab als Opus 4.6 in anderen Harnesses. LangChain stieg allein durch eine Änderung des Harness von Top 30 auf Top 5 auf
- **Zukunft**: Einige Harness-Funktionen werden von Modellen absorbiert, doch Harness Engineering bleibt nützlich, weil es Systeme rund um die Intelligenz des Modells aufbaut und nicht nur dessen Schwächen ausbessert
- **deepagents**: LangChains Bibliothek zur Verbesserung des Harness-Aufbaus. Offene Fragen: die Orchestrierung von Hunderten parallel laufender Agenten, Agenten, die ihre eigenen Traces analysieren, sowie Harnesses, die dynamisch die richtigen Tools just-in-time zusammenstellen

## RésuméDe400mots

Vivek Trivedy von LangChain schlägt eine strukturierte Definition des Agent-Harness vor: Agent = Model + Harness. Der Harness umfasst den gesamten Code, die Konfiguration und die Ausführungslogik, die nicht das Modell selbst ist, einschließlich Systemprompts, Tools und MCP, eingebetteter Infrastruktur, Orchestrierungslogik und deterministischer Hooks.

Der Artikel leitet jede Harness-Komponente aus den gewünschten Verhaltensweisen ab, die Modelle nicht nativ bereitstellen können. Das **Dateisystem** wird als die fundamentalste Primitive identifiziert: Es bietet einen Arbeitsbereich, inkrementelle Speicherung und eine Kollaborationsfläche zwischen Agenten und Menschen. **Bash und Codeausführung** liefern ein universelles Werkzeug, mit dem das Modell seine eigenen Tools spontan entwerfen kann. **Sandboxes** bieten sichere, skalierbare Ausführungsumgebungen mit standardmäßig vorinstallierten Tools.

Für das **Gedächtnis** dient das Dateisystem als zentrale Primitive über Standarddateien wie AGENTS.md, die beim Start in den Kontext geladen und zwischen den Sitzungen aktualisiert werden. Websuche und MCP-Tools (wie Context7) ermöglichen den Zugriff auf Wissen jenseits des Trainings-Cutoffs.

Der Artikel identifiziert **Context Rot** als zentrale Herausforderung: Die Leistung verschlechtert sich, wenn sich das Kontextfenster füllt. Lösungen umfassen Compaction (intelligente Zusammenfassung des Kontexts), das Auslagern großer Tool-Ergebnisse in das Dateisystem sowie Skills als Mechanismus der progressiven Offenlegung.

Für **lang laufende Ausführung** setzen sich die vorherigen Primitiven zusammen. Die **Ralph Loop** ist ein Muster, das den Versuch des Modells, den Vorgang zu beenden, abfängt und den Prompt in einen sauberen Kontext neu einspeist, wodurch die Arbeit zur Fortsetzung gezwungen wird. Planung und Selbstverifikation (Tests plus Korrekturschleife) halten den Agenten auf der richtigen Trajektorie.

Der Artikel untersucht die **Ko-Evolution von Modell und Harness**: Agentenprodukte wie Claude Code und Codex werden gemeinsam mit ihrem Harness nachtrainiert, was eine Kopplung erzeugt (eine Änderung der Logik eines Tools kann die Leistung verschlechtern). Der beste Harness für eine gegebene Aufgabe ist jedoch nicht zwangsläufig derjenige, der beim Training verwendet wurde — LangChain stieg auf Terminal Bench 2.0 allein durch eine Änderung des Harness von Top 30 auf Top 5 auf.

Als Fazit gilt: Auch wenn einige Harness-Funktionen von Modellen absorbiert werden, bleibt Harness Engineering relevant, weil es Systeme rund um die Intelligenz des Modells aufbaut. LangChain entwickelt deepagents und erforscht die massive Orchestrierung von Agenten, die Selbstanalyse von Traces sowie die dynamische Just-in-time-Zusammenstellung von Kontext.

## GrapheDeConnaissance

- Vivek Trivedy —publie→ The Anatomy of an Agent Harness (DOCUMENT, 0.99)
- Vivek Trivedy —travaille_chez→ LangChain (ORGANISATION, 0.95)
- LangChain —a_créé→ deepagents (TECHNOLOGIE, 0.95)
- LangChain —mesure→ passage du Top 30 au Top 5 sur Terminal Bench 2.0 en changeant uniquement le harnais (MESURE, 0.92)
- Harnais d'agent —est_instance_de→ Tout ce qui n'est pas le modèle dans un agent (CONCEPT, 0.98)
- Système de fichiers —est_instance_de→ Primitive la plus fondamentale du harnais (CONCEPT, 0.9)
- Ralph Loop —utilise→ Interception de la tentative de sortie du modèle (CONCEPT, 0.88)
- Context Rot —réduit→ Performance de l'agent (CONCEPT, 0.92)
- Compaction —résout→ Context Rot (CONCEPT, 0.9)
- Claude Code —est_basé_sur→ Post-entraînement avec harnais dans la boucle (CONCEPT, 0.85)
- Codex —est_basé_sur→ Post-entraînement avec harnais dans la boucle (CONCEPT, 0.85)
- Opus 4.6 —mesure→ scores très différents selon le harnais utilisé (Terminal Bench 2.0) (MESURE, 0.88)

---
Canonical: https://www.thekb.eu/de/fiches/trivedy-langchain-anatomy-agent-harness-2026-03-10/
