# trivedy-langchain-anatomy-agent-harness-2026-03-10

## Veille

Anatomy of an Agent Harness: Agent = Model + Harness, componenti fondamentali ed evoluzione degli harness LangChain

## Titre Article

The Anatomy of an Agent Harness

## Date

2026-03-10

## URL

https://blog.langchain.com/the-anatomy-of-an-agent-harness/

## Keywords

agent harness, harness engineering, Agent = Model + Harness, filesystem, sandbox, bash, esecuzione di codice, memoria, ricerca, context rot, compaction, esecuzione di lunga durata, Ralph Loop, planning, autoverifica, co-evoluzione modello-harness, deepagents, LangChain, Terminal Bench

## Authors

Vivek Trivedy

## Ton

**Profilo**: prospettiva da sviluppatore di framework, registro tecnico didattico, livello da intermedio ad avanzato. Vivek scrive come un ingegnere che scompone sistematicamente un concetto per renderlo attuabile.

**Descrizione**: il tono è pedagogico e strutturato, secondo un approccio di derivazione logica: ogni componente dell'harness è giustificata partendo da un comportamento desiderato dell'agente e risalendo alla soluzione tecnica. L'articolo usa uno schema ricorrente, "Comportamento desiderato → Harness Design per aiutare il modello a raggiungerlo", che rende la lettura progressiva e comprensibile. Lo stile è tecnico ma accessibile, con esempi concreti tratti dall'ecosistema LangChain. L'autore adotta una posizione sfumata sul futuro degli harness: anche se i modelli assorbiranno alcune funzioni dell'harness, l'harness engineering resterà utile perché costruisce sistemi attorno all'intelligenza del modello. Il pubblico di riferimento è composto da sviluppatori che costruiscono agenti IA.

## Pense-betes

- **Definizione fondamentale**: Agent = Model + Harness. "Se non sei il modello, sei l'harness." L'harness = tutto il codice, la configurazione e la logica di esecuzione che non è il modello stesso
- **Componenti dell'harness**: system prompt, tool/Skills/MCP e le loro descrizioni, infrastruttura embedded (filesystem, sandbox, browser), logica di orchestrazione (subagent, handoff, model routing), hook/middleware per l'esecuzione deterministica (compaction, continuation, lint check)
- **Filesystem**: la primitiva più fondamentale dell'harness. Sblocca: spazio di lavoro, storage incrementale, superficie di collaborazione multi-agente/umano. Git aggiunge il versioning
- **Bash + esecuzione di codice**: un tool general-purpose piuttosto che tool preconfigurati per ogni azione. Il modello progetta i propri tool al volo tramite codice
- **Sandbox**: ambienti di esecuzione sicuri e isolati. Sbloccano la scalabilità (creati on demand, distrutti in seguito). I buoni ambienti includono tool predefiniti (runtime, git CLI, browser)
- **Memoria e ricerca**: il filesystem come primitiva di memoria (AGENTS.md caricato nel contesto all'avvio). Web Search e MCP (es. Context7) per accedere a conoscenze oltre il training cutoff
- **Context rot**: degrado delle prestazioni man mano che la finestra di contesto si riempie. Soluzioni: compaction (riepilogo intelligente), scaricamento dei risultati dei tool, Skills come progressive disclosure
- **Ralph Loop**: un pattern dell'harness che intercetta il tentativo di uscita del modello tramite un hook e reinietta il prompt originale in una finestra di contesto pulita, forzando l'agente a continuare. Il filesystem lo rende possibile perché ogni iterazione parte da un contesto nuovo ma legge lo stato dell'iterazione precedente
- **Autoverifica**: hook che eseguono una suite di test e ricanalizzano il feedback al modello con il messaggio d'errore in caso di fallimento
- **Co-evoluzione modello-harness**: i prodotti agentici (Claude Code, Codex) vengono post-addestrati con modello e harness nel loop. Questo crea overfitting (es. modificare la logica di apply_patch degrada le prestazioni). Ma l'harness migliore per il proprio task non è necessariamente quello con cui il modello è stato addestrato
- **Terminal Bench 2.0**: Opus 4.6 in Claude Code ottiene un punteggio molto inferiore rispetto a Opus 4.6 in altri harness. LangChain è passata dalla Top 30 alla Top 5 cambiando solo l'harness
- **Futuro**: alcune funzioni dell'harness verranno assorbite dai modelli, ma l'harness engineering resterà utile perché costruisce sistemi attorno all'intelligenza del modello, non solo patch per le sue carenze
- **deepagents**: la libreria di LangChain per migliorare la costruzione degli harness. Problemi aperti: orchestrare centinaia di agenti in parallelo, agenti che analizzano le proprie trace, harness che assemblano dinamicamente i tool giusti just-in-time

## RésuméDe400mots

Vivek Trivedy di LangChain propone una definizione strutturata dell'agent harness: Agent = Model + Harness. L'harness comprende tutto il codice, la configurazione e la logica di esecuzione che non è il modello stesso, inclusi i system prompt, i tool e MCP, l'infrastruttura embedded, la logica di orchestrazione e gli hook deterministici.

L'articolo deriva ciascuna componente dell'harness dai comportamenti desiderati che i modelli non possono fornire nativamente. Il **filesystem** viene identificato come la primitiva più fondamentale: offre uno spazio di lavoro, uno storage incrementale e una superficie di collaborazione tra agenti e umani. **Bash e l'esecuzione di codice** forniscono un tool general-purpose che permette al modello di progettare i propri tool al volo. I **sandbox** offrono ambienti di esecuzione sicuri e scalabili con tool predefiniti preinstallati.

Per la **memoria**, il filesystem funge da primitiva centrale tramite file standard come AGENTS.md, caricati nel contesto all'avvio e aggiornati tra una sessione e l'altra. La ricerca web e i tool MCP (come Context7) offrono accesso a conoscenze oltre il training cutoff.

L'articolo identifica il **context rot** come una sfida importante: le prestazioni si degradano man mano che la finestra di contesto si riempie. Le soluzioni includono la compaction (riepilogo intelligente del contesto), lo scaricamento dei risultati voluminosi dei tool sul filesystem e le Skills come meccanismo di progressive disclosure.

Per l'**esecuzione di lunga durata**, le primitive precedenti si combinano tra loro. Il **Ralph Loop** è un pattern che intercetta il tentativo del modello di uscire e reinietta il prompt in un contesto pulito, forzando la continuazione del lavoro. Il planning e l'autoverifica (test + un ciclo di correzione) mantengono l'agente sulla traiettoria corretta.

L'articolo esplora la **co-evoluzione modello-harness**: i prodotti agentici come Claude Code e Codex vengono post-addestrati insieme al proprio harness, creando un accoppiamento (modificare la logica di un tool può degradare le prestazioni). Tuttavia, l'harness migliore per un determinato task non è necessariamente quello usato per l'addestramento — LangChain è passata dalla Top 30 alla Top 5 su Terminal Bench 2.0 cambiando solo l'harness.

In conclusione, anche se alcune funzioni dell'harness verranno assorbite dai modelli, l'harness engineering resterà rilevante perché costruisce sistemi attorno all'intelligenza del modello. LangChain sta sviluppando deepagents ed esplora l'orchestrazione massiva di agenti, l'autoanalisi delle trace e l'assemblaggio dinamico just-in-time del contesto.

## GrapheDeConnaissance

- Vivek Trivedy —publie→ The Anatomy of an Agent Harness (DOCUMENT, 0.99)
- Vivek Trivedy —travaille_chez→ LangChain (ORGANISATION, 0.95)
- LangChain —a_créé→ deepagents (TECHNOLOGIE, 0.95)
- LangChain —mesure→ passage du Top 30 au Top 5 sur Terminal Bench 2.0 en changeant uniquement le harnais (MESURE, 0.92)
- Harnais d'agent —est_instance_de→ Tout ce qui n'est pas le modèle dans un agent (CONCEPT, 0.98)
- Système de fichiers —est_instance_de→ Primitive la plus fondamentale du harnais (CONCEPT, 0.9)
- Ralph Loop —utilise→ Interception de la tentative de sortie du modèle (CONCEPT, 0.88)
- Context Rot —réduit→ Performance de l'agent (CONCEPT, 0.92)
- Compaction —résout→ Context Rot (CONCEPT, 0.9)
- Claude Code —est_basé_sur→ Post-entraînement avec harnais dans la boucle (CONCEPT, 0.85)
- Codex —est_basé_sur→ Post-entraînement avec harnais dans la boucle (CONCEPT, 0.85)
- Opus 4.6 —mesure→ scores très différents selon le harnais utilisé (Terminal Bench 2.0) (MESURE, 0.88)

---
Canonical: https://www.thekb.eu/it/fiches/trivedy-langchain-anatomy-agent-harness-2026-03-10/
