# lancemartin-anthropic-prompt-auto-caching-claude-2026-02

## Veille

Auto-caching en prompts de Claude: mecanismo técnico, API cache_control, ahorro del 90% en tokens, diseño cache-friendly

## Titre Article

Prompt auto-caching with Claude

## Date

2026-02

## URL

https://x.com/RLanceMartin/status/2024573404888911886

## Keywords

prompt caching, auto-caching, cache_control, ephemeral, cached tokens, hash prefix, cache hit, cache miss, LLM inference, prefill, decode, vLLM, SGLang, Claude messages API, stateless, agents, token cost, latency, breakpoint

## Authors

Lance Martin (@RLanceMartin, Anthropic)

## Ton

**Perfil**: Perspectiva de un developer advocate en Anthropic, registro técnico y pedagógico, nivel intermedio a avanzado

**Descripción**: Lance Martin adopta un tono explicativo y progresivo, partiendo del "por qué" (los agentes vuelven a pagar todo el contexto en cada turno) para llegar al "cómo" (mecanismo de hash criptográfico, prefill/decode). El estilo es el de un tutorial técnico bien estructurado con ejemplos de código JSON intercalados. El autor cita activamente a otros contribuyentes (@trq212 para Claude Code, @peakji de Manus, @sankalp, @kipply), creando un efecto de comunidad de expertos. El público objetivo son los desarrolladores que usan la API de Claude y quieren optimizar el costo y la latencia.

## Pense-betes

- **Ahorro masivo**: Los tokens en caché cuestan el 10% del precio de los tokens sin caché. Sin caché, se paga por toda la ventana de contexto en cada turno del agente.
- **API stateless**: La API de mensajes de Claude no recuerda las acciones pasadas. El harness del agente debe reempaquetar en cada turno: nuevo contexto + acciones pasadas + descripciones de herramientas + instrucciones generales. La mayor parte del contexto es idéntica de un turno a otro.
- **Mecanismo técnico**: El punto de ruptura `cache_control` es un "punto de escritura" que crea un hash criptográfico de todos los bloques hasta ese punto, delimitado al espacio de trabajo. En la siguiente solicitud, Claude busca hacia atrás (máx. 20 bloques) para encontrar una coincidencia de hash. Un solo carácter de diferencia = cache miss.
- **Auto-caching (novedad)**: Nuevo parámetro único `cache_control: {"type": "ephemeral"}` a nivel de la solicitud (no a nivel de bloque). El punto de ruptura se desplaza automáticamente al último bloque cacheable. Ya no es necesario mover manualmente el punto de ruptura.
- **Compatible con el caché a nivel de bloque**: El auto-caching funciona además del caché bloque por bloque (por ejemplo, un punto de ruptura fijo en el system prompt).
- **Cita de @peakji (Manus)**: La tasa de aciertos de caché es "la métrica más importante" para un agente de IA en producción.
- **Dos fases de la inferencia LLM**: (1) Prefill = procesamiento del prompt, (2) Decode = generación de tokens de salida. El caché evita rehacer el prefill para un contexto ya visto.
- **Riesgo de romper el caché**: Modificar el historial de la conversación puede romper el caché. Remite a las lecciones de @trq212 sobre el diseño cache-friendly.
- **Complementario al artículo de @trq212**: Este artículo explica el "qué/por qué/cómo" técnico del caché, mientras que @trq212 detalla las lecciones prácticas de Claude Code (plan mode, compaction, tool search).

## RésuméDe400mots

Lance Martin, developer advocate en Anthropic, presenta el mecanismo de caché de prompts para la API de Claude y anuncia la nueva función de auto-caching que simplifica considerablemente su uso. Los tokens que utilizan la caché cuestan solo el 10% del precio normal, lo que representa un ahorro crítico para las aplicaciones agénticas.

El problema fundamental es que la API de mensajes de Claude es **stateless**: no conserva nada entre llamadas. Un agente que ejecuta acciones en bucle debe reempaquetar, en cada turno, el nuevo contexto junto con el historial de acciones, las descripciones de herramientas y las instrucciones generales. Sin caché, se paga el precio completo de toda la ventana de contexto en cada turno, aunque la mayor parte del contenido sea idéntica.

El caché de prompts resuelve este problema explotando las dos fases de la inferencia LLM: **prefill** (procesamiento del prompt) y **decode** (generación). El cálculo de prefill puede realizarse una sola vez, guardarse y luego reutilizarse si parte del prompt futuro es idéntica. Esto es lo que hacen frameworks como vLLM y SGLang.

Técnicamente, el caché utiliza un parámetro `cache_control` que actúa como un punto de ruptura. Este punto de ruptura crea un **hash criptográfico** de todos los bloques de contenido hasta ese punto, delimitado al espacio de trabajo del usuario. En las solicitudes posteriores, Claude busca hacia atrás (hasta 20 bloques) para encontrar una coincidencia. La coincidencia debe ser exacta: un solo carácter de diferencia produce un hash distinto y un cache miss.

La gran novedad es el **auto-caching**: un único parámetro `cache_control: {"type": "ephemeral"}` colocado a nivel de la solicitud (en lugar de en cada bloque) hace que el punto de ruptura se desplace automáticamente al último bloque cacheable. A medida que la conversación se alarga, el punto de ruptura sigue automáticamente. Esta función sigue siendo compatible con el caché bloque por bloque para los casos en que se desea fijar puntos de ruptura específicos (por ejemplo, en el system prompt).

Martin cita a @peakji de Manus, quien considera que la tasa de aciertos de caché es "la métrica más importante para un agente de IA en producción", y señala el artículo complementario de @trq212, que detalla las lecciones prácticas extraídas de Claude Code: cómo estructurar el prompt para maximizar los aciertos, por qué nunca se debe cambiar de herramientas o de modelo a mitad de sesión, y cómo diseñar funciones (plan mode, compaction) respetando las restricciones del caché. Juntos, los dos artículos forman una guía completa para construir agentes optimizados para caché sobre la API de Claude.

## GrapheDeConnaissance

- Lance Martin —travaille_chez→ Anthropic (ORGANISATION, 0.98)
- Lance Martin —publie→ auto-caching (TECHNOLOGIE, 0.97)
- API Claude messages —est_instance_de→ API stateless (CONCEPT, 0.99)
- Tokens cachés —mesure→ 10% du prix des tokens non cachés (MESURE, 0.99)
- cache_control —permet→ hash cryptographique du préfixe (CONCEPT, 0.97)
- Auto-caching —améliore→ gestion des breakpoints cache (CONCEPT, 0.96)
- Auto-caching —converge_avec→ caching bloc par bloc (TECHNOLOGIE, 0.95)
- prefill et decode —fait_partie_de→ Inférence LLM (CONCEPT, 0.98)
- Prompt caching —réduit→ recalcul du prefill (CONCEPT, 0.97)
- @peakji —affirme_que→ le cache hit rate est la métrique la plus importante pour un agent en production (AFFIRMATION, 0.95)
- @peakji —travaille_chez→ Manus (ORGANISATION, 0.96)
- @trq212 —publie→ leçons pratiques cache Claude Code (DOCUMENT, 0.93)
- vLLM —utilise→ caching du prefill (CONCEPT, 0.9)
- SGLang —utilise→ caching du prefill (CONCEPT, 0.9)

---
Canonical: https://www.thekb.eu/es/fiches/lancemartin-anthropic-prompt-auto-caching-claude-2026-02/
