# gupta-token-budget-wars-marginal-token-utility-2026-05-28

## Veille

Hilo viral de X (**230.5K visualizaciones**, 28 de mayo de 2026, 1:51 AM) de **Jaya Gupta** (@JayaGup10, inversora — probablemente de Foundation Capital, autora del marco *Context Graphs*) titulado ***"Token Budget Wars"***. **Tesis central**: ***"La IA empresarial ha pasado de la adopción a la asignación"*** — la fase 1 de la IA empresarial demostró que los modelos funcionan; la fase 2 decidirá **cuánto vale ese trabajo**. La nueva moneda en la cúpula de la empresa es la **capacidad de cuantificar el ROI de la IA**: *"muéstrame el valor"*. Concepto canónico: ***utilidad marginal del token*** = *"el valor de negocio creado por cada dólar adicional de inferencia"* — el número que importa a escala, y que **la mayoría de las empresas no puede ver**. Cronología: **Claude se lanzó en noviembre de 2025**, después de que se cerraran los presupuestos anuales de 2026 → ya en el **primer trimestre**, empresas *"funcionando muy por encima de lo previsto"* → la inferencia deja de ser una partida de experimentación y se convierte en un **costo operativo recurrente**. Paso de la **experimentación (unos cientos de miles de dólares) a la infraestructura (siete cifras, más de 1 millón de dólares)**: a escala de infraestructura, **la varianza técnica produce oscilaciones materiales en el P&L — dos ejecuciones del mismo flujo de trabajo sobre la misma entrada pueden diferir entre 5 y 10 veces en costo de tokens** sin que nada se vea visiblemente roto, *"una cifra que el CFO tiene que explicarle al CEO"*. **La IA compite con la mano de obra**: 3 tipos de solicitudes presupuestarias (sustituir trabajo externalizado / sustituir trabajo interno / generar ingresos) → desplazamiento hacia el ***costo de un resultado completado*** (costo por ticket resuelto, siniestro procesado, contrato revisado, factura completada, contratación evitada, cliente retenido, dólar de ingreso movilizado). **El BPO es la referencia más fácil para comparar** (ya tiene precio por unidad completada); el trabajo interno es mucho más difícil (empleados multi-competencia, ganancias difusas, resistencia de RR. HH. a la reducción de plantilla). **Por qué es distinto del SaaS**: el SaaS aprendió a tratar el uso como indicador indirecto del valor; la IA rompe ese indicador — *"la señal y el ruido comparten la misma unidad"* (el token), *"el uso de SaaS te decía que el software había sido adoptado. El uso de IA te dice que el contador sigue corriendo. No te dice si tu empresa está funcionando de verdad."* **Tres causas de la invisibilidad de la utilidad marginal del token**: (1) ***colas de reintento*** — tokens por flujo de trabajo resuelto ≈ **T/p**; pasar de un 90% a un 70% de finalización aumenta el costo efectivo en ~**28%**, no un 20%, porque los fallos se acumulan; (2) ***inflación de contexto*** — el costo de inferencia ≈ **O(n²)** respecto a la longitud del contexto (atención), duplicar el contexto **cuadruplica** el costo de razonamiento (sobre-recuperación: 50 documentos cuando bastarían 5); (3) ***enrutamiento*** — por defecto se usa el modelo más potente (una clasificación básica ejecutada en un modelo de razonamiento complejo); a través de millones de llamadas, la diferencia entre enrutar tareas fáciles a un modelo pequeño y enviarlo todo al modelo de vanguardia = *"la diferencia entre una factura manejable y un problema de nivel de consejo de administración."* **División sectorial**: las empresas de **software** = un problema de **medición de productividad** (ya instrumentado: PR, commits, despliegues, incidentes, tiempo de ciclo, MTTR — sigue el rastro de los *"despidos por IA"*); las empresas **no-software** = un problema de **transformación** (trabajo operativo: siniestros, suscripción de pólizas, soporte, revisiones de cumplimiento, excepciones de cadena de suministro, disputas de pago — *correcto bajo auditoría, no solo correcto en promedio*). **La capa que falta = atribución de token a resultado**: una capa de conversión que vincula el gasto en inferencia → el trabajo realizado → el resultado de negocio, respondiendo a 3 preguntas (costo real incluyendo reintentos/correcciones; qué partes de la traza importaron frente al desperdicio; si el trabajo cambió el modelo operativo). ***La medición se convierte en memoria***: vincular un token a un resultado exige capturar **trazas de decisión** (lo que el agente vio, recuperó, invocó, ignoró, dónde reintentó, cuándo un humano lo anuló) — *"el razonamiento de una decisión es uno de los activos más perecederos de una empresa"* (vive en Slack, correos, llamadas de escalado, en la cabeza de las personas). Los agentes **crean** estas trazas; capturadas primero para justificar el gasto, se vuelven *"más valiosas que el informe de costos"* → un **grafo de contexto** (*"aunque estoy tan cansada de esa palabra estos días"*). **La capa de asignación es el premio**: quien posea la atribución de token a resultado toma las **decisiones de asignación** (qué flujos de trabajo merecen más cómputo, cuáles tienen un tope, cuáles pasan a modelos más baratos, cuáles siguen siendo humanos, cuáles sustituyen al BPO). Las empresas no harán esto por sí solas — lo **comprarán como una transformación** (manual del Fortune 500: exalumnos de McKinsey + Palantir y un CEO que impulsa desde arriba, al estilo de la transformación ERP/BI/digital, un *"programa"* con un patrocinador ejecutivo e infraestructura que se convierte en la **nueva fuente de verdad**). Enmarcado por **Charlie Munger**: *"muéstrame el incentivo y te mostraré el resultado."* Subtesis organizativa: el instinto ejecutivo de décadas de que *equipos grandes = trabajos/alcance/poder grandes* → una vez que la inteligencia se convierte en el **recurso escaso**, el nuevo indicador es *"cuánta de ella estás orquestando."* Relevancia directa para el **posicionamiento de Cost Optimization / FinOps agéntico**: confirma empíricamente las palancas (enrutamiento de modelos, caché de prompts, higiene de contexto, subagentes) y desplaza el KPI hacia el **costo por resultado completado**. Fuerte convergencia con el *cross-system labor* de Bain (foso de datos de ejecución, Cursor), el *No AI jobpocalypse* de Ng (precios anclados al salario del empleado sustituido), el ROI de DORA (costo por función), Mensch/Mistral (electrón→token), Ensarguet (economía del cómputo), *Context Graphs* de Foundation Capital (trazas de decisión, misma autora), *Token Burning* de Wescale, BFM/Girard (token = combustible de valor).

## Titre Article

Token Budget Wars

## Date

2026-05-28

## URL

https://x.com/JayaGup10/status/2059784669382791653

## Keywords

Token Budget Wars, utilidad marginal del token, atribución de token a resultado, de la adopción a la asignación, capa de asignación, costo por resultado completado, costo de un resultado completado, colas de reintento, inflación de contexto, enrutamiento de modelos, enrutamiento Haiku Sonnet Opus, caché de prompts, higiene de contexto, cuantificación del ROI de la IA, muéstrame el valor, costo operativo recurrente de inferencia, de la experimentación a la infraestructura, siete cifras, varianza técnica 5-10x costo de tokens, el gasto en IA compite con la mano de obra, referencia BPO, externalización de procesos de negocio, costo por ticket resuelto siniestro procesado contrato revisado, contratación evitada cliente retenido, uso de SaaS como indicador de valor, la señal y el ruido comparten la misma unidad, ¿tu empresa está funcionando de verdad?, economía de reintentos T sobre p, tasa de finalización del 90 al 70 por ciento, 28 por ciento, O(n²) longitud de contexto de la atención, recuperación sobreabastecida, modelo de vanguardia sobredimensionado, problema de medición de productividad en software, problema de transformación en no-software, despidos por IA, PR commits despliegues incidentes tiempo de ciclo MTTR, siniestros suscripción de pólizas revisiones de cumplimiento excepciones de cadena de suministro disputas de pago, correcto bajo auditoría, trazas de decisión, la medición se convierte en memoria, razonamiento de decisión activo perecedero, sistemas de registro el qué no el por qué, grafo de contexto, decisiones de asignación, cómputo con tope, programa de transformación, manual del Fortune 500, McKinsey Palantir CEO desde arriba, transformación ERP BI digital, nueva fuente de verdad, inteligencia recurso escaso, orquestación de inteligencia, equipos grandes trabajos grandes, Charlie Munger muéstrame el incentivo, Jaya Gupta, Foundation Capital, tokenmaxxing, metamates, CFO CEO problema de nivel de consejo de administración, FinOps agéntico, TCO costo por función

## Authors

**Jaya Gupta** (@JayaGup10) — investisseuse / VC. Très probablement **Foundation Capital** (le thread s'auto-réfère au cadre ***Context Graphs*** — *« ahem, context graph, although I am so tired of that word these days »* — concept porté par Foundation Capital, cf. fiche `bain-100b-saas-opportunity` qui cite *Foundation Capital — Context Graphs trillion-dollar opportunity, 2025-12-22*). Thread publié sur X le **28 mai 2026 à 1h51**, **230,5K vues**, format essai long en un seul post. Une réponse notable de **@tuning_engines** (*« DevSecFinOps for the Agentic Era »*) : *« Tokens will basically have to be managed like headcount […] model hierarchies too »*.

## Ton

**Perfil**: Un ensayo-tesis de inversora dirigido a fundadores, CFOs/CEOs, CIOs y operadores de IA empresarial. Perspectiva narrativa discreta en primera persona, registro de **analista de VC**, nivel técnico **medio-alto** (asume *O(n²)*, colas de reintento, two-tower, pero se mantiene legible para un tomador de decisiones). Formato de hilo largo de X (una sola publicación densa, ~1.200 palabras), estructurado con subtítulos internos (*Por qué esto es distinto del SaaS*, *Por qué es difícil ver la utilidad marginal del token*, *La medición se convierte en memoria*, *La capa de asignación es el premio*).

**Estilo**: Prosa de VC afilada al estilo de un memorando de inversión — afirmaciones centrales planteadas en una frase y luego desarrolladas, una mezcla de **rigor económico** (fórmulas como *T/p*, *O(n²)*, rangos numéricos de 5-10×, 28%) y **registro cultural de Silicon Valley/Meta** (*tokenmaxxing*, *#metamates*, *#bearish* Jim Cramer/CNBC, *pausas de TikTok a la hora de comer*, *si tu empresa está funcionando de verdad*). Autoironía respecto a la jerga (*"grafo de contexto, aunque estoy tan cansada de esa palabra estos días"*). Cierra con una cita totémica (Munger) — firma característica del memorando de VC. Tono **prescriptivo sin ser activista**: no se vende ningún producto de forma explícita, pero sí una tesis de mercado ("la capa de asignación es el premio") que esboza implícitamente una categoría de startups que merece financiación.

**Aforismos clave**:
- ***"La IA empresarial ha pasado de la adopción a la asignación."*** (tesis central).
- ***"Utilidad marginal del token: el valor de negocio creado por cada dólar adicional de inferencia."*** (concepto canónico).
- ***"La señal y el ruido comparten la misma unidad."*** (por qué el SaaS ya no aplica).
- ***"El uso de SaaS te decía que el software había sido adoptado. El uso de IA te dice que el contador sigue corriendo. No te dice si tu empresa está funcionando de verdad."***
- ***"La medición se convierte en memoria."*** (trazas de decisión → grafo de contexto).
- ***"La capa de asignación es el premio."*** (la capa que toma las decisiones de asignación).
- ***"Muéstrame el incentivo y te mostraré el resultado."*** (Charlie Munger, cierre).

**Metáforas desarrolladas**:
- ***El contador sigue corriendo*** — la inferencia como el taxímetro en marcha: el uso ya no demuestra valor, demuestra que el gasto sigue corriendo. (Un eco directo de la metáfora del *taxi sin combustible* de Girard/BFM.)
- ***¿Tu empresa está funcionando de verdad?*** — argot para "esto realmente produce algo": dos facturas de tokens idénticas pueden cubrir dos operaciones radicalmente distintas (una convierte, la otra paga el *desperdicio*).
- ***Token budget wars*** como **guerra interna de asignación** — la batalla por la propiedad del token choca con el instinto ejecutivo de décadas (tamaño del equipo = poder); el nuevo indicador = "cuánta inteligencia estás orquestando."
- ***Tokens gestionados como plantilla*** (recogido en una respuesta) — los tokens se convierten en un recurso que gestionar como ETC, con jerarquías de modelos.

**Postura epistémica**: **análisis de mercado + marco económico** que postula una categoría de producto emergente (*atribución de token a resultado* / *capa de asignación*); una mezcla de modelos formales (economía de reintentos, escalado de la atención) y observación de campo (primer trimestre de 2026 muy por encima de lo previsto). Franca respecto a la jerga que ella misma ayudó a popularizar (grafo de contexto).

**Autoridad**: construida a partir de (a) el **punto de vista de inversora** que observa múltiples empresas a escala, (b) la **autoría del marco Context Graphs** (autorreferencia), (c) la **precisión de los modelos** (T/p, O(n²)), (d) el **momento oportuno** (28 de mayo de 2026, justo después del cambio presupuestario del primer trimestre), (e) la **viralidad** (230.5K visualizaciones) que valida la resonancia del tema entre los operadores.

## Pense-betes

- **Fecha / fuente**: **28 de mayo de 2026** (1:51 AM), hilo de X @JayaGup10, **230.5K visualizaciones**. Formato de ensayo largo en una sola publicación.
- **Autora**: **Jaya Gupta**, inversora (probablemente de **Foundation Capital** — autora del marco *Context Graphs*, autocitado).
- **Tesis central**: ***"La IA empresarial ha pasado de la adopción a la asignación"*** — fase 1: los modelos funcionan; fase 2: **cuánto vale ese trabajo**. ### El concepto central — utilidad marginal del token > ***"el valor de negocio creado por cada dólar adicional de inferencia. Es el número que importa a escala, y el número que la mayoría de las empresas no puede ver."***
- Es la **derivada** del ROI: no el costo total, sino el **valor del dólar marginal de inferencia**.
- Invisible porque **la utilidad del token no se cuantifica**: la factura no dice si el gasto sustituyó trabajo, generó ingresos, redujo riesgo, aceleró un flujo de trabajo… o simplemente financió a ingenieros haciendo *tokenmaxxing* en la clasificación. ### Cronología del cambio | Momento | Hecho | |--------|------| | **Nov. 2025** | Claude se lanzó **después** de que se cerraran los presupuestos anuales de 2026 | | **T1 2026** | Empresas *"funcionando muy por encima de lo previsto"* | | Umbral de **~unos cientos de miles de $** | Todavía experimentación | | Umbral de **siete cifras (más de 1 M$)** | Se convierte en **infraestructura** → oscilaciones materiales en el P&L |
- **Varianza técnica canónica**: *"dos ejecuciones del mismo flujo de trabajo sobre la misma entrada pueden diferir en costo de tokens entre 5 y 10 veces sin que nada se vea visiblemente roto"* → a escala de infraestructura, *"una cifra que el CFO tiene que explicarle al CEO."* ### La IA compite con la mano de obra (no con el SaaS)
- **3 tipos de solicitudes presupuestarias**: sustituir trabajo **externalizado** / sustituir trabajo **interno** / generar **ingresos**.
- Cambio de unidad: del token al ***costo de un resultado completado*** → costo por **ticket resuelto, siniestro procesado, contrato revisado, factura completada, contratación evitada, cliente retenido, dólar de ingreso movilizado**.
- **BPO = la referencia más fácil** (ya tiene precio por unidad completada: precio por ticket/siniestro/factura/revisión). El trabajo **interno** = mucho más difícil (empleados multi-competencia, ganancias difusas = contratación/capacidad evitada, resistencia de RR. HH.).
- ⚠️ Trampa: *"un siniestro que requiere tres reintentos, corrección humana y un modelo de vanguardia puede resultar más caro que la mano de obra externalizada que se suponía debía sustituir."* ### Por qué el SaaS ya no aplica > ***"La señal y el ruido comparten la misma unidad."*** El token (unidad de facturación) es **estable**, pero el trabajo que representa **no lo es**. > ***"El uso de SaaS te decía que el software había sido adoptado. El uso de IA te dice que el contador sigue corriendo. No te dice si tu empresa está funcionando de verdad."***
- ### Las 3 causas de la invisibilidad — directamente accionables (FinOps) | # | Causa | Mecanismo | Palanca | |---|-------|-----------|--------| | 1 | **Colas de reintento** | tokens/flujo de trabajo resuelto ≈ **T/p**; finalización 90%→70% = **+~28%** de costo (no 20%, los fallos se acumulan) | mejorar la fiabilidad de finalización en el primer intento | | 2 | **Inflación de contexto** | costo ≈ **O(n²)** respecto a la longitud del contexto; duplicar el contexto **multiplica por 4** el costo de razonamiento; sobre-recuperación (50 documentos en lugar de 5, hilos de correo enteros, historial obsoleto) | **higiene de contexto**, recuperación específica | | 3 | **Enrutamiento** | por defecto = el modelo más potente; una clasificación básica ejecutada en un modelo de razonamiento complejo | **enrutamiento de modelos** (modelo pequeño para tareas fáciles) = *"factura manejable frente a problema de nivel de consejo de administración"* | → **Se corresponde exactamente** con las palancas del bloque «Cost Optimization» de la sesión matinal de Claude Code (enrutamiento Haiku/Sonnet/Opus, caché de prompts, higiene de contexto, subagentes).
- ### División sectorial | | **Software** | **No-software** | |--|-------------|------------------| | Naturaleza del problema | **Medición de productividad** | **Transformación** | | Por qué | Trabajo ya instrumentado (PR, commits, despliegues, incidentes, tiempo de ciclo, MTTR) | Trabajo operativo (siniestros, suscripción de pólizas, soporte, cumplimiento, cadena de suministro, disputas de pago) | | Requisito | *correcto en promedio* | ***correcto bajo auditoría*** | | Síntoma | sigue el rastro de los *"despidos por IA"* | unidad de trabajo ≠ unidad de costo ≠ misma organización | ### La capa que falta — atribución de token a resultado
- **Capa de conversión** que vincula: gasto en inferencia → trabajo realizado → resultado de negocio.
- **3 preguntas**: (1) ¿costo real **incluyendo reintentos/correcciones**? (2) ¿qué partes de la traza **importaron** frente al **desperdicio**? (3) ¿el trabajo **cambió el modelo operativo** (menos tickets/agente, ciclos de siniestros más cortos, partida de BPO reducida, contratación retrasada)?
- Atribución **en el lenguaje del negocio**: no *"este flujo de trabajo costó 2,13 $"* sino *"esta clase de siniestros es más barata con agentes que con BPO, excepto cuando la póliza requiere documentos de excepción, en cuyo caso la cola de reintentos destruye la economía."* ### La medición se convierte en memoria > ***"El razonamiento de una decisión es uno de los activos más perecederos de una empresa"*** — vive en hilos de Slack, cadenas de correo, llamadas de escalado y en la cabeza de las personas (que se van).
- Los sistemas de registro capturan **qué** ocurrió, rara vez **por qué** (un CRM dice que un trato se cayó, no el juicio no escrito detrás de la previsión).
- **Los agentes crean trazas** (recuperación, invocación de herramientas, reintento, escalado, corrección humana, decisión final).
- Capturadas primero para **justificar el gasto**, se vuelven *"más valiosas que el informe de costos"* → un **grafo de contexto** (jerga de la que la autora dice estar *"tan cansada"*). ### La capa de asignación es el premio
- Quien posea la atribución de token a resultado toma las **decisiones de asignación**: qué flujos de trabajo → reciben más cómputo / tienen un tope / pasan a modelos más baratos / siguen siendo humanos / sustituyen al BPO.
- *"Y una vez que tomas esas decisiones, controlas hacia dónde va el gasto en IA dentro de la empresa y ganas la confianza para asignarlo."*
- **Se compra como una transformación** (manual del Fortune 500): exalumnos de McKinsey + Palantir y un CEO que impulsa desde arriba; llega como una transformación ERP/BI/digital, un *"programa"* con un patrocinador ejecutivo + infraestructura = **nueva fuente de verdad**.
- Los fundadores capaces de hacer esto serán *"personas distintas del arquetipo clásico."* ### Para aprovechar en
- **Bloque «Cost Optimization» (sesión matinal de Claude Code)**: cita canónica para el paso de *costo por token → costo por resultado completado*; las 3 causas (reintento/contexto/enrutamiento) estructuran la sección de palancas; *"el contador sigue corriendo"* y *"¿tu empresa está funcionando de verdad?"* = frases de impacto para los tomadores de decisiones.
- **Oferta de consultoría de FinOps agéntico**: la capa de *atribución de token a resultado* es una **categoría emergente de producto/consultoría** — posible posicionamiento para SFEIR (instrumentar la traza, vincularla al P&L).
- **Narrativa CFO/CEO**: *"una cifra que el CFO tiene que explicarle al CEO"* — encuadra exactamente la conversación de presupuesto de IA de 2026.
- **Argumento de trazas de decisión / grafo de contexto**: convergencia con Foundation Capital (misma autora), Bain (foso de datos de ejecución), Talisman (ontología/gobernanza) — *la medición se convierte en memoria* = la tesis del foso de datos de 2026. ### Conexiones con el corpus de vigilancia
- **Bain — cross-system labor** (2026-05): el mismo maridaje de **datos de ejecución = foso** + **costo de resultado completado**; Bain dimensiona el mercado, Gupta dimensiona el **problema de medición** que lo desbloquea. Ambos citan la IA como **sustitución de costo laboral**.
- **Ng — No AI jobpocalypse** (2026-05-08): Ng describe el **poder de fijación de precios** (los proveedores anclan el precio al **salario del empleado sustituido**); Gupta describe la **contraparte del lado del comprador** (la IA se compara con el BPO/salario). Dos caras de la misma dinámica de *el gasto en IA compite con la mano de obra*.
- **ROI de DORA** (2026-04-21): *"no medimos la IA por el código que escribe, sino por los cuellos de botella que despeja"* + *"el código es un pasivo"* → Gupta = la versión a **nivel de token** del mismo rechazo a los indicadores de actividad indirectos.
- **Mensch / Mistral** (2026-05-13): *"estamos convirtiendo electricidad en inteligencia, en generación de tokens"* — una economía electrón→token del lado de la oferta; Gupta = una economía token→resultado del lado de la demanda.
- **Ensarguet — Economía del cómputo** (2026-03-11): el *momento del kilovatio-hora*, el fin del cerebro facturado por hora; Gupta extiende esto en el lado del **valor unitario del cómputo**.
- **Foundation Capital — Context Graphs** (2025-12-22, **misma autora**): *la medición se convierte en memoria* = un puente explícito hacia el marco Context Graphs; las trazas de decisión = el nuevo sistema de registro.
- **Wescale — Augmented Software Factory** (2026-05-03): el concepto de *Token Burning* + Agent Manager = la contraparte operativa francesa del *desperdicio* de Gupta.
- **BFM / Girard** (2026-05-05): *"token = combustible de valor,"* bonificaciones de NVIDIA pagadas en tokens, la metáfora del taxi — convergencia directa con *el contador sigue corriendo*.
- **@tuning_engines** (respuesta — *"DevSecFinOps for the Agentic Era"*): una extensión de la tesis a nivel de **gobernanza/organización**. Tres ideas: (1) ***"los tokens básicamente tendrán que gestionarse como la plantilla"*** — el token se convierte en un recurso gestionado como una plantilla de personal (presupuesto, asignación, justificación); (2) ***jerarquías de modelos*** — *"qué modelo reporta a qué usuario (es decir, qué usuario puede usar qué modelo, en esencia)"* = **control de acceso basado en roles (RBAC) sobre los modelos**: quién puede usar Opus frente a Sonnet frente a Haiku; (3) *"muchas técnicas organizativas de gestión de ETC también tendrán que aplicarse a los tokens"* — importar técnicas de RR. HH. de **gestión de la fuerza laboral** (planificación de capacidad, asignación, revisión) a la gestión de tokens. → Un puente directo hacia el bloque matinal de **Governance** (cuotas/permisos por usuario y por modelo) y convergencia con **Uber Engineering** (identidad de agente, *qué puede hacer cada agente*).

## RésuméDe400mots

El 28 de mayo de 2026, **Jaya Gupta** (inversora, probablemente de Foundation Capital) publicó un hilo-ensayo viral en X (230.5K visualizaciones): ***"Token Budget Wars"***. **Tesis central**: *"La IA empresarial ha pasado de la adopción a la asignación."* La fase 1 demostró que los modelos funcionan; la fase 2 decidirá **cuánto vale ese trabajo**. La nueva moneda en la cúpula de las empresas es la **cuantificación del ROI de la IA** — *"muéstrame el valor."*

Concepto canónico: ***utilidad marginal del token*** = *"el valor de negocio creado por cada dólar adicional de inferencia"* — el número que importa a escala, **invisible** para la mayoría de las empresas porque la factura no dice si el gasto sustituyó trabajo, generó ingresos o financió *tokenmaxxing*. Cronología: **Claude se lanzó en noviembre de 2025**, después de que se cerraran los presupuestos de 2026; ya en el **primer trimestre**, empresas *"muy por encima de lo previsto."* Paso de la **experimentación (100 mil dólares) a la infraestructura (más de 1 millón de dólares)**: *"dos ejecuciones del mismo flujo de trabajo sobre la misma entrada pueden diferir en costo de tokens entre 5 y 10 veces"* — *"una cifra que el CFO tiene que explicarle al CEO."*

**La IA compite con la mano de obra**: la unidad pasa del token al ***costo de un resultado completado*** (por ticket resuelto, siniestro procesado, contrato revisado, contratación evitada…). El **BPO** es la referencia más fácil (ya tiene precio por unidad completada). **Por qué el SaaS ya no aplica**: *"la señal y el ruido comparten la misma unidad"*; *"el uso de SaaS te decía que el software había sido adoptado. El uso de IA te dice que el contador sigue corriendo. No te dice si tu empresa está funcionando de verdad."*

**Tres causas de la invisibilidad**: (1) **colas de reintento** — tokens/resolución ≈ T/p, 90%→70% = +~28%; (2) **inflación de contexto** — costo ≈ O(n²), duplicar el contexto ×4 el razonamiento; (3) **enrutamiento** — enviarlo todo al modelo de vanguardia = *"problema de nivel de consejo de administración."* **División**: software = un problema de **medición de productividad**; no-software = un problema de **transformación** (*correcto bajo auditoría*).

**Capa que falta**: ***atribución de token a resultado*** que vincula inferencia → trabajo → resultado. ***La medición se convierte en memoria***: los agentes crean **trazas de decisión** (*"el razonamiento de una decisión es uno de los activos más perecederos"*) que se vuelven *"más valiosas que el informe de costos"* → un **grafo de contexto**. **La capa de asignación es el premio**: quien la posea toma las *decisiones de asignación* y controla hacia dónde va el gasto en IA — se compra como una **transformación** (McKinsey + Palantir + un CEO que impulsa desde arriba, al estilo ERP/BI). Cierra con Munger: *"muéstrame el incentivo y te mostraré el resultado."*

## GrapheDeConnaissance

- Jaya Gupta —publie→ Token Budget Wars (DOCUMENT, 0.98)
- Jaya Gupta —travaille_chez→ Foundation Capital (ORGANISATION, 0.75)
- Jaya Gupta —affirme_que→ « Enterprise AI has moved from adoption to allocation » (CITATION, 0.96)
- Marginal token utility —est_instance_de→ valeur business créée par dollar marginal d'inférence (CONCEPT, 0.97)
- Jaya Gupta —affirme_que→ Claude a été shippé en novembre 2025, après le lock des budgets annuels 2026 (AFFIRMATION, 0.93)
- Inférence —est_instance_de→ coût opérationnel récurrent (CONCEPT, 0.95)
- Jaya Gupta —mesure→ variance de 5-10× en coût de tokens entre deux exécutions du même workflow sur le même input (MESURE, 0.94)
- AI spend —concurrence→ le travail (labor) (CONCEPT, 0.95)
- Cost of completed outcome —remplace→ coût du token comme unité pertinente (CONCEPT, 0.94)
- BPO —est_instance_de→ baseline benchmarkable (unités complétées) (CONCEPT, 0.93)
- Jaya Gupta —affirme_que→ « the signal and the noise share the same unit » (CITATION, 0.95)
- Jaya Gupta —mesure→ retry tails : coût par résolution ≈ T/p ; 90%→70% de complétion = +~28% de coût (MESURE, 0.92)
- Context inflation —est_basé_sur→ scaling O(n²) de l'attention en longueur de contexte (CONCEPT, 0.92)
- Model routing —permet→ facture gérable (vs board-level problem) (CONCEPT, 0.93)
- Problème de mesure de productivité —s_applique_à→ entreprises software (CONCEPT, 0.9)
- Problème de transformation —s_applique_à→ entreprises non-software (CONCEPT, 0.9)
- Token-to-outcome attribution —est_instance_de→ la couche manquante (CONCEPT, 0.96)
- Agents —permet→ decision traces (CONCEPT, 0.95)
- Jaya Gupta —affirme_que→ les decision traces deviennent un context graph plus précieux que le cost report (AFFIRMATION, 0.93)
- Jaya Gupta —affirme_que→ « the allocation layer is the prize » (CITATION, 0.94)
- Jaya Gupta —prédit→ le token-to-outcome attribution sera acheté comme une transformation (McKinsey + Palantir + top-down CEO) (AFFIRMATION, 0.91)
- Charlie Munger —affirme_que→ « show me the incentive and I will show you the outcome » (CITATION, 0.96)
- @tuning_engines —affirme_que→ « tokens will basically have to be managed like headcount » (CITATION, 0.95)
- Model hierarchies (gouvernance tokens) —permet→ contrôle d'accès par rôle sur les modèles (quel utilisateur peut utiliser quel modèle) (CONCEPT, 0.92)
- Techniques de gestion FTE —s_applique_à→ la gestion des tokens (CONCEPT, 0.91)
- Token Budget Wars —converge_avec→ Bain cross-system labor, Ng pricing power, DORA ROI, Foundation Capital Context Graphs (DOCUMENT, 0.9)

---
Canonical: https://www.thekb.eu/es/fiches/gupta-token-budget-wars-marginal-token-utility-2026-05-28/
