# gupta-token-budget-wars-marginal-token-utility-2026-05-28

## Veille

Thread X virale (**230.5K visualizzazioni**, 28 maggio 2026, 1:51 AM) di **Jaya Gupta** (@JayaGup10, investitrice — probabilmente Foundation Capital, autrice del framework *Context Graphs*) intitolato ***"Token Budget Wars"***. **Tesi cardine**: ***"Enterprise AI has moved from adoption to allocation"*** — la fase 1 dell'IA enterprise ha dimostrato che i modelli funzionano; la fase 2 deciderà **quanto di quel lavoro vale la pena**. La nuova valuta al vertice dell'impresa è la **capacità di quantificare il ROI dell'IA**: *"show me the value"*. Concetto canonico: ***marginal token utility*** = *"the business value created by each additional dollar of inference"* — il numero che conta su larga scala, e che **la maggior parte delle aziende non riesce a vedere**. Cronologia: **Claude è stato rilasciato a novembre 2025**, dopo che i budget annuali 2026 erano già bloccati → già nel **Q1**, aziende *"running multiples ahead of plan"* → l'inferenza smette di essere una voce di spesa sperimentale e diventa un **costo operativo ricorrente**. Passaggio da **sperimentazione (qualche centinaio di migliaia di $) → infrastruttura (sette cifre, $1M+)**: su scala infrastrutturale, **la varianza tecnica produce oscillazioni materiali di conto economico — due esecuzioni dello stesso workflow sullo stesso input possono differire di 5-10× nel costo in token** senza che nulla sembri visibilmente rotto, *"a number the CFO has to explain to the CEO"*. **L'IA compete con il lavoro**: 3 tipi di richieste di budget (sostituire lavoro esternalizzato / sostituire lavoro interno / generare ricavi) → spostamento verso il ***costo di un risultato completato*** (costo per ticket risolto, sinistro elaborato, contratto revisionato, fattura completata, assunzione evitata, cliente trattenuto, dollaro di ricavo mosso). **Il BPO = il benchmark più facile a cui confrontarsi** (già prezzato in unità completate); il lavoro interno è molto più difficile (dipendenti multi-competenza, guadagni diffusi, resistenza delle risorse umane alla riduzione dell'organico). **Perché è diverso dal SaaS**: il SaaS ha imparato a trattare l'utilizzo come proxy del valore; l'IA rompe questo proxy — *"the signal and the noise share the same unit"* (il token), *"SaaS usage told you the software had been adopted. AI usage tells you the meter is running. It doesn't tell you whether your company is cooking."* **Tre cause dell'invisibilità della marginal token utility**: (1) ***retry tails*** — token per workflow risolto ≈ **T/p**; passare dal 90% al 70% di completamento aumenta il costo effettivo di circa il **28%**, non il 20%, perché i fallimenti si compongono; (2) ***context inflation*** — il costo di inferenza è ≈ **O(n²)** rispetto alla lunghezza del contesto (attenzione), raddoppiare il contesto **quadruplica** il costo di ragionamento (over-retrieval: 50 documenti quando ne basterebbero 5); (3) ***routing*** — di default si usa il modello più potente (una classificazione di base eseguita su un modello di ragionamento complesso); su milioni di chiamate, la differenza tra instradare i compiti semplici verso un modello piccolo e inviare tutto al modello di frontiera = *"the difference between a manageable bill and a board-level problem."* **Divisione settoriale**: le aziende **software** = un problema di **misurazione della produttività** (già strumentato: PR, commit, deploy, incidenti, cycle time, MTTR — traccia gli *"AI layoffs"*); le aziende **non software** = un problema di **trasformazione** (lavoro operativo: sinistri, underwriting, supporto, revisioni di conformità, eccezioni nella supply chain, contestazioni di pagamento — *right under audit, not just right on average*). **Il livello mancante = attribuzione token-risultato**: uno strato di conversione che collega spesa di inferenza → lavoro svolto → risultato di business, rispondendo a 3 domande (costo reale includendo retry/correzioni; quali parti della traccia contavano rispetto al thrashing; il lavoro ha cambiato il modello operativo). ***La misurazione diventa memoria***: collegare un token a un risultato richiede di catturare **tracce decisionali** (cosa l'agente ha visto, recuperato, chiamato, ignorato, dove ha ritentato, quando un umano ha annullato) — *"decision rationale is one of the most perishable assets in a company"* (vive in Slack, email, chiamate di escalation, teste delle persone). Gli agenti **creano** queste tracce; catturate anzitutto per giustificare la spesa, diventano *"more valuable than the cost report"* → un **context graph** (*"although I am so tired of that word these days"*). **Il livello di allocazione è il premio**: chi possiede l'attribuzione token-risultato prende le **decisioni di allocazione** (quali workflow meritano più capacità di calcolo, quali sono limitati, quali passano a modelli più economici, quali restano umani, quali sostituiscono il BPO). Le aziende non lo faranno da sole — lo **compreranno come una trasformazione** (playbook Fortune 500: alumni di McKinsey + Palantir + CEO top-down, sul modello di ERP/BI/trasformazione digitale, un *"programma"* con uno sponsor esecutivo e un'infrastruttura che diventa la **nuova fonte di verità**). Inquadrato da **Charlie Munger**: *"show me the incentive and I will show you the outcome."* Sottotesi organizzativa: l'istinto manageriale vecchio di decenni secondo cui *grandi team = grandi incarichi/perimetro/potere* → una volta che l'intelligenza diventa la **risorsa scarsa**, il nuovo indicatore è *"how much of it you're orchestrating."* Rilevanza diretta per il **posizionamento Cost Optimization / agentic FinOps**: conferma empiricamente le leve (model routing, prompt caching, context hygiene, sub-agent) e sposta il KPI verso il **costo per risultato completato**. Forte convergenza con il *cross-system labor* di Bain (moat sui dati di esecuzione, Cursor), *No AI jobpocalypse* di Ng (pricing ancorato allo stipendio del dipendente sostituito), DORA ROI (costo per feature), Mensch/Mistral (elettrone→token), Ensarguet (economia del calcolo), *Context Graphs* di Foundation Capital (tracce decisionali, stessa autrice), *Token Burning* di Wescale, BFM/Girard (token = carburante di valore).

## Titre Article

Token Budget Wars

## Date

2026-05-28

## URL

https://x.com/JayaGup10/status/2059784669382791653

## Keywords

Token Budget Wars, marginal token utility, token-to-outcome attribution, adoption to allocation, allocation layer, cost per completed outcome, cost of a completed outcome, retry tails, context inflation, model routing, Haiku Sonnet Opus routing, prompt caching, context hygiene, AI ROI quantification, show me the value, inference recurring operating cost, experimentation to infrastructure, seven figures, technical variance 5-10x token cost, AI spend competes with labor, BPO benchmark, business process outsourcing, cost per resolved ticket processed claim reviewed contract, avoided hire retained customer, SaaS usage proxy value, signal and noise share the same unit, is your company cooking, T over p retry economics, completion rate 90 to 70 percent 28 percent, O(n²) attention context length, over-supplied retrieval, frontier model overpowered, software productivity measurement problem, non-software transformation problem, AI layoffs, PRs commits deploys incidents cycle time MTTR, claims underwriting compliance reviews supply chain exceptions payment disputes, right under audit, decision traces, measurement becomes memory, decision rationale perishable asset, systems of record what not why, context graph, allocation calls, capped compute, transformation program, Fortune 500 playbook, McKinsey Palantir top-down CEO, ERP BI digital transformation, new source of truth, intelligence scarce resource, orchestrating intelligence, big teams big jobs, Charlie Munger show me the incentive, Jaya Gupta, Foundation Capital, tokenmaxxing, metamates, CFO CEO board-level problem, agentic FinOps, TCO cost per feature

## Authors

**Jaya Gupta** (@JayaGup10) — investisseuse / VC. Très probablement **Foundation Capital** (le thread s'auto-réfère au cadre ***Context Graphs*** — *« ahem, context graph, although I am so tired of that word these days »* — concept porté par Foundation Capital, cf. fiche `bain-100b-saas-opportunity` qui cite *Foundation Capital — Context Graphs trillion-dollar opportunity, 2025-12-22*). Thread publié sur X le **28 mai 2026 à 1h51**, **230,5K vues**, format essai long en un seul post. Une réponse notable de **@tuning_engines** (*« DevSecFinOps for the Agentic Era »*) : *« Tokens will basically have to be managed like headcount […] model hierarchies too »*.

## Ton

**Profilo**: Un saggio-tesi da investitrice rivolto a founder, CFO/CEO, CIO e operatori enterprise dell'IA. Prospettiva narrativa discreta in prima persona, registro da **analista VC**, livello tecnico **medio-alto** (presuppone *O(n²)*, retry tails, two-tower, ma resta leggibile per un decision-maker). Formato thread X lungo (un unico post denso, ~1.200 parole), strutturato con sottotitoli interni (*Why this is different from SaaS*, *Why marginal token utility is hard to see*, *Measurement becomes memory*, *The allocation layer is the prize*).

**Stile**: Prosa VC incisiva in stile memo di investimento — affermazioni cardine poste in una frase e poi sviluppate, un mix di **rigore economico** (formule come *T/p*, *O(n²)*, intervalli numerici 5-10×, 28%) e **registro culturale Silicon Valley/Meta** (*tokenmaxxing*, *#metamates*, *#bearish* Jim Cramer/CNBC, *TikTok breaks at lunch*, *is your company cooking*). Autoironia sul gergo (*"context graph, although I am so tired of that word these days"*). Si chiude con una citazione totemica (Munger) — firma tipica di un memo VC. Tono **prescrittivo senza essere attivista**: nessun prodotto venduto esplicitamente, ma una tesi di mercato ("the allocation layer is the prize") che disegna implicitamente una categoria di startup meritevoli di finanziamento.

**Aforismi chiave**:
- ***"Enterprise AI has moved from adoption to allocation."*** (tesi cardine).
- ***"Marginal token utility: the business value created by each additional dollar of inference."*** (concetto canonico).
- ***"The signal and the noise share the same unit."*** (perché il SaaS non si applica più).
- ***"SaaS usage told you the software had been adopted. AI usage tells you the meter is running. It doesn't tell you whether your company is cooking."***
- ***"Measurement becomes memory."*** (tracce decisionali → context graph).
- ***"The allocation layer is the prize."*** (il livello che prende le decisioni di allocazione).
- ***"Show me the incentive and I will show you the outcome."*** (Charlie Munger, chiusura).

**Metafore elaborate**:
- ***The meter is running*** — l'inferenza come un tassametro in funzione: l'utilizzo non prova più il valore, prova che la spesa continua a correre. (Un'eco diretta della metafora del *taxi senza carburante* di Girard/BFM.)
- ***Is your company cooking*** — gergo per "questo sta effettivamente producendo qualcosa": due fatture di token identiche possono coprire due operazioni radicalmente diverse (una converte, l'altra paga il *thrash*).
- ***Token budget wars*** come **guerra di allocazione interna** — la battaglia sulla proprietà dei token si scontra con l'istinto manageriale vecchio di decenni (dimensione del team = potere); il nuovo indicatore = *"how much intelligence you're orchestrating."*
- ***Tokens managed like headcount*** (ripreso in una risposta) — i token diventano una risorsa da gestire come gli FTE, con gerarchie di modelli.

**Postura epistemica**: **analisi di mercato + framework economico** che ipotizza una categoria di prodotto emergente (*token-to-outcome attribution* / *allocation layer*); un misto di modelli formali (economia dei retry, scaling dell'attenzione) e osservazione sul campo (Q1 2026 multiples ahead of plan). Sincera riguardo al gergo che ha contribuito a popolarizzare (context graph).

**Autorevolezza**: costruita a partire da (a) il **punto di vista dell'investitrice** che osserva molteplici aziende su larga scala, (b) la **paternità del framework Context Graphs** (autoreferenza), (c) la **precisione dei modelli** (T/p, O(n²)), (d) il **tempismo** (28 maggio 2026, subito dopo lo spostamento di budget del Q1), (e) la **viralità** (230.5K visualizzazioni) che convalida la risonanza del tema presso gli operatori.

## Pense-betes

- **Data / fonte**: **28 maggio 2026** (1:51 AM), thread X @JayaGup10, **230.5K visualizzazioni**. Formato long-essay in un unico post.
- **Autrice**: **Jaya Gupta**, investitrice (probabilmente **Foundation Capital** — autrice del framework *Context Graphs*, autocitata).
- **Tesi cardine**: ***"Enterprise AI has moved from adoption to allocation"*** — fase 1: i modelli funzionano; fase 2: **quanto di quel lavoro vale la pena**. ### Il concetto centrale — marginal token utility > ***"the business value created by each additional dollar of inference. It's the number that matters at scale, and the number most companies cannot see."***
- È la **derivata** del ROI: non il costo totale, ma il **valore del dollaro marginale di inferenza**.
- Invisibile perché **l'utilità del token non è quantificata**: la fattura non dice se la spesa ha sostituito lavoro, generato ricavi, ridotto il rischio, accelerato un workflow… o semplicemente finanziato ingegneri che fanno *tokenmaxxing* sulla classifica. ### Cronologia del cambiamento | Momento | Fatto | |--------|------| | **Nov. 2025** | Claude rilasciato **dopo** che i budget annuali 2026 erano stati bloccati | | **Q1 2026** | Aziende *"running multiples ahead of plan"* | | Soglia **~qualche centinaio di migliaia di $** | Ancora sperimentazione | | Soglia **sette cifre ($1M+)** | Diventa **infrastruttura** → oscillazioni materiali di conto economico |
- **Varianza tecnica canonica**: *"two runs of the same workflow on the same input can differ in token cost by 5-10x without anything visibly going wrong"* → su scala infrastrutturale, *"a number the CFO has to explain to the CEO."* ### L'IA compete con il lavoro (non con il SaaS)
- **3 tipi di richieste di budget**: sostituire lavoro **esternalizzato** / sostituire lavoro **interno** / generare **ricavi**.
- Cambio di unità: dal token al ***costo di un risultato completato*** → costo per **ticket risolto, sinistro elaborato, contratto revisionato, fattura completata, assunzione evitata, cliente trattenuto, dollaro di ricavo mosso**.
- **Il BPO = il benchmark più facile** (già prezzato in unità completate: prezzo per ticket/sinistro/fattura/revisione). Il lavoro **interno** = molto più difficile (dipendenti multi-competenza, guadagni diffusi = assunzioni/capacità evitate, resistenza delle risorse umane).
- ⚠️ Trappola: *"a claim that requires three retries, human correction, and a frontier model may be more expensive than the outsourced labor it was supposed to replace."* ### Perché il SaaS non si applica più > ***"The signal and the noise share the same unit."*** Il token (unità di fatturazione) è **stabile**, ma il lavoro che rappresenta **non lo è**. > ***"SaaS usage told you the software had been adopted. AI usage tells you the meter is running. It doesn't tell you whether your company is cooking."*** ### Le 3 cause dell'invisibilità — direttamente attivabili (FinOps) | # | Causa | Meccanismo | Leva | |---|-------|-----------|--------| | 1 | **Retry tails** | token/workflow risolto ≈ **T/p**; completamento 90%→70% = **+~28%** di costo (non 20%, i fallimenti si compongono) | migliorare l'affidabilità del completamento al primo tentativo | | 2 | **Context inflation** | costo ≈ **O(n²)** rispetto alla lunghezza del contesto; raddoppiare il contesto **×4** il costo di ragionamento; over-retrieval (50 documenti invece di 5, thread email interi, cronologia obsoleta) | **context hygiene**, retrieval mirato | | 3 | **Routing** | default = modello più potente; classificazione di base eseguita su un modello di ragionamento complesso | **model routing** (modello piccolo per compiti semplici) = *"manageable bill vs board-level problem"* | → **Si sovrappone esattamente** alle leve dello slot "Cost Optimization" della sessione mattutina Claude Code (routing Haiku/Sonnet/Opus, prompt caching, context hygiene, sub-agent).
- ### Divisione settoriale | | **Software** | **Non-software** | |--|-------------|------------------| | Natura del problema | **Misurazione della produttività** | **Trasformazione** | | Perché | Lavoro già strumentato (PR, commit, deploy, incidenti, cycle time, MTTR) | Lavoro operativo (sinistri, underwriting, supporto, conformità, supply chain, contestazioni di pagamento) | | Requisito | *right on average* | ***right under audit*** | | Sintomo | traccia gli *"AI layoffs"* | unità di lavoro ≠ unità di costo ≠ stessa organizzazione | ### Il livello mancante — attribuzione token-risultato
- **Livello di conversione** che collega: spesa di inferenza → lavoro svolto → risultato di business.
- **3 domande**: (1) costo reale **includendo retry/correzioni**? (2) quali parti della traccia **contavano** rispetto al **thrashing**? (3) il lavoro ha **cambiato il modello operativo** (meno ticket/agente, cicli sinistri più brevi, linea BPO ridotta, assunzioni ritardate)?
- Attribuzione **nel linguaggio del business**: non *"this workflow cost $2.13"* ma *"this class of claims is cheaper with agents than BPO, except when the policy requires exception documents, in which case the retry tail destroys the economics."* ### La misurazione diventa memoria > ***"Decision rationale is one of the most perishable assets in a company"*** — vive in thread Slack, catene email, chiamate di escalation e teste delle persone (che se ne vanno).
- I sistemi di registrazione catturano **cosa** è successo, raramente **perché** (un CRM dice che un deal è slittato, non il giudizio non scritto dietro la previsione).
- **Gli agenti creano tracce** (retrieval, chiamata a tool, retry, escalation, correzione umana, decisione finale).
- Catturate anzitutto per **giustificare la spesa**, diventano *"more valuable than the cost report"* → un **context graph** (un gergo di cui l'autrice dice di essere *"so tired"*). ### Il livello di allocazione è il premio
- Chi possiede l'attribuzione token-risultato prende le **decisioni di allocazione**: quali workflow → ottengono più capacità di calcolo / sono limitati / passano a modelli più economici / restano umani / sostituiscono il BPO.
- *"And once you make those calls, you control where AI spend goes inside the enterprise and get to have the trust to allocate."*
- **Acquistato come una trasformazione** (playbook Fortune 500): alumni di McKinsey + Palantir + CEO top-down; arriva come ERP/BI/trasformazione digitale, un *"programma"* con uno sponsor esecutivo + infrastruttura = **nuova fonte di verità**.
- I fondatori capaci di farlo saranno *"different people than the classic archetype."* ### Da sfruttare per
- **Slot "Cost Optimization" (sessione mattutina Claude Code)**: citazione canonica per il passaggio da *costo del token → costo per risultato completato*; le 3 cause (retry/context/routing) strutturano la sezione delle leve; *"the meter is running"* e *"is your company cooking"* = punchline per i decision-maker.
- **Offerta di consulenza agentic FinOps**: il livello di *attribuzione token-risultato* è una **categoria emergente di prodotto/consulenza** — possibile posizionamento per SFEIR (strumentare la traccia, collegarla al conto economico).
- **Narrativa CFO/CEO**: *"a number the CFO has to explain to the CEO"* — inquadra esattamente la conversazione sul budget IA 2026.
- **Argomento tracce decisionali / context graph**: convergenza con Foundation Capital (stessa autrice), Bain (moat sui dati di esecuzione), Talisman (ontologia/governance) — *measurement becomes memory* = la tesi del data moat 2026. ### Connessioni con il corpus di veille
- **Bain — cross-system labor** (2026-05): lo stesso abbinamento tra **dati di esecuzione = moat** + **costo del risultato completato**; Bain dimensiona il mercato, Gupta dimensiona il **problema di misurazione** che lo sblocca. Entrambi citano l'IA come **sostituzione del costo del lavoro**.
- **Ng — No AI jobpocalypse** (2026-05-08): Ng descrive il **potere di pricing** (i fornitori ancorano il pricing allo **stipendio del dipendente sostituito**); Gupta descrive la **controparte lato acquirente** (l'IA viene confrontata con BPO/stipendio). Due facce dello stesso meccanismo *la spesa in IA compete con il lavoro*.
- **DORA ROI** (2026-04-21): *"we don't measure AI by code it writes but by bottlenecks it clears"* + *"code is a liability"* → Gupta = la versione **a livello di token** dello stesso rifiuto dei proxy di attività.
- **Mensch / Mistral** (2026-05-13): *"we're turning electricity into intelligence, into token generation"* — un'economia elettrone→token lato offerta; Gupta = un'economia token→risultato lato domanda.
- **Ensarguet — Economics of Computation** (2026-03-11): il *momento kilowattora*, la fine del cervello fatturato a ora; Gupta estende questo sul lato del **valore unitario del calcolo**.
- **Foundation Capital — Context Graphs** (2025-12-22, **stessa autrice**): *measurement becomes memory* = un ponte esplicito verso il framework Context Graphs; le tracce decisionali = il nuovo sistema di registrazione.
- **Wescale — Augmented Software Factory** (2026-05-03): il concetto di *Token Burning* + Agent Manager = la controparte operativa francese del *thrash* di Gupta.
- **BFM / Girard** (2026-05-05): *"token = value fuel,"* i bonus NVIDIA pagati in token, la metafora del taxi — convergenza diretta con *the meter is running*.
- **@tuning_engines** (risposta — *"DevSecFinOps for the Agentic Era"*): un'estensione **di governance/organizzativa** della tesi. Tre idee: (1) ***"Tokens will basically have to be managed like headcount"*** — il token diventa una risorsa gestita come un organico (budget, allocazione, giustificazione); (2) ***gerarchie di modelli*** — *"which model reports to which user (meaning which user can use which model in essence!)"* = **controllo degli accessi basato sui ruoli (RBAC) sui modelli**: chi è autorizzato a usare Opus vs. Sonnet vs. Haiku; (3) *"many organizational FTE management techniques will need application to the tokens as well"* — importare tecniche HR di **gestione della forza lavoro** (pianificazione della capacità, allocazione, revisione) nella gestione dei token. → Un ponte diretto verso lo slot mattutino di **Governance** (quote/permessi per utente e per modello) e convergenza con **Uber Engineering** (identità dell'agente, *quale agente può fare cosa*).

## RésuméDe400mots

Il 28 maggio 2026, **Jaya Gupta** (investitrice, probabilmente Foundation Capital) ha pubblicato su X un thread-saggio virale (230.5K visualizzazioni): ***"Token Budget Wars"***. **Tesi cardine**: *"Enterprise AI has moved from adoption to allocation."* La fase 1 ha dimostrato che i modelli funzionano; la fase 2 deciderà **quanto di quel lavoro vale la pena**. La nuova valuta al vertice delle imprese è la **quantificazione del ROI dell'IA** — *"show me the value."*

Concetto canonico: ***marginal token utility*** = *"the business value created by each additional dollar of inference"* — il numero che conta su larga scala, **invisibile** per la maggior parte delle aziende perché la fattura non dice se la spesa ha sostituito lavoro, generato ricavi o finanziato il *tokenmaxxing*. Cronologia: **Claude è stato rilasciato a novembre 2025**, dopo che i budget 2026 erano già bloccati; già nel **Q1**, aziende *"multiples ahead of plan."* Passaggio da **sperimentazione ($100K) → infrastruttura ($1M+)**: *"two runs of the same workflow on the same input can differ in token cost by 5-10x"* — *"a number the CFO has to explain to the CEO."*

**L'IA compete con il lavoro**: l'unità si sposta dal token al ***costo di un risultato completato*** (per ticket risolto, sinistro elaborato, contratto revisionato, assunzione evitata…). Il **BPO** è il benchmark più facile (già prezzato in unità completate). **Perché il SaaS non si applica più**: *"the signal and the noise share the same unit"*; *"SaaS usage told you the software had been adopted. AI usage tells you the meter is running. It doesn't tell you whether your company is cooking."*

**Tre cause dell'invisibilità**: (1) **retry tails** — token/risoluzione ≈ T/p, 90%→70% = +~28%; (2) **context inflation** — costo ≈ O(n²), raddoppiare il contesto ×4 il ragionamento; (3) **routing** — inviare tutto al modello di frontiera = *"board-level problem."* **Divisione**: software = un problema di **misurazione della produttività**; non-software = un problema di **trasformazione** (*right under audit*).

**Livello mancante**: ***attribuzione token-risultato*** che collega inferenza → lavoro → risultato. ***La misurazione diventa memoria***: gli agenti creano **tracce decisionali** (*"decision rationale is one of the most perishable assets"*) che diventano *"more valuable than the cost report"* → un **context graph**. **Il livello di allocazione è il premio**: chi lo possiede prende le *decisioni di allocazione* e controlla dove va la spesa in IA — acquistato come una **trasformazione** (McKinsey + Palantir + CEO top-down, sul modello di ERP/BI). Chiusura con Munger: *"show me the incentive and I will show you the outcome."*

## GrapheDeConnaissance

- Jaya Gupta —publie→ Token Budget Wars (DOCUMENT, 0.98)
- Jaya Gupta —travaille_chez→ Foundation Capital (ORGANISATION, 0.75)
- Jaya Gupta —affirme_que→ « Enterprise AI has moved from adoption to allocation » (CITATION, 0.96)
- Marginal token utility —est_instance_de→ valeur business créée par dollar marginal d'inférence (CONCEPT, 0.97)
- Jaya Gupta —affirme_que→ Claude a été shippé en novembre 2025, après le lock des budgets annuels 2026 (AFFIRMATION, 0.93)
- Inférence —est_instance_de→ coût opérationnel récurrent (CONCEPT, 0.95)
- Jaya Gupta —mesure→ variance de 5-10× en coût de tokens entre deux exécutions du même workflow sur le même input (MESURE, 0.94)
- AI spend —concurrence→ le travail (labor) (CONCEPT, 0.95)
- Cost of completed outcome —remplace→ coût du token comme unité pertinente (CONCEPT, 0.94)
- BPO —est_instance_de→ baseline benchmarkable (unités complétées) (CONCEPT, 0.93)
- Jaya Gupta —affirme_que→ « the signal and the noise share the same unit » (CITATION, 0.95)
- Jaya Gupta —mesure→ retry tails : coût par résolution ≈ T/p ; 90%→70% de complétion = +~28% de coût (MESURE, 0.92)
- Context inflation —est_basé_sur→ scaling O(n²) de l'attention en longueur de contexte (CONCEPT, 0.92)
- Model routing —permet→ facture gérable (vs board-level problem) (CONCEPT, 0.93)
- Problème de mesure de productivité —s_applique_à→ entreprises software (CONCEPT, 0.9)
- Problème de transformation —s_applique_à→ entreprises non-software (CONCEPT, 0.9)
- Token-to-outcome attribution —est_instance_de→ la couche manquante (CONCEPT, 0.96)
- Agents —permet→ decision traces (CONCEPT, 0.95)
- Jaya Gupta —affirme_que→ les decision traces deviennent un context graph plus précieux que le cost report (AFFIRMATION, 0.93)
- Jaya Gupta —affirme_que→ « the allocation layer is the prize » (CITATION, 0.94)
- Jaya Gupta —prédit→ le token-to-outcome attribution sera acheté comme une transformation (McKinsey + Palantir + top-down CEO) (AFFIRMATION, 0.91)
- Charlie Munger —affirme_que→ « show me the incentive and I will show you the outcome » (CITATION, 0.96)
- @tuning_engines —affirme_que→ « tokens will basically have to be managed like headcount » (CITATION, 0.95)
- Model hierarchies (gouvernance tokens) —permet→ contrôle d'accès par rôle sur les modèles (quel utilisateur peut utiliser quel modèle) (CONCEPT, 0.92)
- Techniques de gestion FTE —s_applique_à→ la gestion des tokens (CONCEPT, 0.91)
- Token Budget Wars —converge_avec→ Bain cross-system labor, Ng pricing power, DORA ROI, Foundation Capital Context Graphs (DOCUMENT, 0.9)

---
Canonical: https://www.thekb.eu/it/fiches/gupta-token-budget-wars-marginal-token-utility-2026-05-28/
