# gupta-token-budget-wars-marginal-token-utility-2026-05-28

## Veille

Viraler X-Thread (**230,5K Aufrufe**, 28. Mai 2026, 1:51 Uhr) von **Jaya Gupta** (@JayaGup10, Investorin — vermutlich bei Foundation Capital, Autorin des *Context Graphs*-Frameworks) mit dem Titel ***„Token Budget Wars“***. **Kernthese**: ***„Enterprise AI has moved from adoption to allocation“*** — Phase 1 der Unternehmens-KI hat bewiesen, dass Modelle funktionieren; Phase 2 wird entscheiden, **wie viel diese Arbeit wert ist**. Die neue Währung an der Unternehmensspitze ist die **Fähigkeit, den KI-ROI zu quantifizieren**: *„zeig mir den Wert“*. Kernkonzept: ***marginaler Token-Nutzen*** = *„der Geschäftswert, den jeder zusätzliche Dollar an Inferenz schafft“* — die Zahl, die im großen Maßstab zählt und die **die meisten Unternehmen nicht sehen können**. Zeitachse: **Claude wurde im November 2025 ausgeliefert**, nachdem die Jahresbudgets 2026 bereits festgelegt waren → schon im **Q1** lagen Unternehmen *„um ein Vielfaches über Plan“* → Inferenz hört auf, ein Experimentierposten zu sein, und wird zu **wiederkehrenden Betriebskosten**. Verschiebung von **Experimentieren (ein paar 100.000 $) → Infrastruktur (siebenstellig, 1 Mio. $+)**: Im Infrastruktur-Maßstab erzeugt **technische Varianz materielle Schwankungen in der Gewinn- und Verlustrechnung — zwei Durchläufe desselben Workflows mit demselben Input können sich im Token-Kostenaufwand um das 5- bis 10-Fache unterscheiden**, ohne dass sichtbar etwas kaputt ist, *„eine Zahl, die der CFO dem CEO erklären muss“*. **KI konkurriert mit Arbeitskraft**: 3 Arten von Budgetanfragen (ausgelagerte Arbeit ersetzen / interne Arbeit ersetzen / Umsatz generieren) → Verschiebung hin zu den ***Kosten eines abgeschlossenen Ergebnisses*** (Kosten pro gelöstem Ticket, bearbeitetem Schadensfall, geprüftem Vertrag, abgeschlossener Rechnung, vermiedener Neueinstellung, gehaltenem Kunden, bewegtem Umsatzdollar). **BPO = die einfachste Vergleichsbasis** (bereits in abgeschlossenen Einheiten bepreist); interne Arbeit ist deutlich schwieriger (multiskillte Mitarbeitende, diffuse Gewinne, Widerstand der Personalabteilung gegen Stellenabbau). **Warum es sich von SaaS unterscheidet**: SaaS hat gelernt, Nutzung als Proxy für Wert zu behandeln; KI bricht diesen Proxy — *„Signal und Rauschen teilen sich dieselbe Einheit“* (den Token), *„SaaS-Nutzung sagte dir, dass die Software adoptiert wurde. KI-Nutzung sagt dir, dass der Zähler läuft. Sie sagt dir nicht, ob dein Unternehmen brodelt.“* **Drei Ursachen für die Unsichtbarkeit des marginalen Token-Nutzens**: (1) ***Retry-Tails*** — Tokens pro gelöstem Workflow ≈ **T/p**; ein Rückgang der Abschlussquote von 90 % auf 70 % erhöht die effektiven Kosten um ~**28 %**, nicht 20 %, weil sich Fehlschläge kumulieren; (2) ***Kontext-Inflation*** — die Inferenzkosten verhalten sich ≈ **O(n²)** zur Kontextlänge (Attention), eine Verdopplung des Kontexts **vervierfacht** die Kosten des Reasonings (Over-Retrieval: 50 Dokumente, wo 5 genügen würden); (3) ***Routing*** — standardmäßig wird das leistungsstärkste Modell verwendet (einfache Klassifikation läuft auf einem komplexen Reasoning-Modell); über Millionen von Aufrufen hinweg macht der Unterschied zwischen dem Routing einfacher Aufgaben zu einem kleinen Modell und dem Versenden von allem an das Frontier-Modell *„den Unterschied zwischen einer überschaubaren Rechnung und einem Problem auf Vorstandsebene“* aus. **Sektorale Aufteilung**: **Software**-Unternehmen = ein Problem der **Produktivitätsmessung** (bereits instrumentiert: PRs, Commits, Deployments, Incidents, Zykluszeit, MTTR — verfolgt *„KI-Entlassungen“*); **Nicht-Software**-Unternehmen = ein **Transformations**-Problem (operative Arbeit: Schadensfälle, Underwriting, Support, Compliance-Prüfungen, Ausnahmen in der Lieferkette, Zahlungsstreitigkeiten — *im Audit korrekt, nicht nur im Durchschnitt korrekt*). **Die fehlende Schicht = Token-zu-Ergebnis-Attribution**: eine Umwandlungsschicht, die Inferenzausgaben → geleistete Arbeit → Geschäftsergebnis verknüpft und 3 Fragen beantwortet (reale Kosten einschließlich Retries/Korrekturen; welche Teile der Trace zählten vs. Thrashing; hat die Arbeit das Betriebsmodell verändert). ***Messung wird zu Gedächtnis***: Um einen Token mit einem Ergebnis zu verknüpfen, müssen **Entscheidungs-Traces** erfasst werden (was der Agent gesehen, abgerufen, aufgerufen, ignoriert hat, wo er es erneut versucht hat, wann ein Mensch eingegriffen hat) — *„die Entscheidungsbegründung ist eines der am schnellsten verderblichen Vermögenswerte eines Unternehmens“* (lebt in Slack, E-Mails, Eskalationsanrufen, in den Köpfen der Menschen). Agenten **erzeugen** diese Traces; zunächst erfasst, um die Ausgaben zu rechtfertigen, werden sie *„wertvoller als der Kostenbericht“* → ein **Context Graph** (*„auch wenn ich dieses Wort in letzter Zeit schon so leid bin“*). **Die Allokationsschicht ist der Preis**: Wer die Token-zu-Ergebnis-Attribution besitzt, trifft die **Allokationsentscheidungen** (welche Workflows mehr Rechenleistung verdienen, welche gedeckelt werden, welche zu günstigeren Modellen wechseln, welche menschlich bleiben, welche BPO ersetzen). Unternehmen werden das nicht allein tun — sie werden es **als Transformation einkaufen** (Fortune-500-Playbook: McKinsey- und Palantir-Alumni + top-down agierender CEO, nach Art von ERP/BI/digitaler Transformation, ein *„Programm“* mit einem Executive Sponsor und einer Infrastruktur, die zur **neuen Single Source of Truth** wird). Eingerahmt mit **Charlie Munger**: *„zeig mir den Anreiz, und ich zeige dir das Ergebnis.“* Organisatorische Nebenthese: der jahrzehntealte Führungsinstinkt, dass *große Teams = große Aufgaben/Reichweite/Macht* bedeuten → sobald Intelligenz zur **knappen Ressource** wird, ist das neue Statussymbol *„wie viel davon man orchestriert.“* Direkte Relevanz für die **Positionierung Cost Optimization / agentisches FinOps**: bestätigt empirisch die Hebel (Model-Routing, Prompt-Caching, Context-Hygiene, Sub-Agenten) und verschiebt den KPI hin zu **Kosten pro abgeschlossenem Ergebnis**. Starke Konvergenz mit Bains *Cross-System Labor* (Execution-Data-Moat, Cursor), Ngs *No AI Jobpocalypse* (Preisgestaltung verankert am Gehalt der ersetzten Arbeitskraft), DORA ROI (Kosten pro Feature), Mensch/Mistral (Elektron→Token), Ensarguet (Ökonomie der Berechnung), Foundation Capitals *Context Graphs* (Entscheidungs-Traces, gleiche Autorin), Wescales *Token Burning*, BFM/Girard (Token = Wert-Treibstoff).

## Titre Article

Token Budget Wars

## Date

2026-05-28

## URL

https://x.com/JayaGup10/status/2059784669382791653

## Keywords

Token Budget Wars, marginaler Token-Nutzen, Token-zu-Ergebnis-Attribution, von Adoption zu Allokation, Allokationsschicht, Kosten pro abgeschlossenem Ergebnis, Kosten eines abgeschlossenen Ergebnisses, Retry-Tails, Kontext-Inflation, Model-Routing, Haiku-Sonnet-Opus-Routing, Prompt-Caching, Context-Hygiene, KI-ROI-Quantifizierung, zeig mir den Wert, Inferenz als wiederkehrende Betriebskosten, von Experimentieren zu Infrastruktur, siebenstellig, technische Varianz 5-10x Token-Kosten, KI-Ausgaben konkurrieren mit Arbeitskraft, BPO-Benchmark, Business Process Outsourcing, Kosten pro gelöstem Ticket bearbeitetem Schadensfall geprüftem Vertrag, vermiedene Neueinstellung gehaltener Kunde, SaaS-Nutzung als Wert-Proxy, Signal und Rauschen teilen sich dieselbe Einheit, brodelt dein Unternehmen, T durch p Retry-Ökonomie, Abschlussquote 90 auf 70 Prozent 28 Prozent, O(n²) Attention Kontextlänge, übermäßiges Retrieval, überdimensioniertes Frontier-Modell, Software-Produktivitätsmessproblem, Nicht-Software-Transformationsproblem, KI-Entlassungen, PRs Commits Deployments Incidents Zykluszeit MTTR, Schadensfälle Underwriting Compliance-Prüfungen Lieferketten-Ausnahmen Zahlungsstreitigkeiten, im Audit korrekt, Entscheidungs-Traces, Messung wird zu Gedächtnis, Entscheidungsbegründung als verderblicher Vermögenswert, Systeme der Aufzeichnung was nicht warum, Context Graph, Allokationsentscheidungen, gedeckelte Rechenleistung, Transformationsprogramm, Fortune-500-Playbook, McKinsey Palantir Top-down-CEO, ERP BI digitale Transformation, neue Single Source of Truth, Intelligenz als knappe Ressource, Intelligenz orchestrieren, große Teams große Aufgaben, Charlie Munger zeig mir den Anreiz, Jaya Gupta, Foundation Capital, Tokenmaxxing, metamates, CFO CEO Problem auf Vorstandsebene, agentisches FinOps, TCO Kosten pro Feature

## Authors

**Jaya Gupta** (@JayaGup10) — investisseuse / VC. Très probablement **Foundation Capital** (le thread s'auto-réfère au cadre ***Context Graphs*** — *« ahem, context graph, although I am so tired of that word these days »* — concept porté par Foundation Capital, cf. fiche `bain-100b-saas-opportunity` qui cite *Foundation Capital — Context Graphs trillion-dollar opportunity, 2025-12-22*). Thread publié sur X le **28 mai 2026 à 1h51**, **230,5K vues**, format essai long en un seul post. Une réponse notable de **@tuning_engines** (*« DevSecFinOps for the Agentic Era »*) : *« Tokens will basically have to be managed like headcount […] model hierarchies too »*.

## Ton

**Profil**: Eine Investoren-Essay-These, gerichtet an Gründerinnen, CFOs/CEOs, CIOs und Betreiber von Unternehmens-KI. Eine zurückhaltende Ich-Perspektive, Register einer **VC-Analystin**, **mittel-hohes** technisches Niveau (setzt *O(n²)*, Retry-Tails, Two-Tower voraus, bleibt aber für Entscheidungsträger lesbar). Langes X-Thread-Format (ein einziger dichter Post, ~1.200 Wörter), strukturiert mit internen Zwischenüberschriften (*Warum sich das von SaaS unterscheidet*, *Warum marginaler Token-Nutzen schwer zu erkennen ist*, *Messung wird zu Gedächtnis*, *Die Allokationsschicht ist der Preis*).

**Stil**: Scharfe VC-Prosa im Stil eines Investment-Memos — Kernaussagen werden in einem Satz gesetzt und dann entfaltet, eine Mischung aus **ökonomischer Strenge** (Formeln wie *T/p*, *O(n²)*, numerische Spannen 5-10×, 28 %) und **kulturellem Register des Silicon Valley/Meta** (*Tokenmaxxing*, *#metamates*, *#bearish* Jim Cramer/CNBC, *TikTok-Pausen zum Mittagessen*, *brodelt dein Unternehmen*). Selbstironie gegenüber dem eigenen Fachjargon (*„context graph, auch wenn ich dieses Wort in letzter Zeit schon so leid bin“*). Schließt mit einem Totem-Zitat (Munger) — eine typische Signatur von VC-Memos. Ton **präskriptiv, ohne aktivistisch zu sein**: kein Produkt wird direkt verkauft, aber eine Marktthese („die Allokationsschicht ist der Preis“), die implizit eine förderungswürdige Startup-Kategorie skizziert.

**Zentrale Aphorismen**:
- ***„Enterprise AI has moved from adoption to allocation.“*** (Kernthese).
- ***„Marginal token utility: the business value created by each additional dollar of inference.“*** (Kernkonzept).
- ***„The signal and the noise share the same unit.“*** (warum SaaS nicht mehr greift).
- ***„SaaS-Nutzung sagte dir, dass die Software adoptiert wurde. KI-Nutzung sagt dir, dass der Zähler läuft. Sie sagt dir nicht, ob dein Unternehmen brodelt.“***
- ***„Messung wird zu Gedächtnis.“*** (Entscheidungs-Traces → Context Graph).
- ***„Die Allokationsschicht ist der Preis.“*** (die Schicht, die die Allokationsentscheidungen trifft).
- ***„Zeig mir den Anreiz, und ich zeige dir das Ergebnis.“*** (Charlie Munger, Schlusszitat).

**Ausgearbeitete Metaphern**:
- ***Der Zähler läuft*** — Inferenz als laufender Taxameter: Nutzung beweist nicht mehr Wert, sie beweist, dass die Ausgabe weiterläuft. (Ein direktes Echo der Metapher „Taxi ohne Treibstoff“ von Girard/BFM.)
- ***Brodelt dein Unternehmen*** — Slang für „bringt das hier tatsächlich etwas“: zwei identische Token-Rechnungen können zwei radikal unterschiedliche Vorgänge abdecken (der eine konvertiert, der andere bezahlt für *Thrash*).
- ***Token Budget Wars*** als **interner Allokationskrieg** — der Kampf um den Besitz von Token kollidiert mit dem jahrzehntealten Führungsinstinkt (Teamgröße = Macht); das neue Statussymbol = *„wie viel Intelligenz man orchestriert.“*
- ***Tokens verwaltet wie Headcount*** (aufgegriffen in einer Antwort) — Token werden zu einer Ressource, die wie FTEs verwaltet wird, mit Modellhierarchien.

**Epistemische Haltung**: **Marktanalyse + ökonomisches Framework**, das eine entstehende Produktkategorie postuliert (*Token-zu-Ergebnis-Attribution* / *Allokationsschicht*); eine Mischung aus formalen Modellen (Retry-Ökonomie, Attention-Skalierung) und Feldbeobachtung (Q1 2026 um ein Vielfaches über Plan). Offen bezüglich des Fachjargons, den sie selbst populär gemacht hat (Context Graph).

**Autorität**: aufgebaut aus (a) dem **Blickwinkel der Investorin**, die mehrere Unternehmen im großen Maßstab sieht, (b) der **Autorenschaft des Context-Graphs-Frameworks** (Selbstreferenz), (c) der **Präzision der Modelle** (T/p, O(n²)), (d) dem **Timing** (28. Mai 2026, direkt nach der Q1-Budgetverschiebung), (e) der **Viralität** (230,5K Aufrufe), die die Resonanz des Themas bei Praktikern bestätigt.

## Pense-betes

- **Datum / Quelle**: **28. Mai 2026** (1:51 Uhr), X-Thread @JayaGup10, **230,5K Aufrufe**. Langes Essay-Format in einem einzigen Post.
- **Autorin**: **Jaya Gupta**, Investorin (vermutlich bei **Foundation Capital** — Autorin des *Context Graphs*-Frameworks, Selbstzitat).
- **Kernthese**: ***„Enterprise AI has moved from adoption to allocation“*** — Phase 1: Modelle können funktionieren; Phase 2: **wie viel diese Arbeit wert ist**. ### Das Kernkonzept — marginaler Token-Nutzen > ***„der Geschäftswert, den jeder zusätzliche Dollar an Inferenz schafft. Es ist die Zahl, die im großen Maßstab zählt, und die Zahl, die die meisten Unternehmen nicht sehen können.“***
- Es ist die **Ableitung** des ROI: nicht die Gesamtkosten, sondern der **Wert des marginalen Inferenz-Dollars**.
- Unsichtbar, weil **der Token-Nutzen nicht quantifiziert wird**: Die Rechnung sagt nicht, ob die Ausgabe Arbeit ersetzt, Umsatz generiert, Risiko reduziert, einen Workflow beschleunigt hat … oder nur Ingenieure finanziert hat, die auf dem Leaderboard *tokenmaxxen*. ### Zeitachse der Verschiebung | Zeitpunkt | Fakt | |--------|------| | **Nov. 2025** | Claude wurde ausgeliefert, **nachdem** die Jahresbudgets 2026 bereits festgelegt waren | | **Q1 2026** | Unternehmen *„liegen um ein Vielfaches über Plan“* | | Schwelle **~ein paar 100.000 $** | Noch Experimentieren | | Schwelle **siebenstellig (1 Mio. $+)** | Wird zu **Infrastruktur** → materielle Schwankungen in der GuV |
- **Kanonische technische Varianz**: *„zwei Durchläufe desselben Workflows mit demselben Input können sich im Token-Kostenaufwand um das 5- bis 10-Fache unterscheiden, ohne dass sichtbar etwas schiefgeht“* → im Infrastruktur-Maßstab *„eine Zahl, die der CFO dem CEO erklären muss.“* ### KI konkurriert mit Arbeitskraft (nicht mit SaaS)
- **3 Arten von Budgetanfragen**: **ausgelagerte** Arbeit ersetzen / **interne** Arbeit ersetzen / **Umsatz** generieren.
- Verschiebung der Einheit: vom Token zu den ***Kosten eines abgeschlossenen Ergebnisses*** → Kosten pro **gelöstem Ticket, bearbeitetem Schadensfall, geprüftem Vertrag, abgeschlossener Rechnung, vermiedener Neueinstellung, gehaltenem Kunden, bewegtem Umsatzdollar**.
- **BPO = die einfachste Vergleichsbasis** (bereits in abgeschlossenen Einheiten bepreist: Preis pro Ticket/Schadensfall/Rechnung/Prüfung). **Interne** Arbeit = deutlich schwieriger (multiskillte Mitarbeitende, diffuse Gewinne = vermiedene Einstellungen/Kapazität, Widerstand der Personalabteilung).
- ⚠️ Fallstrick: *„ein Schadensfall, der drei Retries, eine menschliche Korrektur und ein Frontier-Modell erfordert, kann teurer sein als die ausgelagerte Arbeitskraft, die er ersetzen sollte.“* ### Warum SaaS nicht mehr greift > ***„Signal und Rauschen teilen sich dieselbe Einheit.“*** Der Token (Abrechnungseinheit) ist **stabil**, aber die Arbeit, die er repräsentiert, **ist es nicht**. > ***„SaaS-Nutzung sagte dir, dass die Software adoptiert wurde. KI-Nutzung sagt dir, dass der Zähler läuft. Sie sagt dir nicht, ob dein Unternehmen brodelt.“***
- ### Die 3 Ursachen der Unsichtbarkeit — direkt umsetzbar (FinOps) | # | Ursache | Mechanismus | Hebel | |---|-------|-----------|--------| | 1 | **Retry-Tails** | Tokens/gelöster Workflow ≈ **T/p**; Abschlussquote 90 %→70 % = **+~28 %** Kosten (nicht 20 %, Fehlschläge kumulieren sich) | Zuverlässigkeit beim ersten Versuch verbessern | | 2 | **Kontext-Inflation** | Kosten ≈ **O(n²)** zur Kontextlänge; Verdopplung des Kontexts **vervierfacht** die Reasoning-Kosten; Over-Retrieval (50 Dokumente statt 5, ganze E-Mail-Threads, veraltete Historie) | **Context-Hygiene**, gezieltes Retrieval | | 3 | **Routing** | Standard = stärkstes Modell; einfache Klassifikation läuft auf einem komplexen Reasoning-Modell | **Model-Routing** (kleines Modell für einfache Aufgaben) = *„überschaubare Rechnung vs. Problem auf Vorstandsebene“* | → **Deckt sich exakt** mit den Hebeln aus dem Slot „Cost Optimization“ der Claude-Code-Morgensession (Haiku/Sonnet/Opus-Routing, Prompt-Caching, Context-Hygiene, Sub-Agenten).
- ### Sektorale Aufteilung | | **Software** | **Nicht-Software** | |--|-------------|------------------| | Art des Problems | **Produktivitätsmessung** | **Transformation** | | Warum | Arbeit bereits instrumentiert (PRs, Commits, Deployments, Incidents, Zykluszeit, MTTR) | Operative Arbeit (Schadensfälle, Underwriting, Support, Compliance, Lieferkette, Zahlungsstreitigkeiten) | | Anforderung | *im Durchschnitt korrekt* | ***im Audit korrekt*** | | Symptom | verfolgt *„KI-Entlassungen“* | Arbeitseinheit ≠ Kosteneinheit ≠ dieselbe Organisation | ### Die fehlende Schicht — Token-zu-Ergebnis-Attribution
- **Umwandlungsschicht**, die verknüpft: Inferenzausgaben → geleistete Arbeit → Geschäftsergebnis.
- **3 Fragen**: (1) reale Kosten **einschließlich Retries/Korrekturen**? (2) welche Teile der Trace **zählten** vs. **Thrashing**? (3) hat die Arbeit **das Betriebsmodell verändert** (weniger Tickets/Agent, kürzere Schadensfall-Zyklen, reduzierte BPO-Position, verzögerte Einstellungen)?
- Attribution **in der Sprache des Geschäfts**: nicht *„dieser Workflow kostete 2,13 $“*, sondern *„diese Klasse von Schadensfällen ist mit Agenten günstiger als mit BPO, außer wenn die Police Ausnahmedokumente erfordert — in diesem Fall zerstört der Retry-Tail die Wirtschaftlichkeit.“* ### Messung wird zu Gedächtnis > ***„Die Entscheidungsbegründung ist einer der am schnellsten verderblichen Vermögenswerte eines Unternehmens“*** — sie lebt in Slack-Threads, E-Mail-Ketten, Eskalationsanrufen und in den Köpfen der Menschen (die das Unternehmen verlassen).
- Systeme der Aufzeichnung erfassen **was** passiert ist, selten **warum** (ein CRM sagt, dass ein Deal geplatzt ist, nicht das ungeschriebene Urteil hinter der Prognose).
- **Agenten erzeugen Traces** (Retrieval, Tool-Aufruf, Retry, Eskalation, menschliche Korrektur, endgültige Entscheidung).
- Zunächst erfasst, um **die Ausgaben zu rechtfertigen**, werden sie *„wertvoller als der Kostenbericht“* → ein **Context Graph** (ein Fachjargon, den die Autorin nach eigener Aussage *„schon so leid“* ist). ### Die Allokationsschicht ist der Preis
- Wer die Token-zu-Ergebnis-Attribution besitzt, trifft die **Allokationsentscheidungen**: welche Workflows → mehr Rechenleistung erhalten / gedeckelt werden / zu günstigeren Modellen wechseln / menschlich bleiben / BPO ersetzen.
- *„Und sobald man diese Entscheidungen trifft, kontrolliert man, wohin die KI-Ausgaben im Unternehmen fließen, und erhält das Vertrauen, um zu allokieren.“*
- **Eingekauft als Transformation** (Fortune-500-Playbook): McKinsey- und Palantir-Alumni + top-down agierender CEO; kommt daher wie ERP/BI/digitale Transformation, ein *„Programm“* mit einem Executive Sponsor + einer Infrastruktur = **neue Single Source of Truth**.
- Die Gründerinnen und Gründer, die dazu in der Lage sein werden, werden *„andere Menschen als das klassische Archetyp“* sein. ### Nutzbar für
- **Slot „Cost Optimization“ (Claude-Code-Morgensession)**: kanonisches Zitat für die Verschiebung von *Token-Kosten → Kosten pro abgeschlossenem Ergebnis*; die 3 Ursachen (Retry/Kontext/Routing) strukturieren den Hebel-Abschnitt; *„der Zähler läuft“* und *„brodelt dein Unternehmen“* = Pointen für Entscheidungsträger.
- **Agentisches-FinOps-Beratungsangebot**: die Schicht *Token-zu-Ergebnis-Attribution* ist eine **entstehende Produkt-/Beratungskategorie** — mögliche Positionierung für SFEIR (die Trace instrumentieren, sie mit der GuV verknüpfen).
- **CFO/CEO-Narrativ**: *„eine Zahl, die der CFO dem CEO erklären muss“* — rahmt exakt die KI-Budgetdiskussion 2026 ein.
- **Argument Entscheidungs-Traces/Context Graph**: Konvergenz mit Foundation Capital (gleiche Autorin), Bain (Execution-Data-Moat), Talisman (Ontologie/Governance) — *Messung wird zu Gedächtnis* = die Data-Moat-These 2026. ### Verbindungen zum Veille-Korpus
- **Bain — Cross-System Labor** (2026-05): dieselbe Kopplung von **Execution-Data = Moat** + **Kosten eines abgeschlossenen Ergebnisses**; Bain beziffert den Markt, Gupta beziffert das **Messproblem**, das ihn erschließt. Beide zitieren KI als **Substitution von Arbeitskosten**.
- **Ng — No AI Jobpocalypse** (2026-05-08): Ng beschreibt **Preissetzungsmacht** (Anbieter verankern die Preisgestaltung am **Gehalt der ersetzten Arbeitskraft**); Gupta beschreibt das **Gegenstück auf Käuferseite** (KI wird an BPO/Gehalt gemessen). Zwei Seiten derselben Mechanik *KI-Ausgaben konkurrieren mit Arbeitskraft*.
- **DORA ROI** (2026-04-21): *„wir messen KI nicht am Code, den sie schreibt, sondern an den Engpässen, die sie beseitigt“* + *„Code ist eine Verbindlichkeit“* → Gupta = die **Token-Ebene**-Version derselben Ablehnung von Aktivitäts-Proxys.
- **Mensch / Mistral** (2026-05-13): *„wir verwandeln Elektrizität in Intelligenz, in Token-Generierung“* — eine Elektron→Token-Ökonomie auf der Angebotsseite; Gupta = eine Token→Ergebnis-Ökonomie auf der Nachfrageseite.
- **Ensarguet — Economics of Computation** (2026-03-11): der *Kilowattstunden-Moment*, das Ende des abrechenbaren Denk-Stundenlohns; Gupta erweitert dies auf der Seite des **Stückwerts der Rechenleistung**.
- **Foundation Capital — Context Graphs** (2025-12-22, **gleiche Autorin**): *Messung wird zu Gedächtnis* = eine explizite Brücke zum Context-Graphs-Framework; Entscheidungs-Traces = das neue System of Record.
- **Wescale — Augmented Software Factory** (2026-05-03): das Konzept *Token Burning* + Agent Manager = das französische operative Gegenstück zu Guptas *Thrash*.
- **BFM / Girard** (2026-05-05): *„Token = Wert-Treibstoff“*, NVIDIA-Boni ausgezahlt in Token, die Taxi-Metapher — direkte Konvergenz mit *der Zähler läuft*.
- **@tuning_engines** (Antwort — *„DevSecFinOps for the Agentic Era“*): eine **Governance-/Organisations**-Erweiterung der These. Drei Ideen: (1) ***„Tokens werden im Grunde wie Headcount verwaltet werden müssen“*** — der Token wird zu einer Ressource, die wie ein Headcount verwaltet wird (Budget, Allokation, Rechtfertigung); (2) ***Modellhierarchien*** — *„welches Modell an welchen Nutzer berichtet (also im Grunde, welcher Nutzer welches Modell verwenden darf!)“* = **rollenbasierte Zugriffskontrolle (RBAC) auf Modelle**: wer Opus vs. Sonnet vs. Haiku verwenden darf; (3) *„viele organisatorische Techniken des FTE-Managements werden auch auf Token angewendet werden müssen“* — Import von HR-**Workforce-Management**-Techniken (Kapazitätsplanung, Allokation, Review) ins Token-Management. → Eine direkte Brücke zum **Governance**-Slot des Vormittags (nutzer- und modellbezogene Kontingente/Berechtigungen) und Konvergenz mit **Uber Engineering** (Agenten-Identität, *welcher Agent was darf*).

## RésuméDe400mots

Am 28. Mai 2026 veröffentlichte **Jaya Gupta** (Investorin, vermutlich bei Foundation Capital) einen viralen Essay-Thread auf X (230,5K Aufrufe): ***„Token Budget Wars“***. **Kernthese**: *„Enterprise AI hat sich von Adoption zu Allokation verschoben.“* Phase 1 hat bewiesen, dass Modelle funktionieren können; Phase 2 wird entscheiden, **wie viel diese Arbeit wert ist**. Die neue Währung an der Spitze der Unternehmen ist die **Quantifizierung des KI-ROI** — *„zeig mir den Wert.“*

Kernkonzept: ***marginaler Token-Nutzen*** = *„der Geschäftswert, den jeder zusätzliche Dollar an Inferenz schafft“* — die Zahl, die im großen Maßstab zählt, **für die meisten Unternehmen unsichtbar**, weil die Rechnung nicht sagt, ob die Ausgabe Arbeit ersetzt, Umsatz generiert oder *Tokenmaxxing* finanziert hat. Zeitachse: **Claude wurde im November 2025 ausgeliefert**, nachdem die Budgets 2026 bereits festgelegt waren; schon im **Q1** lagen Unternehmen *„um ein Vielfaches über Plan.“* Verschiebung von **Experimentieren (100.000 $) → Infrastruktur (1 Mio. $+)**: *„zwei Durchläufe desselben Workflows mit demselben Input können sich im Token-Kostenaufwand um das 5- bis 10-Fache unterscheiden“* — *„eine Zahl, die der CFO dem CEO erklären muss.“*

**KI konkurriert mit Arbeitskraft**: Die Einheit verschiebt sich vom Token zu den ***Kosten eines abgeschlossenen Ergebnisses*** (pro gelöstem Ticket, bearbeitetem Schadensfall, geprüftem Vertrag, vermiedener Neueinstellung…). **BPO** ist die einfachste Vergleichsbasis (bereits in abgeschlossenen Einheiten bepreist). **Warum SaaS nicht mehr greift**: *„Signal und Rauschen teilen sich dieselbe Einheit“*; *„SaaS-Nutzung sagte dir, dass die Software adoptiert wurde. KI-Nutzung sagt dir, dass der Zähler läuft. Sie sagt dir nicht, ob dein Unternehmen brodelt.“*

**Drei Ursachen der Unsichtbarkeit**: (1) **Retry-Tails** — Tokens/Lösung ≈ T/p, 90 %→70 % = +~28 %; (2) **Kontext-Inflation** — Kosten ≈ O(n²), Verdopplung des Kontexts vervierfacht das Reasoning; (3) **Routing** — alles an das Frontier-Modell zu senden = *„Problem auf Vorstandsebene.“* **Aufteilung**: Software = ein Problem der **Produktivitätsmessung**; Nicht-Software = ein **Transformations**-Problem (*im Audit korrekt*).

**Fehlende Schicht**: ***Token-zu-Ergebnis-Attribution***, die Inferenz → Arbeit → Ergebnis verknüpft. ***Messung wird zu Gedächtnis***: Agenten erzeugen **Entscheidungs-Traces** (*„die Entscheidungsbegründung ist einer der am schnellsten verderblichen Vermögenswerte“*), die *„wertvoller als der Kostenbericht“* werden → ein **Context Graph**. **Die Allokationsschicht ist der Preis**: Wer sie besitzt, trifft die *Allokationsentscheidungen* und kontrolliert, wohin die KI-Ausgaben fließen — eingekauft als **Transformation** (McKinsey + Palantir + top-down agierender CEO, nach Art von ERP/BI). Abschließend mit Munger: *„zeig mir den Anreiz, und ich zeige dir das Ergebnis.“*

## GrapheDeConnaissance

- Jaya Gupta —publie→ Token Budget Wars (DOCUMENT, 0.98)
- Jaya Gupta —travaille_chez→ Foundation Capital (ORGANISATION, 0.75)
- Jaya Gupta —affirme_que→ « Enterprise AI has moved from adoption to allocation » (CITATION, 0.96)
- Marginal token utility —est_instance_de→ valeur business créée par dollar marginal d'inférence (CONCEPT, 0.97)
- Jaya Gupta —affirme_que→ Claude a été shippé en novembre 2025, après le lock des budgets annuels 2026 (AFFIRMATION, 0.93)
- Inférence —est_instance_de→ coût opérationnel récurrent (CONCEPT, 0.95)
- Jaya Gupta —mesure→ variance de 5-10× en coût de tokens entre deux exécutions du même workflow sur le même input (MESURE, 0.94)
- AI spend —concurrence→ le travail (labor) (CONCEPT, 0.95)
- Cost of completed outcome —remplace→ coût du token comme unité pertinente (CONCEPT, 0.94)
- BPO —est_instance_de→ baseline benchmarkable (unités complétées) (CONCEPT, 0.93)
- Jaya Gupta —affirme_que→ « the signal and the noise share the same unit » (CITATION, 0.95)
- Jaya Gupta —mesure→ retry tails : coût par résolution ≈ T/p ; 90%→70% de complétion = +~28% de coût (MESURE, 0.92)
- Context inflation —est_basé_sur→ scaling O(n²) de l'attention en longueur de contexte (CONCEPT, 0.92)
- Model routing —permet→ facture gérable (vs board-level problem) (CONCEPT, 0.93)
- Problème de mesure de productivité —s_applique_à→ entreprises software (CONCEPT, 0.9)
- Problème de transformation —s_applique_à→ entreprises non-software (CONCEPT, 0.9)
- Token-to-outcome attribution —est_instance_de→ la couche manquante (CONCEPT, 0.96)
- Agents —permet→ decision traces (CONCEPT, 0.95)
- Jaya Gupta —affirme_que→ les decision traces deviennent un context graph plus précieux que le cost report (AFFIRMATION, 0.93)
- Jaya Gupta —affirme_que→ « the allocation layer is the prize » (CITATION, 0.94)
- Jaya Gupta —prédit→ le token-to-outcome attribution sera acheté comme une transformation (McKinsey + Palantir + top-down CEO) (AFFIRMATION, 0.91)
- Charlie Munger —affirme_que→ « show me the incentive and I will show you the outcome » (CITATION, 0.96)
- @tuning_engines —affirme_que→ « tokens will basically have to be managed like headcount » (CITATION, 0.95)
- Model hierarchies (gouvernance tokens) —permet→ contrôle d'accès par rôle sur les modèles (quel utilisateur peut utiliser quel modèle) (CONCEPT, 0.92)
- Techniques de gestion FTE —s_applique_à→ la gestion des tokens (CONCEPT, 0.91)
- Token Budget Wars —converge_avec→ Bain cross-system labor, Ng pricing power, DORA ROI, Foundation Capital Context Graphs (DOCUMENT, 0.9)

---
Canonical: https://www.thekb.eu/de/fiches/gupta-token-budget-wars-marginal-token-utility-2026-05-28/
