# finout-cpo-guide-llm-rag-agents-agentic-token-multipliers-2025-11-02

## Veille

CPO-FinOps-Leitfaden zu KI-Architekturen: Token-Multiplikatoren (6×, 5–10×) bei LLM-Workflows, RAG, Agenten und agentischen Systemen, mit dem Cost-Iceberg-Konzept – Finout

## Titre Article

FinOps in the Age of AI: A CPO's Guide to LLM Workflows, RAG, AI Agents, and Agentic Systems

## Date

2025-11-02

## URL

https://www.finout.io/blog/finops-in-the-age-of-ai-a-cpos-guide-to-llm-workflows-rag-ai-agents-and-agentic-systems

## Keywords

FinOps, Token-Multiplikatoren, Cost Iceberg, LLM-Workflows, RAG, KI-Agenten, agentische Systeme, coding agents, Limit the Loop, Tiered Reasoning, Showback, Chargeback, Kill Switch, Kosten pro Aufgabe, Vektordatenbank, Kosten-Observability

## Authors

Finout (perspective CPO, sans auteur nommé)

## Ton

**Profil**: CPO-Perspektive (Chief Product Officer) mit FinOps-Sensibilität, pädagogisches und progressives Register, mittleres Niveau, ausgerichtet auf Product/Engineering

**Beschreibung**: Eine vierteilige Serie, die in der architektonischen Komplexität eskaliert (LLM-Workflow → RAG → Agent → agentisches System), wobei jede Stufe neue Kostenstellen hinzufügt. Der Ton ist zugänglich, reich an einprägsamen Metaphern (*« an AI agent is like an overly eager junior employee »*, der *Cost Iceberg*) und konkreten Zahlen, die der Warnung Glaubwürdigkeit verleihen. Der Autor wechselt zwischen Diagnose (wo sich die Kosten verstecken) und Verschreibung (Optimierungshebel, Best Practices je nach Cloud). Das Ziel ist ebenso kulturell wie technisch: den KI-Entwicklungsteams ein *Cost-Aware Mindset* zu vermitteln. Zielgruppe: Produktverantwortliche, KI-Architekten, Engineering Manager und FinOps-Teams.

## Pense-betes

- **These**: Die Kostenkomplexität wächst **exponentiell** von einem einfachen LLM-Workflow zu einem agentischen System – ohne FinOps-Disziplin wird selbst eine transformative KI-Architektur zu einer finanziellen Belastung. *« Cool AI features and cloud budget need to be on speaking terms. »*
- **Token-Multiplikatoren (Kennzahlen)**:
- **6×**: Ein Chatbot, der in einer Demo mit 200 Tokens antwortet, verbraucht in der Produktion **1.200 Tokens** (Prüfungen + mehrstufiges Reasoning).
- **30×–200×**: Von der FinOps Foundation beobachtete Kostenvarianz zwischen einer unoptimierten und einer gut optimierten Bereitstellung.
- **~5×**: Ein Agent, der pro Aufgabe **5 LLM-Aufrufe statt 1** auslöst.
- **5–10×**: Reale Gesamtkosten (*Cost Iceberg*) im Vergleich zur direkten Cloud-Rechnung, wenn man alles einbezieht.
- **15–25 %**: Token-Reduktion durch das Hinzufügen von *« be concise »* zu Prompts (FinOps Foundation).
- **4 Teile**: 1. **LLM Workflows**: Die Inferenz dominiert; Optimierungen = Model-Right-Sizing, prägnante Prompts, Caching, Rate Limiting, Aufspüren von Ineffizienzen. 2. **RAG**: Neue Kostenstellen jenseits der Inferenz (Vektordatenbank-Speicherung, Embedding-Generierung, Retrieval, größere Prompts, Orchestrierung, Datentransfer); Optimierung = top-k begrenzen, keine überschüssigen Dokumente injizieren, nur Neues embedden. 3. **AI Agents**: Multiplikatoren (mehrfache LLM-Aufrufe, Tool-Kosten, Orchestrierungs-Overhead, Ausführungszeit, Wiederholungsversuche); Hebel = **Limit the Loop** (Schritte begrenzen, z. B. maximal 10), Kontext begrenzen, **Tiered Reasoning** (zunächst günstiges Modell, teures nur bei geringer Konfidenz), Tool-Aufrufe bündeln, Alarme (*« $1/session = abnormal »*). 4. **Agentic AI**: der **Cost Iceberg** — **über 80 % der realen Kosten** sind verborgen (Integrationen = individuelle Entwicklungsprojekte, menschliche Aufsicht, MLOps, Compliance, Observability, Scope Creep).
- **Coding agents**: das kanonische Beispiel für das Tool-Use-Muster (das LLM ruft ein *« execute code »*-Tool auf, liest die Ausgabe, macht weiter); Rat = Schritte begrenzen, um Endlosschleifen zu vermeiden, identische Ausführungsergebnisse cachen, einfache Aufgaben an kleinere Modelle weiterleiten, bei Anomalien alarmieren, Validierung/Tests bündeln.
- **Agentic Governance**: Full-Stack-Sichtbarkeit (einheitliches Dashboard), Showback/Chargeback pro Geschäftsbereich, gemeinsam genutzte Infrastruktur (Vektorspeicher/Monitoring nicht neu erfinden), **Budgetobergrenzen pro Agent**, automatische **Kill Switches** (*« $100 in 1h → shutdown »*), Sandbox vor dem Produktivbetrieb, wöchentliche/monatliche Reviews, kulturelle Schulung.
- **Metaphern zum Merken**: *« an AI agent is like an overly eager junior employee »* ; *« success can breed scope creep »* ; der *Cost Iceberg* ; KPI *« Cost per Decision / Cost per Ticket Resolved »*.
- **Bezug zur Veille**: Segment „agentic cost anatomy" des FinOps-Clusters — quantifiziert die von Gupta referenzierten Multiplikatoren (5–10× beim gleichen Workflow/Input), DORA, Salesforce. Ergänzt den offiziellen Leitfaden [[finops-foundation-finops-for-ai-overview-2026-02-17]], den Allokations-Beitrag [[finout-finops-ai-agents-four-step-allocation-framework-2026-04-27]] und den Cost-per-Outcome-Beitrag [[orq-ai-finops-ai-agents-cost-per-outcome-hosseini-2026-04-15]]. Slot **Cost Optimization / Agentic FinOps**.

## RésuméDe400mots

Dieser CPO-Leitfaden von Finout (November 2025) untersucht die Kostenimplikationen von KI-Architekturen anhand von vier Komplexitätsstufen und zeigt, dass die Kosten nahezu exponentiell ansteigen, wenn man von einem einfachen LLM-Workflow zu einem autonomen agentischen System übergeht.

Der rote Faden ist eine Reihe quantifizierter **Token-Multiplikatoren**. Ein Chatbot, der in einer Demo mit 200 Tokens antwortet, verbraucht in der Produktion **1.200 Tokens** (6×), sobald Prüfungen und mehrstufiges Reasoning hinzukommen. Die FinOps Foundation beobachtet eine Varianz von **30× bis 200×** zwischen einer unoptimierten und einer gut optimierten Bereitstellung. Ein Agent löst typischerweise **5 LLM-Aufrufe statt einem** aus (~5×). Und vor allem erreichen die realen Gesamtkosten **das 5- bis 10-Fache der direkten Cloud-Rechnung**, wenn man alles einbezieht.

**Teil 1 – LLM-Workflows**: Die Inferenz pro Token dominiert; die Hebel sind Model-Right-Sizing, prägnante Prompts (das Hinzufügen von *"be concise"* reduziert die Tokens um 15–25 %), Caching und Rate Limiting. **Teil 2 – RAG**: Über die Inferenz hinaus entstehen neue Kostenstellen (Vektordatenbank-Speicherung, Embedding-Generierung, Retrieval, durch injizierten Kontext erweiterte Prompts, Orchestrierung, Datentransfer); Optimierung bedeutet, top-k zu begrenzen und nur neue Daten zu embedden. **Teil 3 – KI-Agenten**: Die Multiplikatoren entstehen durch wiederholte LLM-Aufrufe, Tool-Kosten, Orchestrierungs-Overhead und Wiederholungsversuche; die zentralen Hebel sind **"Limit the Loop"** (Begrenzung der Schritte, z. B. maximal 10), **Tiered Reasoning** (zunächst ein günstiges Modell, ein teures Modell nur bei geringer Konfidenz), das Bündeln von Tool-Aufrufen und Schwellenwert-Alarme.

**Teil 4 – Agentic AI** führt das zentrale Konzept des **Cost Iceberg** ein: **über 80 % der realen Kosten** eines agentischen Systems liegen unterhalb der Wasserlinie verborgen (jede Integration wird zu einem individuellen Entwicklungsprojekt, mit fachkundiger menschlicher Aufsicht, MLOps, Compliance, Observability und *Scope Creep* — *"success can breed scope creep"*). Die empfohlene Governance: Full-Stack-Sichtbarkeit, Showback/Chargeback pro Einheit, gemeinsam genutzte Infrastruktur, **Budgetobergrenzen pro Agent**, automatische **Kill Switches** ($100 in einer Stunde → Abschaltung), Sandboxing vor dem Produktivbetrieb und die Kultivierung eines *Cost-Aware Mindset*.

Für **coding agents** – das kanonische Beispiel für Tool-Use – lautet der praktische Rat: Schritte begrenzen, um Endlosschleifen zu vermeiden, identische Ausführungsergebnisse cachen, einfache Aufgaben an kleinere Modelle weiterleiten und die Validierung bündeln. Prägende Metapher: *"an AI agent is like an overly eager junior employee"* – gewissenhaft, aber aufsichtsbedürftig.

## GrapheDeConnaissance

- Finout —publie→ guide CPO FinOps (Finout) (DOCUMENT, 0.97)
- systèmes agentiques —permet→ croissance exponentielle des coûts (CONCEPT, 0.94)
- chatbot en production —mesure→ 6× les tokens de la démo (MESURE, 0.93)
- Cost Iceberg —affirme_que→ 80%+ du coût réel est caché (AFFIRMATION, 0.95)
- coût réel agentique —mesure→ 5-10× la facture cloud directe (MESURE, 0.92)
- agent IA —mesure→ ~5 appels LLM par tâche (MESURE, 0.9)
- Limit the Loop —réduit→ étapes d'un agent (CONCEPT, 0.93)
- tiered reasoning —réduit→ coût (modèle cheap puis cher) (CONCEPT, 0.92)
- prompt concis —réduit→ tokens de 15-25% (CONCEPT, 0.88)
- kill switch —résout→ dépense agent anormale (CONCEPT, 0.9)
- coding agent —est_instance_de→ pattern tool-use multi-étapes (CONCEPT, 0.91)
- FinOps Foundation —mesure→ variance de coût 30×-200× (MESURE, 0.9)

---
Canonical: https://www.thekb.eu/de/fiches/finout-cpo-guide-llm-rag-agents-agentic-token-multipliers-2025-11-02/
