# finops-foundation-finops-for-ai-overview-2026-02-17

## Veille

Guía oficial de la FinOps Foundation sobre IA: economía de tokens, KPIs, caching, optimización de prompts, selección de modelos y extensión de las 14 capacidades del FinOps Framework a los servicios de IA generativa - FinOps Foundation

## Titre Article

FinOps for AI Overview

## Date

2026-02-17

## URL

https://www.finops.org/wg/finops-for-ai-overview/

## Keywords

FinOps Foundation, economía de tokens, coste por token, coste por inferencia, optimización de LLM, caching, ingeniería de prompts, selección de modelos, MMLU, Crawl Walk Run, KPIs de FinOps para IA, showback, unit economics, ROI de IA, certificación FinOps for AI

## Authors

FinOps Foundation — groupe de travail (Brent Eubanks/Wayfair, James Barney/MetLife, Eric Lam/Google, Adam Richter/AWS, Rahul Kalva/Wells Fargo, JJ Sharma/KPMG, Karl Hayberg/EY, et al.)

## Ton

**Perfil**: Perspectiva de organismo normativo (grupo de trabajo multiempresa), registro normativo y exhaustivo, nivel de practicante FinOps experimentado

**Descripción**: Documento de referencia colectivo, coescrito por un amplio grupo de trabajo que representa a grandes empresas (Google, AWS, MetLife, Wells Fargo, Roche, Accenture, KPMG, EY…). El tono es el de un estándar bajo licencia CC BY 4.0: neutro, estructurado, agnóstico respecto a proveedores, orientado a la exhaustividad más que a la argumentación. Cada KPI se presenta con su fórmula y un ejemplo resuelto; cada una de las 14 capacidades del FinOps Framework se examina bajo el criterio "común a la nube / diferente para la IA". La progresión se enmarca en un modelo de madurez Crawl-Walk-Run. Público destinatario: profesionales FinOps en ejercicio, equipos de Finanzas/Ingeniería/Datos y candidatos a la certificación *Certified FinOps for AI*.

## Pense-betes

- **Token = unidad fundamental** del consumo de las API de LLM; *"los medidores, o elementos de facturación, pueden ser muy diferentes"* de las métricas clásicas de la nube (brecha entre los tokens de entrada del usuario y los tokens semánticos facturados).
- **KPIs con fórmulas y ejemplos**:
- **Cost Per Token** = Coste total / Tokens usados (p. ej., 2.500 $ / 1M = 0,0025 $).
- **Cost Per Inference** = Costes de inferencia / Número de solicitudes (p. ej., 5.000 $ / 100.000 = 0,05 $).
- **Training Cost Efficiency** = Coste de entrenamiento / métrica de rendimiento (p. ej., 10.000 $ / 95% = 105 $ por punto).
- **ROI** = (Beneficios − Costes) / Costes × 100 (p. ej., 150%).
- **LLM Model Choice Quality Score Alignment**: compara la MMLU mínima requerida con la MMLU del modelo utilizado → identifica el despilfarro (p. ej., una tarea de análisis de sentimiento que requiere MMLU 54 no debería ejecutarse en GPT-4).
- **Optimización de tokens**: acortar los prompts preservando la claridad; **caching** de respuestas repetidas; *"evitar usar los modelos más complejos y costosos para cada tarea"*; **destilación de modelos** (versiones más pequeñas de GPT-4/Claude para producción).
- **14 capacidades del FinOps Framework** revisadas para la IA — las más diferenciadas: Data Ingestion, **Allocation** (trazabilidad de las *cargas de trabajo multiagente*, ausencia de un marco estándar), Planning & Estimating (estimar resultados exitosos frente a alucinaciones), Forecasting (menor previsibilidad en Crawl/Walk), Budgeting, Benchmarking (por token, pocos benchmarks externos), Unit Economics (coste por llamada, satisfacción del cliente por dólar), Rate Optimization (OpenAI Scale Tier), Cloud Sustainability (impacto ambiental por solicitud).
- **Modelo de madurez Crawl → Walk → Run**: Crawl = prototipado *fail-fast*, cálculos manuales; Walk = automatización básica de seguimiento + detección de anomalías; Run = seguimiento y detección de anomalías avanzados, métricas financieras integradas, evitar recortes de costes que comprometan los requisitos no funcionales.
- **8 modelos de precios**: bajo demanda, reservado/CUD, capacidad aprovisionada (OpenAI Scale Tier, Azure PTU), spot/batch, suscripción, escalonado, gratuito/freemium, híbrido.
- **Showback** favorecido (visibilidad sin facturación inmediata) como herramienta de concienciación previa al chargeback.
- **Herramientas citadas**: Langfuse, Langsmith, Prometheus, Grafana, OTEL; nativas de AWS/GCP/Azure (Bedrock, Vertex AI, Azure OpenAI); frameworks de optimización GGUF/ONNX/OpenVINO/TensorRT; bases de datos vectoriales (Kendra, OpenSearch, pgvector, Cosmos DB).
- **Nota**: el documento aún no trata a los **agentes de IA** como una categoría distinta (solo se mencionan las *cargas de trabajo multiagente* bajo Allocation) — de ahí el valor de los complementos de proveedores (Finout, Orq.ai).
- **Ecosistema**: certificación *Certified FinOps for AI*; conferencia **FinOps X 2026** (8-11 de junio, San Diego); licencia CC BY 4.0.
- **Enlace de veille**: base doctrinal oficial del clúster de FinOps agéntico — ampliada por [[finout-finops-ai-agents-four-step-allocation-framework-2026-04-27]] (allocation), [[finout-cpo-guide-llm-rag-agents-agentic-token-multipliers-2025-11-02]] (multiplicadores de tokens), [[orq-ai-finops-ai-agents-cost-per-outcome-hosseini-2026-04-15]] (coste por resultado). Referencias cruzadas con Gupta (coste por token, utilidad marginal del token) y el bloque **Cost optimization**.

## RésuméDe400mots

*FinOps for AI Overview* es la guía de referencia de la FinOps Foundation, coescrita por un amplio grupo de trabajo (Google, AWS, MetLife, Wells Fargo, Roche, Accenture, KPMG, EY…) y publicada bajo licencia CC BY 4.0. Extiende la disciplina FinOps a los servicios de IA generativa, partiendo del token como unidad fundamental de consumo, cuyos "medidores" difieren profundamente de las métricas clásicas de la nube.

El documento ofrece una batería de **KPIs con fórmulas y ejemplos resueltos**: Cost Per Token (coste total / tokens), Cost Per Inference (costes de inferencia / solicitudes, p. ej., 0,05 $), Training Cost Efficiency (coste / punto de precisión), ROI ((beneficios − costes)/costes × 100), y sobre todo el *LLM Model Choice Quality Score Alignment*, que compara la puntuación MMLU mínima que requiere una tarea con la MMLU del modelo realmente utilizado, para detectar el sobreaprovisionamiento (una tarea de análisis de sentimiento que requiere MMLU 54 no debería ejecutarse en GPT-4).

En cuanto a la **optimización**, el enfoque se centra en la reducción de tokens (acortar los prompts preservando la claridad), el **caching** de respuestas repetidas, la **selección de modelos** (*"evitar usar los modelos más complejos y costosos para cada tarea"*), y la **destilación de modelos** para producción.

El núcleo estructural mapea las **14 capacidades del FinOps Framework** en "común a la nube" frente a "diferente para la IA". Las más afectadas: **Allocation** (trazabilidad de las *cargas de trabajo multiagente*, ausencia de un marco estándar), Planning (estimar resultados exitosos y separarlos de las alucinaciones), Forecasting (menor previsibilidad en las fases iniciales), Benchmarking (métricas por token, pocos benchmarks externos), Unit Economics (coste por llamada, satisfacción del cliente por dólar) y Rate Optimization (precios volátiles como OpenAI Scale Tier).

La progresión de madurez sigue un modelo **Crawl → Walk → Run**: prototipado *fail-fast* y cálculos manuales al inicio; automatización básica de seguimiento y detección de anomalías a continuación; seguimiento avanzado, métricas financieras integradas y vigilancia frente a recortes de costes que comprometan los requisitos no funcionales en la fase Run. El documento enumera **ocho modelos de precios** (bajo demanda, reservado/CUD, aprovisionado — OpenAI Scale Tier, Azure PTU —, spot/batch, suscripción, escalonado, freemium, híbrido) y favorece el **showback** como palanca de concienciación previa al chargeback.

Una limitación notable: los **agentes de IA** aún no se tratan como una categoría distinta (solo las *cargas de trabajo multiagente* aparecen bajo Allocation), lo que explica el valor de los complementos de proveedores. La guía va acompañada de una certificación *Certified FinOps for AI* y remite a FinOps X 2026 (junio, San Diego).

## GrapheDeConnaissance

- FinOps Foundation —publie→ FinOps for AI Overview (DOCUMENT, 0.98)
- FinOps for AI Overview —affine→ Framework FinOps (METHODOLOGIE, 0.97)
- token —est_instance_de→ unité fondamentale de consommation LLM (CONCEPT, 0.97)
- Cost Per Token —est_basé_sur→ Coût total / tokens utilisés (CONCEPT, 0.96)
- sélection de modèle —réduit→ coûts inutiles (CONCEPT, 0.94)
- MMLU —permet→ alignement capacité modèle / besoin tâche (CONCEPT, 0.92)
- caching —réduit→ consommation de tokens (CONCEPT, 0.93)
- prompt engineering concis —réduit→ tokens (15-25%) (CONCEPT, 0.88)
- 14 capacités revisitées pour l'IA —fait_partie_de→ Framework FinOps (METHODOLOGIE, 0.95)
- modèle Crawl-Walk-Run —s_applique_à→ maturité FinOps IA (CONCEPT, 0.94)
- FinOps for AI Overview —affirme_que→ l'allocation est compliquée par les multi-agent workloads (AFFIRMATION, 0.9)
- showback —permet→ prise de conscience des coûts (CONCEPT, 0.9)
- FinOps Foundation —a_créé→ certification Certified FinOps for AI (CONCEPT, 0.92)

---
Canonical: https://www.thekb.eu/es/fiches/finops-foundation-finops-for-ai-overview-2026-02-17/
