Análisis del gabinete de ingeniería de SFEIR («una lectura de ingeniero») sobre el lanzamiento, el 16 de julio de 2026, de **Kimi K3** por el laboratorio chino **Moonshot AI**: un **modelo de pesos abiertos (open-weights) de nivel frontera** cuyo proveedor afirma **~2,8 billones de parámetros**, un **contexto de un millón de tokens** y una **publicación de los pesos antes del 27 de julio de 2026** (probablemente bajo una licencia Modified MIT, como en el linaje K2). Tesis: una capacidad que antes se creía reservada a los grandes propietarios (Anthropic, OpenAI, Google) está pasando a estar disponible **en pesos abiertos, a precio de descuento, desde un laboratorio chino**. SFEIR —pese a ser **partner de Anthropic y de Google Cloud**, y por tanto «sin ningún interés en sobrevender un modelo chino»— adopta una **advertencia metodológica** cardinal: el día del lanzamiento **no existe ninguna tabla de benchmarks oficial y completa**; las especificaciones (2,8 billones, Kimi Delta Attention, +25 % de eficiencia de entrenamiento) y las puntuaciones son **declaradas por el proveedor** o proceden de **arenas comunitarias**, «que deben tratarse como afirmaciones, no como hechos medidos». La nueva arquitectura (**Kimi Delta Attention**, atención lineal híbrida; decodificación que se afirma hasta **6,3 veces más rápida** a 1M de tokens) rompe con la cadencia de K2 (K2 jul. 2025 → K2.7 Code jun. 2026, un modelo insignia cada dos meses); dos variantes acompañan el lanzamiento (**K3 Max**, **K3 Swarm Max**), con el retiro forzado de la serie kimi-k2.5/moonshot-v1 el **31 de agosto de 2026**. **La verdadera arma es el precio** (~3 $/M de entrada, 0,30 $ en caché, 15 $ de salida según fuentes secundarias): un modelo frontera de pesos abiertos a este nivel **arrastra hacia abajo toda la curva de precio-rendimiento** — la comoditización de la capa de modelo, acelerada por el open source. Pero la singularidad decisiva no es una puntuación: es la **reversibilidad**. Un modelo frontera de pesos abiertos convierte una API consumida (dependencia del proveedor) en una **opción** (autoalojamiento, portabilidad, salida del lock-in), al precio de una infraestructura pesada para alojar 2,8 billones de parámetros. La postura de SFEIR: **el open-weights cambia la pregunta, no solo la respuesta** — ya no «¿qué modelo es mejor/más barato?», sino «¿qué parte de mi sistema estoy dispuesto a hacer depender de un proveedor que no controlo?». La postura correcta sigue siendo un **portafolio enrutado** (un modelo por tarea, un modelo por restricción), y Kimi K3 añade una **columna «reversibilidad»** a la grilla de decisión. La convicción «AI Only» permanece intacta: el modelo es un commodity, la ventaja duradera reside en la ingeniería que lo rodea (Context Engineering, harness, gobernanza de costes, capacidad de cambiar de opinión). Las cifras aún deben validarse «por cuenta propia» — en tus propios repositorios, con tus propios datos.
**Informe periódico de Mozilla**, *The state of open source AI*, **v1.0.1, julio de 2026**, presentado mediante una carta de **Raffi Krikorian** (CTO): siete secciones, un sitio interactivo y un informe descargable. Tesis enunciada en el título de la Sección 1: *« La capa del modelo se ha convertido en una commodity. El valor se acumula en el harness que se sitúa por encima. »* **Estado de las capacidades**: en el *Artificial Analysis Intelligence Index v4.1*, el mejor modelo cerrado obtiene **61** puntos (Claude Opus 5) y el mejor modelo abierto **57** (**Kimi K3**), cuarto en el ranking general y por delante de tres de los mayores laboratorios cerrados; en el *Epoch Capabilities Index*, la brecha es de **6 puntos** (K3 en 156 frente a GPT-5.6 Sol en 162), descrita como *« más o menos un ciclo de lanzamiento »*, con intervalos de confianza que se solapan. **Frontera en diente de sierra**: el open lidera en código frontend (K3 con 1.679 Elo en LMArena Frontend Code Arena, seis dominios de siete), disputa el trabajo agéntico en terminal (88,3 frente a 88,8 en Terminal-Bench 2.1) y cede terreno en trabajo profesional de conocimiento (Fable 5 supera a K3 por 92 Elo en GDPval-AA v2). **Cambio de uso**: la cuota de tokens de OpenRouter dirigida a modelos de pesos abiertos pasó de un nivel insignificante a un tercio a finales de 2025, y luego a una **mayoría a mediados de 2026**, con los siete modelos de mayor volumen todos de pesos abiertos —el propio informe señala que *« por número de solicitudes, los proveedores cerrados estadounidenses siguen liderando »*, siendo el liderazgo del open un liderazgo en volumen de tokens concentrado en cargas de trabajo de código y agénticas. **El contraste central**: *« El open es fácil de lanzar. El open es difícil de desplegar. »* —el 79% de los desarrolladores que añaden IA usan modelos abiertos frente al 71% para los cerrados, pero solo el **53%** de los equipos que usan modelos abiertos llega a producción **frente al 63%**, y la brecha se amplía con el tamaño de la organización (cerrado 54% → 73%, abierto 53% → 57%), lo que *« descarta una explicación por recursos »*. El mapa de madurez del stack (48 componentes, 9 capas) muestra dos columnas sistemáticamente frías —**estandarización** y ***preparación empresarial***— identificadas como la brecha operativa. **Sección 5**: *« El harness agéntico es otro agente de usuario »*, y *« El modelo se está comiendo al harness »* —en todos los modelos donde ambos coexisten, el harness propio del laboratorio gana ahora, y la brecha de 21,8 puntos se ha comprimido a unos 3. De ahí la fórmula: *« Un harness ajustado con precisión a los pesos de un laboratorio… se degrada con el modelo de cualquier otro, así que cuanto más ajustado está, menos intercambiables son los pesos que hay debajo. El lock-in llega como efecto secundario de la optimización. »*
#Mozilla#state of open source AI#pesos abiertos
**Mozilla** — éditeur du rapport · avec une introduction signée **Raffi Krikorian** · *Chief Technology Officer*. Publié en **juillet 2026** (v1.0.1). Données issues de sources tierces créditées (Artificial Analysis, Epoch AI, OpenRouter, LMArena) et d'une enquête propre menée avec **SlashData** (*Mozilla / SlashData 2026 developer survey*, n = 1 410 sur la question des freins).
Síntesis de Addy Osmani (Google, Chrome/Cloud) sobre el campo emergente de la *harness engineering*: la ecuación `agent = model + harness`, el principio *ratchet* ("cada error se convierte en una regla"), el replanteamiento "skill issue" de HumanLayer, la evidencia de Terminal Bench (de Top 30 a Top 5 solo con un cambio de harness), la arquitectura en capas de Claude Code, la visión de Anthropic "los harnesses no se reducen, se desplazan", y Harness-as-a-Service (Claude Agent SDK, Codex SDK, OpenAI Agents SDK). Artículo bisagra que consolida a Trivedy, HumanLayer, Anthropic y Böckeler en una doctrina.
#harness engineering#agent harness#Addy Osmani
Addy Osmani (Software Engineer at Google, Cloud + Gemini)