Saltar al contenido

root / tags / swe-bench-verified

#SWE-bench Verified

2 fiches

Herramientas y Plataformas Traducción verificada automáticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Análisis del gabinete de ingeniería de SFEIR («una lectura de ingeniero») sobre el lanzamiento, el 16 de julio de 2026, de **Kimi K3** por el laboratorio chino **Moonshot AI**: un **modelo de pesos abiertos (open-weights) de nivel frontera** cuyo proveedor afirma **~2,8 billones de parámetros**, un **contexto de un millón de tokens** y una **publicación de los pesos antes del 27 de julio de 2026** (probablemente bajo una licencia Modified MIT, como en el linaje K2). Tesis: una capacidad que antes se creía reservada a los grandes propietarios (Anthropic, OpenAI, Google) está pasando a estar disponible **en pesos abiertos, a precio de descuento, desde un laboratorio chino**. SFEIR —pese a ser **partner de Anthropic y de Google Cloud**, y por tanto «sin ningún interés en sobrevender un modelo chino»— adopta una **advertencia metodológica** cardinal: el día del lanzamiento **no existe ninguna tabla de benchmarks oficial y completa**; las especificaciones (2,8 billones, Kimi Delta Attention, +25 % de eficiencia de entrenamiento) y las puntuaciones son **declaradas por el proveedor** o proceden de **arenas comunitarias**, «que deben tratarse como afirmaciones, no como hechos medidos». La nueva arquitectura (**Kimi Delta Attention**, atención lineal híbrida; decodificación que se afirma hasta **6,3 veces más rápida** a 1M de tokens) rompe con la cadencia de K2 (K2 jul. 2025 → K2.7 Code jun. 2026, un modelo insignia cada dos meses); dos variantes acompañan el lanzamiento (**K3 Max**, **K3 Swarm Max**), con el retiro forzado de la serie kimi-k2.5/moonshot-v1 el **31 de agosto de 2026**. **La verdadera arma es el precio** (~3 $/M de entrada, 0,30 $ en caché, 15 $ de salida según fuentes secundarias): un modelo frontera de pesos abiertos a este nivel **arrastra hacia abajo toda la curva de precio-rendimiento** — la comoditización de la capa de modelo, acelerada por el open source. Pero la singularidad decisiva no es una puntuación: es la **reversibilidad**. Un modelo frontera de pesos abiertos convierte una API consumida (dependencia del proveedor) en una **opción** (autoalojamiento, portabilidad, salida del lock-in), al precio de una infraestructura pesada para alojar 2,8 billones de parámetros. La postura de SFEIR: **el open-weights cambia la pregunta, no solo la respuesta** — ya no «¿qué modelo es mejor/más barato?», sino «¿qué parte de mi sistema estoy dispuesto a hacer depender de un proveedor que no controlo?». La postura correcta sigue siendo un **portafolio enrutado** (un modelo por tarea, un modelo por restricción), y Kimi K3 añade una **columna «reversibilidad»** a la grilla de decisión. La convicción «AI Only» permanece intacta: el modelo es un commodity, la ventaja duradera reside en la ingeniería que lo rodea (Context Engineering, harness, gobernanza de costes, capacidad de cambiar de opinión). Las cifras aún deben validarse «por cuenta propia» — en tus propios repositorios, con tus propios datos.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Herramientas y Plataformas Traducción verificada automáticamente

Claude Opus 4.8 pour le SEO : le Workflow en Deux Phases que Presque Tout le Monde Rate

Entrada de blog de **Pasquale Pillitteri** (ingeniero de software, Palermo) publicada el **29 de mayo de 2026** (versión FR), lectura de 18 minutos, sección *Claude Code & Anthropic*. **Tesis central**: *« Claude Opus 4.8 es el modelo de SEO más potente de 2026, pero casi todo el mundo lo usa mal »* — no es un problema de modelo sino un problema de **sistema**. La regla de oro: ***« la estrategia es una pizarra, la producción es una cadena de montaje »*** — el SEO debe **dividirse en dos fases distintas**, y mezclarlas es *« la forma más rápida de desperdiciar un modelo que cuesta cinco dólares por millón de tokens de entrada y veinticinco por los de salida »*. **Contexto del modelo**: Opus 4.8 se lanzó el **28 de mayo de 2026** (41 días después de Opus 4.7), contexto de **1M de tokens**, **GraphWalks Long-Context F1 a 1M: 40,3% → 68,1%**, **SWE-bench Verified 88,6%**, **USAMO 2026 96,7%** (+27,4 pts), **HLE con herramienta 57,9%**, precio sin cambios de **$5/$25** por millón de tokens, **Fast Mode 2,5× a $10/$50**, cuatro **niveles de esfuerzo** (Low, High, Extra, Max). **El antipatrón central** = *« la conversación gigante »* / **context drift**: mezclar estrategia, investigación de palabras clave, análisis competitivo y redacción en un único chat produce una *« amalgama de intenciones contradictorias »* → el modelo se desliza hacia **buenas prácticas genéricas** ("optimización holística", "enfoque estratégico") en lugar de contenido anclado en datos. **Fase 1 — Estrategia (pizarra, interfaz visual, puntual)**: dashboard / Google Sheet / lienzo de Claude.ai para decidir mientras se observan los datos juntos. **3 jugadas**: (a) **investigación de palabras clave clasificada** (tabla de volumen / dificultad 0-100 / intención / potencial de negocio / prioridad = volumen÷dificultad×peso de negocio); (b) **análisis competitivo visual** (matriz de cobertura de temas, huecos); (c) **hoja de ruta por fases** (quick wins M1-2 / medio plazo M3-6 / páginas pilar M7-12). El modo **Extra/Max** se justifica aquí (*« una decisión estratégica acertada vale más que mil páginas bien escritas sobre las palabras clave equivocadas »*). 3 artefactos cerrados guardados en Notion/Drive. **Fase 2 — Producción (cadena de montaje, Opus 4.8 + MCP)**: el modelo pasa de estratega a **máquina de ejecución**; cada decisión **anclada a datos en vivo** a través del **Model Context Protocol**. **Stack MCP mínimo**: **GSC MCP** (AminForou/mcp-gsc, 500+ estrellas), **Ahrefs MCP oficial** (98 estrellas), **GA4 MCP**; el repositorio `modelcontextprotocol/servers` = **86.440 estrellas**, **más de 10.000 servidores activos**, 97M de descargas del SDK al mes. Configuración ~35 min, actualización mensual ~20 min. **Bucle semanal**: un único prompt extrae datos en vivo, construye el brief (top 10 SERP + GSC + Ahrefs), deriva los H2/H3, redacta, verifica la densidad, sugiere títulos → **+45% de productividad**, borrador en **6-12 min** (referencia explícita al **content engineering de Ryan Law / Ahrefs**, 23 skills). Menciona los **Dynamic Workflows** de Anthropic (hasta 1.000 subagentes). **4 errores frecuentes**: (1) no verificar las cifras (comprobación puntual obligatoria, *trust & verify*); (2) sustituir por completo Semrush/Ahrefs (MCP es una **capa adicional**, no un sustituto); (3) ignorar el **desfase de contenido pago-orgánico** (caso de cliente de educación: **2.742 términos desperdiciados / 351 oportunidades** identificadas en 90 s); (4) usar Opus 4.8 donde **Haiku 4.5** basta (meta descripciones, texto alternativo). **Coste**: $1-3 por artículo de 2.500 palabras. **Sonnet 4.6** basta para la producción recurrente; Opus 4.8 se reserva para la estrategia. Artículo optimizado para SEO y autorreferencial (el autor escribe sobre SEO en un contenido diseñado a su vez para posicionar en "Opus 4.8 SEO"). Convergencia directa con **Ryan Law/Ahrefs** (citado), **sistemas alrededor del modelo** (Dropbox/Okumura), **skills-over-prompts** (Lattice), enrutamiento de modelos Haiku/Sonnet/Opus (Gupta token-to-outcome).

#Claude Opus 4.8#SEO con IA#flujo de trabajo en dos fases

**Pasquale Pillitteri** — Ingénieur informatique / développeur logiciel basé à **Palerme** (Italie) · certifié Innovation Manager UNI 11814:2021. Auteur d'un blog tech actif (rubrique *Claude Code & Anthropic*) · avec une newsletter hebdomadaire (~3,4k lecteurs). Article publié en version **FR** le **29 mai 2026** (lendemain de la sortie d'Opus 4.8).