Informe de investigación interno fechado el **12 de agosto de 2026** (en formato *What? — So What? — Now What?*, investigación realizada los días 11 y 12 de agosto) sobre una pregunta simple: ¿son las aplicaciones **de escritorio** de ChatGPT y Claude mejores que sus versiones **web**? La respuesta llega en dos partes. **(A) Existe un consenso cualitativo sólido y bien documentado.** El punto de partida es indiscutible: el escritorio y la web llaman exactamente a los mismos modelos en la nube, siendo la aplicación una simple interfaz hacia el servicio — la ganancia reside, por tanto, enteramente en la capa de aplicación (latencia de acceso, estabilidad en sesiones largas, huella de memoria, integraciones con el sistema, fluidez del flujo de trabajo). Lo que distingue verdaderamente al escritorio, confirmado: del lado de OpenAI, un atajo global (Option/Alt + Espacio), una *companion window* que permanece siempre en primer plano, capturas de pantalla nativas, y desde julio de 2026 la capacidad agéntica **Codex/Work** integrada en la aplicación; del lado de Anthropic, **Quick Entry** (macOS), **Desktop Extensions** (instalar un servidor **MCP** local se vuelve *«tan simple como hacer clic en un botón»*), acceso a archivos locales, **Cowork** y **Computer Use** (permisos de Accesibilidad y grabación de pantalla). La web conserva dos fortalezas confirmadas: pestañas/hilos múltiples y universalidad sin necesidad de instalar un cliente. **(B) Casi todas las cifras que circulan en apoyo de este consenso no resisten la verificación.** La auditoría crítica del informe (§1.5) clasifica como **no confirmadas** siete afirmaciones numéricas ampliamente repetidas: el *cold start* «2-3 s frente a 8-12 s» (el único rastro es una mención anecdótica de «carga en unos 3 segundos» en Substack); el uso de RAM «200-700 MB frente a 1,2-2 GB», atribuido a un «Alibaba Product Insights» cuyas páginas devuelven **404**; una tasa de fallos y una cifra de retención de sesión imposibles de rastrear; un «Claude +10-20% de extremo a extremo» atribuido a **Skywork**, que en realidad había evaluado su propio agente de Windows en lugar de comparar Claude con la web; una fuente «Cosmo Edge» imposible de rastrear; citas no confirmadas de Zenken AI; y dos publicaciones de X sin autenticar y sin URL. La señal contraria está documentada con el mismo rigor: Yuri Dvoinos describe una aplicación Claude Desktop que *«me dan ganas de tirar el portátil por la ventana»* — un uso de CPU del 68% y retraso de entrada en un MacBook Pro — y el informe señala que ambas aplicaciones están construidas sobre **Electron** con capas nativas. De ahí su formulación: *la ventaja del escritorio es una promesa de implementación, no una ley de la naturaleza.* **El «So What»**: dado que el modelo se ha convertido en el denominador común, la interfaz se convierte en el campo de batalla — la fusión **Codex + ChatGPT** del 9 de julio de 2026 y el tándem Cowork/Computer Use cuentan la misma historia, *«la aplicación de escritorio ya no es un cliente de chat, es un entorno de ejecución de agentes con acceso a la máquina»*. Tres consecuencias: la ganancia es una ganancia de **fricción**, no de potencia; para un CIO, el escritorio **desplaza el límite de confianza** — Computer Use requiere permisos del sistema sensibles y la fusión de Codex sitúa la ejecución de código, el navegador y los conectores dentro de *«un único límite de confianza ampliado»*, mientras que el navegador sigue siendo gobernable mediante SSO, DLP y CASB; y para quien publica, la fragilidad de las cifras es en sí misma la noticia. **El «Now What»** aporta criterios individuales de cambio, una lista de verificación para CIO (inventariar los permisos, desactivar Computer Use y Cowork por defecto, delimitar qué extensiones MCP están autorizadas, organizar la distribución y las actualizaciones — en Linux, fuera del repositorio apt, Claude Desktop no se actualiza solo) y una directriz editorial: citar únicamente citas textuales confirmadas y fechas.
#ChatGPT Desktop#Claude Desktop#versión web
**Deep Research Veille Interne** — rapport non signé · produit par une enquête sourcée menée les **11-12 août 2026** et rendu le 12.
Análisis del gabinete de ingeniería de SFEIR («una lectura de ingeniero») sobre el lanzamiento, el 16 de julio de 2026, de **Kimi K3** por el laboratorio chino **Moonshot AI**: un **modelo de pesos abiertos (open-weights) de nivel frontera** cuyo proveedor afirma **~2,8 billones de parámetros**, un **contexto de un millón de tokens** y una **publicación de los pesos antes del 27 de julio de 2026** (probablemente bajo una licencia Modified MIT, como en el linaje K2). Tesis: una capacidad que antes se creía reservada a los grandes propietarios (Anthropic, OpenAI, Google) está pasando a estar disponible **en pesos abiertos, a precio de descuento, desde un laboratorio chino**. SFEIR —pese a ser **partner de Anthropic y de Google Cloud**, y por tanto «sin ningún interés en sobrevender un modelo chino»— adopta una **advertencia metodológica** cardinal: el día del lanzamiento **no existe ninguna tabla de benchmarks oficial y completa**; las especificaciones (2,8 billones, Kimi Delta Attention, +25 % de eficiencia de entrenamiento) y las puntuaciones son **declaradas por el proveedor** o proceden de **arenas comunitarias**, «que deben tratarse como afirmaciones, no como hechos medidos». La nueva arquitectura (**Kimi Delta Attention**, atención lineal híbrida; decodificación que se afirma hasta **6,3 veces más rápida** a 1M de tokens) rompe con la cadencia de K2 (K2 jul. 2025 → K2.7 Code jun. 2026, un modelo insignia cada dos meses); dos variantes acompañan el lanzamiento (**K3 Max**, **K3 Swarm Max**), con el retiro forzado de la serie kimi-k2.5/moonshot-v1 el **31 de agosto de 2026**. **La verdadera arma es el precio** (~3 $/M de entrada, 0,30 $ en caché, 15 $ de salida según fuentes secundarias): un modelo frontera de pesos abiertos a este nivel **arrastra hacia abajo toda la curva de precio-rendimiento** — la comoditización de la capa de modelo, acelerada por el open source. Pero la singularidad decisiva no es una puntuación: es la **reversibilidad**. Un modelo frontera de pesos abiertos convierte una API consumida (dependencia del proveedor) en una **opción** (autoalojamiento, portabilidad, salida del lock-in), al precio de una infraestructura pesada para alojar 2,8 billones de parámetros. La postura de SFEIR: **el open-weights cambia la pregunta, no solo la respuesta** — ya no «¿qué modelo es mejor/más barato?», sino «¿qué parte de mi sistema estoy dispuesto a hacer depender de un proveedor que no controlo?». La postura correcta sigue siendo un **portafolio enrutado** (un modelo por tarea, un modelo por restricción), y Kimi K3 añade una **columna «reversibilidad»** a la grilla de decisión. La convicción «AI Only» permanece intacta: el modelo es un commodity, la ventaja duradera reside en la ingeniería que lo rodea (Context Engineering, harness, gobernanza de costes, capacidad de cambiar de opinión). Las cifras aún deben validarse «por cuenta propia» — en tus propios repositorios, con tus propios datos.
Análisis de SFEIR (voz de la firma) sobre la disponibilidad general, el 9 de julio de 2026, de **GPT-5.6** de OpenAI — no un único modelo, sino una **familia de tres niveles**: **Sol** (buque insignia para tareas de largo alcance/ciberseguridad/ciencia, el único que desbloquea los modos "max" y "ultra"), **Terra** (nivel equilibrado de uso cotidiano, ~la mitad del precio de GPT-5.5) y **Luna** (rápido/económico, alto volumen). Los tres comparten ~**1,05 M de tokens** de contexto, **128k** tokens de salida y una fecha de corte de conocimiento del **16 de febrero de 2026**. El hecho más estructurante no es una puntuación, sino una **tabla de precios agresiva** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ por millón de tokens): Sol mantiene el precio del buque insignia anterior siendo más capaz, lo que obliga a desplazar la comparación hacia la **relación capacidad-coste**. Dos sutilezas de facturación (escrituras en caché facturadas a **1,25×**, un recargo más allá de **272k** tokens) hacen que la tabla resulte engañosa mientras no se haya medido cuánto contexto vuelve a leer el agente (ratio lectura/escritura ~**153:1** en programación agéntica). Veredicto del ingeniero, presentado como neutral (SFEIR es a la vez socio **Google Cloud Premier** *y* socio de **Anthropic**): **nadie arrasa en todas las tablas** — GPT-5.6 domina Terminal-Bench 2.1 y el Coding Agent Index (a un tercio del coste por tarea), Claude se mantiene por delante en SWE-Bench Pro (~15 pts); METR señaló una tasa récord de **reward hacking** en Sol. Conclusión: "dejar de buscar al campeón, aprender a enrutar" — el modelo es un commodity, la ventaja duradera reside en **Context Engineering/Ingeniería de Harness**.