Saltar al contenido

root / tags / evals

#evals

5 fiches

Agentes de codificación IA y Skills Traducción verificada automáticamente

The Claude Code guide for startups

Guía firmada por **Michael Segner**, publicada el **20 de agosto de 2026** en el blog claude.com, categoría *Claude Code*: una lectura de **5 minutos** anunciada para aproximadamente **31.500 caracteres** de cuerpo del texto, ofrecida también en PDF. Material declarado: entrevistas con **más de una docena** de startups, quince nombradas — **Artemis Security**, **Cainex**, **Clay**, **ClickHouse**, **Cognition**, **Commure**, **Crosby**, **Emergent**, **Harvey**, **Heidi**, **Higgsfield**, **Omni**, **Parahelp**, **Translucent**, **Zingage**. (A) Cinco reglas operativas: *everyone ships*, *automate the tedium*, *trust, but verify*, *build for rebuilding*, *prototype, dogfood, productionize*, cada una cerrada con consejos de producto y reunidas en una checklist final. (B) Un cuerpo compuesto de citas atribuidas, cada regla ilustrada por directivos nombrados en lugar de una métrica agregada. Las cuatro cifras destacadas son las de las empresas entrevistadas: **+30%** más funcionalidades entregadas (ClickHouse), **de 2 a 3×** productividad de ingeniería (Omni), **100%** del triaje de bugs automatizado (Clay), **más de 6.000 PR por semana** (Artemis Security). Dos pasajes se apartan del registro testimonial: el bucle de autocorrección de **Cainex** sobre la codificación médica, descrito paso a paso, y el uso interno de **Claude Tag** en **Anthropic** como primer respondiente para las guardias de CI/CD. La pregunta planteada al inicio — *"what would it look like if an organization built their product development lifecycle with Claude Code from the ground up?"* — conecta con [[claxton-anthropic-ai-native-sdlc-playbook-2026-08-21]], publicado al día siguiente por el mismo editor, y prolonga [[cherny-wu-reflecting-year-claude-code-2026-07-17]].

#Claude Code#startups#everyone ships

Michael Segner · auteur du guide sur le blog claude.com (fonction non affichée par la page) ; entretiens avec les dirigeants de quinze entreprises nommées.

Agentes de codificación IA y Skills Traducción verificada automáticamente

The AI Engineering Skills Map

Publicación en X de **Andrew Ng** del **14 de agosto de 2026** (16:29 UTC), que retoma la carta «Dear friends» de ***The Batch* #366** (DeepLearning.AI, misma fecha), ~900 palabras. Ng presenta **The AI Engineering Skills Map** y publica **cuatro habilidades** consideradas las más importantes. **(1) Construir y desplegar aplicaciones de IA** — se nombra la especificidad: *« The key difference between AI and non-AI applications is that the former has unpredictable outputs »*, de ahí el énfasis en los *evals* y los bucles de análisis de errores. **(2) Fundamentos de ingeniería de software**, porque *« Understanding software fundamentals allows you to recognize what tradeoffs even exist »* — el desarrollador inexperto fracasa *« because they don't know what context to give their coding agent »*, de ahí el objetivo de *« steering coding agents using the precise language of software engineering »*. **(3) Uso de agentes de codificación**, en una formulación operativa: *« help the agent autonomously close loops by providing verifiers or evals »*, y *« knowing how much to intervene and how much to leave them alone »*. **(4) *Shaping the build***: *« Given a clear spec, coding agents are rapidly improving at delivering to it. Thus, our work as engineers is shifting toward deciding what should be in the spec »*, junto con *« Engineers should no longer expect to be given a pixel-perfect design and asked only to implement it. »* Una **nota terminológica** aporta la mayor parte del enfoque: Ng habla de **habilidades** en ingeniería de IA y **no del rol** "AI Engineer", con una analogía explícita — *« All developers today should know how to work with the cloud, and only a smaller number have a "Cloud engineer" title. »* El conjunto se apoya en *« an analysis of more than 10,000 job postings, dozens of structured interviews with experts, hiring managers, and recruiters, surveys, and other online data »*, de la cual **no se publica ningún resultado numérico**: Ng describe su proceso como *« informally… akin to running clustering »* y anuncia un mapa detallado en futuras publicaciones. Declara el interés en la penúltima frase: *« DeepLearning.AI's principal focus is to help developers gain these AI engineering skills. »*

#AI Engineering Skills Map#mapa de habilidades#Andrew Ng

**Andrew Ng** — fondateur de **DeepLearning.AI** · general partner d'**AI Fund** · cofondateur de **Coursera** et de **Google Brain** · ancien chief scientist de Baidu. Texte signé · à la première personne · écrit *« with my team »* sans qu'aucun collaborateur soit nommé. Publié le **14 août 2026** sur X et dans ***The Batch* n°366** — même texte aux deux endroits ; préférer *The Batch* pour toute citation durable. Quatrième fiche Ng du corpus · après les lettres n°350 (24 avril) · n°352 (8 mai) et n°359 (26 juin).

Agentes de codificación IA y Skills Traducción verificada automáticamente

3 Key Product Development Loops (The Batch, Issue 359 — « Dear friends » letter)

Carta «Dear friends» de Andrew Ng en *The Batch* (DeepLearning.AI, número 359) sobre **loop engineering** aplicado al desarrollo de producto **0-to-1**. Ng comparte sus **3 bucles clave** — bucle de codificación agéntica (~minutos), bucle de feedback del desarrollador (~horas), bucle de feedback externo (~días) — anidados por escala temporal creciente, conectando *agente de codificación → especificación de producto/evals → visión del desarrollador → feedback externo*. Tesis central: los humanos conservan una **ventaja de contexto** (más que un «gusto») que hace indispensable el human-in-the-loop; los ingenieros asumen un rol parcial de gestión de producto. Ámbito: agentes de codificación, ingeniería de producto, metodología agéntica.

#Loop engineering#desarrollo de producto#bucle de codificación agéntica

Andrew Ng

Estrategia y Frameworks Traducción verificada automáticamente

Loop Engineering for Product Managers

Ensayo extenso de **Shubham Saboo** (X/Twitter) que plantea una tesis sobre el rol del Product Manager en la era de los agentes: la próxima competencia clave no es la **ingeniería de prompts** sino **Loop Engineering** — diseñar un *sistema que mejora con cada ejecución* en lugar de escribir el prompt perfecto cada vez. Un **loop** es un ciclo repetido: cambiar lo que moldea el comportamiento del agente → ejecutarlo → evaluar el resultado → conservar el cambio si la calidad sube, revertirlo en caso contrario → **acumular el aprendizaje** para que la siguiente versión parta con ventaja. Para un PM, el punto de entrada no es el código sino los **artefactos duraderos** que codifican su criterio: skill de revisión de PRD, *summarizer* de llamadas con clientes, rúbrica de evaluación, checklist de lanzamiento, flujo de investigación, `CLAUDE.md`, plantilla de prompt, marco de priorización. Como se reutilizan, estos artefactos **se acumulan en ambas direcciones** — y **derivan** (drift) silenciosamente (un CLAUDE.md que no deja de crecer, un checklist que se ignora…): el modelo no ha empeorado, son los artefactos los que han derivado sin supervisión. Un loop tiene **5 partes**: disparador, acción, **prueba**, memoria, **condición de parada** (la más crítica). Las **evals** se convierten en trabajo del PM (poner a prueba el artefacto con ejemplos conocidos: 3 PRD buenos / 3 malos, 5 llamadas ya comprendidas, 2 lanzamientos pasados). La **memoria** vive en **GitHub** (el repositorio se convierte en "memoria de producto": commits, diffs, resultados de evals, registro de decisiones, rollback). Primer loop recomendado: un **loop semanal de señal de producto** (cada viernes). El criterio (taste) sigue siendo central — pero ahora necesita **prueba**. Cita a Boris (creador de Claude Code): "ya no escribe prompts, escribe loops."

#Loop Engineering#gestión de producto#PM aumentado

Shubham Saboo (@Saboo_Shubham_)

Agentes de codificación IA y Skills Traducción verificada automáticamente

The New SDLC With Vibe Coding — From ad-hoc prompting to Agentic Engineering

Whitepaper de Google (la entrega "Day 1" de una serie, de Addy Osmani, Shubham Saboo y Sokratis Kartakis) que traza la transformación del ciclo de vida del desarrollo de software (SDLC) en la era de los agentes de codificación. Tesis: el cambio fundamental no es un nuevo lenguaje, sino el paso de escribir código a **expresar intención**. El documento plantea un espectro que va del *vibe coding* (proponer y aceptar) a la *agentic engineering* (la IA implementa bajo restricciones, pruebas y bucles de retroalimentación diseñados por humanos), con la **context engineering** como habilidad central, el modelo de **software factory** (el entregable del desarrollador = el sistema que produce el código), la **harness engineering** (Agente = Modelo + Harness), y un análisis económico CapEx/OpEx del coste total de propiedad.

#nuevo SDLC#vibe coding#agentic engineering

Addy Osmani · Shubham Saboo · Sokratis Kartakis (Google)