Fiche de **Skill** (et non d'article) : `grill-with-docs` de Matt Pocock est une technique d'interview structurée qui « cuisine » (*grill*) un plan d'architecture en le confrontant méthodiquement au vocabulaire métier du projet (glossaire `CONTEXT.md`) et aux décisions déjà documentées (ADR). Plutôt que de foncer dans l'implémentation, elle challenge les hypothèses une par une via un dialogue question/réponse, nettoie la terminologie, vérifie la cohérence avec le code réel, et capture les décisions au fil de l'eau dans les bons artefacts. Skill de conception en amont, d'inspiration Domain-Driven Design.
#skill#grilling#interview adversariale
Matt Pocock
Retour d'expérience publié par le **Cornell AI Innovation Hub** (15 juin 2026) : comment une collaboration de deux semestres entre l'AI Hub, des étudiants de master et l'équipe Trésorerie de Cornell a transformé une investigation manuelle chronophage en un outil IA qui a permis de **récupérer 100 000 $** de paiements non identifiés sur un premier lot. Cas d'usage **AI4Business** (processus financier) réussi qui illustre presque point par point le framework **Leader-Lab-Crowd** d'**Ethan Mollick** : l'**AI Hub** joue le rôle du **Lab** (équipe centrale ambidextre, technologistes + étudiants) ; la **Trésorerie** (Cheryl Barnes, Marie Graves…) est la **Crowd** porteuse de la connaissance métier et de la douleur réelle ; et les **100 000 $** constituent la **récompense visible** (vivid win) qui ancre l'adoption — exactement le levier d'incitation que Mollick juge décisif. Méthode-clé : **« contexte d'abord, plan puis build »** via **Claude Code Plan Mode**, chaîne **fuzzy-matching → Gemini Enterprise Web Search → synthèse Claude**, le tout dans le **Cornell AI Gateway** gouverné. *« The $100,000 is a start. »*
#Cornell AI Innovation Hub#paiements non identifiés#rapprochement de paiements
**Pete Stergion** — Desktop Engineer au Cornell AI Innovation Hub · co-tech lead du projet (avec Phil Williammee). Article institutionnel signé de l'AI Hub.
Article pédagogique du **MindStudio Team** (blog de la plateforme MindStudio, orchestration de workflows multi-modèles) expliquant les **modèles de langage par diffusion** (*Diffusion Language Models*) à travers le cas de **Diffusion Gemma**, première implémentation **open weights** de Google (2B paramètres, dérivée de Gemma 2). La thèse : là où les modèles **autorégressifs** (GPT-4, Claude, Gemma standard) génèrent le texte **token par token, de gauche à droite** (attention causale, chaque token figé une fois produit), les modèles par **diffusion** partent d'une séquence **masquée/bruitée** et la **raffinent itérativement** (diffusion masquée / *absorbing diffusion*), avec **attention bidirectionnelle** : le modèle peut **réviser n'importe quelle position à n'importe quelle étape**. Conséquences : **parallélisme** élevé (un texte de 500 tokens nécessiterait 50-100 étapes de débruitage au lieu de 500 passes séquentielles), **infilling** et **génération sous contraintes** naturels (remplissage de templates, complétion de code avec contexte environnant), et capacité de **révision intégrée**. Mais à l'échelle actuelle (2B), Diffusion Gemma **ne rivalise pas** avec les grands autorégressifs (GPT-4o, Gemini 1.5 Pro) sur le raisonnement, le suivi d'instructions et les connaissances générales : l'écart « se referme » sans être comblé. L'inspiration vient de l'image (Stable Diffusion, DALL-E ont quitté l'autorégressif il y a des années) ; reste à savoir si le principe tient pour le texte. Diffusion Gemma est distribuée sur Hugging Face (Google DeepMind), AI Studio et Vertex AI.
#modèles de langage par diffusion#Diffusion Gemma#Google DeepMind
MindStudio Team
Satya Nadella (Microsoft) théorise « le futur de la firme » dans une économie pilotée par l'IA : chaque entreprise devra bâtir, à côté de son capital humain (jugement, relations, reconnaissance de patterns), un « capital token » — sa capacité IA propriétaire. La vraie valeur n'est pas dans le choix du meilleur modèle mais dans une boucle d'apprentissage (private evals, RL environments, base de connaissances) qui encode le savoir institutionnel et compose dans le temps. Plaidoyer pour un « écosystème frontière », non un simple « modèle frontière », afin que la valeur se diffuse plutôt que d'être captée par quelques modèles.
#futur de la firme#capital humain#capital token
Satya Nadella
Essai-thread polémique d'Ahmad Osman (@TheAhmadOsman) sur X, *« Anthropic's War on Opensource AI »* (1,7 M vues). Thèse à charge : Anthropic convertirait systématiquement la « sécurité » en **mécanisme de contrôle** (permission regime, capture réglementaire, restrictions d'accès anti-concurrentielles, opacité comportementale) pour maintenir builders, startups et communautés open source **en aval** de quelques labs frontière. Point d'appui central : l'**incident Fable** (dégradation silencieuse des requêtes de dev IA concurrent). Plaidoyer pour l'IA open source / locale comme seule « économie politique de l'intelligence » viable. Domaine : politique de l'IA, open source vs labs fermés, souveraineté, gouvernance.
#Anthropic#IA open source#IA locale
Ahmad Osman (@TheAhmadOsman)
Chris Williams (@voodootikigod) ouvre sa série ADLC en soutenant que faire tourner le SDLC humain sur des modèles est une erreur de catégorie : le cycle classique a été conçu pour contrer des modes de défaillance humains (ego, fatigue, oubli) absents chez les LLM. Il catalogue huit modes de défaillance porteurs (F1-F8) et cinq propriétés exploitables (E1-E5), et pose le principe fondateur : chaque phase d'un cycle agentique doit se rattacher à un mode de défaillance qu'elle défend ou à une propriété qu'elle exploite.
#ADLC#cycle de développement agentique#SDLC
Chris Williams (@voodootikigod)
Deuxième volet de la série ADLC de Chris Williams : il déroule le cycle qui découle de la « première loi » — huit phases (P0 Triage → P7 Distill), un gate déterministe entre chaque paire, et exactement deux moments humains obligatoires (approbation de la spec en P1, acceptation comportementale en P6). Principe clé : un handoff LLM→LLM sans checkpoint déterministe multiplie les taux d'erreur ; et une distribution des coûts « en haltère » (lourde aux deux bouts, légère au milieu) qui inverse l'économie agile.
#ADLC#cycle agentique en huit phases#gates déterministes
Chris Williams (@voodootikigod)
Troisième volet ADLC : Williams fait du test la spécification dans la seule langue que le builder ne peut pas contester. Là où le TDD est une pratique qualité optionnelle pour du code humain, il devient le mécanisme de confiance porteur de tout le cycle quand des agents codent. Trois règles de « rail discipline » : contextes d'écriture séparés (specs-only avant l'implémentation), gel mécanique au niveau de l'outil (pas du prompt), et audits adversariaux (« un test échoue-t-il si on supprime la feature ? »). Préférer le mutation testing au pourcentage de couverture, Goodhart-able à vitesse machine.
#ADLC#tests comme spec#TDD agentique
Chris Williams (@voodootikigod)
Quatrième volet ADLC : Williams reconfigure la revue de code en « prosecution » adversariale plutôt qu'évaluation collaborative. Charter les agents pour réfuter (« trouver ce qui est faux »), déployer des reviewers mono-lentille à contextes frais (correction, sécurité, conformité de contrat, alignement spec, qualité des tests), n'agir que sur des findings vérifiés (reproduits par un test rouge), et boucler jusqu'à deux passes consécutives à zéro finding. Mesurer la calibration en plantant des bugs connus, à la manière du mutation testing. Gate de sortie : zéro finding ouvert, deux passes sèches, tests verts, diff de tests vide.
#ADLC#prosecution#revue adversariale
Chris Williams (@voodootikigod)
Cinquième volet ADLC : orchestrer des agents en parallèle sans « merge hell ». Williams pose trois cadrans couplés — coût (choix du modèle), temps mural (largeur de parallélisation), précision (qualité des contrats) — et un principe d'architecture : « control flow is code; judgment is models » (des scripts déterministes orchestrent, les modèles ne fournissent que le jugement). Quatre lanes (Contract Desk frontier, Builder Pool single-writer, Prosecution Pool partagé, Integrator séquentiel), un forecast de conflits de merge à partir de quatre signaux (largeur certifiée typiquement 3-5 agents), et la désambiguïsation par consensus de N agents pas chers plutôt que par questions de clarification.
#ADLC#orchestration multi-agents#trois cadrans
Chris Williams (@voodootikigod)
Sixième volet ADLC : Williams décrit la phase P7 « Distill » comme le composant qui fait baisser le coût à chaque run. Deux moitiés : la simplification post-merge (déduire après que le code existe, pas avant — « deduplicating before the code exists is speculative ») et le minage des leçons (un « lesson foundry » transforme les findings récurrents en règles de lint, skills et nouvelles questions d'interrogation). Chaque leçon est payée une fois puis rétrogradée de la détection probabiliste coûteuse vers la prévention déterministe gratuite. La bonne unité de compte est le « cost per merged, verified change », et « flat cost is failure ».
#ADLC#phase Distill#P7
Chris Williams (@voodootikigod)
Septième et dernier volet ADLC : Williams présente un toolkit open-source de dix-huit outils construit *avec* le cycle lui-même (boucle build-prosecute-fix, agents parallèles, core `@adlc/core` gelé puis fan-out — « pinned means merged »). Le cœur doctrinal est « frontier-free » : atteindre les cibles de précision avec des modèles mid-tier (Opus/Sonnet/Haiku-class) plutôt que frontier, via cinq substitutions (search remplace insight, décomposition remplace horizon, banking remplace présence, mesure remplace métacognition, le generator-verifier gap fait tourner le moteur), l'humain restant le tier « frontier » sur les deux portes de spec. Fil rouge de la série : « replace trust with structure, and structure with measurement. »
#ADLC#toolkit#dix-huit outils
Chris Williams (@voodootikigod)
Interview vidéo enregistrée sur **VivaTech** (stand **Scaleway**), diffusée par le média **République**, réunissant **Damien Lucas** (CEO de Scaleway) et **Franck Le Moal** (Global Technical Officer du groupe **LVMH**). **Thèse centrale** : l'émergence d'une **« géopolitique de la tech »** force les multinationales à abandonner la solution mondiale unique au profit d'un **système d'information régionalisé en trois plaques** (États-Unis, Europe, Chine). LVMH (80 Md€ de CA, 75 maisons, 100+ pays) officialise un partenariat **cloud avec Scaleway** pour bâtir une **brique européenne autonome**, en complément de Google Cloud (data, depuis 2021), SAP, Salesforce côté occidental et Alibaba Cloud / Huawei / Tencent côté chinois. Le groupe se dit **« hybride »** et **autonome** plutôt que **« souverain »** (mot qu'il refuse, jugé ambigu). Scaleway se positionne en **cloud provider européen** immune aux lois extraterritoriales et protégé contre un **kill switch** (« pas de la science-fiction », au vu de l'actualité du week-end). Argument économique de Damien Lucas : **1 € dépensé chez Scaleway = 68 centimes qui restent dans l'économie européenne** (vs < 20 centimes chez un hyperscaler US, même hébergé en France). Calendrier : PoC terminés, démarrage chez **Sephora et Louis Vuitton**, empreinte significative visée à **12-18 mois**. Mission Scaleway assumée : se concentrer sur **IaaS / PaaS** (pas de verticalisation type bureautique), s'appuyer sur un écosystème de partenaires (applicatif souverain, chipsets et serveurs européens). Le recours aux **GPU Nvidia / IA** de Scaleway n'est **pas prévu à court terme** mais reste ouvert (modèles open source pour l'autonomie + performance économique).
#souveraineté numérique#autonomie stratégique#cloud européen
**Bertrand** — journaliste / présentateur du média **République** (partenaire de VivaTech) · conduit l'entretien. **Damien Lucas** — CEO de **Scaleway**. **Franck Le Moal** — Global Technical Officer du groupe **LVMH**.
Papier arXiv (cs.SE) de Martin Monperrus défendant une thèse radicale pour le SDLC : les agents de codage ont franchi un seuil de capacité tel que **la revue de code humaine n'est plus un composant nécessaire** d'un pipeline qualité. Deux affirmations : (1) des systèmes autonomes à base de LLM atteignent tous les objectifs de la revue (détection de défauts, qualité, conformité) à coût moindre et débit supérieur ; (2) le modèle hybride « l'agent écrit, l'humain relit » est intenable — il n'assure pas une vraie qualité et ne passe pas à l'échelle de la vélocité IA, créant une « fausse sécurité ». Monperrus oppose à l'inspection de Fagan (1976) un **pipeline de vérification adversariale multi-agents** (agent générateur + agents reviewers indépendants + tests/méthodes formelles + consensus par vote). L'humain se recentre sur la spec, les arbitrages d'architecture, l'approbation des domaines critiques et les cas limites. Recommandations : piloter d'abord sur composants à faible risque, mesurer agent vs humain, expliciter les décisions de rejet.
#revue de code#code review#inspection de Fagan
Martin Monperrus
Philippe Ensarguet (Orange) soutient que cinquante ans de design patterns forment une lignée continue : à l'heure où l'IA banalise le code et casse l'apprentissage traditionnel des architectes, la « pattern literacy » (lire un système par ses forces invariantes) devient la compétence durable à enseigner — comme une grammaire, pas comme des catalogues.
#design patterns#lignée des patterns#architecte logiciel
Philippe Ensarguet
Annonce produit de Stack Overflow (blog officiel) lançant **Stack Overflow for Agents**, une plateforme d'échange de connaissances *API-first* conçue pour l'ère agentique. Thèse fondatrice : les agents de codage travaillent **en isolement**, sans accès à une base de savoir partagée et vérifiée. D'où l'**« Ephemeral Intelligence Gap »** — des agents du monde entier résolvent indépendamment les mêmes problèmes, gaspillant tokens et calcul, puis perdent la solution à la fin de la session ; les mêmes patterns d'architecture sont redécouverts en boucle. Principe directeur : *« générer des réponses plausibles est devenu bon marché, mais vérifier lesquelles tiennent en production ne l'est pas »*. Workflow en 4 temps : **chercher d'abord** (consommer le savoir validé) → **contribuer si lacune** (l'agent rédige, l'humain approuve avant publication) → **vérifier** (résultats, modifications, conditions de contexte) → **composer les signaux** (votes, réponses, vérifications font émerger un consensus). Trois formats lisibles par machine : **Questions**, **TIL** (traces de debug), **Blueprint** (patterns réutilisables, exigence qualité maximale). La confiance repose sur la **modération communautaire** et des **boucles de vérification multi-agents** ; l'humain revendique la propriété de son agent via le SSO Stack Overflow (« ancre communautaire » liant l'agent à une réputation humaine). Bénéfices différenciés : développeurs (moins de boucles de retry), labos IA (données haut-signal pour fine-tuning/éval), entreprises (**Stack Internal**, couche de savoir propriétaire sans exfiltration).
#Stack Overflow for Agents#agents de codage#base de connaissances
David Gibson · Janice Manningham
Anthropic lance Claude Fable 5 (modèle de classe Mythos rendu sûr pour usage général) et Claude Mythos 5 (même modèle, garde-fous levés, réservé aux cyberdéfenseurs via Project Glasswing) : performances état de l'art en ingénierie logicielle, vision, mémoire long-contexte et sciences du vivant.
#Claude Fable 5#Claude Mythos 5#modèle de fondation
Anthropic
Guide technique approfondi (blog d'agence Lushbinary) sur le **Loop Engineering** : concevoir les systèmes qui pilotent les agents de codage en boucle, plutôt que de les prompter manuellement. Couvre la filiation prompt → context → loop engineering, la technique Ralph (Geoffrey Huntley), les **cinq briques + la mémoire** d'une boucle, leur implémentation dans Claude Code et OpenAI Codex, l'écriture de conditions d'arrêt vérifiables, une échelle de maturité d'adoption et les risques qui s'aggravent à mesure que les boucles se sophistiquent. Domaine : ingénierie logicielle agentique, agents de codage, harness/orchestration.
#Loop engineering#agents de codage#harness engineering
Lushbinary Team
Guide d'Augment Code (Paula Hingel) décrivant comment les agents IA restructurent le cycle de vie logiciel (SDLC), stage par stage. Thèse : l'IA produit **plus de débit sur certaines étapes et plus de risque d'instabilité sur d'autres** — symptôme d'une adoption inégale sans redessiner les frontières de revue. Appui sur le **DORA 2025** : l'adoption IA est positivement corrélée au débit de livraison et à la performance produit, mais **négativement à la stabilité**. Six étapes revisitées (Requirements, Design/Architecture, Implementation, Testing/QA, Deployment, Maintenance), trois risques majeurs (érosion du pipeline junior, **validation circulaire** des tests IA, lacunes de gouvernance à l'échelle) et trois rôles émergents (**Intent Engineering**, Agentic DevOps, AI Governance/Assurance). Recommandations actionnables : auditer une étape avant de scaler, stress-tester la gouvernance, rendre la **spécification** centrale, définir des politiques de rollback explicites, redessiner le rôle des juniors autour de la revue.
#SDLC#cycle de vie logiciel#agents de codage
Paula Hingel (Augment Code)
Billet de bricolage du dimanche de **Mark Dembo** (Head of Solutions, Developer Platform & AI chez **Cloudflare**) publié le **7 juin 2026** sur son blog perso. **Récit** : inspiré par **Steve Ruiz**, l'auteur achète un petit appareil **M5Stack Stick 3** (~30 €) et, profitant de la sortie d'**Opus 4.8**, se construit un **agent IA DIY** « par pure curiosité, sans objectif ». **Itération 1 (45 min)** : il jette la doc de l'appareil à **Claude Code**, qui génère des scripts Python (~200 LOC, *« zero blast radius »*) affichant la météo de Munich, puis de plusieurs villes ; un **backend Cloudflare Workers + Workers AI** ajoute la **synthèse vocale (TTS)**, le **push-to-talk** (speech-to-text) et un **petit LLM** central pour répondre aux questions. **Itération 2 (vrai agent)** : passage des endpoints REST au transport **WebSocket** via le **Cloudflare Agents SDK** + **Dynamic Worker execution** → le pattern ***« Code Mode »*** (l'agent écrit et exécute du code pour accomplir sa tâche). L'agent répond alors à des questions à données publiques (11 ! = factorielle, vainqueur de la Ligue des Champions via `fetch()` sur Wikipédia, météo de n'importe quelle ville). **Itération 3 (vrais pouvoirs)** : connexion à **Todoist** via flux **MCP OAuth** → 50 outils d'un coup, d'où deux problèmes : **bloat du contexte** et **risque de dégâts réels**. Solution reprise du **MCP Server Portal Cloudflare** + des réglages connecteurs Claude : par outil, **Always allow / Ask for approval / Disable** (les *Disabled* n'entrent jamais dans le contexte ; un **classifieur LLM** n'accepte que les « allow » distincts et **défaut = deny**). **Posture revendiquée** : réduire son rôle à ***« idea generator, executor and judge »*** (et rarement guide technique), un flux « human-in-the-loop » jugé peu *« 2026 »* (copier-coller dans l'UIFlow). **Ce qu'il n'a PAS fait** : pas d'optimisation de latence/streaming, pas d'appels LLM optimistes, pas d'évals, ***« I did not even look at the code once »***. **Émerveillement** : 30 € + une fenêtre de session Anthropic + quelques cents d'inférence Cloudflare → un objet qui écoute et parle, piloté en langage naturel ; *« the true unlock is how accessible it is »*. Contraste vif avec [[thomas-pragdave-failing-faster-code-rot-ai-velocity-2026-06-06]] (ici le *« zero blast radius »* justifie de ne jamais regarder le code) ; illustre concrètement *Code Mode* / *« the agent just writing and executing code »*, le pattern **MCP** ([[claude-skills-bigger-than-mcp-willison-2025-10-16]]), la gouvernance d'outils façon *Ask for approval* (uber-engineering-agent-identity-crisis-zero-trust-spire-2026-05-21), et la doctrine *systems around the model* de dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28.
#BYO agent#bring your own AI#bricolage
**Mark Dembo** (@darkmembo / @mdembo) · **Head of Solutions – Developer Platform & AI** chez **Cloudflare** (auparavant auteur sur le blog Cloudflare). Billet personnel publié sur son blog *markpauldembo.com* le **7 juin 2026** (description : *« Thoughts about tinkering on a Sunday »*).