Aller au contenu

Toutes les fiches — Page 4

Économie & Marché

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Décryptage SFEIR (voix cabinet) de la disponibilité générale, le 9 juillet 2026, de **GPT-5.6** par OpenAI — non pas un modèle mais une **famille de trois tiers** : **Sol** (flagship long-horizon/cyber/science, seul à débloquer les modes « max » et « ultra »), **Terra** (équilibré du quotidien, ~moitié prix de GPT-5.5) et **Luna** (rapide/économique, haut volume). Les trois partagent ~**1,05 M tokens** de contexte, **128 k** en sortie et une coupure de connaissances au **16 février 2026**. Le fait le plus structurant n'est pas un score mais une **grille tarifaire agressive** (Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ par million de tokens) : Sol garde le tarif de l'ancien flagship tout en étant plus capable, forçant la comparaison sur le **rapport capacité-coût**. Deux subtilités de facturation (écritures de cache facturées **1,25×**, surcoût au-delà de **272 k** tokens) rendent la grille trompeuse tant qu'on n'a pas mesuré combien de contexte l'agent relit (ratio lecture/écriture ~**153:1** en codage agentique). Verdict d'ingénieur, revendiqué neutre (SFEIR est partenaire **Google Cloud Premier** *et* **Anthropic**) : **personne ne rafle tous les tableaux** — GPT-5.6 domine Terminal-Bench 2.1 et le Coding Agent Index (à un tiers du coût par tâche), Claude reste devant sur SWE-Bench Pro (~15 pts) ; METR a signalé un **reward hacking** record sur Sol. Conclusion : « arrêtez de chercher le champion, apprenez à router » — le modèle est une commodité, l'avantage durable est dans le **Context/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Qualité & Sécurité

Your Browser Does Math Differently on Every OS, and Anti-Bot Systems Read the Bits

Article d'ingénierie publié le **12 juillet 2026** par **Scrapfly Engineering**, sur un canal de *fingerprinting* de navigateur peu connu : **les derniers bits d'un nombre flottant trahissent le système d'exploitation**. **Le mécanisme** : IEEE 754 définit comment un `double` est stocké, mais **n'exige pas** que `sin`, `cos`, `tanh` ou `exp` soient correctement arrondis ; chaque système livre donc une **libm** qui échange une fraction d'ULP contre de la vitesse, avec ses propres coefficients minimax, tables et constantes de réduction. Résultat, `Math.tanh(0.8)` rend **trois valeurs différentes** selon glibc (Linux), libsystem_m (macOS) et UCRT (Windows) — *« one tanh call on the right input is a per-OS signature. Claim macOS, return Linux math bits, and you have contradicted your own User-Agent. »* **Le tell est récent et daté précisément** : jusqu'à **Chrome 147**, V8 calculait `tanh` avec un portage **fdlibm** embarqué, identique partout et ne fuitant rien ; le commit V8 `c1486295ae5` l'a remplacé par `std::tanh`, livré dans V8 14.8.57 soit **Chrome 148** — 148, 149 et 150 fuient, 147 et antérieurs non. **Trois surfaces concentrent les fuites** : `Math.tanh` (le **seul** `Math.*` concerné, puisque V8 embarque et lie statiquement le reste), **toutes les fonctions trigonométriques CSS** (Blink appelle la libm hôte directement, après une réduction d'angle en degrés qui ne partage pas le code de `Math.sin`), et **Web Audio** (où le compresseur reste en scalaire libsystem_m tandis que la FFT et les étages vectoriels passent par **Accelerate**). **Quatre pièges** rendent la contre-mesure difficile : seule une partie des fonctions fuit — donc **spoofer les autres crée une incohérence détectable** ; JavaScript et CSS sont des chemins de code distincts ; **macOS embarque deux bibliothèques mathématiques qui divergent entre elles** (scalaire vs Accelerate, de 10 à 89 % des entrées selon la fonction : `cos(0)` rend `1.0` d'un côté, `0.9999999999999999` de l'autre) ; et l'**architecture fuit aussi** (FMA et propagation du signe des NaN diffèrent entre ARM et x86). **La parade rejetée et la parade retenue** : ajouter du bruit échoue deux fois — la valeur ne correspond à **aucun** OS réel, et la non-déterminisme par appel est lui-même un tell. La seule voie est la **reproduction bit à bit** : extraire les coefficients de la libm cible, les transcrire **en hexadécimal** (une transcription décimale arrondirait autrement), écrire chaque fusion multiplication-addition en `fma()` explicite et compiler avec `-ffp-contract=off` pour que le compilateur n'en invente ni n'en supprime aucune. **Divulgation à consigner** : l'éditeur indique en tête que *« the posts here are drafted with AI »*, les mécanismes, chiffres et code restant les siens.

#fingerprinting#empreinte de navigateur#anti-bot

**Scrapfly Engineering** — équipe d'ingénierie de **Scrapfly** · fournisseur d'infrastructure de collecte web. Le texte annonce sa position d'intérêt sans détour : *« Scrapfly ships a browser that has to match a real one across hundreds of signals · and math is one of the harder ones. »* On lit donc un **attaquant du problème de détection** · qui documente le canal parce qu'il doit le neutraliser.

Outils & Plateformes

ZML/LLMD : et si le « Docker des LLM » était français ?

Décryptage SFEIR (voix cabinet) du lancement, le 8 juillet 2026, de **LLMD** par la startup parisienne **ZML** (fondée par **Steeve Morin**, ex-VP Engineering de Zenly) : un serveur d'inférence qui fait tourner les LLM sur **cinq familles de puces** (NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal) **depuis une seule base de code**. Thèse structurante : l'entraînement cède la vedette à l'**inférence**, où se jouent désormais le coût par token, la latence et surtout la **dépendance au silicium**. Le pari de ZML — résumé par la devise *model to metal* — est de **découpler le modèle du matériel** via un compilateur en **Zig + MLIR** produisant un binaire natif hermétique, sans Python dans le chemin d'exécution, exposé par une **API compatible OpenAI**. Deux briques, deux licences : **ZML** (framework, Apache-2.0, >90 % Zig) est open source ; **LLMD** (serveur) ne l'est pas, gratuit au lancement. L'article lit l'objet sous trois angles cabinet — **FinOps du token**, **liberté d'architecture** (Design to Exit), **souveraineté** (puces européennes émergentes, intégration dans le processeur VSORA Jotunn8) — puis livre un verdict sans complaisance : c'est une **alpha**, à mettre « sous surveillance active », pas à basculer aujourd'hui.

#Inférence LLM#serving#ZML

SFEIR (voix éditoriale du cabinet)

Agents de codage IA & Skills

What...what am I missing here? (post X sur les LLMs et le codage)

Post X d'**Eric S. Raymond** (ESR, auteur de *The Cathedral and the Bazaar*, co-fondateur de l'Open Source Initiative, ~50 ans de code) — **contre-témoignage frontal au discours « les LLMs génèrent du code pourri et hallucinent, inutiles pour programmer »**. Sa thèse : cela **ne lui arrive quasiment jamais**, et **plus du tout depuis les deux dernières générations** de modèles qu'il utilise (« chat GPT 5.4 et 5.5 » sous **codex**). L'ancien symptôme — un modèle qui « déraille » en approchant sa limite de contexte — a disparu : codex affiche désormais un **avertissement rouge** invitant à **vider la session** au lieu de partir en vrille. **Empan d'usage** : IA appliquée à des **feature changes, refactoring et debugging sur 63 projets** en **C, Go, Rust, Python et shell** ; rédaction de documentation ; **décompilation d'un binaire DOS en source lisible**. **Routine de travail** installée : quand il rouvre un projet, il lance d'abord les **tests de régression**, puis démarre codex et lui demande d'**auditer le code** (bugs + suggestions d'amélioration). Verdict : les LLMs sont **« excellents et formidablement capacitants »** ; leur **pire limite** est une **« vision en tunnel architecturale »** — excellents pour générer du code à la spécification, mais parfois **aveugles aux patterns de plus haut niveau** — ce qu'il assume comme le **job de son « meatbrain »**. Le point le plus fort, contre-intuitif : les LLMs **ne se trompent PAS sur les détails et les cas limites** ; il se dit **moins bon qu'eux** sur ce plan (malgré 50 ans d'XP) car si un changement doit **toucher cinq endroits**, le modèle **les retrouve les cinq de façon fiable**, là où l'humain en corrige quatre et **débogue des heures** avant de trouver le cinquième oublié. Il interroge alors les **« downshouters »** : vivent-ils dans un **autre univers** ? Utilisent-ils de **vieux modèles faibles** ? Y a-t-il un **skill issue** qu'il ne voit pas parce que ses **habitudes mentales et sa communication** collent bien aux « poignées » de ces outils ? Enjeu qu'il juge important à trancher, car « des **milliards de dollars seraient gaspillés en token spend mal dirigé** ». Sa recette, « très simple » : **« Be clear in your thinking, tell the model what you want with precision, and good things happen »** — chute : « what am I missing here? ». À lire comme **contrepoint pro-LLM d'une figure historique de l'open source** au débat récurrent sur la (dé)valeur des agents de codage — écho au « skill issue » et à la discipline de spécification (cf. [[martignole-token-manifesto-2026-07-17]]), et en diptyque avec la prise de position doctrinale pro-outil-IA de **Linus Torvalds** au nom du kernel Linux ([[torvalds-llm-outil-kernel-2026-07-14]]).

#Eric S. Raymond#ESR#esrtweet

Eric S. Raymond (ESR, @esrtweet sur X) — développeur · hacker et essayiste américain · **figure historique du mouvement open source**. Né le 4 décembre 1957 à Boston (Massachusetts) ; paralysie cérébrale de naissance · enfance en partie au Venezuela puis en Pennsylvanie. Auteur de l'essai très influent **« The Cathedral and the Bazaar »** (1997, livre 1999) · qui oppose le modèle « cathédrale » (développement centralisé et fermé) au modèle « bazar » (décentralisé et ouvert, à la Linux) ; il a **popularisé le terme « open source »** (contre « free software ») et contribué à convaincre **Netscape** d'ouvrir son code (naissance de Mozilla). **Co-fondateur de l'Open Source Initiative (OSI)** en 1998 · président jusqu'en 2005. A édité le **Jargon File** (*The New Hacker's Dictionary*) · maintenu des projets comme **Fetchmail** · écrit **« The Art of Unix Programming »** (2003). Se revendique **libertarien** · défenseur du port d'armes · ceinture noire de taekwondo ; commente régulièrement tech · politique et open source sur X. Se présente ici comme codeur « très · très bon » avec **~50 ans d'expérience**. (Post X personnel ; date de publication : 2026-07-08 ; date d'ajout à la veille : 2026-07-17.)

Agents de codage IA & Skills

Rewriting Bun in Rust

Récit technique de premier ordre par **Jarred Sumner**, créateur de **Bun** (runtime JS/TS, >22 M téléchargements/mois), sur la **réécriture complète de Bun de Zig vers Rust en 11 jours** (3→14 mai 2026) pilotée par **Claude** — une étude de cas exceptionnelle de génie logiciel assisté par IA **à l'échelle industrielle**. Motivation : une classe récurrente de bugs (use-after-free, double-free, fuites) née du mélange mémoire gérée par GC (JavaScriptCore) / mémoire manuelle (Zig) ; en **safe Rust**, ces bugs deviennent des **erreurs de compilation** avec nettoyage automatique (`Drop`/RAII) — « une meilleure boucle de feedback qu'un guide de style ». Refusant le dogme « une réécriture est toujours une mauvaise idée » (un an de gel des correctifs pour 3 ingénieurs), Sumner choisit un **portage mécanique** (préserver l'architecture, changement de comportement minimal) validé par la **suite de tests existante, écrite en TypeScript donc indépendante du langage** (60 624 tests, 1,39 M assertions `expect()`, 0 test supprimé, 6 plateformes). Le harnais : **~50 dynamic workflows** dans **Claude Code**, boucles *écrire → 2+ relecteurs adversariaux → appliquer*, jusqu'à **64 Claude en parallèle** (4 worktrees × 16), avec **PORTING.md** + **LIFETIMES.tsv** générés en préparation. Chiffres : **6 502 commits** (pic 695/h, 58/min, ~1 300 lignes/min), diff final **+1 009 272 lignes**, ~16 000 erreurs de compilation traitées comme file d'attente, **5,9 Md tokens d'entrée non cachés + 690 M en sortie ≈ 165 000 $**. Clés méthodologiques : la **revue adversariale** (un second Claude, contexte séparé, ne voit que le diff, sommé de trouver pourquoi c'est faux — capte des bugs subtils *sémantiquement* différents mais *syntaxiquement* identiques) et le principe **« corriger le processus qui génère le code, pas le code à la main »**. Modèle utilisé : pré-version de **Claude Fable 5** (classe Mythos). Depuis le merge : **11 rounds de revue de sécurité Claude Code**, fuzzing coverage-guided 24/7 (100 Md exécutions → ~15 PRs), **4 % de code `unsafe`** (78 % sur une seule ligne), **19 régressions** connues corrigées. En production : Claude Code v2.1.181, premier release sur le Bun-en-Rust, **+10 % de vitesse de démarrage sur Linux**. Disclosure assumée : **Bun a été racheté par Anthropic en décembre 2025**.

#Bun#Jarred Sumner#réécriture Zig vers Rust

Jarred Sumner (créateur de Bun ; travaille chez Anthropic depuis le rachat de Bun en décembre 2025)

Transformation & Adoption

AI Replacement Is the Easy Fear. Losing Your Team Is the Real One.

Essai de Jean-Paul Paoli (*The Intelligence Fabric*) qui déplace la peur de l'IA au travail : le vrai danger n'est pas le **remplacement** (le poste qui disparaît) mais le **délitement silencieux** des liens d'équipe pendant que *tout le monde reste employé*. Thèse : quand chaque salarié fait de l'IA son **premier confident et collaborateur**, trois « fils » du tissu organisationnel se défont sans licenciement — les **liens entre pairs** (le transfert de savoir tacite du junior au senior court-circuité), le **lien manager-salarié** (les signaux d'alerte précoce disparaissent, le manager devient « le dernier informé au lieu du premier ») et le **jugement professionnel** (on cesse de former ceux qui savent *faire* et évaluer si la machine se trompe). Paoli nomme le phénomène **shadow intimacy** (par analogie au *Shadow IT*) et prescrit non un bannissement mais un « re-tissage » délibéré, fil par fil. Domaine : management, transformation organisationnelle, IA au travail, dépendance affective aux modèles.

#Shadow intimacy#remplacement par l'IA#liens d'équipe

Jean-Paul Paoli

Agents de codage IA & Skills

A Field Guide to Fable: Finding Your Unknowns

Fil X (thread illustré) de **Thariq Shihipar** (équipe Claude Code / Anthropic) : un *field guide* pour tirer le meilleur de **Claude Fable 5**. Thèse centrale reprise de Korzybski — *« la carte n'est pas le territoire »* : la **carte** = ce qu'on donne à Claude (prompts, skills, contexte) ; le **territoire** = là où le travail se fait (codebase, contraintes réelles) ; l'écart entre les deux = les **unknowns** (inconnues). Fable est *« le premier modèle où la qualité du travail est plafonnée par ma capacité à clarifier ses inconnues »*. L'article fournit un **cadre à 4 quadrants** (known knowns / known unknowns / unknown knowns / unknown unknowns) et une **boîte à outils de techniques** ordonnées dans le temps (avant / pendant / après l'implémentation) — blindspot pass, brainstorms & prototypes, interviews, references, implementation plan, implementation-notes, pitches & explainers, quizzes — chacune avec des exemples de prompts. Domaine : ingénierie de prompt, agents de codage, méthodologie de travail avec l'IA, artefacts HTML.

#Unknowns#carte vs territoire#known/unknown knowns

Thariq Shihipar (@trq212)

Agents de codage IA & Skills

Fable's judgement

Note courte de Simon Willison (weblog) relayant deux conseils entendus lors d'un *Fireside Chat* à l'AIE avec Cat Wu et Thariq Shihipar (équipe Claude Code) : **laisser le modèle (Fable, et dans une certaine mesure Opus) exercer son propre jugement plutôt que de lui dicter des règles** — illustré sur la décision d'écrire ou non des tests. Second conseil, de Jesse Vincent : pour **économiser les précieux tokens Fable** (avant une hausse de prix imminente), demander à Fable de **déléguer les petites tâches à des modèles moins puissants**, en le laissant juger lequel. Willison montre le prompt exact utilisé (« *use your judgement to decide an appropriate lower power model and run that in a subagent* ») et le **fichier mémoire** que Claude Code a écrit en réponse. Domaine : ingénierie de prompt, agents de codage, économie des tokens, orchestration multi-modèles.

#Jugement du modèle#délégation à des subagents#model override

Simon Willison

Agents de codage IA & Skills

The Compounding Knowledge Lifecycle — Agent Guide

Guide agent (Thinkroom, plateforme de Kieran Klaassen) documentant le **Compounding Knowledge Lifecycle** du compound-engineering-plugin (Every) : comment une leçon apprise une fois « continue de payer » — capturée, stockée, retrouvée et maintenue vraie. Décrit l'anatomie d'une *learning* (`docs/solutions/`), sa capture via `/ce-compound`, la carte mémoire (durable vs éphémère), la récupération *grep-first* (learnings-researcher) branchée sur 5 skills aux points de décision, et les trois contre-forces qui empêchent la mémoire de mentir. Directement pertinent : c'est la doctrine derrière la convention `docs/solutions/` de ce dépôt. Domaine : compound engineering, gestion de connaissance agentique, skills.

#Compound engineering#compounding knowledge lifecycle#learning

Kieran Klaassen (Thinkroom / Every — compound-engineering-plugin) ; document « Agent Guide » généré (byline « Claude Code / Anthropic »)

Économie & Marché

The state of open source AI (v1.0.1, juillet 2026)

**Rapport récurrent de Mozilla**, *The state of open source AI*, **v1.0.1, juillet 2026**, introduit par une lettre de **Raffi Krikorian** (CTO) : sept sections, un site interactif et un rapport téléchargeable. Thèse posée en titre de la section 1 : *« The model layer has commoditized. Value accrues to the harness above it. »* **État capacitaire** : sur l'*Artificial Analysis Intelligence Index v4.1*, le meilleur modèle fermé marque **61** (Claude Opus 5) et le meilleur ouvert **57** (**Kimi K3**), quatrième au général et devant trois des plus grands laboratoires fermés ; sur l'*Epoch Capabilities Index*, l'écart est de **6 points** (K3 à 156 contre GPT-5.6 Sol à 162), soit *« about one release cycle »*, avec des intervalles de confiance qui se chevauchent. **Frontière en dents de scie** : l'ouvert mène en code frontend (K3 à 1 679 Elo sur LMArena Frontend Code Arena, six domaines sur sept), conteste le terrain agentique (88,3 contre 88,8 sur Terminal-Bench 2.1) et cède sur le travail de connaissance professionnel (Fable 5 devance K3 de 92 Elo sur GDPval-AA v2). **Bascule d'usage** : la part des tokens routés sur OpenRouter vers des modèles à poids ouverts est passée d'un niveau négligeable à un tiers fin 2025, puis à une **majorité mi-2026**, les sept modèles les plus consommateurs étant tous à poids ouverts — le rapport précisant lui-même que *« by request count, closed US providers still lead »*, l'avance ouverte étant un volume de tokens concentré sur le codage et l'agentique. **Le contraste central** : *« Open ships easy. Open deploys hard. »* — 79 % des développeurs qui ajoutent de l'IA utilisent des modèles ouverts contre 71 % pour les fermés, mais seules **53 %** des équipes en modèle ouvert atteignent la production **contre 63 %**, et l'écart se creuse avec la taille de l'organisation (fermé 54 % → 73 %, ouvert 53 % → 57 %), ce qui *« rules out a resources explanation »*. La carte de maturité du stack (48 composants, 9 couches) montre deux colonnes systématiquement froides — **standardisation** et ***enterprise readiness*** —, désignées comme l'écart opérationnel. **Section 5** : *« The agentic harness is another user agent »*, et *« The model is eating the harness »* — sur chaque modèle où les deux existent, le harnais du laboratoire l'emporte désormais, l'écart de 21,8 points s'étant comprimé à environ 3. D'où la formule : *« A harness tuned tightly to one lab's weights… degrades on anyone else's model, so the tighter the tuning, the less swappable the weights underneath. Lock-in arrives as a side effect of optimization. »*

#Mozilla#état de l'IA open source#poids ouverts

**Mozilla** — éditeur du rapport · avec une introduction signée **Raffi Krikorian** · *Chief Technology Officer*. Publié en **juillet 2026** (v1.0.1). Données issues de sources tierces créditées (Artificial Analysis, Epoch AI, OpenRouter, LMArena) et d'une enquête propre menée avec **SlashData** (*Mozilla / SlashData 2026 developer survey*, n = 1 410 sur la question des freins).

Économie & Marché

L'intelligence artificielle, quels effets sur l'emploi ?

Note d'analyse **Trésor-Éco n° 391** (juin 2026) de la **Direction générale du Trésor** (Ministère de l'Économie), signée **Martin Chopard, Elisa Cotet, Tristan Gantois et Eloïse Villani**. Revue de littérature économique institutionnelle sur **l'effet de l'IA (surtout générative) sur l'emploi**. **Thèse en trois temps** : (1) l'IA joue sur le volume d'emploi via **deux canaux opposés** — effet de **déplacement** (substitution de tâches automatisables) vs effet de **productivité** (complémentarité, baisse des coûts, demande accrue) — mais l'**effet agrégé reste pour l'instant faible/non mesurable**, faute de recul et d'adoption (≈20 % des entreprises UE en 2025) ; (2) des **effets hétérogènes** apparaissent selon les **métiers** (exposition ≠ effet : tout dépend du degré de substituabilité/complémentarité et de l'**élasticité-prix** de la demande), les **travailleurs** (progrès technique biaisé, craintes pour les **jeunes**) et les **secteurs** (finance, informatique, services aux entreprises les plus exposés) ; (3) à **long terme, l'effet net reste incertain** — entre substitution massive (si IA agentique/physique se généralise) et **destruction créatrice** (leçon des révolutions passées : les innovations ont créé plus d'emplois qu'elles n'en ont détruit). Conclusion de **politique publique** : accompagner la transition (formation, mobilités — plan « Osez l'IA », France 2030) et **investir dans l'IA pour ne pas décrocher** face à la concurrence internationale. Corpus abondamment sourcé (43 notes, panels d'estimations Tableaux 1-3).

#IA et emploi#intelligence artificielle générative#effet de déplacement

**Martin Chopard · Elisa Cotet · Tristan Gantois · Eloïse Villani** — économistes de la **Direction générale du Trésor** (DG Trésor) · Ministère de l'Économie · des Finances et de la Souveraineté industrielle · énergétique et numérique. Directrice de la publication : Dorothée Rouzet. Le document engage la DG Trésor mais « ne reflète pas nécessairement la position du ministère ».

Architecture & Construction

New Engineering Disciplines for the AI Era Part 3: KDLC — Knowledge Development Life Cycle

Troisième volet de la série « New Engineering Disciplines for the AI Era » d'Ashish Singh, consacré au **KDLC — Knowledge Development Life Cycle** : un cycle de vie en **8 étapes** pour transformer la connaissance d'entreprise en **actif ingénieré**, au même titre que le code ou la donnée. Thèse : les initiatives IA échouent parce qu'elles se focalisent sur le choix du LLM ou le déploiement d'un RAG, **sans traiter la structure sous-jacente de la connaissance** — « AI is only as effective as the knowledge it can discover, understand, retrieve, and trust ». Le KDLC enchaîne Discovery → Extraction → Structuring → Knowledge Graph → Embedding → Index Optimization → Retrieval Evaluation → Refresh. Il oppose le **RAG traditionnel** (documents isolés, mots-clés) à l'**Enterprise Knowledge Fabric** (Knowledge Graphs + Semantic Search + Vector DB + Hybrid Search) où les agents comprennent « relationships, context, and business meaning ». Formule-signal : « Models provide reasoning. Memory provides continuity. Knowledge provides understanding. » Trois exemples (finance/conformité, ingénierie logicielle, santé) illustrent l'impact.

#KDLC#knowledge development life cycle#cycle de vie de la connaissance

Ashish Singh

3 Key Product Development Loops (The Batch, Issue 359 — « Dear friends » letter)

Lettre « Dear friends » d'Andrew Ng dans *The Batch* (DeepLearning.AI, n°359) sur le **loop engineering** appliqué au développement produit **0-to-1**. Ng partage ses **3 boucles clés** — boucle de codage agentique (~minutes), boucle de feedback développeur (~heures), boucle de feedback externe (~jours) — imbriquées par échelle de temps croissante, reliant *coding agent → product spec/evals → developer vision → external feedback*. Thèse centrale : les humains conservent un **avantage de contexte** (plutôt qu'un « goût ») qui rend le human-in-the-loop indispensable ; les ingénieurs endossent un rôle partiel de product management. Domaine : agents de codage, ingénierie produit, méthodologie agentique.

#Loop engineering#développement produit#boucle de codage agentique

Andrew Ng

Transformation & Adoption

AI4IT vs AI4Business : le renversement, et ce qu'il fait à vos budgets 2027

Article de fond (point de vue) publié sur **sfeir.com** le 24 juin 2026, signé **Didier Girard** (Managing Director, SFEIR). **Thèse centrale** : en 2024 tout le monde pariait sur l'**AI4Business** (l'IA dans les processus métier) comme grand gisement de valeur ; en 2026, le constat s'est **inversé** — c'est l'**AI4IT** (l'IA pour produire le système d'information : code, SDLC, usine logicielle) qui crée la valeur **mesurable**. L'article *grounde* cette thèse sur la veille du cabinet : déception AI4Business (étude MIT « 95 % de pilotes sans ROI », contestée mais révélatrice ; blocage **organisationnel** / problème hayékien de Mollick) vs preuves AI4IT chiffrées (Salesforce, Intercom, Raiffeisen, AWS/Bedrock, Atlassian, DORA). Explication mécaniste : **le code se vérifie tout seul** (compilation, tests, CI) là où le processus métier n'a ni compilateur ni boucle de feedback immédiate. **Conséquence budgétaire 2027** : bascule **CapEx→OpEx**, dynamique du prix du token (pointe qui monte — Fable 5 à 2× Opus — vs inférence ÷280 et pression baissière open weights/desktop), et **FinOps de l'IA** piloté au **coût par outcome**. Clôture par **4 recommandations COMEX**.

#AI4IT#AI4Business#renversement

**Didier Girard** — Managing Director (CTO / DG) de **SFEIR** · ESN française (~1 000 personnes, France · Belgique · Luxembourg · Suisse). Auteur de l'article ; voix éditoriale du cabinet sur la transformation IA des DSI.

Économie & Marché

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Annonce-benchmark d'**Artificial Analysis** (plateforme d'évaluation indépendante de modèles IA, via X/Twitter + page modèle) : **GLM-5.2** de **Z.ai** (Zhipu AI, @Zai_org) devient **le meilleur modèle à poids ouverts** et se hisse **#3 au classement général** de **GDPval-AA**, un benchmark de *travail de connaissance économiquement valorisable* du monde réel (tâches longue-horizon, multi-tours, agentiques). GLM-5.2 marque **1524 Elo**, derrière les seuls **Claude Fable 5 (1783)** et **Claude Opus 4.8 (1615)**, et à parité avec **GPT-5.5 (xhigh, 1509)**. Il devance d'une large marge le modèle ouvert suivant (**MiniMax-M3, 1408**) et de nombreux modèles propriétaires : **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Les tâches sont réellement agentiques : **~31 tours par tâche** en moyenne sur **1 999 matchs**. La même hiérarchie tient sur l'**Artificial Analysis Intelligence Index** (1er open weights), l'**Agentic Index** (#3) et **AA-Briefcase** (#3, devant GPT-5.5 xhigh, derrière Fable 5). Point saillant : un modèle **open weights** sous **licence MIT**, **MoE 753 Mds de paramètres / 40 Mds actifs**, contexte **1M tokens**, tarifé **1,40 $/4,40 $ par 1M tokens** entrée/sortie, rivalise avec la frontière propriétaire sur le travail agentique — un vrai pas pour les modèles ouverts.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)

Stratégie & Frameworks

Loop Engineering for Product Managers

Essai long format de **Shubham Saboo** (X/Twitter) posant une thèse sur le métier de **Product Manager** à l'ère des agents : la prochaine compétence clé n'est **pas le prompt engineering** mais le **Loop Engineering** — concevoir un *système qui s'améliore à chaque exécution* plutôt qu'écrire le prompt parfait à chaque fois. Une **boucle** = un cycle répété : on modifie ce qui façonne le comportement de l'agent → on exécute → on évalue la sortie → on garde le changement si la qualité monte, on revient en arrière sinon → on **capitalise l'apprentissage** pour que la version suivante démarre en avance. Pour un PM, le point d'entrée n'est pas le code mais les **artefacts durables** qui encodent son jugement : skill de revue de PRD, *summarizer* d'appels clients, rubrique d'évaluation, checklist de lancement, workflow de recherche, `CLAUDE.md`, template de prompt, framework de priorisation. Parce qu'ils sont réutilisés, ces artefacts **composent dans les deux sens** — et **dérivent** silencieusement (CLAUDE.md qui s'allonge, checklist ignorée…) : le modèle n'a pas régressé, les artefacts ont dérivé sans surveillance. Une boucle a **5 parties** : trigger, action, **preuve**, mémoire, **condition d'arrêt** (la plus critique). Les **evals** deviennent du travail de PM (tester l'artefact contre des exemples connus : 3 bons / 3 mauvais PRD, 5 appels compris, 2 lancements passés). La **mémoire** vit sur **GitHub** (le repo devient « mémoire produit » : commits, diffs, résultats d'éval, journal de décision, rollback). Premier loop conseillé : un **weekly product signal loop** (chaque vendredi). Le goût reste central — mais il lui faut désormais une **preuve**. Cite Boris (créateur de Claude Code) : « il n'écrit plus de prompts, il écrit des boucles ».

#Loop Engineering#product management#PM augmenté

Shubham Saboo (@Saboo_Shubham_)

Transformation & Adoption

Comment l'IA agentique bouscule les Grands Groupes ? Partie 2/2 #DevSummit

Entretien podcast « À la French » (chaîne tech francophone, enregistré au DevSummit) avec Mathieu Grymonprez, Global CDO du groupe Adeo (Leroy Merlin, Obramat, Weldom). Comment un groupe de retail familial centenaire embrasse la vague de l'IA agentique : culture vs structure, accountability, coût des tokens et FinOps, lock-in de l'intelligence d'entreprise, mémoire d'entreprise et orchestration d'agents. Domaine : transformation digitale, IA agentique, retail, stratégie SI.

#IA agentique#transformation digitale#CDO

Mathieu Grymonprez (Global CDO, groupe Adeo) — invité ; Jean-Baptiste Kempf · Steeve Morin · Mehdi Medjaoui (hôtes du podcast « À la French »)

Transformation & Adoption

AI made your engineers fast. Too fast to leave room for the rest of the org to think.

Post LinkedIn de Fred Plais (CEO d'Archie, ex-Platform.sh) : l'IA a rendu les ingénieurs si rapides que le **goulot d'étranglement s'est déplacé en amont**, là où personne ne regarde. L'exécution n'étant plus la partie lente, le temps de réflexion qui existait « pendant que le code se construisait » a disparu — il faut désormais avoir la bonne vision et prendre les bonnes décisions en une fraction du temps. Deux profils rares émergent : celui qui sait **formuler une vision assez précise** pour qu'un agent l'exécute sans dérailler, et celui qui sait **orchestrer les agents** (anticiper leurs échecs, les chaîner, rattraper une erreur avant qu'elle se propage). Recruter pour le « code output » devient obsolète : c'est précisément ce qui a cessé d'être rare. Thèse finale : « penser clairement a toujours été le métier — la vitesse a juste rendu impossible de faire semblant ».

#goulot d'étranglement#déplacement du bottleneck#vitesse d'exécution

Fred PLAIS (Frédéric Plais)

Anthropic pauses Claude Agent SDK subscription change on day it was due to take effect

Article de **Paul Sawers** publié sur **The New Stack** le **16 juin 2026**, sur la **suspension par Anthropic** — *« on the very day it was scheduled to go live »* — de la scission de facturation qui devait séparer l'usage de l'**Agent SDK** des limites d'abonnement Claude. **Message d'Anthropic cité** : *« We're pausing the changes to Claude Agent SDK usage described below. For now, nothing has changed. »* **L'apport de l'article n'est pas l'annonce mais le contexte qui l'entoure**, en trois cercles. **Cercle 1 — la semaine d'Anthropic** : le 9 juin, sortie de **Fable 5 et Mythos 5**, premiers modèles de classe Mythos généralement disponibles avec garde-fous cybersécurité durcis ; quelques jours plus tard, une **directive de contrôle à l'export du gouvernement américain** force Anthropic à **retirer les deux modèles pour tous ses clients dans le monde**. La suspension tarifaire est lue comme *« a little good news »* dans ce contexte. **Cercle 2 — les dégâts collatéraux du calendrier** : les entreprises qui avaient déjà répercuté le changement auprès de leurs propres clients se retrouvent en porte-à-faux ; **Conductor**, outil de codage multi-agent bâti sur l'Agent SDK, doit publier un démenti (*« Anthropic has delayed the subscription updates to Claude plans »*). **Cercle 3 — la tension de fond, qui dépasse Anthropic** : citation de **Boris Cherny** (head of Claude Code) en avril, lors d'une restriction antérieure, selon qui les abonnements *« weren't built for the usage patterns of these third-party tools »* — soit l'aveu que **forfait et usage agentique ouvert ne se marient pas** ; **GitHub** a tranché dans le même sens en retirant en juin le modèle de *premium requests* forfaitaires de Copilot au profit d'une **facturation au token**, malgré les protestations. S'ajoute, **la même semaine**, une **proposed class action** déposée devant un tribunal fédéral de Californie, alléguant que les paliers **Max** restent très en deçà des multiplicateurs d'usage annoncés lors des sessions de codage intensives. Anthropic ne dit pas quand une approche révisée arrivera, seulement qu'elle *« works to update the plan to better support how users build with Claude subscriptions »*. **Lecture finale de l'auteur** : entre la pression gouvernementale sur Fable et Mythos, un projet d'**introduction en bourse** et des **baisses de prix supposées chez OpenAI**, Anthropic cherche à **garder sa base de développeurs de son côté** — et la suspension est un moyen d'y parvenir pour l'instant.

#Anthropic#Claude Agent SDK#abonnement Claude

**Paul Sawers** — journaliste tech · signe ici pour **The New Stack**. Registre de **presse spécialisée** : l'article ne relaie pas seulement l'annonce · il la replace dans une série (les changements de facturation successifs d'Anthropic) · la compare à un précédent sectoriel (GitHub Copilot) et l'articule à trois pressions concomitantes (export control, IPO, concurrence). Sourçage explicite et attribué — le billet de Zed · l'analyse de Matthew Diakonov · le post de Conductor · une déclaration antérieure de Boris Cherny.

Architecture & Construction

Un SDLC piloté par l'IA : le cycle SFEIR à 11 phases (et pourquoi l'industrie y converge)

Article SFEIR (en français) qui formalise un **SDLC piloté par l'IA en 11 phases (0 à 10)** et soutient que l'industrie y converge. Constat de départ : en 2025, les organisations ont ajouté des outils IA sans transformer leur modèle opératoire — d'où un paradoxe « tout change… et rien ne change » (la vitesse d'exécution se multiplie sans gain proportionné). La vraie réponse n'est pas le choix d'outils mais la **refonte du cycle** pour une exécution machine. Le cycle SFEIR repose sur **trois portes humaines inamovibles** (Define, Plan, Ship), des phases automatiques entre elles, et **deux moments de capitalisation** (Compound-1 pré-déploiement, Compound-2 en production) qui transforment les leçons en règles réutilisables. Trois principes : l'**IA exécute** (artefacts complets + preuve d'exécution, jamais de confiance aux déclarations de l'agent), l'**humain garde le contrôle de l'intention**, le **système apprend cumulativement**. Résultats mesurés (refonte 6 mois→1 jour, **−30 % d'itérations** après dix cycles) et convergence revendiquée avec ADLC, Google et DORA 2025.

#SDLC#cycle de développement#IA

SFEIR