Aller au contenu

Outils & Plateformes

Outils, plateformes et infrastructure de l'écosystème agentique.

53 fiches · 131 entities · Mis à jour

L'écosystème agentique repose sur des outils, plateformes et infrastructures concrets, et les recenser est le travail mené ici. Assistants de codage et agents autonomes ; runtimes et couches d'orchestration sous-jacents ; tissu connectif — protocoles, interfaces de contexte modèle, IDE, intégrations CI — qui leur permet de toucher de vrais systèmes : chacun est examiné pour ce qu'il fait et la façon dont son harnais est bâti. La consolidation des assistants, runtimes et protocoles de contexte en un plus petit nombre de piles est un fil courant. Où un outil s'insère dans un flux de travail importe autant que la capacité brute. C'est le substrat technique du développement assisté par IA, décrit tel qu'il s'assemble réellement.

Chiffres clés

Concepts clés

Entités clés

Architecture & Construction

DuckDB and the changing physics of analytics

Billet invité d'**Andy Warfield**, ingénieur du service **S3** chez **AWS**, publié le **26 août 2026** sur *All Things Distributed*, le blog de **Werner Vogels**, qui le présente en quelques lignes signées *« --W »* : **3 554 mots** annoncés par la page. Le texte sert de véhicule à l'annonce que **DuckLabs**, l'équipe derrière **DuckDB**, rejoint **AWS**. (A) La thèse : l'informatique système consiste à chercher le compromis élégant face à une « physique » mobile — les rapports entre vitesse mémoire, réseau et calcul — et cette physique a changé. Warfield chiffre l'écart : une **m1.xlarge** de 2007 offrait **15 Go de RAM**, **4 cœurs virtuels** et **~1 Gb/s** de réseau ; une **m8g.48xlarge** d'aujourd'hui environ **50×** plus de chacun des trois. La croissance des jeux de données, elle, suit une distribution dont les très grands volumes sont la queue. (B) La conséquence : le traitement distribué — **MapReduce**, les **RDD** de **Spark** — a été conçu sous la contrainte d'I/O du début des années 2000, et une grande part du travail qui lui était confié n'a plus besoin de quitter l'application. D'où le moteur embarqué en bibliothèque, dans l'espace d'adressage de l'application, dont **DuckDB** est l'exemple. Warfield y adosse l'article *Scalability! But at what COST?* (2015) et l'épigraphe de **Paul Barham** : *« You can have a second computer once you've shown you know how to use the first one. »* Il pose une réserve explicite : *« When a job genuinely needs a thousand machines, it needs a thousand machines. »* Le corpus tient déjà [[vogels-tech-predictions-2026-allthingsdistributed-2025-11-25]] du même blog et [[anthropic-self-service-data-analytics-claude-agentic-stack-2026-06-03]] sur l'analytique en libre-service.

#DuckDB#DuckLabs#acquisition AWS

Andy Warfield · ingénieur du service S3 chez AWS · en billet invité sur *All Things Distributed* ; introduction de Werner Vogels · CTO d'Amazon.

Outils & Plateformes

Designing AI with character: what we learned building Berd

Billet du blog corporate de **Block** (`block.xyz/inside`), non signé — l'auteur affiché est **« Block »** —, publié le **18 août 2026**, ~930 mots, qui annonce **l'ouverture du code de Berd**, l'application de bureau interne de Block pour travailler avec des agents, et expose la thèse de conception qui l'a guidée : donner du caractère aux agents *« not only through roles, instructions, skills, and tools, but through distinctive visual identities »* — d'où les personnages animés maison, les *« Gloopies »*. Le billet part d'un constat de fragmentation (*« The technology was powerful, but the experience around it was fragmented »*) et d'un problème d'interface nommé avec précision : *« the product gives people little sense of how the agent is configured, which context and tools are available to it, and how it differs from another agent »*. Deux apports structurants. **(A) Une articulation en trois étages** : **goose** reste le framework et le *runtime* qui tient la boucle d'agent ; **Berd** est le client de bureau (projets, contexte, sessions, agents, configuration) ; les deux communiquent par l'**Agent Client Protocol**. **Buzz** est désigné comme la suite, quand le travail solo devient collaboratif (*« Start alone, then go multiplayer »*). **(B) Six exigences léguées à Buzz**, énoncées comme bilan : *« private space, durable context, recognizable agent identities, reusable skills, visible configuration, and clearer visibility into an agent's configured context, tools, and capabilities »* — grille directement réutilisable pour évaluer un client d'agents. Le texte distingue lui-même identité et capacité : *« The avatars make the agent recognizable. Its role, skills, and tools make it useful. »* Aucun chiffre d'usage n'est produit et aucune licence n'est nommée pour l'ouverture de code.

#Berd#Block#open source

**Aucun auteur nommé** : le billet est signé **« Block »** — le champ *Author* de la page porte le nom de l'entreprise. Publié le **18 août 2026** sur `block.xyz/inside` · le blog **corporate** · et non sur `engineering.block.xyz`.

Qualité & Sécurité

Securing Software at the Speed of AI: What Four Years of Data Reveal

Billet du blog de **Sonatype** signé **Aaron Linskens** (*technical writer*), publié le **18 août 2026**, ~1 300 mots : il restitue une étude de **Sonatype Research Labs** portant sur **49 mois** (juin 2022 — juin 2026) et sur une **cohorte fixe** d'applications d'entreprise, choix de méthode revendiqué pour isoler l'évolution du parc plutôt que celle du portefeuille clients. Résultat présenté comme une contradiction : on corrige plus vite et on accumule pourtant plus de risque. (A) **Le stock monte** — vulnérabilités *Critical* et *High* par application **×4,31** (de **14,14** en juin 2022 à **54,3** en 2026, encore **×3,91** hors applications légataires nouvellement prises en gestion), versions de composants nouvellement affectées à **46×** le rythme d'avant l'IA, création mensuelle d'applications **×4,84**. (B) **La remédiation progresse** — plus de la moitié des violations résolues le sont en moins d'un jour, l'âge médian des *Critical/High* non résolues passe de **228** à **126 jours** puis à **103** en mai 2026 ; sur les cohortes ayant eu douze mois, **52,6 %** sont résolues, **44,3 %** ouvertes, **3,1 %** en dérogation. (C) **Le point d'appui proposé est le choix du composant** : au moment où une dépendance vulnérable a été retenue, une version sensiblement moins risquée existait déjà dans **62,2 %** des cas sur **Maven**, **46,9 %** sur **npm**, **34,3 %** sur **PyPI** — écart que le texte attribue à un défaut d'information et non à une faute de développeur. Le billet énonce lui-même que l'IA n'est pas la cause unique de l'accélération, et se conclut sur **Sonatype Guide**, qui porte cette intelligence au point de sélection. Il prolonge côté chaîne d'approvisionnement ce que [[fiches/2026-08/staples-gitlab-when-code-is-abundant-2026-08-24]] pose en économie et [[fiches/2026-07/clinton-anthropic-secure-ai-native-sdlc-2026-07-21]] en cycle sécurisé.

#chaîne d'approvisionnement logicielle#software supply chain#Sonatype Research Labs

Aaron Linskens · *technical writer* chez Sonatype · sur le blog de l'éditeur ; les chiffres sont produits par Sonatype Research Labs · non par l'auteur.

Architecture & Construction

Projects in Buzz

Billet d'annonce produit de **Block Engineering** signé **Thomas Petersen** (*Principal Designer & Builder*), publié le **18 août 2026**, ~1 800 mots en treize sections courtes, présentant **Buzz Projects** — une **forge logicielle hébergée sur son propre relais** : dépôts Git, branches, pull requests, issues, revue et fusion, projets multi-dépôts, fil d'activité, le tout lié aux canaux de conversation. Chapeau et thèse du billet : *« Coding agents are the terminal for your computer. Buzz is the terminal for your network. »* Trois apports. **(A) Une doctrine de la confiance fondée sur la preuve *ex post* plutôt que sur l'autorisation *ex ante*** : d'un côté *« No forced guardrails, no limitations on what your agents are allowed to help you with »*, de l'autre *« Every push, review, approval, and merge is a signed Nostr event. If an agent authors a patch, you can see which agent produced it and which human authorized that agent to act »* ; la section se clôt sur une piste déclarée — *« we are already exploring ideas around agent trust protocols informed by past behavior »*. **(B) Une interopérabilité Git sans outillage propriétaire** : *« These are standard git repositories… You can fetch, clone, pull, and push over plain Smart HTTP, with no custom tooling or wrapper CLI required »*, la clé Nostr servant d'identité unique — *« The same npub that signs your messages signs your pushes. »* **(C) Une distinction entre surface d'exécution et présence réseau** : *« A terminal gives an agent somewhere to execute commands and change files, but it does not give it a persistent place in the network. Buzz does. »* Le billet ne produit aucun chiffre et ne comporte aucun lien sortant ; il se qualifie six fois de préliminaire (*« still very basic »*, *« fairly elementary »*, *« still under experiments »*) et Projects vit sous l'onglet **Experiments** de Buzz Desktop.

#Buzz#Buzz Projects#Block

**Thomas Petersen** — *« Principal Designer & Builder »* chez **Block** · auteur unique et signataire du billet ; première apparition dans le corpus. Publié le **18 août 2026** sur le blog **Block Engineering**. Troisième signature Block sur Buzz en un mois · après Tyler Longwell (21 juillet) et Atish Patel (6 août) · et la première non-ingénieur.

Qualité & Sécurité

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Billet d'annonce publié sur le **blog officiel de Z.ai** (ex-Zhipu AI, laboratoire chinois) le **14 août 2026**, **sans signature individuelle**, ~2 000 mots plus notes de bas de page. Il annonce **GLM-5.3**, successeur de GLM-5.2, avec une thèse méthodologique en tête d'article : *« Scaling post-training is all we did for GLM-5.3. »* Même modèle de base que GLM-5.2 — *« every gain comes from post-training »*. Trois annonces. **(A) Un modèle de codage à poids ouverts** : +50 % revendiqués sur **Z.ai Code Bench**, benchmark maison non publié. **(B) Une capacité cyber présentée comme « émergente »**, que le corps du texte rattache à un choix d'entraînement — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ce qui a surpris étant la vitesse et le changement de nature : le modèle passe de l'identification de failles isolées à *« des plans cohérents pour des chaînes d'exploitation complètes »*. Les gains croissent avec la position dans la chaîne d'exploitation : CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** tâches en 2 h (×3,6), l'écart au frontier fermé restant large (181 et 247 tâches). Z.ai le formule ainsi : *« Capability is growing fastest exactly where we are furthest behind. »* Le billet publie également un **Z.ai Security Disclosure Ledger** : **2 436 vulnérabilités identifiées dans 269 projets open source** — noyaux, OS, moteurs de navigateur, infrastructure, applications web, protocoles réseau —, la plus ancienne introduite en **1981**, durée de vie moyenne avant découverte **26,6 ans**, dont **53 divulguées** et **2 383 sous embargo**. **(C) Une publication des poids** *« dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés »*. Contribution méthodologique la plus réutilisable : la **synthèse d'environnements et de vérificateurs**, ces derniers produits sans accès à la solution de référence et admis seulement après un triptyque de contrôles négatifs — **oracle**, **no-op**, **unsolved-state**. Toutes les évaluations agentiques sont conduites **dans Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Agents de codage IA & Skills

DeepSeek Harness developer preview: Everything is a plugin

Page produit officielle de **DeepSeek**, publiée le **13 août 2026**, **non signée**, ~450 mots, annonçant la mise en *developer preview* de **DeepSeek Harness** (`dsh`) — un harnais d'agent de codage **open source sous licence MIT**, dont le dépôt est ouvert le même jour. Thèse en trois mots, répétée en titre et en description du dépôt : *« Everything is a plugin »*, assortie d'une seconde promesse, *« Every run is traceable »*. La page pose l'équation *« AGENT = MODEL + HARNESS »* et énumère les capacités enfichables — *« models, tools, skills, sessions, sandboxes, storage, loops, scheduling, and the UI »*. Quatre modes sont livrés : **Standard** (agent de codage complet), **Code** (outils exposés via le *Code Mode SDK*, pour que le modèle compose des opérations multi-étapes dans un programme TypeScript), **Minimal** (*« two-tool coding agent with persistent bash and str_replace_editor »*, explicitement *« for benchmarking models in a minimal environment »*) et **Creator** (inspection du runtime, test de plugins en mémoire). La substance technique est dans le dépôt, non sur la page : `docs/architecture.md` énonce un invariant de journalisation — *« Model-visible means logged. Anything that reaches a model request must be reconstructable from the log, and a runtime invariant asserts it »* — et pose qu'*« il n'y a pas de noyau privilégié à patcher »*. Le noyau technique n'est pas de DeepSeek : DSH est bâti sur **Cordis** (projet `cordiverse`, tiers), **vendoré** dans `vendor/` avec manifeste et procédure de synchronisation, et la page met le *« Cordis paper »* au même rang de navigation que « GitHub » et « Developer docs ». Deux adaptateurs LLM sont livrés — `dsh-llm-deepseek` et `dsh-llm-pi-ai`, adaptateur multi-fournisseurs générique. Le dépôt avertit en capitales : *« THERE WILL BE COMPATIBILITY-BREAKING CHANGES »*, et `CLAUDE.md` précise que `SESSION_FORMAT_VERSION` reste à `0` *« with no compatibility promise »*, les backends rejetant les anciens formats sur disque. Calendrier : DSH sort le jour où **DeepSeek-V4-Pro passe en GA**, trois jours avant une nouvelle grille tarifaire API effective le **16 août 2026 à 16:00 UTC**, en heures pleines / heures creuses avec un creux à **−50 %**.

#DeepSeek Harness#dsh#harnais d'agent

**DeepSeek** (DeepSeek AI, laboratoire chinois) · en tant qu'institution. Page produit **non signée** : aucun auteur · aucun ingénieur mis en avant · aucun billet de blog ni papier technique associé. Le « nous » n'apparaît qu'une fois · en dernière phrase — *« We look forward to exploring the limits of intelligence with developers worldwide »*. Publiée le **13 août 2026**. La page est rendue en JavaScript : `curl` sur l'URL renvoie **HTTP 202 avec un corps vide** · le texte n'existant qu'après exécution du bundle. Deux documents de politique sont liés en pied de page — *Safe Use Policy* et *Data Processing Statement*.

Architecture & Construction

Buzz (buzz.xyz) — Rapport de recherche pour présentation

Rapport de recherche interne du **12 août 2026** consolidant, en vue d'une présentation, tout ce qui est publiquement documenté sur **Buzz** — le workspace humains + agents de **Block**, lancé le **21 juillet 2026** sous licence **Apache 2.0**. Il agrège les deux billets d'ingénierie déjà fichés avec l'annonce corporate, le dépôt GitHub, la presse, X, et **trois retours d'expérience indépendants** qui constituent les seules données non auto-déclarées du dossier. **(A) Un écart de vocabulaire documenté par citation** : le tweet de lancement de **Jack Dorsey** annonce *« model-agnostic, decentralized, self-sovereign, and open source »* ; l'`ARCHITECTURE.md` de Block écrit *« The relay is the single source of truth. All reads and writes flow through it. There is no peer-to-peer event exchange, no gossip, no replication. »* Le relais est donc unique et autoritaire par communauté : la « décentralisation » de Buzz est une **souveraineté organisationnelle** — auto-hébergement et identité portable — non une redondance réseau. Formule de **TFTC** : *« Two of those three hold cleanly. The third needs a qualifier. »* **(B) Une asymétrie entre la rigueur démontrée et le risque d'exploitation.** D'un côté, un formalisme rare pour une v0.4.x/0.5.x : spécification d'isolation multi-tenant **mécanisée en TLA+**, propriétés d'autorisation vérifiées en **Tamarin**, protocole de stockage Git model-checké, journal d'audit append-only à chaîne de hash, 127 *event kinds*, NIP-01/42/98/34. De l'autre, l'appartenance au canal est l'unité de permission — *« channel membership is not fine-grained tool authorization »* (João Queirós) —, les agents tournent en `--dangerously-skip-permissions` hors bac à sable sur le poste d'un humain, et l'observabilité manque : *« Buzz tells me an agent got a message. It doesn't tell me what happens next »* (DevTools Daily, qui rapporte des kills OOM silencieux). Block l'assume : *« the agent can do anything, and security rests entirely on restricting who can tell it what to do »*. **(C) La pile technique**, absente des billets fichés : relais **Rust** (Axum WS + REST), **Postgres**, **Redis**, **S3/MinIO** via Blossom, client desktop **Tauri + React**. L'intégration agent passe par **`buzz-acp`**, harnais **ACP** qui branche goose, Codex et Claude Code et traduit **ACP ↔ MCP**, plus **`buzz-agent`**, agent maison. Le rapport se corrige lui-même sur un point : le *« +33 % de travail »* du TL;DR de Block est le **ratio de tâches terminées (20 contre 15 sur 44)**, non un gain de score — celui-ci passe de 59,1 % à 71,5 %, soit **+12,4 points**.

#Buzz#buzz.xyz#Block

**Deep Research Veille Interne** — rapport non signé · produit le **12 août 2026** en préparation d'une présentation. Aucune URL publique ; source archivée dans `raw-data/`.

Outils & Plateformes

ChatGPT Desktop & Claude Desktop vs versions web — Rapport « What ? — So What ? — Now What ? »

Rapport de recherche interne du **12 août 2026** (format *What ? — So What ? — Now What ?*, enquête menée les 11-12 août) sur une question simple : les applications **desktop** de ChatGPT et de Claude sont-elles meilleures que leurs versions **web** ? La réponse est en deux temps. **(A) Un consensus qualitatif solide et sourcé existe.** Le point de départ est incontestable : desktop et web appellent exactement les mêmes modèles cloud, l'application n'étant qu'une interface du service — le gain se situe donc intégralement dans l'enveloppe applicative (latence d'accès, stabilité en session longue, empreinte mémoire, intégrations système, fluidité du workflow). Ce qui distingue réellement le desktop, confirmé : côté OpenAI, raccourci global (Option/Alt + Espace), *companion window* toujours au premier plan, captures d'écran natives, et depuis juillet 2026 l'agentique **Codex/Work** intégrée à l'app ; côté Anthropic, **Quick Entry** (macOS), **Desktop Extensions** (installer un serveur **MCP** local devient *« as simple as clicking a button »*), accès aux fichiers locaux, **Cowork** et **Computer Use** (permissions Accessibilité et enregistrement d'écran). Le web garde deux atouts confirmés : multi-onglets / multi-fils, et universalité sans client à installer. **(B) La quasi-totalité des chiffres qui circulent pour étayer ce consensus ne résiste pas à la vérification.** L'audit critique du rapport (§1.5) classe **non confirmées** sept affirmations chiffrées largement reprises : le *cold start* « 2-3 s vs 8-12 s » (seule trace, un *« loads in about 3 seconds »* anecdotique sur Substack) ; la RAM « 200-700 Mo vs 1,2-2 Go », attribuée à un « Alibaba Product Insights » dont les pages renvoient **404** ; un *glitch rate* et une rétention de session introuvables ; un « Claude +10-20 % end-to-end » attribué à **Skywork**, qui avait en réalité benchmarké son propre agent Windows et non Claude contre le web ; une source « Cosmo Edge » introuvable ; des citations Zenken AI non confirmées ; et deux posts X non authentifiés, sans URL. Le contre-signal est documenté avec la même rigueur : Yuri Dvoinos décrit une app Claude Desktop qui *« makes me want to throw my laptop out the window »* — 68 % de CPU, lag de saisie sur MacBook Pro —, et le rapport rappelle que les deux apps sont des constructions **Electron** avec couches natives. D'où sa formule : *l'avantage desktop est une promesse d'implémentation, pas une loi de la nature.* **Le « So What »** : puisque le modèle est devenu le point commun, l'interface devient le champ de bataille — la fusion **Codex + ChatGPT** du 9 juillet 2026 et le tandem Cowork / Computer Use racontent la même histoire, *« l'app desktop n'est plus un client de chat, c'est un runtime d'agents avec accès à la machine »*. Trois conséquences : le gain est un gain de **friction**, non de puissance ; pour une DSI, le desktop **déplace la frontière de confiance** — Computer Use exige des permissions système sensibles et la fusion Codex place exécution de code, navigateur et connecteurs dans *« one expanded trust boundary »*, là où le navigateur reste gouvernable par SSO, DLP et CASB ; et pour qui publie, la fragilité des chiffres est en elle-même l'information. **Le « Now What »** livre des critères de bascule individuels, une checklist DSI (inventorier les permissions, désactiver Computer Use et Cowork par défaut, cadrer les extensions MCP autorisées, organiser distribution et mises à jour — sur Linux, hors dépôt apt, Claude Desktop ne se met pas à jour seul) et une consigne éditoriale : ne citer que les verbatims et dates confirmés.

#ChatGPT Desktop#Claude Desktop#version web

**Deep Research Veille Interne** — rapport non signé · produit par une enquête sourcée menée les **11-12 août 2026** et rendu le 12.

Qualité & Sécurité

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

Note de veille de **Didier Girard** publiée sur **X** le **7 août 2026**, qui lit le lancement de **Shieldstral 1.0 3B** (Mistral AI, 4 août 2026) non comme une sortie produit mais comme **la mise en production d'une doctrine**. Point de départ : le **13 mai 2026**, devant la commission d'enquête de l'Assemblée nationale sur les vulnérabilités numériques, **Arthur Mensch** refusait tout droit de regard de Mistral sur l'usage final de ses modèles — *« nous n'avons pas la légitimité démocratique »* — en écartant explicitement la posture d'**Anthropic**. Moins de trois mois plus tard, Mistral publie un **modèle de modération**. L'auteur écarte la contradiction apparente : **Shieldstral ne porte aucune taxonomie du licite et de l'illicite**, il répond à une **question que l'utilisateur écrit**. **Le mécanisme est le cœur de la note** : un prompt en trois parties (contexte + sévérité / une seule question fermée / le contenu à juger), une réponse `yes` ou `no`, et la **softmax sur ces deux tokens** produit un score continu entre 0 et 1. **La politique de modération n'est pas dans les poids, elle est lue à l'inférence** — là où **Llama Guard 4** embarque la taxonomie MLCommons figée à l'entraînement, Shieldstral lit la vôtre en langage naturel, modifiable **sans réentraînement**. Le rapport technique (**arXiv:2607.25857**, 28 juillet 2026) chiffre le coût de ce choix : fine-tuning sur données publiques seules = **61,1 % de F1** en adaptabilité aux politiques ; **4,4 millions de paires contrastives** générées par LLM (même contenu réécrit pour violer une politique mais pas sa politique sœur) = **+23,3 points** ; **91,3 %** après fusion de trois checkpoints. Caractéristiques : **3,8 Md de paramètres réels** (le « 3B » du nom arrondit vers le bas), base **Ministral 3** + encodeur vision **Pixtral**, **12 langues**, **16 Go de VRAM en BF16**, **Apache 2.0**. Performance texte : **84,9 % de F1 moyen**, à égalité avec **GPT-OSS-Safeguard-20B** (sept fois plus gros), devant **Qwen3Guard-8B** (84,0) et loin devant **LlamaGuard-4-12B** (69,1). **Réserve posée par l'auteur lui-même** : *tous ces chiffres viennent de Mistral, sur des jeux de test que Mistral a sélectionnés, et aucune évaluation tierce n'existait au 6 août*. La thèse structurante est une **opposition de topologies** : chez **Anthropic**, le garde-fou vit **dans les poids** et l'éditeur arbitre qui y échappe (**Claude Fable 5** public avec mesures de sécurité / **Claude Mythos 5** sans, réservé aux cyberdéfenseurs approuvés du **Project Glasswing**, 9 juin 2026) ; chez **Mistral**, le garde-fou **sort du modèle** — composant séparé, ouvert, auto-hébergeable, dont la politique appartient au déployeur. Alignement client explicite (ministère des Armées, BNP Paribas, administrations françaises et luxembourgeoise). La note se termine sur un **revers en trois points documentés** : **auditabilité** (sortie binaire, aucune trace de raisonnement, alors que le déployeur hérite de la charge de justification en audit AI Act), **robustesse** (le premier chapitre du *Traité sur la tolérance* de Voltaire classé « appelle à la violence » par un testeur du fil Hacker News — confusion mention/adhésion), **disponibilité** (au 6 août : pas d'endpoint facturé sur La Plateforme, pas d'Ollama officiel). Trois règles de déploiement en clôture.

#Shieldstral#Shieldstral 1.0 3B#Mistral AI

**Didier Girard** — auteur de la note · publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle · il croise une **audition parlementaire** (Mensch, 13 mai) · un **lancement produit** (Shieldstral, 4 août) · un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Agent Plugins package your skills, tools, and more

Annonce **Google** du **6 août 2026** : Google rejoint comme **Core Maintainer** la spécification **Agent Plugins 1.0.0**, format d'empaquetage ouvert et *vendor-neutral* pour distribuer ensemble des **Agent Skills** et des **serveurs MCP**. La spécification a été publiée par un **TSC** dont les Core Maintainers viennent d'**Amazon, Cursor, Microsoft, OpenAI et Vercel** ; Google s'y ajoute, représenté par **Kevin Hou** (Senior Staff Engineer, Google DeepMind). Les deux briques empaquetées — Agent Skills et MCP — sont d'origine **Anthropic**, qui ne figure pas dans cette liste de mainteneurs. **Le diagnostic** tient en une phrase : *« The core problem isn't the components. It's the manifest. »* Une skill est portable, un serveur MCP est portable ; la boîte dans laquelle on les met ne l'est pas, et chaque client a dû l'inventer pour lui-même — d'où les forks, les copies de composants identiques et leur dérive. **Le format** tient en une contrainte : *« A plugin is a directory. That's the whole idea, and the restraint is the point. »* Un `plugin.json` à deux lignes utiles (`$schema` et `name`), des skills dans `skills/` au format Agent Skills, des serveurs déclarés dans `mcp.json` avec un **`type` explicite sur chaque entrée** (stdio, Streamable HTTP, ou HTTP+SSE historique) — plus de transport deviné à la forme de l'objet de configuration. La force du design est dans ce que le manifeste **ne peut pas** faire : ni déplacer les composants, ni les déclarer en ligne, donc aucun chemin de découverte à configurer et aucun ordre de précédence à apprendre. Corollaire opérationnel : les composants **échouent indépendamment** — un serveur `mcp.json` qui ne démarre pas n'emporte pas les skills du plugin, le client saute l'entrée, continue et signale l'échec. L'échappatoire assumée est le répertoire en **domaine inversé** (`com.example.client/`), espace d'extension appartenant entièrement à un client (hooks, agents, commandes) que les autres ignorent : *« le cœur portable reste petit parce que les parties non portables ont un endroit légitime où aller »*. Une section est consacrée aux cas où le format ne se justifie pas — *« Not every skill should be a Plugin »* : un seul serveur MCP vers un seul client, `mcp.json` suffit ; une seule skill, pas besoin de plugin. Ce que la v1 exclut explicitement, en *future considerations* : **aucun mécanisme d'installation, aucun protocole de distribution, aucun modèle de permissions, aucune exigence de bac à sable, aucune vérification de confiance ou de provenance, aucune UX**. Le tout s'insère dans une pile à quatre couches indépendamment adoptables — **trouver** (Agentic Resource Discovery), **décrire** (AI Catalog, qui enregistrerait le type `application/agent-plugins+json`), **empaqueter** (Agent Plugins), **exécuter** (MCP + Agent Skills). Deux produits Google livrent déjà : **Agents CLI** et **Data Agent Kit** (BigQuery, Spanner, Cloud SQL).

#Agent Plugins#Agent Plugins 1.0.0#spécification ouverte

Trois signataires · répartis sur trois entités Google :

Outils & Plateformes

Graphify — Knowledge Graphs for AI Coding Assistants (site graphify.net : vitrine, annuaire d'outils et galerie de dépôts graphifiés)

Site **graphify.net**, consulté le **6 août 2026**, maintenu par **Safi Shamsi** — le créateur de la skill open source graphify (cf. [[skill-shamsi-graphify-2026-08-06]]). Le domaine porte deux objets qu'il faut distinguer. **Le premier est une vitrine produit** : présentation de graphify, guides d'usage, référence CLI, et surtout une galerie de **100 dépôts GitHub tendance déjà graphifiés** — *« 100 repos, 854 079 nœuds, 1 932 930 arêtes »* — filtrables par langage et par taille de graphe, chacun avec sa prévisualisation et sa page de détail. **Le second, et c'est le plus intéressant pour une veille, est un annuaire éditorial** : *« 30 AI coding client guides »*, un répertoire de serveurs MCP comparés sur *« transport, runtime, client support, setup effort, and access risks »*, des comparaisons structurées entre outils (Cursor contre Codex), et un flux d'articles au ciblage manifestement longue traîne (*« GLM-5.2 Knowledge Graph for Developers »*, *« Trae Context Engineering for Agents »*, *« Symphony Knowledge Graph for Agent Memory »*, *« What Is Cowart? A Codex Plugin for Image Editing »*). Le site revendique une méthode — *« source-reviewed »*, *« aligned decision fields, official evidence, and explicit unknowns »* — et se décline en six langues. **Le point que cette fiche existe pour consigner** : le site est **factuellement décalé par rapport au produit qu'il présente**. Il annonce **« 3,7k+ GitHub Stars »** quand l'API GitHub en compte **103 187** le même jour, une **licence MIT** répétée trois fois quand le fichier `LICENSE` du dépôt est une **Apache 2.0**, et met en avant l'argument **« 71,5× de réduction de tokens »** qui appartient au README de la génération v1 et a disparu de la version courante. **Un site officiel qui affiche 3,7 % du nombre d'étoiles réel et se trompe de licence** est un signal en soi : la couche de communication n'a pas suivi le rythme du dépôt.

#graphify.net#annuaire d'outils IA#directory

**Safi Shamsi** — mainteneur déclaré en pied de page (*« © 2026 Graphify. Built in the open. Maintained by Safi Shamsi »*) · également créateur de la skill graphify et fondateur de **Graphify Labs** (Y Combinator S26). Le site est donc une **propriété officielle du projet** · non un site tiers.

graphify — « Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store. »

Fiche de **Skill** : **graphify** de **Safi Shamsi** (Graphify Labs, Y Combinator S26) transforme un projet entier — code, docs, PDF, images, vidéos — en **graphe de connaissance interrogeable**, invocable par `/graphify` depuis Claude Code, Cursor, Codex, Gemini CLI, GitHub Copilot et une quinzaine d'autres clients. Observé le **6 août 2026** : **103 187 étoiles**, **10 024 forks**, dépôt créé le **3 avril 2026**. Apache-2.0, Python 3.10+, branche par défaut **v8**. **Trois partis pris de conception**, énoncés dans le README. *« Code maps for free, fully local »* : le code est parsé en **AST tree-sitter**, de façon déterministe et sans LLM, rien ne quittant la machine. *« Every edge is explained »* : chaque arête est étiquetée **`EXTRACTED`** (explicite dans la source) ou **`INFERRED`** (résolue par graphify), une troisième valeur `AMBIGUOUS` apparaissant dans le rapport. *« Not a vector index »* : *« no embeddings, no vector store: a real graph you traverse »*. **Trois sorties** : `graph.html` (graphe interactif), `GRAPH_REPORT.md` (god nodes, connexions surprenantes, questions suggérées) et `graph.json` (graphe persistant, interrogeable des semaines plus tard sans relire les fichiers). **Trois modes d'interrogation** en remplacement du grep : `query` (sous-graphe pour une question en langue naturelle), `path A B` (plus court chemin entre deux entités) et `explain` (voisinage d'un concept). **Couverture** : 36 grammaires tree-sitter (~40 langages), plus Terraform, Apex, configurations MCP, manifestes de paquets, Office, Google Workspace, PDF, images, et vidéo/audio transcrits localement par faster-whisper. Communautés détectées par **Leiden**, labellisées sans LLM. **Benchmarks** : sur LOCOMO, recall@10 de **0,497** contre 0,149 pour supermemory et 0,048 pour mem0, mais exactitude QA inférieure (45,3 % contre 49,7 %) ; sur LongMemEval-S, **76 %**, à égalité avec un RAG dense ; et *« Graph build — LLM credits: 0 »*. **Points à consigner** : la branche `main` porte un README de l'ère v1 décrivant un produit différent (skill Claude Code uniquement, argument « 71,5× moins de tokens ») ; le paquet PyPI s'appelle **`graphifyy`** avec deux *y*, le temps que le nom `graphify` soit récupéré ; et un **journal de requêtes** est écrit par défaut dans `~/.cache/graphify-queries.log`, désactivable par variable d'environnement.

#skill#graphe de connaissance#knowledge graph

**Safi Shamsi** — créateur et mainteneur de graphify · et de **Graphify Labs** · société passée par **Y Combinator (promotion S26)** selon le badge du dépôt. Il maintient aussi le site d'annuaire `graphify.net` (cf. [[graphify-net-annuaire-ia-coding-2026-08-06]]) et publie un livre · *The Memory Layer* · sur les idées et l'architecture derrière le projet.

Introducing Muse Code and Muse Spark 1.2

Annonce de **Meta AI Research** publiée le **5 août 2026** (lecture annoncée : 4 minutes, aucune signature individuelle) : **Muse Code** en bêta, *« a terminal coding agent »*, et le modèle qui l'anime, **Muse Spark 1.2**. Meta situe elle-même le lancement : *« This marks our next step toward the frontier, with larger and much more capable models on the way. »* **Trois éléments d'architecture côté harnais.** Des **agents d'arrière-plan asynchrones** qui *« remain active throughout each session, rather than being spawned for individual tasks »*, afin d'éviter la collecte d'information redondante et de réduire le besoin de pilotage. Un **journal d'événements local** où *« every model call, tool run, approval, and edit is appended »*, faisant du runtime un système *« replay-exact and restart-safe »* capable de reprendre exactement où il s'est arrêté après un plantage. Et **trois skills livrées d'origine** : `/plan` (transforme une tâche en plan soumis à approbation), **`/grill`** (met le plan à l'épreuve *« until it holds up »*) et `/goal`. **Côté modèle**, Meta revendique un **co-entraînement du modèle avec le harnais** (*« to maximize harness compatibility »*, avec trajectoires de harnais échantillonnées par rejet et optimisations de recette pour les buts, la compaction et les sous-agents), un entraînement **long-horizon** (génération de dépôt entier, projets bout-en-bout, auto-recherche, avec planification, conditionnement par le but et compaction de contexte), et une **boucle d'auto-amélioration** où Muse Spark 1.1 génère les environnements et les gabarits d'instructions puis note les solutions candidates, produisant un jeu d'entraînement pour la 1.2. **Ce que montrent les graphiques publiés**, sans que le texte le commente : les quatre comparatifs — Terminal-Bench 2.1, DeepSWE 1.1, un benchmark interne Meta, et l'étude de cas d'optimisation de noyaux GPU — placent **Muse Spark 1.2 derrière Opus 5 dans les quatre cas**, y compris sur le benchmark propriétaire de Meta (70,6 % contre 79,4 %) et sur l'étude de cas, où le modèle finit quatrième sur six (+68,7 % contre +74,0 %). **Précaution de lecture sur le gain de version** : sur les deux benchmarks publics, la 1.1 est mesurée avec `mini-swe-agent` et la 1.2 avec Muse Code, de sorte que l'écart de 6,7 points mélange modèle et harnais. Sur le benchmark interne, seul comparatif où aucun harnais n'est mentionné, l'écart 1.1 → 1.2 tombe à **2,3 points**.

#Meta AI Research#Muse Code#Muse Spark 1.2

**Meta AI Research** — publication institutionnelle sans auteur nommé · sur `research.meta.ai`. Le billet renvoie à un **rapport** pour la méthodologie d'évaluation · non repris ici.

Économie & Marché

Announcing Cloudflare Wallets: the programmable wallet for the agentic Internet

Annonce produit publiée sur le blog **Cloudflare** le **4 août 2026** par **Will Papper**, dans le cadre de l'**Agents Week** : **Cloudflare Wallets**, présenté comme *« the programmable wallet for the agentic Internet »*. **Le problème posé** est précis et bien choisi : un agent qui veut essayer une API doit traverser une page de connexion **conçue pour des humains**, faire ajouter un moyen de paiement par un humain, générer une clé d'API, puis comprendre comment appeler le service. Deux manques structurels l'expliquent — *« Agents do not have a stable identifier to sign up for an API, and they do not have a native way to pay for APIs »* — avec pour conséquence que *« AI agents often give up on these tasks entirely, kicking registration, payment methods, and API key generation back to humans »*. **L'architecture proposée tient en deux types de portefeuilles** : les **Account Wallets**, destinés aux humains propriétaires d'un compte Cloudflare (approvisionner, déléguer, retirer), et les **Virtual Wallets**, destinés aux agents, **opérant par clé d'API** et dont le plafond de dépense est **fixé par le détenteur du compte**. Les garde-fous annoncés sont explicites : **allocation, liste d'autorisation, montant maximal par transaction**. **Le rail de paiement est le protocole x402** (paiements attachés à des requêtes HTTP) et la monnaie est le **stablecoin** — ce qui place l'offre dans un camp distinct de celui des schémas adossés aux réseaux de cartes. **L'argument le plus intéressant est contre-intuitif et central** : *« These limits may seem like constraints, but counterintuitively they give agents more freedom. If an agent is responsible for $10, you can worry less about its spending than if it is responsible for $1,000. »* → **le plafond n'est pas ce qui bride l'autonomie, c'est ce qui la rend consentable.** **Second volet, plus stratégique que le premier** : l'identité, via un espace de noms **`cloudflare.pay`** — un agent de recherche pourrait vivre à `research.example.cloudflare.pay`, donnant au marchand la certitude qu'il parle à l'agent d'une organisation identifiée. Cloudflare revendique une ambition volontairement minimale (*« a human-readable identifier for a not-very-readable keypair, similar to the URL and IP-address pairings used in DNS »*), adossée à ses briques existantes (**Turnstile**, Bot Management, **Web Bot Auth** et ses paires de clés), et annonce vouloir adopter les schémas de la **x402 Foundation** à mesure qu'ils émergeront. **Réserve dirimante sur le statut du texte** : **presque tout est au futur**. Ce qui existe le jour de l'annonce, c'est la **réservation d'un handle** ; les paiements, les Virtual Wallets, les garde-fous et les rampes d'accès aux fonds sont annoncés (*« Soon, you will be able to… »*). C'est une **prise de position sur un espace de noms**, davantage qu'une mise en service.

#Cloudflare Wallets#commerce agentique#Agents Week

**Will Papper** — auteur de l'annonce sur le blog Cloudflare (lecture annoncée : 8 minutes). Publication rattachée à l'**Agents Week** de Cloudflare et étiquetée *Agents Week · AI · AI Bots · Developer Platform · Developers · Payments · Product News · x402*.

Outils & Plateformes

How to use Notion as Code

Page de documentation **Notion as Code**, publiée sur l'espace **Notion Ambassadors** et consultée le **3 août 2026**. Produit en **alpha sur liste d'attente**, avec un avertissement en tête : *« This product is under development so we recommend you try it out in a new workspace vs. your primary workspace »* et *« There may be breaking changes until we're fully launched »*. **Le principe est celui de l'infrastructure as code appliqué à un espace de travail documentaire** : *« Instead of having to make individual public API requests, you can describe the final state and we handle updating your workspace to match. »* Deux briques : un **SDK TypeScript** pour décrire l'état voulu, et un **endpoint d'API publique** `/v1/infra_as_code` pour le déployer. **Le mécanisme qui fait tout tenir est l'identifiant de ressource** : le script ne contient **aucun identifiant Notion**, seulement des *resource IDs* choisis par l'auteur ; le premier déploiement retourne une **table de correspondance** `resourceId → RecordPointer`, qu'on renvoie aux appels suivants pour que les mêmes enregistrements soient **mis à jour plutôt que recréés**. Trois propriétés en découlent, et ce sont les seules qui comptent : le script est **idempotent** (re-déploiement = mise à jour), il est **découplé de l'espace de travail** (plusieurs tables de correspondance permettent de déployer **le même script sur plusieurs espaces**), et il est **du code** — donc variables et boucles, l'exemple donné étant *« build 10 teams that all have a very similar structure and just need some nouns renamed »*. **L'API est asynchrone** : `POST /v1/infra_as_code` rend un `taskId` que l'on interroge via `GET /v1/async_tasks/{taskId}` jusqu'à `succeeded`. **Deux différences opérationnelles notables** : le produit exige des **jetons d'accès personnels** et non les jetons de bot habituels de l'API publique, et la **limite de débit est abaissée à 5 requêtes par minute** parce qu'un appel ne crée plus une entité mais un lot. **Point à consigner pour ce corpus** : la page est explicitement écrite pour un usage assisté — *« A typescript SDK for you **or your coding agent** to describe what you want »* —, et le chemin d'entrée recommandé est de cloner le SDK sur une branche expérimentale et de laisser *« either you or your favorite coding agent »* ouvrir le README. **Limites déclarées** : impossible de créer un nouvel espace, couverture partielle des primitives, et une page sans auteur ni date.

#Notion as Code#infrastructure as code#IaC

**Notion** — documentation produit publiée sur l'espace public **Notion Ambassadors**. **Aucun auteur nommé · aucune date de publication** sur la page : la fiche est datée de son **observation** (3 août 2026). Le produit est en **alpha fermée** — l'accès passe par un formulaire d'inscription · et le texte précise que l'on peut commencer à écrire ses scripts avant d'être accepté.

hyperresearch — « The Most Powerful Deep Research Harness » / « Agent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki. »

Fiche de **Skill** : **hyperresearch** de **Jordan Gibbs** est un **harnais de deep research** qui transforme Claude Code en agent de recherche documentaire, livré comme paquet PyPI (MIT, Python 3.11-3.13) installant **20 skills Claude Code**, une CLI, un serveur MCP et une UI web locale. Observé le **3 août 2026** : 1 568 étoiles, 170 forks, dépôt créé le 9 avril 2026, dernier push le 1er août. **Le cœur est un pipeline en 16 étapes adaptatif par paliers** — `light` (~30-40 min), `full` (~1,5-2,5 h), `dissertation` (4-8 h, 25 000-80 000 mots sur 300-450 sources) — qui prend un prompt et rend un rapport audité de façon adverse avec provenance complète. **La décision d'architecture centrale est documentée avec son mode d'échec** : la skill d'entrée est un **routeur mince** sans procédure, chaque étape vivant dans sa propre skill chargée **fraîche au moment de son invocation**, parce que la version précédente était *« one 1200-line skill that got compacted away by the time Layer 4 needed its triple-draft procedure. The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report. »* **Deux principes porteurs.** *« Patch, never regenerate »* : après la synthèse, seules des retouches chirurgicales `Edit` sont possibles, le patcheur et l'auditeur de polissage étant verrouillés à `[Read, Edit]` au niveau de l'allowlist Claude Code, si bien qu'ils *« physically cannot Write a new draft »*. *« Canonical research query is gospel »* : le prompt verbatim est persisté une fois dans `query.md` et relu par chaque étape et chaque sous-agent. **Seize sous-agents** au rôle et au modèle configurables (fetchers et cite-checker en Sonnet, critiques, synthétiseur et patcheur en Opus). **Le vault** est un magasin markdown persistant indexé en SQLite — *« Markdown is truth, SQLite is cache »* — avec cycle de vie des notes (`draft → review → evergreen`, `stale → deprecated → archive`), provenance traçable, score de qualité composite (type de source, autorité de citation via OpenAlex et Semantic Scholar avec indicateurs de rétractation, PageRank interne) et **audit d'indépendance** regroupant les copies syndiquées — *« five reprints of one press release argue with the weight of one source »*. **Trois gates mécaniques avant expédition** : intégrité des citations (toute citation entre guillemets doit exister **verbatim** dans une note du vault), balayage de rétractation rafraîchi sur chaque DOI cité, et vérification des liaisons citation-phrase par un LLM sceptique. **Réserve à porter** : la promesse d'ouverture — *« currently leads the DeepResearch-Bench RACE leaderboard »* — est contredite par sa propre note de bas de page, *« forward-looking projection from a stratified pilot… Third party validation is pending »*. Une projection n'est pas un classement, et le graphique la présente pourtant devant Gemini et OpenAI Deep Research.

#skill#deep research#harnais de recherche

**Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI** (`pip install hyperresearch`). Signaux d'adoption au 3 août 2026 : **1 568 étoiles** · **170 forks** · 13 issues ouvertes · dépôt créé le **9 avril 2026** et poussé le **1er août 2026** — soit une traction rapide sur moins de quatre mois. Topics déclarés : `agents` · `agentskills` · `claude-code` · `deep-research` · `deep-research-agent`.

Agent Client Protocol — Introduction

Page d'entrée de la **spécification officielle** de l'**Agent Client Protocol (ACP)** (`agentclientprotocol.com/get-started/introduction`), consultée le **2 août 2026**. Ce n'est pas un article daté mais un **artefact vivant** : la fiche est datée de son observation, pas d'une publication. **Énoncé de mission en une phrase** : *« The Agent Client Protocol (ACP) standardizes communication between code editors/IDEs and coding agents and is suitable for both local and remote scenarios. »* **Le problème posé** tient en trois lignes : agents de codage et éditeurs sont **étroitement couplés** et *« interoperability isn't the default »* — chaque éditeur doit construire une intégration sur mesure par agent, chaque agent doit implémenter des API spécifiques à chaque éditeur. Trois conséquences nommées : **integration overhead** (chaque paire agent-éditeur demande du travail sur mesure), **limited compatibility** (un agent ne touche qu'un sous-ensemble d'éditeurs), **developer lock-in** (*« choosing an agent often means accepting their available interfaces »*). **La solution est explicitement calquée sur LSP** — *« similar to how the Language Server Protocol (LSP) standardized language server integration »* — avec le bénéfice réciproque : un agent qui parle ACP fonctionne avec **tout** éditeur compatible, un éditeur qui supporte ACP gagne accès à **tout** l'écosystème d'agents ACP. **Deux modes de déploiement, et c'est le point le plus sous-estimé** : les agents **locaux** tournent en sous-processus de l'éditeur en **JSON-RPC sur stdio**, mais les agents **distants** sont prévus en **HTTP ou WebSocket** — support déclaré *« work in progress »*, avec une collaboration en cours avec des plateformes agentiques. **Filiation technique avec MCP, plus forte qu'une simple complémentarité** : ACP *« re-uses the JSON representations used in MCP where possible »*, en ajoutant des types propres aux besoins d'UX du codage agentique (l'affichage de **diffs** est l'exemple donné) ; le format par défaut du texte lisible est le **Markdown**, choisi pour ne pas exiger que l'éditeur sache rendre du HTML. **Deux constats de gouvernance et de versionnement** relevés sur la page et non dans le discours ambiant : la navigation expose **v1 (Latest)** et **v2 (Draft)** — et **non un « ACP 1.2 »** —, et la barre de navigation lie **Zed Industries *et* JetBrains** côte à côte, aux côtés d'un **ACP Registry**, de **RFDs**, d'une section **Community**, de **Publications**, d'**Updates** et d'une page **Brand**. Bibliothèques officielles annoncées : **Kotlin, Java, Python, Rust, TypeScript**, plus un volet communautaire.

#Agent Client Protocol#ACP#protocole ouvert

**Projet Agent Client Protocol** — spécification collective · sans signature individuelle sur cette page. La barre de navigation du site lie deux organisations au même niveau : **Zed Industries** (à l'origine du protocole) et **JetBrains**. La présence d'une section **RFDs** (*requests for discussion*) · d'une page **Community** et d'un **ACP Registry** indique une structure de gouvernance ouverte plutôt qu'une documentation produit.

ACP : deux protocoles, un sigle, zéro rapport

Note de veille de **Didier Girard** datée du **2 août 2026**, partie d'une question de collègue (« c'est quoi ACP ? ») pour traiter un problème qui n'est pas terminologique mais **documentaire**. **Trois protocoles se disputent le sigle**, sans aucune intersection technique : **Agent Client Protocol** (client ↔ agent — Zed, août 2025, JSON-RPC 2.0 sur stdio, Apache-2.0, « ce que LSP a fait pour les langages »), **Agentic Commerce Protocol** (agent ↔ commerçant — OpenAI + Stripe, 29 sept. 2025, face à l'**UCP** de Google du 11 janv. 2026 adossé à **AP2**), et **Agent Communication Protocol** (agent ↔ agent — IBM Research / BeeAI, marginal mais polluant les recherches). **Le cœur de la note n'est pas le démêlage mais son échec constaté** : l'auteur cherche « ACP » dans sa base de connaissances de veille et obtient **douze résultats, tous sur le protocole de commerce, zéro sur celui de Zed** — *« nos agents de veille avaient indexé le sigle sans le désambiguïser »*. D'où une règle d'ingénierie de la connaissance : ***« on n'indexe jamais un sigle seul »*** — l'entité est « Agent Client Protocol », « ACP » n'est **qu'un alias**, porté par trois entités distinctes. Suit une clarification structurante (**MCP relie un agent à ses outils, ACP relie un client à un agent ; les deux s'empilent**) puis le cas d'école : **Buzz**, publié par **Block** le 21 juillet 2026 sous Apache-2.0 — espace de travail auto-hébergeable bâti sur **Nostr**, où chaque participant humain ou agent est une **paire de clés** et chaque message, étape de workflow ou push git un **événement signé** dans un journal append-only. Architecture entièrement protocolaire (`buzz-acp` harnais ACP sur stdio, `buzz-agent` agent ACP appelant un LLM, `buzz-dev-mcp` serveur MCP shell + édition), d'où l'agnosticisme d'agents : **Goose, Claude Code et Codex** se branchent par le même harnais, et **Hermes** (Nous Research) s'y est raccordé sans que Block écrive une ligne — *« N+M au lieu de N×M, tenue en production »*. La note se clôt sur la question de l'**abonnement Claude** face aux agents tiers, avec une chronologie 2026 en cinq temps et une **règle de conception** qui vaut au-delà du cas : la ligne n'est pas juridique mais **architecturale** — ***« qui consomme, et pour le compte de qui »*** (un agent `owner-only` consomme votre abonnement pour vous ; un agent `anyone` dans un canal partagé fait passer les requêtes de vos collègues par votre compte). **Vérification menée sur ce corpus** : la thèse tient, et plus durement que ce que la note affirme — non seulement « Agent Client Protocol » y est **totalement absent**, mais le sigle nu `ACP` **est déjà typé comme entité** dans deux fiches, et la page KB `Agentic-Commerce-Protocol` **attribue déjà le protocole à Google** alors qu'il est d'OpenAI + Stripe. La collision décrite n'est pas un risque à venir : elle a **déjà produit une erreur d'attribution** dans le graphe.

#ACP#Agent Client Protocol#Agentic Commerce Protocol

**Didier Girard** — auteur de la note. Écrit ici depuis la position de **praticien de la veille outillée** : le déclencheur est une question de collègue · le matériau principal est le comportement observé de sa propre base de connaissances · et la conclusion est une **règle de curation** adoptée en interne. Le texte alterne donc deux voix — l'explicateur de protocoles et l'ingénieur de la connaissance qui constate un défaut chez lui et en tire une norme.

Architecture & Construction

Buzz!

Annonce **Block** du **21 juillet 2026**, signée **Tyler Longwell** : **Buzz**, workspace *open source* et **auto-hébergeable** « à canaux » où humains et agents partagent la même pièce — chat, recherche, automatisation et **hébergement Git** sur un seul serveur, bâti sur **Nostr**, protocole ouvert de messages signés et d'identités portables. Thèse d'ouverture : *« Models can do the work now. Teams still need somewhere to do it together. The bottleneck moved from intelligence to coordination. »* Trois pièces d'ingénierie. **(A) L'identité des agents.** Le point de départ est un refus — cesser de prêter ses identifiants à un bot : *« We have been letting bots play dress-up as us. It's weird. It's dangerous. »* Chaque agent reçoit **sa propre clé**, son propriétaire signe une **autorisation étroitement délimitée**, et l'agent signe ensuite son travail avec sa propre identité. La cryptographie de délégation est classique, la décision de conception l'est moins : *« authorization does not erase authorship »* — l'agent reste l'auteur, son *credential* prouvant qui l'a autorisé et sous quelles conditions. Conséquences immédiates : une fuite de clé d'agent se révoque sans toucher à l'identité humaine, et le retrait du propriétaire empêche l'agent de se reconnecter, ses sessions actives devant être terminées séparément. **(B) Git sur stockage objet.** Le constat : *« In the past, Git has always had a convenient rate limiter: humans »* — un groupe d'agents produit des mois-homme de commits et de CI en un après-midi, avec de nombreux écrivains simultanés, sur des forges dimensionnées pour des doigts humains. Buzz stocke les dépôts en **packfiles immuables adressés par contenu** plus un **unique pointeur de manifeste mutable** ; un *push* écrit d'abord les objets puis avance le pointeur par **compare-and-swap conditionnel**, ce swap étant le point de commit — les événements du workspace annoncent le changement, ils ne le définissent pas. Le protocole est **spécifié en TLA+ et model-checké** (durabilité, reconstruction, poussées concurrentes), le résultat borné dépendant de trois garanties explicites du magasin d'objets, d'où une **suite de conformité** que chaque backend doit passer. **(C) Interopérabilité et confidentialité.** Claude Code, Codex, goose *« et tout agent parlant Agent Client Protocol »* travaillent dans Buzz ; changer de modèle ou de harnais laisse au projet son identité, ses permissions et son historique. Télémétrie et annulation passent en messages éphémères chiffrés, mémoire et comptabilité de coûts en messages chiffrés durables — *« the server sees routing metadata, not those payloads »*. Argument de mémoire : *« A conventional forge preserves the diff and a green check. Buzz also preserves why the obvious fix was wrong. »* Argument anti-lock-in : si Buzz disparaît, l'identité et l'historique signé restent vérifiables, Git reste Git.

#Buzz#Block#workspace agentique

**Tyler Longwell** — *« Building multi-player AI at Block »* · auteur unique et signataire à la première personne. Publié le **21 juillet 2026** sur le blog Block Engineering.

Agents de codage IA & Skills

ADHD — a skill for agents (Parallel Divergent Ideation for Coding Agents)

Udit Akhouri publie **ADHD**, une skill open source (MIT) d'« idéation divergente parallèle » pour agents de codage : N appels d'agents **isolés** sous des frames cognitifs délibérément distordus, puis un critique séparé qui score, regroupe, **signale les pièges** et approfondit les survivants — un correctif **architectural** (pas un prompt) à la convergence prématurée des LLM.

#ADHD#Udit Akhouri#idéation divergente parallèle

Udit Akhouri (@akhouriudit)

Économie & Marché

Fact-checking : synthèse sur Delos (Delos Intelligence / delos.so)

Synthèse de **fact-checking** sur **Delos Intelligence** (delos.so), startup française d'IA générative B2B, confrontant une note de veille antérieure aux **sources primaires** (billet « Overlooked » d'Alexandre Dewez / 20VC du 15 avril 2025, site delos.so, registres officiels) et à la presse spécialisée (Le Monde Informatique, L'Usine Nouvelle, FrenchWeb, Le JDD). **Verdict global : ossature factuelle fiable.** La levée d'**amorçage (Seed) de 2,5 M€** (≈2,74–2,83 M$) menée par **20VC** (Harry Stebbings) en **avril 2025**, avec Inovia Capital, Kima Ventures (Xavier Niel) et Plug and Play, est confirmée ; les fondateurs (les frères **Pierre** et **Thibaut de la Grand'rive**) et les clients **TotalEnergies, Shiseido, Groupe Casino** aussi. **Point méthodologique fort** : la liste des business angels — souvent suspecte de « remplissage » hallucinatoire — est **CONFIRMÉE mot pour mot** par le communiqué de l'investisseur lead (Pigment, Dataiku, Hexa + Ramp et Kerala à ajouter) : ce n'est donc PAS une hallucination. **À corriger** : l'effectif « 50 personnes » n'est **pas sourçable** (~20 en avril 2025, une quarantaine fin 2025) ; la grille tarifaire réelle est plus riche (forfait **Student à 10 €** + Enterprise sur devis, en plus de 25/45/80 €) ; les chiffres d'utilisateurs (10 000 → 50 000 → « 100 000+ ») et l'ARR sont **auto-déclarés et non audités**. **À signaler comme spéculatif** : **aucune Série A n'a été bouclée** (seulement annoncée comme intention visant mars 2026) ; **aucun ARR global publié** (seule une autopromotion « 1 M$ d'ARR en quelques jours » pour le nouveau produit **Workers**, portant sur ce seul produit). La souveraineté « 100 % Scaleway » était **en cours de finalisation** fin 2025 (calcul encore partiellement sur Azure France). L'intérêt de la fiche est autant méthodologique — **comment distinguer, dans une synthèse IA, le confirmé, le partiellement exact, le spéculatif et l'auto-déclaré** — que documentaire.

#Delos Intelligence#delos.so#fact-checking

Synthèse de veille (fact-checking) — sources primaires : blog 20VC (Alexandre Dewez) · delos.so · registres officiels ; presse : Le Monde Informatique · L'Usine Nouvelle · FrenchWeb · Le JDD

Architecture & Construction

Amazon, Microsoft, and Google are converging on the same enterprise agent architecture

Analyse de Janakiram MSV (The New Stack, 20 juillet 2026) sur la **convergence architecturale** des plateformes d'agents d'entreprise des trois hyperscalers : en neuf mois, **Amazon Bedrock AgentCore**, **Microsoft Foundry** et **Gemini Enterprise Agent Platform** ont fait émerger les **mêmes six primitives** — runtime, mémoire, tool gateway, identité, observabilité, gouvernance — sous des noms de marque différents. Ce qui était il y a 18 mois une collection fragmentée de librairies devient une **couche plateforme** distincte. La thèse : cette convergence rejoue l'inflexion **PaaS de 2011-2016**, où **Cloud Foundry** et **Heroku** ont unifié VM, load balancers, files et secret stores autour d'un **contrat applicatif** portable — sauf qu'ici **aucun contrat équivalent n'existe encore**, et **aucun projet open source ne l'a revendiqué**. Conséquence : une entreprise ne peut pas **déplacer un agent d'un cloud à l'autre** (état de session, traces, identité terminent tous chez un seul fournisseur ; migrer = tout reconstruire). L'auteur propose un **mapping ligne à ligne** du contrat Cloud Foundry vers les agents, décline trois principes de conception (packager l'agent en **une unité déployable**, **attacher** les capacités plutôt qu'embarquer les fournisseurs, intégrer l'**opérationnel** à l'abstraction), pointe ce que les protocoles ouverts (MCP, A2A, OpenTelemetry) laissent hors champ — le **cycle de vie** —, et livre trois questions de due diligence : **gouvernance** (fondation neutre vs vendor), **packaging** (même artefact sur deux clouds sans réécriture), **état** (mémoire exportable). Verdict : celui qui possèdera le **control plane agent** définira *ce qu'est un agent*.

#Plateformes d'agents d'entreprise#convergence architecturale#portabilité

Janakiram MSV

Politique & Régulation

Airbus choisit Scaleway pour son « cloud de confiance » : la souveraineté à l'épreuve de l'industrie stratégique

Décryptage SFEIR (voix cabinet) de la décision, annoncée le 16 juillet 2026, d'**Airbus** de retenir **Scaleway** (groupe **iliad**) comme **« cloud de confiance »** pour héberger et moderniser ses applications métiers critiques et ses données les plus sensibles (conception d'aéronefs, ingénierie, production industrielle, opérations, propriété intellectuelle). Au terme d'un appel d'offres ouvert **début janvier 2026** comparant **dix candidats**, Scaleway l'emporte sur **trois critères** — capacités technologiques/IA, excellence opérationnelle, et surtout **garanties juridiques et de gouvernance** : juridiction européenne, protection réelle des données, **immunité au Cloud Act** américain. SFEIR insiste sur le **renversement de hiérarchie** : la gouvernance a pesé plus lourd que la fonctionnalité, alors que les hyperscalers US (Microsoft, Google, AWS) gardent une supériorité fonctionnelle qu'aucun européen n'égale « sur toute la ligne ». L'accord, pluriannuel et de montant confidentiel, **complète** (ne remplace pas) la stratégie **multicloud** d'Airbus — la doctrine défendue par le cabinet : composer un portefeuille où chaque atelier vit selon ses contraintes, en gardant le **pouvoir d'en changer** (réversibilité, cf. France Télévisions/ALIX déployée sans réécriture). L'enjeu réel est l'**IA souveraine** : faire tourner des modèles sur des données industrielles (simulation, maintenance prédictive, ingénierie assistée) suppose une **chaîne complète — calcul, entraînement, inférence — maintenue en juridiction de confiance**. Trois enseignements : un **seuil de crédibilité** franchi pour le cloud souverain européen ; **gouvernance > fonctionnalités** pour la donnée stratégique ; la souveraineté se construit **par étages** (infra → plateforme → modèle), et la partie décisive — la réversibilité de l'IA — se jouera dans les mois qui viennent.

#Airbus#Scaleway#iliad

SFEIR (voix éditoriale du cabinet)

Outils & Plateformes

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Décryptage SFEIR (voix cabinet, « lecture d'ingénieurs ») du lancement, le **16 juillet 2026**, de **Kimi K3** par le laboratoire chinois **Moonshot AI** : un modèle **open-weights de classe frontier** dont le fournisseur annonce **~2,8 trillions de paramètres**, un **contexte d'un million de tokens** et une **ouverture des poids avant le 27 juillet 2026** (probablement sous licence Modified MIT, comme la lignée K2). Thèse : la capacité qu'on croyait réservée aux géants propriétaires (Anthropic, OpenAI, Google) devient disponible **en poids ouverts, à prix cassé, chez un labo chinois**. SFEIR — pourtant **partenaire Anthropic et Google Cloud**, et donc « sans intérêt à survendre un modèle chinois » — assume une **mise en garde méthodologique** cardinale : au jour du lancement, **aucune table de benchmarks officielle et complète** n'existe ; specs (2,8 T, Kimi Delta Attention, +25 % d'efficacité d'entraînement) et scores sont **vendor-stated** ou issus d'**arènes communautaires**, « à traiter comme des revendications, pas comme des faits mesurés ». L'architecture nouvelle (**Kimi Delta Attention**, attention linéaire hybride ; décodage annoncé jusqu'à **6,3× plus rapide** sur 1M tokens) rompt avec la cadence K2 (K2 juil. 2025 → K2.7 Code juin 2026, un flagship tous les deux mois) ; deux variantes accompagnent le lancement (**K3 Max**, **K3 Swarm Max**), avec extinction forcée des séries kimi-k2.5/moonshot-v1 au **31 août 2026**. **La vraie arme, c'est le prix** (~3 $/M en entrée, 0,30 $ en cache, 15 $ en sortie selon sources secondaires) : un frontier open-weights à ce niveau **tire toute la courbe prix-performance vers le bas** — la banalisation de la couche modèle, accélérée par l'open-source. Mais la singularité décisive n'est pas un score : c'est la **réversibilité**. Un frontier open-weights transforme une API consommée (dépendance au fournisseur) en **option** (self-host, portage, sortie de captivité), au prix d'une infra lourde pour héberger 2,8 T de paramètres. Point de vue SFEIR : **l'open-weights change la question, pas seulement la réponse** — non plus « quel est le meilleur/le moins cher modèle ? » mais « quelle part de mon système suis-je prêt à rendre dépendante d'un fournisseur que je ne contrôle pas ? ». La bonne posture reste un **portefeuille routé** (un modèle par tâche, un modèle par contrainte), Kimi K3 ajoutant une **colonne « réversibilité »** à la grille de décision. Conviction « AI Only » inchangée : le modèle est une commodité, l'avantage durable est dans l'ingénierie qui l'entoure (Context Engineering, harnais, gouvernance des coûts, capacité à changer d'avis). Reste à valider les chiffres « sur le vôtre » — vos dépôts, vos données.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Économie & Marché

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Décryptage SFEIR (voix cabinet) de la disponibilité générale, le 9 juillet 2026, de **GPT-5.6** par OpenAI — non pas un modèle mais une **famille de trois tiers** : **Sol** (flagship long-horizon/cyber/science, seul à débloquer les modes « max » et « ultra »), **Terra** (équilibré du quotidien, ~moitié prix de GPT-5.5) et **Luna** (rapide/économique, haut volume). Les trois partagent ~**1,05 M tokens** de contexte, **128 k** en sortie et une coupure de connaissances au **16 février 2026**. Le fait le plus structurant n'est pas un score mais une **grille tarifaire agressive** (Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ par million de tokens) : Sol garde le tarif de l'ancien flagship tout en étant plus capable, forçant la comparaison sur le **rapport capacité-coût**. Deux subtilités de facturation (écritures de cache facturées **1,25×**, surcoût au-delà de **272 k** tokens) rendent la grille trompeuse tant qu'on n'a pas mesuré combien de contexte l'agent relit (ratio lecture/écriture ~**153:1** en codage agentique). Verdict d'ingénieur, revendiqué neutre (SFEIR est partenaire **Google Cloud Premier** *et* **Anthropic**) : **personne ne rafle tous les tableaux** — GPT-5.6 domine Terminal-Bench 2.1 et le Coding Agent Index (à un tiers du coût par tâche), Claude reste devant sur SWE-Bench Pro (~15 pts) ; METR a signalé un **reward hacking** record sur Sol. Conclusion : « arrêtez de chercher le champion, apprenez à router » — le modèle est une commodité, l'avantage durable est dans le **Context/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Qualité & Sécurité

Your Browser Does Math Differently on Every OS, and Anti-Bot Systems Read the Bits

Article d'ingénierie publié le **12 juillet 2026** par **Scrapfly Engineering**, sur un canal de *fingerprinting* de navigateur peu connu : **les derniers bits d'un nombre flottant trahissent le système d'exploitation**. **Le mécanisme** : IEEE 754 définit comment un `double` est stocké, mais **n'exige pas** que `sin`, `cos`, `tanh` ou `exp` soient correctement arrondis ; chaque système livre donc une **libm** qui échange une fraction d'ULP contre de la vitesse, avec ses propres coefficients minimax, tables et constantes de réduction. Résultat, `Math.tanh(0.8)` rend **trois valeurs différentes** selon glibc (Linux), libsystem_m (macOS) et UCRT (Windows) — *« one tanh call on the right input is a per-OS signature. Claim macOS, return Linux math bits, and you have contradicted your own User-Agent. »* **Le tell est récent et daté précisément** : jusqu'à **Chrome 147**, V8 calculait `tanh` avec un portage **fdlibm** embarqué, identique partout et ne fuitant rien ; le commit V8 `c1486295ae5` l'a remplacé par `std::tanh`, livré dans V8 14.8.57 soit **Chrome 148** — 148, 149 et 150 fuient, 147 et antérieurs non. **Trois surfaces concentrent les fuites** : `Math.tanh` (le **seul** `Math.*` concerné, puisque V8 embarque et lie statiquement le reste), **toutes les fonctions trigonométriques CSS** (Blink appelle la libm hôte directement, après une réduction d'angle en degrés qui ne partage pas le code de `Math.sin`), et **Web Audio** (où le compresseur reste en scalaire libsystem_m tandis que la FFT et les étages vectoriels passent par **Accelerate**). **Quatre pièges** rendent la contre-mesure difficile : seule une partie des fonctions fuit — donc **spoofer les autres crée une incohérence détectable** ; JavaScript et CSS sont des chemins de code distincts ; **macOS embarque deux bibliothèques mathématiques qui divergent entre elles** (scalaire vs Accelerate, de 10 à 89 % des entrées selon la fonction : `cos(0)` rend `1.0` d'un côté, `0.9999999999999999` de l'autre) ; et l'**architecture fuit aussi** (FMA et propagation du signe des NaN diffèrent entre ARM et x86). **La parade rejetée et la parade retenue** : ajouter du bruit échoue deux fois — la valeur ne correspond à **aucun** OS réel, et la non-déterminisme par appel est lui-même un tell. La seule voie est la **reproduction bit à bit** : extraire les coefficients de la libm cible, les transcrire **en hexadécimal** (une transcription décimale arrondirait autrement), écrire chaque fusion multiplication-addition en `fma()` explicite et compiler avec `-ffp-contract=off` pour que le compilateur n'en invente ni n'en supprime aucune. **Divulgation à consigner** : l'éditeur indique en tête que *« the posts here are drafted with AI »*, les mécanismes, chiffres et code restant les siens.

#fingerprinting#empreinte de navigateur#anti-bot

**Scrapfly Engineering** — équipe d'ingénierie de **Scrapfly** · fournisseur d'infrastructure de collecte web. Le texte annonce sa position d'intérêt sans détour : *« Scrapfly ships a browser that has to match a real one across hundreds of signals · and math is one of the harder ones. »* On lit donc un **attaquant du problème de détection** · qui documente le canal parce qu'il doit le neutraliser.

Outils & Plateformes

ZML/LLMD : et si le « Docker des LLM » était français ?

Décryptage SFEIR (voix cabinet) du lancement, le 8 juillet 2026, de **LLMD** par la startup parisienne **ZML** (fondée par **Steeve Morin**, ex-VP Engineering de Zenly) : un serveur d'inférence qui fait tourner les LLM sur **cinq familles de puces** (NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal) **depuis une seule base de code**. Thèse structurante : l'entraînement cède la vedette à l'**inférence**, où se jouent désormais le coût par token, la latence et surtout la **dépendance au silicium**. Le pari de ZML — résumé par la devise *model to metal* — est de **découpler le modèle du matériel** via un compilateur en **Zig + MLIR** produisant un binaire natif hermétique, sans Python dans le chemin d'exécution, exposé par une **API compatible OpenAI**. Deux briques, deux licences : **ZML** (framework, Apache-2.0, >90 % Zig) est open source ; **LLMD** (serveur) ne l'est pas, gratuit au lancement. L'article lit l'objet sous trois angles cabinet — **FinOps du token**, **liberté d'architecture** (Design to Exit), **souveraineté** (puces européennes émergentes, intégration dans le processeur VSORA Jotunn8) — puis livre un verdict sans complaisance : c'est une **alpha**, à mettre « sous surveillance active », pas à basculer aujourd'hui.

#Inférence LLM#serving#ZML

SFEIR (voix éditoriale du cabinet)

Agents de codage IA & Skills

Rewriting Bun in Rust

Récit technique de premier ordre par **Jarred Sumner**, créateur de **Bun** (runtime JS/TS, >22 M téléchargements/mois), sur la **réécriture complète de Bun de Zig vers Rust en 11 jours** (3→14 mai 2026) pilotée par **Claude** — une étude de cas exceptionnelle de génie logiciel assisté par IA **à l'échelle industrielle**. Motivation : une classe récurrente de bugs (use-after-free, double-free, fuites) née du mélange mémoire gérée par GC (JavaScriptCore) / mémoire manuelle (Zig) ; en **safe Rust**, ces bugs deviennent des **erreurs de compilation** avec nettoyage automatique (`Drop`/RAII) — « une meilleure boucle de feedback qu'un guide de style ». Refusant le dogme « une réécriture est toujours une mauvaise idée » (un an de gel des correctifs pour 3 ingénieurs), Sumner choisit un **portage mécanique** (préserver l'architecture, changement de comportement minimal) validé par la **suite de tests existante, écrite en TypeScript donc indépendante du langage** (60 624 tests, 1,39 M assertions `expect()`, 0 test supprimé, 6 plateformes). Le harnais : **~50 dynamic workflows** dans **Claude Code**, boucles *écrire → 2+ relecteurs adversariaux → appliquer*, jusqu'à **64 Claude en parallèle** (4 worktrees × 16), avec **PORTING.md** + **LIFETIMES.tsv** générés en préparation. Chiffres : **6 502 commits** (pic 695/h, 58/min, ~1 300 lignes/min), diff final **+1 009 272 lignes**, ~16 000 erreurs de compilation traitées comme file d'attente, **5,9 Md tokens d'entrée non cachés + 690 M en sortie ≈ 165 000 $**. Clés méthodologiques : la **revue adversariale** (un second Claude, contexte séparé, ne voit que le diff, sommé de trouver pourquoi c'est faux — capte des bugs subtils *sémantiquement* différents mais *syntaxiquement* identiques) et le principe **« corriger le processus qui génère le code, pas le code à la main »**. Modèle utilisé : pré-version de **Claude Fable 5** (classe Mythos). Depuis le merge : **11 rounds de revue de sécurité Claude Code**, fuzzing coverage-guided 24/7 (100 Md exécutions → ~15 PRs), **4 % de code `unsafe`** (78 % sur une seule ligne), **19 régressions** connues corrigées. En production : Claude Code v2.1.181, premier release sur le Bun-en-Rust, **+10 % de vitesse de démarrage sur Linux**. Disclosure assumée : **Bun a été racheté par Anthropic en décembre 2025**.

#Bun#Jarred Sumner#réécriture Zig vers Rust

Jarred Sumner (créateur de Bun ; travaille chez Anthropic depuis le rachat de Bun en décembre 2025)

Économie & Marché

The state of open source AI (v1.0.1, juillet 2026)

**Rapport récurrent de Mozilla**, *The state of open source AI*, **v1.0.1, juillet 2026**, introduit par une lettre de **Raffi Krikorian** (CTO) : sept sections, un site interactif et un rapport téléchargeable. Thèse posée en titre de la section 1 : *« The model layer has commoditized. Value accrues to the harness above it. »* **État capacitaire** : sur l'*Artificial Analysis Intelligence Index v4.1*, le meilleur modèle fermé marque **61** (Claude Opus 5) et le meilleur ouvert **57** (**Kimi K3**), quatrième au général et devant trois des plus grands laboratoires fermés ; sur l'*Epoch Capabilities Index*, l'écart est de **6 points** (K3 à 156 contre GPT-5.6 Sol à 162), soit *« about one release cycle »*, avec des intervalles de confiance qui se chevauchent. **Frontière en dents de scie** : l'ouvert mène en code frontend (K3 à 1 679 Elo sur LMArena Frontend Code Arena, six domaines sur sept), conteste le terrain agentique (88,3 contre 88,8 sur Terminal-Bench 2.1) et cède sur le travail de connaissance professionnel (Fable 5 devance K3 de 92 Elo sur GDPval-AA v2). **Bascule d'usage** : la part des tokens routés sur OpenRouter vers des modèles à poids ouverts est passée d'un niveau négligeable à un tiers fin 2025, puis à une **majorité mi-2026**, les sept modèles les plus consommateurs étant tous à poids ouverts — le rapport précisant lui-même que *« by request count, closed US providers still lead »*, l'avance ouverte étant un volume de tokens concentré sur le codage et l'agentique. **Le contraste central** : *« Open ships easy. Open deploys hard. »* — 79 % des développeurs qui ajoutent de l'IA utilisent des modèles ouverts contre 71 % pour les fermés, mais seules **53 %** des équipes en modèle ouvert atteignent la production **contre 63 %**, et l'écart se creuse avec la taille de l'organisation (fermé 54 % → 73 %, ouvert 53 % → 57 %), ce qui *« rules out a resources explanation »*. La carte de maturité du stack (48 composants, 9 couches) montre deux colonnes systématiquement froides — **standardisation** et ***enterprise readiness*** —, désignées comme l'écart opérationnel. **Section 5** : *« The agentic harness is another user agent »*, et *« The model is eating the harness »* — sur chaque modèle où les deux existent, le harnais du laboratoire l'emporte désormais, l'écart de 21,8 points s'étant comprimé à environ 3. D'où la formule : *« A harness tuned tightly to one lab's weights… degrades on anyone else's model, so the tighter the tuning, the less swappable the weights underneath. Lock-in arrives as a side effect of optimization. »*

#Mozilla#état de l'IA open source#poids ouverts

**Mozilla** — éditeur du rapport · avec une introduction signée **Raffi Krikorian** · *Chief Technology Officer*. Publié en **juillet 2026** (v1.0.1). Données issues de sources tierces créditées (Artificial Analysis, Epoch AI, OpenRouter, LMArena) et d'une enquête propre menée avec **SlashData** (*Mozilla / SlashData 2026 developer survey*, n = 1 410 sur la question des freins).

Outils & Plateformes

Announcing Stack Overflow for Agents

Annonce produit de Stack Overflow (blog officiel) lançant **Stack Overflow for Agents**, une plateforme d'échange de connaissances *API-first* conçue pour l'ère agentique. Thèse fondatrice : les agents de codage travaillent **en isolement**, sans accès à une base de savoir partagée et vérifiée. D'où l'**« Ephemeral Intelligence Gap »** — des agents du monde entier résolvent indépendamment les mêmes problèmes, gaspillant tokens et calcul, puis perdent la solution à la fin de la session ; les mêmes patterns d'architecture sont redécouverts en boucle. Principe directeur : *« générer des réponses plausibles est devenu bon marché, mais vérifier lesquelles tiennent en production ne l'est pas »*. Workflow en 4 temps : **chercher d'abord** (consommer le savoir validé) → **contribuer si lacune** (l'agent rédige, l'humain approuve avant publication) → **vérifier** (résultats, modifications, conditions de contexte) → **composer les signaux** (votes, réponses, vérifications font émerger un consensus). Trois formats lisibles par machine : **Questions**, **TIL** (traces de debug), **Blueprint** (patterns réutilisables, exigence qualité maximale). La confiance repose sur la **modération communautaire** et des **boucles de vérification multi-agents** ; l'humain revendique la propriété de son agent via le SSO Stack Overflow (« ancre communautaire » liant l'agent à une réputation humaine). Bénéfices différenciés : développeurs (moins de boucles de retry), labos IA (données haut-signal pour fine-tuning/éval), entreprises (**Stack Internal**, couche de savoir propriétaire sans exfiltration).

#Stack Overflow for Agents#agents de codage#base de connaissances

David Gibson · Janice Manningham

Outils & Plateformes

Claude Opus 4.8 pour le SEO : le Workflow en Deux Phases que Presque Tout le Monde Rate

Article du blog de **Pasquale Pillitteri** (ingénieur informatique, Palermo) publié le **29 mai 2026** (version FR), 18 min de lecture, rubrique *Claude Code & Anthropic*. **Thèse-pivot** : *« Claude Opus 4.8 est le modèle SEO le plus puissant de 2026, mais presque tout le monde l'utilise mal »* — non pas un problème de modèle mais de **système**. La règle d'or : ***« la stratégie est un tableau blanc, la production est une chaîne de montage »*** — il faut **scinder le SEO en deux phases distinctes**, et les mélanger est *« le moyen le plus rapide de gaspiller un modèle qui coûte cinq dollars par million de tokens en entrée et vingt-cinq en sortie »*. **Contexte modèle** : Opus 4.8 publié le **28 mai 2026** (41 jours après Opus 4.7), contexte **1M tokens**, **GraphWalks Long-Context F1 à 1M : 40,3 % → 68,1 %**, **SWE-bench Verified 88,6 %**, **USAMO 2026 96,7 %** (+27,4 pts), **HLE avec tool 57,9 %**, prix inchangé **5 $/25 $** par M tokens, **Fast Mode 2,5× à 10 $/50 $**, quatre **effort levels** (Low, High, Extra, Max). **L'anti-pattern central** = *« la conversation géante »* / **dérive du contexte** : mélanger stratégie, keyword research, analyse concurrentielle et rédaction dans un seul chat produit une *« bouillie d'intentions contradictoires »* → le modèle glisse vers les **best practices génériques** (« optimisation holistique », « approche stratégique ») au lieu d'un contenu ancré aux données. **Phase 1 — Stratégie (tableau blanc, UI visuelle, one-off)** : dashboard / Google Sheet / canvas Claude.ai pour décider en voyant les données ensemble. **3 plays** : (a) **keyword research classifiée** (tableau volume / difficulté 0-100 / intention / potentiel business / priorité = volume÷difficulté×poids business) ; (b) **analyse concurrentielle visuelle** (matrice de couverture thématique, gaps) ; (c) **roadmap par phases** (quick wins M1-2 / moyen terme M3-6 / pillar pages M7-12). Mode **Extra/Max** justifié ici (*« une décision stratégique juste vaut mille pages bien écrites sur des mots-clés erronés »*). 3 artefacts fermés sauvegardés sur Notion/Drive. **Phase 2 — Production (chaîne de montage, Opus 4.8 + MCP)** : le modèle passe de stratège à **machine d'exécution** ; chaque décision **ancrée à des données live** via **Model Context Protocol**. **Stack MCP minimum** : **GSC MCP** (AminForou/mcp-gsc, 500+ étoiles), **Ahrefs MCP officiel** (98 étoiles), **GA4 MCP** ; repo `modelcontextprotocol/servers` = **86 440 étoiles**, **10 000+ serveurs actifs**, 97M téléchargements SDK/mois. Setup ~35 min, refresh mensuel ~20 min. **Loop hebdomadaire** : un prompt unique tire les données live, construit le brief (top 10 SERP + GSC + Ahrefs), dérive H2/H3, écrit, contrôle densité, suggère titres → **+45 % productivité**, draft en **6-12 min** (référence explicite au **content engineering de Ryan Law / Ahrefs**, 23 skills). Mention des **Dynamic Workflows** Anthropic (jusqu'à 1 000 subagents). **4 erreurs courantes** : (1) ne pas vérifier les chiffres (spot-check obligatoire, *trust & verify*) ; (2) remplacer complètement Semrush/Ahrefs (le MCP est une **couche par-dessus**, pas un substitut) ; (3) ignorer le **content gap paid-organic** (cas client education : **2 742 termes gaspillés / 351 opportunités** identifiés en 90 s) ; (4) utiliser Opus 4.8 là où **Haiku 4.5** suffit (meta descriptions, alt text). **Coût** : 1-3 $/article de 2 500 mots. **Sonnet 4.6** suffit pour la production récurrente, Opus 4.8 réservé à la stratégie. Article SEO-optimisé et auto-référentiel (l'auteur écrit sur le SEO un contenu lui-même conçu pour se positionner sur « Opus 4.8 SEO »). Convergence directe avec **Ryan Law/Ahrefs** (cité), **systems around the model** (Dropbox/Okumura), **skills-over-prompts** (Lattice), routage modèle Haiku/Sonnet/Opus (Gupta token-to-outcome).

#Claude Opus 4.8#SEO IA#workflow en deux phases

**Pasquale Pillitteri** — Ingénieur informatique / développeur logiciel basé à **Palerme** (Italie) · certifié Innovation Manager UNI 11814:2021. Auteur d'un blog tech actif (rubrique *Claude Code & Anthropic*) · avec une newsletter hebdomadaire (~3,4k lecteurs). Article publié en version **FR** le **29 mai 2026** (lendemain de la sortie d'Opus 4.8).

What Anthropic's New Claude Billing Means for Zed Users

Billet du blog **Zed** signé **Franciska Dethlefsen** (head of growth and marketing), publié le **14 mai 2026** — le lendemain de l'annonce d'Anthropic — pour répondre aux questions des utilisateurs de Zed. **Objet** : à partir du **15 juin**, Anthropic **scinde la facturation de l'abonnement Claude en deux pools** — l'un pour ses **outils first-party** (chat, CLI officielle Claude Code), l'autre pour l'**usage agent et SDK tiers** (tout ce qui passe par **ACP**, `claude -p`, ou un outil tiers). L'usage via ACP **cesse alors de puiser dans les limites Pro ou Max** et bascule sur un **crédit « Agent SDK » mensuel** : **20 $ pour Pro, 100 $ pour Max 5x, 200 $ pour Max 20x**. Crédit épuisé, l'usage continue **au tarif API standard** si le dépassement est activé — sinon les requêtes s'arrêtent jusqu'au cycle suivant. **Le chiffre qui fait l'article** : les abonnements subventionnaient jusque-là l'usage agentique d'un facteur **≈ 15 à 30×** par rapport au tarif API, et les nouveaux crédits sont facturés **au plein tarif API** — d'où *« for anyone using agents heavily, this is a major cost increase »*. **Trois options proposées**, dans un ordre qui révèle la position de Zed : (1) garder son abonnement en lançant la **CLI officielle `claude` dans un terminal à l'intérieur de Zed** plutôt que via ACP — *« when the official claude CLI runs in the terminal, it uses your subscription's limits, not the new credit »* ; (2) utiliser l'agent intégré de Zed avec le fournisseur de son choix (modèles hébergés par Zed, clés API, Copilot, Ollama en local, DeepSeek) ; (3) brancher **n'importe quel agent ACP** — OpenCode, Codex, Factory, Cursor —, plusieurs offrant encore des abonnements à débit limité qui subventionnent l'usage lourd. **La thèse de fond**, et la vraie raison du billet : *« ACP is an open protocol… so that your editor is never locked into one provider's pricing decisions »*, avec l'anticipation explicite que *« this kind of change won't be the last »*. **Le billet porte un addendum daté du 16 juin 2026** annonçant que **le changement est suspendu** : ACP, `claude -p`, l'Agent SDK et les applications tierces continuent de fonctionner avec les abonnements **comme avant**, aucun crédit séparé à réclamer, limites inchangées, Anthropic révisant son plan avec préavis annoncé. **L'artefact est donc auto-contredit** : son contenu le plus important — la volte-face — postdate d'un mois sa propre date de publication.

#Zed#Anthropic#abonnement Claude

**Franciska Dethlefsen** — head of growth and marketing chez **Zed Industries**. Le rôle est déterminant pour lire le texte : ce n'est pas un billet d'ingénierie mais une **communication de crise produit** · écrite le lendemain d'une annonce d'un fournisseur dont Zed dépend · à destination d'utilisateurs inquiets. La signature growth/marketing explique la structure (problème → options → réassurance) et le fait que l'argument protocolaire arrive en conclusion plutôt qu'en tête.

Économie & Marché

Why SpaceX-Cursor Works for Both, and What It Means for Google, AWS, IBM

Note d'analyste de **Mitch Ashley**, VP et responsable des pratiques *CIO & Technology Buyers* et *Software Lifecycle Engineering* chez **The Futurum Group**, publiée le **29 avril 2026** dans la rubrique *Market Coverage News* : format court, environ **9 500 caractères**, ouvert par cinq puces de synthèse et clos par cinq points de veille. Objet : l'accord annoncé le **21 avril 2026** par lequel **SpaceX** obtient le droit d'acquérir **Cursor** pour **60 milliards de dollars** dans l'année, ou de verser **10 milliards** pour un partenariat de calcul adossé au cluster **Colossus** de **xAI**, à Memphis, présenté comme équivalent à **1 million de GPU H100**. (A) La lecture des deux besoins : Cursor cumulait un plafond de calcul et une compression de marge — l'éditeur paie au prix de marché les modèles d'**Anthropic** et d'**OpenAI** qu'il route vers ses clients tout en les concurrençant avec sa gamme **Composer** ; SpaceX cherchait un revenu IA et un récit avant une introduction en bourse visée pour juin. (B) La lecture de la structure : un plancher de 10 milliards et une option d'achat à 60 milliards exerçable en titres cotés après l'introduction, ce qui, écrit Ashley, *« allocates risk more honestly than a straight acquisition »*. (1) Côté acheteurs, il fixe une fenêtre de **six mois** pour revérifier les clauses de rétention nulle de données et l'identité du fournisseur. (2) Côté fournisseurs, il distingue trois expositions — **Google** protégé par **Antigravity**, **AWS** dépendant d'Anthropic, **IBM** peu exposé mais bien placé sur l'angle gouvernance. Le corpus tient déjà [[beck-starving-genies-usage-limits-ai-coding-2026-04-03]] sur la contrainte de ressources imposée aux outils de codage et [[nyt-musk-promises-spacex-ipo-track-record-2026-06-02]] sur les annonces de SpaceX.

#SpaceX#Cursor#Anysphere

Mitch Ashley · VP et responsable des pratiques CIO & Technology Buyers et Software Lifecycle Engineering chez The Futurum Group · ancien CIO et CTO.

Économie & Marché

Giving agents the ability to pay

Annonce produit publiée sur le blog **Stripe** le **29 avril 2026** par **Dan Hill** (Product Manager, Link Consumer Product), dans le prolongement de la keynote **Stripe Sessions 2026** : le lancement du **portefeuille Link pour les agents**, bâti sur une brique nouvelle, **Issuing for agents**. **Le diagnostic tient en une phrase, et c'est la plus importante du texte** : *« While machine payments protocols are still gaining adoption, agents need to work with the payment options sellers and consumers use today. »* → **Stripe acte que les protocoles de paiement machine-natifs ne sont pas prêts, et livre un contournement des rails existants plutôt qu'un pari sur les nouveaux.** **Le mécanisme** : un consommateur donne à un agent l'accès à son portefeuille Link par un **flux OAuth standard** ; l'agent émet ensuite une *spend request* et reçoit soit une **carte à usage unique**, soit un **Shared Payment Token** — adossés aux cartes et comptes bancaires déjà présents dans le portefeuille. Point cardinal : *« The agent never gets access to your raw payment credentials. »* Le justificatif est **scopé** (montant, devise, marchand) et l'agent doit fournir le **contexte de la transaction** pour que l'humain comprenne ce qu'il approuve — l'exemple donné en CLI est explicite : `amount 3500`, `merchant-name "Powdur"`, `context "Purchasing the Powdur Glow Renewal Vitamin C Serum as a gift for $35."`. **La contrainte structurante est temporelle et assumée** : *« Today, each request requires the person's review before the credential is shared with your agent »* — approbation **humaine, transaction par transaction**, sur le web ou dans les **nouvelles applications iOS et Android** de Link. Les limites de dépense et les cas où l'agent agirait **sans approbation supplémentaire** sont annoncés, pas livrés. **Le second étage est le vrai produit d'infrastructure** : **Issuing for agents** ouvre l'ensemble des API Issuing à qui veut bâtir son propre portefeuille agentique — cartes virtuelles à usage unique, stockage de fonds, contrôles de dépense, permissions au niveau de la carte, contrôles antifraude **à l'autorisation**, visibilité temps réel. Quatre débouchés sont cités : automatisation de la dépense interne, cartes agentiques encastrées chez les **fintechs**, plateformes **SaaS verticales** émettant des cartes aux PME sous leur marque, **places de marché** dont les agents vendeurs paient fournisseurs et logistique. **Argument de distribution** : Link revendique **plus de 200 millions de consommateurs**, et l'article cite **OpenClaw** comme exemple d'agent personnel bénéficiaire. **Deux réserves à porter en tête** : l'approbation par transaction est présentée comme une commodité de conception alors qu'elle est **l'aveu que l'autorisation déléguée d'un agent n'est pas résolue** ; et le stablecoin, les *agentic tokens* et « d'autres moyens de paiement » sont tous au **futur** (*« coming soon »*).

#Stripe#Link#portefeuille pour agents

**Dan Hill** — Product Manager · **Link Consumer Product** chez Stripe. Auteur de l'annonce sur le blog Stripe · rubrique *Product*. Le rattachement au produit *Link Consumer* est significatif : l'annonce est écrite depuis le **portefeuille grand public** · pas depuis l'équipe protocole ni depuis Issuing — ce qui explique que le consentement de l'utilisateur final structure tout le texte.

Outils & Plateformes

Making Google Sans Flex

Google Sans Flex - évolution typographie Google design piloté par besoins

#typographie#Google Sans#design système

Barbara Eldredge · Dave Crossland · Megan Lynch · Tobias Kunisch

Outils & Plateformes

Introducing Code Wiki: Accelerating your code understanding

Google Code Wiki - Documentation code automatisée continuously updated - Gemini-powered chat - Architecture diagrams auto-générés - Public preview website - Gemini CLI extension waitlist - Google Cloud Developer Experiences

#Code Wiki#automated documentation#code understanding

Fergus Hurley (Director Product Management, Google Cloud Developer & Experiences) · Pedro Rodriguez (Senior Engineering Manager, Google Cloud Developer & Experiences) · Rafael Marques (Product Manager, Google Cloud Developer & Experiences)

Outils & Plateformes

Voxtral | Mistral AI

Voxtral — modèles open source de compréhension vocale de Mistral AI : transcription multilingue, Q&A audio, licence Apache 2.0 (mistral.ai)

#Voxtral#Mistral AI#compréhension vocale

Mistral AI

Outils & Plateformes

Powered by Claude

Vitrine « Powered by Claude » : écosystème de partenaires Anthropic — intégrations IA et applications construites sur Claude (anthropic.com)

#Claude#Anthropic#IA

Anthropic PBC

Outils & Plateformes

Gemini CLI is awesome! But only when you make Claude Code use it as its bitch.

Gemini CLI + Claude Code - Workflow hybride - Large codebase analysis - Context window - Reddit ChatGPTCoding

#Gemini CLI#Claude Code#Large Codebase Analysis

u/H9ejFGzpN2 (auteur original). Contributeurs notables: u/CatsFrGold · u/djc0 · u/Parabola2112 · u/Comfortable-Gap-808 · u/Still-Ad3045 · u/fhinkel-dev · u/bull_chief · u/casce · et 30+ autres participants actifs de la communauté