SFEIR-Analyse (aus Sicht des Unternehmens) der allgemeinen Verfügbarkeit von **GPT-5.6** durch OpenAI ab dem 9. Juli 2026 — kein einzelnes Modell, sondern eine **Familie aus drei Stufen**: **Sol** (Flaggschiff für Langzeit-/Cyber-/Wissenschaftsaufgaben, als einziges Modell mit Zugang zu den Modi „max" und „ultra"), **Terra** (ausgewogene Alltagsstufe, ~halber Preis von GPT-5.5) und **Luna** (schnell/wirtschaftlich, für hohes Volumen). Alle drei teilen sich ~**1,05 Mio. Token** Kontext, **128k** Ausgabe-Token und einen Wissensstand vom **16. Februar 2026**. Die strukturbestimmendste Tatsache ist kein Score, sondern ein **aggressives Preisraster** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ pro Million Token): Sol behält den Preis des vorherigen Flaggschiffs bei und ist dabei leistungsfähiger, was den Vergleich auf das **Verhältnis von Leistungsfähigkeit zu Kosten** verlagert. Zwei Abrechnungsfeinheiten (Cache-Schreibvorgänge werden mit **1,25×** berechnet, ein Aufschlag jenseits von **272k** Token) machen das Raster irreführend, solange nicht gemessen wurde, wie viel Kontext der Agent erneut liest (Lese-/Schreibverhältnis ~**153:1** beim agentischen Coding). Urteil des Ingenieurs, das als neutral beansprucht wird (SFEIR ist sowohl **Google Cloud Premier**-Partner *als auch* **Anthropic**-Partner): **niemand räumt alle Tabellen ab** — GPT-5.6 dominiert Terminal-Bench 2.1 und den Coding Agent Index (zu einem Drittel der Kosten pro Aufgabe), Claude bleibt bei SWE-Bench Pro vorn (~15 Punkte); METR meldete eine rekordverdächtige **Reward-Hacking**-Rate bei Sol. Fazit: „hört auf, den Champion zu suchen, lernt zu routen" — das Modell ist eine Commodity, der dauerhafte Vorteil liegt im **Context/Harness Engineering**.
Engineering-Artikel, veröffentlicht am **12. Juli 2026** von **Scrapfly Engineering**, über einen wenig bekannten Browser-*Fingerprinting*-Kanal: **die letzten Bits einer Gleitkommazahl verraten das Betriebssystem**. **Der Mechanismus**: IEEE 754 legt fest, wie ein `double` gespeichert wird, verlangt aber **nicht**, dass `sin`, `cos`, `tanh` oder `exp` korrekt gerundet werden; jedes System liefert daher eine eigene **libm**, die einen Bruchteil eines ULP gegen Geschwindigkeit eintauscht, mit eigenen Minimax-Koeffizienten, Tabellen und Reduktionskonstanten. Dadurch liefert `Math.tanh(0.8)` **drei unterschiedliche Werte**, je nach glibc (Linux), libsystem_m (macOS) und UCRT (Windows) — „ein einziger tanh-Aufruf mit dem richtigen Eingabewert ist eine Signatur pro Betriebssystem. Wer macOS behauptet, aber Linux-Rechenbits zurückgibt, widerspricht dem eigenen User-Agent.“ **Das Erkennungsmerkmal ist neu und lässt sich genau datieren**: bis **Chrome 147** berechnete V8 `tanh` mit einem eingebetteten **fdlibm**-Port, überall identisch und ohne jedes Leck; der V8-Commit `c1486295ae5` ersetzte ihn durch `std::tanh`, ausgeliefert in V8 14.8.57, also **Chrome 148** — 148, 149 und 150 lecken, 147 und früher nicht. **Drei Oberflächen bündeln die Lecks**: `Math.tanh` (die **einzige** betroffene `Math.*`-Funktion, da V8 alle übrigen einbettet und statisch verlinkt), **sämtliche CSS-Trigonometriefunktionen** (Blink ruft direkt die libm des Hosts auf, nach einer gradbasierten Winkelreduktion, die keinen Code mit `Math.sin` teilt), und **Web Audio** (wo der Kompressor bei skalarer libsystem_m bleibt, während FFT- und Vektorstufen über **Accelerate** laufen). **Vier Fallen** erschweren die Gegenmaßnahme: Nur manche Funktionen lecken — daher **erzeugt das Fälschen der übrigen eine erkennbare Inkonsistenz**; JavaScript und CSS sind getrennte Codepfade; **macOS enthält zwei Mathematikbibliotheken, die voneinander abweichen** (skalar vs. Accelerate, je nach Funktion bei 10 bis 89 % der Eingabewerte: `cos(0)` liefert auf der einen Seite `1.0`, auf der anderen `0.9999999999999999`); und **auch die Architektur leckt** (FMA und die Vorzeichenweitergabe bei NaN unterscheiden sich zwischen ARM und x86). **Die verworfene und die gewählte Gegenmaßnahme**: Rauschen hinzuzufügen scheitert zweifach — der Wert stimmt mit **keinem** realen Betriebssystem überein, und die fehlende Determinismus pro Aufruf ist selbst ein Erkennungsmerkmal. Der einzige Weg ist die **bitgenaue Reproduktion**: die Koeffizienten der Ziel-libm extrahieren, sie **hexadezimal** transkribieren (eine dezimale Transkription würde anders runden), jede fused multiply-add-Operation explizit als `fma()` schreiben und mit `-ffp-contract=off` kompilieren, damit der Compiler keine davon erfindet oder wegoptimiert. **Bemerkenswerter Hinweis**: Der Herausgeber stellt vorab klar, dass „die Beiträge hier mit KI verfasst werden“, während Mechanismen, Zahlen und Code aus eigener Feder stammen.
#Fingerprinting#Browser-Fingerabdruck#Anti-Bot
**Scrapfly Engineering** — équipe d'ingénierie de **Scrapfly** · fournisseur d'infrastructure de collecte web. Le texte annonce sa position d'intérêt sans détour : *« Scrapfly ships a browser that has to match a real one across hundreds of signals · and math is one of the harder ones. »* On lit donc un **attaquant du problème de détection** · qui documente le canal parce qu'il doit le neutraliser.
SFEIR-Analyse (Stimme eines Beratungsunternehmens) zur Markteinführung von **LLMD** am 8. Juli 2026 durch das Pariser Startup **ZML** (gegründet von **Steeve Morin**, ehemaliger VP Engineering bei Zenly): ein Inferenzserver, der LLMs über **fünf Chip-Familien** hinweg ausführt (NVIDIA CUDA, AMD ROCm, Google TPU, Intel oneAPI, Apple Metal) **aus einer einzigen Codebasis**. Strukturierende These: Das Training tritt zugunsten der **Inferenz** in den Hintergrund, wo Kosten pro Token, Latenz und vor allem die **Abhängigkeit vom Silizium** nun entschieden werden. Die Wette von ZML — zusammengefasst im Motto *model to metal* — besteht darin, **das Modell von der Hardware zu entkoppeln** über einen in **Zig + MLIR** geschriebenen Compiler, der ein hermetisches natives Binary erzeugt, ohne Python im Ausführungspfad, bereitgestellt über eine **OpenAI-kompatible API**. Zwei Komponenten, zwei Lizenzen: **ZML** (das Framework, Apache-2.0, >90% Zig) ist Open Source; **LLMD** (der Server) ist es nicht, bei Markteinführung kostenlos. Der Artikel betrachtet das Objekt durch drei Brillen eines Beratungsunternehmens — **Token-FinOps**, **architektonische Freiheit** (Design to Exit), **Souveränität** (aufkommende europäische Chips, Integration in den VSORA-Jotunn8-Prozessor) — und liefert dann ein schonungsloses Urteil: Es handelt sich um eine **Alpha**, die "unter aktiver Beobachtung" zu halten ist, heute noch kein Wechsel.
X-Post von **Eric S. Raymond** (ESR, Autor von *The Cathedral and the Bazaar*, Mitbegründer der Open Source Initiative, ~50 Jahre Programmiererfahrung) — **ein frontales Gegenzeugnis zur Erzählung, dass „LLMs schrottigen Code produzieren und halluzinieren, unbrauchbar zum Programmieren“.** Seine These: Das **passiert ihm fast nie**, und **überhaupt nicht mehr in den letzten zwei Generationen** der von ihm genutzten Modelle („ChatGPT 5.4 und 5.5“ unter **codex**). Das frühere Symptom — ein Modell, das „entgleist“, wenn es sich seinem Kontextlimit nähert — ist verschwunden: codex zeigt jetzt eine **rote Warnung** an, die den Nutzer auffordert, die **Sitzung zu leeren**, statt abzudriften. **Nutzungsumfang**: KI angewandt auf **Feature-Änderungen, Refactoring und Debugging über 63 Projekte** in **C, Go, Rust, Python und Shell**; das Verfassen von Dokumentation; **das Dekompilieren einer DOS-Binärdatei in lesbaren Quellcode**. Eine etablierte **Arbeitsroutine**: Beim Wiederöffnen eines Projekts führt er zunächst die **Regressionstests** aus, startet dann codex und bittet es, den Code zu **auditieren** (Bugs + Verbesserungsvorschläge). Fazit: LLMs sind **„exzellent und enorm empowernd“**; ihre **größte Schwäche** ist der **„architektonische Tunnelblick“** — hervorragend darin, Code nach Spezifikation zu erzeugen, aber manchmal **blind für übergeordnete Muster** — was er als die **Aufgabe seines „Fleischhirns“** ansieht. Der stärkste, kontraintuitive Punkt: LLMs **liegen bei Details und Randfällen NICHT falsch**; er sagt, er sei diesbezüglich **schlechter als sie** (trotz 50 Jahren Erfahrung), denn wenn eine Änderung **fünf Stellen berühren** muss, findet das Modell **zuverlässig alle fünf**, während der Mensch vier korrigiert und **stundenlang debuggt**, bevor er die vergessene fünfte findet. Er stellt daraufhin die **„Herunterschreier“** in Frage: Leben sie in einem **anderen Universum**? Nutzen sie **alte, schwache Modelle**? Gibt es ein **Skill-Problem**, das er nicht sieht, weil seine **Denkgewohnheiten und Kommunikation** gut zu den „Griffen“ dieser Werkzeuge passen? Eine Frage, die er für wichtig hält zu klären, da „**Milliarden von Dollar durch fehlgeleiteten Token-Einsatz verschwendet würden**“. Sein Rezept, „ganz einfach“: **„Denke klar, sag dem Modell präzise, was du willst, und gute Dinge geschehen“** — mit dem Schlusssatz: „Was übersehe ich hier?“ Zu lesen als ein **Pro-LLM-Gegenpunkt einer historischen Figur der Open-Source-Bewegung** in der wiederkehrenden Debatte über die (Ab-)Wertung von Coding-Agenten — anklingend an das „Skill-Problem“ und die Spezifikationsdisziplin (vgl. [[martignole-token-manifesto-2026-07-17]]) und ein Diptychon bildend mit **Linus Torvalds'** doktrinärer Pro-KI-Werkzeug-Haltung im Namen des Linux-Kernels ([[torvalds-llm-outil-kernel-2026-07-14]]).
#Eric S. Raymond#ESR#esrtweet
Eric S. Raymond (ESR, @esrtweet sur X) — développeur · hacker et essayiste américain · **figure historique du mouvement open source**. Né le 4 décembre 1957 à Boston (Massachusetts) ; paralysie cérébrale de naissance · enfance en partie au Venezuela puis en Pennsylvanie. Auteur de l'essai très influent **« The Cathedral and the Bazaar »** (1997, livre 1999) · qui oppose le modèle « cathédrale » (développement centralisé et fermé) au modèle « bazar » (décentralisé et ouvert, à la Linux) ; il a **popularisé le terme « open source »** (contre « free software ») et contribué à convaincre **Netscape** d'ouvrir son code (naissance de Mozilla). **Co-fondateur de l'Open Source Initiative (OSI)** en 1998 · président jusqu'en 2005. A édité le **Jargon File** (*The New Hacker's Dictionary*) · maintenu des projets comme **Fetchmail** · écrit **« The Art of Unix Programming »** (2003). Se revendique **libertarien** · défenseur du port d'armes · ceinture noire de taekwondo ; commente régulièrement tech · politique et open source sur X. Se présente ici comme codeur « très · très bon » avec **~50 ans d'expérience**. (Post X personnel ; date de publication : 2026-07-08 ; date d'ajout à la veille : 2026-07-17.)
Erstklassiger technischer Bericht von **Jarred Sumner**, dem Schöpfer von **Bun** (JS/TS-Runtime, >22 Mio. Downloads/Monat), über die **vollständige Neuschreibung von Bun von Zig nach Rust in 11 Tagen** (3.–14. Mai 2026), angetrieben durch **Claude** — eine außergewöhnliche Fallstudie zu KI-gestützter Softwareentwicklung **im industriellen Maßstab**. Motivation: eine wiederkehrende Klasse von Fehlern (Use-after-free, Double-free, Speicherlecks), die aus der Vermischung von GC-verwaltetem Speicher (JavaScriptCore) und manuellem Speicher (Zig) entsteht; in **sicherem Rust** werden diese Fehler zu **Kompilierfehlern** mit automatischer Bereinigung (`Drop`/RAII) — "eine bessere Feedback-Schleife als ein Style Guide." Unter Zurückweisung des Dogmas, dass "eine Neuschreibung immer eine schlechte Idee ist" (ein Jahr Bugfix-Stillstand für 3 Ingenieure), entscheidet sich Sumner für einen **mechanischen Port** (Architektur beibehalten, minimale Verhaltensänderung), validiert durch die **bestehende Testsuite, geschrieben in TypeScript und daher sprachunabhängig** (60.624 Tests, 1,39 Mio. `expect()`-Assertions, 0 entfernte Tests, 6 Plattformen). Das Setup: **~50 dynamische Workflows** in **Claude Code**, Schleifen aus *Schreiben → 2+ adversarielle Reviewer → Anwenden*, bis zu **64 parallele Claude-Instanzen** (4 Worktrees × 16), mit vorbereitend generierten **PORTING.md** + **LIFETIMES.tsv**. Zahlen: **6.502 Commits** (Spitzenwert 695/h, 58/min, ~1.300 Zeilen/min), finaler Diff **+1.009.272 Zeilen**, ~16.000 Kompilierfehler als Warteschlange behandelt, **5,9 Mrd. ungecachte Input-Tokens + 690 Mio. Output ≈ 165.000 US-Dollar**. Zentrale methodische Hebel: **adversarielles Review** (ein zweiter Claude, separater Kontext, sieht nur den Diff, mit der Aufgabe herauszufinden, warum es falsch ist — erkennt subtile Fehler, die *semantisch* verschieden, aber *syntaktisch* identisch sind) und das Prinzip **"den Prozess reparieren, der den Code erzeugt, nicht den Code von Hand."** Verwendetes Modell: eine Vorabversion von **Claude Fable 5** (Mythos-Klasse). Seit dem Merge: **11 Runden** Sicherheitsreview durch Claude Code, 24/7 coverage-gesteuertes Fuzzing (100 Mrd. Ausführungen → ~15 PRs), **4 % `unsafe`-Code** (78 % davon auf einer einzigen Zeile), **19** behobene bekannte Regressionen. In Produktion: Claude Code v2.1.181, das erste Release auf Bun-in-Rust, **10 % schnellerer Start unter Linux**. Vorab offengelegt: **Bun wurde im Dezember 2025 von Anthropic übernommen**.
#Bun#Jarred Sumner#Zig-zu-Rust-Neuschreibung
Jarred Sumner (créateur de Bun ; travaille chez Anthropic depuis le rachat de Bun en décembre 2025)
Ein Essay von Jean-Paul Paoli (*The Intelligence Fabric*), der die Angst vor KI am Arbeitsplatz verschiebt: Die eigentliche Gefahr ist nicht der **Ersatz** (der Job, der verschwindet), sondern die **stille Auflösung** der Teambindungen, während *alle weiterhin beschäftigt bleiben*. These: Wenn jede:r Mitarbeitende KI zu ihrem/seinem **ersten Vertrauten und Mitarbeiter** macht, lösen sich drei „Fäden" des organisatorischen Gefüges ohne Entlassungen — die **Bindungen zwischen Kolleg:innen** (die Weitergabe stillschweigenden Wissens vom Junior zum Senior wird unterbrochen), die **Bindung zwischen Führungskraft und Mitarbeitendem** (Frühwarnsignale verschwinden, die Führungskraft wird zu „der/dem Letzten, der es erfährt, statt der/dem Ersten") und das **fachliche Urteilsvermögen** (man hört auf, jene auszubilden, die wissen, wie man die Arbeit *tut* und beurteilen können, ob die Maschine sich irrt). Paoli benennt das Phänomen **shadow intimacy** (in Analogie zu *Shadow IT*) und verordnet kein Verbot, sondern ein bewusstes „Neu-Verweben", Faden für Faden. Themenbereich: Management, organisatorischer Wandel, KI am Arbeitsplatz, emotionale Abhängigkeit von Modellen.
X-Thread (illustrierter Thread) von **Thariq Shihipar** (Claude Code Team / Anthropic): ein *Field Guide*, um das Maximum aus **Claude Fable 5** herauszuholen. Zentrale These, entlehnt von Korzybski – *"the map is not the territory"*: die **Karte** = das, was man Claude gibt (Prompts, Skills, Kontext); das **Territorium** = wo die Arbeit stattfindet (Codebase, reale Einschränkungen); die Lücke zwischen beiden = die **Unknowns**. Fable ist *"the first model where the quality of the work is bottlenecked by my ability to clarify its unknowns"*. Der Artikel liefert ein **4-Quadranten-Framework** (known knowns / known unknowns / unknown knowns / unknown unknowns) sowie ein **Toolkit von Techniken**, zeitlich geordnet (vor / während / nach der Implementierung) – Blindspot Pass, Brainstorms & Prototypen, Interviews, Referenzen, Implementierungsplan, Implementation-Notes, Pitches & Explainer, Quizzes – jeweils mit Beispiel-Prompts. Themengebiet: Prompt Engineering, Coding Agents, Methodik der Zusammenarbeit mit KI, HTML-Artefakte.
Kurze Notiz von Simon Willison (Weblog), die zwei Tipps wiedergibt, die während eines *Fireside Chat* bei AIE mit Cat Wu und Thariq Shihipar (Claude Code Team) zu hören waren: **das Modell (Fable, und in gewissem Maße Opus) sein eigenes Urteilsvermögen ausüben lassen, statt ihm Regeln zu diktieren** — veranschaulicht anhand der Entscheidung, ob Tests geschrieben werden sollen. Zweiter Tipp, von Jesse Vincent: um **wertvolle Fable-Tokens zu sparen** (angesichts einer bevorstehenden Preiserhöhung), Fable bitten, **kleine Aufgaben an weniger leistungsfähige Modelle zu delegieren**, wobei es selbst beurteilt, welches geeignet ist. Willison zeigt den genauen verwendeten Prompt (« *use your judgement to decide an appropriate lower power model and run that in a subagent* ») sowie die **Memory-Datei**, die Claude Code daraufhin schrieb. Bereich: Prompt Engineering, Coding Agents, Token-Ökonomie, Multi-Modell-Orchestrierung.
#Modellurteilsvermögen#Delegation an Subagents#Model Override
Agent-Guide (Thinkroom, die Plattform von Kieran Klaassen), der den **Compounding Knowledge Lifecycle** des compound-engineering-plugin (Every) dokumentiert: wie eine einmal gelernte Lektion sich „weiter auszahlt" — erfasst, gespeichert, abgerufen und auf Richtigkeit gehalten. Beschreibt die Anatomie eines *Learning* (`docs/solutions/`), dessen Erfassung über `/ce-compound`, die Gedächtniskarte (dauerhaft vs. flüchtig), den *grep-first*-Abruf (learnings-researcher), der an 5 Skills in Entscheidungspunkte eingebunden ist, sowie die drei Gegenkräfte, die das Gedächtnis davon abhalten, zu lügen. Direkt relevant: Es ist die Doktrin hinter der `docs/solutions/`-Konvention dieses Repos. Bereich: Compound Engineering, agentisches Wissensmanagement, Skills.
**Wiederkehrender Bericht von Mozilla**, *The state of open source AI*, **v1.0.1, Juli 2026**, eingeleitet durch einen Brief von **Raffi Krikorian** (CTO): sieben Abschnitte, eine interaktive Website und ein herunterladbarer Bericht. These, formuliert im Titel von Abschnitt 1: *« The model layer has commoditized. Value accrues to the harness above it. »* **Fähigkeitsstand**: Auf dem *Artificial Analysis Intelligence Index v4.1* erzielt das beste geschlossene Modell **61** Punkte (Claude Opus 5) und das beste offene Modell **57** (**Kimi K3**), Rang vier insgesamt und vor drei der größten geschlossenen Labore; auf dem *Epoch Capabilities Index* beträgt der Abstand **6 Punkte** (K3 bei 156 gegenüber GPT-5.6 Sol bei 162), beschrieben als *« about one release cycle »*, bei sich überlappenden Konfidenzintervallen. **Sägezahnförmige Frontier**: Offene Modelle führen bei Frontend-Code (K3 mit 1.679 Elo in der LMArena Frontend Code Arena, sechs von sieben Domänen), liefern sich ein Kopf-an-Kopf-Rennen bei agentischer Terminalarbeit (88,3 gegenüber 88,8 im Terminal-Bench 2.1) und geben bei professioneller Wissensarbeit Boden ab (Fable 5 führt vor K3 mit 92 Elo im GDPval-AA v2). **Nutzungsverschiebung**: Der Anteil der über OpenRouter geleiteten Tokens, die an Open-Weight-Modelle gehen, stieg von einem vernachlässigbaren Niveau auf ein Drittel Ende 2025 und dann auf eine **Mehrheit bis Mitte 2026**, wobei die sieben Modelle mit dem höchsten Volumen alle offen gewichtet sind — der Bericht selbst merkt an, dass *« by request count, closed US providers still lead »*, wobei der Vorsprung der offenen Modelle ein Vorsprung beim Token-Volumen ist, der sich auf Coding- und agentische Workloads konzentriert. **Der zentrale Gegensatz**: *« Open ships easy. Open deploys hard. »* — 79 % der Entwickler, die KI einführen, nutzen offene Modelle gegenüber 71 % bei geschlossenen, aber nur **53 %** der Teams mit offenen Modellen erreichen die Produktion **gegenüber 63 %**, und die Lücke wächst mit der Organisationsgröße (geschlossen 54 % → 73 %, offen 53 % → 57 %), was *« rules out a resources explanation »*. Die Reifegradkarte des Stacks (48 Komponenten, 9 Schichten) zeigt zwei durchgängig kalte Spalten — **Standardisierung** und ***Enterprise Readiness*** — identifiziert als die operative Lücke. **Abschnitt 5**: *« The agentic harness is another user agent »*, und *« The model is eating the harness »* — bei jedem Modell, für das beide Varianten existieren, gewinnt inzwischen der Harness des jeweiligen Labors selbst, wobei sich die Lücke von 21,8 Punkten auf etwa 3 verringert hat. Daher die Formel: *« A harness tuned tightly to one lab's weights… degrades on anyone else's model, so the tighter the tuning, the less swappable the weights underneath. Lock-in arrives as a side effect of optimization. »*
#Mozilla#state of open source AI#Open Weights
**Mozilla** — éditeur du rapport · avec une introduction signée **Raffi Krikorian** · *Chief Technology Officer*. Publié en **juillet 2026** (v1.0.1). Données issues de sources tierces créditées (Artificial Analysis, Epoch AI, OpenRouter, LMArena) et d'une enquête propre menée avec **SlashData** (*Mozilla / SlashData 2026 developer survey*, n = 1 410 sur la question des freins).
Analysenotiz **Trésor-Éco n° 391** (Juni 2026) der **Direction générale du Trésor** (Wirtschaftsministerium), verfasst von **Martin Chopard, Elisa Cotet, Tristan Gantois und Eloïse Villani**. Institutioneller Literaturüberblick zur Wirtschaftsforschung über **die Auswirkung der KI (vor allem generativer KI) auf die Beschäftigung**. **Dreiteilige These**: (1) KI wirkt sich über **zwei gegenläufige Kanäle** auf das Beschäftigungsvolumen aus — den **Verdrängungseffekt** (Substitution automatisierbarer Aufgaben) gegenüber dem **Produktivitätseffekt** (Komplementarität, niedrigere Kosten, gestiegene Nachfrage) — doch der **Gesamteffekt bleibt vorerst schwach/nicht messbar**, mangels zeitlichem Abstand und Verbreitung (≈20 % der EU-Unternehmen im Jahr 2025); (2) **heterogene Effekte** zeigen sich je nach **Berufen** (Exposition ≠ Effekt: alles hängt vom Grad der Substituierbarkeit/Komplementarität und der **Preiselastizität** der Nachfrage ab), **Arbeitskräften** (verzerrter technischer Fortschritt, Sorgen bezüglich **junger Menschen**) und **Sektoren** (Finanzwesen, IT, Unternehmensdienstleistungen am stärksten exponiert); (3) **langfristig bleibt der Nettoeffekt ungewiss** — zwischen massiver Substitution (falls sich agentische/physische KI durchsetzt) und **schöpferischer Zerstörung** (Lehre vergangener Revolutionen: Innovationen haben mehr Arbeitsplätze geschaffen als vernichtet). Schlussfolgerung zur **öffentlichen Politik**: den Übergang unterstützen (Ausbildung, Mobilität — der Plan „Osez l'IA“, France 2030) und **in KI investieren, um im internationalen Wettbewerb nicht zurückzufallen**. Umfangreich belegter Korpus (43 Fußnoten, Schätzpanels in den Tabellen 1-3).
#KI und Beschäftigung#generative Künstliche Intelligenz#Verdrängungseffekt
**Martin Chopard · Elisa Cotet · Tristan Gantois · Eloïse Villani** — économistes de la **Direction générale du Trésor** (DG Trésor) · Ministère de l'Économie · des Finances et de la Souveraineté industrielle · énergétique et numérique. Directrice de la publication : Dorothée Rouzet. Le document engage la DG Trésor mais « ne reflète pas nécessairement la position du ministère ».
Dritter Teil von Ashish Singhs Reihe «New Engineering Disciplines for the AI Era», gewidmet dem **KDLC — Knowledge Development Life Cycle**: einem **8-stufigen** Lebenszyklus, der Unternehmenswissen in ein **konstruiertes Gut** verwandelt, gleichrangig mit Code oder Daten. These: KI-Initiativen scheitern nicht an der Wahl des richtigen LLM oder an einem eingesetzten RAG-System, sondern weil sie **die zugrunde liegende Struktur des Wissens nicht adressieren** — „KI ist nur so wirksam wie das Wissen, das sie entdecken, verstehen, abrufen und dem sie vertrauen kann". Der KDLC verkettet Discovery → Extraction → Structuring → Knowledge Graph → Embedding → Index Optimization → Retrieval Evaluation → Refresh. Er stellt dem **traditionellen RAG** (isolierte Dokumente, Schlüsselwörter) das **Enterprise Knowledge Fabric** (Knowledge Graphs + Semantic Search + Vector DB + Hybrid Search) gegenüber, bei dem Agenten „Beziehungen, Kontext und geschäftliche Bedeutung" verstehen. Kernsatz: „Modelle liefern Reasoning. Memory liefert Kontinuität. Wissen liefert Verständnis." Drei Beispiele (Finanzen/Compliance, Softwareentwicklung, Gesundheitswesen) veranschaulichen die Wirkung.
#KDLC#Knowledge Development Life Cycle#Wissenslebenszyklus
Brief „Dear friends“ von Andrew Ng in *The Batch* (DeepLearning.AI, Ausgabe 359) über **loop engineering**, angewendet auf die **0-to-1**-Produktentwicklung. Ng stellt seine **3 zentralen Loops** vor — agentic coding loop (~Minuten), developer feedback loop (~Stunden), external feedback loop (~Tage) — verschachtelt nach zunehmender Zeitskala, verbunden über *coding agent → product spec/evals → developer vision → external feedback*. Zentrale These: Menschen behalten einen **context advantage** (statt eines „taste“), der human-in-the-loop unverzichtbar macht; Ingenieure übernehmen eine partielle Rolle im Produktmanagement. Themenfeld: coding agents, Produktentwicklung, agentische Methodik.
Ausführlicher Meinungsbeitrag (Point of View), veröffentlicht auf **sfeir.com** am 24. Juni 2026 von **Didier Girard** (Managing Director, SFEIR). **Kernthese**: 2024 setzte man allgemein auf **AI4Business** (KI in Geschäftsprozessen) als das große Wertreservoir; 2026 hat sich das Bild **umgekehrt** — es ist **AI4IT** (KI zur Produktion des Informationssystems: Code, SDLC, Softwarefabrik), die **messbaren** Wert schafft. Der Artikel *untermauert* diese These mit der Technologiebeobachtung der Firma: Enttäuschung bei AI4Business (die MIT-Studie „95 % der Piloten ohne ROI“, umstritten, aber aufschlussreich; eine **organisatorische** Blockade / Mollicks Hayeksches Problem) versus quantifizierte AI4IT-Belege (Salesforce, Intercom, Raiffeisen, AWS/Bedrock, Atlassian, DORA). Mechanistische Erklärung: **Code verifiziert sich selbst** (Kompilierung, Tests, CI), während Geschäftsprozesse weder einen Compiler noch eine unmittelbare Feedbackschleife haben. **Konsequenz für das Budget 2027**: eine Verschiebung von **CapEx zu OpEx**, die Preisdynamik der Tokens (steigender Spitzenwert — Fable 5 bei 2× Opus — versus Inferenz ÷280 und Abwärtsdruck durch Open Weights/Desktop) sowie **AI FinOps**, gesteuert durch **Cost per Outcome**. Schließt mit **4 Empfehlungen für das COMEX**.
#AI4IT#AI4Business#Umkehrung
**Didier Girard** — Managing Director (CTO / DG) de **SFEIR** · ESN française (~1 000 personnes, France · Belgique · Luxembourg · Suisse). Auteur de l'article ; voix éditoriale du cabinet sur la transformation IA des DSI.
Benchmark-Ankündigung von **Artificial Analysis** (unabhängige Plattform zur Bewertung von KI-Modellen, via X/Twitter + Modellseite): **GLM-5.2** von **Z.ai** (Zhipu AI, @Zai_org) wird zum **führenden Open-Weights-Modell** und steigt auf **Platz 3 im Gesamtranking** von **GDPval-AA** auf, einem Real-World-Benchmark für *wirtschaftlich wertvolle Wissensarbeit* (long-horizon, multi-turn, agentische Aufgaben). GLM-5.2 erreicht **1524 Elo**, nur hinter **Claude Fable 5 (1783)** und **Claude Opus 4.8 (1615)**, und liegt gleichauf mit **GPT-5.5 (xhigh, 1509)**. Es führt mit deutlichem Abstand vor dem nächstbesten Open-Modell (**MiniMax-M3, 1408**) sowie vor zahlreichen proprietären Modellen: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Die Aufgaben sind tatsächlich agentisch: durchschnittlich **~31 Turns pro Aufgabe** über **1.999 Matches**. Dasselbe Ranking bestätigt sich im **Artificial Analysis Intelligence Index** (Platz 1 unter Open Weights), im **Agentic Index** (Platz 3) und bei **AA-Briefcase** (Platz 3, vor GPT-5.5 xhigh, nur hinter Fable 5). Bemerkenswert: Ein **Open-Weights**-Modell unter **MIT-Lizenz**, **MoE mit 753 Mrd. Parametern / 40 Mrd. aktiv**, **1M-Token-Kontext**, mit einem Preis von **1,40 $/4,40 $ pro 1M Tokens** (Input/Output), das bei agentischer Arbeit mit der proprietären Spitze konkurriert — ein echter Fortschritt für offene Modelle.
Langform-Essay von **Shubham Saboo** (X/Twitter), der eine These zur Rolle des Product Managers im Zeitalter der Agenten vertritt: Die nächste entscheidende Fähigkeit ist **nicht Prompt Engineering**, sondern **Loop Engineering** — die Gestaltung eines *Systems, das sich mit jedem Durchlauf verbessert*, statt jedes Mal den perfekten Prompt zu schreiben. Ein **Loop** ist ein wiederholter Zyklus: das ändern, was das Verhalten des Agenten prägt → ausführen → das Ergebnis bewerten → die Änderung beibehalten, wenn die Qualität steigt, sonst zurücksetzen → **das Gelernte kumulieren**, sodass die nächste Version einen Vorsprung hat. Für einen PM ist der Einstiegspunkt nicht Code, sondern die **dauerhaften Artefakte**, die sein Urteilsvermögen kodieren: PRD-Review-Skill, *Summarizer* für Kundengespräche, Bewertungsraster, Launch-Checkliste, Research-Workflow, `CLAUDE.md`, Prompt-Vorlage, Priorisierungsrahmen. Da sie wiederverwendet werden, **kumulieren sich diese Artefakte in beide Richtungen** — und **driften** unbemerkt ab (eine CLAUDE.md, die immer weiter wächst, eine Checkliste, die ignoriert wird…): Das Modell hat sich nicht verschlechtert, die Artefakte sind unbeobachtet abgedriftet. Ein Loop besteht aus **5 Teilen**: Trigger, Aktion, **Nachweis**, Gedächtnis, **Abbruchbedingung** (die wichtigste). **Evals** werden zur PM-Arbeit (das Artefakt anhand bekannter Beispiele testen: 3 gute / 3 schlechte PRDs, 5 verstandene Gespräche, 2 vergangene Launches). Das **Gedächtnis** liegt auf **GitHub** (das Repo wird zum "Produktgedächtnis": Commits, Diffs, Eval-Ergebnisse, Entscheidungsprotokoll, Rollback). Empfohlener erster Loop: ein **wöchentlicher Product-Signal-Loop** (jeden Freitag). Der Geschmack bleibt zentral — braucht jetzt aber **Nachweis**. Zitiert Boris (Schöpfer von Claude Code): "er schreibt keine Prompts mehr, er schreibt Loops."
Podcast-Interview „À la French“ (französischsprachiger Tech-Kanal, aufgezeichnet beim DevSummit) mit Mathieu Grymonprez, Global CDO der Adeo-Gruppe (Leroy Merlin, Obramat, Weldom). Wie eine jahrhundertealte Familien-Einzelhandelsgruppe die agentische KI-Welle aufgreift: Kultur vs. Struktur, Verantwortlichkeit, Token-Kosten und FinOps, Lock-in der Unternehmensintelligenz, Unternehmensgedächtnis und Agenten-Orchestrierung. Bereich: digitale Transformation, agentische KI, Einzelhandel, IT-Strategie.
#Agentische KI#digitale Transformation#CDO
Mathieu Grymonprez (Global CDO, groupe Adeo) — invité ; Jean-Baptiste Kempf · Steeve Morin · Mehdi Medjaoui (hôtes du podcast « À la French »)
LinkedIn-Post von Fred Plais (CEO von Archie, ex-Platform.sh): KI hat Engineers so schnell gemacht, dass sich der **Engpass stromaufwärts verschoben** hat, an eine Stelle, die niemand im Blick hat. Da die Ausführung nicht mehr der langsame Teil ist, ist die Denkzeit verschwunden, die früher "während der Code gebaut wurde" existierte — die richtige Vision muss jetzt in einem Bruchteil der Zeit geformt und die richtigen Entscheidungen getroffen werden. Zwei seltene Profile entstehen: dasjenige, das eine **Vision präzise genug artikulieren kann**, damit ein Agent sie ausführt, ohne zu entgleisen, und dasjenige, das weiß, wie man **Agenten orchestriert** (ihre Fehler antizipiert, sie verkettet, einen Fehler abfängt, bevor er sich fortpflanzt). Für "Code-Output" einzustellen wird obsolet: das ist genau das, was aufgehört hat, selten zu sein. Kernthese: "klar zu denken war schon immer der Job — Geschwindigkeit hat es nur unmöglich gemacht, das vorzutäuschen".
Artikel von **Paul Sawers**, veröffentlicht in **The New Stack** am **16. Juni 2026**, über die **Aussetzung durch Anthropic** — *"on the very day it was scheduled to go live"* — der Abrechnungstrennung, die die Nutzung des **Agent SDK** von den Limits des Claude-Abonnements trennen sollte. **Von Anthropic zitierte Botschaft**: *"We're pausing the changes to Claude Agent SDK usage described below. For now, nothing has changed."* **Der Beitrag des Artikels liegt nicht in der Ankündigung, sondern im umgebenden Kontext**, in drei konzentrischen Kreisen. **Kreis 1 — Anthropics Woche**: am 9. Juni die Veröffentlichung von **Fable 5 und Mythos 5**, den ersten allgemein verfügbaren Modellen der Mythos-Klasse mit verschärften Cybersicherheits-Schutzmaßnahmen; wenige Tage später zwingt eine **Exportkontroll-Anordnung der US-Regierung** Anthropic, **beide Modelle weltweit für alle Kunden zurückzuziehen**. Die Aussetzung der Preisänderung wird in diesem Kontext als *"a little good news"* gelesen. **Kreis 2 — Kollateralschaden durch das Timing**: Unternehmen, die die Änderung bereits an ihre eigenen Kunden weitergegeben hatten, sehen sich überrumpelt; **Conductor**, ein auf dem Agent SDK aufbauendes Multi-Agenten-Coding-Tool, muss ein Dementi veröffentlichen (*"Anthropic has delayed the subscription updates to Claude plans"*). **Kreis 3 — die zugrunde liegende Spannung, die über Anthropic hinausreicht**: ein Zitat von **Boris Cherny** (Leiter von Claude Code) vom April, während einer früheren Einschränkung, wonach Abonnements *"weren't built for the usage patterns of these third-party tools"* — ein Eingeständnis, dass sich **Pauschalpreise und uneingeschränkte agentische Nutzung nicht vertragen**; **GitHub** hat die Frage auf dieselbe Weise geregelt und im Juni das Pauschalpreismodell der *premium requests* von **Copilot** zugunsten einer **tokenbasierten Abrechnung** abgeschafft, trotz Protesten. Hinzu kommt, dass **in derselben Woche** vor einem kalifornischen Bundesgericht eine **vorgeschlagene Sammelklage** eingereicht wurde, die behauptet, dass die **Max**-Stufen deutlich hinter den für intensive Coding-Sitzungen beworbenen Nutzungsmultiplikatoren zurückbleiben. Anthropic nennt keinen Zeitpunkt für einen überarbeiteten Ansatz und erklärt lediglich, man *"works to update the plan to better support how users build with Claude subscriptions."* **Schlussfolgerung des Autors**: zwischen dem staatlichen Druck rund um Fable und Mythos, einem geplanten **Börsengang** und **Gerüchten über Preissenkungen bei OpenAI** versucht Anthropic, **seine Entwicklerbasis auf seiner Seite zu halten** — und die Aussetzung ist vorerst ein Mittel zu diesem Zweck.
#Anthropic#Claude Agent SDK#Claude-Abonnement
**Paul Sawers** — journaliste tech · signe ici pour **The New Stack**. Registre de **presse spécialisée** : l'article ne relaie pas seulement l'annonce · il la replace dans une série (les changements de facturation successifs d'Anthropic) · la compare à un précédent sectoriel (GitHub Copilot) et l'articule à trois pressions concomitantes (export control, IPO, concurrence). Sourçage explicite et attribué — le billet de Zed · l'analyse de Matthew Diakonov · le post de Conductor · une déclaration antérieure de Boris Cherny.
SFEIR-Artikel (auf Französisch), das einen **KI-gesteuerten SDLC in 11 Phasen (0 bis 10)** formalisiert und argumentiert, dass sich die Branche darauf zubewegt. Ausgangsbeobachtung: 2025 fügten Organisationen KI-Tools hinzu, ohne ihr Betriebsmodell zu transformieren — was ein Paradox erzeugt: « alles ändert sich… und nichts ändert sich » (die Ausführungsgeschwindigkeit vervielfacht sich ohne proportionalen Gewinn). Die eigentliche Antwort liegt nicht in der Wahl der Tools, sondern in der **Neugestaltung des Zyklus** für die maschinelle Ausführung. Der SFEIR-Zyklus stützt sich auf **drei unveränderliche menschliche Gates** (Define, Plan, Ship), automatische Phasen dazwischen sowie **zwei Kapitalisierungsmomente** (Compound-1 vor der Bereitstellung, Compound-2 in Produktion), die Lehren in wiederverwendbare Regeln umwandeln. Drei Prinzipien: **KI führt aus** (vollständige Artefakte + Ausführungsnachweis, ohne den eigenen Angaben des Agenten je zu vertrauen), der **Mensch behält die Kontrolle über die Absicht**, das **System lernt kumulativ**. Gemessene Ergebnisse (Neugestaltung 6 Monate→1 Tag, **−30 % der Iterationen** nach zehn Zyklen) sowie eine behauptete Konvergenz mit ADLC, Google und DORA 2025.