Beitrag von **Ethan Mollick**, veröffentlicht am **31. August 2026** auf *One Useful Thing* (~2.200 Wörter). Er geht von einem Sicherheitsvorfall aus, um eine organisatorische Frage aufzuwerfen: Wann sollte eine KI einen Menschen um Hilfe bitten?
#Agency#Agency#autonome Agenten
Ethan Mollick — professeur à la Wharton School (University of Pennsylvania) · auteur du blog *One Useful Thing* sur Substack.
Ankündigungsbeitrag, veröffentlicht im **offiziellen Z.ai-Blog** (ehemals Zhipu AI, chinesisches Labor) am **14. August 2026**, **ohne namentliche Autorenangabe**, ~2.000 Wörter plus Fußnoten. Er kündigt **GLM-5.3** an, den Nachfolger von GLM-5.2, und eröffnet mit einer methodischen These: *« Scaling post-training is all we did for GLM-5.3. »* Dasselbe Basismodell wie GLM-5.2 — *« every gain comes from post-training »*. Drei Ankündigungen. **(A) Ein Coding-Modell mit offenen Gewichten**: +50 % beansprucht auf **Z.ai Code Bench**, einem unveröffentlichten internen Benchmark. **(B) Eine als „emergent" dargestellte Cyber-Fähigkeit**, die der Fließtext auf eine Trainingsentscheidung zurückführt — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — überraschend waren die Geschwindigkeit und der Wandel in der Natur: Das Modell geht von der Identifizierung isolierter Schwachstellen zu *« coherent plans for complete exploitation chains »* über. Die Gewinne wachsen mit der Position in der Exploitation-Kette: CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** Aufgaben in 2 h (×3,6), wobei der Abstand zur geschlossenen Frontier weiterhin groß bleibt (181 und 247 Aufgaben). Z.ai formuliert es so: *« Capability is growing fastest exactly where we are furthest behind. »* Der Beitrag veröffentlicht zudem ein **Z.ai Security Disclosure Ledger**: **2.436 identifizierte Schwachstellen in 269 Open-Source-Projekten** — Kernel, Betriebssysteme, Browser-Engines, Infrastruktur, Webanwendungen, Netzwerkprotokolle — die älteste eingeführt **1981**, durchschnittliche Lebensdauer bis zur Entdeckung **26,6 Jahre**, davon **53 offengelegt** und **2.383 unter Embargo**. **(C) Eine Gewichtsfreigabe** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Der am ehesten übertragbare methodische Beitrag: **Synthese von Umgebungen und Verifiern**, wobei Letztere ohne Zugriff auf die Referenzlösung erzeugt und erst nach einem Triptychon negativer Kontrollen zugelassen werden — **oracle**, **no-op**, **unsolved-state**. Alle agentischen Evaluierungen werden **in Claude Code 2.1.207** durchgeführt.
#GLM-5.3#GLM-5.2#Z.ai
**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.
Brief „Dear friends“ von Andrew Ng in *The Batch* (DeepLearning.AI, Ausgabe 359) über **loop engineering**, angewendet auf die **0-to-1**-Produktentwicklung. Ng stellt seine **3 zentralen Loops** vor — agentic coding loop (~Minuten), developer feedback loop (~Stunden), external feedback loop (~Tage) — verschachtelt nach zunehmender Zeitskala, verbunden über *coding agent → product spec/evals → developer vision → external feedback*. Zentrale These: Menschen behalten einen **context advantage** (statt eines „taste“), der human-in-the-loop unverzichtbar macht; Ingenieure übernehmen eine partielle Rolle im Produktmanagement. Themenfeld: coding agents, Produktentwicklung, agentische Methodik.
Sonntäglicher Tüftler-Beitrag von **Mark Dembo** (Head of Solutions, Developer Platform & AI bei **Cloudflare**), veröffentlicht am **7. Juni 2026** auf seinem persönlichen Blog. **Erzählung**: Inspiriert von **Steve Ruiz** kauft sich der Autor ein kleines Gerät **M5Stack Stick 3** (~30 €) und baut sich, die Veröffentlichung von **Opus 4.8** nutzend, einen **DIY-KI-Agenten** „aus reiner Neugier, ohne Ziel". **Iteration 1 (45 Min.)**: Er wirft die Dokumentation des Geräts **Claude Code** vor, das Python-Skripte (~200 LOC, *„zero blast radius“*) generiert, die das Wetter in München und dann in mehreren Städten anzeigen; ein **Cloudflare Workers + Workers AI Backend** ergänzt **Text-to-Speech (TTS)**, **Push-to-Talk** (Speech-to-Text) und ein zentrales **kleines LLM** zur Beantwortung von Fragen. **Iteration 2 (ein echter Agent)**: Umstellung der REST-Endpunkte auf **WebSocket**-Transport via **Cloudflare Agents SDK** + **Dynamic Worker execution** → das Muster ***„Code Mode“*** (der Agent schreibt und führt Code aus, um seine Aufgabe zu erledigen). Der Agent beantwortet daraufhin Fragen zu öffentlichen Daten (11! = Fakultät, der Champions-League-Sieger via `fetch()` auf Wikipedia, das Wetter für eine beliebige Stadt). **Iteration 3 (echte Befugnisse)**: Verbindung zu **Todoist** über einen **MCP OAuth**-Flow → 50 Tools auf einmal, daher zwei Probleme: **Context Bloat** und **echtes Schadensrisiko**. Die Lösung stützt sich auf Cloudflares **MCP Server Portal** + die Claude-Connector-Einstellungen: pro Tool **Always allow / Ask for approval / Disable** (*Disabled*-Tools gelangen nie in den Kontext; ein **LLM-Klassifikator** akzeptiert nur eindeutige „Allow“-Freigaben und **verweigert standardmäßig**). **Erklärte Haltung**: Reduzierung seiner Rolle auf ***„idea generator, executor and judge“*** (und selten technischer Anleiter), ein „Human-in-the-Loop“-Ablauf, den er als wenig *„2026“* empfindet (Copy-Paste in UIFlow). **Was er NICHT getan hat**: keine Latenz-/Streaming-Optimierung, keine optimistischen LLM-Aufrufe, keine Evals, ***„I did not even look at the code once.“*** **Verwunderung**: 30 € + ein Anthropic-Session-Fenster + ein paar Cent Cloudflare-Inferenz → ein Objekt, das zuhört und spricht, gesteuert in natürlicher Sprache; *„the true unlock is how accessible it is.“* Scharfer Kontrast zu [[thomas-pragdave-failing-faster-code-rot-ai-velocity-2026-06-06]] (hier rechtfertigt *„zero blast radius“*, den Code nie anzusehen); illustriert konkret *Code Mode* / *„the agent just writing and executing code,“* das **MCP**-Muster ([[claude-skills-bigger-than-mcp-willison-2025-10-16]]), *Ask for approval*-artige Tool-Governance (uber-engineering-agent-identity-crisis-zero-trust-spire-2026-05-21) sowie die Doktrin der *systems around the model* aus dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28.
#BYO Agent#eigene KI mitbringen#Tüfteln
**Mark Dembo** (@darkmembo / @mdembo) · **Head of Solutions – Developer Platform & AI** chez **Cloudflare** (auparavant auteur sur le blog Cloudflare). Billet personnel publié sur son blog *markpauldembo.com* le **7 juin 2026** (description : *« Thoughts about tinkering on a Sunday »*).
Manifestartiger X-Thread von Rohit (@rohit4verse), der die *2026 AI engineer roadmap* entfaltet: eine Gehaltslücke von 150.000 $ zwischen Prompt Engineer und Systems Architect, das Ende generischer *Wrapper*, die "sherlocked by big tech" seien, sowie 5 Portfolio-Projekte, gestaffelt nach Komplexitätsgrad (Offline-Mobile-SLM, selbstverbessernder Coding-Agent, multimodaler *Cursor für Videoeditoren*, Privacy-First-Agent für ein persönliches Life-OS, autonomer Agent für Enterprise-Workflows). Jedes Projekt beschreibt seine *zentralen architektonischen Entscheidungen* (Lazy Loading, Sliding Window, Sandboxing, Szenenerkennung, persönlicher Knowledge Graph, ereignisgesteuertes Multi-Agent-System, Audit Trail, RBAC, Observability). Strukturierender Slogan: *"the replaceable: building wrappers / the unfireable: shipping autonomous systems"*. Auffordernder, viraler Ton, typisch für X im Jahr 2026.
#2026 AI engineer roadmap#Rohit#rohit4verse
Rohit (@rohit4verse) — créateur de contenu IA sur X · vulgarisateur d'architecture et roadmaps de carrière en ingénierie IA.
Ethan Mollick – KI-Entwicklung in 3 Jahren: Von GPT-3 zu Gemini 3 – Von Chatbots zu Agenten – Code als universelle Schnittstelle – Intelligenz auf Doktorandenniveau – Human-in-the-Loop Antigravity