Zum Inhalt springen

root / tags / kimi-k3

#Kimi K3

5 Fiches

Qualität & Sicherheit Automatisch geprüfte Übersetzung

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Ankündigungsbeitrag, veröffentlicht im **offiziellen Z.ai-Blog** (ehemals Zhipu AI, chinesisches Labor) am **14. August 2026**, **ohne namentliche Autorenangabe**, ~2.000 Wörter plus Fußnoten. Er kündigt **GLM-5.3** an, den Nachfolger von GLM-5.2, und eröffnet mit einer methodischen These: *« Scaling post-training is all we did for GLM-5.3. »* Dasselbe Basismodell wie GLM-5.2 — *« every gain comes from post-training »*. Drei Ankündigungen. **(A) Ein Coding-Modell mit offenen Gewichten**: +50 % beansprucht auf **Z.ai Code Bench**, einem unveröffentlichten internen Benchmark. **(B) Eine als „emergent" dargestellte Cyber-Fähigkeit**, die der Fließtext auf eine Trainingsentscheidung zurückführt — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — überraschend waren die Geschwindigkeit und der Wandel in der Natur: Das Modell geht von der Identifizierung isolierter Schwachstellen zu *« coherent plans for complete exploitation chains »* über. Die Gewinne wachsen mit der Position in der Exploitation-Kette: CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** Aufgaben in 2 h (×3,6), wobei der Abstand zur geschlossenen Frontier weiterhin groß bleibt (181 und 247 Aufgaben). Z.ai formuliert es so: *« Capability is growing fastest exactly where we are furthest behind. »* Der Beitrag veröffentlicht zudem ein **Z.ai Security Disclosure Ledger**: **2.436 identifizierte Schwachstellen in 269 Open-Source-Projekten** — Kernel, Betriebssysteme, Browser-Engines, Infrastruktur, Webanwendungen, Netzwerkprotokolle — die älteste eingeführt **1981**, durchschnittliche Lebensdauer bis zur Entdeckung **26,6 Jahre**, davon **53 offengelegt** und **2.383 unter Embargo**. **(C) Eine Gewichtsfreigabe** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Der am ehesten übertragbare methodische Beitrag: **Synthese von Umgebungen und Verifiern**, wobei Letztere ohne Zugriff auf die Referenzlösung erzeugt und erst nach einem Triptychon negativer Kontrollen zugelassen werden — **oracle**, **no-op**, **unsolved-state**. Alle agentischen Evaluierungen werden **in Claude Code 2.1.207** durchgeführt.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

KI-Coding-Agenten & Skills Automatisch geprüfte Übersetzung

Efficient Tokens & Effective Teams in Buzz

Ein **Block-Engineering**-Benchmark-Beitrag vom **6. August 2026**, verfasst von **Atish Patel**, über **Buzz** – den am 21. Juli gestarteten Workspace für Mensch und Agent – der eine Kostenfrage stellt: Welches Agententeam ist **das günstigste, das zuverlässig erfolgreich ist**? Drei Befunde. **(A) Ein vollständig veröffentlichtes negatives Ergebnis**: Auf **Terminal-Bench 2.1** wurden **zwölf Teamzusammensetzungen** (Paare, Triaden, günstige Schwärme unter einem *Frontier*-Modell) gegen den jeweiligen Solo-Agenten antreten lassen, um den sie herum gebaut waren, und **keine schlug ihn bei gleichen Kosten**. Die Erklärung ist struktureller Natur – einer Aufgabe, die in Minuten erledigt ist, *„fehlt genug Struktur, um sie aufzuteilen"*, und *„mehr Agenten kaufen meist nur die Kosten, es zweimal zu erklären"*. **(B) Der Zeithorizont kehrt das Ergebnis um**: Auf **Long-Horizon Terminal-Bench** (44 Aufgaben, eine Aufgabe im Wert von Stunden Arbeit, gleicher Lead **GPT-5.6 Sol** mit *high*-Aufwand) schließt Solo 15 Aufgaben ab bei 59,1 %, +2 QuickBees 19 bei 64,1 %, +1 QuickBee +1 WorkerBee 19 bei 69,5 %, **+2 WorkerBees 20 bei 71,5 %** – ein Zugewinn von **+12,4 Punkten**, wovon 11,4 aus abgeschlossenen Aufgaben stammen. *„Gleiche Plätze, umgekehrtes Ergebnis, weil die Arbeit eine andere Form hat."* Diese Durchläufe liefen mit dem **3-fachen Timeout**, Solo eingeschlossen. **(C) Jenseits einer Schwelle kauft der Preis keine Qualität mehr**: Solo auf Terminal-Bench 2.1, **Opus 5 mit *xhigh*-Aufwand ist der teuerste Durchlauf (140,63 $) bei 75,0 %**, hinter sechs Durchläufen zwischen 20,08 $ und 109,82 $ und 79,5 % bis 88,4 % – als Ursache wird Over-Reasoning genannt, das 17 von 88 Aufgaben in den Timeout trieb. Unter den sechs besten Durchläufen liegt **eine 5,5-fache Preisspanne bei einer Punktzahldifferenz von 8,9 Punkten**: *„die Wahl zwischen ihnen ist überhaupt keine Qualitätsentscheidung. Es ist eine Budgetentscheidung."* Der Beitrag schlägt eine Taxonomie vor, die er selbst als *ad hoc* bezeichnet – **QuickBee**, **WorkerBee**, **SmartBee**, dazu der Mensch als *„Ehrenbiene"* – sowie zwei Teamformen: die permanente **Hive**, die sich die Präferenzen der Nutzenden merkt, und der einmalige **Swarm**, der sich das Projekt merkt. Rahmenbedingungen: alles läuft auf **Harbor**, gegen echte Buzz-Agenten auf einem **Live**-Relay, **ein Versuch pro Aufgabe, kein Retry**, Preise festgeschrieben zum **30.07.2026**.

#Buzz#Block#Agententeams

- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.

Wirtschaft & Markt Automatisch geprüfte Übersetzung

Mistral ↔ Microsoft : un accord souverain, une stratégie industrielle encore illisible

SFEIR-Analyse (in der Stimme der Firma, „eine Lesart von Ingenieuren“) des am **21. Juli 2026** angekündigten Deals zwischen **Mistral** und **Microsoft**: eine **industrielle Partnerschaft im Wert von mehreren Milliarden Dollar**, gegliedert in drei Teile — (1) **Compute in Europa** (reservierte Azure-Kapazität auf dem Kontinent, Rechenzentren in Frankreich, **NVIDIA Vera Rubin**-Systeme der neuesten Generation, um „das europäische Compute-Defizit zu schließen“); (2) **Mistrals Modelle in Microsofts Tooling** (**Mistral Medium 3.5** und **Mistral OCR 4** in **Microsoft Foundry**, zugänglich in **Copilot Studio** zum Aufbau von Business-Agenten); (3) vor allem **Azure Local bis hin zum getrennten Modus** (Public Cloud, überwachte verbundene Cloud, und **air-gapped**, vollständig vom externen Netzwerk getrennt — für Verteidigungsgeheimnisse, Gesundheitswesen, kritisches Bankwesen). **Bemerkenswerte Tatsache, von Brad Smith bestätigt: keine neue Kapitalbeteiligung** von Microsoft an Mistrals Kapital — eine massive Partnerschaft **ohne Kapitalverflechtung**. SFEIR — Partner von Anthropic und Google Cloud, „ohne Interesse daran, den französischen Champion zu überhöhen“ — betrachtet Mistral als **„die beste europäische Wette auf der Modellebene“** und bietet eine dreiteilige Lesart. **Was der Deal einem CIO bringt**: ein europäisches Spitzenmodell, ausführbar in einer getrennten Umgebung und vom Kunden kontrolliert (In-Memory-Verschlüsselung, lokal verwaltete Schlüssel), erfüllt Kriterien, die nur wenige Angebote erfüllen. **Die Spannung**: diese Souveränität wird **auf der Infrastruktur eines amerikanischen Hyperscalers** eingesetzt; vier Souveränitäten müssen unterschieden werden — **Modell, Ausführung, Infrastruktur, Geschäftsbeziehung** — von denen man „drei von vier bekommen kann, aber man muss trotzdem wissen, welche fehlt“. Das einzige Element, das die Souveränität **wirklich portabel** macht, ist die **Open-Weights-Natur** von Mistrals Gewichten (dieselbe Reversibilitätslogik wie bei **Kimi K3**). Das Fehlen einer Kapitalbeteiligung ist kein Detail: Es bewahrt Mistrals Governance **und** minimiert das Risiko einer kartellrechtlichen Prüfung (FTC, Europäische Kommission) — **bewusst gewähltes regulatorisches Arbitrage**, nicht nur eine technische Entscheidung. **Der eigentliche blinde Fleck**: die **Lesbarkeit von Mistrals Industriestrategie**, die gleichzeitig auf fast allen Fronten präsent ist (B2C mit Le Chat, B2B über Azure-Distribution, Open-Weights-Modell **und** Frontier-Ambition, sehr kapitalintensive Infrastruktur — 200 MW gesichert, eine 1-GW-Obergrenze bis 2030 —, Partnerschaften mit einer Handvoll Großkunden, Robostral/OCR-Vertikalisierung, Bedienung regulierter Sektoren): souveräner Full-Stack (optimistische Lesart) oder die Zersplitterung eines drei Jahre alten, mit ~20 Mrd. € bewerteten Unternehmens über Geschäftsfelder mit divergierenden Wirtschaftsmodellen hinweg (vorsichtige Lesart). Für die technische Führung: **das Modell vom Kanal trennen**, **auf Ausstieg auslegen** (Design to Exit — Open-Weights macht die Ausstiegstür glaubwürdig), **routen statt wetten** (souveräne Multi-LLM-Architektur, RAISE). Fazit: **Souveränität ist eine architektonische Eigenschaft, kein Label** — sie wird Abhängigkeit für Abhängigkeit qualifiziert; die fehlende industrielle Lesbarkeit bleibt die eigentlich offene Frage, geklärt nicht durch Pressemitteilungen, sondern durch „die Kompromisse der nächsten zwölf Monate“.

#Mistral#Mistral AI#Microsoft

SFEIR (voix éditoriale du cabinet)

Tools & Plattformen Automatisch geprüfte Übersetzung

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

SFEIRs Analyse aus dem Ingenieur-Kabinett ("die Lesart eines Ingenieurs") des Launches von **Kimi K3** am **16. Juli 2026** durch das chinesische Labor **Moonshot AI**: ein **Open-Weights-Modell der Spitzenklasse (frontier-class)**, für das der Anbieter **rund 2,8 Billionen Parameter**, einen **Ein-Millionen-Token-Kontext** und eine **Veröffentlichung der Gewichte vor dem 27. Juli 2026** beansprucht (voraussichtlich unter einer Modified-MIT-Lizenz, wie schon bei der K2-Reihe). These: Fähigkeiten, die einst proprietären Giganten (Anthropic, OpenAI, Google) vorbehalten schienen, werden **als offene Gewichte, zum Kampfpreis, aus einem chinesischen Labor** verfügbar. SFEIR – obwohl **Partner von Anthropic und Google Cloud** und damit „ohne Interesse daran, ein chinesisches Modell schönzureden" – legt einen zentralen **methodischen Vorbehalt** an: Am Launch-Tag existiert **keine offizielle, vollständige Benchmark-Tabelle**; Spezifikationen (2,8 Billionen, Kimi Delta Attention, +25% Trainingseffizienz) und Scores stammen **vom Anbieter selbst** oder aus **Community-Arenen** und sind „als Behauptungen, nicht als gemessene Fakten zu behandeln." Die neue Architektur (**Kimi Delta Attention**, hybride lineare Aufmerksamkeit; Dekodierung angeblich bis zu **6,3x schneller** bei 1M Token) bricht mit dem Takt der K2-Reihe (K2 Juli 2025 → K2.7 Code Juni 2026, alle zwei Monate ein Flaggschiff); zwei Varianten begleiten den Launch (**K3 Max**, **K3 Swarm Max**), mit erzwungenem Auslaufen der Reihe kimi-k2.5/moonshot-v1 am **31. August 2026**. **Die eigentliche Waffe ist der Preis** (~3 $/M Input, 0,30 $ gecacht, 15 $ Output laut Sekundärquellen): ein Open-Weights-Modell der Spitzenklasse auf diesem Niveau **zieht die gesamte Preis-Leistungs-Kurve nach unten** – die Kommodifizierung der Modellschicht, beschleunigt durch Open Source. Die entscheidende Singularität ist jedoch kein Score: Es ist die **Reversibilität**. Ein Open-Weights-Modell der Spitzenklasse verwandelt eine konsumierte API (Anbieterabhängigkeit) in eine **Option** (Self-Hosting, Portabilität, Ausstieg aus dem Lock-in) – um den Preis einer schweren Infrastruktur, um 2,8 Billionen Parameter zu hosten. SFEIRs Sicht: **Open Weights verändert die Frage, nicht nur die Antwort** – nicht mehr „welches Modell ist das beste/günstigste?", sondern „wie viel meines Systems bin ich bereit, von einem Anbieter abhängig zu machen, den ich nicht kontrolliere?". Die richtige Haltung bleibt ein **geroutetes Portfolio** (ein Modell pro Aufgabe, ein Modell pro Randbedingung), wobei Kimi K3 dem Entscheidungsraster eine **Spalte „Reversibilität"** hinzufügt. Die Überzeugung „AI Only" bleibt unverändert: Das Modell ist eine Commodity, der dauerhafte Vorteil liegt im Engineering drumherum (Context Engineering, Harness, Kostensteuerung, Fähigkeit, die Meinung zu ändern). Die Zahlen müssen weiterhin „selbst" validiert werden – an den eigenen Repositories, den eigenen Daten.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Wirtschaft & Markt Automatisch geprüfte Übersetzung

The state of open source AI (v1.0.1, juillet 2026)

**Wiederkehrender Bericht von Mozilla**, *The state of open source AI*, **v1.0.1, Juli 2026**, eingeleitet durch einen Brief von **Raffi Krikorian** (CTO): sieben Abschnitte, eine interaktive Website und ein herunterladbarer Bericht. These, formuliert im Titel von Abschnitt 1: *« The model layer has commoditized. Value accrues to the harness above it. »* **Fähigkeitsstand**: Auf dem *Artificial Analysis Intelligence Index v4.1* erzielt das beste geschlossene Modell **61** Punkte (Claude Opus 5) und das beste offene Modell **57** (**Kimi K3**), Rang vier insgesamt und vor drei der größten geschlossenen Labore; auf dem *Epoch Capabilities Index* beträgt der Abstand **6 Punkte** (K3 bei 156 gegenüber GPT-5.6 Sol bei 162), beschrieben als *« about one release cycle »*, bei sich überlappenden Konfidenzintervallen. **Sägezahnförmige Frontier**: Offene Modelle führen bei Frontend-Code (K3 mit 1.679 Elo in der LMArena Frontend Code Arena, sechs von sieben Domänen), liefern sich ein Kopf-an-Kopf-Rennen bei agentischer Terminalarbeit (88,3 gegenüber 88,8 im Terminal-Bench 2.1) und geben bei professioneller Wissensarbeit Boden ab (Fable 5 führt vor K3 mit 92 Elo im GDPval-AA v2). **Nutzungsverschiebung**: Der Anteil der über OpenRouter geleiteten Tokens, die an Open-Weight-Modelle gehen, stieg von einem vernachlässigbaren Niveau auf ein Drittel Ende 2025 und dann auf eine **Mehrheit bis Mitte 2026**, wobei die sieben Modelle mit dem höchsten Volumen alle offen gewichtet sind — der Bericht selbst merkt an, dass *« by request count, closed US providers still lead »*, wobei der Vorsprung der offenen Modelle ein Vorsprung beim Token-Volumen ist, der sich auf Coding- und agentische Workloads konzentriert. **Der zentrale Gegensatz**: *« Open ships easy. Open deploys hard. »* — 79 % der Entwickler, die KI einführen, nutzen offene Modelle gegenüber 71 % bei geschlossenen, aber nur **53 %** der Teams mit offenen Modellen erreichen die Produktion **gegenüber 63 %**, und die Lücke wächst mit der Organisationsgröße (geschlossen 54 % → 73 %, offen 53 % → 57 %), was *« rules out a resources explanation »*. Die Reifegradkarte des Stacks (48 Komponenten, 9 Schichten) zeigt zwei durchgängig kalte Spalten — **Standardisierung** und ***Enterprise Readiness*** — identifiziert als die operative Lücke. **Abschnitt 5**: *« The agentic harness is another user agent »*, und *« The model is eating the harness »* — bei jedem Modell, für das beide Varianten existieren, gewinnt inzwischen der Harness des jeweiligen Labors selbst, wobei sich die Lücke von 21,8 Punkten auf etwa 3 verringert hat. Daher die Formel: *« A harness tuned tightly to one lab's weights… degrades on anyone else's model, so the tighter the tuning, the less swappable the weights underneath. Lock-in arrives as a side effect of optimization. »*

#Mozilla#state of open source AI#Open Weights

**Mozilla** — éditeur du rapport · avec une introduction signée **Raffi Krikorian** · *Chief Technology Officer*. Publié en **juillet 2026** (v1.0.1). Données issues de sources tierces créditées (Artificial Analysis, Epoch AI, OpenRouter, LMArena) et d'une enquête propre menée avec **SlashData** (*Mozilla / SlashData 2026 developer survey*, n = 1 410 sur la question des freins).