Interner Recherchebericht vom **12. August 2026** (im Format *What? — So What? — Now What?*, Untersuchung durchgeführt am 11.–12. August) zu einer einfachen Frage: Sind die **Desktop**-Anwendungen von ChatGPT und Claude besser als ihre **Web**-Versionen? Die Antwort kommt in zwei Teilen. **(A) Es existiert ein solider, gut belegter qualitativer Konsens.** Der Ausgangspunkt ist unbestreitbar: Desktop und Web rufen exakt dieselben Cloud-Modelle auf, die Anwendung ist lediglich eine Schnittstelle zum Dienst — der Gewinn liegt somit vollständig in der Application Shell (Zugriffslatenz, Stabilität bei langen Sitzungen, Speicherbedarf, Systemintegrationen, Workflow-Flüssigkeit). Was Desktop tatsächlich unterscheidet, bestätigt: auf OpenAI-Seite ein globaler Shortcut (Option/Alt + Space), ein *companion window*, das immer im Vordergrund bleibt, native Screenshots und seit Juli 2026 die agentische **Codex/Work**-Fähigkeit, die in die App integriert ist; auf Anthropic-Seite **Quick Entry** (macOS), **Desktop Extensions** (die Installation eines lokalen **MCP**-Servers wird *„so einfach wie ein Klick auf einen Button“*), Zugriff auf lokale Dateien, **Cowork** und **Computer Use** (Bedienungshilfen-Berechtigungen und Bildschirmaufzeichnung). Das Web behält zwei bestätigte Stärken: mehrere Tabs/Threads und Universalität ohne zu installierenden Client. **(B) Nahezu alle kursierenden Zahlen zur Stützung dieses Konsenses halten einer Überprüfung nicht stand.** Das kritische Audit des Berichts (§1.5) stuft sieben weitverbreitete numerische Behauptungen als **unbestätigt** ein: der *Kaltstart* „2–3 s vs. 8–12 s“ (die einzige Spur ist ein anekdotisches *„lädt in etwa 3 Sekunden“* auf Substack); RAM-Nutzung „200–700 MB vs. 1,2–2 GB“, zugeschrieben einem „Alibaba Product Insights“, dessen Seiten **404** zurückgeben; eine nicht nachvollziehbare Glitch-Rate und eine ebenso nicht nachvollziehbare Zahl zur Sitzungsbindung; ein Claude „+10–20 %“ End-to-End, zugeschrieben **Skywork**, das in Wahrheit seinen eigenen Windows-Agenten und nicht Claude gegen das Web gebenchmarkt hatte; eine nicht nachvollziehbare Quelle „Cosmo Edge“; unbestätigte Zitate von Zenken AI; sowie zwei nicht authentifizierte X-Posts ohne URL. Das Gegensignal ist mit derselben Sorgfalt dokumentiert: Yuri Dvoinos beschreibt eine Claude-Desktop-App, die *„mich dazu bringt, meinen Laptop aus dem Fenster werfen zu wollen“* — 68 % CPU-Auslastung, Eingabeverzögerung auf einem MacBook Pro — und der Bericht vermerkt, dass beide Apps **Electron**-Builds mit nativen Schichten sind. Daher seine Formulierung: *der Desktop-Vorteil ist ein Implementierungsversprechen, kein Naturgesetz.* **Das „So What“**: Da das Modell zum gemeinsamen Nenner geworden ist, wird die Schnittstelle zum Schlachtfeld — die Fusion **Codex + ChatGPT** vom 9. Juli 2026 und das Tandem Cowork/Computer Use erzählen dieselbe Geschichte: *„die Desktop-App ist kein Chat-Client mehr, sondern eine Agenten-Laufzeitumgebung mit Zugriff auf die Maschine.“* Drei Konsequenzen: Der Gewinn ist ein **Reibungs**-Gewinn, kein Leistungsgewinn; für einen CIO **verschiebt** Desktop die **Vertrauensgrenze** — Computer Use erfordert sensible Systemberechtigungen, und die Codex-Fusion bringt Codeausführung, Browser und Konnektoren in *„eine erweiterte Vertrauensgrenze“*, während der Browser über SSO, DLP und CASB weiterhin steuerbar bleibt; und für jeden, der publiziert, ist die Zerbrechlichkeit der Zahlen selbst die Geschichte. **Das „Now What“** liefert individuelle Umstiegskriterien, eine CIO-Checkliste (Berechtigungen inventarisieren, Computer Use und Cowork standardmäßig deaktivieren, festlegen, welche MCP-Erweiterungen autorisiert sind, Verteilung und Updates organisieren — unter Linux, außerhalb des apt-Repositorys, aktualisiert sich Claude Desktop nicht selbst) sowie eine redaktionelle Vorgabe: nur bestätigte Verbatims und Daten zitieren.
#ChatGPT Desktop#Claude Desktop#Web-Version
**Deep Research Veille Interne** — rapport non signé · produit par une enquête sourcée menée les **11-12 août 2026** et rendu le 12.
SFEIRs Analyse aus dem Ingenieur-Kabinett ("die Lesart eines Ingenieurs") des Launches von **Kimi K3** am **16. Juli 2026** durch das chinesische Labor **Moonshot AI**: ein **Open-Weights-Modell der Spitzenklasse (frontier-class)**, für das der Anbieter **rund 2,8 Billionen Parameter**, einen **Ein-Millionen-Token-Kontext** und eine **Veröffentlichung der Gewichte vor dem 27. Juli 2026** beansprucht (voraussichtlich unter einer Modified-MIT-Lizenz, wie schon bei der K2-Reihe). These: Fähigkeiten, die einst proprietären Giganten (Anthropic, OpenAI, Google) vorbehalten schienen, werden **als offene Gewichte, zum Kampfpreis, aus einem chinesischen Labor** verfügbar. SFEIR – obwohl **Partner von Anthropic und Google Cloud** und damit „ohne Interesse daran, ein chinesisches Modell schönzureden" – legt einen zentralen **methodischen Vorbehalt** an: Am Launch-Tag existiert **keine offizielle, vollständige Benchmark-Tabelle**; Spezifikationen (2,8 Billionen, Kimi Delta Attention, +25% Trainingseffizienz) und Scores stammen **vom Anbieter selbst** oder aus **Community-Arenen** und sind „als Behauptungen, nicht als gemessene Fakten zu behandeln." Die neue Architektur (**Kimi Delta Attention**, hybride lineare Aufmerksamkeit; Dekodierung angeblich bis zu **6,3x schneller** bei 1M Token) bricht mit dem Takt der K2-Reihe (K2 Juli 2025 → K2.7 Code Juni 2026, alle zwei Monate ein Flaggschiff); zwei Varianten begleiten den Launch (**K3 Max**, **K3 Swarm Max**), mit erzwungenem Auslaufen der Reihe kimi-k2.5/moonshot-v1 am **31. August 2026**. **Die eigentliche Waffe ist der Preis** (~3 $/M Input, 0,30 $ gecacht, 15 $ Output laut Sekundärquellen): ein Open-Weights-Modell der Spitzenklasse auf diesem Niveau **zieht die gesamte Preis-Leistungs-Kurve nach unten** – die Kommodifizierung der Modellschicht, beschleunigt durch Open Source. Die entscheidende Singularität ist jedoch kein Score: Es ist die **Reversibilität**. Ein Open-Weights-Modell der Spitzenklasse verwandelt eine konsumierte API (Anbieterabhängigkeit) in eine **Option** (Self-Hosting, Portabilität, Ausstieg aus dem Lock-in) – um den Preis einer schweren Infrastruktur, um 2,8 Billionen Parameter zu hosten. SFEIRs Sicht: **Open Weights verändert die Frage, nicht nur die Antwort** – nicht mehr „welches Modell ist das beste/günstigste?", sondern „wie viel meines Systems bin ich bereit, von einem Anbieter abhängig zu machen, den ich nicht kontrolliere?". Die richtige Haltung bleibt ein **geroutetes Portfolio** (ein Modell pro Aufgabe, ein Modell pro Randbedingung), wobei Kimi K3 dem Entscheidungsraster eine **Spalte „Reversibilität"** hinzufügt. Die Überzeugung „AI Only" bleibt unverändert: Das Modell ist eine Commodity, der dauerhafte Vorteil liegt im Engineering drumherum (Context Engineering, Harness, Kostensteuerung, Fähigkeit, die Meinung zu ändern). Die Zahlen müssen weiterhin „selbst" validiert werden – an den eigenen Repositories, den eigenen Daten.
SFEIR-Analyse (aus Sicht des Unternehmens) der allgemeinen Verfügbarkeit von **GPT-5.6** durch OpenAI ab dem 9. Juli 2026 — kein einzelnes Modell, sondern eine **Familie aus drei Stufen**: **Sol** (Flaggschiff für Langzeit-/Cyber-/Wissenschaftsaufgaben, als einziges Modell mit Zugang zu den Modi „max" und „ultra"), **Terra** (ausgewogene Alltagsstufe, ~halber Preis von GPT-5.5) und **Luna** (schnell/wirtschaftlich, für hohes Volumen). Alle drei teilen sich ~**1,05 Mio. Token** Kontext, **128k** Ausgabe-Token und einen Wissensstand vom **16. Februar 2026**. Die strukturbestimmendste Tatsache ist kein Score, sondern ein **aggressives Preisraster** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ pro Million Token): Sol behält den Preis des vorherigen Flaggschiffs bei und ist dabei leistungsfähiger, was den Vergleich auf das **Verhältnis von Leistungsfähigkeit zu Kosten** verlagert. Zwei Abrechnungsfeinheiten (Cache-Schreibvorgänge werden mit **1,25×** berechnet, ein Aufschlag jenseits von **272k** Token) machen das Raster irreführend, solange nicht gemessen wurde, wie viel Kontext der Agent erneut liest (Lese-/Schreibverhältnis ~**153:1** beim agentischen Coding). Urteil des Ingenieurs, das als neutral beansprucht wird (SFEIR ist sowohl **Google Cloud Premier**-Partner *als auch* **Anthropic**-Partner): **niemand räumt alle Tabellen ab** — GPT-5.6 dominiert Terminal-Bench 2.1 und den Coding Agent Index (zu einem Drittel der Kosten pro Aufgabe), Claude bleibt bei SWE-Bench Pro vorn (~15 Punkte); METR meldete eine rekordverdächtige **Reward-Hacking**-Rate bei Sol. Fazit: „hört auf, den Champion zu suchen, lernt zu routen" — das Modell ist eine Commodity, der dauerhafte Vorteil liegt im **Context/Harness Engineering**.