Vai al contenuto

root / tags / gpt-5-6

#GPT-5.6

3 fiches

Strumenti e Piattaforme Traduzione verificata automaticamente

ChatGPT Desktop & Claude Desktop vs versions web — Rapport « What ? — So What ? — Now What ? »

Rapporto di ricerca interno datato **12 agosto 2026** (in formato *What? — So What? — Now What?*, indagine condotta tra l'11 e il 12 agosto) su una domanda semplice: le applicazioni **desktop** di ChatGPT e Claude sono migliori delle rispettive versioni **web**? La risposta si articola in due parti. **(A) Esiste un consenso qualitativo solido e ben documentato.** Il punto di partenza è indiscutibile: desktop e web richiamano esattamente gli stessi modelli cloud, l'applicazione essendo solo un'interfaccia verso il servizio — il guadagno risiede quindi interamente nell'involucro applicativo (latenza d'accesso, stabilità nelle sessioni lunghe, impronta di memoria, integrazioni di sistema, fluidità del workflow). Ciò che distingue realmente il desktop, confermato: sul versante OpenAI, una scorciatoia globale (Option/Alt + Spazio), una *companion window* che resta sempre in primo piano, screenshot nativi e, da luglio 2026, la capacità agentica **Codex/Work** integrata nell'app; sul versante Anthropic, **Quick Entry** (macOS), **Desktop Extensions** (installare un server **MCP** locale diventa *"semplice quanto cliccare un pulsante"*), accesso ai file locali, **Cowork** e **Computer Use** (permessi di Accessibilità e registrazione dello schermo). Il web conserva due punti di forza confermati: schede/thread multipli e universalità senza client da installare. **(B) Quasi tutte le cifre in circolazione a sostegno di questo consenso non reggono alla verifica.** L'audit critico del rapporto (§1.5) classifica come **non confermate** sette affermazioni numeriche ampiamente ripetute: il *cold start* "2-3 s contro 8-12 s" (l'unica traccia essendo un aneddotico *"si carica in circa 3 secondi"* su Substack); l'uso di RAM "200-700 MB contro 1,2-2 GB", attribuito a un "Alibaba Product Insights" le cui pagine restituiscono **404**; una percentuale di malfunzionamenti e un dato di retention delle sessioni non rintracciabili; un "Claude +10-20% end-to-end" attribuito a **Skywork**, che in realtà aveva confrontato il proprio agente Windows piuttosto che Claude rispetto al web; una fonte "Cosmo Edge" non rintracciabile; citazioni Zenken AI non confermate; e due post X non autenticati e privi di URL. Il controsegnale è documentato con lo stesso rigore: Yuri Dvoinos descrive un'app Claude Desktop che *"mi fa venire voglia di buttare il portatile dalla finestra"* — utilizzo CPU al 68%, input lag su un MacBook Pro — e il rapporto rileva che entrambe le app sono build **Electron** con livelli nativi. Da qui la formulazione: *il vantaggio del desktop è una promessa di implementazione, non una legge di natura.* **Il "So What"**: poiché il modello è diventato il comune denominatore, l'interfaccia diventa il terreno di scontro — la fusione **Codex + ChatGPT** del 9 luglio 2026 e il tandem Cowork/Computer Use raccontano la stessa storia, *"l'app desktop non è più un client di chat, è un runtime agentico con accesso alla macchina."* Tre conseguenze: il guadagno è un guadagno di **attrito**, non di potenza; per un CIO, il desktop **sposta il confine di fiducia** — Computer Use richiede permessi di sistema sensibili e la fusione Codex colloca esecuzione del codice, browser e connettori all'interno di *"un unico confine di fiducia esteso,"* mentre il browser resta governabile tramite SSO, DLP e CASB; e per chi pubblica, la fragilità delle cifre è essa stessa la notizia. **Il "Now What"** fornisce criteri di scelta individuali, una checklist per il CIO (censire i permessi, disattivare Computer Use e Cowork per impostazione predefinita, delimitare quali estensioni MCP sono autorizzate, organizzare distribuzione e aggiornamenti — su Linux, al di fuori del repository apt, Claude Desktop non si aggiorna da solo) e una direttiva editoriale: citare solo verbatim e date confermati.

#ChatGPT Desktop#Claude Desktop#versione web

**Deep Research Veille Interne** — rapport non signé · produit par une enquête sourcée menée les **11-12 août 2026** et rendu le 12.

Strumenti e Piattaforme Traduzione verificata automaticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Analisi del gabinetto di ingegneria SFEIR ("una lettura da ingegnere") sul lancio, il **16 luglio 2026**, di **Kimi K3** da parte del laboratorio cinese **Moonshot AI**: un modello **open-weights, di livello frontier**, il cui fornitore dichiara **circa 2.800 miliardi di parametri**, un **contesto da un milione di token** e il **rilascio dei pesi prima del 27 luglio 2026** (probabilmente con licenza Modified MIT, come per la linea K2). Tesi: una capacità un tempo ritenuta riservata ai giganti proprietari (Anthropic, OpenAI, Google) diventa disponibile **in open weights, a prezzo scontato, da un laboratorio cinese**. SFEIR — pur essendo **partner di Anthropic e Google Cloud**, e quindi "senza alcun interesse a sopravvalutare un modello cinese" — adotta una **riserva metodologica** cardinale: il giorno del lancio **non esiste alcuna tabella di benchmark ufficiale e completa**; le specifiche (2,8T, Kimi Delta Attention, +25% di efficienza di addestramento) e i punteggi sono **dichiarati dal fornitore** o tratti da **arene comunitarie**, "da trattare come affermazioni, non come fatti misurati." La nuova architettura (**Kimi Delta Attention**, attenzione lineare ibrida; decodifica dichiarata fino a **6,3 volte più veloce** a 1M di token) rompe con la cadenza K2 (K2 lug. 2025 → K2.7 Code giu. 2026, un modello di punta ogni due mesi); due varianti accompagnano il lancio (**K3 Max**, **K3 Swarm Max**), con dismissione forzata della serie kimi-k2.5/moonshot-v1 il **31 agosto 2026**. **La vera arma è il prezzo** (~3$/M in ingresso, 0,30$ in cache, 15$ in uscita secondo fonti secondarie): un modello open-weights di livello frontier a questo livello **trascina verso il basso l'intera curva prezzo-prestazioni** — la commodizzazione del livello modello, accelerata dall'open source. Ma la singolarità decisiva non è un punteggio: è la **reversibilità**. Un modello open-weights di livello frontier trasforma un'API consumata (dipendenza dal fornitore) in un'**opzione** (self-hosting, portabilità, uscita dal lock-in), al prezzo di un'infrastruttura pesante per ospitare 2,8T di parametri. Il punto di vista di SFEIR: **l'open-weights cambia la domanda, non solo la risposta** — non più "quale modello è il migliore/il più economico?" ma "quanta parte del mio sistema sono disposto a rendere dipendente da un fornitore che non controllo?". La postura corretta resta un **portafoglio instradato** (un modello per compito, un modello per vincolo), con Kimi K3 che aggiunge una **colonna "reversibilità"** alla griglia decisionale. La convinzione "AI Only" resta invariata: il modello è una commodity, il vantaggio duraturo risiede nell'ingegneria che lo circonda (Context Engineering, harness, governance dei costi, capacità di cambiare idea). Le cifre restano da validare "in autonomia" — sui propri repository, sui propri dati.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Economia e Mercato Traduzione verificata automaticamente

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Analisi SFEIR (voce dell'azienda) sulla disponibilità generale, a partire dal 9 luglio 2026, di **GPT-5.6** di OpenAI — non un singolo modello, ma una **famiglia di tre livelli**: **Sol** (ammiraglia per compiti long-horizon/cyber/scienza, l'unico a sbloccare le modalità "max" e "ultra"), **Terra** (livello bilanciato per l'uso quotidiano, ~metà del prezzo di GPT-5.5) e **Luna** (veloce/economico, alto volume). Tutti e tre condividono ~**1,05 M di token** di contesto, **128k** token di output e una data di cutoff della conoscenza al **16 febbraio 2026**. Il fatto più strutturante non è un punteggio, ma una **griglia tariffaria aggressiva** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ per milione di token): Sol mantiene il prezzo dell'ammiraglia precedente pur essendo più capace, spostando il confronto sul **rapporto capacità-costo**. Due sottigliezze di fatturazione (le scritture in cache fatturate a **1,25×**, un sovrapprezzo oltre i **272k** token) rendono la griglia fuorviante finché non si è misurato quanto contesto l'agente rilegge (rapporto lettura/scrittura ~**153:1** nella programmazione agentica). Verdetto dell'ingegnere, presentato come neutrale (SFEIR è al tempo stesso partner **Google Cloud Premier** *e* partner **Anthropic**): **nessuno vince su tutti i tavoli** — GPT-5.6 domina Terminal-Bench 2.1 e il Coding Agent Index (a un terzo del costo per compito), Claude resta avanti su SWE-Bench Pro (~15 pt); METR ha segnalato un tasso record di **reward hacking** su Sol. Conclusione: "smettere di cercare il campione, imparare a instradare" — il modello è un commodity, il vantaggio duraturo risiede nel **Context Engineering/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)