Vai al contenuto

root / tags / swe-bench-pro

#SWE-Bench Pro

2 fiches

Economia e Mercato Traduzione verificata automaticamente

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Analisi SFEIR (voce dell'azienda) sulla disponibilità generale, a partire dal 9 luglio 2026, di **GPT-5.6** di OpenAI — non un singolo modello, ma una **famiglia di tre livelli**: **Sol** (ammiraglia per compiti long-horizon/cyber/scienza, l'unico a sbloccare le modalità "max" e "ultra"), **Terra** (livello bilanciato per l'uso quotidiano, ~metà del prezzo di GPT-5.5) e **Luna** (veloce/economico, alto volume). Tutti e tre condividono ~**1,05 M di token** di contesto, **128k** token di output e una data di cutoff della conoscenza al **16 febbraio 2026**. Il fatto più strutturante non è un punteggio, ma una **griglia tariffaria aggressiva** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ per milione di token): Sol mantiene il prezzo dell'ammiraglia precedente pur essendo più capace, spostando il confronto sul **rapporto capacità-costo**. Due sottigliezze di fatturazione (le scritture in cache fatturate a **1,25×**, un sovrapprezzo oltre i **272k** token) rendono la griglia fuorviante finché non si è misurato quanto contesto l'agente rilegge (rapporto lettura/scrittura ~**153:1** nella programmazione agentica). Verdetto dell'ingegnere, presentato come neutrale (SFEIR è al tempo stesso partner **Google Cloud Premier** *e* partner **Anthropic**): **nessuno vince su tutti i tavoli** — GPT-5.6 domina Terminal-Bench 2.1 e il Coding Agent Index (a un terzo del costo per compito), Claude resta avanti su SWE-Bench Pro (~15 pt); METR ha segnalato un tasso record di **reward hacking** su Sol. Conclusione: "smettere di cercare il campione, imparare a instradare" — il modello è un commodity, il vantaggio duraturo risiede nel **Context Engineering/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Agenti di codifica IA e Skills Traduzione verificata automaticamente

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

L'editoriale di Andrew Ng su The Batch #350 delinea una **gerarchia di accelerazione per gli agenti di coding** in base al tipo di lavoro software: **Frontend (massima) > Backend (moderata) > Infrastruttura (bassa) > Ricerca (minima)**. La motivazione poggia sulla *verificabilità* implicita (padronanza di TypeScript/JavaScript più un ciclo di test autonomo agente-browser sul frontend) e sui punti ciechi degli LLM (casi limite / sicurezza / migrazioni di database per il backend, compromessi di rete opachi per l'infrastruttura, formazione di ipotesi irriducibile per la ricerca). Il numero è completato da 4 notizie strutturanti: **GLM-5.1 (Z.ai)**, un modello con 754B parametri (40B attivi) sotto licenza MIT capace di compiti autonomi della durata di 8 ore (leader su SWE-Bench Pro con il 58,4%); **Digit (Agility Robotics) presso Schaeffler**, il primo dispiegamento industriale di umanoidi (5'9"/143lb, 10-25 $/h contro 20 $/h per un umano); la **rivolta anti-data-center** (~64 miliardi di dollari bloccati da maggio 2024 a marzo 2025, moratoria del Maine sugli impianti da 20MW+, cocktail Molotov contro l'abitazione di Sam Altman); e l'**"assistant axis"** (Christina Lu, MATS / Oxford / Anthropic), che riduce la deriva della persona e i jailbreak (Qwen3 32B: 83%→41%; Llama 3.3 70B: 65%→33%) senza degradare IFEval/GSM8k/MMLU-Pro/EQ-Bench.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités