Vai al contenuto

root / tags / jagged-frontier

#jagged frontier

4 fiches

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Andrej Karpathy: From Vibe Coding to Agentic Engineering

Intervista ad Andrej Karpathy (co-fondatore di OpenAI, ex responsabile dell'Autopilot di Tesla) sul passaggio dal *vibe coding* all'*agentic engineering*: December 2025 transition come punto di svolta "never felt more behind as a programmer", la tassonomia Software 1.0/2.0/3.0, l'esempio openclaw (script bash → testo da copiare-incollare nell'agente) e MenuGen reso obsoleto da Nanobanana di Gemini, la teoria della *verifiability* che spiega perché gli LLM sono *jagged* (picco su matematica/codice, fallimento su "andare all'autolavaggio a 50 metri"), la distinzione tra *vibe coding* (alzare il pavimento) e *agentic engineering* (mantenere il livello di qualità), la metafora "animals vs ghosts", la revisione del processo di selezione tramite progetti agente-contro-agente, e la formula chiave: ***"You can outsource your thinking but you can't outsource your understanding."***

#Andrej Karpathy#vibe coding#agentic engineering

Andrej Karpathy (co-fondateur OpenAI, ex-Tesla Autopilot, créateur du terme "vibe coding")

Agenti di codifica IA e Skills Traduzione verificata automaticamente

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

L'editoriale di Andrew Ng su The Batch #350 delinea una **gerarchia di accelerazione per gli agenti di coding** in base al tipo di lavoro software: **Frontend (massima) > Backend (moderata) > Infrastruttura (bassa) > Ricerca (minima)**. La motivazione poggia sulla *verificabilità* implicita (padronanza di TypeScript/JavaScript più un ciclo di test autonomo agente-browser sul frontend) e sui punti ciechi degli LLM (casi limite / sicurezza / migrazioni di database per il backend, compromessi di rete opachi per l'infrastruttura, formazione di ipotesi irriducibile per la ricerca). Il numero è completato da 4 notizie strutturanti: **GLM-5.1 (Z.ai)**, un modello con 754B parametri (40B attivi) sotto licenza MIT capace di compiti autonomi della durata di 8 ore (leader su SWE-Bench Pro con il 58,4%); **Digit (Agility Robotics) presso Schaeffler**, il primo dispiegamento industriale di umanoidi (5'9"/143lb, 10-25 $/h contro 20 $/h per un umano); la **rivolta anti-data-center** (~64 miliardi di dollari bloccati da maggio 2024 a marzo 2025, moratoria del Maine sugli impianti da 20MW+, cocktail Molotov contro l'abitazione di Sam Altman); e l'**"assistant axis"** (Christina Lu, MATS / Oxford / Anthropic), che riduce la deriva della persona e i jailbreak (Qwen3 32B: 83%→41%; Llama 3.3 70B: 65%→33%) senza degradare IFEval/GSM8k/MMLU-Pro/EQ-Bench.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités

Trasformazione e Adozione Traduzione verificata automaticamente

Giving your AI a Job Interview

Benchmark AI oltre i test standard - Intervistare i modelli AI per casi d'uso specifici - Jagged Frontier - OpenAI GDPval - Vibes vs misurazioni reali - Esempio GuacaDrone - Ethan Mollick - One Useful Thing

#AI benchmarking#MMLU-Pro#ARC-AGI

Ethan Mollick

Trasformazione e Adozione Traduzione verificata automaticamente

An Opinionated Guide to Using AI Right Now

Guida pratica all'uso dell'IA, scelta del modello, jagged frontier, Centaurs vs Cyborgs, dati di utilizzo OpenAI, Claude/Gemini/ChatGPT - Ethan Mollick

#scelta del modello di IA#ChatGPT vs Claude vs Gemini#jagged frontier

Ethan Mollick (Associate Professor, Wharton School, University of Pennsylvania ; Auteur "Co-Intelligence: Living and Working with AI" ; TIME 100 Most Influential People in AI 2024)