Zum Inhalt springen

root / tags / mmlu-pro

#MMLU-Pro

3 Fiches

KI-Coding-Agenten & Skills Automatisch geprüfte Übersetzung

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

Das Editorial von Andrew Ng in The Batch #350 stellt eine Beschleunigungshierarchie für Coding-Agenten nach Art der Softwarearbeit auf: Frontend (maximal) > Backend (moderat) > Infrastruktur (gering) > Forschung (minimal). Die Begründung stützt sich auf die implizite Verifizierbarkeit (Beherrschung von TypeScript/JavaScript plus eine autonome Agent-Browser-Testschleife im Frontend) sowie auf die blinden Flecken der LLMs (Grenzfälle / Sicherheit / DB-Migrationen beim Backend, undurchsichtige Netzwerk-Tradeoffs bei der Infrastruktur, irreduzible Hypothesenbildung bei der Forschung). Die Ausgabe wird durch 4 einordnende Nachrichten abgerundet: GLM-5.1 (Z.ai), ein Modell mit 754B/40B aktiven Parametern unter MIT-Lizenz, das autonome Aufgaben von bis zu 8 Stunden Dauer bewältigt (Spitzenreiter bei SWE-Bench Pro mit 58,4 %); Digit (Agility Robotics) bei Schaeffler, der erste industrielle Einsatz von Humanoiden (1,75 m/65 kg, 10–25 $/h gegenüber 20 $/h für einen Menschen); die Anti-Rechenzentren-Revolte (~64 Mrd. $ blockiert zwischen Mai 2024 und März 2025, Moratorium in Maine für Anlagen ab 20 MW, Molotow-Cocktail am Wohnhaus von Sam Altman); sowie die „Assistant Axis" (Christina Lu, MATS / Oxford / Anthropic), die Persona-Drift und Jailbreaks reduziert (Qwen3 32B: 83 %→41 %; Llama 3.3 70B: 65 %→33 %), ohne IFEval/GSM8k/MMLU-Pro/EQ-Bench zu verschlechtern.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités

Qualität & Sicherheit Automatisch geprüfte Übersetzung

Playing Pretend: Expert Personas Don't Improve Factual Accuracy

Wharton-Studie (Generative AI Labs): Expertenpersonas verbessern die faktische Genauigkeit von LLMs nicht - GPQA Diamond- und MMLU-Pro-Benchmarks - SSRN

#KI-Prompting#Personas#LLM-Genauigkeit

Savir Basil · Ina Shapiro · Dan Shapiro · Ethan Mollick · Lilach Mollick · Lennart Meincke (Generative AI Labs, The Wharton School, University of Pennsylvania)

Transformation & Adoption Automatisch geprüfte Übersetzung

Giving your AI a Job Interview

AI-Benchmarking jenseits von Standardtests - KI-Modelle für spezifische Anwendungsfälle befragen - Jagged Frontier - OpenAI GDPval - Vibes vs. echte Messungen - GuacaDrone-Beispiel - Ethan Mollick - One Useful Thing

#AI-Benchmarking#MMLU-Pro#ARC-AGI

Ethan Mollick