# pragmatic-engineer-measure-ai-impact-dev-2025-09-16

## Veille

Pragmatic Engineer - Messung der KI-Wirkung - Entwicklerproduktivität - Metriken - GitHub Copilot - DX - Engineering-Effizienz

## Titre Article

HOW TECH COMPANIES MEASURE THE IMPACT OF AI ON SOFTWARE DEVELOPMENT

## Date

2025-09-16

## URL

https://newsletter.pragmaticengineer.com/p/how-tech-companies-measure-the-impact-of-ai?utm_source=tldrnewsletter

## Keywords

KI-Wirkung, Softwareentwicklung, Engineering-Effizienz, Entwicklerproduktivität, KI-Tools, Metriken, GitHub Copilot, Google, Microsoft, Dropbox, Monzo, Atlassian, DX, AI Measurement Framework, Change Failure Rate, PR-Durchsatz, Developer Experience, CSAT, Zeitersparnis

## Authors

Gergely Orosz and Laura Tacho

## Ton

**Profil:** Professionell-Analytisch | Experten-Koautoren | Lehrreich-Präskriptiv | Fortgeschritten-Experte

Orosz und Tacho nehmen eine kollaborative Expertenstimme ein, die Berichterstattung mit dem Aufbau eines methodischen Rahmens verbindet. Daten aus 18 Unternehmen (Google, GitHub, Microsoft, Dropbox) untermauern die Empfehlungen empirisch. Die systematische Struktur, die zentrale Metriken und KI-spezifische Metriken verbindet, offenbart ein auf Frameworks ausgerichtetes Denken. Konkrete Fallstudien (90 % Adoption bei Dropbox, BDD bei Microsoft, Herausforderungen bei Monzo) veranschaulichen abstrakte Prinzipien. Die präskriptive Sprache liefert umsetzbare Anleitungen. Explizite Warnungen (Qualitätsrisiken, Wartbarkeitsschulden, Grenzen der Akzeptanzrate) zeugen von intellektueller Ehrlichkeit. Der Artikel richtet sich an Engineering-Verantwortliche mit einer Mischung aus strategischem Denken und taktischer Umsetzung. Typisch für die ausführlichen Analysen von Pragmatic Engineer, die Branchenrecherche mit praktischen Empfehlungen verbinden.

## Pense-betes

- **18 große Technologieunternehmen** untersucht (Google, GitHub, Microsoft, Dropbox, Monzo, Atlassian...)
- **85 % der Entwickler nutzen KI-Tools**, es fehlen jedoch klare Metriken zur Rechtfertigung der Investition
- **Zentrale + KI-spezifische Metriken**: bestehende (CFR, PR-Durchsatz, PR-Zykluszeit, Developer Experience) mit neuen (Adoptionsrate, CSAT, eingesparte Zeit, KI-Ausgaben) kombinieren
- **Dropbox-Ergebnisse**: **90 % KI-Adoption**, Entwickler mergen **20 % mehr PRs** bei reduzierter CFR
- **Daten segmentieren**: KI-Nutzer vs. Nicht-KI-Nutzer, vor/nach KI, nach Rolle/Seniorität/Sprache
- **Geschwindigkeit und Qualität ausbalancieren**: sich gegenseitig kontrollierende Metriken verfolgen (PR-Durchsatz + CFR)
- **Developer Experience als Priorität**: die Messung von Zufriedenheit und Erlebnis ist entscheidend für nachhaltige Adoption
- **3-schichtige Datenerhebung**: Systemdaten + periodische Umfragen + Experience Sampling
- **Experimentelle Denkweise**: Messung mit klarem Ziel angehen, Vorhersagen testen
- **„Bad Developer Days“ (BDD)**: Microsoft-Metrik zur Bewertung der Wirkung von KI auf die tägliche Reibung
- **Rückgang der Akzeptanzrate**: keine Benchmark-Metrik mehr, erfasst weder Wartbarkeit noch Bugs
- **Agenten-Telemetrie**: aufkommender Bereich mit deutlichem Entwicklungspotenzial
- **Fall Monzo**: objektive Messung ist schwierig (Datenaufbewahrung durch Anbieter), subjektives Empfinden + konkrete Anwendungsfälle (Code-Migrationen) zeigen klaren Mehrwert

## RésuméDe400mots

Diese ausführliche Analyse untersucht, wie **18 große Technologieunternehmen**, darunter Google, GitHub, Microsoft und Dropbox, die Wirkung von KI auf die Softwareentwicklung messen – vor dem Hintergrund der Herausforderung, wachsende Investitionen in KI-Coding-Tools zu rechtfertigen. Verfasst von Gergely Orosz und Laura Tacho (CTO von DX), stellt der Artikel fest, dass zwar **85 % der Entwickler KI-Tools nutzen**, viele Engineering-Verantwortliche jedoch Schwierigkeiten haben, deren tatsächlichen Wert zu beurteilen, da klare Metriken jenseits oberflächlicher Kennzahlen wie Codezeilen (LOC) fehlen.

**Zentrale Botschaft: Metriken kombinieren**

Eine wirksame Messung der KI-Wirkung erfordert **die Kombination bestehender „zentraler“ Engineering-Metriken mit neuen KI-spezifischen Metriken**. Unternehmen sollten traditionelle Metriken wie Change Failure Rate, PR-Durchsatz, PR-Zykluszeit und Developer Experience nicht aufgeben, da das eigentliche Ziel von KI genau darin besteht, diese Grundlagen der Software-Auslieferung zu verbessern. Diese zentralen Metriken müssen zusammen mit KI-Adoptionsraten, Zufriedenheit (CSAT) mit den Tools, eingesparter Zeit pro Entwickler und KI-Ausgaben erfasst werden. **Dropbox** erreichte beispielsweise eine **KI-Adoption von 90 %** und verzeichnete, dass Entwickler **20 % mehr Pull Requests** mergten, bei gleichzeitig reduzierter Change Failure Rate.

**Segmentierung und experimentelle Denkweise**

Ein entscheidender Aspekt ist die **Aufschlüsselung der Metriken nach KI-Nutzungsgrad**: der Vergleich von KI-Nutzern mit Nicht-KI-Nutzern sowie die Analyse von Trends im Zeitverlauf. Diese Aufschlüsselung nach Rolle, Seniorität oder Programmiersprache hilft dabei zu erkennen, welche Gruppen am meisten von KI profitieren oder zusätzliche Schulung benötigen. Der Artikel betont eine **experimentelle Denkweise**, bei der Daten genutzt werden, um konkrete Fragen zu beantworten und Vorhersagen über den Einfluss von KI zu testen.

**Qualität, Wartbarkeit, Developer Experience**

Die Wachsamkeit gegenüber **Codequalität, Wartbarkeit und Developer Experience** ist von zentraler Bedeutung. Die Autoren warnen, dass KI-gestützte Entwicklung „den größten Berg technischer Schulden“ erzeugen kann, wenn sie nicht sorgfältig gesteuert wird. Es ist entscheidend, Metriken zu verfolgen, die sich gegenseitig kontrollieren, etwa Geschwindigkeit zusammen mit Qualität (PR-Durchsatz und CFR). Über Systemmetriken hinaus sind selbstberichtete Daten zu „Vertrauen in Änderungen“, „Wartbarkeit des Codes“ und „wahrgenommener Qualität“ entscheidend, um langfristige Auswirkungen zu erfassen. Developer Experience, oft fälschlicherweise auf oberflächliche Annehmlichkeiten reduziert, ist entscheidend, um Reibungsverluste im gesamten Entwicklungszyklus zu verringern.

**Aufkommende Trends und Herausforderungen**

Microsoft nutzt **„Bad Developer Days“ (BDD)**, um die Wirkung von KI auf die tägliche Reibung zu bewerten, während Glassdoor Experimentierergebnisse (A/B-Tests) misst. Die **Akzeptanzrate** von KI-Vorschlägen, einst eine Benchmark-Metrik, verliert an Bedeutung, da sie zu eng gefasst ist: Sie erfasst weder Wartbarkeit noch die Einführung von Bugs noch die Gesamtproduktivität. Die Kostenanalyse, bisher selten praktiziert, um die Nutzung nicht zu entmutigen, dürfte mit wachsenden KI-Budgets stärker in den Fokus rücken. **Agenten-Telemetrie** und Messung jenseits des reinen Code-Schreibens werden als Bereiche identifiziert, die sich noch deutlich weiterentwickeln dürften.

**AI Measurement Framework und Datenebenen**

Der Artikel stellt das **AI Measurement Framework** vor, ein empfohlenes Metrikset, das KI-Metriken mit zentralen Engineering-Metriken verbindet und die Developer Experience in den Mittelpunkt stellt. Er plädiert für eine mehrschichtige Datenerhebung: quantitative Systemdaten (KI-Tools, GitHub, JIRA, CI/CD), periodische qualitative Umfragen und punktuelle Erfassung des Nutzererlebnisses (Experience Sampling). Die Erfahrung von **Monzo Bank** dient als Fallstudie: eine objektive Messung ist schwierig (Datenaufbewahrung durch Anbieter), doch das subjektive Empfinden der Entwickler und konkrete Anwendungsfälle wie Code-Migrationen zeigen einen klaren Mehrwert.

## GrapheDeConnaissance

- Gergely Orosz —publie→ AI Measurement Framework (METHODOLOGIE, 0.97)
- Laura Tacho —publie→ AI Measurement Framework (METHODOLOGIE, 0.97)
- Laura Tacho —travaille_chez→ DX (ORGANISATION, 0.98)
- DX —permet→ mesure de l'efficacité ingénierie en entreprise (CONCEPT, 0.95)
- AI Measurement Framework —recommande→ combiner métriques d'ingénierie core et métriques spécifiques IA (AFFIRMATION, 0.96)
- Dropbox —mesure→ 90% taux d'adoption IA (MESURE, 0.98)
- Dropbox —mesure→ augmentation 20% des PRs fusionnées (MESURE, 0.95)
- Microsoft —utilise→ Bad Developer Days (METHODOLOGIE, 0.97)
- difficultés de mesure objective de l'IA —observé_dans→ Monzo Bank (ORGANISATION, 0.93)
- acceptance rate —s_oppose_à→ mesure pertinente de productivité IA (CONCEPT, 0.88)
- LeadDev —publie→ AI Impact Report 2025 (DOCUMENT, 0.96)
- METR study —s_oppose_à→ perception de gain de vitesse IA (CONCEPT, 0.9)
- LOC —s_oppose_à→ mesure pertinente productivité (CONCEPT, 0.92)
- Gergely Orosz —prédit→ une évolution significative de la télémétrie d'agents (AFFIRMATION, 0.82)

---
Canonical: https://www.thekb.eu/de/fiches/pragmatic-engineer-measure-ai-impact-dev-2025-09-16/
