# netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12

## Veille

Unified Data Architecture bei Netflix, RDF/SHACL-Wissensgraph, Domänenmodellierung, Upper-Metamodell, semantische Mappings, automatische GraphQL/Avro/Iceberg-Projektionen - Netflix Technology Blog

## Titre Article

Model Once, Represent Everywhere: UDA (Unified Data Architecture) at Netflix

## Date

2025-06-12

## URL

https://netflixtechblog.com/uda-unified-data-architecture-6a6aee261d8d

## Keywords

UDA, Unified Data Architecture, Wissensgraph, Domänenmodellierung, RDF, SHACL, Upper-Metamodell, semantische Integration, Datenkatalog, Schema-Registry, GraphQL, Avro, Iceberg, Data Mesh, Mappings, Projektionen, Transpilation, PDM, Sphere, Netflix, Content Engineering, vernetzte Daten, Ontologien, SPARQL, benannte Graphen, föderierte Schemata, CDC, devil fruit, Data Discovery, operatives Reporting, SKOS

## Authors

Alex Hutter, Alexandre Bertails, Claire Wang, Haoyuan He, Kishore Banala, Peter Royal, Shervin Afshar (Netflix Technology Blog)

## Ton

**Profil:** Technisch tiefgehende Ingenieursanalyse | Institutionelle Tech-Stimme | Deskriptiv-technisches Register | Expertenniveau

Das Netflix-Engineering-Team verwendet eine tiefgehende technische Darstellungsweise, wie sie für den Netflix Tech Blog bei der Vorstellung architektonischer Innovationen typisch ist. Die Zusammenarbeit mehrerer Autoren (7 Ingenieure) signalisiert eine teamübergreifende Anstrengung. Hochspezialisierte Sprache (RDF/SHACL, Upper-Metamodell, semantische Mappings, SPARQL), die sich an erfahrene Data Engineers richtet. Systematische Struktur (Problem → Lösung → Implementierung → Ergebnisse), die technische Sorgfalt demonstriert. Ein selbstbewusster Ton technischer Autorität, der im großen Maßstab gewonnene Erkenntnisse teilt. Typisch für Engineering-Blogs großer Technologieunternehmen (Stil von Uber, Airbnb, LinkedIn), die komplexe Systeme für eine Gemeinschaft von Ingenieuren dokumentieren, die aus Skalierungsherausforderungen lernen.

## Pense-betes

- **Kernprinzip**: "Einmal modellieren, überall repräsentieren"
- **Gelöstes Problem**: duplizierte/inkonsistente Modelle, uneinheitliche Terminologie, Datenqualitätsprobleme, eingeschränkte Konnektivität
- **UDA = Wissensgraph** für vernetzte Daten im gesamten Content Engineering
- **RDF/SHACL-Grundlagen**, jedoch mit operativen Herausforderungen im Unternehmensmaßstab
- **Upper-Metamodell**: Modell aller Modelle, selbstreferenziell, selbstbeschreibend, selbstvalidierend
- **Named-Graph-First**-Informationsmodell für Auflösung, Modularität, Governance
- **Domänenmodelle** ausgedrückt als konzeptionelles RDF innerhalb benannter Graphen
- **Repräsentationen von Datencontainern**: getreue Interpretationen von Systemen als Graphdaten
- **Mappings**: verbinden Domänenmodelle mit konkreten Datencontainern
- **Projektionen**: erzeugen konkrete Container (GraphQL-Schema, Data-Mesh-Quelle, Iceberg-Tabelle)
- **Automatische Transpilation**: Domänenmodell → GraphQL/Avro/Iceberg/Java unter Erhalt der Semantik
- **PDM (Primary Data Management)**: kontrollierte Vokabulare mit SKOS, generierte Benutzeroberfläche
- **Sphere**: Self-Service-Reporting für den Betrieb, Auffindung über Geschäftskonzepte
- **Upper aufgebaut auf RDFS/OWL/SHACL**, jedoch auf einer höheren Abstraktionsebene
- **GraphQL Federation**: Unterstützung für die Generierung föderierter Schemata
- **Intentionsbasierte Automatisierung**: UDA schließt auf Datenbewegungen unter Erhalt der Semantik
- **Der Wissensgraph vereint**: Domänenmodelle + transpilierte Schemata + Mappings
- **Programmierbar über Java/GraphQL/SPARQL**
- **Semantischer Katalog**: erfasst ausschließlich Assets, die mit Domänenmodellen verbunden sind
- **Spider-Man-Problem**: dasselbe Konzept ("Film") wird überall unterschiedlich modelliert

## RésuméDe400mots

Netflix stellt UDA (Unified Data Architecture) vor, eine bahnbrechende Infrastruktur auf Basis eines Wissensgraphen zur Behebung der chronischen Fragmentierung von Datenmodellen im gesamten Content-Engineering-Ökosystem. Das Grundproblem: zentrale Geschäftskonzepte wie "Schauspieler" oder "Film" werden in jedem System unabhängig neu definiert (GraphQL Gateway, Asset-Management, Media Computing), was zu Duplizierung, terminologischen Inkonsistenzen, Qualitätsproblemen und eingeschränkter Konnektivität führt.

**Grundlegende Architektur: RDF/SHACL-Wissensgraph**

UDA verwendet RDF und SHACL als technische Grundlage, sieht sich dabei jedoch mit erheblichen operativen Herausforderungen im Unternehmensmaßstab konfrontiert: RDF verfügte über kein nutzbares Informationsmodell, SHACL war nicht für Unternehmensdaten mit lokalen Schemata und typisierten Schlüsseln konzipiert, den Teams fehlten gemeinsame Modellierungspraktiken, und die Ontologie-Werkzeuge boten keine Unterstützung für kollaborative Modellierung. Lösung: ein "Named-Graph-First"-Informationsmodell, in dem jeder benannte Graph einem übergeordneten Modell entspricht, das selbst wiederum ein benannter Graph innerhalb des Wissensgraphen ist.

**Upper-Metamodell: das Modell aller Modelle**

Upper bildet die formale Sprache zur Beschreibung von Geschäftsdomänen oder Systemen und organisiert Konzepte in Domänenmodellen: kontrollierte Vokabulare, die zentrale Entitätsklassen, Attribute und Relationen definieren. Entscheidend ist, dass Upper eine bootstrapping Upper-Ontologie ist: selbstreferenziell (es modelliert sich selbst), selbstbeschreibend (es definiert das Konzept eines Domänenmodells), selbstvalidierend (es entspricht seinem eigenen Modell). Upper projiziert sich auf eine Java-Jena-basierte API sowie ein föderiertes GraphQL-Schema im Enterprise Gateway. Da alle Domänenmodelle konservative Erweiterungen von Upper sind, gewährleistet die nahtlose Laufzeitintegration konsistente Datensemantik.

**Mappings und Projektionen: Verbindung und Automatisierung**

Mappings verbinden Elemente des Domänenmodells mit Repräsentationen von Datencontainern (GraphQL-Resolver, Data-Mesh-Quellen, Iceberg-Tabellen). Alles ist adressierbar: vom Domänenmodell bis hinunter zum einzelnen Attribut, von der Iceberg-Tabelle bis hinunter zur einzelnen Spalte. Mappings ermöglichen bidirektionale Auffindbarkeit: vom Geschäftskonzept zum physischen System, das die Daten speichert, und umgekehrt. Projektionen erzeugen konkrete Container, die aus dem registrierten Domänenmodell abgeleitete Eigenschaften implementieren, mit automatischer Transpilation zu GraphQL/Avro-Schemata unter Erhalt der Semantik.

**Produktive Anwender: PDM und Sphere**

PDM (Primary Data Management) verwaltet maßgebliche kontrollierte Vokabulare nach dem SKOS-Modell (W3C). Es nimmt ein Domänenmodell als Eingabe, generiert automatisch die Benutzeroberfläche und stellt über UDA-Projektionen Domain Graph Services und Data-Mesh-Pipelines bereit. Konsumierende Vokabulare wissen nichts von SKOS – sie arbeiten mit vertrauter Domänenterminologie.

Sphere: ein auf UDA basierendes Self-Service-System für operatives Reporting. Die Auffindung erfolgt über Geschäftskonzepte ("Schauspieler", "Filme"), nicht über technische Tabellen. Der UDA-Wissensgraph generiert SQL-Abfragen durch Graphtraversierung, wodurch manuelle Joins und technische Vermittlung entfallen. Aggregierte Metadaten werden mit einheitlichem Vokabular dargestellt, und Grenzen sowie Inseln in der Datenlandschaft werden automatisch identifiziert.

**Transformative Wirkung**

UDA verwandelt konzeptionelle Modelle in eine aktive Steuerungsebene: Es dokumentiert Konzepte nicht nur, sondern generiert automatisch Schemata, stellt Services bereit, orchestriert Datenbewegungen und erzwingt Konsistenz. Zukünftige Entwicklungen: Unterstützung von Protobuf/gRPC, Materialisierung von Instanzdaten im Wissensgraphen sowie die Lösung der ursprünglichen Graph-Search-Herausforderungen, die diese Arbeit inspiriert haben.

## GrapheDeConnaissance

- Netflix —a_créé→ UDA (TECHNOLOGIE, 0.99)
- UDA —est_basé_sur→ RDF (TECHNOLOGIE, 0.98)
- UDA —est_basé_sur→ SHACL (TECHNOLOGIE, 0.98)
- Upper —fait_partie_de→ UDA (TECHNOLOGIE, 0.97)
- Upper —permet→ génération de schémas GraphQL (CONCEPT, 0.95)
- Upper —permet→ génération de schémas Avro (CONCEPT, 0.95)
- UDA —permet→ PDM (TECHNOLOGIE, 0.96)
- UDA —permet→ Sphere (TECHNOLOGIE, 0.96)
- PDM —utilise→ SKOS (TECHNOLOGIE, 0.95)
- Sphere —permet→ génération de requêtes SQL (CONCEPT, 0.93)
- UDA —résout→ duplication des modèles (CONCEPT, 0.97)
- UDA —permet→ connexion des domain models aux conteneurs de données (CONCEPT, 0.95)
- Netflix —utilise→ principe "Model Once Represent Everywhere" (CONCEPT, 0.94)

---
Canonical: https://www.thekb.eu/de/fiches/netflix-uda-unified-data-architecture-knowledge-graph-2025-06-12/
