# lightrag-simple-fast-rag-hkuds-2024-10-08

## Veille

LightRAG - RAG semplice e veloce - Knowledge Graph - Recupero a doppio livello - EMNLP2025 - GitHub

## Titre Article

HKUDS/LightRAG: [EMNLP2025] "LightRAG: Simple and Fast Retrieval-Augmented Generation"

## Date

2024-10-08

## URL

https://github.com/HKUDS/LightRAG

## Keywords

knowledge-graph, gpt, rag, gpt-4, large-language-models, llm, genai, retrieval-augmented-generation, graphrag, dual-level retrieval, vector storage, Neo4j, PostgreSQL, Faiss, document processing, multimodal RAG, EMNLP2025

## Authors

Zirui Guo, Lianghao Xia, Yanhua Yu, Tu Ao, Chao Huang (HKUDS - Hong Kong University Data Science)

## Ton

**Profilo**: Accademico-tecnico, voce istituzionale di ricerca, registro descrittivo-tecnico, livello esperto.

**Descrizione**: I ricercatori di HKUDS adottano il tono di un repository GitHub accademico che combina documentazione tecnica e posizionamento da paper di ricerca (accettato a EMNLP 2025). Il linguaggio specialistico ML/AI (recupero a doppio livello, knowledge graph, archiviazione vettoriale) si rivolge a ricercatori e professionisti. La tipica struttura di un progetto open source (README, esempi, benchmark) facilita l'adozione. Il tono tecnico e oggettivo evita l'enfasi promozionale a favore della dimostrazione delle capacità. Tipico delle pubblicazioni di codice accademico (stile HuggingFace, Papers with Code) che collegano i contributi di ricerca all'implementazione pratica, rivolto alla comunità ML.

## Pense-betes

- **22k** **stelle** GitHub, **3,3k fork**, licenza MIT
- Presentazione a **EMNLP 2025** (conferenza NLP di rilievo)
- **Recupero a doppio livello**: combinazione di knowledge graph + database vettoriali
- Supporto **multimodale** tramite RAG-Anything (testo, immagini, tabelle, equazioni)
- **Oltre 25 parametri di configurazione** per una personalizzazione granulare
- Raccomandazioni LLM: **minimo 32 miliardi di parametri**, contesto **32KB+** (64KB ideale)
- **6 modalità di interrogazione**: local, global, hybrid, naive, mix, bypass
- Supporto per **archiviazioni multiple**: PostgreSQL, Neo4j, Redis, MongoDB, Milvus, Qdrant, Faiss
- Integrazione **RAG-Anything** per l'elaborazione dei documenti (PDF, PPT, CSV)
- **Gestione avanzata**: eliminazione per ID documento, per nome entità
- **Risposte in streaming** e cronologia delle conversazioni
- Supporto alle **citazioni** per l'attribuzione delle fonti
- **Docker Compose** disponibile per una distribuzione rapida
- Comunità attiva: Discord, WeChat, documentazione completa

## RésuméDe400mots

LightRAG è un sistema di Retrieval-Augmented Generation (RAG) sviluppato da HKUDS (Hong Kong University Data Science) che sarà presentato a EMNLP 2025, una delle principali conferenze di elaborazione del linguaggio naturale. Con **22k** **stelle** GitHub e con licenza MIT, il progetto mira a semplificare e accelerare l'estrazione di conoscenza e l'interrogazione intelligente attraverso un approccio innovativo che combina knowledge graph e database vettoriali.

**Architettura di recupero a doppio livello**

L'innovazione centrale di LightRAG risiede nel suo sistema di "recupero a doppio livello", che unisce due approcci complementari: i knowledge graph per catturare le relazioni strutturali tra entità e i database vettoriali per la ricerca semantica. Questa ibridazione offre **sei modalità di interrogazione distinte** (local, global, hybrid, naive, mix, bypass) che adattano la strategia di recupero al contesto e alle esigenze specifiche.

**Supporto multimodale e formati multipli**

La recente integrazione con RAG-Anything amplia considerevolmente le capacità di elaborazione dei documenti. Il sistema gestisce ora in modo continuo testo, immagini, tabelle ed equazioni provenienti da vari formati (PDF, DOC, PPT, CSV). Questo approccio multimodale trasforma LightRAG in una soluzione completa per l'estrazione di conoscenza da documenti aziendali eterogenei.

**Flessibilità di archiviazione e scalabilità**

LightRAG supporta un'architettura di archiviazione modulare a quattro livelli: archiviazione KV per la cache dell'LLM e i chunk di testo (JSON, PostgreSQL, Redis, MongoDB), archiviazione vettoriale per gli embedding (NanoVectorDB, Milvus, Chroma, Faiss, Qdrant, PostgreSQL, MongoDB), archiviazione a grafo per il grafo entità-relazione (NetworkX, Neo4J, PostgreSQL, AGE) e archiviazione dello stato dei documenti per il tracciamento dell'elaborazione. Questa flessibilità consente di scegliere il backend ottimale in base ai requisiti di prestazioni e infrastruttura. Per la produzione ad alte prestazioni, si raccomanda Neo4J come database a grafo.

**Requisiti e raccomandazioni per l'LLM**

Le specifiche raccomandate riflettono la sofisticazione del sistema: un LLM con **almeno 32 miliardi di parametri** e una lunghezza di contesto di **32KB** (64KB preferibile) per ottimizzare l'estrazione delle relazioni tra entità. Sono suggeriti modelli di embedding multilingue diffusi come BAAI/bge-m3 e text-embedding-3-large. Il sistema supporta OpenAI (GPT-4o, GPT-4o-mini), Ollama per modelli locali e Hugging Face.

**Configurazione avanzata e personalizzazione**

LightRAG espone **più di 25 parametri di inizializzazione** che offrono un controllo granulare: dimensione dei chunk (1200 token di default), cicli di estrazione delle entità (1 di default), dimensione del batch di embedding (32 di default), parametri della cache dell'LLM e budget di token per entità, relazioni e contesto totale. Questa configurabilità consente di ottimizzare con precisione il compromesso tra prestazioni e costo.

**Funzionalità avanzate e gestione**

Il sistema offre capacità sofisticate: eliminazione di documenti per ID, eliminazione di entità per nome (mantenendo la coerenza grafo/vettore), supporto alle citazioni per l'attribuzione delle fonti, risposte in streaming, tracciamento della cronologia conversazionale e inserimento di knowledge graph personalizzati. L'architettura asincrona (asyncio) garantisce prestazioni e scalabilità.

**Distribuzione e comunità**

Installazione flessibile tramite PyPI (`pip install "lightrag-hku[api]"`), da sorgente o tramite Docker Compose con file di ambiente preconfigurati. La comunità attiva mantiene Discord, WeChat, documentazione completa, esempi e video tutorial. Gli aggiornamenti recenti (supporto PostgreSQL, citazioni, eliminazioni, Neo4J) dimostrano uno sviluppo attivo.

## GrapheDeConnaissance

- HKUDS —a_créé→ LightRAG (TECHNOLOGIE, 0.99)
- LightRAG —observé_dans→ EMNLP2025 (EVENEMENT, 0.98)
- LightRAG —utilise→ dual-level retrieval (CONCEPT, 0.99)
- dual-level retrieval —utilise→ knowledge graphs (TECHNOLOGIE, 0.97)
- dual-level retrieval —utilise→ bases de données vectorielles (TECHNOLOGIE, 0.97)
- LightRAG —utilise→ RAG-Anything (TECHNOLOGIE, 0.95)
- RAG-Anything —permet→ traitement multimodal (CONCEPT, 0.93)
- LightRAG —utilise→ Neo4j (TECHNOLOGIE, 0.96)
- LightRAG —utilise→ PostgreSQL (TECHNOLOGIE, 0.96)
- LightRAG —recommande→ modèles 32B paramètres minimum (CONCEPT, 0.92)
- LightRAG —permet→ 6 modes de requête (CONCEPT, 0.95)
- HKUDS —utilise→ GitHub (TECHNOLOGIE, 0.97)
- LightRAG —mesure→ 22k étoiles GitHub (MESURE, 0.98)

---
Canonical: https://www.thekb.eu/it/fiches/lightrag-simple-fast-rag-hkuds-2024-10-08/
