# lightrag-simple-fast-rag-hkuds-2024-10-08

## Veille

LightRAG - RAG Simple y Rápido - Grafos de Conocimiento - Recuperación de Doble Nivel - EMNLP2025 - GitHub

## Titre Article

HKUDS/LightRAG: [EMNLP2025] "LightRAG: Simple and Fast Retrieval-Augmented Generation"

## Date

2024-10-08

## URL

https://github.com/HKUDS/LightRAG

## Keywords

knowledge-graph, gpt, rag, gpt-4, large-language-models, llm, genai, retrieval-augmented-generation, graphrag, dual-level retrieval, vector storage, Neo4j, PostgreSQL, Faiss, document processing, multimodal RAG, EMNLP2025

## Authors

Zirui Guo, Lianghao Xia, Yanhua Yu, Tu Ao, Chao Huang (HKUDS - Hong Kong University Data Science)

## Ton

**Perfil**: Técnico-académico, voz institucional de investigación, registro descriptivo-técnico, nivel experto.

**Descripción**: Los investigadores de HKUDS adoptan el tono de un repositorio académico de GitHub que combina documentación técnica con un posicionamiento propio de artículo de investigación (aceptado en EMNLP 2025). El lenguaje especializado en ML/IA (recuperación de doble nivel, grafos de conocimiento, almacenamiento vectorial) se dirige a investigadores y profesionales. La estructura típica de proyecto de código abierto (README, ejemplos, benchmarks) facilita la adopción. El tono técnico y objetivo evita el discurso de marketing en favor de la demostración de capacidades. Es característico de las publicaciones académicas de código (estilo HuggingFace, Papers with Code) que vinculan las contribuciones de investigación con la implementación práctica, dirigidas a la comunidad de ML.

## Pense-betes

- **22k** **estrellas** en GitHub, **3.3k forks**, licencia MIT
- Presentación en **EMNLP 2025** (conferencia de referencia en PLN)
- **Recuperación de doble nivel**: combinación de grafos de conocimiento + bases de datos vectoriales
- Soporte **multimodal** vía RAG-Anything (texto, imágenes, tablas, ecuaciones)
- **Más de 25 parámetros de configuración** para una personalización fina
- Recomendaciones de LLM: **mínimo 32 mil millones de parámetros**, contexto de **32KB+** (64KB ideal)
- **6 modos de consulta**: local, global, híbrido, naive, mix, bypass
- Soporte de **múltiples almacenamientos**: PostgreSQL, Neo4j, Redis, MongoDB, Milvus, Qdrant, Faiss
- Integración con **RAG-Anything** para el procesamiento de documentos (PDF, PPT, CSV)
- **Gestión avanzada**: eliminación por ID de documento, por nombre de entidad
- **Respuestas en streaming** e historial de conversación
- Soporte de **citas** para la atribución de fuentes
- **Docker Compose** disponible para un despliegue rápido
- Comunidad activa: Discord, WeChat, documentación exhaustiva

## RésuméDe400mots

LightRAG es un sistema de Generación Aumentada por Recuperación (RAG) desarrollado por HKUDS (Hong Kong University Data Science) que se presentará en EMNLP 2025, una conferencia de referencia en procesamiento del lenguaje natural. Con **22k** **estrellas** en GitHub y bajo licencia MIT, el proyecto tiene como objetivo simplificar y acelerar la extracción de conocimiento y las consultas inteligentes mediante un enfoque innovador que combina grafos de conocimiento y bases de datos vectoriales.

**Arquitectura de recuperación de doble nivel**

La innovación central de LightRAG reside en su sistema de "recuperación de doble nivel", que fusiona dos enfoques complementarios: grafos de conocimiento para capturar las relaciones estructurales entre entidades, y bases de datos vectoriales para la búsqueda semántica. Esta hibridación ofrece **seis modos de consulta distintos** (local, global, híbrido, naive, mix, bypass) que adaptan la estrategia de recuperación al contexto y a las necesidades específicas.

**Soporte multimodal y múltiples formatos**

La reciente integración con RAG-Anything amplía considerablemente las capacidades de procesamiento de documentos. El sistema ahora gestiona de forma fluida texto, imágenes, tablas y ecuaciones procedentes de diversos formatos (PDF, DOC, PPT, CSV). Este enfoque multimodal convierte a LightRAG en una solución completa para la extracción de conocimiento a partir de documentos empresariales heterogéneos.

**Flexibilidad de almacenamiento y escalabilidad**

LightRAG admite una arquitectura de almacenamiento modular de cuatro niveles: almacenamiento KV para el caché del LLM y los fragmentos de texto (JSON, PostgreSQL, Redis, MongoDB), almacenamiento vectorial para los embeddings (NanoVectorDB, Milvus, Chroma, Faiss, Qdrant, PostgreSQL, MongoDB), almacenamiento de grafos para el grafo entidad-relación (NetworkX, Neo4J, PostgreSQL, AGE), y almacenamiento del estado de los documentos para el seguimiento del procesamiento. Esta flexibilidad permite elegir el backend óptimo según los requisitos de rendimiento e infraestructura. Para producción de alto rendimiento, se recomienda Neo4J como base de datos de grafos.

**Requisitos y recomendaciones de LLM**

Las especificaciones recomendadas reflejan la sofisticación del sistema: un LLM con **un mínimo de 32 mil millones de parámetros** y una longitud de contexto de **32KB** (64KB preferible) para optimizar la extracción de relaciones entre entidades. Se sugieren modelos de embedding multilingües reconocidos como BAAI/bge-m3 y text-embedding-3-large. El sistema admite OpenAI (GPT-4o, GPT-4o-mini), Ollama para modelos locales, y Hugging Face.

**Configuración avanzada y personalización**

LightRAG expone **más de 25 parámetros de inicialización** que ofrecen un control granular: tamaño de fragmento (1200 tokens por defecto), bucles de extracción de entidades (1 por defecto), tamaño de lote de embeddings (32 por defecto), parámetros de caché del LLM, y presupuestos de tokens para entidades, relaciones y contexto total. Esta configurabilidad permite ajustar con precisión el compromiso entre rendimiento y coste.

**Funcionalidades avanzadas y gestión**

El sistema ofrece capacidades sofisticadas: eliminación de documentos por ID, eliminación de entidades por nombre (manteniendo la coherencia grafo/vector), soporte de citas para la atribución de fuentes, respuestas en streaming, seguimiento del historial conversacional, e inserción de grafos de conocimiento personalizados. La arquitectura asíncrona (asyncio) garantiza el rendimiento y la escalabilidad.

**Despliegue y comunidad**

Instalación flexible vía PyPI (`pip install "lightrag-hku[api]"`), desde el código fuente, o vía Docker Compose con archivos de entorno preconfigurados. La comunidad activa mantiene Discord, WeChat, documentación exhaustiva, ejemplos y vídeos tutoriales. Las actualizaciones recientes (soporte de PostgreSQL, citas, eliminaciones, Neo4J) demuestran un desarrollo activo.

## GrapheDeConnaissance

- HKUDS —a_créé→ LightRAG (TECHNOLOGIE, 0.99)
- LightRAG —observé_dans→ EMNLP2025 (EVENEMENT, 0.98)
- LightRAG —utilise→ dual-level retrieval (CONCEPT, 0.99)
- dual-level retrieval —utilise→ knowledge graphs (TECHNOLOGIE, 0.97)
- dual-level retrieval —utilise→ bases de données vectorielles (TECHNOLOGIE, 0.97)
- LightRAG —utilise→ RAG-Anything (TECHNOLOGIE, 0.95)
- RAG-Anything —permet→ traitement multimodal (CONCEPT, 0.93)
- LightRAG —utilise→ Neo4j (TECHNOLOGIE, 0.96)
- LightRAG —utilise→ PostgreSQL (TECHNOLOGIE, 0.96)
- LightRAG —recommande→ modèles 32B paramètres minimum (CONCEPT, 0.92)
- LightRAG —permet→ 6 modes de requête (CONCEPT, 0.95)
- HKUDS —utilise→ GitHub (TECHNOLOGIE, 0.97)
- LightRAG —mesure→ 22k étoiles GitHub (MESURE, 0.98)

---
Canonical: https://www.thekb.eu/es/fiches/lightrag-simple-fast-rag-hkuds-2024-10-08/
