# numind-nuextract-foundation-model-structured-extraction-2024-06-24

## Veille

NuExtract NuMind - modelo fundacional para extracción estructurada en JSON, formato compacto

## Titre Article

NuExtract: A Foundation Model for Structured Extraction

## Date

2024-06-24

## URL

https://numind.ai/blog/nuextract-a-foundation-model-for-structured-extraction

## Keywords

extracción estructurada, JSON, modelo de lenguaje, NLP, fine-tuning, LLM compacto, código abierto, MIT, zero-shot

## Authors

Alexandre Constantin, Liam Cripwell, Etienne Bernard

## Ton

Perfil: artículo de blog corporativo técnico, registro científico divulgativo, perspectiva de investigación aplicada.
Estilo: tono entusiasta pero riguroso, respaldado por métricas comparativas precisas. Utiliza comparaciones numéricas contundentes (100 veces más pequeño, 35 veces más eficiente) para demostrar la propuesta de valor. Autoridad basada en la metodología y los benchmarks. Público objetivo: profesionales de ML, desarrolladores de NLP, responsables técnicos de decisiones que evalúan soluciones de extracción.

## Pense-betes

- Modelos de 0,5B a 7B parámetros que rivalizan con LLMs 100 veces más grandes
- NuExtract-tiny supera a GPT-3.5 siendo 100 veces más pequeño
- NuExtract-large logra la equivalencia con GPT-4o con 100 veces menos parámetros
- Conjunto de datos de entrenamiento: 50.000 ejemplos generados a partir de C4 con Llama 3 70B
- Profundidad del árbol de extracción de hasta 9 niveles jerárquicos
- Licencia MIT - código abierto
- Funciona en modo zero-shot o con fine-tuning especializado
- Casos de uso: historiales médicos, documentos legales, informes financieros
- Ventajas: costos de inferencia reducidos, despliegue local/privado posible

## RésuméDe400mots

NuMind presenta NuExtract, un modelo de lenguaje especializado en convertir texto en datos JSON estructurados. La innovación principal reside en la creación de modelos compactos (de 0,5 mil millones a 7 mil millones de parámetros) que igualan o superan el rendimiento de LLMs genéricos cien veces más grandes.

El modelo destaca en la extracción de información compleja a partir de documentos variados, organizando los datos de forma jerárquica. Los casos de uso típicos incluyen el análisis de historiales médicos, documentos legales e informes financieros. NuExtract puede funcionar en modo zero-shot para tareas generales o ser afinado (fine-tuned) para problemas empresariales específicos.

La metodología de creación del conjunto de datos es un elemento clave del éxito. El equipo aprovechó 300.000 textos en inglés del conjunto de datos C4, utilizando Llama 3 70B para generar plantillas de extracción y anotaciones. Este proceso produjo 50.000 ejemplos de entrenamiento de calidad, con árboles de extracción que alcanzan hasta 9 niveles de profundidad jerárquica.

Los resultados de rendimiento demuestran la eficacia del enfoque. NuExtract-tiny supera a GPT-3.5 a pesar de ser 100 veces más pequeño. La versión estándar de NuExtract supera a Llama3-70B siendo 35 veces más compacta. NuExtract-large logra la equivalencia con GPT-4o con un factor de reducción de tamaño de 100.

Estos resultados abren ventajas prácticas considerables en comparación con las alternativas propietarias. Los costos de inferencia se reducen drásticamente gracias al tamaño compacto de los modelos. El despliegue local o privado se vuelve viable, cumpliendo con los requisitos de confidencialidad de numerosas organizaciones. La capacidad de fine-tuning facilita la adaptación del modelo a dominios específicos sin experiencia profunda en ML.

El modelo se distribuye bajo licencia MIT, lo que permite su uso libre en contextos comerciales y de investigación. Este enfoque de código abierto posiciona a NuExtract como una alternativa creíble frente a las APIs de extracción propietarias, en particular para organizaciones preocupadas por controlar sus costos y sus datos.

El artículo ilustra una tendencia importante: los modelos especializados de tamaño modesto pueden rivalizar con los gigantes generalistas en tareas específicas, abriendo el camino a despliegues más económicos y soberanos.

## GrapheDeConnaissance

- NuMind —a_créé→ NuExtract (TECHNOLOGIE, 0.98)
- NuExtract —permet→ extraction structurée JSON (CONCEPT, 0.97)
- NuExtract-tiny —surpasse→ GPT-3.5 (TECHNOLOGIE, 0.95)
- NuExtract-large —converge_avec→ GPT-4o (TECHNOLOGIE, 0.93)
- NuExtract —est_basé_sur→ Llama 3 70B (TECHNOLOGIE, 0.9)
- NuExtract —utilise→ dataset C4 (TECHNOLOGIE, 0.92)
- NuExtract —utilise→ licence MIT (CONCEPT, 0.98)
- Alexandre Constantin —a_créé→ NuExtract (TECHNOLOGIE, 0.95)
- Liam Cripwell —a_créé→ NuExtract (TECHNOLOGIE, 0.95)
- Etienne Bernard —a_créé→ NuExtract (TECHNOLOGIE, 0.95)
- NuExtract —réduit→ coûts d'inférence (CONCEPT, 0.9)
- modèles spécialisés compacts —concurrence→ LLM généralistes (CONCEPT, 0.88)

---
Canonical: https://www.thekb.eu/es/fiches/numind-nuextract-foundation-model-structured-extraction-2024-06-24/
