Datalab Lanza lift: Un Modelo de Visión de 9B Parámetros para la Extracción JSON de PDFs

Datalab presenta lift, un modelo de visión innovador diseñado para extraer datos JSON estructurados de PDFs utilizando esquemas, logrando alta precisión y eficiencia.

3 min readTecnología

Datalab ha lanzado lift, un modelo de visión con 9 mil millones de parámetros centrado en la extracción de datos estructurados. Al utilizar un esquema JSON como entrada, lift procesa PDFs e imágenes para generar un objeto JSON correspondiente. Este modelo marca la primera incursión de Datalab en tecnología de extracción dedicada, apoyándose en sus herramientas OCR de código abierto existentes como chandra, marker y surya. Con una precisión de campo del 90.2% en un conjunto de 225 documentos, lift se presenta como el modelo autoalojado más efectivo, procesando cada documento en un promedio de 9.5 segundos. El modelo admite documentos de varias páginas en una sola operación, permitiéndole leer valores a través de las páginas sin esfuerzo. Ofrece dos modos de inferencia: inferencia local a través de HuggingFace e inferencia remota a través de un servidor vLLM, siendo este último recomendado para entornos de producción. La arquitectura del modelo incorpora decodificación restringida por esquema, asegurando que la salida se adhiera a la estructura JSON especificada. Sin embargo, los usuarios deben tener cuidado con ciertos constructos de esquema que pueden no compilar correctamente, ya que esto puede llevar a una salida no estructurada. En general, lift se posiciona como una herramienta valiosa para extraer datos estructurados mientras minimiza el riesgo de generación de campos erróneos.

Tecnología