Datalab Lance lift : Un Modèle de Vision de 9 Milliards de Paramètres pour l'Extraction JSON des PDF

Datalab présente lift, un modèle de vision innovant conçu pour extraire des données JSON structurées des PDF en utilisant des schémas, atteignant une grande précision et efficacité.

3 min readTechnologie

Datalab a lancé lift, un modèle de vision de 9 milliards de paramètres axé sur l'extraction de données structurées. En utilisant un schéma JSON comme entrée, lift traite les PDF et les images pour générer un objet JSON correspondant. Ce modèle marque la première incursion de Datalab dans la technologie d'extraction dédiée, s'appuyant sur leurs outils OCR open-source existants tels que chandra, marker et surya. Avec une précision de champ de 90,2 % sur un ensemble de 225 documents, lift est présenté comme le modèle auto-hébergé le plus efficace, traitant chaque document en moyenne en 9,5 secondes. Le modèle prend en charge les documents multi-pages en une seule opération, lui permettant de lire des valeurs à travers les pages sans effort. Il propose deux modes d'inférence : l'inférence locale via HuggingFace et l'inférence distante via un serveur vLLM, ce dernier étant recommandé pour les environnements de production. L'architecture du modèle intègre un décodage contraint par schéma, garantissant que la sortie respecte la structure JSON spécifiée. Cependant, les utilisateurs doivent être prudents avec certains éléments de schéma qui peuvent ne pas se compiler correctement, car cela peut entraîner une sortie non structurée. Dans l'ensemble, lift est positionné comme un outil précieux pour extraire des données structurées tout en minimisant le risque de génération de champs erronés.

Technologie