PulseBench-Tab es un nuevo benchmark diseñado para evaluar la extracción de tablas de imágenes de documentos en diversos idiomas. Este recurso presenta 1,820 tablas meticulosamente anotadas por humanos, abarcando 9 idiomas diferentes y 4 sistemas de escritura, incluyendo latino, CJK, árabe y cirílico. Las tablas provienen de 380 documentos auténticos, como estados financieros, informes gubernamentales y divulgaciones regulatorias. Varían significativamente en tamaño, con conteos de celdas que van de 2 a 1,183, y casi la mitad de ellas (48.1%) incluyen celdas fusionadas o que abarcan. Para facilitar la evaluación, introducimos T-LAG (Table Logical Adjacency Graph), una métrica innovadora que representa las tablas como grafos dirigidos basados en las adyacencias de las celdas. Esta métrica permite evaluar tanto la integridad estructural como la precisión del contenido mediante un emparejamiento bipartito óptimo, produciendo una puntuación de evaluación integral. Hemos probado 9 sistemas de extracción de tablas, tanto comerciales como de código abierto, utilizando este benchmark, y hemos proporcionado resultados detallados para cada idioma. El conjunto completo de datos, el código de evaluación y las salidas de todos los sistemas probados están disponibles para el público.
Presentamos PulseBench-Tab: Un Benchmark Multilingüe Integral para la Extracción de Tablas
PulseBench-Tab proporciona un marco sólido para evaluar las capacidades de extracción de tablas en varios idiomas y scripts.
