Los resúmenes estructurados son fundamentales en la literatura biomédica, ya que mejoran la eficiencia en la recuperación de información, la minería de texto y la síntesis del conocimiento. Sin embargo, una gran cantidad de resúmenes en la base de datos de PubMed siguen siendo no estructurados, lo que crea desafíos para diversas aplicaciones de procesamiento de texto. Para abordar este problema, presentamos Structured PubMed, un conjunto de datos completo que contiene resúmenes biomédicos etiquetados por secciones, extraídos de toda la base de datos de PubMed, que incluye más de 23.2 millones de artículos de investigación. El conjunto de datos se divide en dos grupos principales: uno que presenta 5.9 millones de resúmenes organizados por los autores a partir de archivos XML oficiales, y otro que comprende 17.2 millones de resúmenes que inicialmente eran no estructurados pero que han sido etiquetados sistemáticamente mediante un modelo de lenguaje. Cada registro sigue un formato estandarizado de cinco secciones y está vinculado a su identificador de PubMed, tipo de publicación y fecha. Este extenso conjunto de datos está diseñado para facilitar el entrenamiento de modelos de clasificación de oraciones, evaluar sistemas de segmentación de texto y permitir la extracción de información a gran escala, específica por secciones, en toda la base de datos de PubMed.
Presentación de un Conjunto de Datos Completo de Resúmenes Biomédicos Estructurados
Este artículo presenta un nuevo conjunto de datos destinado a mejorar el procesamiento de la literatura biomédica mediante resúmenes estructurados.
