Структурированные аннотации играют важную роль в области биомедицинской литературы, улучшая эффективность поиска информации, текстовой обработки и синтеза знаний. Несмотря на их значимость, значительное количество аннотаций в базе данных PubMed остаются неструктурированными, что создает трудности для различных приложений текстовой обработки. Чтобы решить эту проблему, мы представляем Structured PubMed, обширный набор данных, содержащий аннотации биомедицинских исследований с метками по разделам, собранные из всей базы данных PubMed, включающей более 23,2 миллиона исследовательских статей. Набор данных делится на две основные группы: одна включает 5,9 миллиона аннотаций, структурированных авторами на основе официальных XML-файлов, а другая состоит из 17,2 миллиона аннотаций, которые изначально были неструктурированными, но были систематически помечены с помощью модели извлечения. Каждая запись соответствует стандартизированной пятиразделенной схеме и связана с соответствующим идентификатором PubMed, типом публикации и датой. Этот обширный набор данных предназначен для обучения моделей классификации предложений, оценки архитектур сегментации текста и выполнения извлечения информации по разделам на беспрецедентном уровне по всей базе данных PubMed.
Введение в Обширный Набор Данных Структурированных Биомедицинских Аннотаций
Статья представляет новый набор данных, направленный на улучшение обработки биомедицинской литературы с помощью структурированных аннотаций.
