Создание обучающих наборов данных для извлечения ключевой информации (KIE) традиционно является трудоемким процессом. Чтобы решить эту проблему, мы представляем DocAnnot, инновационную платформу, предназначенную для ускорения создания наборов данных KIE. Используя Большую Модель Языка и Визуализации (LVLM) для извлечения значений меток и Оптическое Распознавание Символов (OCR) для обнаружения текста и ограничивающих рамок, DocAnnot повышает эффективность генерации наборов данных. Ключевой особенностью нашего подхода является алгоритм Пространственно Информированного Контекстуального Сопоставления (SICM), который улучшает точность ассоциаций меток и значений, объединяя пространственные отношения с текстовыми данными. Мы протестировали DocAnnot на бенчмарках CORD и SROIE, достигнув впечатляющих F1-оценок 0,679 и 0,846 соответственно. Кроме того, мы исследовали возможность использования автоматически сгенерированных аннотаций для дообучения моделей KIE. Хотя данные, аннотированные людьми, по-прежнему превосходят наши автоматизированные результаты, модели, обученные исключительно на аннотациях DocAnnot, такие как LayoutLMv3, продемонстрировали достойные результаты с F1-оценкой 0,6765 на CORD. Эта платформа не только минимизирует потребность в ручной аннотации, но и позволяет эффективно дорабатывать результаты с помощью человеческих рецензентов, что приводит к высококачественным аннотациям. Автоматизация, предлагаемая DocAnnot, обеспечивает значительную экономию времени и средств, что делает ее важным инструментом для быстрого развития моделей в условиях ограниченных ресурсов.
DocAnnot: Ускорение Создания Наборов Данных для Извлечения Ключевой Информации с Помощью GenAI
DocAnnot революционизирует процесс генерации наборов данных для извлечения ключевой информации, используя передовые технологии ИИ, значительно сокращая время и усилия.
