Инновационная Поздняя Материализация для Улучшенного Обучения Последовательностей в Масштабируемых Системах Рекомендаций

В этой статье рассматривается новый подход к управлению историей взаимодействия пользователей в моделях рекомендаций глубокого обучения, акцентируя внимание на эффективности и масштабируемости.

5 min readТехнологии

В области систем рекомендаций глубокого обучения растет потребность в обработке ультра-длинных историй взаимодействия пользователей. Традиционные методы, особенно подход 'Fat Row', сталкиваются с серьезными проблемами из-за чрезмерной избыточности данных. Эта избыточность становится еще более заметной в многопользовательских средах, где модели с различными требованиями к длине последовательности работают с общим набором данных. Для решения этих проблем мы представляем стратегию поздней материализации с версионированием. Этот метод оптимизирует хранение, сохраняя истории взаимодействия пользователей в едином, нормализованном и неизменяемом формате, что позволяет в реальном времени восстанавливать последовательности во время обучения с помощью легких версионированных указателей. Наш подход поддерживает согласованность между онлайн и оффлайн данными с помощью двойного протокола, эффективно предотвращая утечку данных во время потокового и пакетного обучения. Кроме того, мы внедряем оптимизированный для чтения уровень хранения, который улучшает извлечение данных для разнообразных требований моделей. Используя раздельную предобработку данных и оптимизацию операций ввода/вывода, мы минимизируем задержку, связанную с восстановлением последовательностей, обеспечивая, чтобы обучение оставалось ограниченным GPU. Эта инновационная система не только снижает потребление ресурсов в инфраструктуре данных для обучения, но и способствует значительному улучшению производительности моделей, закладывая основу для продвинутых архитектур, таких как HSTU и ULTRA-HSTU.

Технологии