Последняя разработка NVIDIA, ProRL Agent, предлагает масштабируемую платформу, предназначенную для обучения с подкреплением (RL) многоходовых агентов больших языковых моделей (LLM). Эта система использует модель 'Rollout-as-a-Service', эффективно отделяя оркестрацию развертывания агентов от цикла обучения. Это разделение решает конфликтующие требования ресурсов для взаимодействий с окружающей средой, требующих много ввода-вывода, и обновлений политик, требующих много вычислений на GPU, что стало значительным узким местом в разработке агентов.
Традиционные платформы, такие как SkyRL и VeRL-Tool, интегрируют контроль развертывания в процесс обучения, что приводит к двум основным проблемам: конфликтующим требованиям системы и трудностям в обслуживании. ProRL Agent работает независимо как HTTP-сервис, позволяя тренерам RL взаимодействовать с ним через API, оставаясь при этом независимым от подлежащей инфраструктуры.
Система использует асинхронный конвейер из трех этапов для развертываний: инициализация, выполнение и оценка, позволяя перекрытие фаз для повышения производительности. Кроме того, ProRL Agent использует Singularity для создания песочниц, оптимизируя задержку выполнения инструментов и обеспечивая совместимость с высокопроизводительными вычислительными средами. Экспериментальные результаты показывают значительные улучшения в производительности моделей Qwen3, демонстрируя эффективность системы в различных областях.
