La dernière innovation de NVIDIA, ProRL Agent, propose un cadre évolutif conçu pour l'apprentissage par renforcement (RL) des agents de modèles de langage de grande taille (LLM) multi-tours. Ce système adopte un modèle 'Rollout-as-a-Service', séparant efficacement l'orchestration des déploiements d'agents de la boucle d'entraînement. Cette séparation répond aux exigences conflictuelles des interactions environnementales lourdes en I/O et des mises à jour de politique intensives en GPU, qui ont constitué un goulot d'étranglement significatif dans le développement des agents.
Les cadres traditionnels, tels que SkyRL et VeRL-Tool, intègrent le contrôle des déploiements dans le processus d'entraînement, entraînant deux principaux défis : des exigences système conflictuelles et des difficultés de maintenance. ProRL Agent fonctionne indépendamment en tant que service HTTP, permettant aux formateurs RL d'interagir avec lui via une API, restant ainsi indifférent à l'infrastructure sous-jacente.
Le système utilise un pipeline asynchrone en trois étapes pour les déploiements : initialisation, exécution et évaluation, permettant le chevauchement des phases pour améliorer le débit. De plus, ProRL Agent exploite Singularity pour le sandboxing, optimisant la latence d'exécution des outils et garantissant la compatibilité avec les environnements de calcul haute performance. Les résultats expérimentaux indiquent des améliorations significatives des performances pour les modèles Qwen3, démontrant l'efficacité du système dans divers domaines.
