NVIDIA AI Presenta ProRL Agent: Una Nueva Infraestructura para el Aprendizaje por Refuerzo

NVIDIA ha lanzado ProRL Agent, una infraestructura innovadora destinada a mejorar el proceso de entrenamiento de aprendizaje por refuerzo para agentes LLM de múltiples turnos.

5 min readTecnología

La última innovación de NVIDIA, ProRL Agent, ofrece un marco escalable diseñado para el entrenamiento de aprendizaje por refuerzo (RL) de agentes de modelos de lenguaje de gran tamaño (LLM) de múltiples turnos. Este sistema adopta un modelo de 'Rollout-as-a-Service', separando efectivamente la orquestación de los despliegues de agentes del ciclo de entrenamiento. Esta separación aborda las demandas de recursos conflictivas de las interacciones ambientales intensivas en I/O y las actualizaciones de políticas intensivas en GPU, que han sido un cuello de botella significativo en el desarrollo de agentes.

Los marcos tradicionales, como SkyRL y VeRL-Tool, integran el control de despliegues dentro del proceso de entrenamiento, lo que lleva a dos desafíos principales: requisitos del sistema conflictivos y dificultades de mantenimiento. ProRL Agent opera de manera independiente como un servicio HTTP, permitiendo a los entrenadores de RL interactuar con él a través de una API, manteniéndose así indiferente a la infraestructura subyacente.

El sistema emplea un pipeline asíncrono de tres etapas para los despliegues: inicialización, ejecución y evaluación, permitiendo la superposición de fases para mejorar el rendimiento. Además, ProRL Agent utiliza Singularity para el sandboxing, optimizando la latencia de ejecución de herramientas y asegurando la compatibilidad con entornos de computación de alto rendimiento. Los resultados experimentales indican mejoras significativas en el rendimiento de los modelos Qwen3, demostrando la eficacia del sistema en diversos dominios.

Tecnología