NVIDIA Presenta SpatialClaw: Un Agente Innovador para el Razonamiento Espacial Sin Entrenamiento

NVIDIA Research ha lanzado SpatialClaw, un marco revolucionario diseñado para el razonamiento espacial, abordando las limitaciones de los modelos de visión-lenguaje.

3 min readTecnología

NVIDIA Research ha introducido SpatialClaw, un marco innovador que permite el razonamiento espacial sin necesidad de entrenamiento. Esta innovación aborda una notable brecha en los modelos de visión-lenguaje (VLM), que a menudo luchan por comprender las ubicaciones, relaciones y movimientos de los objetos en el espacio tridimensional. A diferencia de los modelos tradicionales, SpatialClaw modifica la interfaz de acción utilizada por los agentes para acceder a herramientas de percepción, sugiriendo que la propia interfaz es un factor limitante. Al tratar el código como esta interfaz, SpatialClaw logra una impresionante precisión promedio del 59.9% en 20 benchmarks, superando el rendimiento del reciente agente espacial SpaceTools por 11.2 puntos.

SpatialClaw opera a través de un núcleo de Python con estado, precargado con imágenes de entrada y varias primitivas. Utiliza herramientas de percepción que son funciones estándar de Python, produciendo salidas como máscaras y mapas de profundidad. El marco está diseñado para ser libre de entrenamiento, manteniendo indicaciones y conjuntos de herramientas consistentes a través de todas las evaluaciones. El equipo de investigación realizó pruebas exhaustivas en múltiples categorías, demostrando mejoras significativas sobre los modelos base. Los resultados destacan la efectividad de SpatialClaw, especialmente en tareas dinámicas que requieren razonamiento geométrico complejo, convirtiéndolo en una herramienta valiosa para aplicaciones en robótica, análisis de video y comprensión de escenas interiores.

Tecnología