NVIDIA Présente SpatialClaw : Un Agent Innovant pour le Raisonnement Spatial Sans Entraînement

NVIDIA Research a lancé SpatialClaw, un cadre révolutionnaire conçu pour le raisonnement spatial, répondant aux limites des modèles de vision-langage.

3 min readTechnologie

NVIDIA Research a introduit SpatialClaw, un cadre novateur qui permet le raisonnement spatial sans nécessiter d'entraînement. Cette innovation aborde une lacune notable dans les modèles de vision-langage (VLM), qui ont souvent du mal à comprendre les emplacements, les relations et les mouvements des objets dans l'espace tridimensionnel. Contrairement aux modèles traditionnels, SpatialClaw modifie l'interface d'action utilisée par les agents pour accéder aux outils de perception, suggérant que l'interface elle-même est un facteur limitant. En considérant le code comme cette interface, SpatialClaw atteint une précision moyenne impressionnante de 59,9 % sur 20 benchmarks, surpassant la performance de l'agent spatial récent SpaceTools de 11,2 points.

SpatialClaw fonctionne à travers un noyau Python à état, préchargé avec des images d'entrée et diverses primitives. Il utilise des outils de perception qui sont des fonctions Python standard, produisant des sorties telles que des masques et des cartes de profondeur. Le cadre est conçu pour être sans entraînement, maintenant des invites et des ensembles d'outils cohérents à travers toutes les évaluations. L'équipe de recherche a mené des tests approfondis dans plusieurs catégories, démontrant des améliorations significatives par rapport aux modèles de base. Les résultats soulignent l'efficacité de SpatialClaw, en particulier dans les tâches dynamiques nécessitant un raisonnement géométrique complexe, en faisant un outil précieux pour des applications en robotique, analyse vidéo et compréhension de scènes intérieures.

Technologie