NVIDIA Research запустила SpatialClaw, новаторскую платформу, позволяющую проводить пространственное рассуждение без необходимости в обучении. Эта инновация решает заметный пробел в моделях визуально-языкового понимания (VLM), которые часто испытывают трудности с пониманием расположения объектов, их взаимосвязей и движений в трехмерном пространстве. В отличие от традиционных моделей, SpatialClaw изменяет интерфейс действий, используемый агентами для доступа к инструментам восприятия, предполагая, что сам интерфейс является ограничивающим фактором. Обрабатывая код как этот интерфейс, SpatialClaw достигает впечатляющей средней точности 59,9% по 20 тестовым заданиям, превосходя производительность недавнего пространственного агента SpaceTools на 11,2 пункта.
SpatialClaw работает через состояние Python-ядра, предварительно загруженного входными кадрами и различными примитивами. Он использует инструменты восприятия, которые являются стандартными функциями Python, производя такие выходные данные, как маски и карты глубины. Платформа разработана как свободная от обучения, поддерживая последовательные подсказки и наборы инструментов во всех оценках. Исследовательская группа провела обширные испытания в нескольких категориях, продемонстрировав значительные улучшения по сравнению с базовыми моделями. Результаты подчеркивают эффективность SpatialClaw, особенно в динамических задачах, требующих сложного геометрического рассуждения, что делает его ценным инструментом для приложений в робототехнике, видеоанализе и понимании внутренних сцен.
