Google DeepMind Представляет Vision Banana: Унифицированный Генератор Изображений, Превосходящий Специализированные Модели в Сегментации и Оценке Глубины

Google DeepMind представила Vision Banana, революционный генератор изображений, который превосходит существующие модели в различных визуальных задачах, включая сегментацию и оценку глубины.

5 min readТехнологии

Область компьютерного зрения традиционно делится на генеративные и дискриминационные модели, с убеждением, что умение создавать изображения не означает понимания их. Однако недавнее исследование Google DeepMind ставит под сомнение это мнение, представляя Vision Banana, универсальную модель, которая превосходит в нескольких задачах визуального понимания. Это включает семантическую и инстанс-сегментацию, а также оценку метрической глубины, сохраняя свои возможности генерации изображений. Основная модель, Nano Banana Pro, служит основой, где уникальный процесс настройки инструкций интегрирует минимальные данные компьютерного зрения в обучение. Этот подход позволяет Vision Banana использовать свое генеративное обучение для понимания основных визуальных концепций, таких как глубина и взаимосвязи объектов. Дизайн модели исключает необходимость в специализированных компонентах для различных задач, вместо этого производя выходные данные в виде RGB-изображений, которые легко интерпретировать. В тестах на эталонах Vision Banana показала впечатляющие результаты, превосходя специализированные модели, такие как SAM 3 и Depth Anything V3 в различных задачах, не требуя данных реального мира или параметров камеры. Этот прогресс знаменует собой значительный шаг вперед в подходе к визуальным задачам, подчеркивая потенциал генеративных моделей в понимании визуальных данных.

Технологии