Le domaine de la vision par ordinateur a traditionnellement été divisé en modèles génératifs et discriminatifs, avec la conviction que la capacité à créer des images ne signifie pas comprendre les images. Cependant, une étude récente de Google DeepMind remet en question cette notion avec l'introduction de Vision Banana, un modèle polyvalent qui excelle dans plusieurs tâches de compréhension visuelle. Cela inclut la segmentation sémantique et d'instance, ainsi que l'estimation de profondeur métrique, tout en maintenant ses capacités de génération d'images. Le modèle sous-jacent, Nano Banana Pro, sert de base, où un processus unique d'ajustement d'instructions intègre des données minimales de vision par ordinateur dans son entraînement. Cette approche permet à Vision Banana de tirer parti de son entraînement génératif pour saisir des concepts visuels essentiels tels que la profondeur et les relations entre objets. La conception du modèle élimine le besoin de composants spécialisés pour différentes tâches, produisant plutôt des sorties sous forme d'images RVB facilement interprétables. Dans les tests de référence, Vision Banana a montré des résultats impressionnants, surpassant des modèles spécialisés comme SAM 3 et Depth Anything V3 dans diverses tâches, le tout sans nécessiter de données d'entraînement du monde réel ni de paramètres de caméra. Cette avancée représente un bond majeur dans la manière d'aborder les tâches visuelles, soulignant le potentiel des modèles génératifs dans la compréhension des données visuelles.
Google DeepMind Présente Vision Banana : Un Générateur d'Images Unifié Performant en Segmentation et Estimation de Profondeur
Google DeepMind a lancé Vision Banana, un générateur d'images révolutionnaire qui surpasse les modèles existants dans diverses tâches visuelles, y compris la segmentation et l'estimation de profondeur.
