El campo de la visión por computadora se ha dividido tradicionalmente en modelos generativos y discriminativos, con la creencia de que la habilidad para crear imágenes no se traduce en la comprensión de las mismas. Sin embargo, un estudio reciente de Google DeepMind desafía esta noción con la introducción de Vision Banana, un modelo versátil que sobresale en múltiples tareas de comprensión visual. Esto incluye segmentación semántica e instancia, así como estimación de profundidad métrica, mientras mantiene sus capacidades de generación de imágenes. El modelo subyacente, Nano Banana Pro, sirve como base, donde un proceso único de ajuste de instrucciones integra datos mínimos de visión por computadora en su entrenamiento. Este enfoque permite a Vision Banana aprovechar su entrenamiento generativo para comprender conceptos visuales esenciales como la profundidad y las relaciones entre objetos. El diseño del modelo elimina la necesidad de componentes especializados para diferentes tareas, produciendo salidas como imágenes RGB que pueden ser fácilmente interpretadas. En pruebas de referencia, Vision Banana ha mostrado resultados impresionantes, superando modelos especializados como SAM 3 y Depth Anything V3 en varias tareas, todo sin requerir datos de entrenamiento del mundo real ni parámetros de cámara. Este avance representa un gran salto en la forma de abordar las tareas visuales, enfatizando el potencial de los modelos generativos en la comprensión de datos visuales.
Google DeepMind Presenta Vision Banana: Un Generador de Imágenes Unificado que Supera en Segmentación y Estimación de Profundidad
Google DeepMind ha lanzado Vision Banana, un generador de imágenes innovador que supera a los modelos existentes en diversas tareas visuales, incluyendo segmentación y estimación de profundidad.
