Google ha lanzado Gemini Embedding 2, una actualización significativa de su serie de modelos Gemini, que anteriormente se centraba solo en texto. Este nuevo modelo aborda los desafíos de almacenamiento de alta dimensión y recuperación intermodal, esenciales para los desarrolladores que trabajan en sistemas avanzados de Generación Aumentada por Recuperación (RAG). Gemini Embedding 2 representa un cambio de paradigma al permitir que cinco tipos de medios diferentes—Texto, Imagen, Video, Audio y PDF—se representen dentro de un espacio vectorial unificado y de alta dimensión. Este avance elimina la necesidad de modelos separados para cada tipo de dato, optimizando el proceso de embedding. El modelo admite entradas entrelazadas, permitiendo a los desarrolladores combinar varios tipos de medios en una sola solicitud, mejorando así la comprensión del contexto. Los límites de entrada incluyen 8,192 tokens para texto, seis imágenes, 120 segundos de video, 80 segundos de audio y seis páginas de PDF. Para mejorar la eficiencia, Gemini Embedding 2 emplea el Aprendizaje de Representación Matryoshka (MRL), que prioriza la información semántica crítica en las primeras dimensiones del vector, permitiendo una truncamiento efectiva sin pérdida significativa de precisión. El rendimiento del modelo ha sido validado en comparación con el Massive Text Embedding Benchmark (MTEB), mostrando mejoras en precisión de recuperación y robustez en dominios especializados. Con una ventana de entrada de 8,192 tokens, maneja eficazmente segmentos de texto más grandes, reduciendo la fragmentación del contexto en aplicaciones RAG.
Google AI Presenta Gemini Embedding 2: Un Modelo Multimodal Integral
Gemini Embedding 2 mejora la familia de modelos Gemini, permitiendo la integración fluida de varios tipos de medios en un único marco de embedding.
