Google a lancé Gemini Embedding 2, une mise à jour majeure de sa série de modèles Gemini, qui se concentrait auparavant uniquement sur le texte. Ce nouveau modèle répond aux défis de stockage à haute dimension et de récupération intermodale, essentiels pour les développeurs travaillant sur des systèmes avancés de génération augmentée par récupération (RAG). Gemini Embedding 2 représente un changement de paradigme en permettant à cinq types de médias différents—Texte, Image, Vidéo, Audio et PDF—d'être représentés dans un espace vectoriel unifié et à haute dimension. Cette avancée élimine le besoin de modèles séparés pour chaque type de données, rationalisant le processus d'embedding. Le modèle prend en charge des entrées intercalées, permettant aux développeurs de combiner divers types de médias dans une seule demande, améliorant ainsi la compréhension du contexte. Les limites d'entrée incluent 8 192 tokens pour le texte, six images, 120 secondes de vidéo, 80 secondes d'audio et six pages de PDF. Pour améliorer l'efficacité, Gemini Embedding 2 utilise l'apprentissage de représentation Matryoshka (MRL), qui priorise les informations sémantiques critiques dans les premières dimensions du vecteur, permettant une troncature efficace sans perte significative de précision. Les performances du modèle ont été validées par rapport au Massive Text Embedding Benchmark (MTEB), montrant des améliorations en précision de récupération et robustesse dans des domaines spécialisés. Avec une fenêtre d'entrée de 8 192 tokens, il gère efficacement de plus grands segments de texte, réduisant la fragmentation du contexte dans les applications RAG.
Google AI Présente Gemini Embedding 2 : Un Modèle Multimodal Complet
Gemini Embedding 2 améliore la famille de modèles Gemini, permettant une intégration fluide de divers types de médias dans un cadre d'embedding unique.
