Microsoft a introduit Harrier-OSS-v1, une collection de trois modèles d'embedding de texte multilingues conçus pour offrir des représentations sémantiques supérieures dans plusieurs langues. Cette sortie comprend des modèles de différentes tailles : 270 millions de paramètres, 0,6 milliard de paramètres et 27 milliards de paramètres. Les modèles Harrier-OSS-v1 ont atteint des performances de pointe sur le Multilingual MTEB (Massive Text Embedding Benchmark) v2, marquant une avancée significative dans la technologie de récupération open-source. Contrairement aux modèles d'encodeurs bidirectionnels traditionnels comme BERT, Harrier-OSS-v1 utilise des architectures uniquement décodeurs, qui traitent le contexte différemment. Chaque jeton dans ces modèles ne peut faire référence qu'aux jetons précédents, utilisant le pooling du dernier jeton pour créer une représentation vectorielle unique de l'entrée. Une caractéristique notable de ces modèles est leur capacité à gérer des entrées longues, avec une fenêtre de contexte de 32 768 jetons, permettant l'embedding de documents plus volumineux sans perte d'intégrité sémantique. De plus, les modèles sont ajustés par instruction, nécessitant des instructions spécifiques à la tâche pour des performances optimales. Les modèles plus petits bénéficient de la distillation des connaissances, améliorant leur qualité malgré un nombre de paramètres réduit. La famille Harrier-OSS-v1 démontre des capacités exceptionnelles dans les tâches multilingues, en faisant un outil précieux pour les applications mondiales.
Microsoft Dévoile Harrier-OSS-v1 : Une Nouvelle Famille de Modèles d'Embedding Multilingues
Microsoft a lancé Harrier-OSS-v1, une nouvelle suite de modèles d'embedding multilingues qui établissent de nouveaux repères dans le domaine de la représentation sémantique.
