Microsoft ha introducido Harrier-OSS-v1, una colección de tres modelos de embedding de texto multilingües diseñados para proporcionar representaciones semánticas de alta calidad en varios idiomas. Esta versión incluye modelos de diferentes escalas: 270 millones de parámetros, 0.6 mil millones de parámetros y 27 mil millones de parámetros. Los modelos Harrier-OSS-v1 han logrado resultados de vanguardia en el Multilingual MTEB (Massive Text Embedding Benchmark) v2, marcando un avance significativo en la tecnología de recuperación de código abierto. A diferencia de los modelos de codificadores bidireccionales tradicionales como BERT, Harrier-OSS-v1 emplea arquitecturas solo de decodificador, que procesan el contexto de manera diferente. Cada token en estos modelos solo puede referirse a los tokens anteriores, utilizando el agrupamiento del último token para crear una representación vectorial única de la entrada. Una característica notable de estos modelos es su capacidad para manejar entradas largas, con una ventana de contexto de 32,768 tokens, lo que permite la incrustación de documentos más grandes sin perder integridad semántica. Además, los modelos están ajustados por instrucciones, requiriendo instrucciones específicas de la tarea para un rendimiento óptimo. Los modelos más pequeños se benefician de la destilación del conocimiento, mejorando su calidad a pesar de tener menos parámetros. La familia Harrier-OSS-v1 demuestra capacidades excepcionales en tareas multilingües, convirtiéndola en una herramienta valiosa para aplicaciones globales.
Microsoft Presenta Harrier-OSS-v1: Una Nueva Familia de Modelos de Embedding Multilingües
Microsoft ha lanzado Harrier-OSS-v1, una nueva suite de modelos de embedding multilingües que establecen nuevos estándares en el campo de la representación semántica.
