Google представил Gemini Embedding 2, значительное обновление своей серии моделей Gemini, которая ранее сосредоточилась только на тексте. Эта новая модель решает задачи хранения с высокой размерностью и межмодальной выборки, что важно для разработчиков, работающих над продвинутыми системами Генерации, Увеличенной Поиском (RAG). Gemini Embedding 2 представляет собой сдвиг парадигмы, позволяя пяти различным типам медиа—Текст, Изображение, Видео, Аудио и PDF—быть представленными в едином пространстве векторов с высокой размерностью. Это достижение устраняет необходимость в отдельных моделях для каждого типа данных, оптимизируя процесс встраивания. Модель поддерживает взаимосвязанные входные данные, позволяя разработчикам комбинировать различные типы медиа в одном запросе, что улучшает понимание контекста. Ограничения входных данных включают 8,192 токена для текста, шесть изображений, 120 секунд видео, 80 секунд аудио и шесть страниц PDF. Для повышения эффективности Gemini Embedding 2 использует Обучение Представления Матрешки (MRL), которое приоритизирует критически важную семантическую информацию в первых измерениях вектора, позволяя эффективное сокращение без значительной потери точности. Производительность модели была подтверждена по сравнению с Massive Text Embedding Benchmark (MTEB), показывая улучшения в точности выборки и устойчивости в специализированных областях. С окном ввода в 8,192 токена она эффективно обрабатывает более крупные текстовые сегменты, уменьшая фрагментацию контекста в приложениях RAG.
Google AI Представляет Gemini Embedding 2: Комплексная Мультимодальная Модель
Gemini Embedding 2 улучшает семью моделей Gemini, позволяя бесшовную интеграцию различных типов медиа в единую структуру встраивания.
