В 2023 году типичная архитектура для генерации, дополненной извлечением (RAG), была довольно однородной, в значительной степени полагаясь на семью BERT (включая BGE и e5) для семантического понимания, BM25 для точных совпадений и кросс-энкодеры для повторного ранжирования, часто с Qdrant в качестве базы данных. Эта конфигурация была стандартом в течение двух лет, и многие по-прежнему ее используют. Однако более близкий взгляд на производственные среды ведущих команд показывает значительное изменение. Зависимость от традиционных энкодеров уменьшилась, и на передний план вышли тонко настроенные LLM. Повторное ранжирование теперь в основном осуществляется LLM, а вывод выполняется с использованием SGLang вместо ONNX. Эта трансформация потребовала полной переработки вспомогательной инфраструктуры. В этой статье рассматриваются эти изменения и предлагаются идеи о том, как адаптировать вашу технологическую стек, особенно если вы работаете в узкой области, где нет готовых наборов данных.
Извлечение в 2026: переход RAG от энкодеров к LLM
Изучите эволюцию генерации, дополненной извлечением (RAG) от традиционных энкодеров к большим языковым моделям (LLM) и ее влияние на ваши проекты.
