En 2023, la arquitectura típica para la Generación Aumentada por Recuperación (RAG) era bastante uniforme, dependiendo en gran medida de la familia BERT (incluyendo BGE y e5) para la comprensión semántica, BM25 para coincidencias exactas, y cross-encoders para re-ranking, a menudo con Qdrant como base de datos. Esta configuración ha sido la norma durante dos años, y muchos todavía la utilizan. Sin embargo, un análisis más cercano de los entornos de producción de los equipos líderes revela un cambio significativo. La dependencia de los codificadores tradicionales ha disminuido, con LLMs finamente ajustados tomando el protagonismo. El re-ranking ahora es manejado principalmente por LLMs, y la inferencia se realiza utilizando SGLang en lugar de ONNX. Esta transformación ha requerido una revisión completa de la infraestructura de soporte. Este artículo examina estos cambios y ofrece ideas sobre cómo adaptar tu pila tecnológica, especialmente si operas en un dominio específico que carece de conjuntos de datos listos para usar.
Recuperación en 2026: Transición de RAG de codificadores a LLM
Analiza la evolución de la Generación Aumentada por Recuperación (RAG) de codificadores tradicionales a modelos de lenguaje grande (LLM) y sus implicaciones para tus proyectos.
