Система vstash представляет собой революционный подход к памяти документов, акцентируя внимание на локальном хранении данных и эффективно объединяя поиск по векторному сходству с сопоставлением ключевых слов. Используя Обратное Ранговое Слияние (RRF) и адаптивное взвешивание IDF для отдельных запросов, она работает с одним файлом SQLite, используя sqlite-vec для поиска приближенных соседей и FTS5 для поиска по ключевым словам.
Ключевые вклады включают: (1) Самообучение улучшения встраиваний через несогласие в гибридном поиске, показывающее, что 74,5% из 753 запросов BEIR демонстрируют несоответствия в топ-10 между векторными и FTS-поисками. Это предоставляет ценную обучающую сигнализацию без необходимости в аннотациях от человека. Настройка модели BGE-small на 76K парах несогласия улучшает NDCG@10 на всех наборах данных. (2) Введение адаптивного RRF с взвешиванием IDF по запросу значительно повышает NDCG@10, достигая 0,7263 на SciFact. (3) Попытки улучшить пост-RRF оценку с помощью различных методов не привели к положительным результатам. (4) Надежная производственная структура с проверками целостности и диагностикой ранжирования была подтверждена на более чем 50 000 запросов, оцененных по релевантности. Система поддерживает медианную задержку поиска в 20,9 мс с постоянной производительностью NDCG, а настроенная модель доступна на HuggingFace.
