Le système vstash propose une approche révolutionnaire de la mémoire documentaire, en mettant l'accent sur le stockage local des données tout en combinant efficacement les recherches par similarité vectorielle avec le matching de mots-clés. En utilisant la Fusion de Rang Réciproque (RRF) et un poids IDF adaptatif pour chaque requête, il fonctionne sur un seul fichier SQLite, s'appuyant sur sqlite-vec pour les recherches de voisins approximatifs et FTS5 pour le recouvrement de mots-clés.
Les contributions clés incluent : (1) Un raffinement auto-supervisé des embeddings grâce à un désaccord de récupération hybride, montrant que 74,5 % des 753 requêtes BEIR présentent des divergences dans les top-10 entre les recherches axées sur les vecteurs et celles axées sur FTS. Cela fournit un signal d'entraînement précieux sans annotations humaines. Le modèle BGE-small, affiné sur 76K paires de désaccord, améliore l'NDCG@10 sur tous les ensembles de données. (2) L'introduction de RRF adaptatif avec un poids IDF par requête augmente significativement l'NDCG@10, atteignant un score de 0,7263 sur SciFact. (3) Les tentatives d'amélioration du scoring post-RRF par diverses méthodes n'ont pas donné de résultats positifs. (4) Un cadre de production robuste avec vérifications d'intégrité et diagnostics de classement a été validé sur plus de 50 000 requêtes jugées pertinentes. Le système maintient une latence de recherche médiane de 20,9 ms avec des performances NDCG constantes, et le modèle affiné est disponible sur HuggingFace.
