Avec le passage des agents IA de la recherche aux applications réelles, une question pressante se pose : comment évaluer leur performance ? Les métriques traditionnelles comme les scores de perplexité offrent peu d'informations sur la capacité d'un agent à effectuer des tâches telles que naviguer sur des sites web ou gérer des interactions de service client. En réponse, le domaine a développé plusieurs référentiels agentiques, bien que leur signification varie.
Il est important de noter que les scores des référentiels sont influencés par divers facteurs, y compris la conception du modèle, la structure des invites et les conditions d'évaluation. Par conséquent, ces scores ne doivent pas être vus isolément. Voici sept référentiels qui se distinguent par leur pertinence dans l'évaluation des capacités agentiques :
1. SWE-bench Vérifié : Ce référentiel évalue les agents IA sur leur capacité à résoudre de réels problèmes d'ingénierie logicielle en produisant du code fonctionnel. Ses résultats reflètent des avancées significatives dans le domaine.
2. GAIA : Ce référentiel teste les capacités d'assistant général à travers le raisonnement multi-étapes et l'utilisation d'outils, exposant les faiblesses dans les applications réelles.
3. WebArena : Axé sur la navigation web autonome, ce référentiel évalue la capacité des agents à accomplir des tâches complexes dans des environnements réalistes, mettant en évidence leurs limites par rapport à la performance humaine.
4. τ-bench : Ce référentiel évalue les interactions outil-agent-utilisateur sous des contraintes réelles, révélant des problèmes de cohérence et de fiabilité dans la performance des agents.
5. ARC-AGI-2 : Ce référentiel défie les agents avec des tâches de raisonnement visuel inédites, soulignant l'importance de la généralisation au-delà de la mémorisation. Il reflète l'évolution continue des capacités de l'IA.
