Con el cambio de los agentes de IA de la investigación a aplicaciones del mundo real, surge una pregunta apremiante: ¿cómo podemos evaluar su rendimiento? Las métricas tradicionales como los puntajes de perplejidad ofrecen poca información sobre la capacidad de un agente para realizar tareas como navegar por sitios web o gestionar interacciones de servicio al cliente. En respuesta, el campo ha desarrollado varios referenciales agentes, aunque su significado varía.
Es importante señalar que los puntajes de los referenciales están influenciados por diversos factores, incluyendo el diseño del modelo, la estructura de las indicaciones y las condiciones de evaluación. Por lo tanto, estos puntajes no deben ser vistos de manera aislada. Aquí hay siete referenciales que se destacan por su relevancia en la evaluación de las capacidades agentes:
1. SWE-bench Verificado: Este referencial evalúa a los agentes de IA sobre su capacidad para resolver problemas reales de ingeniería de software produciendo código funcional. Sus resultados reflejan avances significativos en el campo.
2. GAIA: Este referencial prueba las capacidades de asistente general a través de razonamiento de múltiples pasos y uso de herramientas, exponiendo debilidades en aplicaciones del mundo real.
3. WebArena: Enfocado en la navegación web autónoma, este referencial evalúa la capacidad de los agentes para completar tareas complejas en entornos realistas, destacando sus limitaciones en comparación con el rendimiento humano.
4. τ-bench: Este referencial evalúa las interacciones herramienta-agente-usuario bajo restricciones del mundo real, revelando problemas de consistencia y fiabilidad en el rendimiento de los agentes.
5. ARC-AGI-2: Este referencial desafía a los agentes con tareas de razonamiento visual novedosas, enfatizando la importancia de la generalización más allá de la memorización. Refleja la evolución continua de las capacidades de la IA.
