С переходом агентов ИИ от исследований к реальным приложениям возникает актуальный вопрос: как оценить их производительность? Традиционные метрики, такие как показатели перплексии, предоставляют ограниченную информацию о способности агента выполнять задачи, такие как навигация по веб-сайтам или управление взаимодействиями с клиентами. В ответ на это в области были разработаны несколько агентных эталонов, хотя их значение варьируется.
Важно отметить, что оценки эталонов зависят от различных факторов, включая дизайн модели, структуру подсказок и условия оценки. Поэтому эти оценки не следует рассматривать изолированно. Вот семь эталонов, которые выделяются своей значимостью в оценке агентных возможностей:
1. SWE-bench Verified: Этот эталон оценивает агентов ИИ по их способности решать реальные проблемы программной инженерии, производя функциональный код. Его результаты отражают значительные достижения в области.
2. GAIA: Этот эталон проверяет общие возможности помощника через многослойное рассуждение и использование инструментов, выявляя слабые места в реальных приложениях.
3. WebArena: Сосредоточенный на автономной навигации по вебу, этот эталон оценивает способность агентов выполнять сложные задачи в реалистичных условиях, подчеркивая их ограничения по сравнению с человеческой производительностью.
4. τ-bench: Этот эталон оценивает взаимодействия инструмент-агент-пользователь в условиях реальной политики, выявляя проблемы с последовательностью и надежностью в производительности агентов.
5. ARC-AGI-2: Этот эталон ставит перед агентами задачи нового визуального рассуждения, подчеркивая важность обобщения за пределами запоминания. Он отражает продолжающееся развитие возможностей ИИ.
