Perplexity AI ha lanzado WANDR (Wide ANd Deep Research), un benchmark revolucionario destinado a evaluar a los agentes de investigación en su habilidad para recopilar y analizar datos de manera efectiva. A diferencia de los benchmarks tradicionales que se centran en respuestas únicas, WANDR enfatiza la importancia de compilar colecciones extensas de información respaldada por evidencia. Este benchmark cuenta con 500 tareas complejas que desafían a los agentes a realizar trabajo de conocimiento de manera eficiente.
WANDR se distingue del anterior benchmark DRACO de Perplexity al centrarse tanto en la amplitud como en la profundidad de la investigación. El benchmark requiere que los agentes no solo identifiquen una amplia gama de entidades relevantes, sino que también respalden cada entidad con evidencia creíble. Este doble requisito transforma el proceso de evaluación, ya que los agentes deben proporcionar narrativas completas respaldadas por investigaciones exhaustivas.
Por ejemplo, una tarea implica identificar 70 empresas estadounidenses con nombramientos recientes de CEO o CFO y proporcionar fuentes autorizadas para cada una. Las tareas se generan a partir de patrones de datos del mundo real, asegurando su relevancia y aplicabilidad. La calificación se basa en la precisión de la evidencia proporcionada, con un enfoque en la precisión y el recuerdo. En general, WANDR busca mejorar las capacidades de los agentes de investigación en entornos profesionales, abordando desafíos comunes en la recopilación y análisis de datos.
