MP
MarkTechPost • 10일 전
IMP 6
퍼플렉시티, 리서치 에이전트 평가용 WANDR 벤치마크 공개
Perplexity AI는 다수의 결과를 탐색하고 이를 입증할 수 있는 AI 리서치 에이전트의 성능을 평가하기 위해 500개의 과제가 포함된 'WANDR' 벤치마크를 공개했습니다. 이 벤치마크는 AI가 단순히 답변을 생성하는 것을 넘어, 검증 가능한 출처를 바탕으로 폭넓고 깊이 있는 정보 탐색을 수행할 수 있는지를 정량적으로 측정합니다. 현재 Perplexity의 자체 모델이 이 벤치마크에서 가장 우수한 성능을 기록하며 리서치 에이전트 기술의 현재 한계와 방향성을 보여줍니다.
Perplexity AI WANDR 리서치 에이전트