Perplexity
@perplexity_ai
Realistic retrieval evaluation requires large corpora and query sets, with deep relevance judgments to reduce false negatives.
Q2D-Web combines 190M web documents, 69,721 agent-reformulated queries, and 99.6 positive judgments per query on average in its combined set.