gpt.college

FRAMES

A RAG and factual multi-hop question answering benchmark.

Last updated: 2026-06-12

What it measures

  • Retrieval-augmented generation
  • Multi-hop factual QA
  • Evidence synthesis

Sourced Ranking

Rank Model Provider Score Source Source Type Verified
1 DeepSeek-R1 DeepSeek 82.5 DeepSeek-R1 model card Accessed 2026-06-11 official Yes

Limitations

  • Treat HF as dataset provenance, not as a live leaderboard.
  • The arXiv paper is static; Hugging Face is the dataset source, not a live score source.
  • No official dynamic leaderboard was selected; newer scores need self-runs or model reports.

unknown

Hugging Face dataset and paper

The arXiv paper is static; Hugging Face is the dataset source, not a live score source. No official dynamic leaderboard was selected; newer scores need self-runs or model reports.

official

FRAMES dataset or code

Use for dataset, code, or implementation details; score freshness depends on the benchmark.

third-party

LLM Stats FRAMES leaderboard

Third-party leaderboard with limited model coverage. Use for discovery and verify against primary model reports before strong claims.