Humanity's Last Exam (HLE)
A broad expert-level benchmark intended to test difficult questions across many domains and formats.
Signals for expert knowledge, broad academic coverage, and factual accuracy.
| Rank | Model | Provider | Score | Coverage | Source | Source Type | Verified | Last Updated |
|---|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 74 | 3/6 | Scale Labs HLE Text Only leaderboard Accessed 2026-06-12 | leaderboard | Yes | 2026-06-12 | |
| 2 | Gemini 3 Pro | 70.2 | 3/6 | Scale Labs HLE Text Only leaderboard Accessed 2026-06-12 | leaderboard | Yes | 2026-06-12 | |
| 3 | OpenAI GPT-5.4 | OpenAI | 70.2 | 3/6 | Scale Labs HLE Text Only leaderboard Accessed 2026-06-12 | leaderboard | Yes | 2026-06-12 |
| 4 | DeepSeek-R1 | DeepSeek | 61.6 | 4/6 | Scale Labs HLE Text Only leaderboard Accessed 2026-06-12 | leaderboard | Yes | 2026-06-12 |
| Model | Provider | Score | Coverage | Freshest Source | Last Updated |
|---|---|---|---|---|---|
| OpenAI GPT-5.2 Thinking | OpenAI | 86 | 2/6 | Introducing GPT-5.2 Accessed 2026-06-11 | 2026-06-11 |
| Claude Opus 4.6 | Anthropic | 36.2 | 1/6 | Scale Labs HLE Text Only leaderboard Accessed 2026-06-12 | 2026-06-12 |
A broad expert-level benchmark intended to test difficult questions across many domains and formats.
A graduate-level, Google-proof question-answering benchmark with a commonly used Diamond subset.
A harder MMLU-style benchmark for broad knowledge and reasoning.
A harder multimodal academic benchmark derived from MMMU-style tasks.
A factuality benchmark for short-answer factual knowledge questions.
A RAG and factual multi-hop question answering benchmark.