What it measures
- Multimodal academic QA
- Image-text reasoning
- Expert subject knowledge
A harder multimodal academic benchmark derived from MMMU-style tasks.
% accuracy; higher is better.
| Rank | Model | Provider | Score | Source | Source Type | Verified |
|---|---|---|---|---|---|---|
| 1 | OpenAI GPT-5.4 | OpenAI | 81.2 | Introducing GPT-5.4 Accessed 2026-06-11 | official | Yes |
| 2 | Gemini 3 Pro | 81 | Gemini 3.1 Pro model page Accessed 2026-06-11 | official | Yes | |
| 3 | Gemini 3.1 Pro | 80.5 | Gemini 3.1 Pro model page Accessed 2026-06-11 | official | Yes | |
| 4 | OpenAI GPT-5.2 Thinking | OpenAI | 79.5 | Introducing GPT-5.2 Accessed 2026-06-11 | official | Yes |
leaderboard
The arXiv paper is static; leaderboard and Hugging Face sources are better. MMMU official page and HF dataset are selected entry points.
paper
Use for benchmark definition, not necessarily for latest model scores.
official
Use for dataset, code, or implementation details; score freshness depends on the benchmark.