What it measures
- GUI operation
- Computer use
- Multimodal agent control
A computer-use benchmark for operating-system and GUI agents.
% success; higher is better.
| Rank | Model | Provider | Score | Source | Source Type | Verified |
|---|
leaderboard
Original paper scores are outdated; use verified page/results for current comparisons. For 2025 onward, prefer OSWorld-Verified where available.
paper
Use for benchmark definition, not necessarily for latest model scores.
third-party
Use for dataset, code, or implementation details; score freshness depends on the benchmark.