AI Benchmark Center
Live leaderboards across reasoning, coding, math, expert knowledge, and agent performance.
Current Leaders by Category
Overall Model Ranking
(avg. normalized score across all benchmarks)Coding
HumanEval · % pass@1
164 programming challenges requiring correct code from docstrings.
Aug 5, 2026
Aug 1, 2026
Aug 2, 2026
Jul 29, 2026
Aug 4, 2026
SWE-bench
SWE-bench · % resolved
Real GitHub issues from popular open-source repositories.
Aug 5, 2026
Aug 1, 2026
Aug 2, 2026
Jul 29, 2026
Aug 4, 2026
Reasoning
MMLU · % accuracy
57-subject knowledge test across STEM, humanities, and social sciences.
Aug 7, 2026
Aug 18, 2026
Aug 1, 2026
Aug 25, 2026
Aug 5, 2026
Science
GPQA · % accuracy
PhD-level science questions in biology, chemistry, and physics.
Aug 7, 2026
Aug 18, 2026
Aug 1, 2026
Aug 25, 2026
Aug 9, 2026
About These Benchmarks
MMLU (Massive Multitask Language Understanding)
Tests knowledge across 57 subjects including STEM, humanities, and social sciences. 14,000+ questions.
HumanEval (Coding)
164 hand-crafted programming challenges. Measures ability to produce correct code from docstrings.
MATH
12,500 competition math problems from AMC, AIME, and AMC 10/12. Tests advanced mathematical reasoning.
SWE-bench Verified
Real GitHub issues from popular open-source repos. Measures end-to-end software engineering capability.