AI benchmark leaderboards
525 BOARDS ON FILE · 105 FAMILIESVector Wire publishes 525 benchmark leaderboards, each ranking published models with the source and verification tier shown on every score. The most measured is GPQA Diamond at 451 models; a board is published once at least five published models carry a comparable score on it.
● LIVE INDEX525 BOARDS105 FAMILIESREFRESHES WITH THE PIPELINE
Most measuredRANKED BY MODELS SCORED
#LeaderboardModels scoredLatest score
Benchmark familiesTHE SAME SUITE AT DIFFERENT VERSIONS, SUBSETS OR CONTEXT LENGTHS
GPQA3
AA4
HLE6
SCICODE2
CRITPT2
OMNISCIENCE2
IFBENCH3
GDPVAL4
ARTIFICIAL2
TERMINAL6
MMLU9
TAUBENCH5
SWE8
GSM8K2
- GSM8K142
- GSM8K (EM)11
IFEVAL3
LIVECODEBENCH8
HUMANEVAL4
ARENA7
VECTARA4
SIMPLEQA2
ARC4
BROWSECOMP10
FRONTIERMATH4
BBH3
NATURALQUESTIONS2
OSWORLD3
LIVEBENCH8
HMMT4
MCP2
AIDER2
MATHVISION3
MMSTAR2
REALWORLDQA2
DROP3
DEEPSWE2
TOOLATHLON4
LONGBENCH2
CHARTQA3
SCREENSPOT7
AIME252
FINANCE2
MULTIPL3
DOCVQA3
VIDEO2
TRIVIAQA3
HEALTHBENCH9
OMNIDOCBENCH3
PIQA3
OFFICEQA2
CLAW2
MATHARENA2
TEXTVQA2
MRCR2
MULTI2
WIDESEARCH2
DEEPSEARCHQA2
MM2
CODEFORCES4
METR3
INFOVQA3
POPE2
AGENTWORLDBENCH8
SEAL2
USAMO2
ZEROBENCH2
RULER10
MMBENCH6
MINERVA2
BIGCODEBENCH3
FRAMES3
AGIEVAL2
MMVET2
FINSEARCHCOMP3
MULTILINGUAL3
CMATH2
MME2
MMLONGBENCH2
OPENAI2
VALS2
MTOB5
DSBENCH2
HMMT252
JMMLU2
Individual boards164 LEADERBOARDS WITH NO SIBLING SUITE · A–Z
- AceBench5
- Agent's Last Exam (Pass rate)7
- AGI EVAL13
- AI2D45
- AIR-Bench 202474
- AlignBench7
- All-Angles-Bench9
- AlpacaEval-2.016
- AlpacaEval2.0 (LC-winrate)6
- AndroidBench5
- AndroidWorld9
- anthropic_red_team75
- apexAgents46
- ArtifactsBench11
- AttaQ12
- AutoLogi6
- AutomationBench Public6
- Avg.10
- bbq75
- BeyondAIME9
- BIG-Bench Extra Hard16
- BigBenchHard9
- BLINK46
- Blueprint-Bench 27
- BoolQ10
- C-Eval49
- C35
- CC-OCR23
- CharadesSTA11
- ChartQAPro11
- Chinese SimpleQA (C-SimpleQA)27
- CLUEWSC14
- CMMLU27
- CNMO 20249
- Code Arena (Elo)5
- coding_arena_elo116
- CV-Bench7
- CyberGym37
- DeepPlanning12
- DNA sequence design for transcription factor binding5
- Domain Avg6
- DUDE6
- DynaMath14
- EgoSchema9
- EmbSpatial-Bench15
- ERQA37
- Eval+ Avg6
- EvalPlus10
- FLTEval6
- FullStackBench6
- GDP (Surge AI)18
- GMMLU5
- GQA TestDev_Balanced7
- GSMPlus5
- HallusionBench32
- Hard-negative protein binding prediction5
- HarmBench77
- HellaSwag48
- HiL-Bench17
- Humanity’s Last Exam5
- Include43
- InfographicVQA (val)8
- InterGPS (test)6
- IOI 20255
- itbenchSre43
- JGPQA6
- JHumanEval+6
- JobBench22
- KOR-Bench8
- LCB v510
- LiveCodeBenchV6 no tools10
- Longform Writing eval (Kimi K2 Thinking system card)5
- LongVideoBench14
- LVBench44
- M-LongDoc (multimodal long-document benchmark)7
- MATH500 (Pass@1)21
- MathVista85
- MCPAtlas Public (Pass@1)6
- MCPMark17
- MedXPertQA MM6
- MEGA-Bench_macro7
- MHPP6
- MILU7
- MLE-Bench7
- MLS Bench Lite9
- MLVU13
- MMAU7
- MMMB15
- MMMLU80
- MMSI-Bench5
- MMVU14
- MotionBench9
- MT-Bench16
- MTL MMBench_DEV7
- Multi-Challenge66
- MUSR (HF Open LLM)17
- MV-Bench22
- NarrativeQA62
- NL2Repo35
- OctoCodingbench6
- OJBench11
- OlympiadBench7
- OpenBookQA77
- OR-Bench (FRR)5
- OVBench5
- PaperBench10
- PhyX5
- PinchBench21
- PolyMath-en5
- PopQA9
- PostTrainBench16
- ProfBench (Search)7
- Program Bench25
- ProgramBench (Almost Solved)6
- Prophet Arena5
- ProteinGym Hard6
- putnam_20255
- QwenClawBench9
- QwenWebBench8
- RACE5
- RefCOCO (Macro Prec@1)7
- RefSpatial-Bench12
- ReMI5
- ResearchRubrics12
- RiemannBench7
- RoboSpatial-Home5
- SAT7
- ScienceQA (img-test)6
- SEED-Bench (image)8
- simple_safety_tests75
- simplebench95
- SimpleVQA32
- SkillsBench Avg58
- Social IQA10
- SpreadsheetBench 27
- StrongREJECT17
- SuperGPQA59
- SWEBench Pro Public16
- SWT-bench7
- t2-bench19
- Tau2 airline20
- theagentcompany7
- Theorem QA8
- TOMATO9
- Tool-Decathlon23
- TruthfulQA26
- TVBench6
- V* (w/ python)5
- Vending-Bench 29
- VideoHolmes5
- VideoMME (w sub.)14
- VideoMMMU29
- VideoSimpleQA5
- VisuLogic5
- VITA-Bench13
- VLM Judge Score10
- VSI-Bench10
- WildBench11
- WinoGrande40
- WMDP5
- WMT24++ (en→xx)7
- WorldVQA12
- XSTest77
- ZebraLogic13
Counts are the number of published models carrying a comparable default-variant score. A board page ranks the top 100 of them. Internal and scaffold evaluations are excluded. How we choose what to publish.
PRO MODE — THE BOARD DIRECTORY · EVERY LEADERBOARD THE BENCH PUBLISHES · EACH BOARD OPENS THE LIVE INSTRUMENT AT ITS OWN ADDRESSThe frontier boardModels by vendorLLM pricing