AI Benchmarks

A daily-updated catalogue of public AI benchmarks and eval suites, with the companies behind them and the domains they cover. Synthesized from rl-list, Pavlov's List, and BenchLM.

80 of 3092 tracked entries in the 2026-08-30 snapshot.

80 entries

BenchmarkPublisherDomainsLocationTeamSource
SWE-bench ProScaleMulti-DomainCodingSan Francisco, USA; New York, USA; Washington DC, USA; London, UK250+pavlovslist
WebArenaBrowsergym LeaderboardAgenticbenchmarklist
OSWorldAgenticbenchlm-benchmarks
Terminal-Bench / Terminal-Bench 2.0AfterQueryCodingComputer UseEnterprise WorkflowsSan Francisco, USA51-200rl-list
Senior SWE-BenchSnorkelMulti-DomainCodingSan Francisco, USA; Redwood City, USA; New York, USA101-250pavlovslist
OSWorld-VerifiedHUDComputer UseEnterprise WorkflowsSan Francisco, USA11-50rl-list
FinanceQAAfterQueryCodingComputer UseEnterprise WorkflowsSan Francisco, USA51-200rl-list
IDE-BenchAfterQueryCodingComputer UseEnterprise WorkflowsSan Francisco, USA51-200rl-list
EnterpriseBench CoreCraftSurge AIEnterprise WorkflowsLong-HorizonSan Francisco, USA51-200rl-list
APEXMercorCodingEnterprise WorkflowsLong-HorizonSan Francisco, USA51-200rl-list
APEX-AgentsMercorCodingEnterprise WorkflowsLong-HorizonSan Francisco, USA51-200rl-list
AIME 2025Artificial AnalysisMathbenchmarklist
BrowseCompCurated Benchmark ExpansionAgenticbenchmarklist
FHIR-AgentBenchPaper ArxivHealthcarebenchmarklist
FrontierMath 2025-02-28 PrivateNeosignal Epoch AIMathbenchmarklist
FrontierMath Tier 4 2025-07-01 PrivateNeosignal Epoch AIMathbenchmarklist
Global MMLUAnthropic System CardMultilingualbenchmarklist
GPQA DiamondArtificial AnalysisReasoningbenchmarklist
GSM8KHuggingface Leaderboard APIMathbenchmarklist
Humanity's Last ExamArtificial AnalysisKnowledgebenchmarklist
LiveCodeBench-PlusPaper ArxivCodingbenchmarklist
Long-Horizon Terminal-BenchPaper ArxivAgenticbenchmarklist
MMLU-ProArtificial AnalysisKnowledgebenchmarklist
MultiMedia-TerminalBenchPaper ArxivAgenticbenchmarklist
OSWorld 2.0Anthropic System CardComputer Usebenchmarklist
OTIS Mock AIME 2024-2025Neosignal Epoch AIMathbenchmarklist
SimpleQA Net ScoreAnthropic System CardKnowledgebenchmarklist
SWE-bench DockerCurated Benchmark ExpansionCodingbenchmarklist
SWE-bench ExtraCurated Benchmark ExpansionCodingbenchmarklist
SWE-bench JavaScriptCurated Benchmark ExpansionCodingbenchmarklist
SWE-bench VerifiedNeosignal Epoch AICodingbenchmarklist
Terminal BenchNeosignal Epoch AIAgenticbenchmarklist
Terminal-Bench HardArtificial AnalysisAgenticbenchmarklist
AIMEVals AIMathbenchmarklist
LiveCodeBenchVals AICodingbenchmarklist
Terminal-Bench 2.0Vals AICodingbenchmarklist
Terminal-Bench 2.1Vals AICodingbenchmarklist
Hy-BrowseComp-Pro2Tencent HY4 Preview Model CardSearchbenchmarklist
SWE-bench Verified MiniHAL Static Leaderboard HtmlCodingbenchmarklist
TAU-bench AirlineHAL Static Leaderboard HtmlAgenticbenchmarklist
HELM GSM8KHelm Classic GCS JsonMathbenchmarklist
CoreCraftSurgeMulti-DomainSan Francisco, USA; New York, USA; Seattle, USA101-250pavlovslist
FinanceBenchPatronus AIMulti-DomainCodingSan Francisco, USA51-100pavlovslist
Terminal-Bench 3.0Agenticbenchlm-benchmarks
Terminal-Bench 4.0Agenticbenchlm-benchmarks
Terminal-Bench-Science 0.1Agenticbenchlm-benchmarks
HLE w/ toolsAgenticbenchlm-benchmarks
BrowseComp-VLAgenticbenchlm-benchmarks
TAU-benchAgenticbenchlm-benchmarks
WebArena-VerifiedAgenticbenchlm-benchmarks
AA LiveCodeBenchCodingbenchlm-benchmarks
AA Terminal-Bench 2.1Codingbenchlm-benchmarks
HumanEvalCodingbenchlm-benchmarks
CodeforcesCodingbenchlm-benchmarks
LiveCodeBench v6Codingbenchlm-benchmarks
LiveCodeBench v5Codingbenchlm-benchmarks
LiveCodeBench Pass@1-COTCodingbenchlm-benchmarks
LiveCodeBench ProCodingbenchlm-benchmarks
Multi-SWE BenchCodingbenchlm-benchmarks
ARC-AGI-1Reasoningbenchlm-benchmarks
ARC-AGI-2Reasoningbenchlm-benchmarks
ARC-AGI-3Reasoningbenchlm-benchmarks
SWE-bench MultimodalMultimodalbenchlm-benchmarks
AA MMLU-ProKnowledgebenchlm-benchmarks
MMLUKnowledgebenchlm-benchmarks
GPQAKnowledgebenchlm-benchmarks
GPQA-DKnowledgebenchlm-benchmarks
HLEKnowledgebenchlm-benchmarks
AA-GPQA DiamondKnowledgebenchlm-benchmarks
AA-HLEKnowledgebenchlm-benchmarks
SimpleQAKnowledgebenchlm-benchmarks
Chinese-SimpleQAKnowledgebenchlm-benchmarks
HLE w/o toolsKnowledgebenchlm-benchmarks
MMLU-ReduxKnowledgebenchlm-benchmarks
AA Global-MMLU-LiteMultilingualbenchlm-benchmarks
MMLU-ProXMultilingualbenchlm-benchmarks
AA AIME 2025Mathbenchlm-benchmarks
AIME 2023Mathbenchlm-benchmarks
AIME 2024Mathbenchlm-benchmarks
FrontierMathMathbenchlm-benchmarks