BrowseComp

AI benchmark from Curated Benchmark Expansion

BrowseComp: Evaluates autonomous agent performance on multi-step tasks requiring planning, state tracking, tool use, and recovery.

Publisher
Curated Benchmark Expansion
Domains
Agentic
Data source
benchmarklist
Catalogued
Website
https://benchmarklist.com/benchmarks/browsecomp/

Catalogue entry from the RL Engineering daily scrape of public sources. Data reflects the 2026-08-30 snapshot.