BrowseComp
AI benchmark from Curated Benchmark Expansion
BrowseComp: Evaluates autonomous agent performance on multi-step tasks requiring planning, state tracking, tool use, and recovery.
- Publisher
- Curated Benchmark Expansion
- Domains
- Agentic
- Data source
- benchmarklist
- Catalogued
Catalogue entry from the RL Engineering daily scrape of public sources. Data reflects the 2026-08-30 snapshot.