AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
Read-first score
Read-first score 29.1, weighted from topical fit, citation, graph, method, reproducibility, and recency signals.
Field roles
Frontier
Rank sensitivity
Stability: volatile; rank range: 40.