SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers
Read-first score
Read-first score 36.6, weighted from topical fit, citation, graph, method, reproducibility, and recency signals.
Field roles
FrontierReproducibility anchor
Rank sensitivity
Stability: volatile; rank range: 81.