MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation
Read-first score
Read-first score 34.2, weighted from topical fit, citation, graph, method, reproducibility, and recency signals.
Field roles
Reproducibility anchor
Rank sensitivity
Stability: volatile; rank range: 105.