Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists
Dataset Analysis
SDABench evaluates LLMs on six scientific data analysis capabilities across five domains, finding strengths in descriptive analysis but weaknesses in assumption selection and mechanistic reasoning.
Provenance
Collected from papers.
Derived from paper: Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists