Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回数据集列表

当AI共同科学家失败时

2025 数据集
Preview for 当AI共同科学家失败时

数据集分析

SPOT基准测试评估LLM作为科学手稿验证者,发现召回率和精确率低,凸显自动验证的差距。

来源线索

来源:papers。

派生自论文:当AI共同科学家失败时:SPOT:一个用于科学研究自动验证的基准

资源

标签

CL