⌁
Awesome Auto Research Hub
论文 · 数据集 · 项目
首页
论文
数据集
项目
分析
趋势
资源
English
GitHub
← 返回数据集列表
当AI共同科学家失败时
2025
数据集
数据集分析
SPOT基准测试评估LLM作为科学手稿验证者,发现召回率和精确率低,凸显自动验证的差距。
来源线索
来源:papers。
派生自论文:当AI共同科学家失败时:SPOT:一个用于科学研究自动验证的基准
关联论文
当AI共同科学家失败时:SPOT:一个用于科学研究自动验证的基准
资源
论文
标签
CL