Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回数据集列表

SciIntegrity-Bench

2026 数据集
Preview for SciIntegrity-Bench

数据集分析

首个评估AI科学家系统学术诚信的基准,发现7个LLM因完成偏差导致34.2%的失败率。

来源线索

来源:papers。

派生自论文:SciIntegrity-Bench:评估AI科学家系统学术诚信的基准

资源

标签

AI