ASI-Bench
数据集分析
超级人工智能(ASI)要求人工智能超越对现有知识的掌握,转向探索未知、创造新知识,并将新想法转化为可验证的成果。然而,当今人工智能系统的能力在很大程度上仍建立在学习、压缩和应用人类现有知识的基础之上。因此,现有基准主要测试人工智能能否基于已学知识给出正确答案,或能否在大量人类指导下完成任务。为此,我们推出 ASI-Bench,这是首个在通用研究领域内联合评估人工智能系统创新探索能力与自主科学执行能力的基准,也是首个在同一研究项目中逐步撤除人类方法论指导、以测试人工智能在多大程度上能够独立推进的基准。ASI-Bench 由 40 余位专家耗费 31,000 多个人工小时构建,包含涵盖 11 个科学领域的 60 个项目级研究任务,并逐步减少方法论指导,以测试人工智能能否独立选择方法、开展研究并产出可验证的结果。所有任务均经过专家评审、AI 辅助审计、沙盒执行和评分者验证。在 18 种最先进的智能体-模型配置中,平均得分从提供完整方法论指导时的 50.91 分,降至仅指定方法时的 29.10 分,再降至智能体必须自行确定方法时的 26.62 分。这一急剧下降表明,当前系统仍严重依赖人类指导,距离自主开展端到端的项目级科学研究还有很大差距。ASI-Bench 向全球开放。我们邀请各地的研究者和开发者贡献新任务、挑战当今 AI 的极限,并共同加速人类迈向超级人工智能的集体进程,网址为 https://asibench.apexin.ai/submit。
来源线索
来源:papers。
派生自论文:ASI-Bench:超级人工智能的黎明