Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

MegaScience:推动科学推理的后训练数据集前沿

arXiv 2025 56 benchmark

TLDR

提出开源科学推理数据集TextbookReasoning和MegaScience,提升AI科学家训练效果,超越现有数据集。

评分理由

Strengths include large-scale, high-quality, verifiable datasets from textbooks and systematic ablation studies; weaknesses are limited to post-training datasets without addressing full automation or real-world experimental validation.

Read-first 评分解释

综合优先阅读分 56,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:消融、基准、数据集、评估、实验、指标

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

主题相关性 42%
34.2

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:87。

关键词评分

AI for scientific research
8
AI scientist
7
scientific discovery agent
5
automated scientific discovery
4
research automation
4
autonomous research agent
3
automated research
3
automated experimentation
2
experiment design agent
2
literature review agent
1
survey generation
1
paper writing agent
1

深度分析

创新点

  • TextbookReasoning数据集:从12k本大学级科学教科书中提取65万个推理问题,附带真实参考答案,覆盖7个学科
  • MegaScience数据集:125万实例的高质量开源科学数据集混合体,通过系统消融研究确定最优子集
  • 综合评估系统:涵盖15个基准测试,采用稳健的答案提取策略确保准确评估

方法

从12k本教科书中提取TextbookReasoning,然后通过混合开源科学数据集并利用消融研究选择最优子集构建MegaScience。在MegaScience上训练Llama3.1、Qwen2.5、Qwen3基础模型,并在15个基准测试上通过细致的答案提取进行评估。

关键结果

MegaScience训练的模型在更短的响应长度下实现了更优的性能和训练效率,平均性能显著优于官方指令模型,且更大模型受益更多,表明科学调优具有规模效益。

标签

CLAILG