MegaScience:推动科学推理的后训练数据集前沿
TLDR
提出开源科学推理数据集TextbookReasoning和MegaScience,提升AI科学家训练效果,超越现有数据集。
评分理由
Strengths include large-scale, high-quality, verifiable datasets from textbooks and systematic ablation studies; weaknesses are limited to post-training datasets without addressing full automation or real-world experimental validation.
Read-first 评分解释
综合优先阅读分 56,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:87。
关键词评分
深度分析
创新点
- TextbookReasoning数据集:从12k本大学级科学教科书中提取65万个推理问题,附带真实参考答案,覆盖7个学科
- MegaScience数据集:125万实例的高质量开源科学数据集混合体,通过系统消融研究确定最优子集
- 综合评估系统:涵盖15个基准测试,采用稳健的答案提取策略确保准确评估
方法
从12k本教科书中提取TextbookReasoning,然后通过混合开源科学数据集并利用消融研究选择最优子集构建MegaScience。在MegaScience上训练Llama3.1、Qwen2.5、Qwen3基础模型,并在15个基准测试上通过细致的答案提取进行评估。
关键结果
MegaScience训练的模型在更短的响应长度下实现了更优的性能和训练效率,平均性能显著优于官方指令模型,且更大模型受益更多,表明科学调优具有规模效益。