AstroVisBench:天文学科学计算与可视化的代码基准测试
TLDR
AstroVisBench评估LLM在天文科学计算与可视化中的表现,发现显著性能差距。
评分理由
The paper introduces a novel benchmark for evaluating LLMs in astronomy-specific data processing and visualization, validated by professional astronomers. Its strength lies in addressing an underexplored evaluation area, but it is limited to a single domain and relies on an LLM-as-a-judge method that may introduce biases.
Read-first 评分解释
综合优先阅读分 52.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:78。
关键词评分
深度分析
创新点
- 首个同时涵盖天文学科学计算与可视化的基准测试(AstroVisBench)
- 新颖的LLM-as-a-judge工作流用于评估可视化,经五位专业天文学家的标注验证
方法
AstroVisBench是一个基准测试,要求语言模型创建天文学特定的数据处理与分析工作流,并通过复杂图表可视化结果。可视化评估采用LLM-as-a-judge方法,并由五位专业天文学家验证。在该基准上评估了最先进的语言模型。
关键结果
评估揭示了当前最先进语言模型在作为天文学研究的有用助手方面存在显著差距。