Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

大型语言模型能否充分执行时间序列上的符号推理?

arXiv 2025 57.3 method

TLDR

提出SymbolBench评估LLM在时间序列上的符号推理,并构建LLM与遗传编程结合的框架。

评分理由

Strengths include a comprehensive benchmark and a novel framework integrating LLMs with genetic programming for symbolic reasoning. Weaknesses are that it focuses narrowly on symbolic reasoning rather than full automated scientific discovery, and the abstract does not detail specific results or limitations.

Read-first 评分解释

综合优先阅读分 57.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 34。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、结果

可复现性 25%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

主题相关性 42%
28.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:148。

关键词评分

AI for scientific research
6
automated scientific discovery
5
research automation
5
scientific discovery agent
5
automated research
4
automated experimentation
3
AI scientist
2
autonomous research agent
2
experiment design agent
2
literature review agent
0
survey generation
0
paper writing agent
0

深度分析

创新点

  • 引入SymbolBench,一个针对真实世界时间序列符号推理的综合基准,涵盖多元符号回归、布尔网络推断和因果发现,具有多样化的符号形式和复杂度。
  • 一个将LLM与遗传编程集成的统一闭环框架,其中LLM同时作为预测器和评估器。

方法

本文引入了SymbolBench,一个包含三个真实世界时间序列符号推理任务的基准,并提出了一个将LLM与遗传编程结合在闭环系统中的框架。LLM被用作预测器和评估器,并在当前模型上进行了实证评估。

关键结果

实证结果揭示了当前LLM的关键优势和局限性,强调领域知识、上下文对齐和推理结构对于改进时间序列符号推理至关重要。

局限性

  • 当前LLM在时间序列符号推理中表现出局限性,需要结合领域知识、上下文对齐和推理结构才能达到足够的性能。

技术栈

LLMsGenetic ProgrammingSymbolBench

标签

AI