大型语言模型能否充分执行时间序列上的符号推理?
TLDR
提出SymbolBench评估LLM在时间序列上的符号推理,并构建LLM与遗传编程结合的框架。
评分理由
Strengths include a comprehensive benchmark and a novel framework integrating LLMs with genetic programming for symbolic reasoning. Weaknesses are that it focuses narrowly on symbolic reasoning rather than full automated scientific discovery, and the abstract does not detail specific results or limitations.
Read-first 评分解释
综合优先阅读分 57.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 34。
研究版图角色
前沿论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:148。
关键词评分
深度分析
创新点
- 引入SymbolBench,一个针对真实世界时间序列符号推理的综合基准,涵盖多元符号回归、布尔网络推断和因果发现,具有多样化的符号形式和复杂度。
- 一个将LLM与遗传编程集成的统一闭环框架,其中LLM同时作为预测器和评估器。
方法
本文引入了SymbolBench,一个包含三个真实世界时间序列符号推理任务的基准,并提出了一个将LLM与遗传编程结合在闭环系统中的框架。LLM被用作预测器和评估器,并在当前模型上进行了实证评估。
关键结果
实证结果揭示了当前LLM的关键优势和局限性,强调领域知识、上下文对齐和推理结构对于改进时间序列符号推理至关重要。
局限性
- 当前LLM在时间序列符号推理中表现出局限性,需要结合领域知识、上下文对齐和推理结构才能达到足够的性能。
技术栈
LLMsGenetic ProgrammingSymbolBench