Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

基于离散世界模型的元强化学习用于自适应负载均衡

ACMSE 25 2025 43.8 method, application

TLDR

将元强化学习与DreamerV3离散世界模型结合,实现自适应负载均衡,优于A2C并抵抗灾难性遗忘。

评分理由

The paper presents a novel combination of meta-reinforcement learning and world models for load balancing, demonstrating strong adaptation and resilience. However, the abstract lacks detailed experimental setup and comparisons to other world model approaches, limiting assessment of generalizability.

Read-first 评分解释

综合优先阅读分 43.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 32。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
45.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
40

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:无

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:397。

关键词评分

world model
9
model-based reinforcement learning world model
8
world dynamics prediction
7
generative world model
5
world simulator
2
interactive world model
1
video world model
0

深度分析

创新点

  • 将元强化学习与DreamerV3架构集成,用于操作系统中的负载均衡
  • 以最少的重新训练快速适应动态工作负载
  • 在不同工作负载分布和大小下对灾难性遗忘具有鲁棒韧性

方法

该方法将元强化学习算法与DreamerV3架构相结合,在操作系统的负载均衡任务上进行训练。通过与优势演员-评论家(A2C)算法在标准和自适应试验中进行对比评估,测量在不同工作负载分布和大小下的性能。

关键结果

所提出的方法在标准和自适应试验中均优于A2C,保持高性能,并在动态工作负载条件下展现出对灾难性遗忘的鲁棒韧性。

技术栈

DreamerV3A2C元强化学习

标签