← 返回更多项目
强化学习建模项目

游戏装备策略优化

预算约束下的装备组合选择

将英雄联盟出装建模为受金币预算约束的决策过程,探索 DQN 与灵敏度分析。

项目角色

建模与实现

主要方法

DQN · 奖励设计 · 灵敏度分析

装备实验原图:战士设置下金币预算与伤害的关系。
装备实验原图:战士设置下金币预算与伤害的关系。 查看原尺寸图示

研究问题

装备选择同时涉及金币预算与装备属性之间的相互作用。我将购买过程建模为序贯决策,以模拟对战目标评价组合,研究 DQN 策略如何在六步选择过程中分配资源。

我的贡献

  • 构建自定义装备选择环境,将累计装备属性、剩余预算与六步购买过程纳入状态和决策流程。
  • 结合中间模拟伤害、终局反馈与超预算惩罚设计奖励,并接入 DQN 训练。
  • 整理装备数据处理与灵敏度分析代码,分析建模假设如何影响装备选择。

技术路线

  • 将每次购买视为离散动作,更新剩余金币与累计战斗属性。
  • 通过模拟对手模型评价组合,结合中间伤害反馈、终局奖励和超预算惩罚构建学习目标。
  • 将环境转移接入 DQN 训练,结合灵敏度分析工具研究输入属性与策略选择之间的关系。

成果与发现

  • 形成连接装备数据、环境转移、奖励塑形与 DQN 训练的资源约束学习流程。
  • 在模拟对手设置下,将预算分配与属性组合转化为明确的策略选择,并配套灵敏度分析工具,检查输入条件对出装策略的影响。

建模思考与分析

核心问题是:如何把一次性的组合选择转化为序贯学习?逐件选择装备可以控制单步动作空间的规模,而状态需要保留已选组合、剩余预算及影响后续购买的信息。

我比较了终局奖励与中间奖励塑形的思路。最终伤害直接对应组合目标;中间反馈能让信用分配更密集,但如果奖励“尽快买满”,策略可能偏向便宜装备,而非更好的最终组合。

另一种表示是一次选择整套装备。若有 N 件候选装备、六个位置并允许重复,有序动作空间会增长至 N⁶。这促使我采用分步建模,并进一步思考聚合后的状态是否保留了决策所需的信息。

保持联系

欢迎通过邮件交流研究想法、项目经历与潜在合作。