ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

RL-10-赵-Actor-Critic算法04-离线算法01:将算法从on转为off

RL-10-赵-Actor-Critic算法04-离线算法01:将算法从on转为off RL-赵-(十)-Actor-Critic02:Actor-Critic离线算法【将算法从on转为off:利用已有的分布为p1的采样{x}样本通过“重要性采样”来计算分布为p0时的期望值】到目前为止AC的方法还有policy gradient方法都是on-policy的。如果之前有一些经验了 我们想用这些经验该怎么办呢?我们可以用off-policy的actor-critic的方法。Policy gradient是on-policy,因为梯度
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进