タグ: PPO

PPO(Proximal Policy Optimization)まとめ

投稿日: 2023-07-212023-08-18 投稿者: lib-arts

方策勾配法の学習の安定化にあたっては、TRPO(Trust Region Policy Optimization)やPPO(Proximal Policy Optimization)のようにステップ幅の調整が解決策になり…