PPO(Proximal Policy Optimization)まとめ 投稿日: 2023-07-212023-08-18 投稿者: lib-arts 方策勾配法の学習の安定化にあたっては、TRPO(Trust Region Policy Optimization)やPPO(Proximal Policy Optimization)のようにステップ幅の調整が解決策になり… 全文を読む