# 强化学习PPO（Proximal Policy Optimization）算法原理

**URL:** <http://forum.beginner.center/t/topic/2761>\
**Category:** 🛠工具与编程\
**Tags:** 强化学习, proximal-policy-optimization\
**Created:** [2026 年4 月 29 日 04:04 UTC](http://forum.beginner.center/t/topic/2761 "2026-04-29T04:04:57Z")\
**Posts on this page:** 1\
**Page:** 1

<div class="post-metadata">

**Author:** ![doggie](http://forum.beginner.center/user_avatar/forum.beginner.center/doggie/32/550_2.png) [@doggie](http://forum.beginner.center/u/doggie)\
**Post date:** [2026 年4 月 29 日 04:04 UTC](http://forum.beginner.center/t/topic/2761/1 "2026-04-29T04:04:57Z")

</div>

## 原理

 ![图片](https://discoursecdn.beginner.center/original/2X/2/22cce8d0d984ad3cbc9c134871e51e53ce69f545.jpeg)

 ![图片](https://discoursecdn.beginner.center/original/2X/8/8a7dc37a86802e7b24c864a5cc1febb57479bf93.jpeg)

 ![图片](https://discoursecdn.beginner.center/original/2X/f/f0cc87ba125db7d56007a9b1f0db4302ba71f7d2.jpeg)

## 参考

[零基础学习强化学习算法：ppo\_哔哩哔哩\_bilibili](https://www.bilibili.com/video/BV1iz421h7gb)
