📄️ 概述〇、强化学习整体图景:一张图看懂角色与数据流📄️ 大模型强化学习建模思路OpenAI 大模型强化学习(RLHF)三段式建模流程📄️ 策略梯度法公式推导一、策略梯度法(Policy Gradient)解决了什么问题?📄️ 入门案例:CartPole + REINFORCE(含代码逐行解读)一、本案例的目标📄️ 基线(Baseline)原理与优势函数一、基线到底在解决什么问题?——从「梯度全是正号」说起📄️ 重要性采样:换一个「采样分布」还能算对吗?🎯 一句话定位: