
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
文献阅读:RL算法GPG
策略梯度基础:RL 的目标是最大化期望回报JθmaxθEπθ∑t0TrtJθmaxθEπθ∑t0Trt。根据策略梯度定理,这可以通过估计梯度∇θJθEπθ∇θlogπθat∣stAπθstat∇θJθEπθ∇θlogπθat∣stAπθstat)]来实现。优势函数。
实操笔记:vscode+opencode+deepseek
最近配置了一下vscode+opencode,非常简单,记录分享一下。
实操笔记:vscode+opencode+deepseek
最近配置了一下vscode+opencode,非常简单,记录分享一下。
到底了







