logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

文献阅读:RL算法GPG

策略梯度基础:RL 的目标是最大化期望回报Jθmax⁡θEπθ∑t0TrtJθmaxθ​Eπθ​​∑t0T​rt​。根据策略梯度定理,这可以通过估计梯度∇θJθEπθ∇θlog⁡πθat∣stAπθstat∇θ​JθEπθ​​∇θ​logπθ​at​∣st​Aπθ​st​at​)]来实现。优势函数。

#论文阅读
实操笔记:vscode+opencode+deepseek

最近配置了一下vscode+opencode,非常简单,记录分享一下。

#vscode#ide
实操笔记:vscode+opencode+deepseek

最近配置了一下vscode+opencode,非常简单,记录分享一下。

#vscode#ide
到底了