
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
SeqGAN: Sequence Generative Adversarial Nets with Policy Gradient读书笔记
标准的GAN在处理离散数据时遇到的问题:生成器难以传递梯度更新;鉴别器难以评估非完整序列。对于前者,作者把整个GAN看作一个强化学习系统,用policy gradient更新生成器的参数;对于后者,作者借鉴了蒙特卡洛树的思想,对任意时刻的非完整序列都可以进行评估;生成器:目标函数-各个状态价值的和,状态价值怎么算?策略函数×动作价值,策略函数是用策略网络训练出来的,动作价值不知道怎么办?用roll
Linux虚拟环境安装cuda、cudnn、pytorch
conda虚拟环境中安装cuda和cudnn
到底了







