logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

SeqGAN: Sequence Generative Adversarial Nets with Policy Gradient读书笔记

标准的GAN在处理离散数据时遇到的问题:生成器难以传递梯度更新;鉴别器难以评估非完整序列。对于前者,作者把整个GAN看作一个强化学习系统,用policy gradient更新生成器的参数;对于后者,作者借鉴了蒙特卡洛树的思想,对任意时刻的非完整序列都可以进行评估;生成器:目标函数-各个状态价值的和,状态价值怎么算?策略函数×动作价值,策略函数是用策略网络训练出来的,动作价值不知道怎么办?用roll

#自然语言处理#生成对抗网络
到底了