logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Generative Adversarial Imitation Learning(Gail) 论文阅读

原版:对于agent做出的动作a,r(s, a) = − log(1 − D(s, a)) ,被判别器判定越接近专家行为,奖励就越大,这种方式适用于有生存奖励的RL环境,比如说Atari游戏,但对于想尽快结束的环境可能不适合,如果用这种方式也需要结合环境原本奖励并把Gail奖励的系数调低。相较于PPO 其需要一个额外的判别器D,D的作用是用来区分agent做出的动作和expert做出的动作,越接近

文章图片
#论文阅读
虚拟环境找不到包,“ImportError: cannot import name ‘XXX‘”

这个运行配置里面也可以选择虚拟环境,结果就是 你运行的代码是基于这个运行配置里的虚拟环境 而不是你项目设置里的虚拟环境,所以明明装了包,pip list也可以看到,甚至写代码 import 也不会报错,但代码已运行就会报错。

文章图片
#python#windows#开发语言
到底了