logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习中的并行方法:ApeX框架 梯度并行,A3C经验并行 | 分布式异步参数更新, 分布式数据生成

有一个主网络和很多的worker。A3C把主网络的参数直接赋予worker中的网络,更新时。该架构依赖于优先记忆重放,只关注actor生成的最重要的数据。强化学习收敛速度慢,采用并行计算可以加快计算速度。与环境进行交互,产生的数据存储在。,对主网络的参数进行更新。

#深度学习#人工智能#计算机视觉
服务器小技能(alias, tmux, htop,gpustat, zsh)

目录alias自定义指令:tmux保持会话:htop查看CPU占用率:连接外网alias自定义指令:适用场景:想要替换某个长长的指令/设置指令的别名步骤:①vim .bashrc 进入用户配置文件② 在 # <<< conda initialize <<<下方添加想要替换的命令,如alias nv="watch -n .1 -d nvidia-smi"就是用nv

文章图片
#服务器#运维#linux
Richard S.Sutton 《强化学习》 学习笔记 第三章

目录第3章 有限马尔科夫决策过程3.1 “智能体-环境”交互接口3.2 目标和收益3.3 回报和分幕(episodes)3.4 分幕式和持续性任务的统一表示法3.5 策略和价值函数第3章 有限马尔科夫决策过程一二章链接MDP涉及了延迟收益,需要在当前收益和延迟收益之间权衡。赌博机问题估计每个动作的价值q∗(a)q_*(a)q∗​(a),MDP问题中估计每个动作a在每个状态s中的价值q∗(s,a)q

#人工智能#机器学习
“Reinforcement Learning based Recommender Systems: A Survey“强化学习用于推荐系统 综述

这是2021预发表的一篇强化用在推荐系统的综述,文中介绍了RLRSs的分类以及多种算法,非常全面。本篇文章只是一个简单的总结,要想详细了解相关知识还是去看看原文吧~1 introduction用于解决推荐问题的方法:collaborative filtering(协同过滤), content-based filtering(基于内容), and hybrid methods(混合)上述方法存在的问

#人工智能
EasyRL 强化学习笔记 7、8章节(DQN进阶,DQN连续动作)

DQN(进阶技巧)Double DQN**原因:**DQN中,Q值往往被高估了。设计了两个Q-network:假设第一个 Q-function 高估了它现在选出来的动作 a,只要第二个 Q-function Q’没有高估这个动作 a 的值,那你算出来的就还是正常的值。假设 Q’高估了某一个动作的值,那也没差,因为只要前面这个 Q 不要选那个动作出来就没事了,这个就是 Double DQN 神奇的地

图神经网络 图卷积网络

整理:图卷积的核心思想是利用『边的信息』对『节点信息』进行『聚合』从而生成新的『节点表示』GNN分为spectral domain和spatial domain:以前是谱域,涉及傅里叶变换、拉普拉斯矩阵等等(从信号与处理迁移过来的),现在逐渐转成空域,更简单一些。图上的空域:拓扑结构图上的频谱:没有一个直观的表示,只能用矩阵相乘的操作来表示。谱域:spectral domain(谱域):设计中间的

#神经网络#网络#深度学习
强化学习中 on-policy与off-policy 的理解;如何区分on-policy 与 off-policy;RL更新策略、policy结构总结

有趣的解释:古时候,优秀的皇帝都秉持着“水能载舟 亦能覆舟”的思想,希望能多了解民间百姓的生活。皇帝可以选择通过微服出巡,亲自下凡了解百姓生活(On-policy),虽然眼见为实,但毕竟皇帝本人分身乏术,掌握情况不全;因此也可以派多个官员去了解情况,而皇帝本人则躺在酒池肉林里收听百官情报即可(Off-policy)。Q-learning vs. Sarsa二者都是基于TD的强化学习策略,但是前者是

#深度学习
EasyRL 强化学习笔记 5、6章节(PPO,DQN)

第五章 PPOFrom On-policy to Off-policy如果要学习的 agent 跟和环境互动的 agent 是同一个的话, 这个叫做on-policy(同策略)。如果要学习的 agent 跟和环境互动的 agent 不是同一个的话, 那这个叫做off-policy(异策略)。policy gradient就是on-policy,必须要收集到很多τ\tauτ,然后更新式子,非常耗时。

#概率论
强化学习中 on-policy与off-policy 的理解;如何区分on-policy 与 off-policy;RL更新策略、policy结构总结

有趣的解释:古时候,优秀的皇帝都秉持着“水能载舟 亦能覆舟”的思想,希望能多了解民间百姓的生活。皇帝可以选择通过微服出巡,亲自下凡了解百姓生活(On-policy),虽然眼见为实,但毕竟皇帝本人分身乏术,掌握情况不全;因此也可以派多个官员去了解情况,而皇帝本人则躺在酒池肉林里收听百官情报即可(Off-policy)。Q-learning vs. Sarsa二者都是基于TD的强化学习策略,但是前者是

#深度学习
天授tianshou安装方法——基于 PyTorch 的强化学习平台;报错No command ‘conda conda-forge解决方法

知乎上看见的这个项目,github链接,下载之后准备安装,但是服务器老是报错,所以写了这篇文章记录一下安装过程。正常安装方法(readme文件):使用pip安装(清华源有时候不行,可以试试北外的源,我的另一篇博客里有讲方法)pip install tianshou使用conda安装conda -c conda-forge install tianshou使用git安装pip install git

#pip#python
    共 24 条
  • 1
  • 2
  • 3
  • 请选择