logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习论文(PPO)

在强化学习中,经常会面临梯度更新过大,导致训练不稳定,甚至崩溃的问题。为了解决该问题,诞生了TPRO(Trust Region Policy Optimization,TRPO)算法。TPRO算法实现起来比较复杂,需要二阶优化,并且与包括噪声(诸如丢弃)或参数共享(在策略和值函数之间,或与辅助任务)的架构不兼容。针对这些问题,本论文提出了PPO算法。

#计算机视觉#人工智能
强化学习(5)--蒙特卡罗方法

本文介绍了基于赵世钰《强化学习数学基础》的蒙特卡洛学习方法。当环境模型未知时,需依靠数据实现model-free学习。MCBasic算法通过采样episode估计动作价值函数(而非状态价值),避免了依赖环境模型。进阶方法MC Exploring Starts通过every-visit采样提高数据利用率,采用epsilon-greedy策略平衡探索与利用,并通过衰减系数逐步降低探索率以稳定收敛。这些

文章图片
#人工智能#机器学习
嵌入式Linux开发环境搭建

Samba服务器的工作原理是:客户端向Samba服务器发起请求,请求访问共享目录,Samba服务器接收请求,查询smb.conf文件,查看共享目录是否存在,以及来访者的访问权限,如果来访者具有相应的权限,则允许客户端访问,最后将访问过程中系统的信息以及采集的用户访问行为信息存放在日志文件中。使用NFS可以使应用程序的开发变得十分方便, 客户端不需要大容量的存储器,更不需要进行映像文件的烧录和下载,

文章图片
#linux#服务器#ssh +1
【BLDC驱动】分析同步续流与体二极管续流

驱动方式大致可以描述为,高电压端PWM驱动上桥,且高电压端以反向PWM驱动下桥,低电压端以普通IO口驱动下桥。电机转动线圈切割永磁体的磁场,在U、V、W三端产生相对电压,如果将2端或3端连接,形成回路,动能就可以转化为电能然后转化为热能,仍然以A-B相导通为例,在一个PWM周期内,当PWM由高电平进入低电平,也就是Q1由导通变为关断,此时原回路消失,仍然以A-B相导通为例,在一个PWM周期内,当P

文章图片
#单片机#嵌入式硬件#mcu
到底了