
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本人之前一直学的是监督学习,最近开始研究自动驾驶的决策规划,涉及强化学习,发现强化学习的概念相比之下很多,并且很乱,经常被一些Q函数,Value函数,on-policy,off-policy等概念弄得头昏脑胀。因此,从自动驾驶决策规划的角度出发,把强化学习涉及的概念和算法系统梳理一下,打算以系列的方式,边学边更新。(个人的理解都用加粗标出)

本文用一图流整理了Git常用指令及核心概念,重点区分四个空间:工作目录、暂存区、本地仓库和远程仓库。摘要包括:基础操作(init/clone/add/commit)、分支管理(branch/checkout/merge)、标签使用、远程仓库管理(remote/push/pull)以及标准开发流程。特别提醒注意tag与branch的区别,并给出了避免detached HEAD状态的解决方案。文章以简
nuScenes数据集中各种数据定义,如scene,sample,sweep,sample_data,attribute等,对于初学者来说十分头疼,本人在最近也是学习了好久,想与大家分享一些自己的心得。

由于本人目前在研究端到端自动驾驶,不过算力有限,因此打算在autodl上部署复现一下经典的UniAD,但是踩了许多坑。特此写下来记录一下(与官方文档不同的部分用红色标出),也方便大家复现,少走弯路。

本文分享了DiffusionPlanner自动驾驶路径规划项目的数据处理优化方案。针对原代码处理速度慢的问题,主要修改了data_process.py和map_process.py两个文件:1) 在data_process.py中改用多进程并行处理,利用32个CPU核心加速;2) 优化map_process.py中的地图处理逻辑。经过优化后,在Xeon Gold 6459C CPU上处理30多万个
最近对安全强化学习(safe RL)比较感兴趣,不过发现针对于安全强化学习的代码开源较少,且各有各的实现风格,于是自己针对PPO编写了PPO lagrangian,特地分享出来与大家探讨学习。代码已发布在。# 定义 Critic 网络(用于奖励值估计)return v_s# 定义 SafeCritic 网络(用于安全代价估计)希望能帮到大家!GitHub上的代码大家觉得好,也可以多多star!








