logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

强化学习策略梯度(Policy Gradient)太空火箭着陆示例,代码参照李宏毅HW12,新版修正

将对数概率张量堆叠成一个二维张量<-->[tensor(...),tensor(...)...]-->tensor([.........])img.set_data(env.render(mode='rgb_array'))#更新img对象的像素数据。torch.cuda.manual_seed_all(seed)#Pytorch 所有GPU算子设置种子。torch.cuda.manual_see

#python#机器学习#深度学习 +1
多模态大模型+微调的idea

进一步地,本文将该思想拓展至多模态建模场景,提出跨领域稀疏子网络兼容与融合范式:对视觉、语言、音频、生成建模等各领域专用大模型的稀疏子网络进行符号空间统一与结构对齐,构建包含领域专属最优子网络的超级网络,并通过动态路由机制实现面向不同任务的子网络按需激活。由于现实任务具有高度多样性与领域差异性,不同任务往往对应结构与符号分布存在显著差异的最优稀疏子网络,现有Xavier、He等经典初始化方法仅关注

#深度学习
到底了