logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【强化学习】Hands-on Modern RL项目实践|GRPO 算法完整解析

GRPO(Group Relative Policy Optimization)是一种旨在替代PPO中Critic网络的方法,通过组内比较计算相对优势,解决了PPO在大模型训练中的显存占用高、训练不稳定和工程复杂度问题。其核心机制包括在线组采样、规则打分、组内优势计算和PPO裁剪更新。GRPO省去了独立的Critic网络,显存占用降低30~40%,且支持纯RL训练(如DeepSeek-R1-Zer

文章图片
#算法#人工智能#语言模型 +1
【Deepseek Harness】 如何接入 NVIDIA 免费 GLM-5.2/Minimax-m3 全流程实录

本文详细介绍了如何在DeepSeek Harness(DSH)中接入免费的NVIDIA GLM5.2和MiniMax-M3模型,并为其添加多模态图片识别能力。主要内容包括:1)获取NVIDIA API Key的步骤;2)在DSH中添加自定义Provider的方法;3)通过修改配置文件开启多模态输入功能;4)常见问题及解决方案。文章特别指出GLM5.2通过NVIDIA API不支持图片识别,建议使用

文章图片
#人工智能#python#深度学习 +1
【DeepSeek Harness】从安装到使用完整指南

DeepSeek Harness(命令行简称dsh)是 DeepSeek AI 开源的一个 Agent Harness(智能体运行框架)。它采用"一切皆插件"(Everything is a Plugin)的架构理念,底层由Cordis驱动,相关设计思想可参考论文《A Programming Paradigm for Spatiotemporal Composability》。需要注意的是,该项目

#人工智能#python
【大模型部署】手把手教你用 Transformers 库部署开源大模型:以 Qwen3 为例

本文为初学者提供了阿里Qwen3系列大语言模型(LLM)本地部署的完整流程指南。

文章图片
#开源#人工智能#深度学习 +1
到底了