
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【强化学习】Hands-on Modern RL项目实践|GRPO 算法完整解析
GRPO(Group Relative Policy Optimization)是一种旨在替代PPO中Critic网络的方法,通过组内比较计算相对优势,解决了PPO在大模型训练中的显存占用高、训练不稳定和工程复杂度问题。其核心机制包括在线组采样、规则打分、组内优势计算和PPO裁剪更新。GRPO省去了独立的Critic网络,显存占用降低30~40%,且支持纯RL训练(如DeepSeek-R1-Zer

【Deepseek Harness】 如何接入 NVIDIA 免费 GLM-5.2/Minimax-m3 全流程实录
本文详细介绍了如何在DeepSeek Harness(DSH)中接入免费的NVIDIA GLM5.2和MiniMax-M3模型,并为其添加多模态图片识别能力。主要内容包括:1)获取NVIDIA API Key的步骤;2)在DSH中添加自定义Provider的方法;3)通过修改配置文件开启多模态输入功能;4)常见问题及解决方案。文章特别指出GLM5.2通过NVIDIA API不支持图片识别,建议使用

【DeepSeek Harness】从安装到使用完整指南
DeepSeek Harness(命令行简称dsh)是 DeepSeek AI 开源的一个 Agent Harness(智能体运行框架)。它采用"一切皆插件"(Everything is a Plugin)的架构理念,底层由Cordis驱动,相关设计思想可参考论文《A Programming Paradigm for Spatiotemporal Composability》。需要注意的是,该项目
【大模型部署】手把手教你用 Transformers 库部署开源大模型:以 Qwen3 为例
本文为初学者提供了阿里Qwen3系列大语言模型(LLM)本地部署的完整流程指南。

【Claude Code】命令大全:CLI、Slash Commands、参数详解与实战指南
ClaudeCode命令速查指南。

到底了







