
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (2)--- On-Policy Distillation
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 — (2)— On-Policy Distillation 一、引言:从策略蒸馏到 On-Policy Distillation在强化学习中,策略蒸馏(Policy Distillation)是一种将复杂教师模型的知识迁移到轻量学生模型的技术。传统蒸馏通常使用离线数据,但存在分布偏移问题——学生模型在训练时遇到
一文读懂 OpenAI Codex 源码的原理、架构与未来
一文读懂 OpenAI Codex 源码的原理、架构与未来 引言OpenAI Codex 是 GPT-3 的后继模型,专门针对代码生成和理解进行优化。作为全栈工程师,理解 Codex 的核心原理和架构,不仅能帮助我们更好地使用它,还能启发我们构建自己的代码智能工具。本文将从实战角度出发,通过源码分析和代码示例,深入剖析 Codex 的工作原理、系统架构,并展望其未来发展方向。## Codex 的核
到底了







