logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【零基础强化学习】第一阶段:基础 DQN

MountainCar 是一个经典的强化学习环境,目标是通过控制小车的加速方向(向左/向右/不加速),使其从山谷底部到达右侧山顶(旗帜位置)。挑战:小车动力不足,无法直接冲上坡,需要利用重力在两侧坡面之间来回摆动积蓄能量。成功标准:总奖励 > -110(约 140 步内到达山顶)

文章图片
#人工智能#深度学习#python
用大模型进行数据标注

推理任务的数据标注是一场对逻辑严谨性的极致追求。它要求我们不仅设计出引导正确思考路径的思维链,还需对思考过程本身进行细粒度监督,并通过严格的培训与量化体系确保每一步标注都经得起逻辑推敲。从依赖昂贵人工的PRM800K,到自动化高效的OmegaPRM,再到领悟“推理模式”即可的PARO框架,技术演进的核心始终是:如何以可持续的成本,为模型注入更可靠、更深刻的推理能力。

#机器学习#人工智能#深度学习
说一说Agent Loop、Harness以及Loop Engineering

当你在命令行让它排查测试失败并提出修复方案时,它底层的 Loop 轨迹往往是这样推进的:先读报错日志,接着搜相关文件,然后修改代码,再去跑 npm run test 测试命令。决定一个 Agent 系统在生产环境中好不好用的,往往不是大模型单次推理的智商,而是这个循环的反馈机制设计得是否巧妙,Harness 提供的沙箱和工具链是否足够稳固,以及 Loop Engineering 所做出的那些工程权

文章图片
#人工智能#python
OpenClaw:从“能说会道”到“能说会做”,AI 数字员工的工程落地之路

OpenClaw不是一个AI神话,它的Agent范式没有升级,模型能力也没有迎来突破,本质上只是把大模型的推理能力接到了一套可控的执行系统上。用博客中大佬的一句话说,之前Workflow能做的事,OpenClaw能做;之前Workflow不能做的事,OpenClaw自然也不能做。但它的真正价值在于,把从方案到动作这一步做得系统化、工程化、可规模化。它不是一把万能钥匙,但它是一把趁手的工具,如果你知

文章图片
#人工智能
说一说Agent Loop、Harness以及Loop Engineering

当你在命令行让它排查测试失败并提出修复方案时,它底层的 Loop 轨迹往往是这样推进的:先读报错日志,接着搜相关文件,然后修改代码,再去跑 npm run test 测试命令。决定一个 Agent 系统在生产环境中好不好用的,往往不是大模型单次推理的智商,而是这个循环的反馈机制设计得是否巧妙,Harness 提供的沙箱和工具链是否足够稳固,以及 Loop Engineering 所做出的那些工程权

文章图片
#人工智能#python
从“养龙虾”到“驯野马”:当AI Agent学会干活,Harness工程如何成为最后一公里的缰绳

在AI Agent的研发圈子里,一个新概念正在被反复提起:Harness Engineering,中文可以翻译成“驾驭工程”。它指的是在AI系统中,除了模型本身之外,所有用来保障系统稳定交付、可靠执行任务的工程组件总和。如果说模型是引擎,那Harness就是方向盘、刹车、燃油系统和仪表盘,没有它,再强的引擎也无法安全上路。我们不妨先回顾一下AI工程化的三个演进阶段,这能帮我们更好地理解Harnes

文章图片
#人工智能
Hermes Agent是什么?当AI Agent学会“自我进化”

把四个产品放在一起看,一个清晰的格局就出来了:Claude Code和Codex是“垂直深耕型”——专注代码场景,模型能力顶级,但场景边界明确,没有跨会话记忆和跨平台能力。OpenClaw是“横向覆盖型”——生态最大、渠道最全、技能最丰富,但安全漏洞频发。Hermes则是“自进化纵深型”——不求大而全,但在记忆系统和自我学习上做了深度工程,让Agent越用越聪明,越用越懂你。Hermes Agen

文章图片
#人工智能#python#程序人生 +1
【零基础强化学习】第一阶段:基础 DQN

MountainCar 是一个经典的强化学习环境,目标是通过控制小车的加速方向(向左/向右/不加速),使其从山谷底部到达右侧山顶(旗帜位置)。挑战:小车动力不足,无法直接冲上坡,需要利用重力在两侧坡面之间来回摆动积蓄能量。成功标准:总奖励 > -110(约 140 步内到达山顶)

文章图片
#人工智能#深度学习#python
用大模型进行数据标注

推理任务的数据标注是一场对逻辑严谨性的极致追求。它要求我们不仅设计出引导正确思考路径的思维链,还需对思考过程本身进行细粒度监督,并通过严格的培训与量化体系确保每一步标注都经得起逻辑推敲。从依赖昂贵人工的PRM800K,到自动化高效的OmegaPRM,再到领悟“推理模式”即可的PARO框架,技术演进的核心始终是:如何以可持续的成本,为模型注入更可靠、更深刻的推理能力。

#机器学习#人工智能#深度学习
【零基础强化学习】第一阶段:基础 DQN

MountainCar 是一个经典的强化学习环境,目标是通过控制小车的加速方向(向左/向右/不加速),使其从山谷底部到达右侧山顶(旗帜位置)。挑战:小车动力不足,无法直接冲上坡,需要利用重力在两侧坡面之间来回摆动积蓄能量。成功标准:总奖励 > -110(约 140 步内到达山顶)

文章图片
#人工智能#深度学习#python
    共 17 条
  • 1
  • 2
  • 请选择