
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
你得搞清楚,自己手上这件事,到底踩在它会的那一片,还是不会的那一片。Karpathy 的做法是反着来的,他用 LLM 逼自己换角度重看同一件事,每一次新投影,都是在锻炼自己的理解,而不是替代自己的理解。他在意的是适应速度本身:能不能跟上工具的变化、能不能搞清楚模型落在哪一片能力分布里、能不能给这个幽灵搭一套能验证它的流程、能不能在所有人都在外包思考的时候,仍然守住自己的理解。更接近未来的考法是这样
这里的 harness 负责准备环境、应用 patch、执行测试、汇总结果。前面讲 Agent 评测时,我提到:评测 Agent 不能只看最终答案,还要看它用了什么工具、拿到了什么结果、有没有按任务要求完成。有了这套结构,我们就不只是“试一下 Agent 好不好用”,而是能分析问题出在任务理解、工具选择、参数填写、结果读取、步骤冗余,还是评分规则本身不清楚。这样我们看到的就不只是一句回答,而是一条
每一个 wrapper、reset、verifier、planner、memory rule、permission gate,本质上都代表一个假设:模型自己做不好,所以我在外面加一层控制。第一个是成本、质量、速度三角。要记录模型输出、工具调用、工具返回、环境状态变化、上下文快照、错误、重试、恢复动作、token 使用、延迟和成本。谁的执行环境更稳,谁的工具协议更清晰,谁的上下文更不容易漂,谁的 t
GA 只保留 9 个原子工具,覆盖文件操作、代码执行、网页交互、记忆管理、人机协作,任务成功率 100%。上周刚教会的操作,这周又忘了,每次都像第一次见面。没有子 Agent 管理器、事件总线、调度守护进程,但子 Agent 分发、看门狗监控、定时任务调度全都能做。但中文社区几乎没有文档,新手想上手只能啃源码、翻 Issue、泡社区,大量时间花在"搞清楚怎么用"上,而不是真正用它解决问题。不需要有
Datawhale干货作者:郑程睿,算法工程师最近,具身智能的概念很火。那什么是具身智能呢?它又有什么用?一文带你了解。今天是下篇,聚焦人机交互、未来发展。上篇见《一篇具身智能的最新全面综述!(上)》本文部分参考中国信息通信研究院和北京人形机器人创新有限公司的《具身智能发展报告》具身智能的人机交互在机器主动感知与认知的具身交互中,具身智能系统借鉴大脑记忆、自主学习与预测机制,结合感知器件的物..
深度强化学习实验室官网:http://www.neurondance.com/论坛:http://deeprl.neurondance.com/编辑:OpenDeepRLOpenAI Gy...
在传统的机器人研究中,不同实验室使用各异的硬件平台,难以统一且部署复杂,极大限制了评测的灵活性和规模性,导致算法性能对比缺乏公平性。它不仅考察了算法的最终执行结果,还深入挖掘了任务执行中的各个环节,真正系统地揭示了每个算法在不同方面的优缺点,为后续算法优化提供了更加针对性的反馈。这样一来,算法评估的精度和可复现性得到了大大提升。通过RoboChallenge的评测,我们可以清楚地看到,Pi05在精
Datawhale干货作者:知乎King James,伦敦国王大学知乎 |https://www.zhihu.com/people/xu-xiu-jian-33前言:上篇介绍了什么是...
创建一个 Claude Project(类似自定义 GPT),设定好写作风格和关键词规则,以后每次只需要粘贴视频字幕,就能自动生成符合 SEO 标准的博客文章。不需要懂代码,只要把你的产品信息粘贴给 Claude,它就能生成一个专业的营销页面。直接在对话框里说“创建一个番茄钟计时器”,Claude 就能生成一个可以直接使用的网页应用,还能根据你的要求添加动画效果、游戏化元素。不懂编程也能做出自己的
—文件操作、shell、git、网页搜索、子智能体、MCP 服务器,连 Anthropic 主推的 SKILL.md 技能机制都原样支持。:一个用 Rust 写的、住在终端里的编程 Agent,背后跑的是 DeepSeek V4。他还用 DeepSeek 把宣传推文翻译成了中文,给国内用户写了专门的中文 README。一个搞科学的,业余玩音乐。现在有个老外,用 DeepSeek 做了一个同款——开







