从零认识 OpenClaw(龙虾): 一篇给新手看的教学博客
说在前面,这篇文章主要侧重于认识与理解OpenClaw到底是啥,想安装OpenClaw可以把我这篇文章发给ai,让ai生成配置步骤。
一、OpenClaw 到底是什么
如果用一句话解释:
OpenClaw 是一个可以自己装在电脑上的个人 AI 助手平台。
它和普通聊天机器人最大的区别,不只是“能回答问题”,而是它还能接触真实环境,去做事情。比如:
- 接入
Telegram,可以直接在聊天软件里和它说话 - 调用本地工具,读文件、执行命令、查网页
- 按时间执行任务
- 把信息整理后再发回给你
可以把它理解成:
“一个装在自己电脑上的、带手脚的 AI 助手。”
普通聊天框更像“你问一句,它答一句”;
OpenClaw 更像“你给它一个目标,它会结合工具和规则去完成”。
二、它和普通 AI 聊天有什么不同
先举个最简单的对比。
普通聊天 AI
你问:
“今天股市发生了什么?”
它通常只会给你一段回答。
OpenClaw
我问:
“帮我整理今天股市热点,写成一段适合发 贴吧 的帖子。”
理论上它可以这样做:
- 先去查信息
- 再整理成结构化内容
- 如果你给了发布权限,还可以帮你发出去
这就是为什么 OpenClaw 更像“AI 助手平台”,而不是单纯的聊天窗口。
三、理解 OpenClaw,先抓住这几个核心词
很多人第一次接触 OpenClaw,会被一堆词吓到。其实把它们拆开看,至少就应用方面来看,没什么高深的难以理解的知识,事实上,我认为应用方面,基本上计算机涉及到的知识都是这样,名词唬人罢了,当然可能取名的作者并没有这个意思,只是想要用一个词定义一段信息,但是架不住有些人用它们包装自己,所以也就有了唬人的感觉。
1. model
model 就是它背后的“大脑”。
比如我们我自己目前在用的是:
- 主模型:
openai-codex/gpt-5.4 - 兜底模型:
openai/gpt-5.1-codex
可以把它理解成:
OpenClaw是机器人身体model是它思考问题的大脑
没有模型,它就像“身体装好了,但脑子还没接上”。
2. channels
channels 是消息入口和出口。
它决定“从哪里”和 OpenClaw 说话。
总结一下:
-
model决定“它用哪个 AI 大脑” -
channels决定“你从哪里和它互动” -
在
Telegram和它说话,这是一个 channel -
接
Discord对话,那又是另一个 channel
所以它不是智能本身,而是“沟通渠道”。
3. tools
tools 是它真正能动手使用的能力。
目前默认的工具大约有这些:
readeditwriteexecbrowserweb_searchweb_fetchmemory_searchpdf
这些名字看着像程序员术语,但其实可以通俗地理解为“工具箱”:
read: 看文件write: 写文件exec: 在电脑上执行命令browser: 操作浏览器web_search: 搜网页
如果把 OpenClaw 比作一个助理:
model是脑子tools是手里的工具
4. skills
skills 不是工具本身,更像“做事方法说明书”。
主要是这些用途:
- 告诉 agent 什么时候该做什么
- 用什么流程做
- 遇到什么情况该停下来
所以 skill 比较像“工作套路”或“操作手册”,而 tool 才是它真的去调用的能力。
举个例子:
tool像菜刀、锅、火skill像菜谱
没有菜谱也能炒菜,但容易乱;
有了菜谱,动作更稳定。
5. MCP
很多人看到 tools 会问: “这是不是 MCP?”
我的理解是:不完全是。
更准确地说:
- 看到的是 OpenClaw 注入给 agent 的工具能力
- 它们在效果上很像 MCP tools
- 但不等于已经外接了一堆独立的 MCP server
所以别把它们简单画等号。
一句话记忆:
tool是能力skill是方法channel是入口model是大脑MCP是一种更标准化的外部工具协议思路
四、OpenClaw 是怎么装起来的(适用于安装的是旧版本Node的电脑)
OpenClaw安装需要先装node。
我的电脑上因为工作需要,装了node v14.17.1。
但是 OpenClaw 需要更高版本的 Node, 所以我的做法是:
- 不动原本系统里的 Node 环境
- 用官方方式把 OpenClaw 装到用户目录
~/.openclaw - 再把命令链接到
~/.local/bin/openclaw
总的来看,OpenClaw 虽然是 AI 工具,但安装思路仍然是标准工程思路:
“尽量隔离,尽量少影响已有环境。”
如果没装过node,那就很简单了,先装个新版本node,在安装openclaw就行。
五、装好之后,为什么还不能直接聊天
因为“装好平台”不等于“接好大脑”。只能算进入了:
“平台已启动,等待接入模型”
这时候还要做两件事:
- 配模型提供商
- 配交互渠道
我配的就是gpt 5.4,然后又接了 Telegram。
只有这两个都通了,才会有比较完整的体验:
- 模型负责回答
- Telegram 负责收发消息,当然其实也可以命令行形式,使用 openclaw tui
六、为什么 Telegram 接进去后,还要做一次 pairing
这是一个很容易让新手困惑的点。
第一次给 Telegram Bot 发消息时,收到的是:
“access not configured”
这不代表坏了,而是还没授权。
可以把 pairing 理解成“第一次见面先登记身份”。
逻辑很像门禁系统:
- Bot 已经在线
- 但不是谁来发消息都直接放行
- 需要自己先申请
- 管理者批准
- 之后才能正常聊天
这一步的意义在于安全控制。
否则的话,只要知道 bot 的人都能直接和它交互,风险会比较大。
七、为什么 OpenClaw 容易“烧 token”
这个问题基本上是所有 agent 产品都会遇到的问题。
很多人第一次用的时候都会觉得:
“我也没说几句话,怎么 token 掉得这么快?”
核心原因通常不是“回答太长”,而是它每次请求时,带进去的东西太多。
我把这个问题拆开看,大概是下面几类。
1. 固定上下文本身就很大
OpenClaw 每次请求前,不只是带上你刚发的那句话,还会顺手带很多额外信息进去,比如:
- system prompt
- 工具定义
- workspace 里的说明文件
- 当前会话历史
可以把它理解成:
不是“问一句,答一句”那么简单,而是每次都要背着一堆背景资料进场。
2. 会话历史会越聊越长
这个很好理解,聊天越久,历史越多。
如果是 Telegram 这种连续聊天方式,历史很容易越滚越大。
所以我后来专门在配置里加了:
dmHistoryLimit = 24
意思就是:
私聊历史不要无限往后带,只保留一个相对可控的窗口。
3. 工具本身也要占 token
很多人只盯着聊天内容看,其实工具定义本身也很占位置。
默认工具里像下面这些,通常都不算轻:
messagebrowsernodesexecweb_search
原因也不复杂,就是这些工具的说明、参数、schema 往往更长。
4. heartbeat 可能在后台偷偷花钱
heartbeat 可以简单理解成“定时唤醒”。
它的本意是好的,就是让 agent 周期性检查状态、做一些后台动作。
但如果当前的使用场景根本不需要它主动做事,那它就会变成一种纯开销。
我后来就是直接把 heartbeat 关掉了,原因很简单:
平时主要是自己手动聊天和使用,没必要让它在后台定时跑。
5. 一次看起来只发了一条消息,底层可能已经跑了好几轮
这是 agent 和普通聊天产品很不一样的一点。
表面上看,只是发了一条消息。
但底层很可能已经做了这些事:
- 模型先判断要不要用工具
- 调用工具
- 把工具结果重新塞回上下文
- 再生成最终回答
所以很多时候,真正烧 token 的不是“回答长度”,而是“完整处理链路”。
八、我是怎么优化 token 的
这个部分比较实用,因为它不是空谈概念,而是我自己最后真正落下来的配置思路。
1. 限制 Telegram 私聊历史
我加了这段配置:
"channels": {
"telegram": {
"dmHistoryLimit": 24,
"textChunkLimit": 3000
}
}
这两个参数的作用很直接:
dmHistoryLimit: 不让私聊历史无限累积textChunkLimit: 不让单条超长消息把上下文一下子撑太大
2. 给默认 agent 的上下文设上限
我还加了这段:
"agents": {
"defaults": {
"contextTokens": 96000,
"bootstrapMaxChars": 8000,
"bootstrapTotalMaxChars": 40000
}
}
通俗一点理解:
contextTokens: 总预算先卡住,别放得太夸张bootstrapMaxChars: 单个引导文件别写太长bootstrapTotalMaxChars: 整体引导内容也要控制
不然 agent 还没开始干活,前置材料就已经吃掉一大块 token 了。
3. 让 compaction 更早介入
我还设置了:
"compaction": {
"mode": "safeguard",
"keepRecentTokens": 12000,
"recentTurnsPreserve": 6
}
这个配置的思路可以理解成:
别等到上下文膨胀得太厉害了才开始压缩,而是提前做整理。
4. 直接关闭 heartbeat
如果你的使用方式跟我差不多,就是以手动聊天、手动触发为主,那 heartbeat 完全可以先关掉。
这一步不一定适合所有人,但对于我这种使用场景来说,很有效。
九、为什么重开一个新会话也很重要
这个点很容易被忽略。
很多人改完配置以后,马上就在原来的旧会话里继续聊,然后发现:
“怎么感觉也没省多少?”
原因就在这里:
旧会话本身已经带着很多历史了,新配置虽然生效了,但旧包袱还在。
所以我后来还专门做了一步:
/new
本质上就是开一个干净的新会话,让新的规则从头开始生效。
这个逻辑其实很好理解:
- 旧房间已经堆了很多东西
- 你虽然换了收纳规则
- 但最省事的办法,往往还是换一个新房间重新开始
十、如果想让 OpenClaw 自动发一篇热点帖,它会怎么串起这些能力
假设目标是:
“每天自动整理一篇今日股市热点分析,然后发到社区平台。”
这个事情不是靠一个按钮完成的,而是几层能力一起配合。
第一步: cron 负责时间
如果是每天定时发,就需要一个定时器。
这种场景更适合交给 cron,而不是交给 heartbeat。
可以把 cron 理解成:
“闹钟”
它负责的是:
- 什么时候开始
- 多久执行一次
第二步: skill 或 AGENTS.md 负责流程规则
这里可以提前写清楚:
- 每天几点执行
- 去哪里找信息
- 标题和正文怎么组织
- 发之前是否先给我确认
- 如果内容重复要不要跳过
这一步本质上就是把“做事方法”说清楚。
第三步: tools 负责真正动手
比如:
web_search: 搜热点信息web_fetch: 打开网页抓内容browser: 操作网页发帖memory_search: 检查今天是不是已经发过了
这一步就是它真正开始“伸手做事”的阶段。
第四步: model 负责把信息写成帖子
找到信息以后,模型再把它整理成适合发布的内容,比如:
- 标题
- 摘要
- 正文结构
- 风险提示
第五步: 浏览器自动化或 API 负责发出去
如果没有现成的发帖 channel,那通常就走两条路:
- 用浏览器自动化去打开页面并发布
- 或者接一个专门的平台 API 工具
所以这个例子最关键的一点是:
OpenClaw 不是“会聊天”而已,它是把多层能力串起来做一件事。
十一、OpenClaw 代表了什么样的 AI 方向
如果只看表面,OpenClaw 像是一个聊天工具。
但如果往深一点看,它代表的是另一种更像“AI 助理平台”的方向。
我自己的理解是,它大致代表了这样一种组合:
大模型 + 工具调用 + 记忆/上下文 + 工作流/定时 + 外部渠道 + 自动执行
也就是说,AI 不再只是回答一句话,而是开始逐步具备这些能力:
- 理解目标
- 拆分步骤
- 调工具
- 执行动作
- 最后把结果回给你
这也是为什么现在很多人会把这类产品叫做 agent。
不过我也不觉得它已经是“最终形态”了。
它离真正稳定、成熟、长期可托付的 AI 系统,还有不少距离。
难点至少包括:
- 长期上下文不好做
- 工具调用稳定性还不够
- 权限和安全问题很复杂
- token 成本不低
- 长流程很容易漂移
所以更准确一点说,今天的 OpenClaw 更像是:
“一个已经很能代表未来方向,但还远没到终局的早期 AI agent 原型。”
十二、给初学者的一个实用理解框架
如果是第一次接触 OpenClaw,我觉得不用一上来就研究太多高级概念,先抓住下面这套框架就够用了。
先搞清楚它是什么
它不是普通聊天框,而是一个可以接模型、接渠道、接工具、接任务的 AI 助手平台。
再搞清楚它靠什么运行
model提供智能channel提供入口tool提供行动能力skill提供做事方法
最后搞清楚为什么会变贵
因为它不只是回复一句话,而是每次都可能在背后带上:
- 工具定义
- 系统提示
- 会话历史
- 引导文件
- 后台机制
十三、写在最后
如果把普通 AI 比作“一个会说话的人”,
那 OpenClaw 更像“一个能接触现实环境、带着工具箱、按规则做事的数字助理”。
这也是为什么它既强大,也更复杂。
对初学者来说,最好的入门方式不是一开始就去啃所有术语,而是先把这几个问题想清楚:
- 模型接好了没有
- 从哪里和它交互
- 它能调用哪些工具
- 为什么 token 会花得快
- 哪些后台机制应该开,哪些应该关
这几件事一旦想明白,后面再去看 Telegram、tools、skills、MCP、cron 这些词,就不会觉得乱了。
对我来说,理解 OpenClaw 的顺序也差不多就是这样:
先装起来,再把模型和渠道接通,再处理 token 和后台机制,最后才去想自动化、工具链和 agent 这类更大的问题,我现在也是在摸索阶段,如果你有独到的见解,欢迎评论区讨论。
更多推荐



所有评论(0)