OpenClaw与GPT-5.4:构建能操控电脑的AI智能体实战指南
1. 项目概述:当AI学会“动手”,OpenClaw如何重塑人机交互
最近在AI圈子里,OpenClaw这个名字的热度有点高。起因是GPT-5.4这个模型,被不少人拿来和它结合,搞出了一个“原生操控电脑”的演示。视频里,AI不仅能理解你的自然语言指令,还能直接操作鼠标键盘,打开软件、编辑文档、搜索信息,一气呵成。这感觉就像给你的电脑配了一个能听懂人话、会自己动手的“数字员工”。我花了些时间,从环境搭建到功能实测,完整地走了一遍流程。这篇文章,我就以一个开发者的视角,和你聊聊OpenClaw到底是什么,它和GPT-5.4这类大模型结合后能玩出什么花样,以及在实际部署和开发中,你会遇到哪些“坑”,又该如何优雅地跨过去。
简单来说,OpenClaw是一个开源的AI智能体(AI Agent)框架。它的核心目标,是让大语言模型(LLM)不再仅仅是一个“聊天大脑”,而是成为一个能“动手操作”的智能体。传统的AI应用,模型给出建议或代码,最终执行还是要靠人。而OpenClaw试图搭建一座桥梁,将模型的“思考”直接转化为对操作系统(如Windows、macOS)或特定应用程序(如浏览器、IDE)的“动作”。这次引起热议的“GPT-5.4原生操控电脑”,本质上就是利用GPT-5.4(或类似能力的模型)作为决策核心,OpenClaw作为执行引擎,实现的一个高级AI Agent场景。
那么,这适合谁来看呢?如果你是对AI Agent开发感兴趣的开发者,想了解如何将大模型能力落地到自动化任务中;或者你是效率工具爱好者,想探索下一代人机交互的可能性;亦或是你单纯好奇“AI操控电脑”背后的技术原理,那么接下来的内容应该能给你不少干货。我会避开那些浮于表面的宣传,深入到配置细节、原理思考和实战经验里。
2. 核心架构与工作原理拆解:从“思考”到“点击”的旅程
要理解OpenClaw,我们不能把它看成一个黑盒。它的工作流程,清晰地划分了“决策”和“执行”两个阶段,中间通过一套精巧的“工具”定义进行连接。
2.1 智能体(Agent)的核心循环:规划、工具调用、观察
OpenClaw的智能体遵循一个经典且有效的循环: 规划(Plan)-> 工具调用(Tool Call)-> 观察(Observe) 。
-
规划 :智能体接收到用户的自然语言指令(例如:“帮我查一下明天北京的天气,然后总结成一句话发到我的记事本里”)。它首先会利用大语言模型(如GPT-5.4)来理解这个复杂指令,并将其分解成一系列可执行的原子步骤。比如,模型可能会规划出:步骤一:打开浏览器;步骤二:导航到天气网站;步骤三:搜索“北京 明天 天气”;步骤四:从网页中提取温度、天气状况信息;步骤五:打开记事本软件;步骤六:将提取的信息组织成一句话并输入。
-
工具调用 :规划好步骤后,智能体需要“动手”了。但它自己并没有手,它依靠的是预先定义好的“工具”(Tools)。OpenClaw的强大之处在于,它提供了一套丰富的、用于操控电脑的基础工具库。例如,
open_browser工具、navigate_to_url工具、control_mouse工具、type_text工具等。智能体会根据当前步骤,选择最合适的工具,并生成调用这个工具所需的精确参数(如鼠标要移动到的坐标、要输入的文本内容)。 -
观察 :工具执行后,会返回一个结果。这个结果可能是成功/失败的状态码,也可能是从屏幕上捕获的新信息(比如网页加载完成后的HTML内容,或者屏幕上某个区域的截图)。智能体接收到这个观察结果,将其作为新的上下文,结合最初的指令和已完成的步骤,进行下一轮的“规划”。比如,在收到“浏览器已打开”的观察结果后,它就会规划下一步“导航到天气网站”。
这个循环会持续进行,直到智能体判断用户的原始指令已全部完成,或者遇到无法解决的问题为止。整个过程中,大语言模型扮演着“指挥官”和“策略师”的角色,而OpenClaw则提供了“士兵”(工具)和“通信协议”(工具调用框架)。
2.2 OpenClaw的工具箱:不只是模拟鼠标键盘
很多人一听“操控电脑”,第一反应就是模拟鼠标点击和键盘输入。这确实是基础,但OpenClaw的工具箱远不止于此。它从不同层次抽象了对计算机的控制能力:
- 操作系统级控制 :这是最底层的工具,包括
mouse_move,mouse_click,keyboard_type,keyboard_hotkey等。它们直接调用系统API来模拟人工操作。优点是通用性强,几乎可以操作任何图形界面软件;缺点是脆弱,容易因为窗口位置变化、加载延迟而失败。 - 应用程序接口(API)集成 :对于某些支持自动化接口的软件,OpenClaw提供了更高级的工具。例如,直接通过COM接口控制Microsoft Office,通过开发者工具协议(CDP)控制Chrome浏览器。这种方式更稳定、更快速,因为它绕过了图形界面,直接与软件逻辑交互。例如,
extract_page_text工具可以直接从浏览器内存中获取文本,而无需通过OCR识别屏幕。 - 计算机视觉(CV)辅助 :为了应对图形界面自动化中的不确定性,OpenClaw集成了视觉能力。例如,
find_element_on_screen工具可以结合截图和图像识别技术,在屏幕上寻找特定的按钮、图标或文字区域,然后计算出其坐标供鼠标点击。这大大增强了智能体在动态界面中的鲁棒性。 - 自定义工具扩展 :这是OpenClaw作为框架最灵活的部分。开发者可以根据自己的需求,用Python轻松定义新的工具。比如,你可以创建一个
query_database工具,让智能体直接查询公司内部数据库;或者创建一个send_email工具,集成邮件发送功能。任何你能用代码实现的操作,都可以封装成一个工具,供智能体调用。
注意 :工具的设计粒度是关键。工具太粗(如
complete_weather_task),模型就失去了灵活组合的能力;工具太细(如move_mouse_1_pixel),又会给模型规划带来巨大负担。OpenClaw官方工具库的设计提供了一个很好的平衡参考。
2.3 GPT-5.4的角色:为何是“天选模型”?
这次演示中,GPT-5.4被冠以“天选模型”的称号,并非空穴来风。在OpenClaw的架构中,大模型需要具备几种关键能力:
- 复杂指令分解与规划能力 :用户的需求往往是模糊和复杂的。模型必须能将其分解为清晰的、线性的或带有条件判断的步骤序列。GPT-5.4在代码生成和逻辑推理上的强化,使其在任务规划方面表现突出。
- 精准的工具选择与参数生成能力 :模型需要理解每个工具的功能、输入和输出。当规划到“搜索天气”这一步时,它必须能正确选择
navigate_to_url或type_text_in_search_box这样的工具,并生成准确的URL或搜索关键词作为参数。这要求模型对工具描述有深刻的理解。 - 强大的上下文理解与状态管理能力 :在整个多步执行过程中,模型需要记住之前的步骤、观察到的结果以及用户的原始意图。GPT-5.4的长上下文窗口和优秀的上下文关联能力,保证了任务执行不会跑偏。
- 对“图形界面”的隐含知识 :虽然不直接“看到”屏幕,但模型通过工具返回的文本信息(如网页HTML、软件界面元素名称)和可能的视觉描述,需要推断出当前的界面状态。GPT-5.4在训练数据中包含了大量关于软件和网页交互的知识,这有助于它做出合理决策。
相比之下,一些更早或更小规模的模型,可能在工具调用的格式遵循、多步规划的逻辑一致性上容易出错。因此,选择一个能力强、指令遵循好的大模型作为“大脑”,是OpenClaw智能体能否顺畅工作的决定性因素之一。当然,除了GPT-5.4,Claude 3系列、DeepSeek最新版本等模型,经过精心的提示词工程,也能取得不错的效果。
3. 从零开始部署与实战:搭建你的第一个桌面AI助手
理论讲得再多,不如亲手跑一遍。下面我就带你从零开始,搭建一个最基本的OpenClaw环境,并实现一个简单的自动化任务。我会以Windows系统为例,因为它是桌面自动化的主要战场。
3.1 环境准备与安装避坑指南
首先,你需要一个Python环境(建议3.9以上版本)。然后,通过pip安装OpenClaw:
pip install openclaw
听起来很简单?但这里往往是第一个坑。OpenClaw依赖一些系统级的库,特别是用于屏幕捕获和鼠标键盘控制的库。
- Windows系统 :你可能会遇到
pywin32安装或运行时的问题。一个可靠的解决方法是,先通过pip安装pywin32,但如果运行时报错找不到模块,可能需要以管理员身份运行命令提示符,并执行pywin32_postinstall.py -install,这个脚本通常位于Python的Scripts目录下。 - macOS系统 :需要提前授权Python或终端应用辅助功能权限(控制电脑)。在“系统设置”->“隐私与安全性”->“辅助功能”中,添加你的终端应用(如Terminal或iTerm2)。
- Linux系统 :需要安装
xlib等相关库,例如在Ubuntu上可以运行sudo apt-get install python3-tk python3-dev libx11-dev。
安装完成后,一个更重要的步骤是配置你的大模型API。OpenClaw支持OpenAI API格式的兼容接口。你需要在环境变量中设置你的API密钥:
# 在命令行中临时设置(仅当前会话有效)
set OPENAI_API_KEY=你的-api-key-here # Windows
export OPENAI_API_KEY=你的-api-key-here # macOS/Linux
# 或者,更推荐的做法是创建一个`.env`文件在项目根目录
# 内容为:OPENAI_API_KEY=你的-api-key-here
# 然后在代码中通过python-dotenv加载
实操心得 :强烈建议使用
.env文件管理密钥,并将其加入.gitignore,避免密钥泄露。另外,对于国内开发者,如果直接连接OpenAI有困难,需要配置API的base_url指向可用的代理网关,这部分配置通常在初始化OpenClaw的LLM客户端时完成。
3.2 第一个智能体:让AI帮你打开网站并搜索
我们来创建一个最简单的智能体,它的任务是“打开百度首页,并搜索OpenClaw”。
首先,创建一个Python脚本,比如 first_agent.py 。
import asyncio
from openclaw import Agent
from openclaw.tools import mouse, keyboard, browser, vision
from openclaw.llm import OpenAIClient
# 1. 初始化大模型客户端
# 注意:这里假设你的API密钥已通过环境变量OPENAI_API_KEY设置
llm_client = OpenAIClient(model="gpt-4o") # 可以使用gpt-4o, gpt-4-turbo等
# 2. 定义工具包。OpenClaw内置了许多工具,我们按需导入。
tools = [
browser.open_browser,
browser.navigate_to_url,
keyboard.type_text,
keyboard.press_enter,
vision.find_text_on_screen, # 用于可能需要的视觉确认
]
# 3. 创建智能体,并告诉它可以使用哪些工具
agent = Agent(
name="我的桌面助手",
instruction="你是一个桌面自动化助手,可以操作浏览器和键盘。请准确理解用户指令并执行。",
tools=tools,
llm_client=llm_client,
)
async def main():
# 4. 给智能体下达任务
task = "请打开浏览器,访问百度首页(www.baidu.com),然后在搜索框里输入‘OpenClaw’并搜索。"
print(f"任务开始: {task}")
# 5. 运行智能体
async for step in agent.run(task):
# 打印出智能体的每一步思考和行动
print(f"[步骤] {step.thought}")
if step.action:
print(f" -> 执行动作: {step.action.name}, 参数: {step.action.arguments}")
if step.observation:
print(f" <- 观察结果: {step.observation[:200]}...") # 只打印前200字符
print("任务完成!")
if __name__ == "__main__":
asyncio.run(main())
运行这个脚本,你会看到控制台输出智能体的思考过程。它可能会先规划“打开浏览器”,调用 open_browser 工具;然后“导航到百度”,调用 navigate_to_url 工具;接着“找到搜索框并输入文本”,这里它可能需要组合使用 find_text_on_screen (寻找“搜索框”提示)和 type_text 工具;最后“执行搜索”,调用 press_enter 工具。
关键点解析 :
Agent类是核心,它封装了规划、调用、观察的循环。instruction参数非常重要,它是你塑造智能体行为方式的“咒语”。你可以在这里定义它的角色、行事风格和禁忌(例如,“操作前请确认窗口是否在前台”,“不要点击任何看起来像删除或确认的红色按钮”)。async for循环让我们可以实时看到智能体的执行流,这对于调试和理解其工作原理至关重要。
3.3 进阶实战:处理复杂任务与不确定性的技巧
上面的例子比较理想化。现实中,自动化脚本常常因为各种意外而失败:窗口弹窗、网络延迟、元素加载慢、界面变化。一个健壮的AI智能体需要能处理这些不确定性。
技巧一:赋予智能体“重试”和“验证”的能力 我们可以在 instruction 中明确要求智能体进行验证。例如: “在执行每个关键操作后(如点击按钮、导航页面),请通过屏幕信息确认操作是否成功。如果超过10秒未看到预期变化,请尝试重新执行上一步操作,最多重试3次。”
技巧二:利用视觉工具进行状态锚定 纯靠工具返回的成功状态码有时不可靠。结合视觉工具,让智能体“亲眼看看”屏幕状态。例如,在点击“登录”按钮后,可以让它调用 find_text_on_screen 寻找“欢迎,用户名”或“登录失败”等文字,以此判断操作结果。
技巧三:设计更精细的工具和更丰富的上下文 我们可以自定义工具来提升可靠性。比如,创建一个 wait_for_element 工具,它封装了循环查找屏幕元素并等待超时的逻辑。这样,智能体在需要等待时,直接调用这个复合工具,而不是自己规划复杂的等待和重试步骤。
下面是一个模拟处理登录弹窗的复杂任务示例的伪代码思路:
# 自定义工具示例:等待并点击某个特定文本
def wait_and_click(text: str, timeout: int = 10):
"""等待屏幕上出现指定文本,然后点击它。"""
start_time = time.time()
while time.time() - start_time < timeout:
location = vision.find_text_on_screen(text)
if location:
mouse.click(location.center) # 假设返回的location对象有center坐标
return f“成功找到并点击了‘{text}’。”
time.sleep(0.5)
return f“在{timeout}秒内未找到文本‘{text}’。”
# 将这个自定义工具加入到工具列表中
tools.append(wait_and_click)
# 给智能体的指令可以更强大:
instruction = """
你是一个谨慎的桌面助手。你的任务是自动化操作,但必须确保安全。
1. 在点击任何按钮前,尽量通过其旁边的文字再次确认。
2. 如果操作后出现意外的弹窗(尤其是包含‘错误’、‘警告’、‘确认’字样的),暂停并向我报告弹窗内容。
3. 对于‘登录’、‘删除’、‘支付’等敏感操作,必须额外等待2秒,并核对屏幕信息。
现在,请帮我完成XXX软件的日常数据备份任务。
"""
通过这种方式,我们构建的AI智能体就从一个只会按固定剧本操作的“实习生”,变成了一个能应对简单突发状况的“熟练工”。
4. 深入开发:定制工具与优化智能体性能
当你熟悉了基础玩法后,你肯定会不满足于内置工具。定制化开发才是OpenClaw真正发挥威力的地方。同时,如何让智能体更快、更准、更省(钱),也是工程实践中的核心问题。
4.1 如何为你的业务定制专属工具
假设你是一个电商运营,经常需要从后台导出订单报表,这个流程涉及登录内部系统、点击多个菜单、设置筛选条件、点击导出按钮。你可以将这个流程封装成一个 export_order_report 工具。
from openclaw.tools import BaseTool
from pydantic import Field
import some_internal_sdk # 假设的内部系统SDK
class ExportOrderReportTool(BaseTool):
"""一个用于导出电商平台昨日订单报表的工具。"""
name: str = "export_order_report"
description: str = "登录内部电商后台,导航至订单管理,筛选昨日订单,并导出CSV报表。报表将保存在默认下载目录。"
# 定义工具的参数
date: str = Field(..., description="报表的日期,格式为YYYY-MM-DD")
async def run(self):
# 1. 使用内部SDK或自动化脚本登录系统(这部分是业务逻辑)
# 例如:some_internal_sdk.login(username, password)
# 2. 导航到订单页面
# 例如:browser.navigate_to_url("https://internal.com/orders")
# 3. 设置日期筛选器为 self.date
# 例如:keyboard.type_text(self.date)
# 4. 点击导出按钮
# 例如:mouse.click(export_button_location)
# 5. 等待下载完成,并返回结果路径
file_path = await wait_for_download_complete()
return f“昨日({self.date})订单报表已成功导出,文件路径:{file_path}”
# 使用这个工具
tools.append(ExportOrderReportTool())
agent = Agent(tools=tools, ...)
# 现在你可以直接对智能体说:“请导出2023-10-27的订单报表。”
通过这种方式,你将一个需要多步图形界面操作的复杂业务流程,抽象成了一个简单的自然语言接口。智能体无需关心内部点击逻辑,只需要在合适的时候调用这个“高级工具”即可。
4.2 提示词工程:如何与你的智能体有效“沟通”
智能体的 instruction 和用户输入的 task ,共同构成了给大模型的提示词(Prompt)。这里的编写技巧直接决定了智能体的表现。
- 角色设定要具体 :不要只说“你是一个助手”。要说“你是一个专注于桌面自动化、行事谨慎、在操作前会双重确认的软件机器人。”
- 约束条件要明确 :列出智能体绝对不能做的事情。例如:“未经明确确认,不得点击任何红色或标有‘删除’、‘格式化’、‘确认支付’的按钮。”“不得在非工作时间(晚10点至早8点)执行任何可能产生通知或声音的操作。”
- 输出格式要规定 :如果你希望智能体在每一步都报告进度,可以在instruction里要求:“每个工具调用后,请用‘【进度】...’的格式简短汇报当前状态和下一步计划。”
- 提供范例(Few-shot) :对于特别复杂的任务,可以在instruction里给出一两个例子。例如:“如果任务是要‘整理桌面文件’,你应该按以下顺序执行:1. 打开文件资源管理器;2. 导航到桌面路径;3. 根据文件类型创建文件夹...”
- 处理模糊指令 :教导智能体如何询问澄清。例如:“如果用户的指令不够清晰,例如只说‘处理一下那个文件’,你应该主动询问:‘请问您指的是哪个文件?请提供文件名或描述。’”
一个优秀的提示词,相当于为这个“数字员工”编写了一份详尽且可操作的岗位说明书。
4.3 成本与性能优化实战
使用GPT-4这类高级模型,每一次工具调用和规划都需要消耗Token,产生API费用。在长时间运行的自动化任务中,成本可能不容忽视。
-
减少不必要的上下文 :OpenClaw默认会将完整的任务历史(包括所有步骤的思考、行动、观察)都作为上下文传给模型,以保持连贯性。但对于超长任务,这会导致上下文膨胀,增加成本和延迟。可以考虑只保留最近N步的历史,或者对过去的观察结果进行摘要(Summarize)后再传递。这需要修改Agent的运行逻辑或寻找支持此功能的配置。
-
分层模型策略 :并非每一步都需要最强的模型。你可以配置一个“路由逻辑”:让一个速度快、成本低的小模型(如GPT-3.5 Turbo)负责简单的、模式化的工具调用决策(例如“连续输入三个表单字段”);只有当遇到复杂判断、规划新阶段或处理异常时,才切换到GPT-4o等大模型。这需要更复杂的Agent架构设计。
-
工具描述的优化 :提供给模型的工具描述(
description)要简洁准确。冗长模糊的描述会浪费Token,还可能误导模型。用最少的词说清工具的功能、输入和输出。 -
超时与重试机制 :在网络不稳定或目标系统响应慢时,智能体可能长时间卡住。在工具层面和Agent运行层面设置合理的超时(Timeout)和重试(Retry)机制,避免无意义的等待和API调用堆积。
-
本地模型替代方案 :对于成本极度敏感或数据隐私要求高的场景,可以探索使用开源的、能本地部署的大模型(如Qwen、DeepSeek Coder等)作为LLM后端。虽然它们的工具调用和规划能力可能稍弱,但通过精细的提示词工程和微调(Fine-tuning),完全可以在特定领域任务上达到可用水平。OpenClaw通常通过兼容OpenAI API的本地服务器(如LM Studio、Ollama提供的接口)来接入这些模型。
5. 常见问题、排查与安全伦理思考
在实际把这样一个能操控电脑的AI智能体投入使用时,你会遇到各种技术问题,更需要提前思考其带来的安全与伦理挑战。
5.1 实战问题排查手册
以下是我在开发和测试中遇到的一些典型问题及解决方案:
| 问题现象 | 可能原因 | 排查步骤与解决方案 |
|---|---|---|
| 智能体卡住,不执行任何动作 | 1. API密钥未设置或错误。 2. 网络问题导致无法连接LLM服务。 3. 模型返回的格式不符合OpenClaw预期。 |
1. 检查环境变量 OPENAI_API_KEY 。 2. 使用 curl 或Python requests 测试API端点连通性。 3. 查看Agent运行日志,检查模型返回的原始消息,确认其是否包含有效的工具调用JSON。 |
| 鼠标点击位置偏移 | 1. 屏幕分辨率或缩放比例问题。 2. 查找元素的坐标计算有误。 3. 目标窗口未激活/置顶。 |
1. 确保自动化脚本运行时系统的显示缩放设置为100%。 2. 使用 vision.capture_screen 工具截图,并手动验证元素查找逻辑。 3. 在点击前,先调用 window.activate 工具将目标窗口提到前台。 |
| 智能体进入“死循环”,重复同一操作 | 1. 工具的观察结果未能正确反映状态变化。 2. 模型未能从观察中识别出任务已完成或已失败。 3. 任务规划逻辑出现错误。 |
1. 增强工具的观察能力,例如在点击“提交”按钮后,工具应返回更明确的成功/失败信号,而非简单的“点击完成”。 2. 在 instruction 中明确告知智能体任务完成的标志,例如“当你看到‘操作成功’的提示框时,任务完成”。 3. 设置最大步骤数限制,防止无限循环。 |
| 处理动态内容(如验证码)失败 | 当前工具链无法处理非文本、非固定模式的交互。 | 1. 对于此类任务,应在设计时就将其排除在AI智能体自动化范围之外。 2. 或者,设计一个“人工接管”工具,当遇到验证码时,暂停流程并通知用户手动处理,处理完毕后通知智能体继续。 |
| 运行速度慢 | 1. 每次工具调用都涉及一次LLM API请求,网络延迟是主要瓶颈。 2. 视觉查找工具耗时较长。 3. 任务步骤过多。 |
1. 考虑使用上下文更长的模型,减少规划轮次;或采用本地轻量模型处理简单步骤。 2. 优化视觉查找的搜索区域和匹配精度。 3. 将常用操作序列封装成复合工具,一次调用完成多个动作,减少与LLM的交互次数。 |
5.2 安全红线与伦理边界:给“数字员工”上锁
让AI直接操作你的电脑,其力量与风险并存。在兴奋之余,必须设立严格的安全边界。
- 权限最小化原则 :运-行OpenClaw Agent的账户,不应具有管理员权限。为其创建一个专用的、权限受限的系统账户,防止其执行格式化磁盘、修改系统文件等危险操作。
- 操作沙盒化 :尽可能让智能体在虚拟机(VM)或容器内运行。这样,即使它执行了恶意操作或脚本出错,也不会影响宿主机。
- 关键操作二次确认 :在
instruction中硬性规定,对于删除文件、修改关键配置、发送邮件、进行支付等操作,必须生成一个明确的确认请求,等待(模拟)用户批准后才能执行。可以在代码层面实现一个“安全审批层”,拦截这类工具调用。 - 网络访问控制 :限制智能体进程的网络访问权限,只允许其访问完成任务所必需的服务(如LLM API、目标业务系统)。防止其被恶意指令利用去访问危险网站或下载不明文件。
- 审计与日志 :完整记录智能体的每一步思考、每一个工具调用及其参数、每一次观察结果。这些日志不仅是排查问题的依据,更是事后审计和安全分析的关键材料。确保日志不可篡改,并定期审查。
- 伦理考量 :明确禁止使用该技术进行任何形式的欺诈、攻击、隐私侵犯或垃圾信息发送。确保其应用场景是提升合法工作的效率,而非替代人类进行需要道德判断的决策。
OpenClaw代表的AI Agent技术,正在将大语言模型从“智库”变为“执行者”。从简单的桌面自动化到复杂的业务流程编排,其潜力巨大。然而,当前的技术仍然处于早期阶段,对复杂、非标准化场景的处理能力有限,稳定性和可靠性需要精心设计和大量调试。它不是一个“即插即用”的万能解决方案,而是一个强大的“乐高积木”套装,需要开发者结合具体的业务场景,设计合适的工具,编写精准的提示词,并构筑牢固的安全护栏。
我的体会是,最有效的应用模式不是追求全自动,而是“人机协同”。让AI智能体处理那些重复、枯燥、规则明确的“脏活累活”,而人类则专注于监督、处理异常和进行创造性决策。从这个角度看,OpenClaw和GPT-5.4的组合,或许真的为我们打开了一扇通往新型生产力的大门,但门的钥匙,始终应该握在谨慎而负责的开发者手中。
更多推荐


所有评论(0)