Agent 之王 Codex 的办公场景从 0 到 1
预计字数:6000 字 阅读时间:13 分钟 难度等级:⭐⭐(小白友好,进阶可照着搭)
核心价值:看完这篇,你能拿走一套中文办公场景的 Codex / Agent 工作流清单,以及一个 7 天上手计划。
最近Codex的火爆程度就不用多说了,那作为普通人
我们如何在工作中高效的开始Codex呢?下面我将带你从0到1走一遍。
Codex 像一个可以接进你电脑、文件夹、知识库、邮件、飞书、网页、命令行的工作台。
你不再只是打开一个聊天框,问一句,答一句。
而是在给一个 Agent 安排任务:
读这些材料。
查这些文件。
按这个规则整理。
不确定的地方标出来。
能起草的先起草。
要我拍板的单独放一边。
这一下,味道就完全不一样了。
聊天机器人像一个很聪明的问答窗口。
Codex 这类 Agent 工作台,更像一个能力很强但入职第一天的新人。
它能干活。
但你要给它上下文、边界、检查标准。
先把话说清楚:这里有两个 Codex
这篇文章里,我会同时讲两个东西。
第一个,是 OpenAI 官方的 Codex 产品线。
截至 2026-07-01,OpenAI 官方 GitHub README 里对 Codex CLI 的描述很明确:它是一个运行在你本机电脑上的 coding agent。官方也区分了 CLI、IDE、Desktop App、Codex Web 这些形态。
第二个,是我自己现在用的中文办公工作台。
它不是"装了 Codex 就自动拥有"的东西。
我的系统更准确地说,是:
Hermes Agent + Codex CLI + Obsidian + 飞书 + 邮件 + 微信 + 一堆 Skill + 自动化任务。
这两个东西不能混着吹。
OpenAI Codex 是官方产品。
我这套是中文用户把 Agent 接进真实办公场景之后,搭出来的个人工作系统。
为什么要先讲清楚?
因为很多 AI 文章最容易犯的错,就是把产品能力、插件能力、自己系统能力揉在一起,最后读者看完很激动,回去一试,发现根本不是一回事。
我不想这么写。
📚
这篇文章你可以把它当成两层:
第一层,理解 Codex 这类 Agent 工作台为什么不只是写代码。
第二层,参考我这套中文办公系统,看看你可以从哪些工作流开始。
我的中文办公系统长什么样
先给你看几个真实数字。
我现在的 Obsidian 主知识库是 2.7GB。
根目录下有 36 个一级目录。
本机 Hermes 运行时有 84 个 Skill。
自动化任务有 33 个。
记忆系统分三层:L1 关键摘要、L2 结构知识、L3 核心洞察。
经过大半年的运行,这些已不是"规划中"。
而都是本机命令查出来的。
比如:
du -sh /Users/dx/Hermes-agent
# 2.3G /Users/dx/Hermes-agent
jq '.jobs | length' /Users/dx/.hermes/cron/jobs.json
# 33
你不用一开始就搭到这个程度。
千万别。
如果你第一天就想着"我要 80 个 Skill、33 个自动化、三级记忆系统",基本第二天就不想干了。
更合理的理解是:
我的系统只是一个已经长大的样子。
你刚开始只需要一个小版本:
- 一个文件夹。
- 两个信息来源。
- 一套规则文件。
- 一个低风险任务。
这就够了。
为什么它不像普通聊天机器人
普通聊天机器人的典型用法是:
- 我给你一段话,你帮我润色。
- 我问你一个问题,你回答我。
- 我给你一个主题,你给我几个点子。
这当然有用。
但它的问题也很明显:
上下文散。
结果难复用。
每次都要重新解释。
它不知道你的文件在哪,不知道你之前怎么决策,不知道哪些话题不能碰,也不知道哪些输出必须标来源。
Agent 工作台的变化在于:
它可以围绕一个工作空间持续干活。
- 你可以把项目规则写进 AGENTS.md。
- 把偏好写进 preferences.md。
- 把红线写进 rules.md。
- 把素材、文档、数据、历史记录放进同一个文件夹。
然后让它按这些规则执行。
这不是玄学。
它其实就是把"你每次都要在聊天框里重复说的话",变成一个可复用的工作环境。
你想想看。
如果你每次写文章,都要重新告诉 AI:
先调研素材
别虚构案例
事实要标来源
面向目标用户,需要哪些规则
标题想要什么样子的风格,等等
这就很烦。
更好的方式是把这些规则放进项目文件。
以后每次写文章,Agent 先读规则,再干活。
这就是差别。
我最常用的 5 个工作流
下面先讲我自己这套系统里最有感的 5 个方向。
不是为了让你照抄。
而是让你看到,Codex / Agent 工作台一旦接进真实资料源,它能从"回答问题"变成"处理工作"。
1. 每日摘要和日报

今天到底做了什么?
哪些东西值得沉淀?
哪些只是临时操作?
哪些应该变成下次能复用的规则?
如果全靠人脑记,肯定漏。
我现在会让系统每天整理会话、项目变更、记忆状态和自动化任务状态,然后生成日报素材。
这里的关键不是"AI 写日报"。
重点是它能从真实文件和真实任务里找证据。
日报里必须区分:
事实。
推断。
待确认。
这三个标签很重要。
很多 AI 自动化之所以危险,就是因为它把"猜测"写得像"事实"。
日报这种东西,如果发给别人看,更不能这么干。
2. 调研简报
写方案、开会、做选题之前,我经常需要快速搞清楚一个话题。
以前的流程是:
- 打开浏览器。
- 搜一堆链接。
- 复制到文档。
- 再让 AI 总结。
最后还要自己判断哪些可信,哪些只是营销号。
现在更合理的做法是让 Agent 先建一个素材包。
它要写清楚:
- 背景是什么。
- 关键事实来自哪里。
- 不同观点冲突在哪里。
- 哪些数据没有核实。
- 哪三个来源最值得深入读。
调研简报最怕什么?
最怕一篇看起来很完整,但里面全是二手转述。
所以我现在会要求:
重要事实必须回到官方文档、GitHub、原始公告、论文、数据源。
查不到就写"未验证"。
宁可少写。
不要编。
3. 内容创作全流程
我现在写文章,不是直接让 AI "写一篇"。
这个动作太粗了。
更稳的流程是:
- 先编译素材。
- 再拆事实、推断、待验证。
- 再形成素材包。
- 再写大纲。
- 再出初稿。
- 再做风格校准。
- 最后做审校。
你看起来会觉得慢。
但真正做久了,它反而快。
因为很多返工都发生在"AI 一上来就开写"之后。
- 方向错了,越写越偏。
- 事实没核,越写越虚。
- 语气不对,越润越油。
我宁愿前面多花 20 分钟,把素材和边界说清楚,也不愿后面花 2 小时救一篇空洞的稿子。
4. 想法和记忆维护
很多人的想法库,其实是"想法坟场"。
今天记一个。
明天记一个。
半年后再也找不到。
我更希望 Agent 做的是:
每个想法记录来源。
和已有想法查重。
判断它是选题、素材、方法论,还是一次性念头。
被否决的也保留理由。
这件事很小。
但长期价值很大。
因为你不是在堆笔记。
你是在训练自己的判断系统。
5. 系统健康检查
这部分听起来偏技术,但普通人也能理解。
任何自动化都会坏。
账号会过期。
接口会更新。
路径会改。
规则文件会过时。
如果你以为"自动化就是设好之后不用管",那基本迟早翻车。
我的系统里有 Gateway 健康检查、Vault 健康检查、Skill 审计、备份、记忆索引刷新等任务。
不一定每个人都需要这么复杂。
但你至少要有一个意识:
自动化不是替你永远省心,而是把重复工作变成可检查的流程。
更多起步工作流(精简清单)
下面这些模板,不展开了。每个只写一句话核心。
你先扫一遍,哪个最戳你的痛点,就从哪个开始。
收件类:
- 收件箱清零 — 让 Agent 分类邮件,起草回复,但只草案不自动发送。
- 漏回消息汇总 — 飞书、微信、邮件里你没回的消息,按紧急度排好,你来判断语气。
调研类:
- 调研简报 — 给主题和来源,输出背景、关键数据、观点分歧、待确认问题。
- 写作素材整理 — 把链接和材料整理成证据库:支持观点的、反对的、还缺的。
写作类:
- 边写边审 — 先让 Agent 诊断结构、事实、语气问题,再改。不是一上来就润色。
- 文字转音频 — 草稿转语音,通勤路上听。
管理类:
- KPI 周报 — 多系统拉数据,但必须标注每个指标的定义、来源和时间范围。
- 产品上线方案 — GTM 计划草稿,决策留给人。
- 内容更新审核 — 对比最新来源,列修改建议,不自动编辑不自动发布。
协作类:
- 客服问题整理 — 识别核心问题,去重,标优先,但 AI 不替你理解人情世故。
- 候选人名单 — 整理材料、对齐标准、发现遗漏,但最终判断由人负责。
- 非程序员也能理解代码更新 — Agent 把 PR 翻译成业务语言,帮非工程角色参与评审。
规划类:
- 战略规划 / OKR — 从过往数据整理草稿,强制标注哪些是提炼的,哪些是推断的,哪些需要人类判断。
- 共享看板网页 — 当长文档管不过来时,让 Agent 做看板,不是跑去学新工具。
- 个人学习工具 — 告诉 Agent 学什么、什么水平、怎么练,它给你搭一个本地练习场。
- 想法收集库 — 每一条记来源、现有方案、价值判断、下一步行动。否决的也保留理由。
❤️
你不是为了这一次省时间。你是为了下一次不用重新解释。
怎么"管理" Codex
我越来越觉得,用 Codex 这类 Agent,不像"使用软件"。
更像带一个能力很强但入职第一天的新人。
新人不是不聪明。
但他不知道你的业务,不知道你的禁忌,不知道你对质量的标准,也不知道哪些事能自己做、哪些事必须先问。
所以你要做的不是把每一步都教给它。
而是把方向、资源、边界和验收标准说清楚。
说结果,不要微操步骤
很多人提示词写得特别累:
- 第一步你先去飞书搜这个词。
- 第二步你再去 Notion 找那个页面。
- 第三步你打开某个表格。
- 第四步你复制某一列。
不是不能这样写。
但这会把 Agent 当成一个很笨的脚本。
更好的写法是:
帮我用这些来源做一份调研简报,结构是背景、关键事实、观点分歧、待确认问题和推荐阅读。所有重要事实标来源,不确定的地方单独列出来。
你告诉它目标和标准。
它自己决定怎么查。
这才是 Agent 的价值。
复杂任务先让它说计划
如果一件事要跑好几分钟,或者涉及多个工具,先别急着让它开干。
先让它说计划。
比如:
开始前,先告诉我你打算怎么做、会读哪些来源、会产出哪些文件、哪些地方需要我确认。
这句话很值钱。
因为方向错的时候,越早纠正越便宜。
等它跑完 30 分钟,你再发现它理解错了,那个时候就很烦。
你可以把这句话直接复制到提示词里。它不会让你看起来不懂 AI,只会说明你用过 AI。
开工前问它缺什么
我很喜欢问一句:
开始之前,你还需要知道什么,才能做得更好?
这句话能逼它暴露缺口。
有时候它会告诉你:
- 缺少目标读者。
- 缺少输出格式。
- 缺少时间范围。
- 缺少来源链接。
- 缺少权限。
这比它硬着头皮编一个结果强多了。
重要事实必须标来源
只要这个文档会被别人看到,或者会用于决策,所有重要事实都要标来源。
不要相信"听起来很对"。
尤其是这些内容:
- 数字。
- 日期。
- 价格。
- 产品功能。
- 政策规则。
- 官方限制。
- GitHub 项目活跃度。
一句话:
能回源头,就回源头。
回不了,就标"未验证"。
方向没问题就别一直插手
这点也很重要。
很多人用 AI,忍不住每 30 秒看一次。
它刚读完文件,你说一句。
它刚写两段,你改一下。
它刚跑命令,你又插一嘴。
最后它很难完成一整轮思考。
我的经验是:
方向错了,及时打断。
假设变了,及时打断。
碰到未授权的高风险动作,及时打断。
除此之外,让它跑完一轮。
你审结果就行。
永远去真实工具里检查结果
在 Codex 里看起来没问题的东西,到了飞书、Slack、Gmail、Notion、公众号后台,可能完全不是那回事。
表格可能不渲染。
图片可能丢。
链接可能打不开。
Markdown 可能被平台改格式。
邮件语气可能太硬。
飞书文档里的 Callout 可能不对。
所以最后一定要去实际使用的地方检查。
别只在 Agent 的输出里点头。
检查结果前,问三个问题
每次 Agent 做完一个稍微复杂的任务,我建议你问它三个问题。
- 第一:你做这件事的时候,最难决定的是什么?
- 第二:你考虑过但没采用的方案有哪些?
- 第三:你最拿不准的地方在哪?
这三个问题很有用。
因为它能把"看起来很完整的答案"背后的不确定性翻出来。
一个靠谱的 Agent 输出,不应该只有结果。
还应该告诉你它在哪里做了取舍。
常见翻车场景
说错了,还特别自信。
这是大模型老毛病。
所以事实性内容要回源头核实,不要直接转发。
数字对不上。
多个系统拼数据时,定义不一致、数据过期、关联方式不同,都会出问题。
改了不该改的东西。
尤其是涉及代码、配置、知识库目录的时候,要逐行看它到底改了什么。
自动化流程悄悄坏了。
接口更新、账号过期、规则文件过时,都可能导致自动化失效。
被外部内容带偏。
邮件、网页、文档里可能藏着针对 AI 的指令,有些你自己都看不见。
所以发送、删除、修改、发布这类动作,一定放在人工审批后面。
只给最小必要权限。
不要一上来就把所有钥匙都给它。
团队怎么用
如果你是个人,先把一个工作流跑顺。
如果你在团队里,千万别一上来全员推广。
最简单的方法是:
找一个人。
找一个具体问题。
跑出一个可见成果。
把过程记录下来。
让别人看到"这东西真能省时间"。
团队使用有几个关键点:
每个自动化流程都要有负责人。
AI 生成的文档要放到共享工具里审,不要只停留在 Codex 对话里。
文档要写得人能读,AI 也能查。
这句话很重要。
未来的团队知识库,不只是给人看的。
也是给 Agent 用的。
7 天上手计划
你不需要一次变成高级用户。
先跑一个真实、低风险、可检查的任务。
下面这个 7 天计划,重点不是"挑战打卡"。
重点是降低门槛。
第 1 天:观察工作
不要先想自动化。
先列出你一周内最重复、最烦、最需要整合信息的任务。
比如:
- 每天漏回消息。
- 每周写周报。
- 每次写文章前找资料。
- 每次开会后整理纪要。
- 每个月更新资源列表。
先找烦人的点。
不要一开始就找最酷的点。
第 2 天:连接两个来源
选择两个最关键的系统。
中文办公场景里,我建议从飞书和本地文件夹开始。
如果你不用飞书,也可以是邮箱和本地文件夹。
只做一个小任务:
比如读取一个会议纪要,再结合一个项目文档,整理出待办清单。
两个来源就够了。
超过两个,新手很容易乱。
第 3 天:建立工作空间
创建一个项目文件夹。
里面放几个基础文件:
- AGENTS.md
- context.md
- preferences.md
- rules.md
- sources.md
不用写得很复杂。
👍
先写清楚:
你是谁。
这个项目要做什么。
哪些资料可信。
哪些事不能做。
输出格式是什么。
然后让 Agent 复述一遍它理解的角色、项目和边界。
如果它复述错了,先改规则。
不要急着开工。
第 4 天:跑一个一次性任务
选一个低风险但真实的任务。
比如整理会议纪要。
生成调研简报。
把一堆链接整理成素材包。
要求它输出不确定点。
你审阅它的结果。
这一天的目标不是自动化。
目标是建立信任。
你要知道它在哪些地方靠谱,哪些地方容易胡来。
第 5 天:跑一个多来源任务
让它从多个系统合成一个输出。
比如:
- 飞书消息 + Obsidian 笔记 -> 周报草稿。
- 邮件 + 项目文档 -> 待办清单。
- 网页链接 + 本地素材 -> 调研简报。
这一天一定让它先给计划。
计划确认后再执行。
多来源任务最容易跑偏,前面多花 3 分钟看计划,非常划算。
第 6 天:把任务变成清单
如果前几天有一个任务跑得不错,把它写成工作流文档。
至少包括:
输入来源。
输出格式。
执行步骤。
审阅标准。
常见错误。
哪些动作必须人工确认。
这一步很关键。
你不是为了这一次省时间。
你是为了下一次不用重新解释。
第 7 天:决定是否自动化
不是所有任务都值得自动化。
只有满足这几个条件,才考虑周期化:
反复发生。
风险可控。
输入稳定。
检查标准明确。
失败后容易发现。
如果不满足,就保留为手动触发的协作流程。
这并不丢人。
很多时候,手动触发比全自动更稳。
现在就开始
Codex 的价值不只是"会写代码"。
它更像一个知识工作的智能体工作空间。
真正重要的不是某个单点功能。
而是把上下文、工具、流程、审阅和复用串成一个循环。
你不需要一开始就搭一套庞大的系统。
先打开一个文件夹。
选一件你本来就会做的事。
告诉它你有什么素材、要什么结果、你会怎么检查。
做好一次。
把有效做法保存下来。
再把重复工作变成流程。
最后,再决定哪些流程值得自动化。
真正的目标不是让 AI 替你思考。
而是让你把更多注意力留给判断、品味、策略和最终责任。
出来混,最重要的是出来。
打开一个文件夹,先跑一次。
既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果可以给我个星标⭐,将不胜感激~谢谢你看我的文章,我们,下次再见。
#Codex #AI办公 #Agent工作流 #大象AI共学 #Obsidian #飞书 #自动化
作者:大象-推动 AI 共学,让普通人轻松上手AI
相关链接
- OpenAI Codex CLI GitHub:https://github.com/openai/codex
- OpenAI Codex 官方文章:https://openai.com/index/codex-for-every-role-tool-workflow/
- 社群站:https://daxiangnaoyang.github.io/daxiang-ai-gongxue/
更多推荐




所有评论(0)