也算跟上时代了!策略经理如何使用 Claude 在量化交易中制胜
写在前面:本文是我作为一个在量化和工程之间来回横跳了不到十年的从业者的实操笔记,不是投资建议,也不是任何产品的软文。文中所有回测数字均为示意,历史业绩不代表未来表现。
一、先把牌桌看清楚:2026 年,这已经不是”要不要用”的问题了
先说一个我自己都觉得有点魔幻的对比。
2023 年,我在组里提”我们能不能让大模型帮忙写因子代码”,被一位资深研究员当场怼回来:”它连 groupby 的时点对齐都能写错,你敢用?”他说得对。
2026 年的今天,同一位研究员每天开着 Claude Code 跑三个终端窗口。
这不是个例。NVIDIA 在今年 1 月发布的第六份《State of AI in Financial Services》里,调研了全球 800 多位金融从业者,数据挺能说明问题:65% 的受访者表示公司已在主动使用 AI,而上一年这个数字是 45%;73% 的高管认为 AI 对公司未来至关重要,近 100% 表示 AI 预算会增加或至少持平。其中 61% 的机构在使用或评估生成式 AI,42% 在使用或评估智能体(agentic)AI,已经实际部署了 AI Agent 的占 21%。
考虑到国内订阅claude确实有点困难,可以参考一下这里:claudemax.shop

真正让我警觉的是这条:89% 的受访者说 AI 已经帮公司增加了收入、降低了成本。当一个行业里近九成的人说某个工具已经产生了可量化的回报,这个工具就不再是”加分项”,而是”及格线”。
国内这边节奏更分化。中证报今年 3 月那篇量化私募 AI Agent 调研里几个细节我印象很深:头部机构已经在自建算力甚至对外溢出技术能力,而中小机构受限于成本和人力,多数还处在观望或轻度试用阶段;老牌百亿私募鸣石基金明确表示,Agent 主要用在辅助编程环节,因子挖掘等核心投研仍以既有方式为主。第三方研究员的判断更直白:2026 年 AI Agent 正从”炫技”走向”普及”,但在量化私募领域,多数机构尚未将其作为成熟的投研工具投入策略迭代与生产。
这就是我写这篇文章的原因——中间那段最大的空白,不在模型能力,在工作流设计。而工作流设计,恰恰是策略经理这个岗位的核心职责,不是研究员的,也不是 IT 的。
海外的样本可以对照着看。Anthropic 今年 5 月 5 日在纽约那场面向金融机构的发布会上,公开的客户案例里有一条数字很扎眼:Walleye Capital 这家 400 人的对冲基金,100% 的员工在用 Claude Code——注意是全员,不只是工程团队。同时 Citadel 提到投资专业人员的工作离不开数据和分析模型,Claude for Excel 正好切进了这个场景。Anthropic 一次性放出了可在 Claude Cowork、Claude Code 里作为插件使用、也可通过 Claude Platform 以 Managed Agents 方式程序化调用的一批金融 Agent 模板,并接入了 FactSet、Moody’s、Morningstar 等数据源。
但同一份发布材料里还有一句被很多人忽略的话,我认为它比上面所有数字都重要:Anthropic 在官方仓库文档里明确写着,这些 Agent 只产出供合格人工审阅的草稿;它们不执行交易、不批准开户、不直接写入记账系统。
记住这句话。本文剩下的部分,基本都是在解释这句话对策略经理意味着什么。
二、认知纠偏:三个”不要”
在讲怎么用之前,我想先把三个最常见的幻想按死。这三条我踩过两条,代价都不小。
不要指望它直接给你 alpha。 你问”帮我找一个夏普 3 的 A 股中频因子”,它会给你一个看起来很像那么回事的公式。你回测,发现 IC 0.08。你很兴奋。然后你做样本外,发现是 0.01。原因很简单:训练语料里那些”经典因子”早就被市场消化干净了,而模型生成的”新因子”,本质上是在你给定的算子集合里做组合搜索——搜索能力不等于发现能力,能不能发现,取决于你给它的搜索空间和评价函数。评价函数是你的活儿。
不要把它当交易系统的一部分。 大模型有延迟、有非确定性、有速率限制,还会在极少数情况下给出格式不对的输出。任何把 LLM 放进下单链路的设计——哪怕只是”让它判断一下这单要不要撤”——在我看来都是拿净值开玩笑。它属于研究侧(offline),不属于执行侧(online)。今年金融 AI 的学术综述里也是同一个判断:LLM 更适合承担离线研发、语义校验、技术面解释和投研辅助的角色。
不要让它”自己评估自己”。 这是最隐蔽的坑,我单独放到第五节讲。
那它到底强在哪?强在把研究员从”实现”里解放出来,让研究员回到”提问”。一个策略团队真正的瓶颈从来不是想法不够,是想法验证得太慢——一个假设从提出到得到干净的样本外结论,过去要三天,现在可以是三小时。三天变三小时意味着什么?意味着你敢去验证那些”可能没用但万一呢”的假设了。研究的产出 ≈ 假设质量 × 验证吞吐,Claude 打的是后面那一项,而后面那一项一旦放大十倍,会反过来改变你敢提什么样的假设。
三、模型路由:先把钱算明白
策略经理是要背成本的。所以在讲流程前,先讲钱。
截至 2026 年 8 月,Claude 的模型线和官方价目(美元 / 百万 token,输入/输出)是这样:
| 模型 | 定位 | 价格 | 上下文 | 可靠知识截止 |
|---|---|---|---|---|
| Claude Fable 5 | 面向长周期智能体的下一代智能 | 10 / 50 | 100 万 | 2026-01 |
| Claude Opus 5 | 复杂智能体编码与企业级工作 | 5 / 25 | 100 万 | 2026-05 |
| Claude Sonnet 5 | 速度与智能的最佳平衡 | 3 / 15(8/31 前 2 / 10) | 100 万 | 2026-01 |
| Claude Haiku 4.5 | 最快、接近前沿的智能 | 1 / 5 | 20 万 | 2025-02 |
(来源:Anthropic 官方 Models overview 与 Pricing 文档。Fable 5 于 2026 年 6 月 9 日在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 上正式可用;同门的 Mythos 5 是邀请制,走 Project Glasswing,不对外自助开通。)

我们组的路由规则简单到可以贴在墙上:
- Haiku 4.5 干脏活:新闻/公告/研报的批量打标、日志清洗、因子元数据抽取。这类任务量大、单条简单、可用规则复核。
- Sonnet 5 是主力:日常写回测脚本、写数据管道、做研究问答。八成的 token 消耗在这里。
- Opus 5 用在硬骨头上:跨十几个文件的策略重构、复杂归因分析、需要真正”想清楚”的架构决策。
- Fable 5 留给长周期自治任务:跨库调研、多轮因子搜索、季度级复盘。它慢,但在需要连续几十步不掉链子的任务上,这个溢价是值的。
三个必须用满的省钱杠杆:
- Prompt caching:把项目规范、因子库文档、数据字典这些不变的前缀缓存住,命中后输入成本可降到基础价的 10%。量化研究的 prompt 前缀高度重复,这一条的实际收益比看上去大得多。
- Batch API:非实时任务全部走批处理,输入输出各打五折。夜间跑的全市场文本打标,没有任何理由走同步接口。
- 别用大模型做小事:让 Opus 去做 JSON 格式化,等于开跑车送外卖。
一个粗略的量级感受:一个 8 人的策略团队,把 Sonnet 5 当主力、缓存和批处理都开满,月度 API 支出通常落在四位数人民币到低五位数区间。对比一个研究员的人月成本,这个账不用算第二遍。
四、把流水线拆开:六段,每段的人机分工都不一样
这是本文的核心。我把量化研究流程拆成六段,并标注了每段可以交出去多少。

这张图最重要的信息是那个趋势:越靠近资金,人的比重越高。 从代码实现的 85% 交出去,一路降到风控合规的 25%。任何试图把这条曲线拉平的做法,都是在给自己埋雷。
① 数据与特征接入(Claude 75%)
脏活,也是最适合交出去的活。行情落库、财报对齐、另类数据清洗、时点(point-in-time)处理。
关键做法是先给规范,再给任务。在项目根目录放一个 CLAUDE.md,把团队约定写死:
# 项目约定(所有代码必须遵守) ## 数据 - 所有财报数据必须使用 PIT 快照,禁止使用 `report_date` 直接 join,必须用 `ann_date` - 复权:统一后复权,因子计算前不得混用前复权 - 停牌股在因子计算日的处理:置 NaN,不前向填充 ## 因子 - 输出统一为 MultiIndex (date, code) 的 Series,float64 - 禁止在因子函数内部做任何形式的未来信息引用; 所有 rolling/shift 操作必须显式标注窗口方向 - 每个因子必须附带一个 test_<name>.py,至少包含:时点泄露测试、 停牌股测试、极端值测试 ## 禁止事项 - 不得引入新的第三方依赖,除非在 PR 描述中说明理由 - 不得修改 backtest/core/ 下的任何文件
这份文件的价值在于,它把”资深研究员脑子里那些不成文的规矩”变成了机器可读的约束。我们组补上这个文件之后,Claude 生成代码的一次通过率从大概六成提到九成以上。
数据接入还有一个大杀器是 MCP。把内部行情库、因子库、回测引擎包成 MCP server,Claude 就能直接查询而不是猜。海外的做法也是这个思路——Claude 已经打通了 FactSet、S&P Capital IQ、MSCI、PitchBook、Morningstar、LSEG 等数据服务,也可以对接内部数仓和研究库。国内团队完全可以照着做一套自己的:get_bar、get_factor、run_backtest 三个工具,就能覆盖大部分研究场景。
② 假设生成(Claude 50%)
这一段我给的比重最尴尬——正好一半。因为它能读,但不能判断值不值得读。
有效的用法不是”给我一些因子想法”,而是:
读取 ./papers/ 下 2025 年以来的 37 篇论文摘要,以及 ./research/ 下我们 自己的 12 份内部报告。 任务:找出那些【我们内部报告里提到过、但从未真正实现过】的假设。 对每一条,输出: 1. 假设的一句话表述(必须是可证伪的) 2. 它依赖哪些数据字段,我们的库里是否都有(查 MCP 的 data_catalog) 3. 为什么当时没做(如果报告里写了) 4. 用我们现有的算子集合,最小实现路径是什么 5. 你认为它失败的最可能原因是什么 不要给我任何"经典因子"。不要给我你在训练数据里见过的公开因子。
最后两句是重点。不加限制,你会收获一堆动量反转和 PB-ROE。
③ 因子/策略代码实现(Claude 85%)
交出去最多的一段,也是收益最直接的一段。Claude Code 在这里的价值不是”写代码快”,是”写测试快”。
我的硬性要求:任何因子代码,必须同时产出泄露测试。而且测试要 Claude 自己先写、自己先跑:
实现因子 xxx。要求: 1. 先写 test_xxx.py,至少覆盖:时点泄露、停牌处理、全 NaN 输入、 单只股票输入、极端值 2. 跑测试,全绿之后再提交因子实现 3. 用 2019-2021 数据做一次冒烟回测,只报告 IC 均值和 IC_IR, 不要给我任何"这个因子表现不错"之类的评价 4. 遵守 CLAUDE.md
第 3 条那句”不要给我评价”,是我吃过亏之后加的。模型有很强的取悦倾向,一个 IC 0.02 的因子它也能夸出花来,而人是会被夸奖影响判断的。让它报数,不让它下结论。
④ 回测与统计检验(Claude 55%)
从这里开始,人的比重陡增。
Claude 可以帮你写多重检验校正的代码、写分层分域的稳健性检查、写各种 bootstrap。但校正参数怎么设、哪个稳健性检验是决定性的、什么样的衰减算可接受,这些必须是人来定,而且要在看到结果之前定。
我们组的规矩是:因子进入检验前,先在文档里写下”什么结果算通过”,签字,然后才跑。这条规矩跟 Claude 没关系,是做量化的基本功,但在 Agent 时代它的重要性乘以了十倍——因为你现在一天能测三十个因子,而不是三个。
⑤ 风控与合规审查(Claude 25%)
容量、拥挤度、交易成本、行业和风格暴露、合规限制。这一段 Claude 主要做两件事:把数据整理成人能看的形式,以及做 checklist 式的机械核对。
决策权 100% 在人手里。 这不是保守,这是责任归属——出了事,监管不会接受”模型说没问题”这个答案。
⑥ 上线与归因复盘(Claude 40%)
灰度、监控、偏离归因。Claude 在归因这一步意外地好用:给它实盘与回测的日度偏离序列,让它列出所有可能的解释并按可检验性排序,它经常能想到人当时想不到的角度(比如某个交易日的成交量分布异常、某类股票的停复牌集中)。
然后——这是整条流水线上最容易被跳过、也最值钱的一步——把归因结论写回 CLAUDE.md 和研究文档。图 3 里那条虚线箭头就是这个意思。你的护城河不是你用了 Claude,是你的 CLAUDE.md 里沉淀了三年的教训,而别人的是空的。
五、最危险的一步:让 Agent 自己迭代
现在说那个我认为最该单独拎出来讲的问题。
让 Claude 自动迭代优化因子,技术上完全可行。国内已经有公开的实验在做这件事:融量科技今年 5 月做过一次六大模型的因子挖掘横向评测,实验时间 2026 年 5 月,平台是 AlphaMind + Claude Code,数据区间 2021—2026,股票池中证全指,标准赛制是 20 轮迭代优化。学术侧也在往这个方向走,微软亚洲研究院的 R&D-Agent-Quant 就是专门面向量化投研的多智能体框架,覆盖从假设生成到策略回测的全链路自动化,论文被 NeurIPS 2025 接收,代码已开源。知乎上那篇被广泛传播的量化 Agent 综述甚至给出了一个很有画面感的推演:未来可能出现”量化工厂”——持续运行的多智能体系统,7×24 不间断挖掘因子、评估有效性、构建组合、执行交易。
听起来很美。但请看这张图。

自动迭代的真正敌人从来不是模型能力,是过拟合。
道理其实是老道理:当你让一个系统在同一份数据上迭代 20 轮、每轮都用回测指标做选择信号时,你实际上在做的是一次 20 次的多重比较。样本内 IC 会一路走高(灰色虚线),因为它必然走高。而样本外,在某个拐点之后开始劣化(橙线)——系统不是在学规律,是在学噪声。
这个拐点在哪,取决于你的数据量、算子空间和评价函数,不是固定的第 7 轮。但它一定存在,而且如果你不主动去找它,你会在实盘上找到它。
我们组的护栏清单,五条,缺一条就不许跑自动迭代:
- 冻结样本,物理隔离。 划出最近 12—18 个月数据,放在 Agent 完全访问不到的地方(不同的数据库账号、不同的目录权限)。不是”约定不用”,是真的拿不到。整个迭代过程只允许查看一次,就是最后决定上不上的那一次。
- 多重检验校正写进评价函数。 用 Deflated Sharpe Ratio 或者 BH 校正,把”我试了多少次”这个信息显式地扣进分数里。让 Agent 优化的目标本身就是校正后的指标,而不是让它优化原始指标、你事后再校正。这两者的效果差别巨大。
- 成本敏感性作为一票否决。 每轮迭代都必须报告在 1.5 倍和 2 倍假设成本下的表现。一个只在低成本假设下成立的因子,不是因子,是幻觉。
- 迭代轮次硬上限 + 人工中检。 我们设的是 10 轮,且第 5 轮必须有人看一眼中间产物。看什么?看因子的经济学解释是否还站得住。如果第 5 轮的产物已经是一个套了四层嵌套、你完全说不清它在捕捉什么的怪物,停。
- 留一个”什么都不做”的对照组。 每次自动迭代实验,都同时记录”如果第 1 轮就停手”的结果。你会惊讶于有多少次,第 1 轮的朴素版本样本外表现更好。
第 4 条里那句”说不清它在捕捉什么”,是我个人最看重的判据。可解释性在这里不是合规要求,是过拟合探测器。 一个你能用两句话讲清楚经济逻辑的因子,衰减起来通常也是可预期的;一个你讲不清的因子,它什么时候死、怎么死,你完全没有先验。
六、三个月落地路线(可以直接抄)
给还没开始的团队一个排期。这是我们实际走过的路径,也踩过其中的坑。
第 1 个月:建地基,不碰核心投研。
- 写
CLAUDE.md,把团队所有不成文规矩显式化。这件事最好由最资深的研究员主导,因为规矩在他脑子里。 - 把三个最基础的内部工具包成 MCP:行情查询、因子库查询、回测调用。
- 全员用 Claude 做代码审查、文档整理、研报摘要。目标只有一个:让所有人对它的能力边界形成手感——它哪里靠谱、哪里会一本正经地胡说。
第 2 个月:接管实现层。
- 因子实现、回测脚本、数据管道全面交给 Claude Code,人只写规范和审代码。
- 建立”因子必带测试”的硬规矩,测试不过不进库。
- 开始记录:每个因子从假设到结论花了多少时间。这个数字是你后面向老板证明 ROI 的唯一依据。
第 3 个月:谨慎试探迭代。
- 选一个已经死掉的老因子做自动迭代实验。为什么选死的?因为它没有商业价值,你可以放心地把它玩坏,而且你知道正确答案是”它应该继续是死的”。如果你的 Agent 把一个死因子”救活”了,那你的护栏有问题。
- 五条护栏全部就位后,才允许在活的因子上跑。
永远不做的事: 把实盘持仓、成交明细、客户信息发给任何外部 API。合规上不允许,商业上更不明智。如果确实需要用真实持仓做分析,走企业版的零数据保留(ZDR)协议,或者走 Bedrock / Vertex AI 的私有部署通道,并且事先过法务和合规。这条没有商量余地。
七、几个反直觉的教训
最后说几个我自己撞出来的,都是些看起来不重要、实际上很要命的东西。
教训一:最大的产能提升不在写代码,在写测试。 大部分人第一反应是用 AI 加速写因子。但因子代码本来也就几十行,快不了多少。真正的变化是,你现在敢给每个因子配二十个测试用例了——过去没人愿意花那个时间。代码质量的提升,比代码速度的提升值钱得多。
教训二:模型的”顺从”是最大的风险源。 你说”我觉得这个因子在小盘股上应该更有效”,它大概率会帮你找到支持这个说法的证据。这不是它在骗你,是它在配合你。对策:永远让它同时论证正反两面,或者干脆用两个独立会话,一个论证成立、一个论证不成立,你自己当裁判。
教训三:不要让它记住太多上下文。 100 万 token 的上下文很诱人,但一个塞满了前二十轮失败尝试的会话,会带着强烈的路径依赖。该开新会话就开新会话。 我的经验法则是:每完成一个完整假设的验证,无论成败,都重开。
教训四:给它工具,别给它答案。 与其在 prompt 里贴一堆数据让它分析,不如给它一个 MCP 工具让它自己查。前者它会在数据上产生幻觉,后者它会诚实地告诉你查不到。
教训五:策略经理的角色变了,而且是往上变。 过去你的核心竞争力可能是”我知道怎么把这个想法实现出来”,现在实现这件事的门槛塌了。新的竞争力是:你知道该验证什么、什么样的证据算数、以及在哪里停手。 这三样,模型给不了你,而且短期内也看不到它能给的迹象。
八、写在最后
回到开头那句被很多人忽略的话:这些 Agent 只产出供合格人工审阅的草稿。
我认为 2026 年这一轮真正的分水岭,不在于谁的模型更好——大家用的模型其实都差不多。分水岭在于,谁把”人在哪里签字”这件事想清楚了。
想清楚了的团队,Claude 是一个把研究吞吐放大数倍的杠杆。没想清楚的团队,它是一个把过拟合速度也放大数倍的杠杆。
杠杆是中性的。方向是你给的。
参考资料
- Anthropic, Models overview / Pricing , Agents for financial services(2026-05-05)
- Anthropic, Deploying Claude across financial services
- NVIDIA, State of AI in Financial Services: 2026 Trends(2026-01-22 发布,800+ 从业者调研)
- 中国证券报,《量化私募 AI Agent 落地调查:投研”自动驾驶”驶入深水区》(2026-03-30)
- 融量科技,《六大国产大模型量化因子挖掘横向评测》(2026-05)
- 国联民生金工,《AI 投研新范式:2026 年 AAAI 与 ICLR 前沿论文综述》(2026-07)
- Microsoft Research Asia, R&D-Agent-Quant(NeurIPS 2025)
更多推荐
所有评论(0)