用Claude比发工资还贵!?
过去三年,全球大模型行业的竞争叙事始终围绕着一条清晰主线展开:参数规模的军备竞赛、通用推理能力的榜单排名,以及谁能率先突破"通用人工智能"的能力天花板。在这一阶段,行业默认的商业逻辑是——模型的智能上限决定市场份额,谁能拿出更"聪明"的底座,谁就能吸引更多开发者与企业客户付费。
但随着AI Agent从概念验证全面进入生产落地,这条延续多年的增长逻辑正在发生根本性反转:越来越多深度绑定大模型的企业发现,即便模型能力再强,如果推理成本无法控制在业务可承受的范围内,最终也难以支撑起一门可持续的生意。最近AI Agent创业公司Lindy将全量生产流量从Anthropic迁移至DeepSeek V4的行业事件,正是这一转折的标志性信号。

一、一场由成本危机倒逼的战略决策
Lindy并非行业内的无名新玩家:这家2023年生成式AI浪潮中诞生的AI Agent平台,主打零代码智能助手能力,支持用户自动完成邮件处理、会议调度、CRM数据同步、客户跟进等全链路办公自动化任务。其创始人Flo Crivello拥有连续成功创业背景,此前曾在Uber担任核心工程师与产品负责人,后续创办远程协作平台Teamflow并完成5200万美元融资,是典型的兼具大厂工程视野与创业实战经验的行业从业者。
正是这样一家深耕AI Agent场景的成熟企业,率先公开了行业早已心照不宣的痛点:2026年4月,Crivello在社交平台X上直接披露,Lindy的月度推理总支出已经超过全公司员工薪资总和,成为企业第一大成本项。对于7×24小时持续运行的AI Agent产品而言,这意味着每一次用户触发的自动化任务、每一轮后台长链条思考,都在持续消耗企业的现金流储备。
Lindy面临的困境绝非个例,整个AI产业的成本压力早已从下游应用端向上传导:
2026年5月,GitHub正式宣布调整Copilot订阅模式,将部分高级功能从固定月费转向按量计费,核心原因正是Agent式编程普及后,用户单次触发的链式推理请求量暴涨数倍,原有定价体系已经完全无法覆盖实际算力成本;
曾深度参与大模型早期落地的Uber内部也出现预算危机:由于大规模部署Anthropic Claude Code用于研发提效,公司2026年规划的全年AI算力预算,仅用4个月就接近耗尽,直接推动管理层重新评估所有AI项目的投入产出比;
为了应对全行业爆发的Token成本乱象,Linux基金会在2026年联合谷歌、微软、IBM、Salesforce等科技巨头共同发起成立Tokenomics基金会,试图建立全行业统一的AI Token计量与定价标准,从侧面印证了推理成本失控已经成为全球性的产业共性问题。

二、6-9个月选型背后的产业能力拐点
Lindy最终选择DeepSeek V4,绝非单次事件营销式的临时决策,而是团队持续6-9个月全维度选型评估后的必然结果。这一漫长的选型周期,恰好对应了大模型行业近一年来最关键的能力拐点:
2024年,绝大多数企业对非头部闭源模型的普遍认知仍是"通用能力差距明显,仅能用于边缘场景";但进入2025年底到2026年,以DeepSeek、Kimi、GLM为代表的国产大模型快速迭代,在核心场景能力持续追平国际第一梯队的同时,推理定价始终保持着远低于OpenAI、Anthropic的成本优势。
Crivello在公开分享中完整披露了选型路径:团队最初曾计划将月之暗面的Kimi作为默认底座,后续又完成了智谱AI GLM全系列模型的深度测评,最终将目标锁定在2026年4月刚发布预览版的DeepSeek V4。相比此前在推理能力领域引发行业震动的DeepSeek R1,V4版本进一步补齐了通用场景短板,尤其在Agent长链条任务处理能力上实现针对性优化,同时延续了品牌一贯的极致定价策略。
2026年6月初,Lindy完成全量灰度测试后得到了超出预期的结果:不仅整体推理成本大幅下降,在邮件处理这类占业务比重最高的核心场景中,DeepSeek V4的实际表现甚至超过了此前长期使用的Anthropic模型。
三、100倍迁移工作量揭示的工程真相
全行业都曾有过疑问:大模型都提供标准化API接口,替换底座难道只是修改几行代码的简单操作?但Crivello事后在社交平台感慨,整个迁移过程的实际工作量,比团队最初预估的多出了100倍。
这一巨大的工程鸿沟,恰恰戳破了很多企业对大模型落地的理想化认知:生产环境中的AI系统从来不是孤立的API调用节点,而是一套高度耦合的复杂工程体系——模型背后串联着经过长期调优的Prompt工程体系、全链路自动化评测系统、用户反馈闭环机制、全链路可观测平台、多模型智能路由逻辑,以及完整的安全合规校验流程。更换核心底座意味着所有这些环节都需要完成针对性适配,任何一个节点的偏差都可能直接导致用户体验滑坡。
为了保障迁移后的业务稳定性,Lindy团队搭建了线上线下双层验证体系:除了常规的自动化指标测评,还创新性引入了"Vibe Eval"机制,通过人工主观判断模型输出是否符合用户长期形成的使用习惯,避免自动化测评无法覆盖的体验偏差。整个过程中团队采用灰度放量策略,逐步提升新模型流量占比,全程实时监测用户留存与任务完成率指标,同步迭代适配新模型的Prompt体系。
值得注意的是,Lindy最终没有选择自行部署DeepSeek模型,而是通过美国本土推理服务商Atlas Cloud调用其服务,在保留极致成本优势的同时,规避了自建大规模推理集群的运维复杂度与合规风险。从这个维度看,这次迁移本质上不是简单的模型替换,而是Lindy对自身底层AI基础设施的一次全面重构升级。

四、新市场格局下的理性商业选择
这次迁移并非意味着DeepSeek实现了对Anthropic的全面碾压。Crivello明确披露,在复杂多节点工作流自动化场景中,Anthropic旗下Claude Sonnet的表现依然更具优势,只是这类场景在Lindy的整体业务中占比极低。
当前Lindy的技术栈已经形成了清晰的分层架构:全量核心生产流量运行在DeepSeek V4之上,Anthropic完全从过去的默认主底座退居为备用补充角色——仅当系统监测到主模型任务执行失败时,才会降级调用Anthropic Opus完成兜底,这类请求在总流量中的占比不足1%。同时公司内部员工日常办公仍在使用Anthropic Max订阅服务,Crivello也公开表示,如果未来Anthropic推出能力更强、定价更具竞争力的新模型,团队会第一时间重新评估选型。
对于Lindy这类日均消耗海量Token的AI Agent企业而言,这次迁移直接带来了数百万美元的年度成本节约。而行业第三方数据已经印证了这一趋势的普遍性:来自Vercel AI Gateway的2026年5月运营数据显示,DeepSeek单月在平台的总Token调用占比从不足1%飙升至17%,但对应的营收占比仅约1%,核心驱动因素正是其远低于行业平均水平的定价。
整个大模型市场的商业逻辑正在完成重构:过去行业分层是"头部闭源模型主导高端市场,其他模型补充边缘场景",如今新的二元格局已经清晰形成——一侧是OpenAI、Anthropic等厂商提供的能力天花板最高、定价也最高的旗舰模型,另一侧是DeepSeek、GLM、Kimi等能力持续追平、定价仅为前者几十分之一的高性价比模型。

对于所有深度落地AI Agent的企业来说,商业决策已经回归最朴素的本质:如果用几分之一的成本就能拿到90%的场景能力,为了剩余10%的边缘需求支付数倍溢价,是否还具备商业合理性?正如Crivello的公开表态:"对于我们这类高Token消耗的企业来说,全量迁移是100%必须做的选择,否则就是对公司经营的不负责任。" 未来3-5年,整个AI产业的选型逻辑将彻底脱离品牌崇拜,回归到"场景适配能力+推理成本"的核心标尺上。
更多推荐
所有评论(0)