
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
分析llm的一切,vibe coding
一个独立开发者用 Claude API 搭建飞书群聊 AI 同事的实战经验。从两天搭出原型、到加入三层记忆系统、再到踩坑安全隔离,完整记录一个月的使用效果和成本分析。整套系统不到 1000 行 Python,月成本仅 200-300 元。
上周做客服机器人项目,需要选个小模型跑日常对话。GPT-5.4 系列刚更新了 Mini 和 Nano 两个版本,名字就差一个词,文档里的参数描述也很接近,一开始确实没搞清楚该用哪个。下面是我花两天跑完的实测数据。
折腾了这几天,我对 GPT-5 的总体评价是:综合能力确实是当前最强的,但不是所有场景都值得用它。场景以推理和多模态为主的话,GPT-5 值得立刻切换,提升是肉眼可见的主力是代码生成的话,建议 GPT-5 + Claude Opus 4.6 搭配使用,不同任务用不同模型成本敏感型,GPT-5-mini + DeepSeek V3 的组合可能是 2026 年最优的性价比方案模型更新这么快,与其绑死一
上周我接了个私活,甲方要求同时对接好几个大模型做 A/B 测试——GPT-5.4 刚出没几天,老板非要跟 Claude Opus 4.6、Gemini 3、DeepSeek V3 放一起比比。我寻思这活儿不复杂,结果一算成本差点劝退自己。各家定价策略天差地别,光查价格就花了大半天。索性把评测数据整理出来,省得后面再查。核心结论先放这儿:GPT-5.4 综合能力确实是目前第一梯队,但论性价比,Dee
上周团队把主力模型从 GPT-4o 升级到 GPT-5,月底看账单,我心态有点崩——光 API 费用就涨了将近 40%。GPT-5 推理能力和长上下文处理确实强,但这价格对小团队来说真的肉疼。于是我花了两天时间把能调 GPT-5 的平台挨个摸了一遍,整理出这份费率对比,顺便把自己摸索出的省钱方案一起分享。各平台价格差异很大,选对渠道月省 30%-50% 完全可行。下面是详细数据。
上周四(5 月 22 号)通义千问把 Qwen3.7-Max 的免费 Tier 正式开放了,掘金好几个帖子在讨论。我正好手上有个内部知识库问答的项目在用 Qwen3.7 Plus,想着免费的旗舰模型不白嫖一下说不过去,就花了大半天把接入流程从头跑了一遍。,如果你的业务有并发需求,得提前规划好降级策略。
测了两天,我对 Kimi K2.5 的评价是:2026 年性价比最高的"中文+代码"双修模型。各项全能谈不上,但在"中文理解 × 代码生成 × 合理定价"这个区间里,目前没看到有力的竞争者。项目以中文用户为主、需要大量调用 API 做代码生成或文档处理的话,K2.5 值得认真考虑。几点建议:先用免费额度跑一下你自己的真实场景,别只看 Benchmark;和你现在在用的模型做 A/B 对比,关注输出
上周五晚上,我正用 Claude Code 重构一个老项目的后端接口,写到一半突然开始疯狂报。一看账户余额——没了。充值页面又打不开,卡在支付环节转圈圈。当时项目第二天要交,我差点原地爆炸。折腾到凌晨两点,我把 Claude Code 的 API 地址换成了第三方聚合接口,后面写代码丝滑得不行。核心操作就两个字段:环境变量或配置文件,覆盖掉默认端点,全程不到 5 分钟,不需要改任何代码逻辑。踩过的
上周团队在做一个多模型路由的 RAG 项目,需要选一个性价比高的长上下文模型。MiniMax 刚发了 M2.7,号称百万级上下文、推理能力大幅提升,我寻思正好拉过来跟手头常用的几个模型做个横评。测完数据我人傻了——不是说 M2.7 不行,而是它在某些维度上的表现完全超出我对这个价位模型的预期,但另一些维度又确实拉胯。这篇文章不吹不黑,纯数据说话。
DeepSeek V4 在 2026 年的开源模型里确实是个狠角色。SWE-Bench 58.2、GPQA 72.8,复杂场景下的表现摆在那里。更关键的是价格——输入 ¥4/百万 token,让很多之前因为成本用不起旗舰模型的团队有了新选择。在用 V3 的,尽快测试 V4,尤其是 Function Calling 和复杂推理场景,提升会很明显在用 GPT-5 或 Claude 但成本压力大的,V4








