
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文对国产大模型qwen和deepseek系列进行横向评测,采用统一测试框架对比编程场景表现。测试覆盖代码生成、Bug修复等核心场景,使用可复现的定量分析方法。结果显示:在代码生成方面,qwen-max和deepseek-v3表现相当,均能实现线程安全、关键字参数等完整功能;qwen-plus在边界条件处理稍弱;deepseek-r1因推理过程导致延迟较高但注释最详细。测试框架支持多模型统一调用,
本文解析了大模型API的Token计费机制与实用省钱技巧。Token是文本处理的最小单位,中英文Token密度差异显著(中文约为英文2倍)。计费按输入/输出Token分开计算,输出通常更贵。文章对比了主流国产模型定价,指出DeepSeek-V3性价比突出,并分析了影响Token消耗的关键因素:System Prompt、Few-shot示例、对话历史和输出长度。通过智能客服案例展示了成本估算方法,
用同一个 prompt 打了 8 个模型,测了每个的 TTFB 和总响应时间。结论比你想象中差异更大——某些"便宜小模型"比旗舰快了 10 倍以上。
一个日均 10 万次调用的项目,月费从 $3000 降到 $1200,没有降低服务质量。本文分享我们的完整优化路径。
让模型输出 JSON,说起来简单,实际上能把人逼疯。这篇文章讲清楚三种方案的差别,以及怎么通过 TheRouter 在多个模型上统一使用。
--- 过去两年,主流大模型的 context window 从 4K 涨到了 128K,再到如今 Gemini 3 Pro 的 1M、Llama 4 Scout 宣称的 10M。每次发布都伴随着"长文档处理"、"长上下文理解"的宣传。

你可能已经习惯了“用哪个 AI 编程工具更强”的争论。

上周我排一个 Agent 执行链路的问题,日志里有一行特别刺眼:模型把「检查依赖」理解成了「重装依赖」,生成了一条 rm -rf ./node_modules && npm install。

去年 10 月,我在跑一个自动化内容分析 Agent——每隔几分钟拉一批数据、调 LLM 分析、写回数据库。它跑了好几周没出过事。

文章摘要: 本文聚焦智能Agent架构中的记忆层,对比了记忆层与上下文管理层的区别,并介绍了三种持久化架构。记忆层负责跨会话的知识持久化,决定了Agent能否记住用户偏好和历史信息。与上下文管理不同,记忆层具有永久存储、跨会话、数据库存储和检索后注入的特点。文章详细分析了三种记忆架构:1)键值对存储,适合结构明确的小量数据;2)对话日志+摘要归档,通过定期压缩对话历史生成摘要;3)向量检索,实现语







