
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要 Claude Code是Anthropic推出的命令行AI编程工具,被誉为"终端中的AI工程师",能深度理解项目、执行终端命令并直接修改代码。为解决官方API地域限制和成本问题,推荐使用CC-Switch工具接入国产大模型(DeepSeek、Qwen、GLM等)。安装教程涵盖Node.js环境配置、Claude Code安装、CC-Switch部署及模型接入步骤,特别提供了DeepSeek/

文章摘要: DeepSeek 的 Input Cache(输入缓存) 是一种优化大模型推理性能的技术,通过缓存输入 Prompt 的中间计算结果(如 KV Cache),避免重复计算相同前缀的 Token,从而提升响应速度并降低 API 成本。其核心原理是:当多次请求的输入前缀一致时,直接复用已缓存的中间状态,仅计算新增或变化的部分。 关键点: 缓存内容:模型处理输入时的中间计算结果(非最终回答)

大模型agent的记忆系统如何实现,什么时候存,什么时候取?

如何让大模型稳定输出JSON

文章摘要: DeepSeek 的 Input Cache(输入缓存) 是一种优化大模型推理性能的技术,通过缓存输入 Prompt 的中间计算结果(如 KV Cache),避免重复计算相同前缀的 Token,从而提升响应速度并降低 API 成本。其核心原理是:当多次请求的输入前缀一致时,直接复用已缓存的中间状态,仅计算新增或变化的部分。 关键点: 缓存内容:模型处理输入时的中间计算结果(非最终回答)

AI 应用的高并发并没有一个所谓的“万能技术”。先减少不必要的请求↓缓存再限制请求进入速度↓限流再控制下游并发↓再把耗时任务异步化↓再提高单机处理能力↓单机不够↓多实例 + Load Balancer下游不稳定↓模型成为瓶颈↓模型路由 + vLLM / SGLang + Batching所以对于 AI 应用来说,高并发优化最重要的不是记住几十个组件,而是学会找到真正的瓶颈在哪里。QPS高→ 看限流

大模型agent的记忆系统如何实现,什么时候存,什么时候取?

大模型agent的记忆系统如何实现,什么时候存,什么时候取?

大模型agent的记忆系统如何实现,什么时候存,什么时候取?

本文介绍了一个基于LangGraph和MCP协议构建的AI Agent天气查询系统。系统采用分层架构设计,包含MCP Server(提供天气查询服务)、MCP Client(工具调度)、LangGraph Agent(决策推理)和DeepSeek LLM(语言处理)四个核心组件。相比传统LangChain Agent,该系统通过MCP协议实现了工具服务化,解决了工具复用性差、耦合度高的问题。文章详








