
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
如果你长时间用过代码 Agent,大概率遇到过这种场景:前面半小时还在很认真地查仓库、跑测试、解冲突,下一轮突然像换了个人,只记得“正在处理一个项目”,但忘了分支名、PR 编号、刚才失败的是哪个测试。这类崩坏通常不发生在第一轮。它发生在上下文被压缩之后。所以过去很多人的习惯很保守:上下文快满之前,先让 Agent 写一份交接文档;重要任务做到一半,尽量不要自动 compact;能新开会话就新开会话
接收用户输入的问题;自主判断是否需要调用搜索工具;输出标准化结果:需要搜索则返回关键词,无需搜索则直接返回答案。这个案例是 LangGraph 与大模型结合的最佳入门示例用 LangGraph 编排流程,让大模型做决策。对于刚接触大模型应用开发的朋友,先跑通这个基础工作流,再逐步添加工具调用、分支判断、循环执行等功能,就能快速搭建出专业的大模型智能应用。后续我会继续分享 LangGraph 进阶实
把"滚动截屏"放在截屏工具的扩展项里,本质上反映的是一件很普通的事:现代应用几乎没有"一屏装得下"的内容。一个长 PDF 几十页,一个 GitHub Issue 几百条评论,一段没分页的 Word 文档,一份产品需求的网页版说明,一段微信里被反复刷出来的长文截图——这些内容统统需要滚动条才能看完,但当你需要把它"完整地交给别人"时,传统的单屏截屏只能截到你眼睛当前看到的那一块,剩下的全部丢失。
任何一款操作系统, 总有人爱有人恨, 其实挺正常的, 不过手机这玩意只是个工具, 我们犯不着提升到咬牙切齿的地步, 不喜欢, 换了就是. 想想如果这世界清一色都是IOS和Android那种思路的IOS系统(现今Android的那套换肤其实当年黑莓和WinMobile早就玩烂了, 架子和灵魂都是一样的), 我们的行事思维也太固化了. 有这么一个与众不同的手机操作系统存在, 至少也让你,你的朋友和家人
很久很久之前,你不与任何其他电脑相连接,孤苦伶仃。直到有一天,你希望与另一台电脑 B 建立通信,于是你们各开了一个网口,用一根连接了起来。用一根网线连接起来怎么就能"通信"了呢?我可以给你讲 IO、讲中断、讲缓冲区,但这不是研究网络时该关心的问题。如果你纠结,要么去研究一下操作系统是如何处理网络 IO 的,要么去研究一下包是如何被网卡转换成电信号发送出去的,要么就仅仅把它当做电脑里有个小人在吧~反
当时想做一个弹簧振子的 Manim 动画:一个小球连接在弹簧上,在平衡位置附近往复振动。我一开始的思路是——。这段代码跑起来之后,小球确实动起来了。但看了几秒之后——小球越振幅度越大,能量明显不守恒。欧拉法的数值误差在逐帧累积,像个隐形的外力在不断推着小球。我当然可以换龙格-库塔法,但那意味着更复杂的代码、更长的调试时间。直到我开始用SymPy的dsolve,才发现原来我根本不需要自己写数值积分。
GPUStack 支持可插拔的推理引擎架构,允许自定义推理后端及其版本,用于引入 GPUStack 未内置的vLLMSGLangMindIE版本,或接入其他自定义推理引擎镜像。为了部署模型,这里以SGLang最新v0.5.12CUDA 版本官方镜像地址国内镜像地址cu130cu129对于其他 GPU,可前往查找 SGLang 官方打包的专用镜像。在推理后端菜单,编辑 SGLang,在版本配置中选择
vLLM的定位是服务端LLM推理引擎,而不是个人本地试玩工具。如果只是本地体验模型,或者主要使用CPU推理、GGUF模型,llama.cpp和Ollama通常更合适。vLLM的核心场景,是将开源LLM稳定部署为在线服务。它的优势主要体现在GPU推理、高并发处理、监控指标和生产部署能力上,适用于企业内部模型服务、RAG系统、Agent平台,以及需要多人同时调用的API服务。不过vLLM本身并未提供官
如果你长时间用过代码 Agent,大概率遇到过这种场景:前面半小时还在很认真地查仓库、跑测试、解冲突,下一轮突然像换了个人,只记得“正在处理一个项目”,但忘了分支名、PR 编号、刚才失败的是哪个测试。这类崩坏通常不发生在第一轮。它发生在上下文被压缩之后。所以过去很多人的习惯很保守:上下文快满之前,先让 Agent 写一份交接文档;重要任务做到一半,尽量不要自动 compact;能新开会话就新开会话







