
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
内存管理KV 缓存的存储占 LLM 服务内存使用量的主导地位,尤其是在上下文长度较长时。由于生成长度不确定,因此提前为 KV 缓存存储分配空间具有挑战性。早期的实现通常会根据每个请求预设的最大长度提前分配存储空间。然而,在请求生成提前终止的情况下,这种方法会导致存储资源的大量浪费。针对这个问题,两个比较有名的推理框架vLLM和LightLLM分别做了以下解决:vLLM提出了一种类似于操作系统分页的

2026年春天,AI行业的热词不再只是“万亿参数”或“MoE架构”,一个听起来和AI毫无关系的词突然火了——Harness。这个词的走红源于一个有趣的现象:OpenClaw没有发布任何新模型,没有刷新任何基准测试,甚至没有训练一个新参数。它只做了一件事——给大模型搭建了一套完整的工作环境:文件系统、代码沙箱、工具链、反馈循环、自动验收。同一个模型,在这套环境中,不再是一个只会对话的聊天机器人,而是

2026年春天,AI行业的热词不再只是“万亿参数”或“MoE架构”,一个听起来和AI毫无关系的词突然火了——Harness。这个词的走红源于一个有趣的现象:OpenClaw没有发布任何新模型,没有刷新任何基准测试,甚至没有训练一个新参数。它只做了一件事——给大模型搭建了一套完整的工作环境:文件系统、代码沙箱、工具链、反馈循环、自动验收。同一个模型,在这套环境中,不再是一个只会对话的聊天机器人,而是

自从2022年12月 ChatGPT 横空面世以来,AI 领域获得了十足的关注和资本,其实AI的概念在早些年也火过一波,本轮 AI 热潮相比于之前的 AI,最大的区别在于:生成式。本文主要介绍大语言模型(Large Language Model,简称LLM)。通过海量文本训练的、能识别人类语言、执行语言类任务、拥有大量参数的模型,称之为大语言模型。

引申到模型层面,涌现能力指的是当模型的训练数据突破一定规模,模型突然涌现出之前小模型所没有的、意料之外的、能够综合分析和解决更深层次问题的复杂能力和特性,展现出类似人类的思维和智能。简而言之,大模型是指利用海量数据,通过先进的算法和技术,训练得到的具有强大预测和决策能力的模型。它们利用大算力、使用海量的开放数据与具有巨量参数的深度学习算法,在大规模无标注数据上进行训练,以寻找特征并发现规律,进而形

提到“大模型”,很多人第一反应是“听起来很复杂”,其实拆解开来看,核心就是“大”和“模型”两个关键词。首先说名字:大模型的英文是“Large Model”,早期也叫“Foundation Model”(基础模型),但咱们平时说的“大模型”,其实是“人工智能预训练大模型”的简称——“预训练”是它的核心技术之一,后面会专门解释,这里先记住这个完整名字。更关键的是“分类”:现在大家口中的大模型,大多特指

AI Agent并非简单的“任务执行器”,而是具备感知、推理、决策与行动闭环的智能系统。它以大模型(LLM)的深度语义理解与推理能力为核心,结合工具调用、环境交互能力,能自主拆解目标、调整策略,最终实现复杂需求。从技术层面看,AI Agent是“能感知外部环境信息、基于预设目标与经验进行推理、自主选择行动方案,并通过工具或接口执行操作的软件实体”。它不仅整合了LLM的语言理解与逻辑分析能力,还融入

OpenAI 将AI Agent(智能体)定义为,以大语言模型为大脑驱动,具有自主理解感知、规划、记忆和使用工具的能力,能自动化执行完成复杂任务的系统。它不像传统工具只会“被动干活”,而是可以像“数字员工”一样,自己接任务、做规划、找方法,还能不断自我优化。想象你招了个“超级员工”:它自己会拆解任务,主动调用工具,持续进化不摆烂。简单来说,它具备三个“核心技能”:👁️ 能看懂:能感知客户行为、文

学术界和工业界对术语“智能体”提出了各种定义。大致来说,一个智能体应具备类似人类的思考和规划能力,拥有记忆甚至情感,并具备一定的技能以便与环境、智能体和人类进行交互。可以将智能体想象成环境中的数字人,其中:智能体 = 大语言模型(LLM) + 观察 + 思考 + 行动 + 记忆。这个公式概括了智能体的功能本质。为了理解每个组成部分,让我们将其与人类进行类比:1. 大语言模型(LLM):LLM 作为

过去一年,AI Agent从技术概念走向工程落地。但很多人仍然把注意力集中在“用哪个模型”上——换更强的模型、写更长的提示词,仿佛模型就是Agent的全部。但实际开发过Agent 的人,大概率会认识到,这并非事实。一个在业界已形成共识的公式是:Agent = Model + Harness。模型负责“思考”,Harness负责让这份思考变得有用。长程Agent对Harness的依赖,超过它对任何单








