
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
/ ===== 功能函数:真正干活的代码 =====// 给用户实时反馈(Agent 任务可能很耗时,用户需要感知进度)console.log(`[工具调用] read_file(${// ===== 功能函数:真正干活的代码 ===== const content = await fs . readFile(filePath , 'utf-8');

Tool 是 Agent 的"手脚",让 LLM 从"想"变成"做"。LangChain 使用的tool()(把js变成LLM的tool) 函数定义工具,配合zod做参数校验。组成部分说明处理函数(异步)真正的执行逻辑,如描述对象name(工具名)、(告诉 LLM 什么时候用)、schema(zod 参数约束)// tool.mjs — 定义文件读取工具import {// zod 提供运行时类型

如果你用过Trae或Cursor,一定对这样的体验不陌生:“用 Vite 创建一个 React 的 TodoList 项目,并把它运行起来。Cursor 到底做了哪些事情?当你在 Cursor 中输入:"帮我创建一个 React TodoList 项目"它其实不是一句话回答你。而是在后台连续完成了下面这些事情:① 分析你的需求② 创建 React 项目③ 修改 App.tsx④ 写 CSS⑤ 安装
用户发送问题 → 服务器开始推理 → 推理完成 → 一次性返回全部结果 → 前端渲染推理过程可能非常漫长——一个复杂问题(比如"用 JavaScript 写一个贪吃蛇游戏"),LLM 可能需要推理 30 秒甚至更久。用户盯着空白页面干等半分钟,这是 AI 产品绝不能出现的体验。不要等所有结果都生成完再返回,而是生成一个 token 就立即返回一个 token。用户发送问题 → 服务器开始推理 →
用户输入 → 网络请求 → 远程服务器(GPU集群) → 推理计算 → 返回结果这种方式叫云端推理,模型跑在厂商的服务器上。贵:厂商需要采购大量 GPU,成本最终转嫁给你(API 按 token 计费)。不安全:你的输入内容(context)会随着请求发送到远端服务器,数据隐私无法完全掌控。而端侧模型(On-Device Model)指的是模型直接运行在你的设备上——手机、电脑、汽车、甚至浏览器。
Benchmark 就是一套统一的考试题,用来公平比较不同模型、算法或硬件谁更强。放在大模型领域,Benchmark 是 LLM 在一系列标准化测试中的得分集合。它是多维的、可量化、可复现的。你可以把它理解为:给AI模型出一堆标准题目,让它去考试,考完了会出一个分数——这就是模型的"高考成绩单"。上半部分——Benchmark 评测体系:梳理了 MMLU、GPQA、HumanEval、SWE-be
在构思Prompt时,首先要回答一个问题:我想做什么样的东西?对于3D小世界编辑器,定位是“摆在桌子上的小模型”,而不是“开放世界探索游戏”。这两者的差异巨大:模型世界:规模有限(8×8网格),视角固定俯瞰,物体像积木一样拼接,强调手作感和可控性。开放世界:无边无际,需要LOD(细节层次)技术、动态加载、第一人称或第三人称漫游。将定位明确写入Prompt,可以防止模型生成过于复杂或不切实际的方案。
Token:LLM 最小计价/工作单位,BPE 子词切分产物,不是字符也不是单词。Tokenization 必要性:神经网络只认数字,文本必须转 ID 再 Embedding 为连续语义向量。BPE 算法:从字符开始反复合并高频字节对,兼顾语义完整性和词汇表效率。Embedding:完成"离散符号 → 连续语义"的关键一跃,让语义相似度可计算。余弦相似度:衡量语义相似度的标准工具,只看方向不看长度
在模型之上,是数据的艺术;在模型之下,是数据的地基。智能 = 数据 × 算力 × 算法,数据决定智能上限,是三者中最关键的一环。训练集学规律,验证集调参数,测试集测泛化——三者严格分离,测试集绝不可反复使用。K 折交叉验证让每份数据轮换充当训练/测试集,防止单次划分偏差,适合中小数据集。LLM 数据工程是动态循环:质量评估 → 动态验证集 → 覆盖率分析 → 去重与污染检测。实战要点:seed 固

Harness Engineering 代表的是 AI 工程化从"调 Prompt"到"建系统"的范式跃迁。演进路径:Prompt → Context → Harness,每一步解决前一步的局限核心比喻:模型是引擎 / 马,Harness 是整车 / 挽具缺陷驱动设计:无状态→记忆层记忆层是基石:CLAUDE.md 作为导航地图,/init建立记忆,持续更新——这是 Harness 的首要切入点。







