
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
调用大模型时,默认是"一次性返回":你发请求,模型把整段答案生成完,再一次性返回给你。这种方式叫同步调用。问题在于:大模型生成一段长文本可能要十几秒,这期间用户只能干盯着 loading 图标转圈,体验很差。流式输出(Stream)改变了这个模式:模型一边生成、一边把已经生成出来的"碎片"(token)推送给客户端,客户端边收边显示,像打字机一样逐字出现。ChatGPT 那种"文字一个个蹦出来"的
在构思Prompt时,首先要回答一个问题:我想做什么样的东西?对于3D小世界编辑器,定位是“摆在桌子上的小模型”,而不是“开放世界探索游戏”。这两者的差异巨大:模型世界:规模有限(8×8网格),视角固定俯瞰,物体像积木一样拼接,强调手作感和可控性。开放世界:无边无际,需要LOD(细节层次)技术、动态加载、第一人称或第三人称漫游。将定位明确写入Prompt,可以防止模型生成过于复杂或不切实际的方案。
本文核心讲解了编程底层哈希容器体系:哈希表是 Dict、Set 的底层核心,依靠 key 哈希运算实现 O(1) 极速查询;Dict 适合高速键值检索,内存开销大;List 节省内存,大数据查询低效。同时明确了可哈希规则:只有不可变对象可作为字典、集合的键,可变对象会直接抛出类型错误。最后区分了可变与不可变对象的本质差异,联动 JS 变量提升优先级知识点,打通前后端底层逻辑。
Token:LLM 最小计价/工作单位,BPE 子词切分产物,不是字符也不是单词。Tokenization 必要性:神经网络只认数字,文本必须转 ID 再 Embedding 为连续语义向量。BPE 算法:从字符开始反复合并高频字节对,兼顾语义完整性和词汇表效率。Embedding:完成"离散符号 → 连续语义"的关键一跃,让语义相似度可计算。余弦相似度:衡量语义相似度的标准工具,只看方向不看长度
在模型之上,是数据的艺术;在模型之下,是数据的地基。智能 = 数据 × 算力 × 算法,数据决定智能上限,是三者中最关键的一环。训练集学规律,验证集调参数,测试集测泛化——三者严格分离,测试集绝不可反复使用。K 折交叉验证让每份数据轮换充当训练/测试集,防止单次划分偏差,适合中小数据集。LLM 数据工程是动态循环:质量评估 → 动态验证集 → 覆盖率分析 → 去重与污染检测。实战要点:seed 固

Harness Engineering 代表的是 AI 工程化从"调 Prompt"到"建系统"的范式跃迁。演进路径:Prompt → Context → Harness,每一步解决前一步的局限核心比喻:模型是引擎 / 马,Harness 是整车 / 挽具缺陷驱动设计:无状态→记忆层记忆层是基石:CLAUDE.md 作为导航地图,/init建立记忆,持续更新——这是 Harness 的首要切入点。
让任何 AI 模型以统一的方式访问任何外部资源和工具。它类比于硬件领域的 USB-C——统一接口、即插即用、生态共享。
概念层面:蒸馏 = 把大模型(教师)的知识精华提炼出来,迁移到小模型(学生),就像化学蒸馏去其糟粕取其精华,也像无崖子传功给虚竹。原理层面:核心在于软标签 vs 硬标签的区别。硬标签是"标准答案",软标签是"概率分布"。软标签里藏着暗知识——类别之间的相似性和关联关系。蒸馏让小模型学会这个概率分布,本质上是学会了思维方式而不仅仅是答案。价值层面:蒸馏是 AI 商业化的关键技术,让"便宜、快速、可私
LangChain = Lang(uage) + Chain(链)。它的核心思想很简单:AI 应用不是"调一次 API 就完事"的,它往往是一个多步骤的工作流(Workflow)——接收输入 → 套用提示词模板 → 调用 LLM → 解析输出 → 执行下一步操作。LangChain 做的事情,就是让这个工作流中的每一步都可复用、可组合、可维护。LLM 的本质是概率预测,不是确定性计算。它输出的每个
这篇文章我们完整拆解了一个"浏览器本地大模型"应用。浏览器跑大模型是可行的,靠的是 WebGPU 提供 GPU 算力 + 量化压缩模型体积;架构上采用主线程 + Web Worker分离:Worker 负责吃力的推理,主线程只做渲染,两者靠消息协议通信;流式输出是体验的关键,靠逐个 token 解码回调,主线程增量拼接实现"打字机"效果;思考/回答的区分利用了<think></think>特殊 t







