
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
上一篇我们画了一张完整的冷启动全景图,从 Launcher 点击到 Fully Drawn 的七个阶段都拆开看了一遍。理解全景图是前提,但只有全景图是不够的——你知道时间花在了"某个阶段",但具体是哪行代码、哪个初始化拖慢了整个链路,靠肉眼看代码是猜不出来的。我见过太多团队的启动优化方式是这样的:凭直觉觉得"这个 SDK 初始化肯定慢",花两周把它改成懒加载,一测——快了 50ms。对一个冷启动

LLM 没有持久记忆,它只能看到被塞进上下文窗口里的内容。你塞什么,它就基于什么推理。这个窗口是有限的——哪怕 Claude 3.5 有 200K token,也不是无限的,而且 token 越多,推理越慢、成本越高、注意力越涣散(所谓"Lost in the Middle"问题,中间段内容被忽略的概率更高)。在有限的 token 预算里,把最有价值的信息放进去,把噪声排出去。听起来很简单,但实际
llama.cpp、MNN、MediaPipe 三大端侧推理引擎横向对比,含实测数据、代码示例和决策树,帮你选对引擎省掉80%工程难度
推理越强账单越贵?从GRPO缺陷到BCR任务扩展定律,深度解析2026年AI推理效率之战的核心方法与工程实践
MNN、llama.cpp、NNAPI怎么选?INT4量化踩坑、KV Cache内存炸裂、GPU加速fallback——Android端侧LLM推理工程全攻略
本文以Android开发者的视角解析AI开发中的RAG(检索增强生成)技术,类比Android中的常见模式(如RecyclerView数据绑定、ContentProvider架构)帮助理解。RAG通过文档切片、向量化存储和语义检索,解决大模型的“幻觉”问题,核心流程与Android的数据加载-缓存-展示逻辑高度相似。文章还对比了向量数据库(如Chroma、Pinecone)和Embedding模型
本文探讨了Android工程师如何通过微调技术定制AI模型,类比AOSP与定制ROM的关系。作者以Code Review工具为例,指出Prompt工程存在上下文窗口有限、token成本高、行为修改浅等硬伤,提出微调才是"编译期改代码"的解决方案。文章对比了全量微调、LoRA和QLoRA三种方式,重点推荐LoRA这种"热修复"式方法,能在消费级显卡上实现高效微调。最后详细介绍了数据集构建标准和实战步
Agentic AI的瓶颈从写代码转向产品决策与Agent运营
本文是Android工程师AI开发实战系列的完结篇,探讨如何将RAG、Agent和微调三大技术组合应用,打造一个实用的AI Android开发助手。文章通过MVVM架构类比,提出三层融合方案:RAG作为数据层提供知识检索,Agent作为逻辑层执行工具调用,微调模型作为表现层统一输出风格。作者分享了实战经验,包括构建三层知识库索引、设计Agent工具集、从团队历史数据中提取微调样本等关键技术细节,并
多Agent系统里最隐蔽的成本不是推理费用,是重复注入的上下文。本文从工程角度讲清楚上下文所有权模型、按需拉取、乐观锁状态管理和重置策略







