
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文探讨了端侧大模型在鸿蒙应用中的架构重构问题。传统云端AI模式存在网络依赖、延迟高等问题,而端侧模型带来三大本质变化:常驻运行、参与业务决策和系统级调度。作者提出应将模型置于Domain层而非Data层,通过抽象接口实现业务集成,并结合鸿蒙分布式能力实现跨设备协同。文章分析了工程挑战如推理耗时管理、输出校验和算力适配,指出未来鸿蒙应用的竞争力在于嵌入式决策能力。端侧大模型不仅是技术升级,更是从功

《AI行业的效率革命:从算力竞争到系统优化》 摘要:随着AI技术的发展,行业正从单纯的算力竞争转向系统效率优化。过去堆叠GPU和参数的方法已遇到瓶颈,现代AI系统的核心矛盾已从"算不动"变为"流不动",内存访问、带宽和任务调度成为关键制约因素。长上下文处理、MoE架构和AI Runtime调度能力的优化,正推动行业进入"系统效率革命"阶段。未来竞争将聚焦内存管理、资源调度和带宽优化,AI芯片设计也

摘要 本文探讨了AI系统性能瓶颈的演变趋势。随着大模型发展,行业发现单纯提升模型规模已无法保证系统性能,实际应用中常出现响应延迟问题。研究表明,现代AI系统的瓶颈已从计算能力转向数据流效率,主要体现在: 数据预处理和传输耗时远超计算时间 KV Cache等运行时状态占用大量内存资源 带宽和内存访问速度取代算力成为关键指标 长上下文场景下内存容量成为主要限制 Agent系统中任务调度效率比单次推理速

QKVToken:北京Q_beijingK_beijingV_beijingQ:我想找谁K:我是哪个信息V:我携带什么内容Q = 查询条件K = 索引V = 数据KV名称的来源。KV Cache 本质上是 Transformer Attention 的结果缓存机制,用空间换时间,避免历史 Token 的重复计算。重复计算问题已经算过的 K 和 V不要再算第二次决定模型能力KV Cache决定推理效

大模型推理成本分析:从架构视角看为什么推理如此昂贵 本文从技术架构角度分析了大模型推理成本高昂的核心原因。关键点包括: 推理本质是实时计算过程,需要逐层执行Transformer计算,生成每个token都需要完整计算流程 成本主要取决于GPU占用时间而非单纯参数规模,延迟直接转化为金钱成本 Attention机制存在O(N²)复杂度问题,长上下文场景计算量激增 KV Cache虽提高效率但占用大量

大模型推理加速十大核心技术摘要 随着AI应用从训练转向推理,降低推理成本成为行业焦点。本文系统介绍了当前大模型推理优化的十大关键技术: KV Cache:缓存历史计算结果,避免重复计算,降低复杂度 Continuous Batching:动态批处理提升GPU利用率 PagedAttention:分页管理显存减少碎片 FlashAttention:优化内存访问加速Attention计算 量化技术:I

本文从系统架构角度分析了Transformer至今仍是大模型核心架构的原因。首先,Transformer解决了RNN无法并行计算的问题,大幅提升GPU利用率;其次,Attention机制赋予模型全局视野和长距离依赖能力;第三,Transformer的矩阵运算特性与GPU高度匹配;第四,Scaling Law证明其具有持续扩展性;第五,模块化设计使其能不断升级优化;第六,围绕Transformer已

自治系统:从任务执行到自主运行的范式转变 本文探讨了AI系统从工具(Agent)到自治系统(Autonomous System)的演进过程。核心观点指出,Agent虽然能执行任务,但仍存在被动触发、短期记忆、无长期目标和自我优化等局限。真正的自治系统具备持续感知、长期记忆、目标驱动、自我决策、自我优化和多Agent协作六大关键能力,形成"感知-记忆-决策-行动-反馈"的闭环循环

文章摘要: 随着AI时代的到来,传统操作系统(如Windows、HarmonyOS等)聚焦的“资源管理”模式正面临挑战。未来软件系统的核心需求转向“目标管理”,催生了运行于操作系统之上的“第二操作系统”——Agent Runtime。它承担任务规划、上下文管理、工具调度等新职责,形成“目标驱动”的新架构。HarmonyOS PC可能率先实现双层Runtime架构:底层HarmonyOS Kerne

ChatBot:知道答案Agent:完成任务ChatBotLLMAgentLLMMemoryPlanningToolsAction认知问题执行问题因此从 ChatBot 到 Agent,并不是一次产品升级。AI 应用范式升级。未来的软件不再只是“被使用的工具”,而会逐渐演变成“主动工作的系统”。而 Agent,正是这场变革的起点。








