logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型推理加速与部署专家:构建高性能AI服务的关键技术栈与实践

未来,随着MoE(混合专家模型)的普及和端侧推理需求的爆发,如何针对稀疏模型进行加速、如何在手机端进行极致压缩,将是我们面临的下一个挑战。更糟糕的是,操作系统通常以连续的块分配显存,而请求的长度是动态的,这导致了大量的内部碎片(Internal Fragmentation)。在大模型推理过程中,显存(HBM)往往是比计算单元(FLOPS)更稀缺的资源。传统的Transformer推理中,KV Ca

#人工智能#语言模型
大模型工程化落地:Java后端与K8s容器化部署的深度融合实践

随着大语言模型(LLM)从实验室走向产业界,企业对于AI的需求已经跨越了“跑通Demo”的阶段,迈向了“高可用、高并发、易维护”的生产级应用。这类岗位的核心使命并非从零推导神经网络公式,而是利用Java成熟的工程化体系、Python丰富的AI生态以及Kubernetes(K8s)强大的容器编排能力,将大模型能力无缝、稳定地接入现有业务系统。通过构建高可用的服务网关、设计优雅的流式交互、实现精细化的

#java#开发语言
AI Infra 架构演进:基于 K8s 与 RDMA 构建高性能分布式训练底座

引言:大模型时代的算力与通信博弈随着大语言模型(LLM)的参数规模从数十亿迈向万亿级别,单机训练已彻底无法满足算力需求。在千卡甚至万卡规模的集群中,AI Infra 工程师面临着严峻的挑战:昂贵的 GPU 算力常常在等待节点间的数据同步中白白浪费。传统 TCP/IP 网络栈的延迟和 CPU 开销,已经成为大规模模型训练中最隐蔽的性能杀手。要打破这一瓶颈,必须将 Kubernetes 强大的容器编排

#人工智能#架构#kubernetes
大模型训推一体化架构:从Megatron到vLLM的无缝流转与工程实践

引言:跨越训练与推理的鸿沟随着大模型从预训练阶段迈向强化学习(RL)和在线持续学习,传统的“离线训练、离线部署”模式已无法满足业务对实时反馈和快速迭代的需求。作为大模型训推一体化架构师,我们的核心使命是打破训练框架与推理引擎之间的壁垒,构建一套高吞吐、低延迟、资源高度共享的闭环系统。当前,业界主流的架构通常采用“Megatron-LM + vLLM”的组合。Megatron-LM 凭借其强大的张量

#架构
大模型推理加速与部署专家:构建高性能AI服务的关键技术栈与实践

未来,随着MoE(混合专家模型)的普及和端侧推理需求的爆发,如何针对稀疏模型进行加速、如何在手机端进行极致压缩,将是我们面临的下一个挑战。更糟糕的是,操作系统通常以连续的块分配显存,而请求的长度是动态的,这导致了大量的内部碎片(Internal Fragmentation)。在大模型推理过程中,显存(HBM)往往是比计算单元(FLOPS)更稀缺的资源。传统的Transformer推理中,KV Ca

#人工智能#语言模型
AI Infra 架构演进:基于 K8s 与 RDMA 构建高性能分布式训练底座

引言:大模型时代的算力与通信博弈随着大语言模型(LLM)的参数规模从数十亿迈向万亿级别,单机训练已彻底无法满足算力需求。在千卡甚至万卡规模的集群中,AI Infra 工程师面临着严峻的挑战:昂贵的 GPU 算力常常在等待节点间的数据同步中白白浪费。传统 TCP/IP 网络栈的延迟和 CPU 开销,已经成为大规模模型训练中最隐蔽的性能杀手。要打破这一瓶颈,必须将 Kubernetes 强大的容器编排

#人工智能#架构#kubernetes
大模型训推一体化架构:从Megatron到vLLM的无缝流转与工程实践

引言:跨越训练与推理的鸿沟随着大模型从预训练阶段迈向强化学习(RL)和在线持续学习,传统的“离线训练、离线部署”模式已无法满足业务对实时反馈和快速迭代的需求。作为大模型训推一体化架构师,我们的核心使命是打破训练框架与推理引擎之间的壁垒,构建一套高吞吐、低延迟、资源高度共享的闭环系统。当前,业界主流的架构通常采用“Megatron-LM + vLLM”的组合。Megatron-LM 凭借其强大的张量

#架构
大模型工程化落地:Java后端与K8s容器化部署的深度融合实践

随着大语言模型(LLM)从实验室走向产业界,企业对于AI的需求已经跨越了“跑通Demo”的阶段,迈向了“高可用、高并发、易维护”的生产级应用。这类岗位的核心使命并非从零推导神经网络公式,而是利用Java成熟的工程化体系、Python丰富的AI生态以及Kubernetes(K8s)强大的容器编排能力,将大模型能力无缝、稳定地接入现有业务系统。通过构建高可用的服务网关、设计优雅的流式交互、实现精细化的

#java#开发语言
构建下一代认知智能体的技术架构与实践

作为大模型算法工程师(Agent/RAG方向),我们的核心职责不再仅仅是微调一个基座模型,而是设计一套能够高效协同“大脑(LLM)”、“记忆(Vector DB)”与“手脚(Tools)”的系统工程。随着大语言模型(LLM)能力的指数级跃升,我们正见证着人工智能从单纯的“文本生成器”向具备自主规划、工具使用及环境交互能力的“智能体(Agent)”演变。基础的RAG流程(切片-嵌入-检索-生成)往往

#架构#人工智能
大模型推理加速与部署专家:构建高性能AI服务的关键技术栈与实践

未来,随着MoE(混合专家模型)的普及和端侧推理需求的爆发,如何针对稀疏模型进行加速、如何在手机端进行极致压缩,将是我们面临的下一个挑战。更糟糕的是,操作系统通常以连续的块分配显存,而请求的长度是动态的,这导致了大量的内部碎片(Internal Fragmentation)。在大模型推理过程中,显存(HBM)往往是比计算单元(FLOPS)更稀缺的资源。传统的Transformer推理中,KV Ca

#人工智能#语言模型
到底了