logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Kthena + vLLM-Ascend:云原生大模型推理的编排与调度实践

云原生技术与AI基础设施深度融合,大模型在 Kubernetes 上的生产级部署成为行业当前核心课题。在千亿参数模型普及的今天,单机显存已无法承载,TP(张量并行)与 PP(流水线并行)成为标配。然而,这种分布式范式的转变,使得习惯于处理无状态微服务的 Kubernetes 原生工作负载抽象(如 Deployment/Service)显得力不从心。

#云原生
Claude Code 实战 400 万 Tokens:接入 DeepSeek V4,从$26降到$2

400 万个 tokens。Claude Sonnet 4.6,$3 输入 / $15 输出,保守估算下来将近 $26。不是说它贵,是突然意识到:这只是一周的编码量。如果是个认真用 AI 工具的工程师,每个月的消费可能超过一台云服务器。然后 2026 年 4 月 24 日,DeepSeek 发布了 V4,并在三天后(今天,4 月 27 日)宣布 V4-Pro 限时降价 75%。我把 Claude

#spring#java#后端
Kthena + vLLM-Ascend:云原生大模型推理的编排与调度实践

云原生技术与AI基础设施深度融合,大模型在 Kubernetes 上的生产级部署成为行业当前核心课题。在千亿参数模型普及的今天,单机显存已无法承载,TP(张量并行)与 PP(流水线并行)成为标配。然而,这种分布式范式的转变,使得习惯于处理无状态微服务的 Kubernetes 原生工作负载抽象(如 Deployment/Service)显得力不从心。

#云原生
《动手学深度学习》第一章笔记:机器学习问题到底怎么分类

好家伙,这次我把《动手学深度学习》第一章读完了。先说一下,我为什么会突然翻这本书。更直接的原因是,前面我在做一个从零学习 AI 的小项目。写一个小项目去用,去学习ai(所谓干中学)写到训练循环时,代码里开始出现这些东西:再具体一点,是为了看懂这行代码:这行代码背后其实是在回答:当时我一路追下去,就追到了:让我的codex老师给我解释,越解释越晕所以我才去翻《动手学深度学习》。为了理解第一章它先把机

#机器学习#深度学习
Kthena + vLLM-Ascend:云原生大模型推理的编排与调度实践

云原生技术与AI基础设施深度融合,大模型在 Kubernetes 上的生产级部署成为行业当前核心课题。在千亿参数模型普及的今天,单机显存已无法承载,TP(张量并行)与 PP(流水线并行)成为标配。然而,这种分布式范式的转变,使得习惯于处理无状态微服务的 Kubernetes 原生工作负载抽象(如 Deployment/Service)显得力不从心。

#云原生
到底了