logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

$173,一个 4B 小模型正面打赢了 20 倍参数的大模型

如果我告诉你,有人只花了 173 美元、用一块 Colab 的 A100 显卡,就微调出了一个在特定任务上打赢 20 倍参数量大模型的 4B 小模型,你的第一反应大概率是"这是营销号吹牛"。但这件事背后其实有着扎实的理论支撑:斯坦福、MIT、哈佛 Kempner 研究所和 Anthropic 联合发表的论文揭示了大模型聪明的真正原因,而这个原因反过来推导,恰恰说明了小模型微调在垂直场景下"以小博大

文章图片
#人工智能#机器学习#深度学习
Langfuse:开源的大模型工程可观测平台

Langfuse 是一个开源的 LLM 工程平台,帮助团队协作开发、监控、评估和调试 AI 应用。它把追踪(Tracing)、提示词管理、评估、数据集和 Playground 整合到同一个系统里,既可以用云端托管版,也能在 5 分钟内用 Docker Compose 自托管。项目由 YC W23 孵化,基于 ClickHouse 构建,已被大量开源 AI 项目采用为默认可观测方案。

文章图片
#开源
Opik:开源大模型可观测与评估平台

Opik 是 Comet 团队开源的一站式 LLM 应用可观测、评估与优化平台,覆盖从原型到生产的全生命周期。无论是 RAG 问答、代码助手还是复杂的 Agent 系统,Opik 都能提供完整的调用链路追踪、自动化评估以及提示词/工具的自动优化能力,让开发者不再靠"猜"来判断模型效果好坏。项目已支持 40M+/天 的生产级追踪量,并原生集成了数十种主流 LLM 框架。

文章图片
#开源
LiteLLM:一个 AI 网关打通 100+ 大模型

LiteLLM 是一个开源 AI Gateway,把 OpenAI、Anthropic、Gemini、Bedrock、Azure 等 100+ 大模型供应商统一成一套 OpenAI 格式的接口——换供应商不用重写代码,一行代码切换模型。既可以当 Python SDK 直接嵌进代码里用,也可以部署成独立的代理服务(AI Gateway)给团队统一管理密钥、限流和计费,1000 RPS 下 P95 延

文章图片
#人工智能#AI#开发工具
K8s+Ray+vLLM打穿大模型全生命周期(有实践步骤)

K8s + Ray + PyTorch + vLLM 是当前大模型工程里出现频率很高的一套组合,但网上大多数文章只谈"为什么好",很少给出真正能跑、能验证的完整链路。这篇文章分两部分:先做定位分析——四个组件到底各自解决什么问题、边界在哪里;再给出一条贯穿数据处理、预训练、后训练(RLHF)、在线推理、Agent 五个阶段的最小可运行示例,每一段代码和命令都对照官方文档(RayvLLMKubeRa

文章图片
#kubernetes#容器#人工智能 +2
K8s+DeepSpeed+vLLM打通大模型训练到上线全链路

DeepSpeed 是微软开源的分布式训练优化库,核心是 ZeRO 显存切分技术,最近两年在大模型岗位的招聘要求里出现得越来越频繁——但网上大多数介绍停留在"ZeRO 三个 stage 分别切什么",很少讲清楚它在一条完整生产链路里具体怎么落地。这篇文章接着上一篇的思路,换一条编排路径:用 K8s + Kubeflow Trainer 的 MPI-based 调度承载 DeepSpeed ZeRO

文章图片
#kubernetes#容器#AI
K8s+Megatron-LM+vLLM打通超大模型训练全链路

Megatron-LM 是 NVIDIA 开源的大模型训练库,核心是张量并行(TP)、流水线并行(PP)等模型并行技术——和前两篇讲的RayDeepSpeed不同,它解决的不是"怎么调度"或"怎么省显存",而是"单个模型本身大到一张卡、甚至一台机器都装不下"这个更底层的问题。

#kubernetes#容器
uv:终结 Python 虚拟环境管理乱局

如果你还在这套流程里反复横跳,是时候看看 uv 了。uv 是 Astral(Ruff、ty 的作者)用 Rust 写的 Python 包与项目管理工具,把版本管理、依赖安装、锁文件、虚拟环境、项目管理这五件事揉进一个单文件二进制里,安装速度是 pip 的 10-100 倍,而且完全不需要手动激活环境。

文章图片
#python#uv#人工智能 +1
Pi:不止编程,一套通用 Agent 框架

Pi 是 earendil-works 开源的 Agent 开发框架,很容易被"pi 命令行编程工具"这个第一印象带偏——它把"统一多模型 LLM API、通用 Agent 运行时、终端 UI、编程 Agent CLI"拆成四个独立又能组合使用的包,真正的通用能力在这一层:一个带工具调用、状态管理和事件流的有状态 Agent 运行时,官方定位就是可以承载任意类型 Agent,而不是专为编程场景设计

文章图片
#AI#开发工具#个人开发
Orca让多个AI编程智能体并行工作

Orca 是一款面向"百倍效率开发者"的 AI 编排工具(ADE),核心思路是让 Claude Code、Codex、OpenCode、Pi 等任意命令行 AI 编程智能体在各自独立的 Git worktree 中并行运行,并集中在一个界面里管理。它不锁定某一家模型厂商,而是用你已有的订阅去调度你已经在用的智能体,桌面端、移动端和远程 VPS 三端协同,让"一次提问、多个智能体同时干活、挑最好的结

文章图片
#人工智能#开发工具#gitea
    共 36 条
  • 1
  • 2
  • 3
  • 4
  • 请选择