logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

llama.cpp 在 Linux 上安装使用指南

场景推荐方案快速上手生产部署 / GPU 加速源码编译 +单模型长期服务常驻多模型按需切换路由模式(需最新源码版本)工具调用 / Qwen3.x 模型llama.cpp 优于 Ollama。

文章图片
#linux#运维
⑨番外篇II,FastLLM——老卡也能跑满血DeepSeek

我经常想:“我的显卡只有 RTX 4060 8G,能跑 DeepSeek 吗?“服务器上还有张 5090 24G,高不成低不就,只能吃灰吗?“vLLM 装不上,CUDA 版本太低了怎么办?这些问题,vLLM 回答不了——vLLM 不是为这些场景设计的。但 FastLLM 可以。经粉丝晓东同志让那些"不够格"的硬件,也能跑大模型。这篇文章是我的调研笔记,也是一份选型参考。声明:本文未做实测,所有性能

文章图片
#人工智能#运维
大模型架构的三年进化:从 Transformer 到DeepSeek团队的全面超越

大模型的底层架构不是静止的,它在以极快的速度进化。而在这场进化中,中国团队已经从学生变成了老师。不是因为中国团队更聪明,而是因为他们面对的约束更严格——GPU 不够、预算有限、时间紧迫。约束倒逼创新,这个规律在汽车工业、芯片行业、以及现在的大模型领域,一次次地应验。上篇聊了"怎么做到的",这篇聊了"做了什么改变"。下一篇,我们把视角从模型转向应用——聊聊 Agent。2025 年被称为"Agent

文章图片
#架构#transformer#深度学习
①:你真的需要本地部署吗?

不跑分,聚焦实战,帮你从「不知道该选哪个」到「用好适合自己的工具」本篇目标:动手之前先想清楚,你到底需不需要本地部署,以及该选哪个工具。

文章图片
#人工智能#python#开发语言
桌面养个AI宠物?MiniCPM Desk Pet尝鲜真实体验报告

满分10分,我打6分。加分项:安装体验极佳、桌宠动画精致、本地运行隐私无忧、开源可定制。扣分项:模型切换不可用、本地加载GGUF有bug、1B模型能力上限明显、偶发服务崩溃。现在这个版本,更像一个技术预览版。核心骨架搭好了,方向正确,但肌肉还没长齐。如果你是OpenBMB的粉丝,或者想看看"本地AI桌宠"这个品类能做到什么程度,值得花10分钟装一个玩玩。如果只是想用AI聊天,直接用DeepSeek

文章图片
#人工智能#宠物
⑤:三个工具到底怎么选?(对比+决策矩阵)

一张表解决选择困难症,面对任何需求都能快速做出工具选择。

文章图片
#人工智能
Ollama导入和使用模型详解

SYSTEM "你是一个幽默的助手,用轻松的方式回答问题"优先下载 GGUF— 直接从 HuggingFace / ModelScope 获取 GGUF 版本,省去转换步骤目录结构规范— 每个模型建独立目录,Modelfile 与模型文件同目录网络好时用在线加载一键搞定网络受限或特定版本— 下载 GGUF 后手动导入企业部署— 用 Modelfile 统一配置,便于版本管理导入后立即测试— 验证模

文章图片
#人工智能
llama.cpp 在 Linux 上安装使用指南

场景推荐方案快速上手生产部署 / GPU 加速源码编译 +单模型长期服务常驻多模型按需切换路由模式(需最新源码版本)工具调用 / Qwen3.x 模型llama.cpp 优于 Ollama。

文章图片
#linux#运维
⑨番外篇II,FastLLM——老卡也能跑满血DeepSeek

我经常想:“我的显卡只有 RTX 4060 8G,能跑 DeepSeek 吗?“服务器上还有张 5090 24G,高不成低不就,只能吃灰吗?“vLLM 装不上,CUDA 版本太低了怎么办?这些问题,vLLM 回答不了——vLLM 不是为这些场景设计的。但 FastLLM 可以。经粉丝晓东同志让那些"不够格"的硬件,也能跑大模型。这篇文章是我的调研笔记,也是一份选型参考。声明:本文未做实测,所有性能

文章图片
#人工智能#运维
⑦:LiteRT-LM——端侧部署的未来展望

到此,本地大模型部署工具实战手册7 篇全部完成。标题核心收获①你真的需要本地部署吗?场景决策树,隐私 + 成本动机②Ollama实战:RTX 4060从安装到跑起来能跑起来,Modelfile 自定义③vLLM实战:单卡/多卡部署生产级高并发,显存常驻逻辑④LM Studio:5分钟尝鲜零门槛,常见坑避雷⑤三个工具到底怎么选?决策矩阵,真实案例参考⑥公开benchmark数据解读看懂数据,结合硬件

文章图片
#人工智能
    共 75 条
  • 1
  • 2
  • 3
  • 8
  • 请选择