logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

边缘计算节点本地推理部署

本文深入探讨边缘计算中本地AI推理的部署技术,涵盖模型轻量化、推理引擎优化与专用硬件加速三大核心策略,并结合工厂质检等实战场景,分享工程化落地的关键经验与挑战。

#边缘计算
快速启动大模型项目:PyTorch-CUDA环境一键部署

本文介绍如何使用Docker预集成镜像pytorch/pytorch:2.1.0-cuda11.8-cudnn8-runtime实现大模型项目的快速启动,避免CUDA驱动与运行时版本不匹配等问题。通过容器化方案,开发者无需手动安装依赖,即可在GPU上高效运行训练任务,并支持多卡分布式训练与性能优化设置。

Mac环境下编译Hadoop 3.1.4源码生成Native库完整指南

构建 Hadoop Native 库的过程,本质上是在跨越Java 与 C 的边界Linux 与 macOS 的鸿沟、以及历史遗留与现代架构的断层。当你理解了:为什么要用 JNI?configure 脚本是怎么工作的?Homebrew 如何影响编译路径?什么是 Universal Binary?日志里的每一个阶段意味着什么?你就不再是一个只会复制粘贴命令的“脚本男孩”,而是一位真正懂得系统运作原理

Stable Diffusion 3.5 FP8镜像现已支持Docker一键拉取

Stable Diffusion 3.5 FP8量化镜像通过Docker实现一键拉取,显著降低显存占用与推理延迟,支持RTX 4090等主流GPU,兼顾画质与性能,助力AI生成模型高效部署至生产环境。

Dify低代码平台部署大模型时的GPU资源需求分析

本文分析在Dify低代码平台部署大语言模型时对GPU资源的关键依赖,重点探讨PyTorch-CUDA基础镜像在显存管理、多卡并行、推理优化中的核心作用,揭示低代码背后不可忽视的硬件与环境一致性要求。

Linly-Talker支持gRPC调用,微服务架构集成更便捷

Linly-Talker新增对gRPC的原生支持,实现高性能、低延迟的远程调用,推动AI数字人系统向服务化架构转型。通过Protobuf定义接口,支持双向流式通信,提升跨语言协作与生产环境部署灵活性,适用于智能客服、在线教育等实时交互场景。

#微服务
S32DS多版本共存安装:面向S32K项目的实践方案

针对S32K项目需求,详细解析S32DS多版本共存的安装配置过程,解决环境冲突问题。结合s32ds安装教程与实际操作要点,提升开发效率与系统兼容性。

电商商品描述生成:结合大模型与历史数据批量产出文案

利用大模型与历史数据结合,通过RAG技术实现高转化商品描述的自动化生产。系统基于Anything-LLM平台,支持本地部署、风格统一与持续优化,显著提升新品上架效率与点击率,推动电商内容创作进入智能协同新阶段。

#RAG
PyTorch-CUDA-v2.7镜像赋能大模型token批量生成服务

通过预集成的PyTorch-CUDA容器镜像,实现大模型批量文本生成的高效部署。该方案解决了环境不一致、GPU加速难、扩展性差等常见问题,利用容器化技术保障从开发到生产的无缝衔接,在分钟级完成十万级任务处理,显著提升AI服务稳定性与资源利用率。

Xinference-v1.17.1环境部署:Ubuntu/CentOS/Docker三平台安装与验证全流程

本文介绍了如何在星图GPU平台上自动化部署Xinference-v1.17.1镜像,快速搭建开源大模型统一服务平台。该平台简化了部署流程,用户可通过该镜像轻松启动和管理Llama、Qwen等主流模型,并利用其提供的OpenAI兼容API,便捷地实现文本生成、代码编写等AI应用。

    共 795 条
  • 1
  • 2
  • 3
  • 80
  • 请选择