logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

GLM-5.3/GLM-5.3-Flash 部署实践(包含双推理引擎对比8xH200)

GLM-5.3-Flash(4×H20)与GLM-5.3(8×H20)部署对比显示,显存容量与拓扑配置直接影响模型支持的上下文长度与并发能力。单机部署Atlas 800 A2(8×昇腾910B3)需关注显存、P2P/NCCL及软件栈适配。关键问题在于:39B激活参数≠仅需39B显存;需结合业务场景(如128K/256K/1M上下文)、并发量、负载类型(Chat/Coding/RAG)和性能指标(T

#sglang#缓存
GLM-5.3/GLM-5.3-Flash 部署实践(包含双推理引擎对比8xH200)

GLM-5.3-Flash(4×H20)与GLM-5.3(8×H20)部署对比显示,显存容量与拓扑配置直接影响模型支持的上下文长度与并发能力。单机部署Atlas 800 A2(8×昇腾910B3)需关注显存、P2P/NCCL及软件栈适配。关键问题在于:39B激活参数≠仅需39B显存;需结合业务场景(如128K/256K/1M上下文)、并发量、负载类型(Chat/Coding/RAG)和性能指标(T

#sglang#缓存
ubuntu 22.04 iptables 运行失败解决方法

ubuntu 22.04默认使用nftables作为防火墙,而非iptables。

文章图片
#ubuntu#linux#运维
ubuntu 22.04 iptables 运行失败解决方法

ubuntu 22.04默认使用nftables作为防火墙,而非iptables。

文章图片
#ubuntu#linux#运维
向量数据库简单对比

简单好部署好用(很多应用都使用Redis作为缓存中间件的数据库,这也就意味着使用Redis作为向量数据库,不需要额外的技术架构调整。:Elasticsearch是为全文搜索目的而设计的,虽然支持向量搜索,但对于涉及百万级向量搜索及以上的数据,性能会受到影响。从开发人员的角度来看,依赖外部的第三方托管服务的危险,无法完全控制数据库的设置和运行方式。,不需要用户了解任何有关向量化或向量索引的知识,前期

文章图片
#数据库
游戏思考17:寻路引擎recast和detour学习三:客户端角度学习(unity专题导航系统,阶段三完结)

一、如何构建导航网格1)导航系统作用2)导航系统包括3)做一个简单的导航Demo二、当行网格烘焙与烘焙设置1)对应相关参数三、导航网格代理与自动巡逻角色四、构建一个朝目标位置移动的角色五、导航网格障碍物六、网格外链接

#unity#游戏#学习
AI大模型预先学习笔记二:prompt提问大模型、langchain使用大模型框架、fine tune微调大模型

一、Prompt Engineering1)环境准备2)交互代码的参数备注3)交互代码二、LangChain(一个框架名字)1)LangChain核心介绍:I/O模块、数据链接模块、2)I/O模块(Prompts、Language models、Output parsers)3)数据链接模块(Data connection)三、Fine-tuning(微调)

文章图片
#学习
pytorch学习笔记二:用pytorch神经网络模型做气温预测、分类任务构建和分类网络构建、卷积神经网络原理介绍

与之前的回归模型的区别①得到的结果是不同的②使用的损失函数也是不同的学习目的:Mnist分类任务①网络基本构建与训练方法,常用函数解析②torch.nn.functional模块③nn.Module模块①有可学习的参数用Module:卷积层、②其他情况用functional:激活函数、损失函数(分类任务一般用交叉相乘作为损失函数:cross_entropy)定义函数定义参数bs:也就是batch_

文章图片
#pytorch#学习
端到端从pretrain, sft, RLHF三个阶段训练一个完整的大模型

将得到的单词表示向量矩阵 (如上图所示,每一行是一个单词的表示 x) 传入 Encoder 中,经过 6 个 Encoder block 后可以得到句子所有单词的编码信息矩阵 C,如下图。获取输入句子的每一个单词的表示向量 X,X由单词的 Embedding(Embedding就是从原始数据提取出来的Feature) 和单词位置的 Embedding 相加得到。sft阶段之后, 我们使用了大量的过

文章图片
#深度学习#人工智能
大模型并行推理架构笔记

摘要: 大模型推理面临显存和计算瓶颈,需通过并行策略优化。核心方法分为两类:模型并行(TP、PP、EP)和请求并行(批处理优化)。TP按层内切分降低单请求延迟,PP跨层切分减少通信量,EP专用于MoE模型。连续批处理和PagedAttention提升吞吐效率。进阶策略包括PD分离(Prefill与Decode阶段解耦)、序列并行(长上下文优化)和投机解码(小模型加速生成)。近两年进展聚焦分离式架构

#架构
    共 61 条
  • 1
  • 2
  • 3
  • 7
  • 请选择