logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

算法设计与分析:分治法

第1关:分治法介绍,任务描述,本关任务:掌握分治法的基本原理,解决最大连续序列和问题。相关知识,为了完成本关任务,你需要掌握:分治法的基本原理。第2关:归并排序。理解 归并排序的算法原理 ;自己手动实现 归并排序。为了完成本关任务,你需要掌握:为了完成本关任务,你需要掌握:分治法。第3关:快速排序。理解 快速排序的算法原理 ;自己手动实现 快速排序。第4关:中值问题。本关任务: 独立完成中值问题。

#算法#其他#学习
算法设计与分析:贪心法

第一关:贪心法任务描述:本关任务:完成 乘船问题 ;相关知识:为了完成本关任务,你需要掌握:贪心法。第二关:最小生成树任务描述:本关任务:理解并实现无向图的最小生成树相关知识:为了完成本关任务,你需要掌握:贪心算法。

#算法#贪心算法#学习 +1
前沿模型系列(一)《大模型学习方法》

文章摘要:AI发展经历了符号智能(1950s-1980s)、专用智能(1990s-2010s)和大模型(2018至今)三个阶段。大模型时代通过自监督学习实现量变到质变的涌现智能,其训练包含预训练(自监督学习)、监督微调(SFT培养指令遵循)和强化学习(RLHF对齐人类偏好)三个核心阶段。预训练利用海量无标注数据,SFT通过指令微调激发模型能力,RLHF则通过人类反馈优化模型输出。未来需关注数据多样

#学习方法#学习#其他
推理引擎方向(二)《大模型原理与结构》

本文是推理引擎方向的第二课讲义,系统讲解大模型核心原理与结构。内容涵盖:从神经网络基础到序列建模的演进,深入剖析RNN的局限与注意力机制的突破;详解Transformer架构中的自注意力计算、多头注意力、旋转位置编码(RoPE)及RMSNorm层归一化;最后介绍Decoder模块、MLP层结构及文本向量化处理(BPE分词与嵌入层),为构建大模型推理系统奠定理论基础。

#rnn#深度学习#人工智能 +2
前沿模型系列(二)《科学多模态大模型》

摘要:上海人工智能实验室推出的InternS1科学多模态大模型通过创新架构解决了传统模型在科研场景的局限性。该模型采用三大输入通道(视觉/动态分词/时序)处理科学数据,构建2.5万亿token高质量科学语料库,并开发PDF解析和网页过滤双管线确保数据质量。其MOR混合奖励模型能动态平衡科学严谨性与创造性,配合FP8全链路优化显著提升效率。实际应用中,该模型在数学竞赛、化学解析等任务表现优异,并推出

#人工智能#学习#性能优化 +1
通信与并行系列(二)《大模型并行策略与通信优化》

摘要:随着模型规模扩大,单卡训练面临算力、显存和效率瓶颈,多卡并行成为必要选择。主流并行策略包括数据并行(处理不同数据批次)、模型并行(参数切分)及混合并行,需根据模型规模和硬件资源选择。通信优化是关键,涉及点对点和集合通信(如Allreduce),通过计算通信重叠、拓扑感知和DualPipe等技术减少空闲时间。这些方法显著提升训练效率,未来仍需持续优化以适应更大模型和硬件发展。

#人工智能#深度学习#机器学习 +2
推理引擎系列(三)《从大模型推理到 AI 对话》

本文解析了大模型推理的核心流程与优化技术。首先介绍了从输入到输出的完整路径,包括token化、向量转换、Transformer计算等步骤,强调模型输出的是token概率分布而非确定结果。重点讲解了KVCache技术如何通过缓存历史键值向量来避免重复计算,提升推理效率。同时将推理过程划分为Prefill(预填充)和Decode(解码)两个阶段,并说明其不同计算特性及优化策略。此外还阐述了AI对话中的

#架构#人工智能#学习 +1
训练系统系列(三)《大模型训练中的显存优化》

本文系统阐述了大模型训练中的显存优化技术。数据并行(DDP)通过AllReduce同步梯度,但存在显存冗余问题。ZeRO优化器采用三级分片策略:Stage1分片优化器状态,Stage2增加梯度分片,Stage3实现参数分片。激活值检查点通过选择性保存和重新计算减少显存占用。模型并行包括张量并行(参数维度切分)、流水并行(分层切分)和序列并行(序列维度切分)。此外还介绍了Offloading技术(将

#算法#分布式#学习 +2
推理引擎系列(四)《大模型计算优化与分布式推理》

本文系统介绍了大模型推理的计算优化与分布式技术。在计算优化方面,重点阐述了低精度量化(FP16/INT8等)降低显存占用、算子融合减少计算开销、注意力机制优化(MQA/GQA)等技术。在分布式推理方面,分析了数据并行、模型并行和流水并行策略,以及张量切分的具体实现方法。这些技术通过充分利用硬件资源,有效解决了大模型推理面临的空间占用高、计算延迟大、硬件成本高等问题,为提供高效实时的大模型服务奠定了

#分布式#人工智能#机器学习 +1
前沿模型系列(四)《大模型前沿架构》

本文系统梳理了大模型架构的最新优化技术,重点分析了稀疏激活、混合专家(MoE)架构和量化技术三大方向。研究发现MoE架构通过专家分组和选择性激活,能以20%计算量实现98%性能,大幅提升效率。同时,文章揭示了人脑与AI在能耗效率上的显著差距,指出稀疏激活是优化关键。在推理优化方面,投机采样、Medusa解码等技术可实现1.6-5倍加速。此外,专家负载均衡、可微路由等创新方法进一步提升了MoE的扩展

#架构#人工智能#学习 +2
    共 88 条
  • 1
  • 2
  • 3
  • 9
  • 请选择