logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

动态规划-矩阵连乘问题

给定n个矩阵,其中与 是可乘的,   。考察这n个矩阵的连乘积  由于矩阵乘法满足结合律,所以计算矩阵的连乘可以有许多不同的计算次序。这种计算次序可以用加括号的方式来确定。若一个矩阵连乘积的计算次序完全确定,也就是说该连乘积已完全加括号,则可以依此次序反复调用2个矩阵相乘的标准算法计算出矩阵连乘积算法复杂度分析:对于n个矩阵的连乘积,设其不同的计算次序为P(n

#算法#动态规划#矩阵
贪心-单源最短路径

给定带权有向图G =(V,E),其中每条边的权是非负实数。另外,还给定V中的一个顶点,称为源。现在要计算从源到所有其它各顶点的最短路长度。这里路的长度是指路上各边权之和。这个问题通常称为单源最短路径问题。1、算法基本思想  Dijkstra算法是解单源最短路径问题的贪心算法。其基本思想是,设置顶点集合S并不断地作贪心选择来扩充这个集合。一个顶点属于集合S当且仅当从源到该顶点的最短路

#算法
c++中sort()的用法

C++sort()函数的用法近来看了c++标准库这本书,学到了很多,就把这其中的一点C++sort()函数的用法写下来和大家分享吧!(一)为什么要用c++标准库里的排序函数Sort()函数是c++一种排序方法之一,学会了这种方法也打消我学习c++以来使用的冒泡排序和选择排序所带来的执行效率不高的问题!因为它使用的排序方法是类似于快排的方法,时间复杂度为n*log2(n),执行效率较高!(二)c++

卷积神经网络——第一周 卷积神经网络基础——第四部分

1.10 卷积神经网络示例(Convolutional neural network example)构建全卷积神经网络的构造模块我们已经掌握得差不多了,下面来看个例子。假设,有一张大小为32×32×3的输入图片,这是一张RGB模式的图片,你想做手写体数字识别。32×32×3的RGB图片中含有某个数字,比如7,你想识别它是从0-9这10个数字中的哪一个,我们构建一个神经网络来实现这个功能。...

#计算机视觉
Attention is all you need注意力机制代码解析

在这篇文章中,我以逐行实施的形式介绍了本文的“注释”版本。 我已经重新排序并从原始论文中删除了一些部分,并在全文中添加了评论。 本文档本身是一个有效的笔记本,应完全可用。 总共有400行库代码,可在4个GPU上每秒处理27,000个token。import numpy as npimport torchimport torch.nn as nnimport torch.nn.functional

#深度学习#python#java +2
大模型面试必备7-left padding、MoE 网络、Router

本文讨论了大语言模型(LLM)中Left Padding的应用原因以及MoE架构的核心原理。 Left Padding的转变:从BERT时代的Right Padding转向LLM的Left Padding,主要因为Decoder架构需要确保生成的连贯性。Left Padding使真实Token末尾对齐,避免语义断层,在批量处理时更高效。 MoE架构解析: MoE通过稀疏激活专家网络(如FFN层)取

文章图片
#面试#网络#职场和发展 +2
大模型面试必备6-看懂 PPO、DPO、GRPO、DAPO 与 GSPO

大模型对齐算法演进:从PPO到GSPO 大模型对齐技术通过RLHF使模型响应更符合人类偏好。PPO作为鼻祖,使用4个模型(策略、参考、奖励、价值模型)计算优势值优化策略,但训练复杂。DPO简化流程,直接利用偏好数据微调,省去奖励模型。GRPO改进PPO,通过组内采样计算相对优势,提升推理能力。DAPO针对GRPO优化,引入动态采样、软惩罚等机制,解决长文本训练问题。GSPO则针对MoE架构,采用整

文章图片
#面试#职场和发展#人工智能 +1
大模型面试必备8-模型并行、显存计算

本文系统讲解了大模型分布式训练中的核心通信原语及其应用场景。首先介绍了五大通信原语:Broadcast(广播初始化参数)、Scatter(数据分片)、Gather(结果收集)、Reduce(梯度聚合)和AllReduce(同步更新),通过员工协作的比喻形象说明其区别。特别强调AllReduce=Reduce+Broadcast,是分布式训练梯度同步的关键。其次详细推导了大模型显存估算方法:全精度下

文章图片
#面试#职场和发展
大模型面试必备9-大模型badcase、Encoder-Only 和 Decoder-Only

对比维度Encoder-Only (如 BERT)Decoder-Only (如 GPT, LLaMA)注意力机制双向 (Bidirectional):可以看到完整的上下文。单向 (Unidirectional/Causal):只能看到当前词及其前面的词。训练方式完形填空 (Masked Language Modeling)预测下一个词 (Next Token Prediction / Autor

文章图片
#面试#人工智能#机器学习 +2
大模型面试必备11-InfoNCE loss 和 Cross Entropy Loss

任务明确,分类数量有限(比如判断图片是猫、狗、还是猪),且有充足的人工标注数据。面临大规模预训练、图文匹配(CLIP)、推荐系统或自监督学习时。因为在这些场景下,“每个物品/人物/Token 本身就是一个独立的类别”,类别数接近无限,这时候“找不同”比“做单选”高效得多。“Cross Entropy 侧重于通过全类别遍历让特征极化对齐,强依赖人工标签;

文章图片
#面试#职场和发展#深度学习 +2
    共 156 条
  • 1
  • 2
  • 3
  • 16
  • 请选择