logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型面试必备01——GPT参数计算、BPE分词算法

所有参数=$$词向量维度 × (词表大小 + 窗口长度) +(4D^2 + 8D^2 + 5D)*注意力层数 $$,D为词向量维度代码计算看7、代码计算。(计算复杂度和宽度是平方关系,和层数是线性关系)

文章图片
#人工智能#python#语言模型
大模型面试必备02—— Scaling Laws与涌现能力、CLM vs MLM建模

量变引起质变,当规模达到一定程度的时候,产生了一种群体的现象,这种群体的现象再也不能从原来的个体现象推知,可能需要一个新的学科,或者一些新的定律来研究整体的系统。(说人话就是一开始模型学习翻译的,训练完之后,模型也学会了做完型填空……)总结:大模型出现涌现现象(Emergent Abilities)的本质是复杂系统在规模效应和高维表征能力的共同作用下,产生的非线性相变。小模型不具备,但是大模型拥有

文章图片
#深度学习#人工智能#机器学习 +1
大模型面试必备03——llama文章精读

LLaMA是一个系列模型,模型参数量从7B到65B。在大部分的任务上,LLaMA-13B强于GPT-3(175B)。LLaMA-65B的性能,可以和最好的LM相媲美,如Chinchilla-70B 和PaLM-540B。

文章图片
大模型面试必备04——BERT 论文逐段精读

参考视频:【BERT 论文逐段精读【论文精读】】 https://www.bilibili.com/video/BV1PL411M7eQ/?

文章图片
#bert#人工智能#深度学习
大模型面试必备05——ChatGLM详解

GLM:https://arxiv.org/abs/2103.10360GLM130B: https://arxiv.org/abs/2210.02414 code: https://github.com/THUDM/GLM-130B/Code: https://github.com/THUDM/ChatGLM-6B相关博客参考(按优先级顺序):https://blog.csdn.net/zsq_

文章图片
#人工智能#python#opencv +2
大模型面试必备06——InstructGPT精读

论文题目Training language models to follow instructions with human feedback,即训练语言模型,使得它们能够服从人类的一些指示。语言模型每次是给定一段东西,然后去预测下一个词,它是一个自监督模型,所以认为它是没有标号的。如果想让语言模型去解释某一个概念的话,就需要文本中出现过类似的东西,因此模型的行为取决于文本搜集的好坏。这样的问题在

文章图片
#人工智能
大模型面试必备07——HuggingFaceDatasets数据集组件使用

datasets库是一个轻量级、易用的数据集加载工具,支持从本地文件或快速加载数据集,适用于机器学习、自然语言处理等任务。公开数据集地址说明:Hugging Face Hub上托管了数万个公开数据集(如GLUE、SQuAD、COCO等),可直接通过该平台搜索和下载。文档地址说明:官方文档提供了完整的库使用方法,包括数据集加载、处理、分片、流式加载等高级功能。使用load_dataset加载的数据集

文章图片
#人工智能#算法
构建镜像&docker命令

【代码】构建镜像&docker命令。

文章图片
#docker#容器#运维
SAM(Segment Anything)自动分割部署实战

下载地址:https://huggingface.co/datasets/Gourieff/ReActor/blob/main/models/sams/sam_vit_l_0b3195.pth。自动标注工具可以集成SAM实现自动标注的功能。L模型是1.2G 兼顾精度和速度 大概75ms以内。我是直接暴露端口的,然后提供给标注平台使用。主要有三个模型,一般用的B,L比较多一点。

文章图片
#pytorch#人工智能#python
AI重构产品线之一

ai模型使用不限量。

文章图片
#重构
    共 30 条
  • 1
  • 2
  • 3
  • 请选择