logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

一文讲透大语言模型构建流程

最近已有不少大厂都在秋招宣讲了,也有一些在 Offer 发放阶段。节前,我们邀请了一些互联网大厂朋友、今年参加社招和校招面试的同学。针对新手如何入门算法岗、该如何准备面试攻略、面试常考点、大模型技术趋势、算法项目落地经验分享等热门话题进行了深入的讨论。大语言模型的构建过程一般分为两个阶段,即:预训练、人类对齐(对齐再细分为指令微调+基于人类反馈强化学习)预训练-数据准备流程原始语料库:为了构建功能

文章图片
#语言模型#人工智能#自然语言处理 +3
使用 PyTorch FSDP 微调 Llama 2 70B

我们在多节点多 GPU 上使用 PyTorch FSDP 成功微调了一个 70B Llama 模型,并在此过程中解决了各种挑战。我们看到了当前在 🤗 Transformers 和 🤗 Accelerates 中应如何初始化大模型从而有效克服 CPU 内存不足的问题。我们还给出了如何高效地保存/加载中间检查点,同时又能以易于使用的方式保存最终模型的最佳实践。为了加速训练并减少 GPU 显存使用,

文章图片
#pytorch#人工智能
《大模型面试宝典》(2026版) 正式发布!

2025年12月11日,OpenAI发布GPT-5.2,这次升级确实挺猛的,核心亮点就是‌更专业、更高效、更可靠‌,直接瞄准了办公、开发这些实际场景。同样国内模型应用加速迭代落地。12月1日,豆包手机助手首个OS级合作落地,实现AI像人一样操作手机,这种深度参与将催生更多创新应用场景。同时,DeepSeek-V3.2正式发布,强化Agent能力、融入思考推理。经历这两年的你追我赶,大模型已进入深耕

文章图片
#面试#职场和发展#深度学习 +2
平安大模型面试题:Self-Attention 原理与多头注意力设计

Transformer 的灵魂就在 Attention。能讲清楚 Self-Attention 和 Multi-Head,你的面试表现就已经比 70% 的候选人强。别把公式当成背诵题,而要真正理解:Q 是问题,K 是标签,V 是答案。多头注意力,就是让模型从不同角度同时“看世界”。下一次当面试官问你“为什么要除以 √dₖ”,你就能笑着回答:“为了不让梯度消失。这才是面试官最想看到的答案。

文章图片
#算法#人工智能#自然语言处理
基于 Langchain 和 Streamlit,构建多 PDF RAG 聊天机器人

与 PDF 互动是很酷的。你可以与你的笔记、书籍和文档等进行聊天。本文将帮助你构建一个基于 Multi RAG Streamlit 的 Web 应用程序,通过对话 AI 聊天机器人来读取、处理和互动PDF数据。以下是该应用程序的工作步骤,用简单的语言进行说明。

文章图片
#机器人#深度学习#人工智能 +1
2024大模型面试八股(含100道答案)

前馈神经网络 (Feedforward Neural Network) 是一种最基础的神经网络类型,它的信息流动是单向的,从输入层经过一个或多个隐藏层,最终到达输出层。数据输入格式通常需要与模型的输入接口相匹配,例如,对于文本模型,数据通常需要是字符串格式,并且可能需要经过特定的预处理,如分词、编码等。这种现象通常发生在大型模型中,原因是大型模型具有更高的表示能力和更多的参数,可以更好地捕捉数据中

文章图片
#面试#职场和发展#算法 +1
小米大模型二面,我感觉要废了

原理是类似的,embedding 矩阵的初始化方式是 xavier,方差是 1/根号 d,因此乘以根号 d,可以让 embedding 矩阵的方差是 1,从而加速模型的收敛。举个例子:假如输入的原始句子是"我爱机器学习",我们按最简单的基于字的分词,这个样本的单词长度是 6,也就是 ‘我’ ‘爱’ ‘机’ ‘器’ ‘学’ ‘习’,这六个字。所以更深层的原因是,选择根号 d,可以让输入 softma

文章图片
#深度学习#人工智能#算法
基于新版DeepSeek V3,轻松开发大模型智能体Agent

为了能以兼容openai标准的形式,在中调用国内常用的各种DeepSeek服务源,我们需要基于中的譬如,接入DeepSeek# 示例1:DeepSeek官方api_key='<填入你的key>'# 示例2:火山方舟api_key='<填入你的key>'# 示例1:DeepSeek官方# 这里deepseek-chat对应目前最新的非深度思考模型V3# 示例2:火山方舟'<请填写你在火山方舟控制中创

文章图片
#数据库#人工智能#自然语言处理 +2
通用大模型训练过程必须经历的四个阶段!

以上4个阶段构成了完整的GPT模型训练的pipeline,从中可以看出训练大模型是一个非常艰巨的任务,例如对庞大算力资源的要求、对高质量语料数据的要求。另外,在训练大模型的时候一般需要基于一些优化框架,如DeepSpeed,这些工程化方面的任务也有不少坑。因此,对于一般的企业而言通常不建议自己训练基础大模型,如果必须进行私有化部署,可以根据实际情况选择一款开源大模型,如有必要可基于开源大模型进行微

文章图片
#人工智能#大数据
【大模型】开源向量数据库性能对比: Milvus, Chroma, Qdrant

Qdrant:优点:中规中矩,Qps 相对较高、延迟相对较低。在CPU和磁盘IO方面的利用率较高,能够在处理高负载时提供较好的性能。缺点:在大数据集的加载时间和总体检索精度上略逊于 Milvus,适合对过滤查询有需求但不追求极端性能的场景。对CPU和内存的需求较大,尤其在高并发和复杂查询时可能会出现较高的资源消耗,导致系统负载上升。Chroma:优点:对于较小的数据集,Chroma 更容易上手和集

文章图片
#开源#数据库#milvus +3
    共 60 条
  • 1
  • 2
  • 3
  • 6
  • 请选择