logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型 | Transformer模型的多头注意力机制,非常通俗的讲解

Transformer模型最核心的内容就是。很多时候,如果我们想快速的学习一个特别复杂的模型,比如Transformer。最好一开始,就能对它的核心结构,有一个基本的“认知”。然后再去深入的探索这个模型的算法设计和代码实现。这样能够让我们更快的学习和理解这个复杂的深度学习模型。学习的过程,也会变得事半功倍!观察Transformer模型,会看到其中包含了3个用橙色标记的“多头自注意力”。

文章图片
#transformer#深度学习#人工智能
大模型(LLM)的四阶段技术:提示工程、AI Agent、微调、预训练

预训练是语言模型学习的初始阶段。在预训练期间,模型会接触大量未标记的文本数据,例如书籍、文章和网站。目标是捕获文本语料库中存在的底层模式、结构和语义知识。预训练利用大量无标签或弱标签的数据,通过某种算法模型进行训练,得到一个初步具备通用知识或能力的模型。预训练通常是一个无监督学习过程,模型在没有明确指导或标签的情况下从未标记的文本数据中学习。模型经过训练可以预测句子中缺失或屏蔽的单词、学习上下文关

文章图片
#人工智能
使用 PyTorch FSDP 微调 Llama

我们在多节点多 GPU 上使用 PyTorch FSDP 成功微调了一个 70B Llama 模型,并在此过程中解决了各种挑战。我们看到了当前在 Transformers 和 Accelerates 中应如何初始化大模型从而有效克服 CPU 内存不足的问题。我们还给出了如何高效地保存/加载中间检查点,同时又能以易于使用的方式保存最终模型的最佳实践。为了加速训练并减少 GPU 显存使用,我们还强调了

文章图片
#pytorch#人工智能
字节 REFT:通过强化微调进行推理

在 OpenAI 系列发布会的次日,OpenAI 公布了强化微调(Reinforcement Fine-Tuning)研究计划。强化微调是一种具有创新性的模型定制技术,开发者可以利用包含数十到数千个高质量任务的数据集,对模型进行针对性优化,从而让人工智能在特定领域的复杂任务中表现出更高的精准度。Sam Altman 称其为 2024 年最令人惊喜的发现之一,它使得在特定领域创建专家模型变得极为容易

文章图片
#人工智能#深度学习
大模型RAG系统入门到精通(四)数据与LLM的三种“联姻“方式:上下文方法、小模型方法、微调方法

在前面的内容中,我们讨论了RAG系统如何处理不同层次的查询。现在,让我们转向一个更加根本的问题:假如获取到数据后,如何将外部数据与LLM结合起来?论文提出了三种主要的方法,每种方法都有其独特的优势和挑战。让我们逐一深入探讨。

文章图片
#人工智能#RAG
李飞飞谢赛宁新作「空间推理」:多模态大模型性能突破关键所在

再发新成果:直接把o1式思考拉至下一个level——!这项研究系统评估了多模态大模型的视觉空间智能,结果发现:当前,即使是最先进的多模态大模型,在空间认知方面与人类相比仍有显著差距,测试中约。更为有趣的是,在这种情况下,——不仅没有提升模型在空间任务上的表现,反而会使性能下降。而在问答过程中明确则会增强多模态大模型的空间距离能力。这项工作阵容非常豪华,合著作者中不仅有李飞飞,还有纽约大学计算机科学

文章图片
#人工智能#深度学习#多模态
大模型论文 | Google重磅升级PaliGemma 2,刷新视觉语言模型新高度

AI大模型作为人工智能领域的重要技术突破,正成为推动各行各业创新和转型的关键力量。抓住AI大模型的风口,掌握AI大模型的知识和技能将变得越来越重要。学习AI大模型是一个系统的过程,需要从基础开始,逐步深入到更高级的技术。这里给大家精心整理了一份全面的AI大模型学习资源,包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享!

文章图片
#语言模型#人工智能#自然语言处理
NVIDIA发布Cosmos平台:打造物理AI的“数字孪生世界“ | 7B模型在AIME数学竞赛中超越GPT-4,背后秘密是什么

1、NVIDIA重磅发布Cosmos平台:打造物理AI的"数字孪生世界"2、7B参数模型在AIME数学竞赛中超越GPT-4,背后的秘密是什么?

文章图片
#人工智能#AI
LangChain大模型应用开发框架,从入门到精通

LangChain现在归属于LangChain AI公司,LangChain作为其中的一个核心项目,开源发布在Gitub上:https://github.com/langchain-ai/langchainLangChain给自身的定位是:用于开发由大语言模型支持的应用程序的框架。它的做法是:通过提供标准化且丰富的模块抽象,构建大语言模型的输入输入规范,利用其核心概念chains,灵活地连接整个应

文章图片
#人工智能
    共 1579 条
  • 1
  • 2
  • 3
  • 158
  • 请选择