logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型基础理论-BPE/DeepNorm/FlashAttention/GQA/RoPE

大模型基础理论介绍:1.BPE分词2.DeepNorm3.FlashAttention4.GQA5.RoPE

文章图片
#语言模型#transformer
大模型训练-流水线并行/张量并行/ZeRO/Prefix/Prompt tunning/LoRA

大模型训练:1.流水线并行2.张量并行3.ZeRO4.Prefix/Prompt tunning5.LoRA

文章图片
大模型应用开发-基础理论

大模型应用开发:1.CoT2.零样本推理能力3.ToT4.Toolformer5.Plan and Solve6.ReAct7.AgnetVerse8.AutoGen

文章图片
大模型应用开发-Langchain(V1-最新版)-上

大模型应用开发-langchain(V1最新版)-上部分

文章图片
大模型应用开发-Langchain(V1-最新版)-中

本文介绍了大模型应用开发中LangChain框架的关键技术,重点讲解了检索器和记忆系统两大核心功能。在检索器部分,详细阐述了文档嵌入与向量存储的实现方法,包括普通检索、检索器融合、上下文压缩、元信息查询、父文档回溯和多维度检索等多种检索策略,并提供了Python代码示例。在记忆系统部分,介绍了基础会话记忆、带上下文裁剪记忆、摘要式记忆、RAG增强记忆和知识图谱记忆五种记忆机制,展示了如何有效管理和

文章图片
大模型应用开发-Langchain(V1-最新版)-下

本文介绍了LangChain最新版(V1)在大模型应用开发中的核心功能与实现方法。主要内容包括:1) 工具调用机制,详细讲解@tool装饰器、StructuredTool和BaseTool三种工具封装方式;2) Agent构建方案,重点介绍基于LangGraph的工作流实现和传统Prompt方式构建ReAct智能体;3) 回调处理机制,对比事件流和handler函数两种回调方式。文章通过完整代码示

文章图片
深度学习基础-5 注意力机制和Transformer

本文系统介绍了Transformer网络架构及其核心组件。首先概述了深度学习的四大基础架构:前馈神经网络、卷积神经网络、循环神经网络和Transformer。重点解析了Transformer的核心机制——注意力计算原理及其多头注意力实现方式,详细阐述了Encoder和Decoder的结构设计,包括位置编码、残差连接等关键技术。文章还探讨了Transformer在输入处理(如mask机制)、位置编码

#深度学习#transformer#人工智能
大模型应用开发-向量数据库

本文介绍了大模型应用开发中常用的向量数据库工具,重点阐述了其在高维数据管理方面的优势。文章首先解释了高维向量数据的特点和处理难点,对比了传统数据库与向量数据库的区别。然后详细介绍了向量嵌入空间评估方法(t-SNE和UMAP)以及主流向量索引结构(HNSW、IVF-PQ等)。最后以FAISS为例,展示了向量数据库的实际应用,包括索引构建和查询策略。向量数据库通过高效存储和检索高维向量,为大模型应用开

文章图片
大模型应用开发-2 上下文工程

本文探讨了大模型应用开发中的上下文工程理论。上下文工程通过动态组合系统提示词、外部知识、工具定义等六类信息,优化大模型的条件概率输出。相比静态提示词工程,上下文工程将输入视为动态信息组合,以最大化任务相关信息的互信息。文章详细阐述了上下文获取(提示工程、知识检索、动态组装)、处理(超长序列、多模态、结构化数据处理)和管理(记忆机制、压缩技术)三大环节。其中,处理环节通过注意力机制优化等方法提升信息

多模态-10 Qwen-VL

本文介绍了千问系列的多模态模型Qwen-VL,重点阐述了Qwen-VL的创新架构和训练方法。该模型采用ViT图像编码器、视觉-语言适配器和Qwen7B语言模型的组合结构,通过[img]、[box]、[ref]等特殊标记实现图像特征与文本的语义对齐。模型训练分为预训练、多任务预训练和监督微调三个阶段,支持中英双语理解、图像定位和OCR等任务。Qwen-VL通过创新的标记机制和分阶段训练策略,在多个评

文章图片
#多模态
    共 44 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择