logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大语言模型-文本检索任务基准 BEIR

BEIR(A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models)文本检索任务的基准,使用`18 个数据集`为检索系统的零样本评估提出了一个标准化基准, BEIR 基准上在`9个不同领域的检索任务`评估 `10 种不同的检索方法`。

文章图片
#语言模型#人工智能#自然语言处理
大语言模型-GPT3-Language Models are Few-Shot Learners

## 一、背景信息:GPT3是于2020 年由OpenAI 发布的预训练语言模型。GPT3在自然语言处理(NLP)任务中表现出色,可以生成连贯的文本、回答问题、进行对话等。GPT3的网络架构继续沿用GPT1、GPT2的是多层Transformer Decoder改的结构。GPT3出自Language Models are Few-Shot Learners,语言模型是Few-Shot学习者。

文章图片
#语言模型#gpt-3#人工智能
大语言模型-GPT-Generative Pre-Training

GPT是2018 年 6 月由OpenAI 提出的预训练语言模型。GPT可以应用于复杂的NLP任务中,例如文章生成,代码生成,机器翻译,问答对话等。GPT也采用两阶段的训练过程,第一阶段是无监督的方式来预训练生成式的语言模型,第二阶段根据特定任务进行微调。GPT的网络架构使用的是多层Transformer Decoder改的结构。

文章图片
#语言模型#人工智能
智能体-DeepAgent-中间件SkillsMiddleware

SkillsMiddleware的核心作用是:从一个或多个 skill 源里加载 SKILL.md 的元数据,把“有哪些 skill、它们做什么、去哪里读完整说明” 注入到 system prompt,让 agent 按 “ 渐进式披露(progressive disclosure)” 的方式按需使用技能,而不是一开始把所有 skill 全文塞进上下文。

文章图片
#自然语言处理#人工智能#语言模型 +1
智能体-DeepAgent入门

DeepAgents是一个基于LangGraph和LangChain构建的高级Agent框架,专注于构建复杂的多代理系统。它提供了开箱即用的能力,包括多步骤任务规划、工具并行调用、子代理委派与隔离执行等核心功能。框架通过封装底层复杂性,降低了开发自主Agent系统的门槛。 文章通过示例展示了DeepAgents的基本使用方式: 定义工具(如天气查询工具) 创建主代理并配置模型、工具和系统提示 运行

#python#人工智能#语言模型 +2
大语言模型-PDF文档解析

PDF解析能够提升大语言模型系统的信息处理能力和应用范围,为用户提供更加便捷、高效、个性化的服务体验。本文介绍三种常用的pdf解析方式:`Open Parse`、`pdfplumber`、`PyMuPD`。

文章图片
#语言模型#人工智能
大语言模型-对比学习-Contrastive Learning

对比学习 是一种特殊的`无监督学习方法`。旨在通过`拉近相关样本的距离`并且`推远不相关样本的距离`,来学习`数据表示`。通常使用一种高自由度、自定义的规则来`生成正负样本`。在模型预训练中有着广泛的应用。

文章图片
#语言模型#学习#人工智能
大语言模型-检索测评指标

1. MRR (Mean Reciprocal Rank)平均倒数排名2. AP(Average Precision)平均精度3. MAP(Mean Average Precision)平均准确率等检索评估指标

文章图片
#语言模型#人工智能#自然语言处理
大语言模型-RetroMAE-检索预训练模型

RetroMAE是2022年10月由北邮和华为提出的一种密集检索预训练策略。RetroMAE主要应用于检索模型的预训练,模型架构为非对称的Encoder-Decode结构。

文章图片
#语言模型#人工智能#自然语言处理
大语言模型-文本向量模型评估基准 MTEB

MTEB(Massive Text Embedding Benchmark)涵盖112种语言的58个数据集,包含如下`8种任务`。

文章图片
#人工智能#自然语言处理#深度学习 +1
    共 28 条
  • 1
  • 2
  • 3
  • 请选择