logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

使用 LoRA 微调相比纯 BERT 微调,训练速度会有明显提升

LoRA 的核心是在原模型的注意力层(如 query/value)中插入低秩矩阵,前向传播时的额外计算量极小(可忽略不计),而反向传播仅需更新低秩矩阵的参数,避免了对整个 BERT 模型的参数更新。综上,LoRA 微调在保持模型性能接近纯微调的前提下,能显著加快训练速度,尤其适合资源有限的场景。相比之下,纯 BERT 微调需要对所有注意力层、隐藏层的参数进行更新,计算量巨大。的速度,推理(预测)时

#人工智能#机器学习#深度学习
rag agent 微调

RAG(检索增强生成)、Agent(智能体)、微调是大模型应用里的关键技术,它们的关系可从。

#人工智能#深度学习
BERT 模型微调与传统机器学习的对比

BERT 微调入门示例,展示了如何将预训练语言模型应用于特定的分类任务。随着 Transformer 架构的普及,这种方法已经成为 NLP 任务的主流解决方案。

文章图片
#bert#机器学习#人工智能
agent rag 微调

Agent 先规划:这事该分几步?RAG 上场:查资料避免瞎说微调过的 AI:回答更对胃口

#人工智能
在深度学习对话机器人中,NLU、DST、DPO、NLG 的含义如下:

NLU(Natural Language Understanding,自然语言理解):它是自然语言处理的一个子领域,主要作用是对用户输入的句子或者语音识别结果进行处理,旨在让计算机理解人类语言的含义,从中提取用户对话意图以及所传递的相关信息,像意图识别、实体抽取、领域识别和语义消歧等都属于其范畴 。DST(Dialogue State Tracking,对话状态跟踪) :是对话管理的重要

#深度学习#机器人#人工智能
Python 和 PyTorch 手动实现多头注意力机制(Multi-Head Attention)

缩放点积注意力是多头注意力机制的核心部分,它计算 query、key 和 value 之间的注意力权重,并返回加权后的 value。python运行代码解释d_k表示 query 和 key 的维度。scores通过矩阵乘法计算 query 和 key 的转置的乘积,然后除以 \(\sqrt{d_k}\) 进行缩放。如果提供了掩码(mask),将掩码中值为 0 的位置对应的分数设为负无穷,这样在

#python#pytorch#深度学习
langchain

框架将核心功能拆分为多个模块(如提示模板、记忆系统、工具调用、链(Chains)、代理(Agents)等),开发者可以像搭积木一样组合这些模块,灵活扩展功能。LangChain 封装了大量与语言模型交互的细节(如提示工程、API 调用、上下文管理等),提供了统一的接口,让开发者无需重复编写基础代码,快速构建复杂的 LLM 应用(如聊天机器人、问答系统、智能代理等)。当应用出现问题(如输出不符合预期

GPT - 4 进行大语言模型(LLM)答案评价

事实性问题有明确、客观的答案(像历史事件发生时间、科学定理内容等 ),但 GPT - 4 本身基于训练数据生成输出,其训练数据可能存在过时、错误,或在处理事实性内容时,受模型推理逻辑等影响,难以精准判别答案是否完全符合客观事实,会导致对涉及事实类问题的 LLM 答案排序出现偏差,无法可靠区分事实性内容的对错优劣。这种评价方式有一定应用价值,但因事实性判断短板,使用时要结合场景,对于非事实性、侧重语

#语言模型#人工智能
在深度学习对话机器人中,NLU、DST、DPO、NLG 的含义如下:

NLU(Natural Language Understanding,自然语言理解):它是自然语言处理的一个子领域,主要作用是对用户输入的句子或者语音识别结果进行处理,旨在让计算机理解人类语言的含义,从中提取用户对话意图以及所传递的相关信息,像意图识别、实体抽取、领域识别和语义消歧等都属于其范畴 。DST(Dialogue State Tracking,对话状态跟踪) :是对话管理的重要

#深度学习#机器人#人工智能
很多大语言模型数不对 “strawberry” 中 “r” 的数量,主要是由模型的技术原理和特性导致的

很多大语言模型数不对 “strawberry” 中 “r” 的数量,主要是由模型的技术原理和特性导致的,具体原因如下:

#语言模型#人工智能#自然语言处理
    共 67 条
  • 1
  • 2
  • 3
  • 7
  • 请选择