
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在当今的大模型(LLM)时代,强化学习(Reinforcement Learning, RL)已经成为了让 AI 从“只会续写”进化到“听懂指令、符合人类价值观”的关键技术。本文全面总结了强化学习的基础理论推导、RLHF 的三阶段训练流程、PPO 算法详解,以及前沿的 DPO、GRPO 等算法对比,并深入解析了显存计算、LoRA 参数分配、RoPE 位置编码等工程实践细节。这是一份从理论到实践的完
BGE(BAAI General Embedding)是由智源研究院(BAAI)开源的一系列通用文本向量化模型,目标是生成高质量的文本语义向量。它的主要用途包括语义检索、问答匹配、推荐系统等。BGE 模型基于 Transformer 架构(通常是 BERT 或 RoBERTa 的改进),通过有监督的对比学习和指令微调,使得向量更好地适配下游语义匹配任务。双塔模式(bi-encoder):生成向量表
BERT,全称 Bidirectional Encoder Representations from Transformers,是 Google 于 2018 年提出的一种预训练语言模型。它的核心思想是使用Transformer 编码器结构,通过双向上下文建模学习文本的语义表示。传统的语言模型往往是单向的,比如左到右(GPT)或右到左(ELMo),因此在预测一个词时只能看到部分上下文。

BGE(BAAI General Embedding)是由智源研究院(BAAI)开源的一系列通用文本向量化模型,目标是生成高质量的文本语义向量。它的主要用途包括语义检索、问答匹配、推荐系统等。BGE 模型基于 Transformer 架构(通常是 BERT 或 RoBERTa 的改进),通过有监督的对比学习和指令微调,使得向量更好地适配下游语义匹配任务。双塔模式(bi-encoder):生成向量表







