logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【RLHF】深入浅出:完整解析人类反馈强化学习的预训练、SFT与RL微调三阶段

人类反馈强化学习(RLHF)已成为塑造现代大语言模型行为的关键技术。然而,其过程远非一蹴而就,而是一个环环相扣、层层递进的系统工程。本文将深入浅出地完整解析RLHF的三大核心阶段:首先,在“预训练”阶段,模型在海量数据中汲取知识,奠定其通用的语言与推理能力根基;继而,通过“有监督微调(SFT)”,模型学习理解并遵循人类指令,从“通才”转变为“专家”;最终,在最具挑战的“强化学习微调”阶段,模型借助

文章图片
#人工智能#自然语言处理#语言模型 +2
Ollama API 请求失败:404 Not Found 问题排查与解决记录

摘要:应用程序调用本地Ollama大模型时返回404错误。排查发现Ollama服务未监听默认11434端口,而是其他端口(如44431)。解决方法:通过修改systemctl服务配置,添加OLLAMA_HOST=0.0.0.0:11434环境变量并重启服务,或调整应用程序端口。最终验证端口监听状态确认修复成功。

文章图片
#人工智能#自然语言处理
解决PyTorch代码中torch.cuda.is_available()终端返回True但代码中显示False的问题

在深度学习训练中,我们通常会优先选择GPU加速计算。然而,有时会遇到一个诡异的现象:返回True却返回False,导致代码回退到CPU模式。

文章图片
#pytorch#人工智能#python +3
【RLHF】深入浅出:完整解析人类反馈强化学习的预训练、SFT与RL微调三阶段

人类反馈强化学习(RLHF)已成为塑造现代大语言模型行为的关键技术。然而,其过程远非一蹴而就,而是一个环环相扣、层层递进的系统工程。本文将深入浅出地完整解析RLHF的三大核心阶段:首先,在“预训练”阶段,模型在海量数据中汲取知识,奠定其通用的语言与推理能力根基;继而,通过“有监督微调(SFT)”,模型学习理解并遵循人类指令,从“通才”转变为“专家”;最终,在最具挑战的“强化学习微调”阶段,模型借助

文章图片
#人工智能#自然语言处理#语言模型 +2
【RLHF】深入浅出:完整解析人类反馈强化学习的预训练、SFT与RL微调三阶段

人类反馈强化学习(RLHF)已成为塑造现代大语言模型行为的关键技术。然而,其过程远非一蹴而就,而是一个环环相扣、层层递进的系统工程。本文将深入浅出地完整解析RLHF的三大核心阶段:首先,在“预训练”阶段,模型在海量数据中汲取知识,奠定其通用的语言与推理能力根基;继而,通过“有监督微调(SFT)”,模型学习理解并遵循人类指令,从“通才”转变为“专家”;最终,在最具挑战的“强化学习微调”阶段,模型借助

文章图片
#人工智能#自然语言处理#语言模型 +2
保姆级教程:用DeepSeek + RAGFlow 构建你的个人智能知识库

本教程为一份保姆级的私有化知识库构建指南。文章针对通用AI无法回答内部文档的问题,引入RAG(检索增强生成) 技术作为解决方案,并对比了其与模型微调的区别。教程核心在于教你如何将 DeepSeek 大模型与 RAGFlow 框架在本地整合。内容涵盖了从Ollama本地部署(运行DeepSeek及Embedding模型)、RAGFlow私有化部署,到最终构建知识库并进行问答的完整实战步骤。文中还贴心

文章图片
#语言模型#人工智能#自然语言处理 +1
解决PyTorch代码中torch.cuda.is_available()终端返回True但代码中显示False的问题

在深度学习训练中,我们通常会优先选择GPU加速计算。然而,有时会遇到一个诡异的现象:返回True却返回False,导致代码回退到CPU模式。

文章图片
#pytorch#人工智能#python +3
【RLHF】深入浅出:完整解析人类反馈强化学习的预训练、SFT与RL微调三阶段

人类反馈强化学习(RLHF)已成为塑造现代大语言模型行为的关键技术。然而,其过程远非一蹴而就,而是一个环环相扣、层层递进的系统工程。本文将深入浅出地完整解析RLHF的三大核心阶段:首先,在“预训练”阶段,模型在海量数据中汲取知识,奠定其通用的语言与推理能力根基;继而,通过“有监督微调(SFT)”,模型学习理解并遵循人类指令,从“通才”转变为“专家”;最终,在最具挑战的“强化学习微调”阶段,模型借助

文章图片
#人工智能#自然语言处理#语言模型 +2
Ollama API 请求失败:404 Not Found 问题排查与解决记录

摘要:应用程序调用本地Ollama大模型时返回404错误。排查发现Ollama服务未监听默认11434端口,而是其他端口(如44431)。解决方法:通过修改systemctl服务配置,添加OLLAMA_HOST=0.0.0.0:11434环境变量并重启服务,或调整应用程序端口。最终验证端口监听状态确认修复成功。

文章图片
#人工智能#自然语言处理
保姆级教程:用DeepSeek + RAGFlow 构建你的个人智能知识库

本教程为一份保姆级的私有化知识库构建指南。文章针对通用AI无法回答内部文档的问题,引入RAG(检索增强生成) 技术作为解决方案,并对比了其与模型微调的区别。教程核心在于教你如何将 DeepSeek 大模型与 RAGFlow 框架在本地整合。内容涵盖了从Ollama本地部署(运行DeepSeek及Embedding模型)、RAGFlow私有化部署,到最终构建知识库并进行问答的完整实战步骤。文中还贴心

文章图片
#语言模型#人工智能#自然语言处理 +1
    共 11 条
  • 1
  • 2
  • 请选择