logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

LLM大模型微调技术全景:从IFT、SFT到RLHF、DPO与PPO强化学习

本文系统梳理了大语言模型(LLM)微调技术的演进路径,从基础微调(IFT/SFT)到强化学习优化(RLHF/PPO),再到轻量级偏好对齐方法(DPO)。IFT和SFT让模型具备任务执行能力,RLHF通过人类反馈优化输出质量,PPO算法确保训练稳定性,而DPO则简化了对齐流程。这些技术呈现出从功能实现到人类偏好对齐、从复杂到高效的进化逻辑,为不同应用场景提供了多样化选择。文章通过对比分析各技术的特点

文章图片
#DeepSeek#AIGC#多模态
具身智能机器人终于有了 “三维大脑”!3D-VLA 破解动态场景推理难题,动作误差仅 0.02m

3D-VLA模型突破了传统二维视觉-语言-行动(VLA)模型的局限,首次将三维感知、动态场景推理与机器人行动规划深度融合。该模型通过3D大模型架构、交互Tokens机制及具身扩散模型,实现了语言指令→三维场景预测→精确动作生成的闭环,行动误差仅0.02米。其创新点包括:从二维数据中提取三维信息构建百万级数据集,结合ChatGPT生成语言标注;利用扩散模型预测动态场景变化,指导机器人适应真实环境。开

文章图片
#机器人#3d#人工智能 +1
多模态大模型基础模型 “能听会看善说” 的关键:对齐、融合、表示三大核心技术拆解

本文节选自陈敬雷新书《GPT多模态大模型与AI Agent智能体》,重点探讨多模态大模型的核心技术。文章指出多模态学习的三大关键:对齐(建立跨模态关联)、融合(信息整合策略)和表示(数据特征转换)。其中,对齐分为时间同步和语义匹配;融合涵盖早期、晚期及混合方式;表示则包括联合、互补和交互三种方法。通过深度学习、迁移学习和自监督学习等技术,这些环节协同工作,推动多模态模型实现"能听会看善说

文章图片
#人工智能#大数据#DeepSeek +2
多模态大模型卷出新高度!LLaVA-1.5 凭 LoRA 微调 + 高分辨率输入,11 项任务登顶 SOTA

摘要: 本文节选自陈敬雷《GPT多模态大模型与AI Agent智能体》,重点解析了LLaVA系列多模态大模型的创新突破。LLaVA-1.5通过LoRA微调、高分辨率输入及优化视觉-语言连接器(如两层MLP),在11项任务中达到SOTA水平,仅需120万训练数据即超越更大规模模型。其核心创新包括:端到端训练框架、GPT-4生成的多模态指令数据集,以及两阶段训练策略(视觉-语言对齐预训练+指令微调)。

文章图片
#人工智能#自然语言处理
开源端到端训练多模态大模型LLaVA 深度拆解

《GPT多模态大模型与AI Agent智能体》一书深入解析了LLaVA系列多模态大模型的技术创新。LLaVA通过两阶段训练策略(视觉语言预训练+指令微调)和GPT-4构造的158K多模态指令数据集,实现了视觉与语言特征的高效对齐。其核心架构采用CLIP视觉编码器+LLaMA语言模型,通过线性层映射跨模态特征,在OCR/KIE等任务中表现优异。开源策略(含数据/代码/权重)推动了行业协作,Video

文章图片
#人工智能#机器人#机器学习 +1
开源必看!MoE-LLaVA多模态大模型:参数量省了、计算成本低了,视觉理解还更强了

北京大学袁粒课题组开源的多模态大模型MoE-LLaVA通过专家混合架构显著提升视觉理解能力,同时降低计算成本。该模型采用视觉编码器、投影层、词嵌入层和MoE块等创新组件,实现多模态数据的高效处理。其分阶段训练策略(MoE-Tuning)通过逐步优化视觉适应、多模态融合和专家选择机制,在保持高性能的前提下大幅减少计算资源消耗。MoE-LLaVA-1.8B×4版本在参数效率和性能平衡方面表现突出,为多

文章图片
#DeepSeek#大数据#人工智能
多模态大模型LLaVA 家族放大招!LLaVA-Plus 化身多模态 Agent,工具自由 + 性能追平 GPT-4

LLaVA-Plus是LLaVA系列的最新升级版,作为多模态Agent实现了工具自由调用与性能突破。它通过智能规划和整合视觉生成、交互、理解等工具库,完成复杂任务,性能接近GPT-4。相比前代,LLaVA-Plus具备更强的工具选择与规划能力,支持"全工具"和"飞速"两种训练模式,7B规模模型即可高效运行。实验显示其在OCR、空间感知等任务上有显著提升,标志

文章图片
#人机交互#语言模型#人工智能 +3
AutoGPT 深度拆解:Agent 初始化、ReAct 框架、记忆模块… 看懂它,才算跟上 AI 自治时代

《AutoGPT深度解析:AI自治时代的核心技术》 摘要: AutoGPT作为开源AI项目,通过融合GPT-4与GPT-3.5技术实现任务自治,其核心架构包含四大模块: Agent初始化:定义AI身份与目标,构建任务执行基础; ReAct任务规划框架:结合推理与行动,通过"思考-行动-观察"循环实现复杂任务分解; 记忆管理:采用向量数据库存储历史信息,支持长短期记忆调用; 工具

文章图片
#人工智能#自然语言处理#语言模型 +3
开发者狂喜!SuperAGI 开源免费还能改:Transformer 架构 + 模块化设计,智能客服到自动驾驶决策都能做

SuperAGI是一个开源自主Agent框架,采用Transformer架构和模块化设计,支持开发者构建、管理和运行智能体。核心功能包括:提供图形化界面和操作控制台、支持多向量数据库连接、优化代币使用策略、自定义模型微调等。其应用场景涵盖智能客服、自动驾驶决策、财务预测等领域。SuperAGI提供本地部署和云平台两种使用方式,并开放Python SDK简化开发流程。项目已在GitHub和Gitee

文章图片
#开源#transformer#架构
揭秘 DeepSeek-V3大模型:MLA 如何破解传统注意力 “内存炸弹”,大模型推理效率飙升!

DeepSeek-V3大模型创新采用MLA(多头潜在注意力)和DeepSeekMoE架构,突破传统Transformer局限。MLA通过低秩联合压缩键值技术,将KV缓存转化为潜在向量,在保持性能的同时显著降低内存占用和计算成本,推理效率提升40%。该机制包含键值压缩、查询压缩和注意力输出生成三个核心步骤,特别适合长序列处理。模型还引入无辅助损失的负载均衡策略优化DeepSeekMoE架构,实现计算

文章图片
#人工智能#自然语言处理#AI +2
    共 211 条
  • 1
  • 2
  • 3
  • 22
  • 请选择