logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

多模态大模型的核心范本:深入解读 BLIP 的统一理解与生成架构

BLIP提出了一种创新的多模态预训练框架,通过多模块共享权重的统一架构(MED)同时实现视觉语言理解和生成任务。

文章图片
#深度学习#迁移学习#计算机视觉
大模型低精度量化详细原理指南(Quantization)

摘要 大模型量化技术通过降低参数精度(如FP32→INT4)大幅减少内存占用(70B模型从280GB压缩到35GB),使大模型能在消费级硬件上运行。量化核心机制包括对称/非对称映射、异常值截断和校准优化。

文章图片
#深度学习#自然语言处理#人工智能
大模型后训练全解:SFT、RLHF/PPO、DPO 的原理、实践与选择

本文系统介绍了大语言模型后训练(Post-Training)的核心技术,包括SFT监督微调、RLHF强化学习对齐和DPO直接偏好优化。SFT通过高质量指令-回答对训练模型遵循指令;RLHF利用人类偏好数据训练奖励模型,通过PPO算法优化模型输出;DPO则简化了RLHF流程,直接优化偏好对差异。文章还介绍了DeepSeek-R1提出的GRPO新范式,特别适用于可验证推理任务。针对不同应用场景,作者提

文章图片
#人工智能
PointPillars 架构详解

PointPillars是自动驾驶3D目标检测领域的里程碑工作,通过创新的点云编码方式实现了高效检测。其核心思想是将点云划分为2D柱状结构(Pillar),利用简化版PointNet提取特征后转换为伪图像,再通过2D CNN处理,完全避免了计算昂贵的3D卷积。该方法在KITTI基准测试中以62Hz的推理速度超越当时所有方法,包括多传感器融合方案。文章详细解析了Pillar特征网络、Backbone

文章图片
#人工智能#计算机视觉#目标检测
多模态大模型的核心范本:深入解读 BLIP 的统一理解与生成架构

BLIP提出了一种创新的多模态预训练框架,通过多模块共享权重的统一架构(MED)同时实现视觉语言理解和生成任务。

文章图片
#深度学习#迁移学习#计算机视觉
从零实现 Llama 3:架构拆解与实现细节

本文详细解析了Llama3架构的实现过程,通过PyTorch从零构建模型。作者首先介绍了Llama3的整体架构特点,包括数据规模扩大、参数规模提升和复杂度管理等关键改进。重点剖析了解码器块的核心组件:RMSNorm归一化、RoPE位置编码、KVCache优化、分组查询注意力(GQA)和SwiGLU前馈网络。

文章图片
#深度学习#自然语言处理
LLaVA 详解:如何构建一个高性能视觉助手

LLaVA论文提出了一种轻量高效的视觉指令微调方法,通过创新的数据生成和极简架构实现了接近多模态GPT-4的性能。

文章图片
#人工智能#计算机视觉#深度学习 +2
大模型后训练全解:SFT、RLHF/PPO、DPO 的原理、实践与选择

本文系统介绍了大语言模型后训练(Post-Training)的核心技术,包括SFT监督微调、RLHF强化学习对齐和DPO直接偏好优化。SFT通过高质量指令-回答对训练模型遵循指令;RLHF利用人类偏好数据训练奖励模型,通过PPO算法优化模型输出;DPO则简化了RLHF流程,直接优化偏好对差异。文章还介绍了DeepSeek-R1提出的GRPO新范式,特别适用于可验证推理任务。针对不同应用场景,作者提

文章图片
#人工智能
CrewAI :多智能体开发

CrewAI是一个轻量级Python框架,用于构建和协调多智能体(AI Agent)协作系统。它通过角色分工和任务编排,模拟真实团队的工作流程。框架包含四个核心概念:Agent(定义角色和能力的智能体)、Task(具体工作任务)、Crew(协作团队)和Process(执行流程)。开发者可以轻松配置智能体的专业领域、工具集和使用的LLM模型,并通过任务依赖关系建立工作流。CrewAI支持动态参数输入

文章图片
#人工智能
A2A(Agent-to-Agent)协议解析

A2A协议摘要:该协议解决了多Agent系统的碎片化问题,通过定义统一通信规范实现跨平台互操作。

文章图片
#人工智能#开源协议
    共 30 条
  • 1
  • 2
  • 3
  • 请选择