logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型全参数训练与微调

本文详细介绍了大模型全参数训练方法,重点分析了SFT、DPO、PPO、GRPO等主流模型训练技术及其实现工具TRL和LlamaFactory。主要内容包括: 训练流程:分为预训练、SFT微调、偏好对齐三个阶段,TRL提供统一接口支持各阶段训练。

#python#语言模型#transformer
大模型压缩常用方法

T 越高,输出分布越平缓,类别间的相对关系("暗知识")越明显。T=1 退化为标准 softmax。用大模型(teacher)的 soft label 指导小模型(student)训练。训练后的网络中存在大量接近零的权重,对输出贡献可忽略。剪枝即移除这些冗余连接。

#python#pytorch#深度学习
视觉模型全景:从 CNN 到多模态大模型

(数千个不同尺寸/比例的参考框),模型预测相对 anchor 的偏移量,再用 NMS 去除重叠框。

#python#人工智能#深度学习
大模型文本生成效果评估体系详解

类别 外部指标 侧重 Recall一句话定义:与 BLEU 侧重 Precision 相反,ROUGE 侧重Recall——参考摘要中的关键信息,模型生成结果覆盖了多少。变体计算方式适用场景ROUGE-N参考与候选之间 n-gram 的 Recall基础版本,类似 BLEU 的 recall 方向ROUGE-L基于最长公共子序列(LCS)最常用,不要求连续匹配,更灵活ROUGE-W加权 LCS,对

#python#人工智能#算法
VLA 视觉-语言-动作模型

VLA = Vision-Language-Action(视觉-语言-动作模型)。它是一个端到端的多模态模型,输入端接收摄像头图像 + 自然语言指令,输出端直接产生机器人的关节动作序列。你对机器人说"帮我把桌上的红色杯子拿过来",VLA 模型通过摄像头看到杯子在哪、理解"拿过来"是什么意思、然后自主规划出一系列关节运动轨迹来完成任务。整个过程不需要人工编程每一步怎么做。组件负责什么输入输出类比V

#人工智能#计算机视觉#深度学习
到底了