logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

手搓minigpt(预训练+SFT)

本文记录了作者从零开始训练一个MiniGPT的学习过程。首先介绍了机器学习的基本概念,通过一个三次函数拟合的极简示例展示了梯度下降原理。然后重点解析了Transformer架构,特别是Decoder-only模型中多头自注意力的工作机制,包括其解决长距离依赖问题的优势。在实现部分,作者使用Qwen2分词器处理文本数据,并详细说明了预训练阶段的数据准备过程(添加结束符、分块切分等)。最后展示了带ma

文章图片
#机器学习#语言模型#transformer
NER 序列标注横向评测:BERT (Linear/CRF) VS 大模型 LoRA 微调 + API 方案实测对比

中文命名实体识别技术方案对比分析 本文对比了两种中文命名实体识别(NER)技术方案。数据集采用CLUENER2020,包含10类实体,以短文本为主,实体平均长度4.5字。 方案一:LLM API调用 使用DeepSeek-V4-Flash模型,严格匹配准确率仅26.66% 存在识别错误、输出不稳定、速度慢(0.74s/条)等问题 面临隐私保护、长期成本高等落地挑战 方案二:BERT微调 采用BIO

文章图片
#bert#人工智能#深度学习
文本分类的三种解法:接口调用、Bert微调与LLM微调实战对比

文本分类实践:从数据探索到方案对比 本文探讨了文本分类在实际场景中的应用及两种实现方案。文本分类广泛应用于内容平台分类、电商评论分析、风控合规等领域,核心价值在于自动化处理海量文本数据。实验基于CLUE/TNEWS数据集展开,分析显示数据存在类别不均衡(23倍差异)、文本短(平均22字)等特点。 方案一测试了调用DeepSeek-V4大模型API的效果,结果显示:DeepSeek-V4-Pro零样

文章图片
#分类#bert#人工智能
最短路之含负权边(bellman-ford+spfa+Floyd)学习笔记 (模板+OJ题目供读者自测)

前言与模板需要读者对最短路之不含负权边:Dijkstra算法朴素和堆实现有所了解。bellman-ford适用情况:与拓展次数有关可用于负权。因为有次数限制,所以可以有负环(负权回路)简要介绍:暴力法。每次大循环的含义是向外拓展一次,每次大循环将所有的边遍历一次。模板://循环k次(拓展k次边) 每次循环尝试更新所有的节点最小值int bellman_ford(int n, int m, int

#学习#图论#算法 +2
到底了