
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
预训练模型(如 VGG16 在 ImageNet 上训练的权重)已经学习了丰富的图像通用特征(如边缘、纹理、形状等)。复用预训练模型的特征提取部分(冻结其权重,避免破坏已有特征);替换模型的分类头(输出层),适配新任务的类别数;仅训练新的分类头参数,实现快速收敛和高性能。
昨天我们讲到了,subword中的BPE以及BBPE算法,今天,我们将深入探讨三种在现代大语言模型(如BERT、T5)中广泛应用的Subword(子词)分词算法:WordPiece, Unigram, 和 SentencePiece。本文旨在清晰地解析它们的核心原理、训练过程及各自的优势。
昨天我们讲到了,subword中的BPE以及BBPE算法,今天,我们将深入探讨三种在现代大语言模型(如BERT、T5)中广泛应用的Subword(子词)分词算法:WordPiece, Unigram, 和 SentencePiece。本文旨在清晰地解析它们的核心原理、训练过程及各自的优势。
昨天我们讲到了,subword中的BPE以及BBPE算法,今天,我们将深入探讨三种在现代大语言模型(如BERT、T5)中广泛应用的Subword(子词)分词算法:WordPiece, Unigram, 和 SentencePiece。本文旨在清晰地解析它们的核心原理、训练过程及各自的优势。
昨天我们讲到了,subword中的BPE以及BBPE算法,今天,我们将深入探讨三种在现代大语言模型(如BERT、T5)中广泛应用的Subword(子词)分词算法:WordPiece, Unigram, 和 SentencePiece。本文旨在清晰地解析它们的核心原理、训练过程及各自的优势。
本文是写给大模型(LLM)初学者的分词(Tokenizer)算法入门指南。文章将通过一个极其简单的例子,手动、完整地推演BPE(字节对编码)算法的每一步,并详细解释其优化版BBPE的核心思想与区别。拒绝跳步,拒绝省略,让你真正从零到一掌握这两种主流分词算法的底层逻辑。
结果发现 —— 能跑通,但问题不少,模型预测准确率提不上去对于高维度图像全连接还是很吃力,要用到后面的卷积会好很多,刚好暴露了全连接的局限性!







