基础大模型basellm学习笔记2026@TOC

1、NLP简介 & 环境配置

1.1 NLP简介

在这里插入图片描述

1.2 环境配置

相对而言,是见过最全面的配置流程了~~~
下载Anaconda:https://www.anaconda.com/download/success

# 添加环境变量 - win+R -> sysdm.cpl -> 高级 -> 环境变量 -> 用户变量 -> path
X:\xxx\anaconda3
X:\xxx\anaconda3\Scripts
X:\xxx\anaconda3\Library\bin

# 校验conda  -- conda 25.11.1
conda --version  

# 配置镜像
conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/main/
conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/r/
conda config --add channels https://mirrors.tuna.tsinghua.edu.cn/anaconda/pkgs/msys2/
conda config --set show_channel_urls yes
# 校验
conda config --show channels

# 建虚拟环境
conda create -n base-llm python=3.10
conda activate base-llm
conda deactivate

# 配置常见依赖
pip install numpy pandas matplotlib scikit-learn jupyter
# cpu版本 - pytorch
pip install torch torchvision torchaudio

2、文本表示与词向量

在这里插入图片描述

2.1 分词 Tokenization

连续的文本序列 切分成 基本单元-词/词元;预处理中前期的分词错误,会逐步随着文本堆积产生级联效应Cascading Effect。

import jieba
text1 = "我在梦里收到清华大学录取通知书"
seg_list = jieba.lcut(text1, cut_all=False) # cut_all=False 表示精确模式
print(seg_list)
text2 = "九头虫让奔波儿灞把唐僧师徒除掉"
print(f"精准模式: {jieba.lcut(text2, cut_all=False)}")
jieba.load_userdict("D:/user_dict.txt") 
print(f"加载词典后: {jieba.lcut(text2, cut_all=False)}")
text3 = "我在Boss直聘找工作"
seg_list_hmm = jieba.lcut(text3, HMM=True)
print(f"HMM开启: {seg_list_hmm}")
seg_list_no_hmm = jieba.lcut(text3, HMM=False)
print(f"HMM关闭: {seg_list_no_hmm}")
import jieba.posseg as pseg
words = pseg.lcut(text2, HMM=False)
print(f"默认词性输出: {words}")
jieba.load_userdict("D:/user_pos_dict.txt")
dic_words = pseg.lcut(text2, HMM=False)
print(f"加载词性词典后: {dic_words}")
# 修改九和头的词频
jieba.load_userdict("D:/user_pos_dict2.txt")
dic_words2 = pseg.lcut(text2, HMM=False)
print(f"加载修改后的词性词典后: {dic_words2}")
# test
text4 = "两个黄鹂鸣翠柳,一行白鹭上青天"
print(f"精准模式: {jieba.lcut(text4, cut_all=False)}")
print(f"HMM关闭: {pseg.lcut(text4, HMM=False)}")
print(f"HMM开启: {pseg.lcut(text4, HMM=True)}")

在这里插入图片描述

更多推荐