
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
上下文管理器是一种协议对象,用于在执行一段代码块前后自动执行设置和清理操作。最典型的使用场景是资源管理(如文件、锁、数据库连接等),确保资源被正确释放,即使发生异常也不会泄漏。核心作用:“自动善后” —— 进入时准备,退出时清理。基本语法:等价于(伪代码):上下文管理器协议一个对象要成为上下文管理器,必须实现两个方法: 参数说明:场景:文件编辑场景:抑制特定异常使用装饰器(推荐!)常见内置上下文管
随着上下文窗口达到百万级 (1M+ Tokens),传统 O(N2)O(N2) 的注意力机制面临瓶颈,新架构层出不穷。注:2026年主流模型通常使用分组查询注意力 (GQA) 或 滑动窗口注意力 来优化推理速度。: 不再是将图像Patch简单映射为Text Token,而是构建统一的语义空间。扩散模型 (Diffusion Models): 通过逐步去噪生成数据。允许模型在不同的子空间同时关注不同
数据处理阶段:放心使用NumPy。它生态成熟,配合 Pandas/Matplotlib 处理 CSV、图像预处理非常方便。模型训练阶段:必须转换为PyTorch。利用其 GPU 加速和自动求导能力。避坑指南:不要试图把 GPU 张量直接转 NumPy。注意的内存共享特性,修改原数组可能会意外改变张量数据。矩阵乘法记得用或,别用。
模型选择:理解类任务选BERT系列,生成类任务选GPT/T5系列;中文任务优先。库的使用:快速验证用Pipeline,通用开发用AutoModel,深度定制用。迁移学习本质:所有预训练模型均基于“预训练+微调”范式,通过少量数据即可适配新任务,大幅降低训练成本。对比维度BERTGPT核心架构注意力方向双向 (可同时看前后文)单向 (只能看前文)训练目标掩码语言模型 (MLM),类似“完形填空”自回
模型选择:理解类任务选BERT系列,生成类任务选GPT/T5系列;中文任务优先。库的使用:快速验证用Pipeline,通用开发用AutoModel,深度定制用。迁移学习本质:所有预训练模型均基于“预训练+微调”范式,通过少量数据即可适配新任务,大幅降低训练成本。对比维度BERTGPT核心架构注意力方向双向 (可同时看前后文)单向 (只能看前文)训练目标掩码语言模型 (MLM),类似“完形填空”自回
文本↓分词器(将文本切分为索引,如 [101, 7592, 2088, 102])↓词嵌入查找(将索引转换为向量EtokenE_{token}Etoken↓位置编码生成(生成位置向量EposE_{pos}Epos↓相加XEtokenEposXEtokenEpos↓输入模型(张量XXX进入第一层编码器或解码器)并行策略核心逻辑优点缺点典型应用场景数据并行 (DP)数据分片,模型复制。
让模型在处理信息时,学会“聚焦”于输入序列中与当前任务最相关的部分,而不是同等地看待所有信息。它模拟了人类视觉的注意力机制——我们看一张图或读一句话时,不会平均分配精力,而是关注重点。在注意力机制出现之前,主流的序列模型(如 RNN、LSTM、GRU)主要依赖编码器-解码器架构来处理序列到序列的任务(如机器翻译)。注意力机制的诞生:它允许解码器在生成每一个输出词时,直接“回头”查看编码器的所有隐藏
人工神经网络( Artificial Neural Network, 简写为ANN)也简称为神经网络(NN),是一种模仿生物神经网络结构和功能的计算模型。人脑可以看做是一个生物神经网络,由众多的神经元(基本单位)连接而成。神经网络的概念最早源于对生物神经系统的研究。在大脑中,神经元通过树突接收信号,在细胞体内处理,若信号强度超过阈值,则通过轴突传递信号。受此启发,人工神经网络将这一过程抽象为数学模
数据处理阶段:放心使用NumPy。它生态成熟,配合 Pandas/Matplotlib 处理 CSV、图像预处理非常方便。模型训练阶段:必须转换为PyTorch。利用其 GPU 加速和自动求导能力。避坑指南:不要试图把 GPU 张量直接转 NumPy。注意的内存共享特性,修改原数组可能会意外改变张量数据。矩阵乘法记得用或,别用。







