登录社区云,与社区用户共同成长
邀请您加入社区
在Pytorch中,数据转换(Data Transformation)是一种在加载的样本数据时对数据预处理的机制,将原始数据转换为合适模型训练的格式主要通过torchvision.transforms提供的工具完成。数据转换不仅可以实现基本的数据预处理(如归一化,大小调整等),还能帮助进行数据增强(如随机裁剪、翻转等),提高模型的泛化能力。其作用如下:数据预处理: 将原始图片(PIL Imag
摘要:本文探讨了MoE(混合专家)架构在大模型发展中的关键作用,重点分析了SwitchTransformer论文的创新点。该论文通过简化MoE路由机制,提出仅激活单个专家的top-1路由策略,在保持计算量不变的前提下显著提升了模型性能。实验表明,SwitchTransformer在相同计算资源下可获得7倍预训练加速,并首次实现了万亿参数模型的稳定训练。同时,文章还讨论了DeepSeek最新提出的E
PyTorch框架——基于深度学习神经网络手写字母识别系统源码(带界面和手写画板)
我不是内容的产出者只是内容的搬运工哈哈哈,新换的电脑从头配,折腾了半天。下一步装gpu的TensorFlow,装完我再补。
PyTorch框架——基于深度学习EfficientDeRain神经网络AI去雨滴图像增强系统
PyTorch中已经实现了神经网络中可能用到的各种激活函数,我们在代码中只要直接调用即可。至于激活函数的基本公式和原理查看相关历史文章。
计算机(包括神经网络)只能处理数字。
深度学习的基础理论知识及对应的Pytorch代码实现方法,掌握深度学习的基础知识,与经典机器学习算法的区别与联系,以及最新的迁移学习、循环神经网络、长短时记忆神经网络、时间卷积网络、对抗生成网络、Yolo目标检测算法、自编码器等算法的原理及其Pytorch编程实现方法。
import gc# 用于清理显存print("显存清理完毕")top_p=0.9,del model。
摘要:大模型开发环境配置的关键要点 PyTorch与Transformers是大模型开发的核心工具,但版本不匹配会导致隐性错误。本文通过实际案例揭示环境对齐的重要性: 版本耦合陷阱:Transformers库对PyTorch有隐式依赖,版本错配可能导致静默错误(如NaN损失)或性能下降(如Attention算子回退实现) 工具链价值: PyTorch提供动态图调试、分布式训练支持(如FSDP)和编
很多同学在学习机器学习、深度学习算法的过程中,没有获得感和成就感,因为仅仅学习了理论,没有落地的出口,感受不到这个算法有什么作用或者能解决什么问题这一期给大家推荐一个爆火项目practicalAI, 项目本身就是让大家在实战当中学习AI技术,代码可以在Jupyter中运行下面具体来介绍一下这个实战项目:实战一:线性回归项目。
图像卷积。
本文详细介绍了神经网络的核心知识,包括隐藏层激活函数的选择(ReLU及其变体解决Sigmoid的梯度消失问题)和输出层激活函数(Softmax用于多分类),并通过PyTorch实现了神经网络模型,展示了从模型构建到训练的完整流程。文章解释了各类激活函数的原理、优缺点及适用场景,为开发大模型提供了基础理论知识。
本文深入解析大型语言模型高效推理的两大核心技术:KV缓存与分页注意力机制。文章揭示传统Transformer推理中的冗余计算问题,展示KV缓存如何通过缓存键值矩阵提升计算效率,同时分析其内存管理挑战,提出分页注意力作为解决方案,通过序列分页优化内存使用。代码示例对比三种实现方式,强调这些技术对提升LLM推理效率和可扩展性的关键作用。
本文详细介绍了LangChain框架,一个用于简化大模型应用开发的Python开源工具。文章阐述了LangChain解决LLM三大痛点(信息过时、无法动手、记忆有限)的优势,并全面解析了其技术体系和核心模块,包括LLM接口、提示词模板、Chain链、Memory记忆、工具调用和RAG检索等。特别强调了LangChain在智能运维领域的应用场景,如告警分析、日志检索、Kubernetes故障定位等,
该类通过文本文件(如train2.txt)加载图片路径和标签。使用交叉熵损失函数处理多分类任务,优化器为Adam。模块作用特点ResNet18特征提取主干使用 ImageNet 预训练权重Dataset读取图片与标签支持 transform 自动增强DataLoader批量化输入shuffle 提升训练效果train()前向传播与反向传播更新梯度Test()模型评估计算平均损失与准确率学习率调整自
从基础的Python语法到前沿的多模态AI,从数学工具箱到工程实践,从理论学习到技术贡献,这个学习历程不仅是知识的积累,更是思维方式的转变和能力体系的构建。技术的学习没有终点,每一个阶段的完成都是下一个阶段的开始。在这个快速变化的AI时代,保持好奇心批判性思维和持续学习的能力,比掌握任何具体技术都更加重要。愿每一位读者都能在技术的道路上找到属于自己的方向,在AI技术的浪潮中既是受益者,也是贡献者,
本文介绍了CNN模型的两种构建方式及其可视化方法。通过对比"分步骤定义层"和"Sequential容器封装"两种实现方式,展示了如何构建包含卷积层、池化层、全连接层等核心模块的CNN模型。具体讲解了每层的作用和关键参数,并提供了完整的代码示例。还介绍了使用TensorBoard可视化模型结构的方法,通过add_graph函数生成计算图,便于理解模型架构。最后
PyTorch是一个开源的Python机器学习库,基于Torch库(一个有大量机器学习算法支持的科学计算框架,有着与Numpy类似的张量(Tensor)操作,采用的编程语言是Lua),底层由C++实现,应用于人工智能领域,如计算机视觉和自然语言处理。PyTorch主要有两大特征:类似于NumPy的张量计算,能在GPU或MPS等硬件加速器上加速。基于带自动微分系统的深度神经网络。–》就是自动计算
torchvision中有很多数据集,当我们写代码时指定相应的数据集指定一些参数,它就可以自行下载。CIFAR-10数据集包含60000张32×32的彩色图片,一共10个类别,其中50000张训练图片,10000张测试图片。
2025年,大语言模型已从技术概念渗透到各行各业,成为职场人升职加薪的新赛道。美国圣母大学的最新研究表明,大语言模型正在重塑13个主要学术领域,从传统的人文学科到前沿的工程技术都能看到它的身影。