登录社区云,与社区用户共同成长
邀请您加入社区
这里用已经预训练好的开源模型openvla-7b-finetuned-libero-spatial来做测试,目的仅仅只是看eval脚本能不能运行,数据指标和演示视频能否被记录,从而验证evaluation pipeline能否正常工作。在之前几个训练步的测试中的失败案例在肉眼看来大多都是机械臂完全静止,为区分到底是环境未执行动作还是和模型输出无效动作,从 7.5k 开始,在 eval 中加入了ep
本文详细指导在Windows环境下搭建深度学习推理环境,涵盖显卡驱动更新、CUDA/cuDNN安装、PyTorch部署及TensorRT配置。关键步骤包括:通过nvidia-smi确认驱动支持的CUDA版本,下载对应CUDAToolkit与cuDNN,使用pip安装匹配CUDA版本的PyTorch,解压TensorRT并将其库文件复制至CUDA路径,配置环境变量后验证nvcc与TensorRT版本
本文通过可复现的计时方法,验证PyTorch中pin_memory与non_blocking对数据传输效率的实际影响。指出GPU利用率低不一定是计算瓶颈,可能是CPU到GPU的数据搬运阻塞。强调需在固定配置下对比基线,结合CUDA Event精准计时与系统监控,避免盲目增加num_workers。实证表明,锁页内存与异步复制仅在合适条件下提升吞吐,优化应基于对照实验,而非参数堆叠。
本篇承接上篇 NLP 数据预处理内容,基于 PyTorch 实现双向多层 LSTM 的 TextRNN 微博情感四分类任务。完整拆解模型网络结构,讲解 Embedding、双向 LSTM、全连接层实现细节;同时剖析训练、验证、测试整套逻辑,包含交叉熵损失、Adam 优化器、梯度反向传播、早停策略、模型保存,使用 sklearn 完成准确率、精确率、召回率、F1 指标评估。结合主程序讲解设备适配、随
模型训练过程中,报错信息铺天盖地,初学者往往束手无策。其实,90%以上的报错都属于少数几类常见问题。本课将系统梳理PyTorch训练中最高频的报错类型,涵盖:维度不匹配(`mat1 and mat2 shapes cannot be multiplied`)、梯度报错(`element 0 of tensors does not require grad`)、显存溢出(`CUDA out of m
本文是微博四分类情感分析实战系列的第一篇——数据预处理。基于 TextRNN(双向LSTM) 模型,从零讲解 NLP 数据预处理全流程。内容涵盖:字符级词表构建(频次统计、低频过滤、<UNK>/<PAD> 特殊标记、pickle 持久化)、数据集加载与预处理(字符转 ID、Padding 截断、8:1:1 划分训练/验证/测试集),以及自定义 DatasetIterater 批量迭代器。词表最终大
PyTorch 是由 Meta 开发的主流深度学习框架,以其动态计算图、自动求导和丰富的生态著称。本文从张量概念入手,介绍如何创建张量(如 tensor、zeros、randn 等),并演示基本操作:加法、矩阵乘法、索引切片与形状变换。张量作为多维数组,支持 GPU 加速与自动求导,是构建神经网络的核心数据结构,适合快速上手深度学习开发。
VLA 如何把图像与语言变成机器人动作?本文使用 LeRobot 加载 SmolVLA 预训练策略,在本地 RTX 4080 Laptop GPU 上完成最小离线推理实验:以三路合成桌面图、零状态和语言指令为输入,生成 [1,50,6] 动作片段,检查数值、固定输入重复性及指令变化影响。提供完整代码、模型版本和实测耗时、显存数据,并解释动作片段、归一化与机器人控制的区别。实验不涉及训练和真机抓取,
深度学习模型的训练往往像在“黑盒”中摸索——代码跑起来了,Loss在下降,但模型到底学得怎么样?是否过拟合?参数分布是否合理?梯度是否消失或爆炸?这些问题的答案,都隐藏在训练过程中的海量数据里。本课将系统讲解PyTorch官方可视化工具TensorBoard的完整使用教程:从安装配置到核心API的实战演练,涵盖`add_scalar`记录损失/准确率曲线、`add_image`可视化输入图像和特征
零基础在 PyCharm 用 CPU 跑通第一个 MindSpore / 昇腾模型,含虚拟环境、安装报错、MNIST 训练全流程和真实踩坑,新手照着做就能跑。
《脑内会议》是一款让AI替你“吵架”的纯前端工具,通过四角色辩论预演现实争执。用户输入议题,AI化身理性派、暴躁哥、毒舌女、和事佬,轮流发言,流式输出如真实会议。基于原生HTML/CSS/JS,零依赖、无构建,支持手机端响应式。核心技术是用浏览器fetch+ReadableStream模拟Python的SSE流式请求,实现“边想边说”的沉浸感。既解压又练逻辑,让“事后诸葛亮”变成“现场赢麻了”。
过拟合是深度学习中最常见的陷阱——模型在训练集上表现完美,却在验证集上一败涂地。本课将系统讲解过拟合与欠拟合的判定方法,并提供一整套正则化武器库:Dropout(随机失活)及其变体、BatchNorm与LayerNorm的归一化原理与选型、权重正则化(L1/L2)的数学直觉与效果对比、早停(Early Stopping)的实现与注意事项、数据集扩充(数据增强进阶)、以及模型剪枝(Pruning)的
D4PG (分布式分布深度确定性策略梯度) 从四方面改进 DDPG:用概率分布替代评论家的单一Q值输出、引入n步贝尔曼方程加速收敛、采用优先经验回放提升样本效率,并简化探索机制为高斯噪声。其评论家输出51个原子概率,训练时通过贝尔曼投影与交叉熵损失对齐分布,演员训练则借助分布转Q值。在四足机器人任务上,D4PG平均奖励从 DDPG 的4.5提升至近 18,收敛更快、性能更优。
用Docker部署 Milvus 单机版;实现统一 Embedding 抽象,兼容 OpenAI 与本地模型;完成记忆的分块、写入、索引构建与语义检索;接入大模型,打通RAG 问答;增加记忆回流机制,让私人知识库持续增长;最终封装成一个可直接运行的CLI 私人记忆助手。这套代码稍加扩展就能变成浏览器插件、微信机器人或者本地笔记工具的记忆后端。向量数据库 + 大模型的组合正把「AI 懂你」从口号变成
机械臂完成切割任务需解决工具安装、视觉定位、坐标转换、运动规划与双臂协同等问题。本文以刀具固定安装为起点,探讨如何通过手眼标定实现刀尖精准定位,并构建从视觉感知到动作执行的完整链路,为后续力控与协同操作奠定基础。
本文业务场景是:大型 PDF 和设计文件在用户打开前预加载必要范围,缩短可交互时间。主操作为“扫描文件是否适合加速并配置预加载策略”。成功标准至少包括:目标结果正确、用户可取消、进程重启可恢复、重复回调不破坏终态、性能指标可度量、隐私数据未越界。value?: string非目标也要写清:不绕过系统权限,不在不支持设备伪造成功,不把平台对象直接暴露给页面,不用用户原始数据换取更方便的调试。
本文业务场景是:文件导出任务在锁屏与关键界面持续展示进度,并在完成后进入唯一终态。主操作为“在实况窗辅助区展示百分比进度环”。成功标准至少包括:目标结果正确、用户可取消、进程重启可恢复、重复回调不破坏终态、性能指标可度量、隐私数据未越界。value?: string非目标也要写清:不绕过系统权限,不在不支持设备伪造成功,不把平台对象直接暴露给页面,不用用户原始数据换取更方便的调试。百分比进度环:单
本文业务场景是:自动化测试需要复现跨窗口快捷键和鼠标拖拽,不应影响用户真实会话。主操作为“在受控测试环境模拟键盘和鼠标输入”。成功标准至少包括:目标结果正确、用户可取消、进程重启可恢复、重复回调不破坏终态、性能指标可度量、隐私数据未越界。value?: string非目标也要写清:不绕过系统权限,不在不支持设备伪造成功,不把平台对象直接暴露给页面,不用用户原始数据换取更方便的调试。键鼠事件注入:测
在 PyTorch 的优化路径中,图捕获(Graph Capture)是实现性能提升的关键环节。当前 PyTorch 社区对图捕获的实现主要围绕 CUDA 设备展开,但随着 NPU 等其他加速器的接入需求日益增长,我们需要设计一套可扩展的图捕获架构,使得不同硬件后端能够以统一的方式接入这一优化路径。本文介绍的是“使用契约、但不迁移 CUDA”的实现变体。该方案的核心思路是:NPU 及其他已注册后端
精准解决torch_npu版本不匹配导致的段错误。核心要点:torch_npu、PyTorch、CANN严格对应(如2.4.0.x配CANN 8.0),通过get_cann_version与环境变量校验版本一致性,容器需初始化Ascend环境,冲突安装清理后重装或源码编译,确保torch.npu.is_available()为True,视觉库需在昇腾支持清单内。
随着大模型训练场景的多样化发展,模型需要在不同硬件平台上保持一致的训练精度。本工作旨在将 GLM-5.2 模型结构接入 MindFormers PyNative 框架,并以 GPU 上的 Megatron-LM 为参考基准,验证 Ascend NPU 与 NVIDIA GPU 在单卡训练场景下的精度一致性。通过系统化的对齐流程,确保模型在不同硬件平台上的训练行为可复现、可预期,为后续多卡扩展和实际
在大型语言模型(LLM)的训练与推理实践中,框架生态的兼容性是一个关键挑战。在无 MindSpore 环境的情况下,实现单卡 PyNative(动态图)模式的预训练闭环。目标平台为 Ascend NPU(通过torch_npu),同时需向下兼容 CUDA 和 CPU。本次单卡改造必须为后续平滑放大到多卡并行训练铺平道路,避免未来大规模重构。因此,所有设计决策都以“单卡即多卡 world_size=
本文从零讲解词向量的训练与保存全流程。先用 Numpy 演示 .npy / .npz 的保存与读取,这是深度学习中间产物落盘的基本功;再对比 One-hot 编码与分布式词向量,说明为何需要 Word2Vec。随后基于 PyTorch 实现 CBOW 模型:用上下文词预测中心词,经 Embedding 查表、向量平均、全连接与 log_softmax 输出,用 NLLLoss 训练。最后提取 Em
本文基于PyTorch,使用预训练ResNet18模型实现食物分类任务,通过迁移学习技术显著提升小数据集下的分类性能。核心步骤包括:加载ImageNet预训练权重、冻结卷积层参数、替换全连接层为20类输出,并仅训练新层。结合数据增强与学习率调度,实现高效训练。该方法在参数量少、数据有限的情况下仍可获得高准确率,充分体现了迁移学习在图像分类中的优势。
问题方向优化建议指标不一致设计更贴合业务的评估指标(如 Weighted NDCG)分布不一致使用近线训练样本,引入在线特征、周期性更新模型部署不一致特征/模型/服务版本对齐,建立稳定部署流程策略干扰区分模型效果与策略干预效果,独立评估纯模型表现数据不闭环建立推荐结果与点击行为的闭环采样与再训练机制。
miniconda 24.11.1和最新版的powershell有兼容性问题,无法执行conda命令,目前powershell 社区已经知晓,把责任归咎于conda,据悉最新版的anaconda已经修复了该问题,但miniconda依旧存在该问题,有人在社区给了解决办法,但我尝试后无效,终极解决办法是卸载 powershell 7.5,安装powershell 7.4.7,7.4版本是目前微软的l
分析 Pytorch 框架中 train_dataloader 的数据结构。根据Pytorch官网上的tutorials部分介绍,首先下载训练和测试数据并安装好,然后是编程分析数据加载器的数据结构。这里分享的是分析 train_dataloader 的数据结构的过程,test_dataloader的数据结构与前者的是一样的,不再赘述。
在设计时对微信客户端进行了充分的了解,掌握微信平台通过的接口,同时系统采用Java技术进行开发,MySQL数据库进行数据的储存,充分的保证了系统的稳定性、安全性,基于微信平台的在线答题小程序实现了客户端和服务器端两部分,实现了在线答题相关信息的查询管理功能。微信是目前国内使用最多的社交软件之一,有庞大的用户群体,便于调查者获取不同年龄段不同层次和地方的市场情况和用户需求,而且利用微信小程序调查,用
注意:miniconda和虚拟环境的路径要替换成自己的路径。
tensorflow-estimator、tensorflow-intel、tensorflow-io-gcs-filesystem等卸载后无需重新安装即可以顺利执行。方式一:用命令行卸载torch、torchvision、tensorboard、tensorboardX等及其相关再重新安装。如果存在tensorflow-estimator、tensorflow-intel、tensorflow-
Pytorch 混合精度训练 (Automatically Mixed Precision, AMP)
win10超简单安装onnx和tensorrt,没有花里胡哨!
yolov5s模型使用tensorrt加速在显卡1060上运行FPS提升到90左右,比原始官方模型提升一倍左右支持python调用和c++调用
import paddleimport matplotlib.pyplot as pltimport numpy as npfrom PIL import Imageimport paddle.nn.functional as Fclass MNIST(paddle.nn.Layer):def __init__(self):super(MNIST, self).__init__()self.fc
用torch 1.8.1训练保存的模型,用torch 1.1.0进行模型加载。PyTorch的1.6版本将torch.save切换为使用新的基于zipfile的文件格式。 torch.load仍然保留以旧格式加载文件的功能。 如果出于任何原因您希望torch.save使用旧格式,请传递kwarg _use_new_zipfile_serialization = False。The 1.6 rele
对于这个问题,需要做的也很简单,无非就是将模式“P”转化为“RGB”模式,再保存为“jpg”就可以了,所以只用增加两行代码:if img.mode == "P":img = img.convert('RGB')
第一步v列表JSON格式的[{“sentence”: “宝可梦李宏毅大师”},{“sentence”: “宝可梦李宏毅大师”},{“sentence”: “宝可梦李宏毅大师”},{“sentence”: “宝可梦李宏毅大师”},{“sentence”: “宝可梦李宏毅大师”},{“sentence”: “宝可梦李宏毅大师”},{“sentence”: “宝可梦李宏毅大师”},{“sentence”
目录结构1、背景介绍2、数据采集3、网络设计4、网络训练5、网络部署6、总结1、背景介绍最近采购了一块新的树莓派,迫不及待的想要在树莓派上实现一个实时的手势识别。从算法的角度讲,并不是太难;但是从工程的角度来说,主要有两个难点,一是手势数据的采集。大家都知道,深度学习的高精度离不开大量的训练数据,网络设计的再好,没有足够的数据是不行的。因此要想实现一个好的手势识别,采集数据就成了一个比较重要的难点
首先导入pandas会报出/usr/local/lib/python3.6/site-packages/pandas/compat/__init__.py:120: UserWarning: Could not import the lzma module.Your installed Python is incomplete.Attempting to use lzma compression
>>> import torchTraceback (most recent call last):File "<stdin>", line 1, in <module>File "/home/gp/anaconda3/envs/torch1.4.0/lib/python3.6/site-packages/torch/__init__.py", line
在 PyTorch 框架中,是一个通过和 Triton 生成代码来运行的内部接口,用于实现灵活的注意力机制。NPU 环境下该接口在部分场景下存在兼容性问题。本文记录了在 NPU 环境下适配接口的完整过程,包括问题定位、解决方案及最终结论。本文详细记录了在 NPU 环境下适配 PyTorch设备类型检查的绕过与补丁triton 依赖的安装与版本适配设备属性检查的兼容性修改模块路径变更的适配编译优化阶
**同步很关键** | 不同步到 site-packages,实际运行仍会加载旧逻辑,表现为报错仍在 `torch.distributed._state_dict_utils` 的 `cudaHostRegister` 行 || **直接原因** | 对 `None` 对象调用 `cudaHostRegister(...)` / `cudaHostUnregister(...)` 导致 `Attr
本文业务场景是:用药应用按周期提醒用户,并在疗程结束后自动停止。主操作为“创建有限次数的周期提醒任务”。成功标准至少包括:目标结果正确、用户可取消、进程重启可恢复、重复回调不破坏终态、性能指标可度量、隐私数据未越界。value?: string非目标也要写清:不绕过系统权限,不在不支持设备伪造成功,不把平台对象直接暴露给页面,不用用户原始数据换取更方便的调试。重复提醒:周期、次数与幂等执行 的真正
本文业务场景是:全球化应用希望登录入口跟随语言,并在授权过程中显示一致加载反馈。主操作为“配置华为账号登录按钮多语言文本与加载动效”。成功标准至少包括:目标结果正确、用户可取消、进程重启可恢复、重复回调不破坏终态、性能指标可度量、隐私数据未越界。value?: string非目标也要写清:不绕过系统权限,不在不支持设备伪造成功,不把平台对象直接暴露给页面,不用用户原始数据换取更方便的调试。
本文业务场景是:共享企业终端根据班次切换受管系统账号,并核对关键应用窗口状态。主操作为“创建、切换或移除企业设备系统账号”。成功标准至少包括:目标结果正确、用户可取消、进程重启可恢复、重复回调不破坏终态、性能指标可度量、隐私数据未越界。value?: string非目标也要写清:不绕过系统权限,不在不支持设备伪造成功,不把平台对象直接暴露给页面,不用用户原始数据换取更方便的调试。
pytorch
——pytorch
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net