
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要: 超算中心环境限制:CentOS 7.6系统因glibc版本过低无法安装PyTorch 2.4+,且已EOL需迁移至新系统。 Slurm与Docker关系:Slurm本身支持Docker,但超算出于安全考虑禁用普通用户直接使用Docker,推荐使用Singularity/Apptainer容器方案。 个人账户解决方案:用户可通过Singularity在个人目录下创建可写的Ubuntu容器环境
本文对比了低秩分解与量化在模型压缩中的效果。低秩矩阵通过降维压缩(如SVD分解),适用于嵌入层压缩,压缩比2-10倍但精度损失1-3%。量化则通过降低数据位宽(如INT8/INT4)实现更高压缩比(2-32倍)且几乎无损精度,硬件支持更好,推理加速显著。 核心结论显示,量化在压缩比、加速效果和易用性上全面优于低秩分解,尤其适合大模型部署。低秩分解更适合作为辅助手段,与量化结合(如LoRA+QLoR
💡 不同版本的 AI Studio 界面不同,找 “自定义服务” 或 “端口映射” 按钮,把 7860 映射出来。📋 第八步:改成访谈模式最省显存的组合:LiteAvatar + 云端 LLM + Edge TTS / CosyVoice API,官方实测只要 3~6GB 显存就能跑只想跑 LiteAvatar 数字人 + 云端 API:4GB 显存就能玩,6GB 以上更舒服。想本地跑 Min
OpenVINO详解:英特尔AI推理优化工具套件 OpenVINO是英特尔推出的开源端到端深度学习推理优化工具套件,支持英特尔全系列硬件加速。最新版本原生兼容视觉模型、LLM大模型及多模态生成模型。核心功能包括模型优化器(转换模型为IR格式)和推理运行时(统一跨硬件API),支持CPU/GPU/NPU异构计算。优势在于零成本加速英特尔硬件、边缘友好、统一API和开源免费。典型应用涵盖计算机视觉、本
梯度检查点技术通过牺牲少量计算性能换取显存优化。原生模式下(关闭时),前向传播会保存所有中间激活值,导致显存占用爆炸式增长(尤其长序列大batch时)。开启后,仅存储关键节点激活值,反向传播时临时重算所需数据,显存峰值可降低30%-50%,但训练速度会减慢10%-20%。该技术与梯度累积无关,建议显存经常爆满时开启,配合use_cache=false可进一步节省显存。LoRA微调场景下不影响参数更
Mamba模型技术报告摘要 Mamba是2023年底提出的新一代深度学习架构,通过选择性状态空间模型(Selective SSM)与硬件感知计算的结合,解决了Transformer在长序列处理中的二次方复杂度瓶颈。核心创新在于打破传统SSM的线性时不变约束,使模型参数能够随输入动态变化,在保持线性计算效率的同时获得类似Transformer的内容依赖建模能力。 技术表现上,Mamba的推理吞吐量可
摘要: Triton是OpenAI开发的Python GPU编程编译器,允许用Python语法编写高性能GPU内核,替代传统CUDA C++开发。在PyTorch/LLaMA-Factory中,Triton用于实现Flash Attention、LayerNorm等关键算子,提升大模型训练效率。海光DCU因指令集差异需安装专用版Triton(基于DTK/ROCm适配),否则会导致性能下降或功能失效
超算中心的K8s容器服务是基于Kubernetes构建的容器化计算集群,将超算级硬件资源(如多核CPU、大内存、国产DCU加速卡)打包为独立容器。主要用途包括运行AI训练、数值计算等算力任务,统一调度硬件资源,提供隔离且可复用的环境,支持交互式开发和后台批量任务。相比传统Slurm超算,K8s容器更轻量化,适合单节点加速卡场景,特别适合AI模型开发和实验。当前环境配备DCU加速卡和大内存,专为深度
昇腾CANN算子开发认证高效备考指南(150字摘要) 本文针对HCIP/微认证考生提供7天速通方案,基于CANN 8.x版本划分三大备考梯队:优先攻克架构理论(50%分值)→突击算子开发实操(40%)→最后突破高阶优化。理论部分需重点记忆五层架构、数据流向和并行模型;实操环节强调套用向量加法模板,掌握核函数标准写法与32字节对齐原则;工具使用侧重msprof性能分析。配套7天冲刺计划表,每日聚焦特
国家超算中心西安站异构加速节点配置4颗海光C86 7285 CPU和4张海光Z100SM HCU加速卡(gfx906架构),每卡配备16GB显存,兼容ROCm生态。设备空载温度45-46℃、功耗21-25W,支持FP16加速和分布式计算。该平台适合HPC和AI训练任务,建议使用--rocm-arch=gfx906编译指令,并可通过调整性能模式释放算力。系统完整支持ROCm环境,可无缝运行适配AMD







