
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要:本文介绍在NVIDIA DGX Spark(GB10芯片)上部署Qwen3.5-35B-A3B-FP8量化模型的最佳实践。该MoE架构模型(35B参数/3B激活)通过FP8量化将模型大小从65GB降至37.5GB,精度损失<0.5%,同时避免了NVFP4的兼容性问题。部署采用vLLM 0.16.1rc1容器化方案,支持262K上下文长度和自动工具调用功能。关键配置包括:FlashAtt
在MediaTek Genio 1200 EVK开发板上安装Ubuntu系统的过程

摘要:本文展示了在NVIDIA DGX Spark环境下使用Wan 2.2 Animate 14B模型的工作流程,包含视频预处理、SAM2模型加载、图像缩放控制等关键节点。完整工作流文件支持视频输入处理和结果预览功能。

摘要:本文详细介绍了在NVIDIA DGX Spark服务器(ARM64架构)上部署Kubernetes集群的全过程,重点解决四大技术难题:1)ARM64架构适配问题,2)Grace Blackwell GB10芯片的CDI配置,3)DGX OS驱动兼容性问题,4)国内网络环境下的镜像拉取问题。通过优化containerd配置、使用Helm国内源部署Cilium网络插件,以及关键性地禁用GPU O
如果 8 台 DGX Spark 都去本地拉取一遍模型,不仅浪费几百 GB 的 NVMe 空间,后续更新模型(如增量微调的 LoRA 权重)也需要手动 Rsync 繁琐同步。为了解决这个问题,我们选取一台搭载大容量 NVMe 硬盘的 DGX Spark 作为**“主镜像仓库”**,通过配置优化的。:在 DGX Spark 上运行一次后,只要不清理系统缓存,第二次启动代码将直接从内存读取,实现几秒钟
本文详细介绍了在NVIDIA DGX Spark集群上部署196B参数大模型的架构设计与实现方案。采用两台主机通过高速网卡直连组成Ray集群,使用流水线并行(PP=2)拆分模型。重点解决了GB10统一内存架构的特殊性、ConnectX-7网络带宽的实际限制,以及软件栈适配中的关键技术难题。特别针对vLLM在跨节点Ray PP场景下的多个严重Bug进行了源码级修复,包括Placement Group

在架构私有云存储时,遇到签名不匹配问题,绝大多数的概率是因为反向代理层(Nginx/Caddy)修改了Host头或者未透传原始请求特征。一开 Debug 看原样,二对 Host 找端倪,三用 location 强制传。最佳实践提醒:对于大文件上传,千万不要忘记在 Nginx 中配置和,否则极易出现或 Nginx 内存被打爆的情况。觉得这篇文章有帮助?遇到其他问题欢迎在评论区交流。
介绍如何基于Google MediaPipe框架,利用WebGPU在浏览器端直接运行Gemma 2/Gemma 3等轻量级大模型,无需后端服务器和API成本。通过MediaPipe的LLM Inference API结合WebGPU和LiteRT模型格式,开发者可在前端实现隐私安全、低延迟的AI推理功能。文章详细解析了核心原理(WebGPU算力调度、WASM运行时、流式响应机制)、硬件要求(2GB
自定义命令允许你定义经常使用的提示为 Markdown 文件。Model Context Protocol (MCP) 是一个开源标准,允许 Claude Code 连接到外部工具和数据源。MCP 服务器可以访问数百个工具。Hooks 是在 Claude Code 生命周期中特定点执行的自定义 shell 命令,提供对 Claude Code 行为的确定性控制。
Agent职责使用场景Researcher深度调研、信息收集新技术调研、竞品分析、技术选型Architect系统设计、架构规划模块拆分、数据流设计、技术架构代码实现、功能开发功能开发、Bug 修复、代码重构安全审查、漏洞检测代码审查、安全审计、风险评估测试设计、质量保证测试用例设计、测试策略制定Documenter文档编写、知识整理API 文档、使用手册、技术文档Optimizer性能优化、效率提







