
简介
资深技术经理 & AI大模型全栈工程师 9年Java技术纵深 | 2年AI工程化落地 | 大型项目管理专家
擅长的技术栈
可提供的服务
大模型应用开发,大模型训练或微调,Agent 开发,软件研发
本文系统介绍了HuggingFace生态系统的核心组件和使用方法。主要内容包括:HuggingFace生态概览,涵盖Transformers库、HuggingFace Hub和配套工具链;预训练模型的加载与使用,详细讲解AutoModel类和任务专用模型的加载方式;Tokenizer的原理与使用方法,展示文本预处理全流程;Datasets库的功能详解,包括数据加载、预处理和保存方法。文章通过大量代

自动混合精度(AMP)技术通过智能切换FP32和FP16精度,显著提升深度学习训练效率。本文详解AMP核心原理:权重备份防止梯度消失、损失缩放避免数值下溢、精度累加减小计算误差。PyTorch实现部分介绍了autocast上下文管理器和GradScaler的使用方法,并提供了完整训练示例。文章还涵盖AMP高级应用,包括梯度累积、多模型训练、自定义函数兼容性等实用技巧,以及性能优化和调试策略,帮助开

本文全面介绍了Neo4j图数据库的使用方法,主要包括以下内容:1. 图数据库基础概念:解释了节点、关系和路径等核心元素,以及与关系型数据库的区别。2. 安装部署指南:详细说明了Windows系统下的JDK配置、Neo4j安装和环境变量设置,以及Docker容器化部署方案。3. Cypher查询语言:系统讲解了数据CRUD操作、数据类型、常用函数和高级查询技巧,包括模式匹配、过滤、排序、分页和聚合等

本文系统解析了PyTorch中常见的8种矩阵运算操作符(torch.dot、@、matmul等)的区别与应用场景。主要内容包括:1)点积的数学本质与几何意义;2)各操作符的输入输出形状规则与典型用法,重点对比了torch.dot、matmul、mv等函数的差异;3)批量矩阵乘法的形状推断技巧;4)NumPy与PyTorch在矩阵运算上的关键区别;5)大模型中的典型应用场景(如自注意力机制);6)性

主流中文大模型评测资源汇总,涵盖Opencompass司南实验室、CLiB、LMSYS等权威评测平台,以及HuggingFace和OSSInsight的模型榜单。在企业私有化部署场景中,Qwen、DeepSeek、Llama、ChatGLM、Baichuan等开源模型表现突出,常被列入备选方案。同时推荐ArtificialAnalysis等专业评测网站,提供模型性能与API分析服务。(99字)

深度学习模型训练中,Epoch、BatchSize、Iteration和学习率是四个关键超参数。Epoch指完整遍历训练数据的次数,BatchSize为每次参数更新前的样本数量,Iteration=ceil(数据集大小/BatchSize)×Epoch数。学习率控制参数更新步长,需根据优化器类型(BatchSize)调整。实践经验表明:小数据集需要更多Epoch(50-100),大数据集可较少Ep

本文介绍了SSH隧道技术在AI模型训练中的应用,主要解决两个问题:1)本地访问云平台非公网端口,如AutoDL上的自定义端口;2)实现Pycharm本地开发与远程GPU计算的无缝对接。文章详细演示了两种实现方式:图形化工具(Xterminal等)和命令行方法,并重点展示了通过SSH隧道实现本地Pycharm调用远程GPU进行模型训练的全过程,包括环境配置、数据同步、镜像设置等关键步骤,最终实现本地

基于 Dify 实现 RAG、Agent “大模型应用落地”是目前企业落地 AI 场景最简单也是必须的路径,我将分两篇文章,从“原理->Dify 部署->模型私有化部署->Agent 搭建案例”完整演示一下实操过程。

基于 Dify 实现 RAG、Agent “大模型应用落地”是目前企业落地 AI 场景最简单也是必须的路径,我将分两篇文章,从“原理->Dify 部署->模型私有化部署->Agent 搭建案例”完整演示一下实操过程。

Jupyter项目包含三大核心工具:Jupyter Notebook提供轻量级的交互式笔记本环境;JupyterLab是新一代模块化开发界面,支持多文档和扩展功能;JupyterHub是多用户服务器方案,支持团队协作。三者均可通过pip安装,其中JupyterHub还支持Kubernetes部署(Littlest JupyterHub适合小型团队)。主要区别在于:Notebook侧重简洁,Lab提









