
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Transformer的基本原理是Encoder(编码)和Decoder(解码),也就是先将输入的内容转换为计算机能理解的内容,再将计算机理解的内容转换为我们人类能理解的内容。但在语言转化的过程中,还会出现一个问题:歧义。我们生活中也会有很多出现歧义的情况,比如“我买了一斤苹果”和“我买了个苹果新产品”。那么问题来了:大家怎么判断这两句中的苹果指的是某种水果还是某个电子设备?答案估计也没啥争议:结

大模型训练主要分为预训练、监督调优和对齐三个阶段。预训练是基础,旨在让模型掌握语言表达的流畅性和规则,而具体任务能力则通过监督调优实现。模型架构上,可选择主流开源方案如ChatGLM、Baichuan等,参数量建议从0.5B起步。训练数据需覆盖百科、新闻等类型,数据量按20倍参数比例计算。以0.5B模型为例,单卡4090训练成本约1116元。大模型学习资源包括书籍、行业报告和视频等,可系统提升AI

就在4月份上交大发布了动手学大模型教程,这份教程来自上海交大《人工智能安全技术》课程讲义拓展,教师是是张倬胜教授。这份教程不仅提供了大模型的入门编程教学,每个部分还包含 详细教程和参考资料,非常适合新手学习。教程内容包含以下方向:微调与部署提示学习与思维链知识编辑模型水印大模型越狱攻击多模态模型大模型智能体与安全

大模型入门必读12本书推荐 本文推荐12本大模型学习必读书籍,涵盖GPT-4、ChatGPT等Transformer架构的核心技术。推荐书籍包括《基于GPT-3的自然语言处理》《大模型应用开发极简入门》等,内容涉及文本生成、机器翻译、图像标注及高级提示工程等。这些书籍适合具备深度学习基础的本科生和研究生,提供从理论到实践的完整学习路径。部分书籍已整理为PDF资源,可免费获取。通过系统学习这些材料,

本篇文章比较适合以下几类朋友:适合想要了解大模型到底是怎么回事的小白和入门朋友;适合有意愿转型从事AI相关的产品和岗位的朋友,包括产品经理,运营人员;适合已经初步了解AI,但是想要进阶学习AI,减少AI认知焦虑的朋友;

本项目聚焦大模型技术全栈知识,涵盖训练、微调、推理、压缩等核心环节。重点介绍参数高效微调技术原理及实践,帮助开发者低成本实现大模型定制。提供分布式训练、推理优化、量化剪枝等关键技术解析,并配套完整学习资源包(含代码、教程)。内容包含:LLM训练/微调实战、分布式并行技术、推理框架优化、模型压缩方法(量化/剪枝/知识蒸馏)、AI编译器及基础设施等。附赠网盘学习资料和系统化进阶教程,助力从入门到精通大

SEBASTIAN RASCHKA博士分享了使用LoRA微调大模型的实践经验:LoRA通过低秩分解表示权重更新矩阵ΔW,显著降低计算和内存需求(如秩r=8时可节省830倍参数)。实验表明,LoRA微调效果稳定;QLoRA可节省33%内存但增加39%训练时间;为更多层启用LoRA可提升性能;超参数r和alpha需平衡调整;在单GPU上3小时即可微调7B参数模型。常见问题解答了数据集重要性、参数选择、

LoRA(低秩自适应)是一种高效微调大模型的技术,通过冻结预训练参数,仅训练低秩分解的增量矩阵来降低计算和存储成本。其核心步骤包括:冻结原模型参数、替换注意力层为低秩矩阵分解结构、仅训练增量参数、支持训练后权重合并。相比全量微调,LoRA可减少99%参数量,适用于LLM、ViT等大模型,在多任务切换和资源受限场景优势显著。该方法平衡了模型性能与计算效率,是大模型微调的重要解决方案。

《大模型算法岗面试指南:基础与进阶知识点解析》 当前秋招季中,大模型相关岗位成为热门,高薪职位层出不穷。本文系统整理了大模型算法岗位面试的核心问题及答案,分为基础篇和进阶篇。基础篇涵盖主流开源模型体系(Transformer、PyTorch Lightning等)、Prefix LM与Causal LM的区别、大模型涌现能力成因、LLM架构解析(基于Transformer)等15个关键技术点。进阶

复旦大学自然语言处理实验室推出国内首本大语言模型专著《大语言模型入门与实践》。该书基于300多篇论文的研究积累,系统讲解了大语言模型的基础理论、预训练技术、指令理解及应用评估等核心内容。全书共8章,既适合高校学生作为教材,也能满足不同层次读者的学习需求。该书特别注重实践指导,详细分享了从数据构建到模型训练、微调、强化学习应用的全流程细节,填补了国内该领域的空白,为读者提供了权威全面的学习资源。








