登录社区云,与社区用户共同成长
邀请您加入社区
Q @ K.TQ @ K.T自动求导(Automatic Differentiation, Autograd)是深度学习框架的核心功能,它能够自动计算函数的梯度,无需手动推导和编写梯度计算代码。只跑一次前向(一张计算图),但是要从输出端执行≥2 次梯度回传就必须连续多次 backward + retain_graph=True。普通单 Loss 深度学习训练完全碰不到这个需求。info]- 训练循
2026年的大模型面试,早已不是简单的"背诵知识点",而是考察你的技术深度、工程能力、架构思维和对前沿趋势的把握。核心心法: 1. 从原理到实践:不仅要懂"是什么",更要懂"为什么"和"怎么做" 2. 从单点成体系:构建完整的技术栈认知 3. 从跟随到创新:紧跟技术前沿,培养独立思考能力最重要的是:保持对技术的热爱和持续学习的动力。AI领域变化太快,唯有不断进化,才能立于不败之地。如果说程序员已经
功能实现方式分片上传+ 并发控制断点续传服务端记录已上传分片 + 前端跳过秒传文件hash + 服务端比对进度条已上传分片数 / 总分片数这套方案已在我司多个项目中稳定运行,支持GB级文件上传。你可以根据自己的需求调整分片大小、并发数、重试策略。你在大文件上传中还遇到过什么坑?评论区交流。
大白话解释计算机是不认识汉字和英文的,它只认识数字。Embedding 就是把一段文字变成一串固定长度的数字(稠密向量)。你可以把它想象成在茫茫宇宙中给这段文字定了一个**“三维坐标”**。意思是相近的句子,在宇宙中的坐标也离得越近;意思八竿子打不着的句子,坐标离得十万八千里。底层原理详解数学本质:把离散文本映射为固定维度的稠密向量(Dense Vector)。训练目标:主流的 Embedding
工作经历不会写、简历投出去没回音?STAR法则(情境-任务-行动-结果)是把流水账变成战绩卡的核心公式。本文用具体对比案例展示如何用STAR改写技术岗、运营岗等工作经历,附面试90秒完整回答模板和三个最容易踩的坑。
阿里面试:RAG如何支撑800QPS 流量?RAG 如何高并发。说了QPS 限流+堆机器, 但面试挂了
本文介绍了vLLM如何通过PagedAttention技术解决大模型推理中的显存管理问题,并介绍了nano-vLLM这个简化版学习项目。PagedAttention通过显存块化与逻辑映射解决了内存碎片问题,实现了写时复制、前缀缓存和智能调度等优化,大幅提升显存利用率和推理吞吐量。nano-vLLM用约1200行Python代码实现了这些核心思想,是学习大模型推理加速的重要资源。
在人工智能领域,大语言模型(LLM)的应用日益广泛,选择合适的推理(部署)框架对实现高效、稳定的模型运行至关重要。Ollama和vLLM作为当下流行的LLM部署工具,各具独特优势与适用场景。本文将深入剖析二者的优缺点,并给出选型建议,同时附上它们的具体使用案例,以便读者更直观地了解其应用情况。
按官网要求,在部署vLLM之前首先要保证Python的版本在3.12及以上,gcc版本在12以上,并且一般需要安装Anaconda,用于做Python环境隔离,上述过程不再赘述。一、vLLM安装部署查看GPU显存nvidia-smi创建一个独立的虚拟环境并激活安装vLLM二、QwQ-32B模型下载从魔塔社区下载模型https://modelscope.cn/models/Qwen/QwQ-32B/
本文介绍了如何使用llama-factory进行Lora微调模型、部署模型以及通过Python调用API。首先,建议阅读官方文档和推荐教程,了解基本流程。安装步骤包括克隆仓库、安装依赖包,并建议从国内平台下载模型。通过可视化网页界面下载模型权重,并加载到显存中进行对话。微调模型时,需准备符合格式要求的数据集,并在dataset_info.json中注册。文末还提供了大模型AGI-CSDN的独家资料