登录社区云,与社区用户共同成长
邀请您加入社区
AMD宣布为Qwen3.8 27B大模型提供Day 0支持,开发者可在配备AMD Ryzen™ AI Max+处理器或Radeon™ AI PRO R9700显卡(32GB显存)的PC上直接运行该高密度模型。测试显示,该模型在AMD硬件上表现优异,最高生成速度达51.8 Tokens/秒。用户可通过llama.cpp或LM Studio等工具快速部署,AMD的Lemonade平台还简化了AI应用的
本文介绍了如何使用XTuner微调框架对Qwen2.5-1.5B-Instruct模型进行单卡QLoRA微调。主要内容包括:1)XTuner特性分析,突出其配置驱动、多卡支持及完整工具链优势;2)详细环境搭建步骤,包括Conda环境创建和依赖安装;3)模型下载与数据准备方法;4)核心配置文件修改指南,涵盖路径设置、超参数调整等关键环节。教程采用Alpaca格式数据,通过Python配置文件实现全流
本文以训练、推理、部署、应用、安全的逻辑串联起50+大模型核心概念,每个术语用三句话解释清楚是什么、干嘛用、怎么理解。涵盖基础概念(LLM、参数量、Token等)、训练相关(预训练、SFT、RLHF等)、推理相关(Temperature、Top-p/k等)、高级概念(Prompt Engineering、RAG等)、部署与优化、智能体与生态、底层架构与训练进阶、推理技术进阶、Prompt技术大全、
本文以阿里为例,探讨了AI大模型岗位的工作日常与职责划分。文章指出,真正参与大模型研发的工程师往往无暇分享经验,网络上的相关描述多来自实习生或离职人员。作者基于实习观察,将大模型岗位细分为五大方向:模型训练/预训练(解决训练稳定性问题、优化效率)、模型对齐/后训练(数据质量把控与评估)、推理优化/部署(降低延迟与成本)、应用开发/工程落地(业务场景适配)以及数据方向(基础设施建设)。其中,模型训练
本文详细介绍了在大模型应用中,向量检索的重要性及其工作原理。从基础概念到主流算法(如HNSW、IVF、PQ等),文章全面解析了不同算法的优缺点和适用场景,并通过Faiss和Qdrant的实例演示了如何实现精确和近似的向量检索。此外,还探讨了混合搜索策略、参数调优技巧以及评估检索效果的方法。对于想要提升RAG系统性能的程序员来说,本文提供了宝贵的实践指导和选型建议。
本文介绍了如何使用llama.cpp工具在普通电脑上运行AI大模型。只需8GB内存和50GB硬盘,即可本地运行低配AI模型,无需顶级显卡。文章详细提供了下载模型文件、安装运行(支持图形界面、命令行、Docker)、性能优化等步骤。低配电脑可用于写作、查资料等任务,数据私密且无需网络。◎ 一、你的电脑其实能跑大模型很多人觉得“跑AI大模型必须有顶配显卡”,其实不是。2026年的开源生态已经完全变了:
本文系统性地解析了大模型(LLM)行业的发展现状、职位分类、核心技术知识图谱,并提供了候选人评估与面试提问技巧,最后还介绍了大模型人才寻访策略。文章涵盖了国内外大模型发展现状、产业链构成、人才需求、核心技术演进、职位详细解读、评估面试技巧以及人才寻访策略等多个方面,为猎头和算法候选人提供了全面的大模型职位知识参考。 目录包括:大模型行业全景、职位分类、各职位详细解读、核心技术知识图谱、候选人评估与
2026年大模型行业的竞争,早已不是“会不会用AI”的竞争,而是“能不能落地、能不能优化、能不能解决行业问题”的技术落地竞争。这套五阶段学习路线,从基础到进阶、从理论到实战、从入门到深耕,完整覆盖了大模型学习的核心路径。零基础人群可快速入门建立认知,初级开发者可完善技术体系、突破技术瓶颈,在职工程师可深耕高阶能力、实现职场进阶。坚持阶梯式学习、聚焦实战落地、持续迭代沉淀,就能真正掌握大模型核心能力
量化是无损的,直接 INT4 部署"只能拿 **50 分**;讲清 **分场景掉点 + 自己回归集测端到端**,才到 **90 分**。
随着人工智能领域的不断发展,这一观念正在迅速改变。类似 LLama-Factory 等新工具的出现,使得微调过程更加便捷和高效。此外,现在还可以使用 DPO、ORPO、PPO 和 SFT 等技术进行微调和模型优化。更进一步说,大家现在可以有效地训练和微调如 LLama、Mistral、Falcon 等模型。
微调模型涉及调整预训练模型或基础模型的参数,这些参数可用于特定任务或数据集,可以提高模型的性能和准确性。这个过程涉及向模型提供新数据并修改其权重、偏差和某些参数。通过这种方式,可以让这个新模型可以在新任务或数据集上获得更好的表现,而无需为了新任务或数据从头开始开发一个模型,从而节省时间和资源。通常,当创建新的大语言模型(LLM)时,它会在大量文本数据上进行训练,这些数据可能包含潜在的有害的数据。在
摘要:本文详细介绍了在配备Nvidia RTX 5090 GPU的服务器上部署Qwen3.5-27B大模型的全过程。内容包括安装miniconda、配置清华镜像源、安装Nvidia驱动和CUDA工具包、部署vLLM框架等关键步骤。vLLM框架凭借PageAttention算法和分布式推理能力,显著提升了大模型推理效率。文章还提供了docker-compose部署方案,并展示了32GB显存的测试结果
LLaMA Factory是一款开源低代码大模型微调框架,集成了业界最广泛使用的微调技术,支持通过Web UI界面零代码微调大模型,目前已经成为开源社区内最受欢迎的微调框架。
近年来,大语言模型(LLM)在自然语言处理(NLP)领域取得了突破性进展。然而,直接训练或微调这些模型往往需要昂贵的计算资源和复杂的工程实现,这使得许多研究者和开发者在落地应用时面临困难。为此,开源社区涌现出了一系列面向大模型的高效训练与推理框架,前面我们介绍了LangChain,vLLM,PEFT,TRL,今天我们来看一下 LLaMA Factory 。
本文系统梳理了当前主流的大语言模型推理部署框架,包括vLLM、SGLang、TensorRT-LLM、Ollama和XInference等。从核心技术、架构设计、性能指标和适用场景等维度进行对比分析:vLLM采用PagedAttention和ContinuousBatching技术,显存利用率达95%以上,适合高并发企业应用;SGLang的RadixAttention技术在多轮对话场景下吞吐量比v
不得不感叹AI的发展真是太快了,各行各业都在被AI影响着!前段时间我跟了一个央企的AI项目,他们的需求很简单就是要做一个AI应用平台,目的就是要AI办公提效。这个项目的驱动也很有意思,是由上及下的。我猜测,应该是公司大领导为了响应上面,急于做出一些“成绩”。至于这个“成绩”是否真正能产生效益先不管,至少表面工作要做到位!这是态度问题!按理说,央企的项目,我是没机会参与的,但就因为他们着急落地,所以
vLLM 原本是为自回归文本大语言模型(LLM)服务的框架,现已通过 vLLM-Omni 升级,扩展到支持文本、图像、视频和音频模型的服务,所有功能集成在一个统一框架中。同时,它还支持扩散模型,实现快速并行生成。该项目完全开源,帮助开发者更高效地构建多模态 AI 应用。
文章详细对比了Ollama和vLLM两大LLM框架,帮助开发者选择合适工具。Ollama适合本地测试、原型开发和隐私敏感项目,简单易用;vLLM专为高吞吐量生产环境设计,性能更优。从性能、使用场景、部署步骤、故障处理等多方面进行分析,提供详细的安装配置指南,帮助开发者从Ollama平稳过渡到vLLM,构建高效的大模型应用。
在人工智能领域,大语言模型(LLM)的应用日益广泛,选择合适的推理(部署)框架对实现高效、稳定的模型运行至关重要。Ollama和vLLM作为当下流行的LLM部署工具,各具独特优势与适用场景。本文将深入剖析二者的优缺点,并给出选型建议,同时附上它们的具体使用案例,以便读者更直观地了解其应用情况。
vLLM 是一个快速且易于使用的大语言模型推理和部署库,最初由加州大学伯克利分校的 Sky Computing Lab 开发,现已发展为一个由学术界和工业界共同贡献的社区驱动项目。核心优势:持续批处理:内存效率提升,吞吐量最高 23 倍提升量化支持:GPTQ、AWQ、INT4/8、FP8 等多种格式并行计算:张量/流水线/数据/专家并行,支持多 GPU 扩展生态兼容:HuggingFace 集成,
私有部署大模型选型指南:Ollama vs. vLLM,谁是你的最佳选择?
如果对比过 vllm 进行大模型推理 和 直接调用模型generate 就会知道 vllm可以让推理速度比直接调用模型generate快2-4倍。那问题来了,?
在大语言模型技术快速迭代的浪潮中,数据安全与定制化需求推动着私有化部署成为企业和开发者的重要选择。Ollama 和 vLLM 作为两款备受关注的大语言模型部署和推理开源框架,各有千秋。接下来,我们将从多个关键维度对二者进行深度剖析,为你的私有化部署选型提供全面参考,并分享实用的实战经验与避坑技巧。
LLaMAFactory是一个高效易用的大型语言模型训练与微调平台,支持上百种预训练模型的无代码本地微调。该平台提供多种训练算法(如增量预训练、指令监督微调)、运算精度(16比特全参微调、QLoRA等)和推理引擎(Transformers、vLLM)。主要功能包括:基于LoRA/QLoRA技术的高效微调(可减少97%以上参数量)、多模态训练支持、以及完整的微调流程(从模型选择、数据加载到训练评估与
想在你的 Mac Mini M4 上体验 LLaMA-Factory 的强大功能,进行大模型微调和训练吗?本篇文章为你准备了详细的环境配置教程,强烈建议使用 Conda 来管理你的 Python 环境,避免各种潜在的依赖冲突。跟着以下步骤,一步步搭建你的 LLaMA-Factory !
本文介绍了使用LLaMA Factory进行微调的步骤,包括环境搭建、数据准备、参数配置、训练和效果评估等,最终成功微调模型并使用Ollama部署,提升了模型表现,达到了预期的效果。有一点感受是跟之前接触的安全实验不太一样:大多数的安全实验都是我打了这个Payload,就一定会出现确定的结果,不管是弹计算器还是反弹Shell,一切都是确定的。而大模型的训练往往充满了玄学成分,可能需要多实验几次才知