登录社区云,与社区用户共同成长
邀请您加入社区
向量数据库是 RAG(检索增强生成)系统的核心基础设施。当你的知识库从几千条增长到百万、千万级时,向量检索的性能瓶颈就会彻底拖垮你的 AI 应用响应速度。Faiss:Meta 出品的纯库,轻量但功能有限Milvus:云原生向量数据库,功能完整,生产级首选Qdrant:Rust 写的新一代向量库,性能出色,API 友好本文将从原理对比 → 性能实测 → 部署配置 → 调优指南四个维度,帮你做出最适合
本文将会带领大家使用 LLaMA Factory 的 Agent Tuning 功能,使用单张 GPU 在 3 小时内训练出自己专属的 LLM Agent。
从头开始训练一个模型,所有模型的参数都会被初始化并根据训练数据进行更新。最初使用的就是直接通过transformers 对模型训练。
RAG(检索增强生成)是一种将外部知识库与大语言模型动态结合的关键技术,其核心原理是通过向量检索精准召回相关文档片段,再交由LLM生成准确、可溯源的回答。该技术显著提升模型在专业领域、私有数据场景下的事实性与可控性,避免幻觉,降低微调成本。当前主流实践已转向轻量化本地部署:借助Ollama提供的标准化模型管理与API服务,搭配Llama3等开源高质量基座模型,可在消费级硬件上快速构建端到端RAG系
RAG(检索增强生成)作为大模型落地的关键范式,其核心在于解耦长文本存储与精准语义理解。当主流模型宣称支持千万级上下文时,实际推理中仍面临注意力失焦、指代消解失败和幻觉加剧等固有瓶颈——这恰恰凸显RAG不可替代的技术价值:通过向量检索将海量信息压缩为高相关性片段,交由LLM进行轻量、可控、可解释的生成。本文聚焦工程可落地的RAG实现路径,深度融合Groq低延迟推理与mxbai-embed-larg
RAG(检索增强生成)是一种将大语言模型与外部知识库动态结合的关键技术,其核心原理在于通过向量检索精准定位相关上下文,再交由LLM生成可信回答。技术价值体现在可控性、数据隐私保障与低延迟响应,广泛应用于企业知识库问答、技术文档智能检索、标准规范辅助审查等场景。本文聚焦DeepSeek-R1这一强推理模型在本地环境的落地实践,深入解析Ollama如何通过Q4_K_M量化压缩、Flash Attent
生成式AI已从概念走向产线核心,但技术选型、模型调优与合规落地常陷认知模糊——根源在于缺乏对Transformer数学本质、架构演进逻辑与工业级约束的系统理解。本书单聚焦‘可证伪性’‘上下文锚定’和‘代际穿透力’三大支点,覆盖LLM底层矩阵分解、MoE/SSM等新架构适用边界、DPO训练稳定性边界、量化部署帕累托前沿及AI水印与偏见治理等关键技术价值。面向算法工程师、MLOps与产品负责人,提供从
本地知识库是企业与个人实现私有化AI问答的核心基础设施,其本质是将非结构化文档通过嵌入(Embedding)向量化,并结合大语言模型完成语义检索与生成式回答。技术原理涵盖文本分块、向量存储、RAG架构协同及模型轻量化部署。该方案显著提升数据安全性与响应实时性,避免公网API调用延迟与隐私泄露风险,广泛适用于法律合同解析、内部技术文档问答、医疗科研资料检索等场景。本文基于Ollama本地运行Llam
本文介绍了如何在星图GPU平台上自动化部署Qwen3-Embedding-4B镜像,快速构建高性能文本嵌入服务。依托SGlang推理框架,该镜像可高效支持语义搜索、RAG知识库构建及多语言文档召回等典型场景,显著提升AI应用的检索精度与响应速度。
大语言模型微调已从学术实验走向工程落地,参数高效微调(PEFT)成为消费级GPU上的主流范式。Llama-Factory并非简单封装,而是围绕LoRA微调、动态梯度检查点、量化感知训练与RAG-ready导出构建的闭环工具链。其核心价值在于解决显存瓶颈、模板对齐、Ollama兼容性等真实生产问题——尤其在中文RAG场景中,通过强制匹配llama3专用chat_template与RoPE配置,显著提
在检索增强生成(RAG)系统中,大语言模型(LLM)的幻觉问题一直是影响其可靠性的核心挑战。其原理在于,模型在生成答案时可能忽略或曲解提供的参考文档,转而依赖自身训练数据中的记忆进行“编造”。为了解决这一问题,业界提出了幻觉感知微调技术,通过在模型生成主干旁并联一个轻量级检测头,实时分析模型内部状态,为每个生成token输出一个“可归因于上下文”的置信度分数。这项技术的核心价值在于,它不仅能在推理
RAG(检索增强生成)和LoRA(低秩自适应)是当前大模型落地的核心技术路径,其原理分别涉及向量检索一致性保障与微调过程中的梯度稳定性控制。技术价值在于降低AI应用开发门槛、提升训练鲁棒性并实现企业级工程集成。典型应用场景包括轻量级本地知识库构建、资源受限环境下的模型微调,以及Java生态中AI能力的标准化注入。本文基于raglite、unsloth和spring-ai-alibaba三个真实Gi
本文分析vLLM作为RAG系统生成引擎的可行性,重点探讨其PagedAttention和连续批处理技术如何解决长上下文、高并发与显存效率难题,并评估集成成本、性能优势及适用边界,论证其为何成为RAG推理层的理想选择。
本文介绍了如何在星图GPU平台上自动化部署Flowise镜像,结合vLLM显著提升GPU算力利用率,快速构建高性能RAG知识库问答系统。用户可通过可视化拖拽方式,5分钟内搭建支持多并发、低延迟的智能客服或企业知识检索应用,无需编写代码即可上线生产环境。
Ollama是一款专注于简化大型语言模型本地部署和运行的开源框架,基于Go语言实现,支持跨平台运行,并以“开箱即用”为核心理念,适合个人开发者和轻量化场景。
本文介绍了如何在星图GPU平台上自动化部署通义千问3-Embedding-4B-向量化模型镜像,快速构建企业级语义搜索服务。依托平台能力,用户可一键完成vLLM+Open WebUI联合部署,典型应用于技术文档知识库的自然语言精准检索,如从百页Kubernetes手册中秒级定位‘会话保持’相关内容。
本文深入探讨如何利用vLLM推理加速镜像显著提升RAG系统的响应速度与并发处理能力。通过PagedAttention和连续批处理技术,vLLM可大幅提高显存利用率和吞吐量,实测性能较传统方案提升达8倍以上,并支持OpenAI兼容接口,实现低延迟、高可用的生产级部署。
vLLM 是“走向工程 / 服务 /高负载 /规模化”的桥梁,而 Ollama 更偏向“个人 / 原型 / 轻量 /易上手”。
本文介绍了如何在星图GPU平台上自动化部署Flowise镜像,结合vLLM加速实现高性能本地大模型推理。通过可视化拖拽方式,用户可快速构建RAG知识问答工作流,典型应用于企业内部制度查询、客服文档智能检索等场景,显著提升响应速度与并发能力。
本文将探讨于2024年3月21日发布的LLama-Factory,并学习如何使用 DigitalOcean 旗下的 Paperspace平台对 LLama 3 进行微调。为了完成我们的任务,我们将使用 NVIDIA A4000 GPU,它被认为是功能最强大的单插槽 GPU 之一,能够无缝集成到各种工作站中。
Llama-factory是一种常用的模型微调框架,之前一直知道有这样一款产品,但是没有尝试过。本文记录了本地基于Llama-factory的模型微调过程,方便后续进行复盘。
LLaMA-Factory项目的目标是整合主流的各种高效训练微调技术,适配市场主流开源模型,形成一个功能丰富,适配性好的训练框架。
本教程就以Llama3-8B-Instruct开源模型为模型基座,通过开源程序LLaMA-Factory来进行中文的微调,提高Llama3的中文能力!