登录社区云,与社区用户共同成长
邀请您加入社区
向量数据库是 RAG(检索增强生成)系统的核心基础设施。当你的知识库从几千条增长到百万、千万级时,向量检索的性能瓶颈就会彻底拖垮你的 AI 应用响应速度。Faiss:Meta 出品的纯库,轻量但功能有限Milvus:云原生向量数据库,功能完整,生产级首选Qdrant:Rust 写的新一代向量库,性能出色,API 友好本文将从原理对比 → 性能实测 → 部署配置 → 调优指南四个维度,帮你做出最适合
本文系统性地解析了大模型(LLM)行业的发展现状、职位分类、核心技术知识图谱,并提供了候选人评估与面试提问技巧,最后还介绍了大模型人才寻访策略。文章涵盖了国内外大模型发展现状、产业链构成、人才需求、核心技术演进、职位详细解读、评估面试技巧以及人才寻访策略等多个方面,为猎头和算法候选人提供了全面的大模型职位知识参考。 目录包括:大模型行业全景、职位分类、各职位详细解读、核心技术知识图谱、候选人评估与
作为一名热心肠的互联网老兵,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。对于没有安装过Ollama的朋友,可以直接进入Ollama的官网: https://ollama.com/ 进行安装和下载。如果要下载对应的模型,可以ollama pull llama3从Ollama的模型注册表中拉取指定的
本文将会带领大家使用 LLaMA Factory 的 Agent Tuning 功能,使用单张 GPU 在 3 小时内训练出自己专属的 LLM Agent。
从头开始训练一个模型,所有模型的参数都会被初始化并根据训练数据进行更新。最初使用的就是直接通过transformers 对模型训练。
摘要:本文详细介绍了在配备Nvidia RTX 5090 GPU的服务器上部署Qwen3.5-27B大模型的全过程。内容包括安装miniconda、配置清华镜像源、安装Nvidia驱动和CUDA工具包、部署vLLM框架等关键步骤。vLLM框架凭借PageAttention算法和分布式推理能力,显著提升了大模型推理效率。文章还提供了docker-compose部署方案,并展示了32GB显存的测试结果
今天看到了 @游凯超 大神分享的 游凯超:我与vLLM的2024,感受颇多,大模型推理无疑是 2024 年大模型非常重要的一个细分领域,也诞生了非常多优秀的工作,vLLM,sglang,lmdeploy 等开源社区更是其中翘楚。vLLM 作为大模型推理领域现象级的开源项目,从开源伊始便收获无数 star,形成了庞大且活跃的社区,每天新的 issue 和 pull request 不计其数。
大模型技术发展到现在,企业想要真正利用大模型做些事情,一定需要懂得大模型微调的过程。注意,这里说的是过程,而不是原理,专业技术人员才需要懂原理,普通用户只要懂过程就可以完成对大模型的微调。
LLaMA Factory微调后的大模型Chat对话效果,与该模型使用vLLM推理架构中的对话效果,可能会出现不一致的情况。
LLaMA-Factory 是一个开源项目,它提供了一套全面的工具和脚本,用于微调、提供 LLaMA 模型并对其进行基准测试。LLaMA(大型语言模型适应)是由 Meta AI 开发的基础语言模型的集合,在各种自然语言任务中表现出强大的性能。
介绍了在网络安全知识图谱场景下,如何基于 LLM(大语言模型)实现自然语言查询图数据库的系统设计。系统采用 四阶段 Pipeline 架构,将用户的自然语言问题转化为可执行的 Gremlin 查询语句,并通过 自修正机制 保证查询的准确性。同时实现了 MCP Server 标准协议集成、多轮会话上下文管理等高级能力。
对于AI Agent而言,没有记忆,就没有真正的智能。记忆工程(Memory Engineering)将成为LLM应用开发的必备技能。
本文将从安装到运行,详解关键操作、常见坑点,以及本地 LLM 带来的独特优势。不管你是 AI 发烧友,还是刚入门的好奇者,这份实用指南都能让你快速上车。