登录社区云,与社区用户共同成长
邀请您加入社区
本文详细介绍了如何在本地使用Ollama部署和运行DeepSeek系列大模型。从Ollama的跨平台安装、DeepSeek不同参数版本的选择与硬件匹配,到多模型管理、存储路径优化及API调用等高级技巧,提供了一套完整的本地AI部署实战指南,帮助用户构建私有、高效且安全的AI应用环境。
文章详细介绍了在Ubuntu 22.04系统上使用8×NVIDIA H20 GPU部署DeepSeek大模型的环境准备工作,包括安装GPU驱动、CUDA、nvidia-fabricmanager以支持NVLink通信,以及配置Docker和NVIDIA Container Toolkit环境。最后通过ModelScope下载DeepSeek-R1-Distill-Qwen-32B模型权重,为后续使
本文介绍RLTR智能体训练框架,通过解耦训练过程和引入基于工具使用完整度的奖励信号,解决了端到端多目标优化中的目标分配失衡与可验证数据稀缺问题。实验表明,该方法使智能体规划性能提升8%-12%,最终回答质量提升5%-6%。框架包含冷启动、工具使用完整度计算和多轮强化学习三个关键部分,为提升大模型智能体规划能力提供了新思路。
SpringAI简化大模型集成开发 摘要:SpringAI为Java开发者提供了便捷的大模型集成方案。通过添加Maven依赖和简单配置,即可快速接入DeepSeek等AI模型。代码示例展示了调用大模型的两种方式:同步调用和流式响应。当前企业应用更倾向于采用智能体模式而非直接训练大模型,数字化基础良好的企业将更快实现智能化转型。SpringAI的工具库已经相当完善,开发者可以基于此快速构建各类AI应
本文全面比较了DeepSeek-V3、OLMo 2、Gemma 3、Qwen3等主流LLM的架构创新,包括多头潜在注意力(MLA)、专家混合(MoE)、滑动窗口注意力、QK-Norm归一化和无位置编码(NoPE)等技术。这些优化在提升模型性能的同时,显著降低了计算和内存需求,为开发者提供了2025年LLM架构设计的宝贵参考,帮助理解大模型效率提升的关键方向。
文章详细介绍了RAG(检索增强生成)系统的构建原理与实现,通过"检索+生成"架构将外部知识库与大语言模型结合,减少模型幻觉和知识时效性问题。内容涵盖环境搭建、数据准备、向量检索和LLM生成等核心环节,使用Langchain框架、Chroma向量数据库和DeepSeek-R1模型提供完整代码实现,适合小白快速上手实践大模型应用。
文章介绍了基于DeepSeek大模型的开源农业专家系统Farm-RAG,该系统通过图像识别、智能灌溉、牲畜行为识别、农产品分级、生产规划、溯源报告、智能客服、基因数据建模等技术,实现了精准农业管理、生产流程优化、供应链管理和市场运营创新。系统已在多个农业场景中应用,显著提高了农业生产效率和产品质量,是农业智能化转型的重要工具。
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Lecture 11: Scaling laws 2
本文详细介绍了如何使用Modelscope平台下载Qwen模型,通过vLLM部署本地模型,并利用LLaMA-Factory工具进行微调。作者展示了微调前后的效果对比:原生Qwen模型在意图分类任务中准确率仅40%,DeepSeek V3为80%,而经过微调的小模型准确率高达98%,完全超过了DeepSeek V3。文章为开发者提供了完整的大模型微调流程,帮助提升特定任务下的模型性能。
通过LobeChat集成DeepSeek,可轻松打造专属AI助手。利用阿里云百炼或自建服务,免费获取API密钥并部署,支持R1等高性能模型,还能查看完整思考过程,实现高效对话与任务处理。
本文介绍如何通过LobeChat零代码集成DeepSeek大模型,实现安全、美观的类ChatGPT对话界面。利用OpenAI协议兼容性,用户仅需配置环境变量即可完成部署,适用于个人助手、团队知识库和教育等场景,兼具安全性与扩展性。
DeepSeek招聘揭示了AI时代产品人才新要求:需熟悉大模型技术栈,具备从0-1落地复杂项目经验。文章对比分析了产品经理与产品设计岗位区别,指出AI正替代部分界面设计工作,但奖励能将复杂系统转化为良好体验的人才。同时提供了全球QS100院校中HCI、Human-Centered AI等交叉专业的选校建议,帮助规划AI时代的产品技能发展路径。