登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍了在d.run算力云上安装沐曦显卡并配置llama factory的过程。首先修复了MCX500容器初始化报错问题,通过修改conda.sh文件防止自动激活base环境。随后下载并安装了沐曦专用的PyTorch 2.6版本及其相关组件,配置了必要的环境变量。最后完成了llama factory的安装和环境配置,并通过命令行验证了安装成功。整个过程涉及容器初始化修复、专业版PyTorch安装
你说"我喜欢上海" → 路由器判断:这话跟"地理"和"情感"相关 → 激活"地理专家"和"情感专家" → 他们加工后得出结论:"这人可能也喜欢大城市"的意思:派 8 个(或更多)"阅读理解小工"同时看这句话,每人关注不同方面,最后把结论拼起来——比一个人看更全面。模型脑子里一堆数字,有的特别大有的特别小,直接往下传会"数值爆炸"。:重复惩罚 → 已经说过的词扣分 → 别让模型"我喜欢上海,我喜欢上
站在企业数据工程师的角度看,真正的难点往往不是模型本身,而是让大模型理解企业内部复杂的数据语义以及数据关系。企业级 AI 数据智能应用的第一层能力,不应该是“让模型直接猜 SQL”,而应该是先把企业数据底座整理清楚。
本文介绍了一个基于Qwen2.5-0.5B模型的轻量化本地知识库问答系统实现方案。该系统支持TXT/PDF/DOCX多种文档格式,通过jieba分词实现关键词检索,结合Qwen2.5-0.5B进行本地化推理生成精准回答。文章详细阐述了系统架构、核心流程和关键技术实现,包括模型本地加载、多格式文档解析、关键词检索与问答生成等模块。该系统具有部署简单、数据安全、中文适配性强等特点,适合中小企业和个人开
本文分享了大模型面试中的技术问题及RLHF/DPO训练流程代码实现。面试问题涵盖项目经历、模型选型、部署优化、数据增强、评估策略等15个技术点。代码部分通过"道歉邮件"案例,对比演示了RLHF(SFT→RM训练→PPO)和DPO两种对齐方法:RLHF需要独立奖励模型,通过PPO优化策略;DPO则直接利用偏好数据优化策略模型,无需奖励模型。两种方法均基于PyTorch实现,包含完
牧马人本地推理引擎API使用指南,通过Python代理和HTML界面实现本地模型自动化工作流。核心步骤:1)硬件配置建议(显存要求);2)开启局域网访问并启动对话/生图模型;3)运行代理服务器脚本并配置网络类型;4)使用HTML界面生成分镜脚本并批量生图,支持手机端操作。该方案提供从文本到视觉素材的完整本地闭环,无需云端,保障隐私和低延迟。适用于ComfyUI等后续工作流处理,支持多设备协作。注:
return y。
大模型注意力机制正经历快速迭代。2022年Flash Attention通过工程优化解决内存瓶颈;2023年聚焦KV Cache优化,出现GQA等技术;2024年分化为KV压缩(如MLA)和架构革新(如Mamba)两条路线。未来趋势包括:动态混合注意力模式、注意力与记忆系统融合、硬件协同设计,以及跨模态统一注意力机制。注意力机制正从固定计算范式演变为自适应信息处理框架,核心目标始终是高效捕捉关键信
摘要: 深度学习开源知识库DeepBase为初学者提供系统化学习路径,整合Python/PyTorch基础、神经网络理论、CV/NLP核心技术及LLM前沿内容。该项目源于作者自学时遭遇的资料碎片化问题,现以完全开源形式分享,包含从张量操作到Transformer架构的完整知识体系,特别适合零基础入门者构建连贯认知。站点涵盖四大模块:工具栈(Python/PyTorch)、深度学习原理、CV/NLP
这一阶段评价的不是模型本身,而是数据与任务的质量:如果前期数据杂乱,任务边界不清,后续训出的模型跑分再高也不可信。数据质量:去重、去污染;标注一致性(常用一致率或 Cohen κ);垂直域的数据集(法律、医学等)往往没有现成试卷,要先定义合格的题目样本。任务定义:输出是离散类别、固定参考答案文本,还是开放生成?与后续评测的衔接:避免训练、公开榜、业务验收各说各话。对绝大多数普通用户, deepse
└─────────────────┘│ Runtime Services 启动│。├─ cronReconciliation│├─ 停止诊断心跳├─ 停 cron、停心跳。├─ 停 retained 插件清理│├─ 停定价刷新├─ 取消所有事件订阅。
【代码】【求助】Chatglm cpu 本地部署出错。
glm-4 联网搜索api测试
Dify 之前有介绍过。
在微调qwen-vl的时候,微调完成之后,模型也保存好了,但是用保存的模型进行推理的时候报错,看样子是找不到分词器tokenizer。
llama.cpp是一个大模型推理平台,可以运行gguf格式的量化模型,并使用C++加速模型推理,使模型可以运行在小显存的gpu上,甚至可以直接纯cpu推理,token数量也可以达到四五十每秒(8核16线程,使用qwen2.5-1.5b模型),另外,该平台几乎兼容所有主流模型。本文介绍了如何使用docker部署llama.cpp和llama.cpp的python绑定llama-cpp-python
前不久,Meta前脚发布完开源大语言模型LLaMA,随后就被网友“泄漏”,直接放了一个磁力链接下载链接。然而那些手头没有顶级显卡的朋友们,就只能看看而已了但是 Georgi Gerganov 开源了一个项目llama.cpp次项目的牛逼之处就是没有GPU也能跑LLaMA模型大大降低的使用成本,本文就是时间如何在我的 mac m1 pro 上面跑起来这个模型。
今天,在【NLP学习群】中,一位同学一下问了2个问题,相信大家在微调时也会遇到这样的问题,自己问题应该放在instruction、input、output哪个字段,用什么格式去训练呢?还有同学是几年前的老爷机/笔记本,或者希望大幅提升部署/微调模型的速度,我们应用了动态技术框架,大幅提升其运算效率(约40%),节省显存资源(最低无显卡2g内存也能提升),工众后台:“加速框架”;如果你还不知道该怎么
保姆级本地部署,金牌讲师级工具调用--基于全球10B以下最强LLM模型ChatGLM3-6B
这个问题尝试了很久,实际上是环境的问题,如果在训练过程中,将fp16设置为true+int8量化,那么是可以正常训练推理的,如果不设置int8量化就会报错。可以尝试改变peft的版本。
除英语和中文外,还接受过 27 种语言的数据培训显着提高编码和数学表现;Qwen2-7B-Instruct 和 Qwen2-72B-Instruct 的扩展上下文长度支持高达 128K 令牌更详细的benchmark建议去看官网blog。
Ollama支持在Modelfile中导入GGUF模型:创建一个名为Modelfile的文件, 使用带有要导入的模型的本地文件路径的“FROM”指令。在 Ollama 里创建模型运行模型从Ollama 库下载的大模型可以用prompt 自定义. 例如, 要自定义llama3创建Modelfile# 将参数设置为1[越高越有创意,越低越连贯]# 设置系统信息SYSTEM """""">>> hiHe
基于milvus的多模态检索,本文包含milvus安装使用、attu 可视化,完整指南启动 Milvus 进行了向量相似度搜索,利用CLIP模型进行多模态检索,附完整代码。
市场洞察:帮助企业了解消费者对其产品、品牌及竞争对手的看法和态度,及时掌握市场动态,为产品研发、市场营销和品牌建设提供决策依据。政策制定:了解公众对政策的反馈和需求,为政府制定更加科学、合理的政策提供参考,提高政策的针对性和有效性。内容管理:帮助平台更好地管理和规范用户生成的内容,打击不良信息和违规行为,营造健康、积极的网络环境。本项目旨在利用 Spark、Hive 和 Hadoop 等大数据技术
【代码】Qdrant 使用指南。
DeepSeekV4的HybridAttention架构通过分层记忆系统解决了百万Token上下文的核心瓶颈问题。该系统采用三级结构:SlidingWindow保留最近128个Token的原始KV作为短期精确记忆;CSA(Compressed Sparse Attention)每4个Token压缩为一条KV并建立索引系统,形成可检索的中长期记忆;HCA(Heavily Compressed Att
【摘要】本文介绍如何通过Herdsman本地推理引擎和TokenRouter工具,实现在ChatGPT(原Codex)中调用本地大模型,减少云端Token消耗并确保数据本地化运行。教程分六步:1)下载Herdsman并安装适合硬件配置的本地模型;2)安装TokenRouter调度引擎;3)选择智能/端侧/云端三种路由策略;4)可视化连接本地模型;5)一键配置ChatGPT;6)选择TokenRou
智能指针是C++标准库提供的类模板,用于自动化管理动态分配的内存资源。它们在对象生命周期结束时自动释放内存,从而有效防止内存泄漏,并帮助开发者编写更安全、更简洁的代码。C++11引入了包括unique_ptr、shared_ptr和weak_ptr在内的多种智能指针,每种都适用于不同的所有权语义场景。智能指针是现代C++编程中管理动态内存的基石。理解unique_ptr和shared_ptr的不同
其设计哲学强调代码的可读性和简洁性,使得初学者能够快速上手,同时为专业开发者提供了处理复杂项目的工具和框架。无论是数据分析、人工智能、Web开发还是自动化脚本,Python都能提供高效且灵活的解决方案,这正是它成为编程入门首选语言的重要原因。类(Class)是对象的蓝图,通过定义属性和方法封装数据与行为。Python的threading模块支持多线程,但由于全局解释器锁(GIL)的存在,多线程更适
nlp
——nlp
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net