登录社区云,与社区用户共同成长
邀请您加入社区
文章摘要 本章系统介绍了自然语言处理(NLP)的核心技术和发展脉络。首先阐述了文本预处理流程,包括清洗、分词、去除停用词等关键步骤,并提供了中英文处理的代码实现。重点讲解了词嵌入技术(Word2Vec、GloVe、FastText)的演进,以及从上下文无关表示到上下文相关表示(如BERT)的转变。同时介绍了语言模型从N-gram到神经网络的进化过程,深入分析了Seq2Seq、注意力机制和预训练-微
今日候选池 89 篇,硬过滤 + LLM 打分后通过评估 7 篇。
如何解决主流E2M1格式在FP4预训练中因几何不对称导致的系统性收缩偏差及训练不稳定问题?论文揭示了非均匀格式的收缩偏差根源,提出基于均匀网格的UFP4配方,实现了全路径RHT并显著提升训练精度。
DreamX-World-5B 推理涉及三个独立模型:问题: 和不支持 Windows,安装失败。修复: 中和直接调用无回退机制,在 Windows 下必定崩溃。方案:将导入和调用改为有回退机制的函数(内部自动降级到 )。文件:(2处调用)问题: 与新版 PyAV 不兼容, 报 TypeError。方案:替换为写入。文件:问题: 中层的权重维度为 768(,即 ),但推理代码因将设为 1,导致模型
本文介绍了从零开始构建生产级智能体(Agent)的完整流程。通过虚拟环境隔离依赖,使用配置文件和参数初始化实现环境切换,定义工具函数并组装智能体工作流,集成多工具链协同工作,并通过结构化日志监控执行过程。重点解决了依赖冲突、配置管理、工具链挂载和日志定位等实操问题,帮助开发者高效实现智能体在复杂场景中的自主决策与执行能力。
维度DeepSpeed 做了什么显存优化ZeRO 分片存储,消除冗余,节省 90%+ 显存训练加速3D 并行 + 混合精度 + 通信优化易用性基于 PyTorch 的轻量封装,只需改几行代码规模突破支持从单卡百亿到千卡万亿级模型训练简单来说,DeepSpeed 就是让大模型训练从"不可能"变成"可落地"的关键工具。像 GPT-3、BLOOM-176B 等知名大模型的训练背后,都有 DeepSpee
本文详细记录了在AMD Radeon Cloud单卡环境下,使用Qwen3-0.6B模型和LoRA方法微调明日方舟干员助手的过程。作者从环境配置(ROCm 6.x)、数据集构建(8,846条干员问答对)到模型训练(8-15分钟完成)进行了完整说明,重点展示了小模型(0.6B参数)通过LoRA高效微调(仅训练0.22%参数)实现专业化任务的能力。最终得到的助手不仅能准确回答干员属性、技能等游戏知识,
安装好进入后会让你进行设置,点击配置本地模型,选择模型提供方为OllamaAPI,模型选择为你下载的对应模型。复制右侧代码ollama run deepseek-r1:7b,直接win+R,cmd进入命令窗口,粘贴刚才复制的代码,回车即开始下载模型。注意,这里第一次是没有东西的,需要新建,变量名为OLLAMA_MODELS,值为刚才自己新建的ollamaimagers路径粘贴进去。尽管我们更改了O
Ollama 是一个大语言模型管理工具(开源项目),专注于在上运行、部署和管理大型语言模型(LLMs)。它的目标是让用户能够轻松地在自己的设备(如个人电脑或服务器)上运行各种开源大模型(如 LLaMA、Mistral、Gemma 等),而无需依赖云端服务。
Ollama 在Windows Server中部署
作为一名热心肠的互联网老兵,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。对于没有安装过Ollama的朋友,可以直接进入Ollama的官网: https://ollama.com/ 进行安装和下载。如果要下载对应的模型,可以ollama pull llama3从Ollama的模型注册表中拉取指定的
随着人工智能领域的不断发展,这一观念正在迅速改变。类似 LLama-Factory 等新工具的出现,使得微调过程更加便捷和高效。此外,现在还可以使用 DPO、ORPO、PPO 和 SFT 等技术进行微调和模型优化。更进一步说,大家现在可以有效地训练和微调如 LLama、Mistral、Falcon 等模型。
Llama3 通过深度学习技术,特别是基于 Transformer 架构的预训练模型,实现了对自然语言的高度理解和生成能力。它利用了海量的文本数据进行训练,从而能够捕获语言的复杂模式和规律,并在各种自然语言处理任务中展现出卓越的性能。本文详细介绍了如何实现本地部署该模型。
在LLM应用开发中,Transformers是底层基础库,用于模型微调和研究;vLLM是生产级推理引擎,优化并发性能;Ollama简化本地模型运行,适合开发调试;LlamaIndex专注数据连接,构建RAG系统。典型开发链路包括:用LlamaIndex处理数据,Ollama本地测试,Transformers微调,最终通过vLLM部署。选择工具时,建议本地开发用Ollama+LlamaIndex,生
用 AMD Radeon RX 7900 XTX 单卡,以 Qwen3-4B 为底座、LoRA 做参数高效微调,训练一个《绝区零》仪玄角色助手,再通过 vLLM 部署推理,配合 ChromaDB 向量检索和防 OOC 校验器,实现风格还原 + 知识准确 + 人设稳定。本文记录从环境配置、数据集构建、LoRA 微调、vLLM 部署到踩坑填坑的全流程,AMD ROCm 生态实战可复现。
大型语言模型(LLMs)通常对计算资源需求极高,需要大量的内存、计算能力和功耗才能高效运行。量化技术通过将权重和激活值从 16 位浮点数降低到更低的比特率(如 8 位、4 位、2 位),从而实现显著的加速和内存节省,同时还支持更大的 batch size。现有的低精度推理方案在小 batch size 场景下表现良好,但存在以下问题:当 batch size 增大时,性能下降对量化类型的限制,例如
python-ollama
因为dify被装在了docker中,它的localhost和ollama的是不一样的。我们又说了怎么安装ollama,现在说说怎么把ollama对接到Dify平台上。上回说道,为了简便,我们可以把在线的模型的API,接入到我们的Dify平台上。👆上面这张图,便是一个错误的示范,也是一个最大的坑。还是在模型供应商这里,我们可以看到ollama。
在使用SGLang部署Qwen3 Reranker系列模型时,由于模型架构差异会出现API不兼容问题。本文将基于生成式架构的Qwen3ForCausalLM转换为二分类模型Qwen3ForSequenceClassification,通过提取yes,no token的权重向量构建新的分类器,最终使用classify接口实现模型部署。该方法借鉴了VLLM的解决思路,成功实现了SGLang部署Qwen
本文简要介绍下基于LLaMA-Factory的llama3 8B模型的微调过程。
LLaMA Factory是一款开源低代码大模型微调框架,集成了业界最广泛使用的微调技术,支持通过Web UI界面零代码微调大模型,目前已经成为开源社区内最受欢迎的微调框架。