登录社区云,与社区用户共同成长
邀请您加入社区
deepseek-v4-flash-0731-in-c 是一个纯 C99 + OpenMP 的大模型 CPU 推理引擎,可在不使用 GPU、CUDA、PyTorch和权重转换的情况下,直接加载原生 DeepSeek-V4-Flash-0731 284B-A13B 权重。本文给出环境要求、完整运行命令、实测 TTFT/TPOT,以及 MoE 专家流式读取、缓存、I/O 计算流水线和低比特算子优化的实
本文探讨了Agent从工具到伙伴的演变,分析了其核心技术特征和哲学意义。文章指出,Agent实现了人机交互范式的转变:从指令执行转向意图理解与协作。关键突破包括:1)模糊意图的精确解析能力;2)通过记忆系统构建身份连续性;3)上下文工程实现环境感知;4)任务分解的动态规划能力。这些特性使Agent具备类似人类伙伴的主动性和适应性,而不仅是机械执行工具。文章强调,高质量的上下文工程是提升Agent性
本文摘要:智能体检索流程分为召回(双塔向量模型初筛)、空结果过滤(阈值判断)和重排(Reranker精排)。传统NLP依赖分词/词袋模型,现代技术采用Transformer子词切分和稠密向量表征,显著提升语义理解能力。向量数据库通过ANN索引(如IVF/HNSW)实现毫秒级检索,但需结合阈值过滤和混合检索优化结果质量。相比关键词匹配,向量检索支持跨语言和语义泛化,但需处理多义性问题(如"Trans
本文介绍了一套基于Llama 3大模型的本地化部署与轻量微调完整方案。主要内容包括: 推理部署:使用Ollama实现零门槛本地API服务,详细对比了Ollama与vLLM的特性差异,并提供环境配置、模型拉取和OpenAI风格流式对话的工程实现代码。 轻量微调:通过LLaMA Factory框架实现低算力消耗的LoRA微调,对比分析了全量微调、局部微调和LoRA三种范式的参数更新量与显存需求,深入讲
这篇文章揭示了AI Agent与大语言模型(LLM)的本质区别,并详细解释了Agent的工作原理。核心观点包括: 大语言模型本质是无状态的文本处理函数,所有"记忆"都是通过客户端重传历史对话实现的,这导致对话成本呈平方级增长。 AI Agent是"大脑+手脚+循环"的系统,由三部分组成: 大模型作为决策核心 工具调用作为执行手段 循环机制实现持续交互 Agent的实际工作流程: ① 客户端维护对话
本文介绍了一种基于YAML+Python Factory模式的CrewAI最佳实践方案。主要内容包括: 推荐目录结构:按agent/tool分类,采用YAML配置文件 动态加载机制:通过config_loader.py实现YAML到Python对象的转换 核心实现: Agent配置使用YAML定义角色、目标等 Tool通过Python类实现具体功能 工厂模式动态加载配置和工具 扩展能力:支持sou
本文系统介绍了Python函数中的五种参数类型,重点解析了/和*两个特殊分隔符的作用。/前的参数必须位置传递,*后的参数必须关键字传递,两者之间的参数可自由选择传递方式。文章通过代码示例展示了参数分隔符的实际应用场景,如API设计和类方法定义,并总结了参数类型的设计目的:/保证向后兼容性,*提高代码可读性。最后提供了速查表和记忆口诀:"位置在前,关键字在后",帮助开发者快速掌握参数传递规则。这些语
H2HMem提出首个面向人-人交互场景的多模态记忆评测基准,包含7000+对话轮次、1000+图片和2000+QA对,覆盖双人/多人对话场景。该工作创新性地将记忆能力细分为9类任务(回忆/推理/应用三级),实验揭示当前系统的关键缺陷并非记忆容量不足,而是多模态对齐和说话人追踪能力的缺失。研究表明,多人对话会使记忆性能下降49%,凸显交互历史结构化建模的重要性,为超越传统RAG的记忆系统发展指明方向
《OpenKitty:Windows本地部署AI多智能体工具完整指南》 本文详细介绍在Windows系统部署OpenKitty单二进制AI多智能体工具的完整流程。该工具采用Go语言静态编译,无需复杂环境配置,支持DeepSeek、OpenAI等主流大模型API接入,具备多智能体协同调度和流水线任务编排能力。部署过程包含:下载30MB左右的单文件程序包、处理系统安全警告、通过本地Web界面配置API
在多用户共享记忆环境中,一个好的 Agent 不仅要有用,还要知道什么该说、什么不该说、什么已经被要求遗忘。
本文介绍了在d.run算力云上安装沐曦显卡并配置llama factory的过程。首先修复了MCX500容器初始化报错问题,通过修改conda.sh文件防止自动激活base环境。随后下载并安装了沐曦专用的PyTorch 2.6版本及其相关组件,配置了必要的环境变量。最后完成了llama factory的安装和环境配置,并通过命令行验证了安装成功。整个过程涉及容器初始化修复、专业版PyTorch安装
你说"我喜欢上海" → 路由器判断:这话跟"地理"和"情感"相关 → 激活"地理专家"和"情感专家" → 他们加工后得出结论:"这人可能也喜欢大城市"的意思:派 8 个(或更多)"阅读理解小工"同时看这句话,每人关注不同方面,最后把结论拼起来——比一个人看更全面。模型脑子里一堆数字,有的特别大有的特别小,直接往下传会"数值爆炸"。:重复惩罚 → 已经说过的词扣分 → 别让模型"我喜欢上海,我喜欢上
站在企业数据工程师的角度看,真正的难点往往不是模型本身,而是让大模型理解企业内部复杂的数据语义以及数据关系。企业级 AI 数据智能应用的第一层能力,不应该是“让模型直接猜 SQL”,而应该是先把企业数据底座整理清楚。
本文介绍了一个基于Qwen2.5-0.5B模型的轻量化本地知识库问答系统实现方案。该系统支持TXT/PDF/DOCX多种文档格式,通过jieba分词实现关键词检索,结合Qwen2.5-0.5B进行本地化推理生成精准回答。文章详细阐述了系统架构、核心流程和关键技术实现,包括模型本地加载、多格式文档解析、关键词检索与问答生成等模块。该系统具有部署简单、数据安全、中文适配性强等特点,适合中小企业和个人开
本文分享了大模型面试中的技术问题及RLHF/DPO训练流程代码实现。面试问题涵盖项目经历、模型选型、部署优化、数据增强、评估策略等15个技术点。代码部分通过"道歉邮件"案例,对比演示了RLHF(SFT→RM训练→PPO)和DPO两种对齐方法:RLHF需要独立奖励模型,通过PPO优化策略;DPO则直接利用偏好数据优化策略模型,无需奖励模型。两种方法均基于PyTorch实现,包含完
牧马人本地推理引擎API使用指南,通过Python代理和HTML界面实现本地模型自动化工作流。核心步骤:1)硬件配置建议(显存要求);2)开启局域网访问并启动对话/生图模型;3)运行代理服务器脚本并配置网络类型;4)使用HTML界面生成分镜脚本并批量生图,支持手机端操作。该方案提供从文本到视觉素材的完整本地闭环,无需云端,保障隐私和低延迟。适用于ComfyUI等后续工作流处理,支持多设备协作。注:
return y。
大模型注意力机制正经历快速迭代。2022年Flash Attention通过工程优化解决内存瓶颈;2023年聚焦KV Cache优化,出现GQA等技术;2024年分化为KV压缩(如MLA)和架构革新(如Mamba)两条路线。未来趋势包括:动态混合注意力模式、注意力与记忆系统融合、硬件协同设计,以及跨模态统一注意力机制。注意力机制正从固定计算范式演变为自适应信息处理框架,核心目标始终是高效捕捉关键信
摘要: 深度学习开源知识库DeepBase为初学者提供系统化学习路径,整合Python/PyTorch基础、神经网络理论、CV/NLP核心技术及LLM前沿内容。该项目源于作者自学时遭遇的资料碎片化问题,现以完全开源形式分享,包含从张量操作到Transformer架构的完整知识体系,特别适合零基础入门者构建连贯认知。站点涵盖四大模块:工具栈(Python/PyTorch)、深度学习原理、CV/NLP
这一阶段评价的不是模型本身,而是数据与任务的质量:如果前期数据杂乱,任务边界不清,后续训出的模型跑分再高也不可信。数据质量:去重、去污染;标注一致性(常用一致率或 Cohen κ);垂直域的数据集(法律、医学等)往往没有现成试卷,要先定义合格的题目样本。任务定义:输出是离散类别、固定参考答案文本,还是开放生成?与后续评测的衔接:避免训练、公开榜、业务验收各说各话。对绝大多数普通用户, deepse
└─────────────────┘│ Runtime Services 启动│。├─ cronReconciliation│├─ 停止诊断心跳├─ 停 cron、停心跳。├─ 停 retained 插件清理│├─ 停定价刷新├─ 取消所有事件订阅。
【代码】【求助】Chatglm cpu 本地部署出错。
glm-4 联网搜索api测试
Dify 之前有介绍过。
在微调qwen-vl的时候,微调完成之后,模型也保存好了,但是用保存的模型进行推理的时候报错,看样子是找不到分词器tokenizer。
llama.cpp是一个大模型推理平台,可以运行gguf格式的量化模型,并使用C++加速模型推理,使模型可以运行在小显存的gpu上,甚至可以直接纯cpu推理,token数量也可以达到四五十每秒(8核16线程,使用qwen2.5-1.5b模型),另外,该平台几乎兼容所有主流模型。本文介绍了如何使用docker部署llama.cpp和llama.cpp的python绑定llama-cpp-python
nlp
——nlp
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net