
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文是一篇详细指导如何在LangChain中调用不同大模型的教程,主要面向新手开发者。文章首先区分了LangChain中的两类模型:LLM文本模型和ChatModel对话模型,并指出其关键区别在于是否需要使用.content获取输出。 文中提供了多种主流模型的原生调用方法,包括DeepSeek、通义千问、OpenAI、Ollama本地模型和vLLM本地推理服务,对每个模型的关键参数进行了详细解释。
在大模型与强化学习交叉的技术领域面试中,PPO(Proximal Policy Optimization)和GRPO这两种算法常常成为面试官考察候选人对强化学习算法理解深度与工程实践能力的重点。今天,我们就从面试高频问题出发,深入剖析二者的核心差异。

本报告对当前主流AI大模型在纯文本理解场景下的性能进行系统评估,涵盖DeepSeekV4、GLM-5、Qwen3.5等10款模型。DeepSeekV4-Pro以1M上下文、88.7 MMLU得分成为开源天花板;GLM-5在AAIntelligenceIndex获50分,与ClaudeOpus4.5同级;Qwen3.5-397B以91.5 MMLU得分居开源第一。报告建议:追求性能选DeepSeek
Linux root磁盘不足应急清理方案:当服务器告警磁盘空间100%时,可通过三步快速释放空间。1)应急清理:安全删除yum缓存(yum clean all)、系统日志(rm -rf /var/log/.gz)和临时文件(/tmp/);2)深度清理:移除无用依赖包(yum autoremove)、Python缓存(pip cache purge)和特定大文件;3)长期维护:设置日志大小限制(jo
DeepSeek-V3通过“MoE架构+MLA注意力+负载均衡+混合精度训练+MTP生成”的技术组合,在671B参数规模下实现了“能力强、速度快、成本低”的平衡;而DeepSeek-R1则填补了“深度逻辑分析”的场景空白。二者形成互补,覆盖了通用任务与专业推理的需求。

在人工智能领域,大语言模型(LLM)已成为技术革新与应用落地的核心驱动力。从参数规模到训练技术,从基础架构到前沿研究方向,理解这些术语是掌握LLM技术的关键。本文将系统解析大语言模型的核心术语,涵盖模型规模、训练方法、优化技术、部署实践及前沿研究方向,为从业者构建完整的知识结构。

阿里通义千问Qwen3.5-Plus技术测试报告显示,该模型采用稀疏MoE、混合注意力和原生多模态三大创新架构,397B总参数仅激活17B,实现高效部署。实测验证其性能超越GPT-5.2等闭源模型,256K长文本处理速度提升19倍,多模态识别准确率达98%,Agent任务完成率100%,且百万Token成本仅0.8元。报告证实Qwen3.5在架构效率、多模态融合和场景落地方面表现优异,为中小企业提

Qwen3以混合推理架构与多语言能力重新定义了开源大模型性能边界,而硅基流动平台通过优化AI基础设施,显著降低了大模型的应用门槛与成本,两者共同推动了生成式AI技术的普及与商业化落地。本文将采用硅基流动+Cherry studio的方式免费尝鲜Qwen3模型。

Ollama 是一个开源的本地化大模型运行平台,支持用户直接在个人计算机上部署、管理和交互大型语言模型(LLMs),无需依赖云端服务。而且其混合推理的特性也使得CPU和GPU的算力能够充分被使用,能够在同等配置下跑更大的模型,是非常适合个人学习使用的平台。本篇将详细介绍Ollama在各种平台上的详细安装过程以及应用。

循环神经网络(RNN)为处理序列数据提供了基础框架,但其在长序列处理上的局限性促使了长短期记忆网络(LSTM)和门控循环单元(GRU)的诞生。LSTM 通过精细的门控机制和细胞状态,有效地解决了梯度问题,能够处理复杂的长序列数据。GRU 则在保持一定性能的同时,通过简化结构提高了训练效率。在实际应用中,我们需要根据具体任务的特点和需求,选择合适的模型。希望通过本文的介绍,你对 RNN、LSTM 和








