logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

如何让 Ollama 模型始终驻留显存?高效调用 AI 推理服务的秘诀!

本文介绍如何通过Ollama的keep_alive参数优化本地大语言模型部署效率。默认模型5分钟自动卸载导致重复加载损耗性能,可通过API参数(如"24h"或"infinite")或环境变量OLLAMA_KEEP_ALIVE实现模型常驻显存。详细说明Linux系统下systemd服务的配置方法,并提醒注意显存容量与多模型场景的资源管理。该方案可显著减少加载延

#人工智能#Ollama
阿里通义千问重磅发布Qwen3-Coder:480B超大规模代码模型,支持256K上下文,AI编程进入“智能体”时代!

阿里通义实验室推出4800亿参数Qwen3-Coder系列AI编程模型,采用混合专家架构(MoE),支持256K上下文并可通过YaRN扩展至100万tokens。该模型在7.5万亿token数据上训练,代码占比70%,具备自主规划、工具调用等智能体能力,刷新开源模型记录。提供Qwen Code、Claude Code等多种集成方案,支持OpenAI兼容API调用。Qwen3-Coder标志着AI编

LangChain 1.0 智能体开发实战全栈教程:从入门到企业级应用

本教程是一套 从零到一、从理论到实战、从单机到企业级 的完整学习体系,旨在帮助开发者系统掌握 LangChain 1.0 框架的核心能力,特别是如何构建、部署和管理具备自主感知、推理、行动能力的智能体(Agent)系统。

文章图片
第二篇:LangChain 1.0 模块化架构与依赖管理

通过本篇学习,你已经掌握了 LangChain 1.0 模块化架构的核心思想和各包的具体职责。理解分层架构core→主包→厂商包/社区包→classic的清晰分层掌握各包定位:每个包都有明确的职责和使用场景遵循最佳实践:生产环境优先使用厂商包,利用实现灵活性规划迁移路径:为旧版本用户提供平滑的升级体验。

文章图片
#人工智能
Fun-CosyVoice 3.0:新一代LLM语音合成模型深度解析

Fun-CosyVoice 3.0是一款基于大语言模型的零样本多语言语音合成系统,在0.5B参数量下实现了卓越性能。它支持9种语言和18+种中文方言,具备跨语言语音克隆能力,音色相似度达78%(中文测试集)。创新功能包括发音修补、智能化文本正则化和150ms低延迟流式处理。通过强化学习优化,内容准确率(中文CER)提升至0.81%,超越多个更大参数模型。适用于多语言内容创作、实时交互系统等场景,代

#人工智能
一站式大模型微调与部署利器:ms-SWIFT 全面解析

ms-SWIFT是ModelScope推出的高效大模型微调与部署框架,支持450+大语言模型和150+多模态模型的全流程处理。该框架提供LoRA、QLoRA等多样化微调策略,显著降低计算成本,并支持分布式训练与推理加速。其特色包括多模态任务覆盖、用户友好界面,以及适用于不同算力场景的优化方案,是科研和商业落地的理想工具。

文章图片
极速蒸馏实践:基于 Unsloth 与 LoRA 技术蒸馏 DeepSeek-R1-Distill-Qwen-1.5B 模型

摘要 本文介绍了使用Unsloth和LoRA技术对DeepSeek-R1-Distill-Qwen-1.5B模型进行高效知识蒸馏的方法。通过结合Unsloth的优化训练和LoRA的低秩适配,实现了3-5倍速度提升和70%显存节省。内容涵盖环境配置、模型加载、蒸馏训练全流程,并提供了预训练模型推理测试示例。该方法为资源受限场景下的模型轻量化提供了有效解决方案。

一款让你“看见世界正在发生什么”的开源仪表盘:Situation Monitor 上手体验与安装指南

在这个信息密度越来越高的时代,仅仅“看到信息”已经不够,更重要的是——看见信息之间的联系。Situation Monitor 试图把散落在全球各个角落的新闻、市场、事件,拉到同一个屏幕上,用分析逻辑把它们“串成故事”。如果你对国际局势、市场波动、情报分析、数据可视化、前端工程化中的任意一个方向感兴趣,强烈建议你亲手把这个项目跑起来,点开每一个面板,看看它能帮你发现什么有趣的关联。SvelteKit

#github
炸裂!智谱AI开源GLM-4.6V多模态大模型,能看能想还能执行,本地部署9B轻量版来了!

智谱AI开源多模态大模型GLM-4.6V系列,包含106B参数的云端高性能版和9B参数的轻量本地版。新模型支持128K tokens上下文窗口,原生集成Function Calling能力,可理解图像并执行复杂任务。GLM-4.6V-Flash轻量版特别适合个人开发者和边缘设备部署。用户可通过ModelScope平台免费体验该模型,探索智能客服、AI编程等应用场景。

#人工智能#多模态
国产编程 AI 天花板来了!通义千问 Qwen3.6-Plus 深度测评:百万上下文 + 最强代码能力

阿里巴巴发布新一代旗舰模型Qwen3.6-Plus,具备100万token超长上下文、领先的Agentic Coding能力和原生多模态理解三大亮点。该模型采用专有架构,仅通过API提供服务,在编程基准测试中表现优异,支持自主规划、工具调用等智能代理功能。提供阿里云百炼商业版和OpenRouter免费预览版两种接入方式,兼容主流开发工具协议。Qwen3.6-Plus标志着国产大模型在编程和长上下文

#人工智能
    共 132 条
  • 1
  • 2
  • 3
  • 14
  • 请选择