logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

读Crush源码-AGI时代的LLM操作系统

文章摘要: 本文深入解析了开源AI编程助手Crush的核心设计,揭示了优秀AI工具90%的价值在于其"执行外壳"(harness)而非模型本身。作者通过分析Crush源码,总结了三大harness设计原则:1)严格权限控制与用户可扩展的hook机制;2)智能循环检测避免AI陷入死循环;3)上下文压缩和串行化确保长任务稳定性。文章特别指出,Crush通过将配置设计为可执行脚本、工具自描述文档等细节,

#人工智能
多模型AI网关的容灾与智能路由实践

本文分享了在AI教育产品中构建生产级多模型网关的工程实践。面对模型供应商的不稳定性(限流、超时、脏数据等),作者团队设计了一个智能路由系统,核心包括: 抽象能力(Capability)与提供方(Provider)概念,实现零代码新增供应商 优先级容灾机制:按序尝试可用模型,首个成功即返回 熔断设计:连续失败三次自动禁用,需人工恢复 智能路由:通过难度评估分流,简单题走廉价模型,难题用高级模型 多层

#人工智能
colab使用本地数据集微调llama3-8b模型

在Google的Colab上面采用unsloth,trl等库,训练数据集来自Google的云端硬盘,微调llama3-8b模型,进行推理验证模型的微调效果。保存模型到Google的云端硬盘可以下载到本地供其它使用。

#python
AI应用数据监控框架

本方案构建了一套高并发、分布式AI模型数据处理管道,旨在可靠处理ASR、LLM、TTS等模型的高吞吐量输入输出数据。系统采用生产者-消费者模式与事件驱动架构,通过Kafka实现系统解耦与异步通信。Web API基于FastAPI实现高并发接入,消费者服务采用多实例并行处理,结合连接池与批量插入优化MySQL持久化。方案通过并行处理、消息缓冲、压缩传输等策略保障低延迟与高吞吐,支持水平扩展,并具备完

#kafka#fastapi
用langchain快速搭建旅行智能体

基于 LangChain 构建的智能旅行助手,支持天气查询、航班查询、景点推荐和预算计算。

#人工智能
本地部署阿里最新开源的Z-Image

本文介绍了阿里最新开源的文生图大模型Z-Image的本地部署方法。内容包括环境准备(创建Conda环境、安装diffusers、PyTorch等)、从ModelScope下载模型、编写生成图像代码并测试。示例生成了一张zwplayer播放器海报和一张女孩图像,模型运行需约22GB GPU内存,生成速度快且能较好理解提示词,尽管部分汉字渲染略有瑕疵。整体上,Z-Image是一个高效、可本地部署的文生

文章图片
#开源
向量数据库Milvus字符串查询

主要说明向量数据库字符串查询要注意的问题,就是构建查询表达式要注意加单引号,否则会出现异常。

文章图片
#milvus
AWQ模型量化之llmcompressor

文本采用待量化模型自己生成数据集的方式,使用llmcompressor对智谱公司的GLM-4-9b-chat-hf模型进行AWQ量化。

#AI
模型量化之BitsAndBytes篇

摘要: BitsAndBytes是Hugging Face开发的神经网络高效量化库,支持8-bit和4-bit量化(INT8减少2倍内存,NF4减少4倍内存),适用于大模型部署与训练优化。通过Python示例演示了自动加载、量化(默认4-bit)及保存模型流程,量化后模型体积从18.3G降至6.5G。量化模型可通过vllm部署服务,需确保环境安装bitsandbytes。测试显示模型层成功转换为L

#人工智能
模型量化之BitsAndBytes篇

摘要: BitsAndBytes是Hugging Face开发的神经网络高效量化库,支持8-bit和4-bit量化(INT8减少2倍内存,NF4减少4倍内存),适用于大模型部署与训练优化。通过Python示例演示了自动加载、量化(默认4-bit)及保存模型流程,量化后模型体积从18.3G降至6.5G。量化模型可通过vllm部署服务,需确保环境安装bitsandbytes。测试显示模型层成功转换为L

#人工智能
    共 18 条
  • 1
  • 2
  • 请选择